Skip to content
    HAQQ
    • Tarifs
    Commencer gratuitement
    Commencer gratuitementRéserver une démo
    Se connecter
    1. Accueil
    2. Blog
    3. HAQQ Legal Agent Study : un benchmark d'IA juridique à long horizon
    Retour au BlogIA & Tech Juridique

    HAQQ Legal Agent Study : un benchmark d'IA juridique à long horizon

    1 372 tâches juridiques à long horizon, 24 domaines de pratique, ~78 000 critères de notation, validation tout-ou-rien. Le premier benchmark d'agents juridiques pensé pour le droit civil et le MENA.

    6 mai 2026
    11 min de lecture
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study : un benchmark d'IA juridique à long horizon

    Nous présentons la HAQQ Legal Agent Study - une évaluation à horizon long, conçue pour mesurer si les agents d'IA peuvent réaliser un vrai travail juridique de bout en bout, et pas seulement répondre à des questions de culture générale. 1 372 tâches. 24 domaines de pratique. ~78 000 critères de grille rédigés par des experts. Une couverture du droit civil et de la région MENA prévue dès la conception.

    Points clés

    • 1 372 tâches juridiques à horizon long réparties sur 24 domaines de pratique
    • ~78 000 critères de grille atomiques et binaires (réussite/échec)
    • Notation « tout ou rien » - un seul critère manqué fait échouer la tâche
    • 6 familles de pratique de droit civil et MENA incluses dès la v1
    • Le meilleur modèle de pointe (Claude Opus 4.7) atteint 41 % en réussite totale ; HAQQ Justinian atteint 58 %
    • Sur les tâches de droit civil / MENA, l'écart se creuse à 71 % contre 28 %

    Le point d'inflexion des agents juridiques

    L'observation d'Andrej Karpathy sur les agents de codage - qu'ils « ne fonctionnaient pratiquement pas avant décembre et fonctionnent pratiquement depuis » - commence à s'appliquer au droit. Le taux de complétion des tâches juridiques à horizon long est resté stable pendant deux ans. Puis, fin 2025, les modèles de raisonnement de pointe, des contextes plus longs, un meilleur usage des outils et une infrastructure d'évaluation adéquate ont convergé. La capacité a basculé.

    Faits clés

    • La HAQQ Legal Agent Study : 1 372 tâches juridiques à horizon long, 24 domaines de pratique, ~78 000 critères de grille atomiques réussite/échec.
    • Le meilleur modèle de pointe (Claude Opus 4.7) atteint 41 % en réussite totale ; HAQQ Justinian atteint 58 %.
    • Sur les tâches de droit civil / MENA, l'écart se creuse à 71 % (Justinian) contre 28 % (meilleur modèle de pointe).

    Le droit a atteint cette courbe plus tard que le codage, pour une seule raison : il n'existait aucun benchmark pour la mesurer. On ne peut pas suivre une inflexion qu'on ne voit pas. La Study est l'instrument que nous avons construit.

    Pourquoi les benchmarks à horizon court ont atteint leurs limites

    La plupart des évaluations d'IA juridique - LegalBench, CUAD, LEXam, y compris nos propres travaux antérieurs - testent un raisonnement à horizon court : lire une clause, répondre à une question, classer un paragraphe. Elles sont utiles, mais elles ne disent presque rien sur la capacité réelle d'un agent à mener une mission de bout en bout.

    Le vrai travail juridique ne ressemble en rien à un QCM. Un associé transfère un e-mail, joint un dossier et écrit une seule ligne : « Jette un œil et reviens avec une note pour jeudi. » Tout ce qui se passe entre cet e-mail et la note constitue l'intégralité du travail - lire le dossier, repérer les questions qui comptent, écarter celles qui ne comptent pas, rédiger un livrable révisable, et avoir chaque fait juste.

    C'est ce que mesure la Study.

    Comment une tâche de la Study est structurée

    Chaque tâche de la Study reproduit la manière dont le travail circule au sein d'un cabinet d'avocats. L'agent reçoit une instruction rédigée comme le ferait un associé - courte, affirmative, sans cahier des charges de mise en forme. Il reçoit un environnement - un dossier client contenant les documents et fils d'e-mails dont il a besoin (et beaucoup dont il n'a pas besoin). Il doit produire un livrable révisable. Et il est noté selon une grille d'experts.

    • Instructions : ~50 mots en moyenne. Demande affirmative, sans liste de contrôle.
    • Environnement : dossier de l'affaire mêlant documents déterminants et bruit périphérique. L'agent doit trouver ce qui compte.
    • Résultat : une note, une version révisée (redline), un tableau, un projet d'acte de procédure ou un dépôt - selon ce qu'exige réellement la tâche.
    • Vérification : critères atomiques, binaires (réussite/échec), rédigés par des experts. Chaque fait, chaque citation, chaque niveau de gravité, chaque délai et chaque montant est vérifié.

    Chaque ligne encode, terme à terme, la manière dont un dossier réel circule dans un cabinet : la demande de l'associé devient l'instruction, le dossier client devient l'environnement, le livrable devient le résultat, la révision de l'associé devient la grille d'experts. Rien n'est simplifié pour faciliter la tâche du modèle.

    Notation « tout ou rien »

    Une tâche n'est marquée comme réussie que si chaque critère de la grille est validé. Nous appelons cela la notation « tout ou rien », et c'est le choix de conception le plus important de toute la Study.

    Un rapport d'équipe transactionnelle qui identifie 8 risques sur 10 n'est pas utile à 80 %. Les deux risques manqués peuvent être précisément le déclencheur de changement de contrôle qui fait capoter l'opération, ou la réserve de continuité d'exploitation qui fait rebaisser le prix de l'offre. Il n'y a pas de crédit partiel lors de la révision de l'associé.

    Anatomie d'une grille

    Les grilles sont l'élément de la Study qui a demandé le plus d'heures d'avocat pour être construit. Pour chaque tâche, nous nous sommes assis avec des praticiens du domaine concerné pour décomposer ce qu'un associé ou un client examinerait réellement dans le livrable. Chaque vérification est atomique et binaire - pas de notation approximative, pas de LLM-juge qui botte en touche sur le style.

    Les critères atomiques accomplissent trois choses à la fois : ils rendent la notation reproductible d'une exécution à l'autre, ils rendent les échecs de l'agent débogables (on voit exactement quelle vérification a échoué et pourquoi), et ils font office de signaux de récompense pour le fine-tuning. La même grille qui note un modèle peut entraîner sa version suivante.

    24 domaines de pratique - dont le droit civil et la région MENA

    Les benchmarks juridiques existants sont dominés par des tâches de common law américaine. C'est cohérent avec ce qu'ils sont, mais ce n'est pas le monde dans lequel exerce la majorité de nos clients. La Study (v1) couvre 24 domaines de pratique, dont six relèvent explicitement du droit civil et de la région MENA : rédaction en droit civil arabe, conformité à la charia, droit des sociétés du CCG, contentieux de la construction, droit de la famille / statut personnel, et droit du travail MENA.

    Nous sommes partis de dossiers réels - anonymisés et purgés de toute donnée sensible - traités par des avocats en exercice au sein de notre base de clients. Nous avons décomposé chaque dossier en tâches distinctes qu'un collaborateur se verrait réellement déléguer. Les 24 domaines ne sont pas exhaustifs. Les versions futures ajouteront l'arbitrage de la construction, la réglementation fintech, l'ESG et les flux de travail juridiques internes (in-house).

    Exemple : revue d'une clause de changement de contrôle

    Une tâche de M&A corporate demande à l'agent d'analyser les clauses de changement de contrôle à travers une data room virtuelle, pour l'acquisition (fictive) de Crestview Software Solutions dans le cadre d'une opération tout en actions de 458 millions de dollars. La data room contient huit contrats déterminants ainsi que des fichiers annexes - 10-K, plan de rémunération différée, procès-verbaux du conseil - qui peuvent être pertinents ou non.

    Ci-dessous, la vue complète des données d'entrée telle que l'agent la voit - la demande, le contexte de l'opération, les contrats principaux, les documents plus larges de la data room, et le résultat attendu. Chaque élément fait à la fois office d'indice et de leurre : l'agent doit exploiter les faits de la note, mais il doit aussi séparer la mission centrale des fichiers périphériques - projets de lettres d'offre, biographies de l'équipe - qui ne changent rien à l'analyse.

    L'agent doit déterminer quels fichiers comptent, les lire en contexte, et synthétiser les clauses pertinentes à travers l'ensemble du dossier. Le résultat attendu est une note pour l'équipe transactionnelle comprenant un résumé exécutif, une cartographie des risques, une analyse contrat par contrat, des niveaux de gravité et des mesures d'atténuation recommandées.

    La grille de cette seule tâche contient 57 critères - couvrant neuf problématiques juridiques implantées, les faits sous-jacents à chacune, le niveau de gravité, l'exposition financière et l'action recommandée. Manquer une seule des neuf fait échouer la tâche.

    Essayer HAQQ AI gratuitement

    Découvrez la rédaction et la recherche juridique par IA

    Ce qui est implanté, et comment c'est noté

    Les neuf problématiques implantées dans cette seule tâche ne sont pas de simples pièges de mots-clés superficiels. Elles exigent que l'agent relie des faits entre plusieurs documents, déduise des déclencheurs à partir de définitions, quantifie l'exposition financière en dollars, et recommande la bonne action juridique suivante. Survolez chaque problématique pour voir ce que l'agent doit déterminer et le test unitaire que la grille applique au livrable.

    Résultats de référence de la v1

    Nous avons fait passer la Study (v1) à six systèmes de premier plan : HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 et Mistral Large 3. Chaque tâche a été tentée trois fois ; nous indiquons le meilleur taux de réussite totale sur trois tentatives. Les chiffres clés se répartissent nettement par catégorie.

    Deux constantes se dégagent de l'ensemble des données.

    • Les modèles de pointe génériques réussissent bien sur un raisonnement isolé et mal sur le travail à horizon long. Ils perdent le contexte, hallucinent des liens entre documents, et produisent des résultats à l'apparence assurée qui échouent aux vérifications de la grille sur les faits et les citations.
    • Les agents entraînés sur le domaine (Justinian et les systèmes spécialisés comparables) réduisent l'écart sur la complétion à horizon long - notamment sur la rédaction en droit civil, où les modèles génériques retombent par défaut sur des structures de common law et échouent sur les spécificités procédurales.

    Matrice de capacités - ce que chaque modèle peut réellement mener à terme

    Les scores agrégés masquent la question opérationnelle que se pose tout associé de cabinet : quels types de travail puis-je déléguer de bout en bout, lesquels nécessitent un avocat dans la boucle, et auxquels ne dois-je pas toucher ? La matrice ci-dessous répond à cette question sur les 24 familles de tâches.

    Pourquoi cela compte pour les cabinets d'avocats

    Si vous évaluez un fournisseur d'IA et qu'il vous présente une démonstration assurée sur un seul document, demandez-lui quel est son taux de complétion à horizon long sur un dossier réel. Demandez-lui quel est son taux de réussite totale sur une grille de 50 critères pour ce dossier. Demandez-lui quels domaines de pratique il couvre de bout en bout, par opposition à ceux où il ne fait qu'assister.

    Ce sont précisément les questions auxquelles la Study est conçue pour répondre - publiquement, de manière reproductible, et avec des grilles que tout associé peut auditer.

    Ce qui est ouvert et ce qui vient ensuite

    • Les familles de tâches et le format des grilles de la v1 sont documentés et seront publiés auprès des clients et des partenaires de recherche sous licence d'évaluation.
    • Nous publierons une méthodologie de notation normalisée et un classement de référence dès que nous disposerons des résultats de tous les principaux modèles de pointe.
    • La v2 ajoutera l'arbitrage MENA, les contentieux de la construction, les flux de travail des juristes d'entreprise, ainsi qu'une rédaction en droit civil arabe et français plus étendue.
    • Nous co-développons des extensions avec des cabinets d'avocats sélectionnés - si vous souhaitez contribuer des familles de tâches issues de votre pratique, contactez-nous.

    Les travaux antérieurs n'ont jamais été aussi intéressants - LegalBench, BigLaw Bench et le benchmark d'agents juridiques récemment publié par Harvey font tous progresser le domaine. La contribution de HAQQ est l'axe multilingue, droit civil, MENA-first qui faisait défaut.

    À essayer

    Si vous voulez voir comment Justinian se comporte sur des tâches à horizon long issues de votre pratique, parlez à notre équipe. Nous mènerons un pilote confidentiel, noté selon une grille, sur un dossier anonymisé de votre cabinet.

    • Parler à notre équipe
    • Voir les benchmarks de Justinian
    • Comparer HAQQ

    Remerciements

    La Study est le fruit du travail de nombreuses personnes au sein de HAQQ et à travers notre réseau de praticiens. La direction technique du harnais de test, du bac à sable des agents et du moteur d'exécution des grilles a été assurée par l'équipe d'ingénierie HAQQ Justinian, avec la conception des tâches et la génération des dossiers pilotées par notre groupe de recherche juridique appliquée. Nos équipes Sécurité et Plateforme IA ont construit l'environnement d'exécution isolé qui nous permet de faire tourner des agents sur des dossiers synthétiques sans exposer de données clients. Nos équipes Marque et Produit ont façonné la manière dont les résultats sont communiqués aux acheteurs juridiques non techniques.

    En dehors de HAQQ, nous remercions les avocats en exercice - dans la région MENA, dans l'UE et au Royaume-Uni - qui ont fourni des dossiers anonymisés, rédigé des grilles dans leurs domaines de pratique, et testé en conditions extrêmes les premières familles de tâches. Nous remercions également les chercheurs académiques qui ont revu notre méthodologie, ainsi que les équipes à l'origine des travaux antérieurs - LegalBench, BigLaw Bench, CUAD, LEXam et le benchmark d'agents juridiques de Harvey - dont les travaux publiés nous ont permis de concevoir ce benchmark plus vite et mieux.

    À lire aussi

    • HAQQ-LAB, notre benchmark de droit civil en open source
    • notre benchmark de 3 000 réponses sur 10 modèles de pointe
    • le paysage de l'IA juridique open source, y compris les benchmarks ouverts
    S

    Stephane Boghossian

    Head of Growth

    Ressources associées

    JustinianLegal AI ChatCompare HAQQSecurity

    Articles associés

    Le benchmark de l'IA juridique en droit civil : pourquoi nous avons construit HAQQ-LAB

    Le benchmark de l'IA juridique en droit civil : pourquoi nous avons construit HAQQ-LAB

    Pourquoi ChatGPT déçoit les avocats : retours de 3 avocats américains

    Pourquoi ChatGPT déçoit les avocats : retours de 3 avocats américains

    IA juridique arabe : le fossé est dans le retrieval, pas le contenu

    IA juridique arabe : le fossé est dans le retrieval, pas le contenu

    Questions fréquentes

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    Et ensuite ?

    Essayer HAQQ AI gratuitement

    Découvrez la rédaction et la recherche juridique par IA

    Calculer votre ROI

    Voyez combien HAQQ économise pour votre cabinet

    Parcourir Prompts juridiques

    Prompts prêts à l'emploi pour chaque tâche juridique

    Retour au Blog

    Article précédent

    L'IA peut-elle planifier un contentieux ? Nous avons construit un planificateur GOAP

    Article suivant

    Générateur de testament par IA : rédiger un testament adapté à la juridiction avec HAQQ

    Mettez-le en pratique

    Posez à HAQQ la question que cet article a soulevée pour vous.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Votre Jumeau Juridique IA et Système de Gestion de Cabinet pour la rédaction, la facturation et le succès.

    Download on theApp StoreGet it onGoogle Play

    Documentations

    • Docs s'ouvre dans un nouvel onglet
    • Premiers pas s'ouvre dans un nouvel onglet
    • Presse s'ouvre dans un nouvel onglet
    • Nouveautés produit s'ouvre dans un nouvel onglet
    • Statut s'ouvre dans un nouvel onglet
    • Sécurité
    • FAQ s'ouvre dans un nouvel onglet
    • Communauté s'ouvre dans un nouvel onglet
    • Assistance s'ouvre dans un nouvel onglet

    Academy

    • Cours s'ouvre dans un nouvel onglet
    • Compétences s'ouvre dans un nouvel onglet
    • Clauses s'ouvre dans un nouvel onglet
    • Bibliothèque de prompts s'ouvre dans un nouvel onglet
    • Outils s'ouvre dans un nouvel onglet
    • Pôle recherche s'ouvre dans un nouvel onglet
    • Documents s'ouvre dans un nouvel onglet

    Site web

    • eFirm
    • Chat IA Juridique
    • Application Mobile
    • Moteur Justinien
    • HAQQ eBar
    • HAQQ eWallet
    • Tarifs
    • Comparez-nous
    • Solutions
    • Blog
    • Rencontrer l'équipe
    • Rejoignez-nous s'ouvre dans un nouvel onglet
    Ouvrir l'app
    • Languesar en fr es it de pt
    • Contactinfo@haqq.ai
    • Statutopérationnel·ancré
    • Conditions d'Utilisation
    • Politique de Confidentialité
    • Politique de Cookies
    • Traitement des Données s'ouvre dans un nouvel onglet
    • humans.txt s'ouvre dans un nouvel ongletlawyers.txt s'ouvre dans un nouvel ongletsecurity.txt s'ouvre dans un nouvel onglet
    © 2026 HAQQ Inc. Tous droits réservés.Produit conçu en interne par HAQQ. Site web construit avec des outils web modernes.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion