Nous présentons la HAQQ Legal Agent Study - une évaluation à horizon long, conçue pour mesurer si les agents d'IA peuvent réaliser un vrai travail juridique de bout en bout, et pas seulement répondre à des questions de culture générale. 1 372 tâches. 24 domaines de pratique. ~78 000 critères de grille rédigés par des experts. Une couverture du droit civil et de la région MENA prévue dès la conception.
Points clés
- 1 372 tâches juridiques à horizon long réparties sur 24 domaines de pratique
- ~78 000 critères de grille atomiques et binaires (réussite/échec)
- Notation « tout ou rien » - un seul critère manqué fait échouer la tâche
- 6 familles de pratique de droit civil et MENA incluses dès la v1
- Le meilleur modèle de pointe (Claude Opus 4.7) atteint 41 % en réussite totale ; HAQQ Justinian atteint 58 %
- Sur les tâches de droit civil / MENA, l'écart se creuse à 71 % contre 28 %
Le point d'inflexion des agents juridiques
L'observation d'Andrej Karpathy sur les agents de codage - qu'ils « ne fonctionnaient pratiquement pas avant décembre et fonctionnent pratiquement depuis » - commence à s'appliquer au droit. Le taux de complétion des tâches juridiques à horizon long est resté stable pendant deux ans. Puis, fin 2025, les modèles de raisonnement de pointe, des contextes plus longs, un meilleur usage des outils et une infrastructure d'évaluation adéquate ont convergé. La capacité a basculé.
Faits clés
- La HAQQ Legal Agent Study : 1 372 tâches juridiques à horizon long, 24 domaines de pratique, ~78 000 critères de grille atomiques réussite/échec.
- Le meilleur modèle de pointe (Claude Opus 4.7) atteint 41 % en réussite totale ; HAQQ Justinian atteint 58 %.
- Sur les tâches de droit civil / MENA, l'écart se creuse à 71 % (Justinian) contre 28 % (meilleur modèle de pointe).
Le droit a atteint cette courbe plus tard que le codage, pour une seule raison : il n'existait aucun benchmark pour la mesurer. On ne peut pas suivre une inflexion qu'on ne voit pas. La Study est l'instrument que nous avons construit.
Pourquoi les benchmarks à horizon court ont atteint leurs limites
La plupart des évaluations d'IA juridique - LegalBench, CUAD, LEXam, y compris nos propres travaux antérieurs - testent un raisonnement à horizon court : lire une clause, répondre à une question, classer un paragraphe. Elles sont utiles, mais elles ne disent presque rien sur la capacité réelle d'un agent à mener une mission de bout en bout.
Le vrai travail juridique ne ressemble en rien à un QCM. Un associé transfère un e-mail, joint un dossier et écrit une seule ligne : « Jette un œil et reviens avec une note pour jeudi. » Tout ce qui se passe entre cet e-mail et la note constitue l'intégralité du travail - lire le dossier, repérer les questions qui comptent, écarter celles qui ne comptent pas, rédiger un livrable révisable, et avoir chaque fait juste.
C'est ce que mesure la Study.
Comment une tâche de la Study est structurée
Chaque tâche de la Study reproduit la manière dont le travail circule au sein d'un cabinet d'avocats. L'agent reçoit une instruction rédigée comme le ferait un associé - courte, affirmative, sans cahier des charges de mise en forme. Il reçoit un environnement - un dossier client contenant les documents et fils d'e-mails dont il a besoin (et beaucoup dont il n'a pas besoin). Il doit produire un livrable révisable. Et il est noté selon une grille d'experts.
- Instructions : ~50 mots en moyenne. Demande affirmative, sans liste de contrôle.
- Environnement : dossier de l'affaire mêlant documents déterminants et bruit périphérique. L'agent doit trouver ce qui compte.
- Résultat : une note, une version révisée (redline), un tableau, un projet d'acte de procédure ou un dépôt - selon ce qu'exige réellement la tâche.
- Vérification : critères atomiques, binaires (réussite/échec), rédigés par des experts. Chaque fait, chaque citation, chaque niveau de gravité, chaque délai et chaque montant est vérifié.
Chaque ligne encode, terme à terme, la manière dont un dossier réel circule dans un cabinet : la demande de l'associé devient l'instruction, le dossier client devient l'environnement, le livrable devient le résultat, la révision de l'associé devient la grille d'experts. Rien n'est simplifié pour faciliter la tâche du modèle.
Notation « tout ou rien »
Une tâche n'est marquée comme réussie que si chaque critère de la grille est validé. Nous appelons cela la notation « tout ou rien », et c'est le choix de conception le plus important de toute la Study.
Un rapport d'équipe transactionnelle qui identifie 8 risques sur 10 n'est pas utile à 80 %. Les deux risques manqués peuvent être précisément le déclencheur de changement de contrôle qui fait capoter l'opération, ou la réserve de continuité d'exploitation qui fait rebaisser le prix de l'offre. Il n'y a pas de crédit partiel lors de la révision de l'associé.
Anatomie d'une grille
Les grilles sont l'élément de la Study qui a demandé le plus d'heures d'avocat pour être construit. Pour chaque tâche, nous nous sommes assis avec des praticiens du domaine concerné pour décomposer ce qu'un associé ou un client examinerait réellement dans le livrable. Chaque vérification est atomique et binaire - pas de notation approximative, pas de LLM-juge qui botte en touche sur le style.
Les critères atomiques accomplissent trois choses à la fois : ils rendent la notation reproductible d'une exécution à l'autre, ils rendent les échecs de l'agent débogables (on voit exactement quelle vérification a échoué et pourquoi), et ils font office de signaux de récompense pour le fine-tuning. La même grille qui note un modèle peut entraîner sa version suivante.
24 domaines de pratique - dont le droit civil et la région MENA
Les benchmarks juridiques existants sont dominés par des tâches de common law américaine. C'est cohérent avec ce qu'ils sont, mais ce n'est pas le monde dans lequel exerce la majorité de nos clients. La Study (v1) couvre 24 domaines de pratique, dont six relèvent explicitement du droit civil et de la région MENA : rédaction en droit civil arabe, conformité à la charia, droit des sociétés du CCG, contentieux de la construction, droit de la famille / statut personnel, et droit du travail MENA.
Nous sommes partis de dossiers réels - anonymisés et purgés de toute donnée sensible - traités par des avocats en exercice au sein de notre base de clients. Nous avons décomposé chaque dossier en tâches distinctes qu'un collaborateur se verrait réellement déléguer. Les 24 domaines ne sont pas exhaustifs. Les versions futures ajouteront l'arbitrage de la construction, la réglementation fintech, l'ESG et les flux de travail juridiques internes (in-house).
Exemple : revue d'une clause de changement de contrôle
Une tâche de M&A corporate demande à l'agent d'analyser les clauses de changement de contrôle à travers une data room virtuelle, pour l'acquisition (fictive) de Crestview Software Solutions dans le cadre d'une opération tout en actions de 458 millions de dollars. La data room contient huit contrats déterminants ainsi que des fichiers annexes - 10-K, plan de rémunération différée, procès-verbaux du conseil - qui peuvent être pertinents ou non.
Ci-dessous, la vue complète des données d'entrée telle que l'agent la voit - la demande, le contexte de l'opération, les contrats principaux, les documents plus larges de la data room, et le résultat attendu. Chaque élément fait à la fois office d'indice et de leurre : l'agent doit exploiter les faits de la note, mais il doit aussi séparer la mission centrale des fichiers périphériques - projets de lettres d'offre, biographies de l'équipe - qui ne changent rien à l'analyse.
L'agent doit déterminer quels fichiers comptent, les lire en contexte, et synthétiser les clauses pertinentes à travers l'ensemble du dossier. Le résultat attendu est une note pour l'équipe transactionnelle comprenant un résumé exécutif, une cartographie des risques, une analyse contrat par contrat, des niveaux de gravité et des mesures d'atténuation recommandées.
La grille de cette seule tâche contient 57 critères - couvrant neuf problématiques juridiques implantées, les faits sous-jacents à chacune, le niveau de gravité, l'exposition financière et l'action recommandée. Manquer une seule des neuf fait échouer la tâche.
Essayer HAQQ AI gratuitement
Découvrez la rédaction et la recherche juridique par IA
Ce qui est implanté, et comment c'est noté
Les neuf problématiques implantées dans cette seule tâche ne sont pas de simples pièges de mots-clés superficiels. Elles exigent que l'agent relie des faits entre plusieurs documents, déduise des déclencheurs à partir de définitions, quantifie l'exposition financière en dollars, et recommande la bonne action juridique suivante. Survolez chaque problématique pour voir ce que l'agent doit déterminer et le test unitaire que la grille applique au livrable.
Résultats de référence de la v1
Nous avons fait passer la Study (v1) à six systèmes de premier plan : HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 et Mistral Large 3. Chaque tâche a été tentée trois fois ; nous indiquons le meilleur taux de réussite totale sur trois tentatives. Les chiffres clés se répartissent nettement par catégorie.
Deux constantes se dégagent de l'ensemble des données.
- Les modèles de pointe génériques réussissent bien sur un raisonnement isolé et mal sur le travail à horizon long. Ils perdent le contexte, hallucinent des liens entre documents, et produisent des résultats à l'apparence assurée qui échouent aux vérifications de la grille sur les faits et les citations.
- Les agents entraînés sur le domaine (Justinian et les systèmes spécialisés comparables) réduisent l'écart sur la complétion à horizon long - notamment sur la rédaction en droit civil, où les modèles génériques retombent par défaut sur des structures de common law et échouent sur les spécificités procédurales.
Matrice de capacités - ce que chaque modèle peut réellement mener à terme
Les scores agrégés masquent la question opérationnelle que se pose tout associé de cabinet : quels types de travail puis-je déléguer de bout en bout, lesquels nécessitent un avocat dans la boucle, et auxquels ne dois-je pas toucher ? La matrice ci-dessous répond à cette question sur les 24 familles de tâches.
Pourquoi cela compte pour les cabinets d'avocats
Si vous évaluez un fournisseur d'IA et qu'il vous présente une démonstration assurée sur un seul document, demandez-lui quel est son taux de complétion à horizon long sur un dossier réel. Demandez-lui quel est son taux de réussite totale sur une grille de 50 critères pour ce dossier. Demandez-lui quels domaines de pratique il couvre de bout en bout, par opposition à ceux où il ne fait qu'assister.
Ce sont précisément les questions auxquelles la Study est conçue pour répondre - publiquement, de manière reproductible, et avec des grilles que tout associé peut auditer.
Ce qui est ouvert et ce qui vient ensuite
- Les familles de tâches et le format des grilles de la v1 sont documentés et seront publiés auprès des clients et des partenaires de recherche sous licence d'évaluation.
- Nous publierons une méthodologie de notation normalisée et un classement de référence dès que nous disposerons des résultats de tous les principaux modèles de pointe.
- La v2 ajoutera l'arbitrage MENA, les contentieux de la construction, les flux de travail des juristes d'entreprise, ainsi qu'une rédaction en droit civil arabe et français plus étendue.
- Nous co-développons des extensions avec des cabinets d'avocats sélectionnés - si vous souhaitez contribuer des familles de tâches issues de votre pratique, contactez-nous.
Les travaux antérieurs n'ont jamais été aussi intéressants - LegalBench, BigLaw Bench et le benchmark d'agents juridiques récemment publié par Harvey font tous progresser le domaine. La contribution de HAQQ est l'axe multilingue, droit civil, MENA-first qui faisait défaut.
À essayer
Si vous voulez voir comment Justinian se comporte sur des tâches à horizon long issues de votre pratique, parlez à notre équipe. Nous mènerons un pilote confidentiel, noté selon une grille, sur un dossier anonymisé de votre cabinet.
Remerciements
La Study est le fruit du travail de nombreuses personnes au sein de HAQQ et à travers notre réseau de praticiens. La direction technique du harnais de test, du bac à sable des agents et du moteur d'exécution des grilles a été assurée par l'équipe d'ingénierie HAQQ Justinian, avec la conception des tâches et la génération des dossiers pilotées par notre groupe de recherche juridique appliquée. Nos équipes Sécurité et Plateforme IA ont construit l'environnement d'exécution isolé qui nous permet de faire tourner des agents sur des dossiers synthétiques sans exposer de données clients. Nos équipes Marque et Produit ont façonné la manière dont les résultats sont communiqués aux acheteurs juridiques non techniques.
En dehors de HAQQ, nous remercions les avocats en exercice - dans la région MENA, dans l'UE et au Royaume-Uni - qui ont fourni des dossiers anonymisés, rédigé des grilles dans leurs domaines de pratique, et testé en conditions extrêmes les premières familles de tâches. Nous remercions également les chercheurs académiques qui ont revu notre méthodologie, ainsi que les équipes à l'origine des travaux antérieurs - LegalBench, BigLaw Bench, CUAD, LEXam et le benchmark d'agents juridiques de Harvey - dont les travaux publiés nous ont permis de concevoir ce benchmark plus vite et mieux.



