En bref — 300 tâches juridiques commerciales et transfrontalières exigeantes, 10 modèles de pointe issus de 8 fournisseurs, 3 000 réponses notées sur un barème de 35 points à température 0.
Claude Opus 4.8 l'emporte globalement (30,02/35, en tête sur 130 tâches). Grok 4.3 est le meilleur rapport qualité-prix. GPT-5.5 est le plus précis (8,41/10, 3 % de citations hallucinées).
La conclusion principale : 24 % des 3 000 réponses citaient ou appliquaient une loi qui ne dit pas ce que le modèle prétendait. Aucun modèle de pointe n'est fiable pour livrer une réponse juridique sans vérification.
Pourquoi nous benchmarkons l'IA juridique en toute transparence
Cinq milliards de personnes n'ont pas accès à une aide juridique. C'est le problème que HAQQ existe pour résoudre. Mais sous chaque démo d'IA juridique se cache une question fondamentale : peut-on vraiment faire confiance au résultat devant un client ? « Une IA a répondu à une question juridique » et « une IA sur laquelle vous pouvez apposer votre nom » sont deux affirmations différentes, et l'écart entre elles constitue tout le produit.
Chiffres clés
- 24 % des 3 000 réponses notées de modèles de pointe citaient ou appliquaient une loi qui ne dit pas ce que le modèle prétendait.
- Claude Opus 4.8 a remporté 130 des 300 tâches juridiques (30,02/35 au global) ; GPT-5.5 était le plus précis à 8,41/10 avec un taux de citations hallucinées de 3 %.
- Le coût par tâche juridique varie dans un rapport de 90x selon les modèles de pointe : 0,0009 $ (DeepSeek V3.2) à 0,082 $ (GPT-5.5).
Alors nous le mesurons. C'est le troisième article de notre série de benchmarks : 100 questions juridiques de particuliers couvrait l'angle common law / grand public. HAQQ-LAB était le premier benchmark public de conformité juridictionnelle en droit civil / MENA. Ce rapport est le plus vaste à ce jour — travail juridique commercial et transfrontalier, les dossiers qui font vivre un vrai cabinet.
Si vous ne lisez qu'une section, lisez L'écart de citation. C'est la conclusion qui devrait changer la façon dont chaque cabinet achète de l'IA juridique.
Comment nous avons mené le benchmark
Nous avons rédigé 300 tâches juridiques originales et précises — pas des questions triviales, mais de vrais dossiers avec des parties nommées, des montants, des dates et des textes de loi applicables. Rédiger cette clause. Renégocier cette disposition. Structurer cette transaction. Analyser ce conflit de lois. Elles couvrent 51 domaines de pratique, plus de 20 juridictions (le fédéral américain + Delaware / Californie / New York / Texas, le Royaume-Uni, l'UE, les EAU, le DIFC, l'Arabie saoudite, le Liban, l'Égypte, le Qatar, Singapour, l'Australie, le Canada, l'Inde, le Brésil, le Nigeria, l'OHADA, le Japon, l'Allemagne, la France, la Suisse, plus les Conventions de La Haye et les places offshore — Cayman, BVI, Bermudes).
Difficulté fortement pondérée : 114 tâches de niveau 5 sur 5, 108 de niveau 4, 22 de niveau 3. Ce sont des problèmes multi-juridictions conçus pour mettre les modèles en échec. Chaque tâche a été soumise aux 10 modèles avec un prompt système identique à température 0, plafonné à 6 000 tokens de sortie.
Chaque réponse a été notée sur cinq dimensions :
- Qualité (1-10) — profondeur, exhaustivité, exploitabilité.
- Précision (1-10) — exactitude juridique ; -5 pour une jurisprudence hallucinée, -3 pour une mauvaise juridiction.
- Vitesse (1-5) — latence de réponse mesurée, non jugée.
- Style (1-5) — structure professionnelle.
- Créativité (1-5) — risques non évidents repérés, questions transfrontalières identifiées.
Qualité, Précision, Style et Créativité sont notés par Claude Sonnet 4.6 selon un barème fixe. La vitesse est calculée à partir de la latence réelle. Le biais du juge est traité honnêtement dans les réserves méthodologiques — nous ne le cachons pas.
Le classement : quelle IA est la meilleure pour le travail juridique
Claude Opus 4.8 gagne — nettement
Opus a pris la première place sur 130 des 300 tâches — presque le double de n'importe quel autre modèle — et a terminé dans le top 3 sur 265 des 300 tâches. Il affiche la meilleure qualité (8,9), une précision de premier plan (8,4), un style parfait, et la meilleure créativité. Sa seule faiblesse est la vitesse : à 60,8 s, il est lent, et à 0,069 $/tâche, il est parmi les plus chers. Si vous voulez la meilleure réponse et pouvez attendre, c'est celui-là.
Grok 4.3 : 98 % de la qualité en 1/7e du temps et 1/20e du coût
Le résultat le plus intéressant du tableau. Grok 4.3 arrive deuxième (28,98) mais le fait en 8,8 secondes pour 0,003 $ par tâche — contre 60,8 s et 0,069 $ pour Opus. Pour un produit orienté client où la latence et l'économie unitaire comptent, Grok est sans doute le meilleur choix technique. Il remporte même plus de tâches environnement/ESG, propriété intellectuelle et cas limites que quiconque.
GPT-5.5 : le champion de la précision qui « gagne » rarement
GPT-5.5 affiche la précision la plus élevée du terrain (8,41) et le taux d'hallucination le plus bas (3 %) — pourtant il se classe cinquième au total et n'a remporté qu'une seule tâche en direct. Il a rarement tort et est rarement spectaculaire. Il est aussi le plus lent (134 s) et le plus cher (0,082 $). Pour le travail juridique, « rarement dans l'erreur » est peut-être la dimension qui compte le plus, ce qui explique exactement pourquoi un score composite unique induit en erreur.
o3 : le modèle le plus polarisant du test
Le o3 d'OpenAI a remporté 66 tâches en direct — la troisième meilleure performance de tous les modèles — pourtant il se classe huitième au global, avec un taux d'hallucination de 32 % et la deuxième plus faible précision (5,89). Quand o3 est bon, il est brillant ; quand il a tort, il a tort avec assurance, et cher. Cette variance est en elle-même un risque d'achat.
Le plancher : Mistral et Llama
Mistral Large a halluciné ou mal appliqué des citations dans 64 % de ses réponses (précision 4,74). Llama 4 Maverick termine dernier (20,01) — rapide et bon marché, mais avec une qualité de 4,8 et des réponses très minces. « Citer un vrai texte de loi » n'est pas résolu au bas du marché.
L'écart de citation : la conclusion la plus importante
Sur l'ensemble des 3 000 réponses, 24 % citaient ou appliquaient une loi qui ne dit pas ce que le modèle prétendait. Des affaires inventées. Des textes de loi mal appliqués. La bonne doctrine appliquée à la mauvaise juridiction. Ce ne sont pas de vagues approximations — notre juge a signalé des erreurs précises et vérifiables.
Un échantillon, un par modèle :
- Claude Opus 4.8 : Computer Associates / Gemstar cités comme précédents de gun-jumping ; caractérisations inexactes.
- GPT-5.5 : La citation Hitz semble fabriquée ; 616 B.R. 374 invérifiable.
- Gemini 3.1 Pro : Citation Halpin v. Riverstone invérifiable ; probable affaire du Delaware hallucinée.
- Grok 4.3 : CBS v. Ziff-Davis cité de façon inexacte ; l'affaire concerne la garantie et non la divulgation.
- Claude Sonnet 4.6 : Citation Schrier invérifiable ; l'affaire Biotronik est réelle mais mal appliquée.
- o3 : Les citations MSA Technology v Antec et GB Gas semblent fabriquées ou dénaturées.
- Qwen3.7 Max : Specht v. Netscape mal appliquée ; ce n'est pas une affaire UCC biens/services.
- DeepSeek V3.2 : Citation Crosstown Music invérifiable / mal appliquée.
- Mistral Large : Les citations N.Y. Gen. Oblig. Law §5-328 et UCC §2-515 sont douteuses / mal appliquées.
- Llama 4 Maverick : Affaire Cavendish mal appliquée ; sans rapport avec les clauses de prix.
Chaque modèle, y compris les leaders, a fabriqué ou mal appliqué une citation quelque part dans le test. Ce n'est pas un problème réservé au bas du tableau. Le modèle le plus précis du terrain entier n'a obtenu que 8,41 sur 10. Le plancher est alarmant ; le plafond n'est pas sûr non plus.
Pour situer le contexte, les outils historiques souffrent du même mal. Des tests indépendants situent le taux d'erreur de Westlaw AI-Assisted Research à environ une requête sur trois, et Lexis+ AI au-dessus d'une sur six. Un modèle plus gros n'a pas résolu ce problème, et selon nos données, ne le résoudra pas.
Aucun modèle ne gagne dans tous les domaines de pratique
Décomposez les 300 tâches par domaine de pratique et le leader change constamment. Sur 51 domaines de pratique : Claude Opus 4.8 en remporte 30, Grok 4.3 en remporte 13, o3 en remporte 6, et Gemini 3.1 Pro et Sonnet 4.6 en remportent un chacun. Points saillants :
- Opus domine le cœur doctrinal : fusions-acquisitions (30,6), conformité réglementaire (30,5), valeurs mobilières, droit pénal des affaires, fiscalité, droit bancaire, protection des données, droit du travail, commerce international.
- Grok excelle dans la créativité commerciale : propriété intellectuelle/tech (30,2), environnement/ESG (30,8), protection des consommateurs, conformité/diligence raisonnable (31,4), cas limites.
- o3 se distingue sur les opérations transactionnelles : opérations juridiques (31,1), valeurs mobilières et finance (30,9), marchés publics (31,1), immobilier transfrontalier.
- Gemini 3.1 Pro obtient le meilleur score individuel en protection de la vie privée et des données (31,4).
L'implication est directe : un produit juridique qui mise tout sur un seul modèle laisse de la précision de côté dans des domaines de pratique entiers. La bonne architecture achemine chaque tâche vers le moteur le plus susceptible d'avoir raison — puis vérifie la réponse avant de la livrer.
La taxe latence-coût
La qualité n'est ni gratuite ni uniforme. L'écart est énorme : GPT-5.5 (134 s) et Claude Sonnet 4.6 (102 s) sont environ 17 fois plus lents que Grok 4.3 (8,8 s) et Llama 4 Maverick (7,7 s). Le coût par tâche varie dans un rapport de 90x, de DeepSeek V3.2 à 0,0009 $ à GPT-5.5 à 0,082 $. Grok 4.3 obtient la deuxième place à 0,003 $.
Pour un produit juridique à fort volume, le « meilleur » modèle sur un classement basé uniquement sur la qualité peut être la mauvaise décision commerciale. L'objectif « qualité d'Opus, à la vitesse et au coût de Grok » relève d'un problème d'acheminement et de vérification, pas d'un choix de modèle unique.
Vue par fournisseur (fusionnée avec chaque run précédent)
Classement de l'IA juridique 2026 : tous les modèles classés par score moyen
Le run de 300 tâches ci-dessus note 10 modèles de pointe sur un barème de 35 points. Nous tenons aussi un second classement, plus large : une évaluation de 50 tâches sur un barème de 50 points qui ajoute les plateformes juridiques verticales que la plupart des cabinets présélectionnent réellement (Harvey, CoCounsel, LexisNexis +AI, Legora, Spellbook, Clio Duo) aux côtés des modèles de pointe. Ce tableau est publié intégralement sur notre page de comparaison. Le voici classé par score moyen sur les 11 catégories de tâches, pour lire un seul chiffre par modèle plutôt que onze.
| Rang | Modèle | Moy. /50 | Moy. % |
|---|---|---|---|
| 1 | HAQQ (Justinian) | 47.5 | 95% |
| 2 | Claude Fable 5 | 44.0 | 88% |
| 3 | Claude Opus 4.7 | 42.1 | 84% |
| 4 | Mike OS | 41.8 | 84% |
| 5 | DeepSeek v4 Pro | 38.2 | 76% |
| 5 | Harvey | 38.2 | 76% |
| 7 | CoCounsel | 36.2 | 72% |
| 8 | Claude + plugins juridiques | 35.4 | 71% |
| 9 | Legora | 34.5 | 69% |
| 10 | ChatGPT 5.5 | 34.4 | 69% |
| 11 | LexisNexis +AI | 33.2 | 66% |
| 12 | Grok 4.3 | 31.4 | 63% |
| 13 | Gemini 3.1 Pro | 31.1 | 62% |
| 14 | Spellbook | 29.0 | 58% |
| 15 | Perplexity Sonar | 26.5 | 53% |
| 16 | Clio Duo | 25.2 | 50% |
| 17 | Meta Llama 4 | 23.1 | 46% |
| 18 | Mistral 3 | 21.2 | 42% |
| 19 | Qwen 3 Plus | 17.1 | 34% |
Ce classement dit trois choses que le run de 300 tâches ne peut pas dire. D'abord, les plateformes juridiques verticales se regroupent au milieu, pas en tête : Harvey (38,2), CoCounsel (36,2), Legora (34,5) et LexisNexis +AI (33,2) se situent toutes en dessous des meilleurs modèles de pointe bruts. Ce qu'une entreprise paie à un éditeur d'IA juridique, c'est le workflow et l'enveloppe de sécurité, pas un score plus élevé sur la réponse elle-même. Ensuite, DeepSeek v4 Pro est à égalité exacte avec Harvey à 38,2 — un modèle à poids ouverts qui égale l'entreprise d'IA juridique la plus valorisée au monde sur la qualité brute du résultat. Enfin, l'écart est large : le dernier modèle (Qwen 3 Plus, 34 %) obtient à peine un tiers du score de HAQQ (95 %), donc « quelle IA juridique » est une vraie décision, pas un tirage à pile ou face.
Vérification d'honnêteté : c'est notre classement, et HAQQ y arrive premier. Traitez cela comme vous devriez traiter n'importe quel score publié par un éditeur — vérifiez-le. Chacun des 19 modèles et des 11 catégories est sur notre page de comparaison pour que vous puissiez vérifier, et le barème est décrit ci-dessous. Notez aussi ce qu'un score par tâche ne peut pas voir : le déploiement à l'échelle du cabinet, les certifications de sécurité et les workflows agentiques sur des milliers de documents sont de vraies forces des plateformes verticales que ce tableau ne mesure pas.
Essayer HAQQ AI gratuitement
Découvrez la rédaction et la recherche juridique par IA
Comment nous notons le classement de l'IA juridique
Deux benchmarks alimentent deux classements, et il importe de savoir lequel vous lisez.
- Le run de 300 tâches de pointe (le corps de cet article) : 300 tâches commerciales et transfrontalières originales, 10 modèles de pointe, notés sur un barème de 35 points — Qualité, Précision, Vitesse, Style, Créativité — à température 0, plafonné à 6 000 tokens de sortie. Idéal pour « sur quel modèle brut dois-je construire ».
- Le run de 50 tâches plateforme (le tableau de classement ci-dessus, publié sur /compare-us) : 11 catégories de tâches notées sur un barème de 50 points couvrant la charia, les textes de loi, le for, les clauses, le risque, l'hallucination, la mise en forme, la concision, la préparation associé et le sourçage. Il ajoute les plateformes verticales que les cabinets achètent réellement. Idéal pour « quel produit ou modèle dois-je présélectionner ».
Les deux partagent les mêmes règles de la maison. Des prompts identiques pour chaque modèle. Un barème fixe et écrit plutôt que du ressenti. Des données publiées pour que quiconque puisse rejouer le run et nous vérifier. Et les deux notent la qualité de la réponse isolée — ce qui est le bon périmètre pour un classement, et le mauvais périmètre pour une décision d'achat, car cela ne peut pas voir le déploiement, la posture de sécurité, ou la couche de vérification dont un vrai produit juridique sérieux entoure le modèle.
Nous ne sommes pas les seuls à tenir les comptes, et vous ne devriez pas dépendre d'un seul classement. L'étude préenregistrée du RegLab de Stanford a constaté que les outils de recherche historiques hallucinent souvent — Westlaw AI-Assisted Research à environ une requête sur trois et Lexis+ AI au-dessus d'une sur six. L'évaluateur indépendant Vals AI tient un classement public de l'IA juridique qui, en juin 2026, place aussi Claude Fable 5 en tête de son benchmark de raisonnement juridique (88,6 %), les modèles de pointe y obtenant environ 80 % contre 71 % pour les avocats humains sur la recherche juridique. Barèmes différents, jeux de tâches différents, même direction : les modèles de pointe sont solides en raisonnement et peu fiables sur les citations, et l'écart entre eux se réduit.
Quelle IA est la meilleure pour le droit en 2026 ? Cela dépend de ce que vous pondérez
Il n'existe pas une seule « meilleure IA juridique », et tout classement qui prétend le contraire vend quelque chose. Lisez les deux tableaux ensemble et la réponse se divise selon ce que vous optimisez :
- Meilleure qualité de réponse globale : Claude Opus 4.8 a mené le run de 300 tâches de pointe (30,02/35, 130 tâches remportées). Sur le classement plateforme, Claude Fable 5 est le modèle non-HAQQ le plus solide (44,0/50).
- Le plus précis / le moins d'hallucinations : GPT-5.5 — précision la plus élevée (8,41/10) et taux de citations hallucinées le plus bas (3 %) sur le run de 300 tâches, même s'il « gagne » rarement une tâche en direct.
- Meilleur rapport qualité-prix (vitesse et coût) : Grok 4.3 — deuxième en qualité en 8,8 secondes et environ 0,003 $ par tâche, contre 60,8 secondes et 0,069 $ pour Opus.
- Meilleure plateforme juridique verticale : Harvey mène son groupe de pairs sur le run de 50 points (moyenne de 38,2), devant CoCounsel, Legora et LexisNexis +AI — mais chacune d'entre elles reste derrière les meilleurs modèles de pointe bruts sur la sortie isolée.
- Meilleur pour le travail MENA, arabe et de droit civil : HAQQ (Justinian) arrive premier sur le classement plateforme (47,5/50) avec un arabe natif et plus de 80 juridictions ; vérifiez-le face au terrain sur /compare-us.
L'idée de fond survit à chaque remaniement du classement : aucun modèle unique ne gagne dans tous les domaines de pratique, 24 % des réponses de pointe citent une loi qui ne les soutient pas, et la position dans le classement est la plus petite partie d'un vrai produit juridique. L'acheminement, la vérification des citations et la gouvernance juridictionnelle sont ce qui transforme un chiffre sur un graphique en réponse sur laquelle vous pouvez apposer votre nom.
En regroupant les modèles par marque de fournisseur et en fusionnant ce run avec chaque run précédent du même benchmark commercial (indice de 0 à 100, pondéré par le nombre d'évaluations) :
Le sommet est un peloton, pas un sacre. Le fournisseur que vous choisissez compte moins que ce que vous construisez autour.
Une note sur l'intégrité du benchmark
Notre première passe plafonnait les réponses à 1 200 tokens. Cela a discrètement faussé le résultat : les modèles de raisonnement épuisaient le budget à « réfléchir » et renvoyaient des réponses vides, tandis que les modèles verbeux étaient coupés en milieu de phrase et le juge les pénalisait. Nous l'avons repéré, avons jeté le run, et l'avons relancé uniformément à 6 000 tokens. La plupart des modèles ont gagné 1,5 à 2,5 points — mais Mistral et Llama se sont dégradés avec plus de marge, parce que la longueur supplémentaire exposait davantage de mauvaises citations. Les plafonds de sortie sont un pouce invisible sur la balance dans de nombreux classements publics. Le nôtre est en accès libre pour que vous puissiez voir exactement où il se situait.
Ce que prouvent réellement 3 000 réponses notées
La couche de raisonnement est largement résolue. Les modèles de pointe repèrent les problèmes, structurent l'analyse, et rédigent comme un collaborateur compétent. Ce qu'ils ne savent pas encore faire, c'est être dignes de confiance : citer de façon vérifiable, refuser les questions hors juridiction, formuler les réserves appropriées, et avoir raison de la même façon deux fois de suite.
Cet écart ne se comble pas avec un modèle plus gros. Il se comble avec une couche par-dessus :
- Acheminement — envoyer chaque dossier vers le moteur le plus susceptible d'avoir raison.
- Vérification des citations — aucune référence invérifiable n'atteint le client.
- Gouvernance juridictionnelle — la réponse dans la mauvaise juridiction est écartée en amont, pas filtrée après coup.
Cette couche, c'est le produit. Le modèle n'est pas la barrière à l'entrée. C'est le vérificateur. C'est ce que nous construisons chez HAQQ.
Réserves méthodologiques — parce qu'un benchmark qu'on ne peut pas vérifier est du marketing
- Un seul run, température 0. Traitez les classements comme plus fiables que les décimales ; lisez Opus et Grok comme des co-leaders, pas comme une photo-finish.
- Le juge est un modèle Claude (Sonnet 4.6). Une question légitime de préférence pour soi-même — sauf qu'un modèle non-Claude (Grok) est à égalité en tête et que GPT-5.5 affiche la précision la plus élevée, donc il ne note manifestement pas sur une pente favorable maison. Un re-jugement par un second modèle est la prochaine étape de renforcement.
- L'indice par fournisseur mélange des barèmes entre plusieurs runs et reste directionnel.
- Chaque prompt, chaque réponse brute, et le code de notation sont publiés. Clonez-le et vérifiez-nous.
Points clés à retenir
- Claude Opus 4.8 est le modèle unique le plus solide pour le travail juridique commercial ; GPT-5.5 est le plus précis ; Grok 4.3 est le meilleur rapport qualité-prix.
- 24 % des réponses juridiques de modèles de pointe citent une loi qui ne les soutient pas — le plafond n'est pas sûr, pas seulement le plancher.
- Aucun modèle ne gagne dans tous les domaines de pratique ; l'acheminement bat le pari sur un seul modèle.
- Le coût et la latence varient dans des rapports de 90x et 17x — le « gagnant » basé uniquement sur la qualité peut être le mauvais choix commercial.
- La couche défendable, c'est l'acheminement + la vérification des citations + la gouvernance juridictionnelle, pas le modèle de base.
Troisième volet de la série de benchmarks HAQQ, aux côtés de notre benchmark de questions juridiques de particuliers et de notre benchmark de droit civil HAQQ-LAB. Curieux de savoir comment HAQQ transforme ces conclusions en un produit sur lequel un avocat peut apposer son nom ? Découvrez le moteur Justinian.



