Cinq milliards de personnes n'ont pas accès à l'aide juridique. Avant de demander à qui que ce soit de faire confiance à l'IA pour ses questions juridiques, il fallait prouver que cela fonctionne réellement. Alors nous avons fait le test — 100 questions juridiques réelles, trois modèles frontières, un cadre d'évaluation structuré.
Le protocole
Nous avons collecté les 100 publications les plus consultées de tous les temps sur r/legaladvice — des questions réelles de personnes réelles portant sur des litiges bailleur-locataire, le droit du travail, des affaires de garde d'enfants, la défense pénale, les dommages corporels, et tout ce qui se trouve entre les deux. Longueur moyenne des publications : plus de 2 200 caractères d'une complexité juridique authentique.
Faits clés
- Claude Sonnet 4 a réussi 88/100 questions juridiques réelles, GPT-4o 87/100, Gemini 2.5 Flash 78/100, sous un prompting en chaîne de raisonnement identique.
- La dimension la plus faible pour les trois modèles était les Réserves appropriées (3,0–3,15/5) — pas l'exactitude juridique (3,98–4,30/5).
- Sur 20 questions fraîches de r/legaladvice issues des 48 heures précédentes : Claude 95 %, GPT-4o 90 %, Gemini 85 %.
Chaque question a été soumise à trois modèles frontières avec un prompting en chaîne de raisonnement identique :
- Claude Sonnet 4 (Anthropic)
- GPT-4o (OpenAI)
- Gemini 2.5 Flash (Google)
Chaque modèle a reçu le même prompt système : se comporter comme un avocat américain expérimenté, suivre un raisonnement structuré — identifier la juridiction, repérer les problèmes, citer le droit applicable, analyser, puis conseiller.
Même prompt. Mêmes questions. Trois moteurs différents. Laissons les réponses parler.
L'évaluation
Nous avons utilisé Claude comme évaluateur structuré, notant chaque réponse sur cinq dimensions : Exactitude juridique (les lois citées sont-elles correctes ?), Exhaustivité des problèmes (a-t-elle repéré tous les enjeux juridiques ?), Qualité du raisonnement (la chaîne de raisonnement est-elle logique ?), Valeur pratique (ce conseil aiderait-il quelqu'un à prendre les bonnes prochaines mesures ?), et Réserves appropriées (la réponse comporte-t-elle les avertissements nécessaires et recommande-t-elle de consulter un vrai avocat ?).
Critères de réussite : score moyen ≥ 3,5/5 ET aucune dimension individuelle en dessous de 2/5. Oui, utiliser l'IA pour évaluer l'IA introduit un biais. Nous l'abordons plus bas.
Les résultats
Claude Sonnet 4 a réussi 88 des 100 questions (88 %), GPT-4o en a réussi 87 (87 %), et Gemini 2.5 Flash 78 (78 %). Les trois ont démontré un raisonnement juridique structurellement solide sur des scénarios réels variés.
Décomposition par dimension
Les scores d'exactitude juridique s'étendaient de 3,98 à 4,30 sur 5. L'Exhaustivité des problèmes était la plus élevée pour Gemini (4,82) et Claude (4,58). La Valeur pratique était la dimension la plus forte de Claude, à 4,73. Mais la dimension la plus faible pour tous les modèles — les Réserves appropriées — est celle qui raconte l'histoire la plus importante.
Ce que nous avons appris
1. La capacité brute est là
Chaque modèle a identifié le bon domaine du droit, repéré les enjeux clés, et fourni un conseil exploitable dans la grande majorité des cas. Les scores d'exactitude juridique s'étendaient de 3,98 à 4,30 sur 5 — sur 100 questions réelles et variées. Ce n'est pas une démonstration gadget. C'est un raisonnement juridique de niveau production.
2. Le talon d'Achille, ce sont les réserves, pas l'exactitude
La dimension la plus faible des trois modèles était les Réserves appropriées (3,0–3,15). Les modèles se lançaient dans des analyses juridiques détaillées — souvent correctement — sans indiquer correctement qu'ils ne fournissent pas de conseil juridique, ni recommander à la personne de consulter un avocat local.
C'est exactement pourquoi les modèles d'IA bruts ne suffisent pas. Un conseil techniquement correct délivré avec une confiance inappropriée est dangereux. Il faut une couche par-dessus — garde-fous, avertissements, chemins d'escalade — qui transforme un modèle de langage en outil juridique responsable. C'est ce que nous construisons chez HAQQ.
3. La régularité l'emporte sur le pic de performance
Gemini 2.5 Flash affichait les scores moyens les plus élevés en Exactitude juridique (4,30) et en Exhaustivité des problèmes (4,82), mais le taux de réussite le plus bas (78 %). Certaines réponses étaient tronquées. D'autres omettaient totalement les avertissements.
Pour le travail juridique, on ne peut pas se permettre un modèle brillant 78 % du temps et peu fiable le reste du temps. La régularité est l'exigence produit. C'est pourquoi HAQQ ne s'appuie pas sur un seul modèle — nous routons, validons et vérifions à travers plusieurs moteurs pour garantir que chaque réponse atteint un seuil de qualité avant d'atteindre l'utilisateur.
Essayer HAQQ AI gratuitement
Découvrez la rédaction et la recherche juridique par IA
4. Claude et GPT-4o sont au coude à coude
À 88 % contre 87 %, la différence n'est pas statistiquement significative. Claude prenait l'avantage sur la Valeur pratique (4,73 contre 4,21) — ses conseils incluaient des prochaines étapes plus concrètes. GPT-4o était solide sur l'ensemble, mais légèrement moins structuré. La conclusion : le choix du modèle compte moins que ce que l'on construit autour.
La question de l'auto-évaluation
Nous avons utilisé Claude comme juge pour les trois modèles, y compris lui-même. Limites connues : avantage potentiel du « terrain familier » (Claude pourrait favoriser son propre style de raisonnement), biais style contre substance (l'évaluateur pourrait récompenser des motifs structurels qu'il reconnaît), et absence de vérité terrain (sans validation par des avocats, nous mesurons un consensus de l'IA, pas une exactitude juridique).
Notre prochaine étape est une validation par des avocats. Mais même avec l'auto-évaluation, le signal est clair : les modèles frontières ont franchi un seuil où leur raisonnement juridique est structurellement solide, bien cité, et pratiquement utile dans la majorité des cas.
Validation en direct : 20 questions fraîches
Le benchmark des 100 questions repose sur des publications historiques. Pour prouver que ce n'est pas du simple pattern-matching, nous avons fait tourner le même pipeline sur 20 questions fraîches publiées sur r/legaladvice au cours des 48 heures précédentes. Claude Sonnet 4 a obtenu 95 %, GPT-4o 90 %, et Gemini 2.5 Flash 85 %. Les trois modèles ont même mieux performé sur les questions fraîches.
Nous avons ensuite pris la meilleure réponse pour chaque question parmi les trois modèles, l'avons réécrite en langage naturel, et l'avons publiée en réponse. Le fond était là. La forme était humaine.
Pourquoi cela compte pour HAQQ
Voici ce que ce benchmark prouve réellement : la couche IA est résolue. Les modèles savent raisonner sur le droit. Ils savent repérer les enjeux, citer des textes de loi, et donner des conseils pratiques qui résistent à l'examen 85 à 95 % du temps.
Mais « 85 à 95 % du temps » n'est pas assez pour le travail juridique. L'écart entre un modèle performant et un produit juridique digne de confiance, c'est tout ce que nous faisons chez HAQQ : le routage multi-modèle (nous sélectionnons la meilleure réponse parmi plusieurs modèles pour chaque requête), les garde-fous et réserves (chaque réponse inclut les avertissements appropriés et une escalade vers des avocats humains), le contexte propre à chaque cabinet (des réponses adaptées aux domaines de pratique et aux travaux antérieurs de chaque cabinet), et les sources vérifiées (aucune citation de jurisprudence hallucinée — chaque référence est traçable).
La question n'a jamais été « l'IA peut-elle faire du raisonnement juridique ? » La réponse est oui — 88 fois sur 100 avec le bon prompting. La vraie question est : qui construit le produit qui rend cela sûr, régulier et utile pour les 5 milliards de personnes qui en ont besoin ? C'est HAQQ.
Méthodologie
- Source : les 100 publications les plus consultées de tous les temps sur r/legaladvice + 20 publications fraîches, filtrées pour ne garder que les publications textuelles substantielles
- Modèles : Claude Sonnet 4, GPT-4o, Gemini 2.5 Flash — tous via OpenRouter avec des prompts système identiques
- Prompting : chaîne de raisonnement avec un cadre juridique structuré en 5 étapes
- Évaluation : Claude Sonnet 4 comme juge unique, 5 dimensions sur une échelle de 1 à 5
- Seuil de réussite : moyenne ≥ 3,5 ET minimum ≥ 2 sur toutes les dimensions
- Reproductibilité : tout le code, les questions, les réponses et les évaluations sont disponibles dans le dépôt GitHub



