- Home
- Legal AI Index
- Cross-Model Legal Benchmark
Cross-Model Legal Benchmark
HAQQ's own measured benchmark scoring legal AI models out of 50 across legal task categories.
KI-Modellleistung bei Rechtsaufgaben
HAQQ's eigener unabhängiger modellübergreifender Legal Benchmark: 19 Modelle wurden von 50 Punkten über 11 reale Rechtsaufgaben hinweg bewertet - vom Vertragsentwurf und der Rechtsrecherche bis hin zu NDAs und Aktionärsvereinbarungen. Dies ist HAQQ's gemessener Benchmark (vollständig veröffentlicht auf unseren Vergleichsseiten), kein Ranking Dritter; Spezialisten dominieren in ihrem Fachgebiet und kein Modell gewinnt jede Aufgabe.
| Modell | Durchschnitt / 50 | Allgemein | Vertragserstellung | Juristische Recherche | Rechtserläuterung | Arbeitsvertrag | Memo-Erstellung | Lizenzvertrag | Gesellschaftervereinbarung | Beratungsvertrag | Handelsvertrag | NDA-Erstellung |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| HAQQ (Justinian) | 45.8 | 49 | 44 | 43 | 42 | 48 | 44 | 46 | 47 | 45 | 47 | 49 |
| Claude Fable 5 | 42.7 | 45 | 45 | 41 | 43 | 43 | 41 | 42 | 42 | 42 | 41 | 45 |
| Claude Opus 4.7 | 40.8 | 43 | 43 | 39 | 39 | 39 | 41 | 43 | 40 | 39 | 42 | 41 |
| Mike OS | 39.1 | 42 | 39 | 35 | 33 | 41 | 39 | 38 | 41 | 40 | 40 | 42 |
| Harvey | 37.9 | 38 | 40 | 32 | 27 | 42 | 34 | 39 | 44 | 38 | 43 | 40 |
| DeepSeek v4 Pro | 36.8 | 40 | 36 | 38 | 38 | 35 | 37 | 36 | 36 | 36 | 37 | 36 |
| CoCounsel | 36.6 | 37 | 38 | 40 | 31 | 37 | 42 | 35 | 37 | 34 | 35 | 37 |
| Legora | 35.9 | 33 | 42 | 27 | 26 | 40 | 30 | 40 | 39 | 41 | 38 | 39 |
| ChatGPT 5.5 | 35.3 | 39 | 34 | 34 | 45 | 33 | 35 | 32 | 32 | 35 | 34 | 35 |
| Claude + legal plugins | 33.9 | 35 | 35 | 33 | 35 | 34 | 33 | 34 | 34 | 33 | 33 | 34 |
| Gemini 3.1 Pro | 32.9 | 36 | 32 | 36 | 41 | 30 | 32 | 31 | 30 | 30 | 31 | 33 |
| Spellbook | 32.9 | 27 | 46 | 18 | 20 | 38 | 20 | 41 | 35 | 37 | 36 | 44 |
| LexisNexis +AI | 32 | 36 | 29 | 46 | 28 | 30 | 38 | 28 | 31 | 27 | 29 | 30 |
| Grok 4.3 | 30.7 | 33 | 31 | 26 | 36 | 28 | 29 | 29 | 28 | 31 | 35 | 32 |
| Perplexity Sonar | 27.2 | 29 | 22 | 43 | 34 | 24 | 28 | 23 | 23 | 25 | 24 | 24 |
| Clio Duo | 25.6 | 26 | 27 | 24 | 23 | 28 | 23 | 25 | 24 | 29 | 26 | 27 |
| Meta Llama 4 | 23.8 | 24 | 23 | 23 | 29 | 23 | 24 | 22 | 22 | 24 | 23 | 25 |
| Mistral 3 | 22.4 | 22 | 25 | 20 | 25 | 21 | 22 | 24 | 20 | 22 | 22 | 23 |
| Qwen 3 Plus | 18.7 | 19 | 18 | 21 | 22 | 17 | 18 | 18 | 17 | 19 | 18 | 19 |
Gemessene Daten - vorverarbeitet aus HAQQs tatsächlichem Legal AI Index Nutzungsdatensatz (über 134.000 Datenpunkte in 30 Ländern) oder HAQQs eigenem /50 Cross-Modell Legal Benchmark.
Verwandte Forschung
Multi-Model Strategy in Legal
How many AI models firms run, and the criteria they weigh when choosing.
Risk & Hallucination Rates
Estimated error rates across legal tasks, highest for citation and jurisdiction work.
Competitive Landscape Map
Legal AI vendor categories, vendor counts and growth rates across the market.
Modellübergreifender Benchmark
HAQQs gemessener Benchmark, der Legal AI Modelle von 50 Punkten bewertet.
Legal AI Index
Der vollständige Datenbericht darüber, wie KI im gesamten juristischen Ökosystem eingesetzt wird.
Studie zu Rechts-Agenten
Umfassende Rubrik-Bewertung von KI-Agenten für langfristige juristische Aufgaben.
Forschungs-Hub
Durchsuchen Sie jeden Legal AI Forschungs-Graphen an einem Ort.