TL;DR — Die beiden größten Legal-AI-Unternehmen sind inzwischen zusammen rund 16,6 Mrd. USD wert (Harvey 11 Mrd. USD, Legora 5,6 Mrd. USD), und fast jeder Benchmark, der sie bewertet, ist Common-Law- und US-geprägt. Common Law deckt rund 80 Länder und ein Drittel der Menschheit ab; Civil Law deckt rund 150 Länder und über 60% der Weltbevölkerung ab — mit null öffentlichen Legal-Agent-Benchmarks, bis jetzt. Wir haben HAQQ-LAB als Open Source veröffentlicht: 16 Aufgaben aus den VAE, DIFC, Saudi-Arabien, Libanon, Ägypten und Katar, plus 4 Fallen außerhalb der Zuständigkeit. Gemessen wird die Zuständigkeitstreue — verweigert der Agent ein Recht, das nicht anwendbar ist? Ungesteuerte Basislinie: 0%. Gesteuerter Agent: 100%.
Die Karte, die alle benutzen, deckt 60% des Territoriums nicht ab
2026 ist das Jahr, in dem Legal AI zu einem echten Markt wurde. Harvey sammelte im März 200 Mio. USD bei einer Bewertung von 11 Mrd. USD ein (nach 8 Mrd. USD im Dezember). Legora schloss eine Series-D-Runde über 550 Mio. USD bei 5,6 Mrd. USD ab, nachdem das Unternehmen die 100-Mio.-USD-ARR-Marke überschritten hatte. Lexroom sammelte weitere 50 Mio. USD für „Europas eine Million Anwälte“ ein. Zwei Unternehmen, rund 16,6 Mrd. USD.
Wichtige Fakten
- Civil Law deckt rund 150 Länder und über 60% der Weltbevölkerung ab; Common Law rund 80 Länder und etwa ein Drittel — dennoch ist fast jeder Legal-AI-Benchmark Common-Law-geprägt.
- HAQQ-LAB v0: ungesteuerte Basislinie mit 0% Zuständigkeitstreue und 0% Quellenverankerung gegenüber einem gesteuerten Agenten mit 100%/100% über 16 MENA-Aufgaben + 4 Fallen.
- Westlaw AI-Assisted Research halluzinierte bei ~33% der Anfragen und Lexis+ AI bei >17% (EXTERNE QUELLE: Stanford-RegLab/HAI-Studie, verlinkt in den Quellen dieses Beitrags).
Und zu ihrer Ehre muss man sagen: Sie konkurrieren inzwischen um Sorgfalt, nicht nur um Demos. Im Mai 2026 hat Harvey LAB als Open Source veröffentlicht — eine ernsthafte Arbeit: über 1.200 Aufgaben aus 24 Praxisbereichen, bewertet anhand von über 75.000 von Experten verfassten Bewertungskriterien, mit Beiträgen von Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain und Stanfords LIFTLab. Wir meinen es ernst, wenn wir sagen, dass das ein Beitrag zum Feld ist.
Hier liegt der Haken. Rufen Sie die Legal-AI-Benchmark-Karte auf und sehen Sie, was tatsächlich darauf verzeichnet ist:
| Benchmark | Aufgaben | Umfang | Rechtssystem |
|---|---|---|---|
| LegalBench (Stanford) | 162 Aufgaben, 6 Denkkategorien | US-Rechtsanwendung | Common Law |
| Harvey LAB | 1.200+ Aufgaben, 24 Praxisbereiche | BigLaw / Unternehmensjuristen-Agentenarbeit | Common Law |
| LegalAgentBench | 300 Aufgaben, 17 Korpora, 37 Tools | Chinesischer Rechtsbereich | Chinesisches Zivilrecht |
| HAQQ-LAB | 16 Aufgaben (v0), 6 Rechtsordnungen | VAE · DIFC · KSA · LB · EG · QA | MENA-Zivilrecht |
Die unabhängigen Beobachter geben die Lücke in ihren eigenen Fußnoten zu: Die Ergebnisse lassen sich möglicherweise nicht auf Zivilrechtssysteme übertragen. Rund 150 Länder folgen dem Zivilrecht, und mehr als 60% der Menschheit lebt unter diesem System; Common Law deckt etwa 80 Länder und rund ein Drittel der Weltbevölkerung ab. Die Benchmark-Karte ist das fotografische Negativ der tatsächlichen Welt — fast die gesamte Messung dient dem Common-Law-Drittel, und die zivilrechtliche Mehrheit, einschließlich der gesamten MENA-Region, bleibt unbewertet.
Das Zuverlässigkeitsproblem, das niemand in Ihrer Rechtsordnung misst
Warum ist eine unvermessene Rechtsordnung wichtig? Weil wir bereits wissen, was mit Legal AI passiert, wenn niemand mitzählt — selbst in den bestausgestatteten Systemen der Welt. In der vorregistrierten, peer-begutachteten Studie des Stanford RegLab halluzinierten die eigens entwickelten, RAG-gestützten kommerziellen Tools trotzdem:
Westlaw AI-Assisted Research: ~33% der Anfragen. Lexis+ AI: >17%. „Eins von sechs oder mehr.“
Lesen Sie das noch einmal. Das sind keine Verbraucher-Chatbots. Es sind retrieval-gestützte Systeme, gebaut von Thomson Reuters und LexisNexis, trainiert auf den tiefsten Common-Law-Korpora, die existieren, und sie lagen bei zwischen jeder sechsten und jeder dritten Antwort falsch. Die Folgekosten sind inzwischen eine erfasste Statistik: Eine öffentliche Datenbank hat 1.458 Gerichtsfälle mit KI-erfundenen Zitaten dokumentiert, mit mehreren neuen Fällen pro Tag.
Übertragen Sie dieselbe Technologie nun auf eine Zivilrechtsordnung mit einem Bruchteil des digitalisierten Primärrechts und einer bekannten Lücke bei der arabischen Informationsbeschaffung. Die ehrliche Erwartung ist, dass die Zuverlässigkeit schlechter wird — und die ehrliche Realität ist, dass niemand eine Zahl dafür hat, weil es keinen Benchmark gibt, der eine liefern könnte. Genau diese Lücke soll HAQQ-LAB füllen.
Warum Zivilrecht ein Common-Law-Modell zum Scheitern bringt
Ein kurzer Überblick, denn dieser Blog wird sowohl von Ingenieuren als auch von Juristen gelesen. Common Law (USA, Großbritannien) ist präzedenzgetrieben: Der Fall ist die Primärquelle, und die Argumentation ist analog — was hat das Gericht im ähnlichsten Fall entschieden? Zivilrecht (der Großteil der MENA-Region, Frankreich, Lateinamerika, Ostasien) ist kodexgetrieben: Das Gesetz ist die Primärquelle, und die Argumentation ist deduktiv — was besagt der Artikel des Gesetzbuchs? Es sind unterschiedliche Betriebssysteme für die Frage „was ist Recht“.
Ein Modell, das auf dem ersten trainiert und benchmarkt wurde, wird im zweiten selbstbewusst das Falsche tun. Drei konkrete Fehler, die wir als Fallen in HAQQ-LAB eingebaut haben:
- Vorzugsaktien in einer libanesischen SARL. Ein US-SAFE wandelt sich nach Delawares DGCL §151 in Vorzugsaktien um. Eine libanesische SARL (GmbH-Äquivalent) verfügt über keine entsprechende Aktienklassen-Mechanik. Ein Common-Law-geprägter Agent wird bereitwillig „das SAFE in Vorzugsaktien umwandeln“ — nach einem Recht, das kein solches Instrument kennt.
- Die Consideration-Doktrin in Saudi-Arabien. Common Law setzt ein Versprechen ohne Gegenleistung (Consideration) nicht durch. Das saudische (scharia-basierte) Vertragsrecht kennt diese Doktrin überhaupt nicht. Ein Agent, der „auf Consideration prüft“, wendet eine fremde Anforderung an.
- Anstellung nach Belieben (At-will) im Golf. Es gibt kein At-will-Beschäftigungsverhältnis in den VAE/DIFC/KSA/Katar — es gibt gesetzliche Kündigungsfristen und Abfindungsansprüche zum Dienstende. Eine in Kalifornien geprägte Antwort ist nicht nur unbrauchbar; sie grenzt an Berufshaftung.
Das sind keine Randfälle. Es sind die typischen Fragen, die ein Anwalt aus der MENA-Region stellen würde — und genau die Stelle, an der ein an der Spitze der Bestenliste stehendes Modell still versagt.
Was HAQQ-LAB misst
HAQQ-LAB v0 ist bewusst klein und bewusst ehrlich: 16 Aufgaben — zwölf reale Fälle, je zwei aus sechs Rechtsordnungen, plus vier Fallen.
| Rechtsordnung | Aufgaben | Zitierte Primärinstrumente |
|---|---|---|
| VAE | SAFE/Finanzierung, Handelsvertretung | Bundesgesetzesdekret Nr. 32 von 2021; Zivilgesetz über Transaktionen (Bundesgesetz Nr. 5 von 1985) |
| DIFC | Abfindung bei Beschäftigungsende, Datenübermittlung | DIFC-Beschäftigungsgesetz Nr. 2 von 2019; DIFC-Datenschutzgesetz Nr. 5 von 2020 |
| Saudi-Arabien | Dienstende-Abfindung, Umwandlung LLC→JSC | Saudisches Arbeitsgesetz (Königlicher Erlass M/51); Gesellschaftsgesetz (M/132 von 1443H) |
| Libanon | Vertragsstrafeklausel, SARL-Gründung | Gesetz über Verpflichtungen und Verträge (1932); Handelsgesetzbuch (1942) |
| Ägypten | Rücktritt, rechtmäßige Kündigung | Zivilgesetzbuch (Gesetz Nr. 131 von 1948); Arbeitsgesetz Nr. 12 von 2003 |
| Katar | Ausländischer Anteilsbesitz, Kündigungsfrist/Dienstende | Handelsgesellschaftsgesetz Nr. 11 von 2015; Arbeitsgesetz Nr. 14 von 2004 |
| FALLE ×4 | Delaware auf SARL, kalifornisches Wettbewerbsverbot, englische Consideration auf KSA, DSGVO als VAE-Recht | (korrekte Antwort: Ablehnung) |
Jede Aufgabe trägt ein Bewertungsraster mit prüfbaren Behauptungen: must_cite (das kanonische Primärinstrument, das eine korrekte Antwort nennen muss), must_mention (die Konzepte, die eine fundierte Antwort abdecken muss) und must_refuse (gilt für Fallen — der richtige Zug ist eine Ablehnung). Daraus bewertet das Prüfsystem vier Dimensionen: Zuständigkeitstreue, Antwortquote innerhalb des Geltungsbereichs, Quellenverankerung und inhaltliche Substanz.
HAQQ AI kostenlos testen
Erleben Sie KI-gestützte juristische Recherche und Entwurf
Die Methodenentscheidung: kein LLM-Richter
Die meisten modernen Evaluierungen nutzen ein starkes Modell, um die Ausgaben zu bewerten. Wir tun das nicht, und das war die Entscheidung, über die wir am längsten diskutiert haben. Ein LLM-Richter driftet von Lauf zu Lauf, lässt sich gezielt auf seinen Geschmack hin manipulieren und kann von einem Skeptiker nicht auf dem eigenen Laptop reproduziert werden. Die Bewertungsraster von HAQQ-LAB sind deterministische String-Prüfungen. Führen Sie den Test zweimal aus, erhalten Sie identische Zahlen. Führen Sie ihn auf Ihrer eigenen Maschine aus, erhalten Sie unsere Zahlen. Der Kompromiss ist real: Deterministische Raster können Quellenverankerung und Ablehnung perfekt prüfen, können inhaltliche Substanz aber nur annähern. Deshalb braucht die Substanz-Spalte einen Reasoning-Adapter — und deshalb schönen wir die Zahl, die wir ohne einen solchen erhalten, nicht auf.
Das Ergebnis
Wir haben zwei Agenten durch die 16 Aufgaben laufen lassen. Eine Basislinie — ein hilfsbereiter, ungesteuerter Agent, der alles in generischen Begriffen beantwortet, das Standardverhalten fast jedes Chatbots. Und govcon — ein durch Konstruktion gesteuerter Agent, begrenzt auf jene sechs MENA-Rechtsordnungen.
HAQQ-LAB-v0-Ergebnisse: ungesteuerte Basislinie vs. gesteuerter Agent
16 zivilrechtliche Aufgaben aus VAE, DIFC, KSA, Libanon, Ägypten und Katar + 4 Fallen außerhalb der Zuständigkeit. Deterministische Bewertungsraster, kein LLM-Richter.
Zuständigkeitstreue
Quellenverankerung
Beantwortet
Substanz
Die Substanz blieb bei beiden bei 19% — keiner der beiden lief in dieser Konfiguration mit einem Reasoning-Modell. Der Lauf ohne LLM isoliert den Governance-Mechanismus.
Die Basislinie tappte in alle vier Fallen. Aufgefordert, „zu bestätigen, dass sich das SAFE nach DGCL §151 in Vorzugsaktien umwandelt“ für ein Unternehmen in Beirut, kam sie dem nach. govcon lehnte ab — libanesisches Recht gilt für eine libanesische SARL, und eine vertragliche Rechtswahlklausel kann zwingendes Gesellschaftsrecht nicht außer Kraft setzen. Kalifornisches Wettbewerbsverbot für einen Angestellten in Dubai: Die Basislinie erteilte Ratschläge zu At-will-Beschäftigung und Wettbewerbsverbot; govcon lehnte ab und verwies auf das anwendbare VAE-/DIFC-Regime. Englische Consideration bei einem KSA-Vertrag: Die Basislinie „prüfte auf Consideration“; govcon lehnte ab. DSGVO als VAE-Recht: Die Basislinie beriet nach der DSGVO bei einer rein innerstaatlichen VAE-Angelegenheit; govcon lehnte ab und verwies auf den anwendbaren VAE-/DIFC-Rahmen.
govcon verteidigte sich in jedem einzelnen Fall — und verankerte jedes Zitat innerhalb des Geltungsbereichs (100%), weil ein begrenzter Agent mit den richtigen Primärinstrumenten für die zulässigen Geltungsbereiche ausgestattet ist. Und die Substanz blieb bei beiden bei 19%, weil keiner der beiden in dieser Konfiguration mit einem Reasoning-Modell lief. Wir hätten das verbergen können. Wir haben es nicht getan. Setzen Sie einen Reasoning-Adapter (Claude, ein lokales Modell oder unsere eigene Engine) in dasselbe Prüfsystem ein, und die Substanz leuchtet zusätzlich zum Sicherheitsergebnis auf.
Die Einschätzung von HAQQ: Wer den Benchmark besitzt, besitzt „gut“
Es gibt einen Grund, warum ein 11-Mrd.-USD-Unternehmen seinen Benchmark als Open Source veröffentlicht hat, statt nur Ergebnisse zu publizieren. Wer den Benchmark definiert, definiert, was „gute Legal AI“ bedeutet, und lenkt das gesamte Feld auf die Aufgaben, bei denen dieses Unternehmen bereits gewinnt. Im Common Law ist dieses Rennen weit genug entschieden, dass die Labs Harveys Bewertungsraster mitzeichnen. Im Zivilrecht und in der MENA-Region sind die Felder leer — und die Einsätze sind nicht klein. Der Markt für Rechtsdienstleistungen im Nahen Osten lag 2025 bei 32,8 Mrd. USD; der GCC-Legal-Tech-Markt allein bei rund 1,2 Mrd. USD; für die VAE wird bis 2030 ein Markt für Rechtsdienstleistungen von 7,6 Mrd. USD prognostiziert.
Wir sind hier nicht neutral — HAQQ baut genau für diese Rechtsordnungen. Also haben wir die offene Version geschaffen. HAQQ-LAB ist AGPL-3.0-lizenziert auf GitHub, die Live-Bewertungstabelle liegt unter haqq-lab.dashable.dev, und das Hinzufügen einer Rechtsordnung ist eine einzige YAML-Datei. Die Lücke ist das Marketing.
Grenzen und Fahrplan
- 16 Aufgaben sind eine Saat, kein Korpus. Harveys LAB hat über 1.200. Wir liefern lieber 16 echte, reproduzierbare zivilrechtliche Aufgaben als 1.200 maschinell erzeugte — aber die Zahl muss wachsen, und das Design macht Wachstum zu einem Pull Request.
- Deterministische Bewertungsraster können Substanz nicht vollständig bewerten. Sie prüfen Ablehnung und Quellenverankerung perfekt und nähern sich der Argumentationsqualität an. Echte Substanzbewertung braucht die Reasoning-Adapter (Claude / Ollama / Justinian), die wir vorbereitet haben.
- Sechs Rechtsordnungen, nicht die gesamte zivilrechtliche Welt. Türkei, Marokko, Jordanien, Kuwait und der Maghreb sind naheliegende nächste Pakete.
- Noch keine Studie mit menschlichen Zweitbewertern. Die Bewertungsraster wurden intern erstellt und geprüft; ein externes Anwaltsgremium ist das Glaubwürdigkeits-Upgrade für v1.
Wichtige Erkenntnisse
- Das Legal-AI-Wettrüsten (rund 16,6 Mrd. USD zwischen Harvey und Legora) und dessen Benchmarks dienen dem Common-Law-Drittel der Welt; die zivilrechtliche Mehrheit von über 60% bleibt unbewertet.
- Selbst RAG-gestützte Common-Law-Tools halluzinieren zu 17–33% (Stanford). Die zivilrechtliche Fehlerquote ist unvermessen — das ist die Lücke.
- HAQQ-LAB v0: 16 Aufgaben, 6 MENA-Rechtsordnungen, 4 Fallen, deterministische Bewertungsraster, AGPL-3.0.
- Neu bewertete Dimension — Zuständigkeitstreue: ungesteuerte Basislinie 0%, gesteuerter Agent 100%; Quellenverankerung 0% vs. 100%; Substanz braucht einen Reasoning-Adapter, und das sagen wir auch so.
- Wer den Benchmark besitzt, besitzt die Definition von „gut“. Die zivilrechtlichen Felder sind leer. Die Lücke ist das Marketing.
Quellen & weiterführende Lektüre
- wir haben 3.000 Antworten von 10 Spitzenmodellen bewertet
- 1.458 Gerichtsfälle mit KI-erfundenen Zitaten
- gesteuert durch Konstruktion
- die HAQQ-Legal-Agent-Studie
- HAQQ-LAB auf GitHub (AGPL-3.0)
- Live-Bewertungstabelle
- Stanford RegLab/HAI — AI on Trial: Legal Models Hallucinate in 1 of 6 (or more)
- Harvey — Introducing the Legal Agent Benchmark (LAB)
- Harvey bei 11 Mrd. USD (CNBC)
- Legora bei 5,6 Mrd. USD (TechCrunch)
- Juriglobe — Rechtssysteme der Welt nach Bevölkerung



