Skip to content
    HAQQ
    • Preise
    Kostenlos starten
    Kostenlos startenDemo buchen
    Einloggen
    1. Startseite
    2. Blog
    3. HAQQ Legal Agent Study: Ein Long-Horizon-Benchmark für Rechts-KI
    Zurück zum BlogKI & Rechtstechnologie

    HAQQ Legal Agent Study: Ein Long-Horizon-Benchmark für Rechts-KI

    1,372 Long-Horizon-Rechtsaufgaben, 24 Rechtsgebiete, ~78,000 Rubrik-Kriterien, All-Pass-Bewertung. Der erste Legal-Agent-Benchmark für Civil Law und MENA.

    May 6, 2026
    11 Min. Lesezeit
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study: Ein Long-Horizon-Benchmark für Rechts-KI

    Wir stellen die HAQQ Legal Agent Study vor — eine Long-Horizon-Evaluierung, die misst, ob KI-Agenten echte juristische Arbeit end-to-end erledigen können, statt nur Quizfragen zu beantworten. 1.372 Aufgaben. 24 Praxisbereiche. ~78.000 von Experten erstellte Bewertungskriterien. Zivilrecht- und MENA-Abdeckung von Grund auf.

    Kernpunkte

    • 1.372 Long-Horizon-Rechtsaufgaben in 24 Praxisbereichen
    • ~78.000 atomare, binäre Bestehen/Nicht-bestehen-Bewertungskriterien
    • All-Pass-Bewertung — ein verpasstes Kriterium lässt die Aufgabe durchfallen
    • 6 zivilrechtliche und MENA-Praxisfamilien bereits in v1 enthalten
    • Bestes Frontier-Modell (Claude Opus 4.7) erreicht 41% All-Pass; HAQQ Justinian erreicht 58%
    • Bei zivilrechtlichen/MENA-Aufgaben weitet sich die Lücke auf 71% gegenüber 28%

    Der Wendepunkt für Legal Agents

    Andrej Karpathys Beobachtung zu Coding-Agenten — dass sie „vor Dezember im Grunde nicht funktionierten und seitdem im Grunde funktionieren“ — beginnt sich im Rechtsbereich zu bestätigen. Long-Horizon-Rechtsbearbeitung stagnierte zwei Jahre lang. Dann kamen Ende 2025 Frontier-Reasoning-Modelle, längere Kontexte, besserer Tool-Einsatz und geeignete Evaluierungsinfrastruktur zusammen. Die Fähigkeit machte einen Sprung.

    Wichtige Fakten

    • Die HAQQ Legal Agent Study: 1.372 Long-Horizon-Rechtsaufgaben, 24 Praxisbereiche, ~78.000 atomare Bestehen/Nicht-bestehen-Bewertungskriterien.
    • Bestes Frontier-Modell (Claude Opus 4.7) erreicht 41% All-Pass; HAQQ Justinian erreicht 58%.
    • Bei zivilrechtlichen/MENA-Aufgaben weitet sich die Lücke auf 71% (Justinian) gegenüber 28% (bestes Frontier-Modell).

    Legal Tech erreichte diese Kurve später als Coding aus einem einzigen Grund: Es gab keinen Benchmark, um sie zu messen. Man kann keinen Wendepunkt verfolgen, den man nicht sieht. Die Study ist das Instrument, das wir gebaut haben.

    Warum Short-Horizon-Benchmarks versagten

    Die meisten Legal-AI-Evaluierungen — LegalBench, CUAD, LEXam, sogar unsere eigene frühere Arbeit — testen Short-Horizon-Reasoning: eine Klausel lesen, eine Frage beantworten, einen Absatz klassifizieren. Sie sind nützlich, sagen aber fast nichts darüber aus, ob ein Agent tatsächlich ein Arbeitspaket durchführen kann.

    Echte juristische Arbeit sieht überhaupt nicht wie Multiple-Choice aus. Ein Partner leitet eine E-Mail weiter, hängt einen Ordner an und schreibt eine Zeile: „Schauen Sie sich das an und liefern Sie bis Donnerstag ein Memo.“ Was zwischen dieser E-Mail und dem Memo passiert, ist der gesamte Job — das Mandat lesen, die relevanten Punkte finden, die irrelevanten ignorieren, ein prüffähiges Arbeitsprodukt entwerfen und jede Tatsache korrekt wiedergeben.

    Genau das misst die Study.

    Wie eine Study-Aufgabe aufgebaut ist

    Jede Aufgabe in der Study spiegelt wider, wie Arbeit innerhalb einer Kanzlei abläuft. Der Agent erhält eine Anweisung, geschrieben wie ein Partner sie schreiben würde — kurz, bejahend, ohne Formatvorgabe. Er erhält eine Umgebung — ein Mandantenmandat mit den Dokumenten und E-Mail-Threads, die er braucht (und vielen, die er nicht braucht). Er muss ein prüffähiges Arbeitsprodukt liefern. Und er wird anhand eines Experten-Bewertungsrasters benotet.

    • Anweisungen: im Schnitt ~50 Wörter. Bejahende Bitte, keine Checkliste.
    • Umgebung: Mandatsordner, der wesentliche Dokumente mit peripherem Rauschen mischt. Der Agent muss herausfinden, was zählt.
    • Ergebnis: ein Memo, ein Redline, eine Tabelle, ein Schriftsatzentwurf oder eine Einreichung — was die Aufgabe tatsächlich erfordert.
    • Verifizierung: von Experten verfasste, atomare, binäre Bestehen/Nicht-bestehen-Kriterien. Jede Tatsache, jedes Zitat, jede Schweregradbewertung, jede Frist und jeder Dollarbetrag wird geprüft.

    Jede Zeile ist eine 1:1-Abbildung dessen, wie ein reales Mandat durch eine Kanzlei läuft: Die Partneranfrage wird zur Anweisung, das Mandantenmandat wird zur Umgebung, das Arbeitsprodukt wird zum Ergebnis, die Partnerprüfung wird zum Experten-Bewertungsraster. Nichts wird abstrahiert, um die Aufgabe für das Modell einfacher zu machen.

    All-Pass-Bewertung

    Eine Aufgabe gilt nur dann als abgeschlossen, wenn jedes Kriterium des Bewertungsrasters besteht. Wir nennen das All-Pass-Bewertung, und es ist die wichtigste Designentscheidung der gesamten Study.

    Ein Deal-Team-Bericht, der 8 von 10 Risiken erfasst, ist nicht zu 80% nützlich. Die beiden übersehenen könnten der Change-of-Control-Auslöser sein, der den Deal platzen lässt, oder der Going-Concern-Vermerk, der das Angebot neu bepreist. Bei der Partnerprüfung gibt es keine Teilpunkte.

    Anatomie eines Bewertungsrasters

    Die Bewertungsraster sind der Teil der Study, der die meisten Anwaltsstunden zum Aufbau erforderte. Für jede Aufgabe setzten wir uns mit Praktikern aus dem jeweiligen Bereich zusammen und arbeiteten heraus, was ein Partner oder Mandant im Ergebnis tatsächlich genau prüfen würde. Jede Prüfung ist atomar und binär — keine weichen Bewertungen, kein LLM-as-Judge-Herumlavieren beim Stil.

    Atomare Kriterien leisten drei Dinge gleichzeitig: Sie machen die Bewertung über mehrere Durchläufe hinweg reproduzierbar, sie machen Agentenfehler debugbar (man sieht genau, welche Prüfung fehlschlug und warum), und sie dienen zugleich als Belohnungssignale für Fine-Tuning. Dasselbe Bewertungsraster, das ein Modell bewertet, kann dessen nächste Version trainieren.

    24 Praxisbereiche — einschließlich Zivilrecht und MENA

    Bestehende Legal-Benchmarks werden von US-Common-Law-Aufgaben dominiert. Das ist für das, was sie sind, in Ordnung — aber es ist nicht die Welt, in der die meisten unserer Kunden praktizieren. Die Study (v1) deckt 24 Praxisbereiche ab, von denen sechs explizit zivilrechtlich und MENA-bezogen sind: arabisches zivilrechtliches Drafting, Scharia-Konformität, GCC-Gesellschaftsrecht, Baurechtsstreitigkeiten, Familien-/Personenstandsrecht und MENA-Arbeitsrecht.

    Wir gingen von realen Mandaten aus — anonymisiert, bereinigt —, die von praktizierenden Anwälten in unserem Kundenstamm bearbeitet wurden. Wir zerlegten jedes Mandat in die einzelnen Aufgaben, die tatsächlich an einen Associate delegiert würden. Die 24 Bereiche sind nicht abschließend. Künftige Releases werden Bauschiedsverfahren, Fintech-Regulierung, ESG und Inhouse-Workflows hinzufügen.

    Beispiel: Change-of-Control-Prüfung

    Eine M&A-Aufgabe im Gesellschaftsrecht fordert den Agenten auf, Change-of-Control-Klauseln in einem virtuellen Datenraum für die (fiktive) Übernahme von Crestview Software Solutions in einer reinen Eigenkapitaltransaktion über 458 Mio. USD zu analysieren. Der Datenraum enthält acht wesentliche Verträge sowie angrenzende Unterlagen — 10-K-Bericht, Pensionsplan, Vorstandsprotokolle —, die relevant sein können oder auch nicht.

    Nachfolgend die vollständige Eingabeansicht, wie der Agent sie sieht — Anfrage, Deal-Kontext, Kernverträge, weiteres Datenraummaterial und das geforderte Ergebnis. Jeder Eintrag dient zugleich als Hinweis und als Ablenkung: Der Agent muss die Fakten des Memos nutzen, aber auch die Kernaufgabe von peripheren Dateien wie Entwürfen von Gebotsschreiben und Team-Biografien trennen, die die Analyse nicht verändern.

    Der Agent muss bestimmen, welche Dateien relevant sind, sie im Kontext lesen und die maßgeblichen Klauseln über das gesamte Mandat hinweg zusammenführen. Das geforderte Ergebnis ist ein Deal-Team-Memo mit Executive Summary, Risikokartierung, vertragsweiser Analyse, Schweregradbewertungen und empfohlenen Abhilfemaßnahmen.

    Das Bewertungsraster für diese eine Aufgabe enthält 57 Kriterien — sie decken neun eingebaute Rechtsfragen ab, die zugrunde liegenden Fakten zu jeder, die Schweregradbewertung, das finanzielle Risiko und die empfohlene Maßnahme. Wird eine der neun übersehen, fällt die Aufgabe durch.

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    Was eingebaut wird — und wie es bewertet wird

    Die neun in diese eine Aufgabe eingebauten Punkte sind keine oberflächlichen Stichwortfallen. Sie verlangen vom Agenten, Fakten über Dokumente hinweg zu verknüpfen, Auslöser aus Definitionen abzuleiten, das finanzielle Risiko in Dollar zu beziffern und die richtige nächste rechtliche Maßnahme zu empfehlen. Fahren Sie mit der Maus über einen Punkt, um zu sehen, was der Agent herausfinden muss und welchen Unit-Test das Bewertungsraster gegen das Ergebnis ausführt.

    v1-Basisergebnisse

    Wir ließen die Study (v1) gegen sechs führende Systeme antreten: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 und Mistral Large 3. Jede Aufgabe wurde dreimal versucht; wir berichten die Best-of-Three-All-Pass-Quote. Die Kernzahlen teilen sich sauber nach Kategorie auf.

    Zwei Muster zogen sich durch den gesamten Datensatz.

    • Generische Frontier-Modelle schneiden bei isoliertem Reasoning gut ab und bei Long-Horizon-Arbeit schlecht. Sie verlieren den Kontext, halluzinieren dokumentübergreifende Verknüpfungen und liefern selbstbewusst klingende Ergebnisse, die bei Fakten- und Zitatprüfungen im Bewertungsraster durchfallen.
    • Domänenspezifisch trainierte Agenten (Justinian und vergleichbare Spezialsysteme) schließen die Lücke bei der Long-Horizon-Fertigstellung — besonders beim zivilrechtlichen Drafting, wo generische Modelle standardmäßig auf Common-Law-Strukturen zurückgreifen und an verfahrensrechtlichen Details scheitern.

    Fähigkeitsmatrix — was jedes Modell tatsächlich fertigstellen kann

    Aggregierte Punktzahlen verdecken die operative Frage, die sich jeder Kanzleipartner stellt: Welche Art von Arbeit kann ich end-to-end delegieren, welche benötigt einen Anwalt im Loop, und welche sollte ich gar nicht anfassen? Die untenstehende Matrix beantwortet das über 24 Aufgabenfamilien hinweg.

    Warum das für Kanzleien wichtig ist

    Wenn Sie einen KI-Anbieter evaluieren und dieser Ihnen eine selbstbewusste Demo an einem einzelnen Dokument zeigt, fragen Sie nach der Long-Horizon-Fertigstellungsquote bei einem realen Mandat. Fragen Sie nach der All-Pass-Quote bei einem Bewertungsraster mit 50 Kriterien für dieses Mandat. Fragen Sie, welche Praxisbereiche end-to-end abgedeckt werden und bei welchen nur unterstützt wird.

    Genau diese Fragen soll die Study beantworten — öffentlich, reproduzierbar und mit Bewertungsrastern, die jeder Partner prüfen kann.

    Was offen ist und was als Nächstes kommt

    • Die Aufgabenfamilien und das Bewertungsrasterformat von v1 sind dokumentiert und werden Kunden und Forschungspartnern unter einer Evaluierungslizenz zur Verfügung gestellt.
    • Wir werden eine normalisierte Bewertungsmethodik und eine Basis-Rangliste veröffentlichen, sobald Ergebnisse aller wichtigen Frontier-Modelle vorliegen.
    • v2 wird MENA-Schiedsverfahren, Baurechtsstreitigkeiten, Inhouse-Counsel-Workflows und breiteres arabisches und französisches zivilrechtliches Drafting hinzufügen.
    • Wir entwickeln Erweiterungen gemeinsam mit ausgewählten Kanzleien — wenn Sie Aufgabenfamilien aus Ihrer Praxis beisteuern möchten, kontaktieren Sie uns.

    Bestehende Vorarbeiten leisten interessantere Arbeit als je zuvor — LegalBench, BigLaw Bench und Harveys kürzlich veröffentlichter Legal-Agent-Benchmark bringen das Feld allesamt voran. HAQQs Beitrag ist die mehrsprachige, zivilrechtliche, MENA-first-Achse, die bislang gefehlt hat.

    Selbst ausprobieren

    Wenn Sie sehen möchten, wie Justinian bei Long-Horizon-Aufgaben aus Ihrer Praxis abschneidet, sprechen Sie mit unserem Team. Wir führen ein vertrauliches, anhand von Bewertungsrastern benotetes Pilotprojekt an einem geschwärzten Mandat Ihrer Kanzlei durch.

    • Sprechen Sie mit unserem Team
    • Justinian-Benchmarks ansehen
    • HAQQ vergleichen

    Danksagungen

    Die Study ist das Werk vieler Menschen innerhalb von HAQQ und in unserem gesamten Praktiker-Netzwerk. Die technische Leitung für das Testgerüst, die Agenten-Sandbox und die Bewertungsraster-Laufzeitumgebung lag beim HAQQ-Justinian-Engineering-Team, während Aufgabendesign und Mandatserstellung von unserer Applied-Legal-Research-Gruppe geleitet wurden. Unsere Security- und AI-Platform-Teams bauten die isolierte Ausführungsumgebung, die es uns erlaubt, Agenten gegen synthetische Mandate laufen zu lassen, ohne Mandantendaten preiszugeben. Unsere Brand- und Product-Teams gestalteten, wie die Ergebnisse gegenüber nicht-technischen juristischen Einkäufern kommuniziert werden.

    Außerhalb von HAQQ danken wir den praktizierenden Anwälten — in MENA, der EU und Großbritannien —, die anonymisierte Mandate beigesteuert, Bewertungsraster in ihren Praxisbereichen entworfen und frühe Aufgabenfamilien einem Stresstest unterzogen haben. Wir danken auch den akademischen Forschern, die unsere Methodik überprüft haben, sowie den Teams hinter den Vorarbeiten LegalBench, BigLaw Bench, CUAD, LEXam und Harveys Legal-Agent-Benchmark, deren veröffentlichte Arbeit es ermöglichte, diesen Benchmark schneller und besser zu gestalten.

    Weiterführende Lektüre

    • HAQQ-LAB, unser Open-Source-Zivilrechts-Benchmark
    • unser 3.000-Antworten-Benchmark von 10 Frontier-Modellen
    • die Open-Source-Legal-AI-Landschaft, einschließlich offener Benchmarks
    S

    Stephane Boghossian

    Head of Growth

    Verwandte Ressourcen

    JustinianLegal AI ChatCompare HAQQSecurity

    Verwandte Artikel

    Der Legal-AI-Benchmark für das Zivilrecht: Warum wir HAQQ-LAB gebaut haben

    Der Legal-AI-Benchmark für das Zivilrecht: Warum wir HAQQ-LAB gebaut haben

    Warum ChatGPT Anwälte enttäuscht: Notizen von 3 US-Anwälten

    Warum ChatGPT Anwälte enttäuscht: Notizen von 3 US-Anwälten

    Arabische Rechts-KI: Die Lücke liegt im Retrieval, nicht im Inhalt

    Arabische Rechts-KI: Die Lücke liegt im Retrieval, nicht im Inhalt

    Häufig gestellte Fragen

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    Was kommt als Nächstes?

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    ROI berechnen

    Sehen Sie, wie viel Zeit und Geld HAQQ Ihrer Kanzlei spart

    380+ juristische Prompts durchsuchen

    Sofort einsatzbereite Prompts für jede juristische Aufgabe

    Zurück zum Blog

    Vorheriger Artikel

    Kann KI Prozessführung planen? Wir haben einen GOAP-Planner gebaut

    Nächster Artikel

    KI-Testament-Generator: Mit HAQQ ein gerichtsfestes Testament entwerfen

    Setzen Sie das ein

    Stellen Sie HAQQ die Frage, die dieser Artikel bei Ihnen aufgeworfen hat.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Ihr juristischer KI-Zwilling und Kanzleimanagement-System für Entwurf, Abrechnung und Gewinnen.

    Download on theApp StoreGet it onGoogle Play

    Dokumentationen

    • Docs wird in einem neuen Tab geöffnet
    • Erste Schritte wird in einem neuen Tab geöffnet
    • Presse wird in einem neuen Tab geöffnet
    • Produkt-Updates wird in einem neuen Tab geöffnet
    • Status wird in einem neuen Tab geöffnet
    • Sicherheit
    • FAQ wird in einem neuen Tab geöffnet
    • Community wird in einem neuen Tab geöffnet
    • Support wird in einem neuen Tab geöffnet

    Academy

    • Kurs wird in einem neuen Tab geöffnet
    • Skills wird in einem neuen Tab geöffnet
    • Klauseln wird in einem neuen Tab geöffnet
    • Prompt-Bibliothek wird in einem neuen Tab geöffnet
    • Tools wird in einem neuen Tab geöffnet
    • Research Hub wird in einem neuen Tab geöffnet
    • Dokumente wird in einem neuen Tab geöffnet

    Website

    • eFirm
    • Juristischer KI-Chat
    • Mobile App
    • Justinian KI-Engine
    • HAQQ eBar
    • HAQQ eWallet
    • Preise
    • Vergleichen Sie uns
    • Lösungen
    • Blog
    • Team kennenlernen
    • Mach mit wird in einem neuen Tab geöffnet
    App öffnen
    • Sprachenar en fr es it de pt
    • Kontaktinfo@haqq.ai
    • Statusbetriebsbereit·fundiert
    • Nutzungsbedingungen
    • Datenschutzrichtlinie
    • Cookie-Richtlinie
    • Datenverarbeitung wird in einem neuen Tab geöffnet
    • humans.txt wird in einem neuen Tab geöffnetlawyers.txt wird in einem neuen Tab geöffnetsecurity.txt wird in einem neuen Tab geöffnet
    © 2026 HAQQ Inc. Alle Rechte vorbehalten.Produkt intern von HAQQ entwickelt. Website mit modernen Web-Tools gebaut.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion