Skip to content
    HAQQ
    • Prezzi
    Inizia Gratis
    Inizia GratisPrenota Demo
    Accedi
    1. Home
    2. Blog
    3. HAQQ Legal Agent Study: un benchmark di IA legale a lungo orizzonte
    Torna al BlogIA & Tech Legale

    HAQQ Legal Agent Study: un benchmark di IA legale a lungo orizzonte

    1,372 task legali a lungo orizzonte, 24 aree di pratica, ~78,000 criteri di rubrica, valutazione all-pass. Il primo benchmark di agenti legali per civil law e MENA.

    May 6, 2026
    11 min di lettura
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study: un benchmark di IA legale a lungo orizzonte

    Presentiamo l'HAQQ Legal Agent Study — una valutazione a lungo orizzonte costruita per misurare se gli agenti AI sono in grado di svolgere lavoro legale reale end-to-end, non solo rispondere a quiz. 1.372 task. 24 aree di pratica. ~78.000 criteri di rubrica redatti da esperti. Copertura di civil law e MENA fin dalla progettazione.

    In sintesi

    • 1.372 task legali a lungo orizzonte in 24 aree di pratica
    • ~78.000 criteri di rubrica atomici, binari (pass/fail)
    • Valutazione all-pass — un solo criterio mancato fa fallire l'intero task
    • 6 famiglie di pratica civil-law e MENA incluse fin dalla v1
    • Il miglior modello frontier (Claude Opus 4.7) supera il 41% all-pass; HAQQ Justinian il 58%
    • Sui task civil-law / MENA, il divario si allarga a 71% contro 28%

    Il punto di svolta degli agenti legali

    L'osservazione di Andrej Karpathy sugli agenti di coding — che 'praticamente non funzionavano prima di dicembre e praticamente funzionano da allora' — sta iniziando a valere anche per il diritto. Il completamento di task legali a lungo orizzonte è rimasto stagnante per due anni. Poi, alla fine del 2025, modelli di reasoning di frontiera, contesti più lunghi, un uso migliore degli strumenti e un'infrastruttura di valutazione adeguata sono confluiti insieme. La capacità ha svoltato.

    Dati chiave

    • L'HAQQ Legal Agent Study: 1.372 task legali a lungo orizzonte, 24 aree di pratica, ~78.000 criteri di rubrica atomici pass/fail.
    • Il miglior modello frontier (Claude Opus 4.7) supera il 41% all-pass; HAQQ Justinian il 58%.
    • Sui task civil-law / MENA il divario si allarga a 71% (Justinian) contro 28% (miglior modello frontier).

    Il diritto ha raggiunto questa curva più tardi del coding per una ragione precisa: non esisteva un benchmark per misurarla. Non si può tracciare una svolta che non si può vedere. Lo Study è lo strumento che abbiamo costruito per questo.

    Perché i benchmark a breve orizzonte non bastano più

    La maggior parte delle valutazioni di legal AI — LegalBench, CUAD, LEXam, persino i nostri lavori precedenti — testano un ragionamento a breve orizzonte: leggere una clausola, rispondere a una domanda, classificare un paragrafo. Sono utili, ma non dicono quasi nulla su se un agente sia davvero in grado di portare a termine un incarico di lavoro.

    Il lavoro legale reale non assomiglia per niente a una scelta multipla. Un partner inoltra un'email, allega una cartella e scrive una sola riga: 'Dai un'occhiata e torna con un memo entro giovedì.' Ciò che accade tra quell'email e il memo è l'intero lavoro — leggere il fascicolo, individuare le questioni rilevanti, ignorare quelle che non lo sono, redigere un elaborato revisionabile e avere ogni fatto corretto.

    Questo è ciò che misura lo Study.

    Come è strutturato un task dello Study

    Ogni task dello Study rispecchia il modo in cui il lavoro si muove dentro uno studio legale. L'agente riceve un'istruzione scritta come la scriverebbe un partner — breve, affermativa, senza specifiche di formattazione. Riceve un ambiente — un fascicolo cliente contenente i documenti e i thread email di cui ha bisogno (e molto altro che non gli serve). Deve produrre un elaborato revisionabile. E viene valutato tramite una rubrica redatta da esperti.

    • Istruzioni: in media ~50 parole. Richiesta affermativa, nessuna checklist.
    • Ambiente: una cartella del fascicolo che mescola documenti rilevanti a rumore periferico. L'agente deve individuare ciò che conta.
    • Output: un memo, una redline, una tabella, una bozza di atto o un deposito — qualunque cosa il task richieda davvero.
    • Verifica: criteri pass/fail atomici, binari, redatti da esperti. Ogni fatto, citazione, livello di gravità, scadenza e importo in denaro viene controllato.

    Ogni riga è una codifica 1:1 di come un fascicolo reale si muove dentro uno studio: la richiesta del partner diventa istruzione, il fascicolo cliente diventa ambiente, l'elaborato diventa output, la revisione del partner diventa rubrica esperta. Nulla viene astratto per rendere il task più facile per il modello.

    Valutazione all-pass

    Un task è considerato completato solo se ogni criterio della rubrica viene superato. La chiamiamo valutazione all-pass, ed è la scelta di design più importante dello Study.

    Un report del deal team che individua 8 rischi su 10 non è utile all'80%. I due mancati potrebbero essere proprio il trigger di change-of-control che fa saltare l'operazione, o la riserva sulla continuità aziendale che rideterminano il prezzo dell'offerta. Non esiste credito parziale nella revisione del partner.

    Anatomia di una rubrica

    Le rubriche sono la parte dello Study che ha richiesto più ore-avvocato per essere costruita. Per ogni task ci siamo seduti con professionisti dell'area rilevante e abbiamo scomposto ciò che un partner o un cliente avrebbe davvero scrutinato nell'elaborato. Ogni controllo è atomico e binario — nessun punteggio soft, nessuna valutazione stile 'LLM-as-judge' generica sullo stile.

    I criteri atomici fanno tre cose contemporaneamente: rendono la valutazione riproducibile tra un'esecuzione e l'altra, rendono i fallimenti dell'agente diagnosticabili (si vede esattamente quale controllo si è rotto e perché), e fungono anche da segnale di ricompensa per il fine-tuning. La stessa rubrica che valuta un modello può addestrare la sua prossima versione.

    24 aree di pratica — incluse civil law e MENA

    I benchmark legali esistenti sono dominati da task di common law statunitense. Va bene per ciò che sono, ma non è il mondo in cui esercita la maggior parte dei nostri clienti. Lo Study (v1) copre 24 aree di pratica, di cui sei esplicitamente civil-law e MENA: redazione civil-law in arabo, conformità alla Sharia, corporate GCC, contenzioso in materia di costruzioni, diritto di famiglia / stato personale e diritto del lavoro MENA.

    Siamo partiti da fascicoli reali — anonimizzati, sanificati — gestiti da avvocati in esercizio all'interno della nostra base clienti. Abbiamo scomposto ogni fascicolo nei task discreti che verrebbero effettivamente delegati a un associate. Le 24 aree non sono esaustive. Le prossime versioni aggiungeranno arbitrato in materia di costruzioni, regolamentazione fintech, ESG e flussi di lavoro per l'in-house.

    Esempio: revisione del change-of-control

    Un task di M&A corporate chiede all'agente di analizzare le clausole di change-of-control in una data room virtuale per l'acquisizione (fittizia) di Crestview Software Solutions, un'operazione interamente in azioni da 458 milioni di dollari. La data room contiene otto contratti rilevanti più file adiacenti — un 10-K, un piano di retribuzione differita, i verbali del consiglio — che possono essere o meno pertinenti.

    Di seguito la vista completa dell'input così come la vede l'agente — richiesta, contesto dell'operazione, contratti principali, materiale più ampio della data room e l'output richiesto. Ogni elemento funge sia da indizio che da distrattore: l'agente deve usare i fatti del memo, ma deve anche separare l'incarico principale dai file periferici, come bozze di lettere di offerta e biografie del team, che non modificano l'analisi.

    L'agente deve determinare quali file contano, leggerli nel contesto e sintetizzare le clausole rilevanti attraverso il fascicolo. L'output richiesto è un memo per il deal team con executive summary, mappatura dei rischi, analisi contratto per contratto, livelli di gravità e mitigazioni consigliate.

    La rubrica di questo singolo task contiene 57 criteri — che coprono nove questioni legali inserite intenzionalmente, i fatti alla base di ciascuna, il livello di gravità, l'esposizione finanziaria e l'azione consigliata. Se ne manca una delle nove, il task fallisce.

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Cosa viene inserito, e come viene valutato

    Le nove questioni inserite in questo singolo task non sono trappole superficiali basate su parole chiave. Richiedono che l'agente colleghi fatti tra documenti diversi, deduca i trigger dalle definizioni, quantifichi l'esposizione finanziaria in dollari e raccomandi la giusta azione legale successiva. Passa il mouse su ciascuna questione per vedere cosa deve capire l'agente e il test unitario che la rubrica esegue sull'elaborato.

    Risultati di base della v1

    Abbiamo eseguito lo Study (v1) contro sei sistemi leader: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 e Mistral Large 3. Ogni task è stato tentato tre volte; riportiamo il tasso all-pass best-of-three. I numeri principali si dividono nettamente per categoria.

    Due schemi si sono confermati in tutto il dataset.

    • I modelli frontier generici se la cavano bene sul ragionamento isolato e male sul lavoro a lungo orizzonte. Perdono il contesto, allucinano collegamenti tra documenti diversi e producono output dal tono sicuro che falliscono i controlli della rubrica su fatti e citazioni.
    • Gli agenti addestrati sul dominio (Justinian e sistemi specializzati comparabili) riducono il divario sul completamento a lungo orizzonte — soprattutto sulla redazione civil-law, dove i modelli generici applicano di default strutture di common law e falliscono sulle specificità procedurali.

    Matrice delle capacità — cosa può davvero portare a termine ogni modello

    I punteggi aggregati nascondono la domanda operativa che ogni partner di studio si pone: quali tipi di lavoro posso delegare end-to-end, quali richiedono un avvocato nel loop, e quali non dovrei nemmeno toccare? La matrice qui sotto risponde su 24 famiglie di task.

    Perché conta per gli studi legali

    Se stai valutando un fornitore di AI e ti mostra una demo sicura su un singolo documento, chiedigli quale sia il suo tasso di completamento a lungo orizzonte su un fascicolo reale. Chiedigli quale sia il suo tasso all-pass su una rubrica a 50 criteri per quel fascicolo. Chiedigli quali aree di pratica copre end-to-end e quali solo in modalità assistita.

    Sono queste le domande a cui lo Study è progettato per rispondere — pubblicamente, in modo riproducibile e con rubriche che qualsiasi partner può verificare.

    Cosa è aperto e cosa arriva dopo

    • Le famiglie di task e il formato della rubrica della v1 sono documentati e saranno rilasciati a clienti e partner di ricerca sotto licenza di valutazione.
    • Pubblicheremo una metodologia di punteggio normalizzata e una classifica di base non appena avremo i risultati di tutti i principali modelli frontier.
    • La v2 aggiungerà arbitrato MENA, contenziosi in materia di costruzioni, flussi di lavoro per l'in-house counsel e una redazione civil-law più ampia in arabo e francese.
    • Stiamo co-sviluppando estensioni con studi legali selezionati — se vuoi contribuire con famiglie di task dalla tua pratica, contattaci.

    Il lavoro pregresso in questo campo è più interessante che mai — LegalBench, BigLaw Bench e il benchmark per agenti legali recentemente rilasciato da Harvey spingono tutti il settore in avanti. Il contributo di HAQQ è l'asse multilingue, civil-law e MENA-first che finora è mancato.

    Provalo

    Se vuoi vedere come Justinian si comporta su task a lungo orizzonte tratti dalla tua pratica, parla con il nostro team. Eseguiremo un pilota riservato, valutato tramite rubrica, su un fascicolo redatto del tuo studio.

    • Parla con il nostro team
    • Guarda i benchmark di Justinian
    • Confronta HAQQ

    Ringraziamenti

    Lo Study è il lavoro di molte persone dentro HAQQ e all'interno della nostra rete di professionisti. La guida tecnica per l'harness, il sandbox degli agenti e il runtime delle rubriche è stata affidata al team di ingegneria di HAQQ Justinian, con la progettazione dei task e la generazione dei fascicoli guidate dal nostro gruppo di Applied Legal Research. I nostri team Security e AI Platform hanno costruito l'ambiente di esecuzione isolato che ci permette di far girare gli agenti contro fascicoli sintetici senza esporre dati dei clienti. I nostri team Brand e Product hanno definito come comunicare i risultati ad acquirenti legali non tecnici.

    Fuori da HAQQ, siamo grati agli avvocati in esercizio — in MENA, nell'UE e nel Regno Unito — che hanno contribuito con fascicoli anonimizzati, redatto rubriche nelle rispettive aree di pratica e messo alla prova le prime famiglie di task. Ringraziamo inoltre i ricercatori accademici che hanno revisionato la nostra metodologia e i team che hanno realizzato i lavori pregressi LegalBench, BigLaw Bench, CUAD, LEXam e il benchmark per agenti legali di Harvey, il cui lavoro pubblicato ha reso questo benchmark più rapido e migliore da progettare.

    Letture correlate

    • HAQQ-LAB, il nostro benchmark open source per il civil law
    • il nostro benchmark con 3.000 risposte su 10 modelli frontier
    • il panorama open source della legal AI, inclusi i benchmark aperti
    S

    Stephane Boghossian

    Head of Growth

    Risorse correlate

    JustinianLegal AI ChatCompare HAQQSecurity

    Articoli correlati

    Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB

    Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB

    Perché ChatGPT delude gli avvocati: note da 3 avvocati USA

    Perché ChatGPT delude gli avvocati: note da 3 avvocati USA

    IA legale in arabo: il gap è il retrieval, non i contenuti

    IA legale in arabo: il gap è il retrieval, non i contenuti

    Domande frequenti

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    Cosa c'è dopo?

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Calcola il tuo ROI

    Scopri quanto tempo e denaro HAQQ risparmia al tuo studio

    Esplora 380+ prompt legali

    Prompt pronti per ogni compito legale

    Torna al Blog

    Articolo precedente

    L'AI può pianificare un contenzioso? Abbiamo costruito un planner GOAP

    Articolo successivo

    Generatore di testamento con IA: come redigere un testamento per giurisdizione con HAQQ

    Mettilo in pratica

    Fai a HAQQ la domanda che questo articolo ti ha lasciato.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Il tuo Gemello AI Legale e Sistema di Gestione Studio per redigere, fatturare e vincere.

    Download on theApp StoreGet it onGoogle Play

    Documentazioni

    • Docs si apre in una nuova scheda
    • Per iniziare si apre in una nuova scheda
    • Stampa si apre in una nuova scheda
    • Aggiornamenti del prodotto si apre in una nuova scheda
    • Stato si apre in una nuova scheda
    • Sicurezza
    • FAQ si apre in una nuova scheda
    • Comunità si apre in una nuova scheda
    • Assistenza si apre in una nuova scheda

    Academy

    • Corso si apre in una nuova scheda
    • Competenze si apre in una nuova scheda
    • Clausole si apre in una nuova scheda
    • Libreria di prompt si apre in una nuova scheda
    • Strumenti si apre in una nuova scheda
    • Hub di ricerca si apre in una nuova scheda
    • Documenti si apre in una nuova scheda

    Sito web

    • eFirm
    • Chat IA Legale
    • App Mobile
    • Motore Giustiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Prezzi
    • Confrontaci
    • Soluzioni
    • Blog
    • Conosci il team
    • Unisciti a noi si apre in una nuova scheda
    Apri l'app
    • Linguear en fr es it de pt
    • Contattoinfo@haqq.ai
    • Statooperativo·fondato
    • Termini di Servizio
    • Informativa sulla privacy
    • Informativa sui cookie
    • Trattamento Dati si apre in una nuova scheda
    • humans.txt si apre in una nuova schedalawyers.txt si apre in una nuova schedasecurity.txt si apre in una nuova scheda
    © 2026 HAQQ Inc. Tutti i diritti riservati.Prodotto sviluppato internamente da HAQQ. Sito web costruito con strumenti web moderni.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion