Presentiamo l'HAQQ Legal Agent Study — una valutazione a lungo orizzonte costruita per misurare se gli agenti AI sono in grado di svolgere lavoro legale reale end-to-end, non solo rispondere a quiz. 1.372 task. 24 aree di pratica. ~78.000 criteri di rubrica redatti da esperti. Copertura di civil law e MENA fin dalla progettazione.
In sintesi
- 1.372 task legali a lungo orizzonte in 24 aree di pratica
- ~78.000 criteri di rubrica atomici, binari (pass/fail)
- Valutazione all-pass — un solo criterio mancato fa fallire l'intero task
- 6 famiglie di pratica civil-law e MENA incluse fin dalla v1
- Il miglior modello frontier (Claude Opus 4.7) supera il 41% all-pass; HAQQ Justinian il 58%
- Sui task civil-law / MENA, il divario si allarga a 71% contro 28%
Il punto di svolta degli agenti legali
L'osservazione di Andrej Karpathy sugli agenti di coding — che 'praticamente non funzionavano prima di dicembre e praticamente funzionano da allora' — sta iniziando a valere anche per il diritto. Il completamento di task legali a lungo orizzonte è rimasto stagnante per due anni. Poi, alla fine del 2025, modelli di reasoning di frontiera, contesti più lunghi, un uso migliore degli strumenti e un'infrastruttura di valutazione adeguata sono confluiti insieme. La capacità ha svoltato.
Dati chiave
- L'HAQQ Legal Agent Study: 1.372 task legali a lungo orizzonte, 24 aree di pratica, ~78.000 criteri di rubrica atomici pass/fail.
- Il miglior modello frontier (Claude Opus 4.7) supera il 41% all-pass; HAQQ Justinian il 58%.
- Sui task civil-law / MENA il divario si allarga a 71% (Justinian) contro 28% (miglior modello frontier).
Il diritto ha raggiunto questa curva più tardi del coding per una ragione precisa: non esisteva un benchmark per misurarla. Non si può tracciare una svolta che non si può vedere. Lo Study è lo strumento che abbiamo costruito per questo.
Perché i benchmark a breve orizzonte non bastano più
La maggior parte delle valutazioni di legal AI — LegalBench, CUAD, LEXam, persino i nostri lavori precedenti — testano un ragionamento a breve orizzonte: leggere una clausola, rispondere a una domanda, classificare un paragrafo. Sono utili, ma non dicono quasi nulla su se un agente sia davvero in grado di portare a termine un incarico di lavoro.
Il lavoro legale reale non assomiglia per niente a una scelta multipla. Un partner inoltra un'email, allega una cartella e scrive una sola riga: 'Dai un'occhiata e torna con un memo entro giovedì.' Ciò che accade tra quell'email e il memo è l'intero lavoro — leggere il fascicolo, individuare le questioni rilevanti, ignorare quelle che non lo sono, redigere un elaborato revisionabile e avere ogni fatto corretto.
Questo è ciò che misura lo Study.
Come è strutturato un task dello Study
Ogni task dello Study rispecchia il modo in cui il lavoro si muove dentro uno studio legale. L'agente riceve un'istruzione scritta come la scriverebbe un partner — breve, affermativa, senza specifiche di formattazione. Riceve un ambiente — un fascicolo cliente contenente i documenti e i thread email di cui ha bisogno (e molto altro che non gli serve). Deve produrre un elaborato revisionabile. E viene valutato tramite una rubrica redatta da esperti.
- Istruzioni: in media ~50 parole. Richiesta affermativa, nessuna checklist.
- Ambiente: una cartella del fascicolo che mescola documenti rilevanti a rumore periferico. L'agente deve individuare ciò che conta.
- Output: un memo, una redline, una tabella, una bozza di atto o un deposito — qualunque cosa il task richieda davvero.
- Verifica: criteri pass/fail atomici, binari, redatti da esperti. Ogni fatto, citazione, livello di gravità, scadenza e importo in denaro viene controllato.
Ogni riga è una codifica 1:1 di come un fascicolo reale si muove dentro uno studio: la richiesta del partner diventa istruzione, il fascicolo cliente diventa ambiente, l'elaborato diventa output, la revisione del partner diventa rubrica esperta. Nulla viene astratto per rendere il task più facile per il modello.
Valutazione all-pass
Un task è considerato completato solo se ogni criterio della rubrica viene superato. La chiamiamo valutazione all-pass, ed è la scelta di design più importante dello Study.
Un report del deal team che individua 8 rischi su 10 non è utile all'80%. I due mancati potrebbero essere proprio il trigger di change-of-control che fa saltare l'operazione, o la riserva sulla continuità aziendale che rideterminano il prezzo dell'offerta. Non esiste credito parziale nella revisione del partner.
Anatomia di una rubrica
Le rubriche sono la parte dello Study che ha richiesto più ore-avvocato per essere costruita. Per ogni task ci siamo seduti con professionisti dell'area rilevante e abbiamo scomposto ciò che un partner o un cliente avrebbe davvero scrutinato nell'elaborato. Ogni controllo è atomico e binario — nessun punteggio soft, nessuna valutazione stile 'LLM-as-judge' generica sullo stile.
I criteri atomici fanno tre cose contemporaneamente: rendono la valutazione riproducibile tra un'esecuzione e l'altra, rendono i fallimenti dell'agente diagnosticabili (si vede esattamente quale controllo si è rotto e perché), e fungono anche da segnale di ricompensa per il fine-tuning. La stessa rubrica che valuta un modello può addestrare la sua prossima versione.
24 aree di pratica — incluse civil law e MENA
I benchmark legali esistenti sono dominati da task di common law statunitense. Va bene per ciò che sono, ma non è il mondo in cui esercita la maggior parte dei nostri clienti. Lo Study (v1) copre 24 aree di pratica, di cui sei esplicitamente civil-law e MENA: redazione civil-law in arabo, conformità alla Sharia, corporate GCC, contenzioso in materia di costruzioni, diritto di famiglia / stato personale e diritto del lavoro MENA.
Siamo partiti da fascicoli reali — anonimizzati, sanificati — gestiti da avvocati in esercizio all'interno della nostra base clienti. Abbiamo scomposto ogni fascicolo nei task discreti che verrebbero effettivamente delegati a un associate. Le 24 aree non sono esaustive. Le prossime versioni aggiungeranno arbitrato in materia di costruzioni, regolamentazione fintech, ESG e flussi di lavoro per l'in-house.
Esempio: revisione del change-of-control
Un task di M&A corporate chiede all'agente di analizzare le clausole di change-of-control in una data room virtuale per l'acquisizione (fittizia) di Crestview Software Solutions, un'operazione interamente in azioni da 458 milioni di dollari. La data room contiene otto contratti rilevanti più file adiacenti — un 10-K, un piano di retribuzione differita, i verbali del consiglio — che possono essere o meno pertinenti.
Di seguito la vista completa dell'input così come la vede l'agente — richiesta, contesto dell'operazione, contratti principali, materiale più ampio della data room e l'output richiesto. Ogni elemento funge sia da indizio che da distrattore: l'agente deve usare i fatti del memo, ma deve anche separare l'incarico principale dai file periferici, come bozze di lettere di offerta e biografie del team, che non modificano l'analisi.
L'agente deve determinare quali file contano, leggerli nel contesto e sintetizzare le clausole rilevanti attraverso il fascicolo. L'output richiesto è un memo per il deal team con executive summary, mappatura dei rischi, analisi contratto per contratto, livelli di gravità e mitigazioni consigliate.
La rubrica di questo singolo task contiene 57 criteri — che coprono nove questioni legali inserite intenzionalmente, i fatti alla base di ciascuna, il livello di gravità, l'esposizione finanziaria e l'azione consigliata. Se ne manca una delle nove, il task fallisce.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Cosa viene inserito, e come viene valutato
Le nove questioni inserite in questo singolo task non sono trappole superficiali basate su parole chiave. Richiedono che l'agente colleghi fatti tra documenti diversi, deduca i trigger dalle definizioni, quantifichi l'esposizione finanziaria in dollari e raccomandi la giusta azione legale successiva. Passa il mouse su ciascuna questione per vedere cosa deve capire l'agente e il test unitario che la rubrica esegue sull'elaborato.
Risultati di base della v1
Abbiamo eseguito lo Study (v1) contro sei sistemi leader: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 e Mistral Large 3. Ogni task è stato tentato tre volte; riportiamo il tasso all-pass best-of-three. I numeri principali si dividono nettamente per categoria.
Due schemi si sono confermati in tutto il dataset.
- I modelli frontier generici se la cavano bene sul ragionamento isolato e male sul lavoro a lungo orizzonte. Perdono il contesto, allucinano collegamenti tra documenti diversi e producono output dal tono sicuro che falliscono i controlli della rubrica su fatti e citazioni.
- Gli agenti addestrati sul dominio (Justinian e sistemi specializzati comparabili) riducono il divario sul completamento a lungo orizzonte — soprattutto sulla redazione civil-law, dove i modelli generici applicano di default strutture di common law e falliscono sulle specificità procedurali.
Matrice delle capacità — cosa può davvero portare a termine ogni modello
I punteggi aggregati nascondono la domanda operativa che ogni partner di studio si pone: quali tipi di lavoro posso delegare end-to-end, quali richiedono un avvocato nel loop, e quali non dovrei nemmeno toccare? La matrice qui sotto risponde su 24 famiglie di task.
Perché conta per gli studi legali
Se stai valutando un fornitore di AI e ti mostra una demo sicura su un singolo documento, chiedigli quale sia il suo tasso di completamento a lungo orizzonte su un fascicolo reale. Chiedigli quale sia il suo tasso all-pass su una rubrica a 50 criteri per quel fascicolo. Chiedigli quali aree di pratica copre end-to-end e quali solo in modalità assistita.
Sono queste le domande a cui lo Study è progettato per rispondere — pubblicamente, in modo riproducibile e con rubriche che qualsiasi partner può verificare.
Cosa è aperto e cosa arriva dopo
- Le famiglie di task e il formato della rubrica della v1 sono documentati e saranno rilasciati a clienti e partner di ricerca sotto licenza di valutazione.
- Pubblicheremo una metodologia di punteggio normalizzata e una classifica di base non appena avremo i risultati di tutti i principali modelli frontier.
- La v2 aggiungerà arbitrato MENA, contenziosi in materia di costruzioni, flussi di lavoro per l'in-house counsel e una redazione civil-law più ampia in arabo e francese.
- Stiamo co-sviluppando estensioni con studi legali selezionati — se vuoi contribuire con famiglie di task dalla tua pratica, contattaci.
Il lavoro pregresso in questo campo è più interessante che mai — LegalBench, BigLaw Bench e il benchmark per agenti legali recentemente rilasciato da Harvey spingono tutti il settore in avanti. Il contributo di HAQQ è l'asse multilingue, civil-law e MENA-first che finora è mancato.
Provalo
Se vuoi vedere come Justinian si comporta su task a lungo orizzonte tratti dalla tua pratica, parla con il nostro team. Eseguiremo un pilota riservato, valutato tramite rubrica, su un fascicolo redatto del tuo studio.
Ringraziamenti
Lo Study è il lavoro di molte persone dentro HAQQ e all'interno della nostra rete di professionisti. La guida tecnica per l'harness, il sandbox degli agenti e il runtime delle rubriche è stata affidata al team di ingegneria di HAQQ Justinian, con la progettazione dei task e la generazione dei fascicoli guidate dal nostro gruppo di Applied Legal Research. I nostri team Security e AI Platform hanno costruito l'ambiente di esecuzione isolato che ci permette di far girare gli agenti contro fascicoli sintetici senza esporre dati dei clienti. I nostri team Brand e Product hanno definito come comunicare i risultati ad acquirenti legali non tecnici.
Fuori da HAQQ, siamo grati agli avvocati in esercizio — in MENA, nell'UE e nel Regno Unito — che hanno contribuito con fascicoli anonimizzati, redatto rubriche nelle rispettive aree di pratica e messo alla prova le prime famiglie di task. Ringraziamo inoltre i ricercatori accademici che hanno revisionato la nostra metodologia e i team che hanno realizzato i lavori pregressi LegalBench, BigLaw Bench, CUAD, LEXam e il benchmark per agenti legali di Harvey, il cui lavoro pubblicato ha reso questo benchmark più rapido e migliore da progettare.



