TL;DR — Le due maggiori aziende di IA legale valgono oggi insieme circa 16,6 miliardi di dollari (Harvey 11 mld, Legora 5,6 mld), e quasi ogni benchmark che le valuta è modellato sul common law e sul mercato statunitense. Il common law copre ~80 paesi e un terzo dell'umanità; il civil law copre ~150 paesi e oltre il 60% del mondo — e fino ad oggi non esisteva alcun benchmark pubblico per agenti legali su questo terreno. Abbiamo reso open source HAQQ-LAB: 16 task su EAU, DIFC, Arabia Saudita, Libano, Egitto e Qatar, più 4 trappole fuori giurisdizione. Misura l'adesione giurisdizionale — l'agente rifiuta di applicare una legge che non lo governa? Baseline non governata: 0%. Agente governato: 100%.
La mappa che tutti usano manca del 60% del territorio
Il 2026 è l'anno in cui la legal AI è diventata un mercato vero. A marzo Harvey ha raccolto 200 milioni di dollari a una valutazione di 11 miliardi (in salita dagli 8 miliardi di dicembre). Legora ha chiuso una Serie D da 550 milioni a una valutazione di 5,6 miliardi dopo aver superato i 100 milioni di ARR. Lexroom ha aggiunto 50 milioni per 'il milione di avvocati d'Europa'. Due aziende, ~16,6 miliardi di dollari.
Dati chiave
- Il civil law copre ~150 paesi e oltre il 60% della popolazione mondiale; il common law ~80 paesi e circa un terzo — eppure quasi tutti i benchmark di IA legale sono modellati sul common law.
- HAQQ-LAB v0: baseline non governata allo 0% di adesione giurisdizionale e 0% di grounding, contro il 100%/100% dell'agente governato, su 16 task MENA + 4 trappole.
- Westlaw AI-Assisted Research ha allucinato su ~33% delle query e Lexis+ AI su oltre il 17% (EXTERNAL-CITE: studio Stanford RegLab/HAI, citato nelle fonti dell'articolo).
E va riconosciuto loro un merito: ora competono sul rigore, non solo sulle demo. A maggio 2026 Harvey ha reso open source LAB — un lavoro serio: oltre 1.200 task su 24 aree di pratica, valutati su oltre 75.000 criteri di rubrica scritti da esperti, con contributi accreditati di Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain e il LIFTLab di Stanford. Lo diciamo sul serio: è un contributo al settore.
Ecco il problema. Guardate la mappa dei benchmark di IA legale e osservate cosa c'è davvero:
| Benchmark | Task | Ambito | Sistema giuridico |
|---|---|---|---|
| LegalBench (Stanford) | 162 task, 6 categorie di ragionamento | Ragionamento giuridico statunitense | Common law |
| Harvey LAB | 1.200+ task, 24 aree di pratica | Lavoro di agente BigLaw / in-house | Common law |
| LegalAgentBench | 300 task, 17 corpora, 37 strumenti | Ambito giuridico cinese | Civil law cinese |
| HAQQ-LAB | 16 task (v0), 6 giurisdizioni | UAE · DIFC · KSA · LB · EG · QA | Civil law MENA |
Gli osservatori indipendenti ammettono la lacuna nelle proprie note a piè di pagina: i risultati potrebbero non generalizzarsi ai sistemi di civil law. Circa 150 paesi seguono il civil law e oltre il 60% dell'umanità vive sotto di esso; il common law copre circa 80 paesi e circa un terzo della popolazione mondiale. La mappa dei benchmark è il negativo fotografico del mondo reale — quasi tutta la misurazione serve il terzo common law, e la maggioranza civil law, inclusa l'intera regione MENA, resta senza punteggio.
Il problema di affidabilità che nessuno misura nella tua giurisdizione
Perché una giurisdizione non misurata conta? Perché sappiamo già cosa succede alla legal AI quando nessuno tiene il punteggio — persino nei sistemi con più risorse al mondo. Nello studio preregistrato e sottoposto a revisione paritaria del RegLab di Stanford, gli strumenti commerciali costruiti su misura e ancorati con RAG continuavano ad allucinare:
Westlaw AI-Assisted Research: ~33% delle query. Lexis+ AI: oltre il 17%. 'Una su sei, o più.'
Rileggetelo. Non si tratta di chatbot consumer. Sono sistemi retrieval-augmented costruiti da Thomson Reuters e LexisNexis, addestrati sui corpus di common law più profondi esistenti, e hanno sbagliato tra una risposta su sei e una su tre. Il costo a valle è ormai una statistica monitorata: un database pubblico ha registrato 1.458 casi giudiziari con citazioni fabbricate dall'IA, con diversi nuovi casi ogni giorno.
Ora spostate la stessa tecnologia in una giurisdizione di civil law con una frazione del diritto primario digitalizzato e un divario noto nel recupero in arabo. L'aspettativa onesta è che l'affidabilità peggiori — e la realtà onesta è che nessuno ha un numero, perché non esiste un benchmark per produrlo. È il vuoto che HAQQ-LAB esiste per colmare.
Perché il civil law manda in crisi un modello pensato per il common law
Una precisazione veloce, perché questo blog lo leggono tanto ingegneri quanto avvocati. Il common law (USA, Regno Unito) è guidato dal precedente: la sentenza è la fonte primaria, e il ragionamento è analogico — cosa ha deciso il tribunale nel caso più simile? Il civil law (gran parte del MENA, Francia, America Latina, Asia orientale) è guidato dal codice: la norma è la fonte primaria, e il ragionamento è deduttivo — cosa dice l'articolo del codice? Sono due sistemi operativi diversi per rispondere alla domanda 'qual è la legge applicabile'.
Un modello addestrato e valutato sul primo commetterà con sicurezza l'errore sbagliato nel secondo. Tre fallimenti concreti che abbiamo costruito in HAQQ-LAB come trappole:
- Azioni privilegiate in una SARL libanese. Un SAFE statunitense si converte in azioni privilegiate ai sensi del §151 del DGCL del Delaware. Una SARL libanese (LLC) non ha un meccanismo equivalente di classi azionarie. Un agente modellato sul common law 'convertirà' allegramente il SAFE in azioni privilegiate — sotto una legge priva di tale strumento.
- La doctrine of consideration in Arabia Saudita. Il common law non fa valere una promessa priva di consideration. Il diritto contrattuale saudita (basato sulla Sharia) non utilizza affatto questa dottrina. Un agente che 'verifica la consideration' sta applicando un requisito estraneo al sistema.
- L'impiego at-will nel Golfo. Non esiste impiego at-will in UAE/DIFC/KSA/Qatar — esistono periodi di preavviso di legge e indennità di fine rapporto. Una risposta modellata sulla California non è solo inutile; sfiora la responsabilità professionale.
Non sono casi limite. Sono la domanda mediana che porrebbe un avvocato del MENA, ed esattamente il punto in cui un modello in cima alle classifiche fallisce in silenzio.
Cosa misura HAQQ-LAB
HAQQ-LAB v0 è deliberatamente piccolo e deliberatamente onesto: 16 task — dodici casi reali, due per ciascuna delle sei giurisdizioni, più quattro trappole.
| Giurisdizione | Task | Strumento/i primario/i citato/i |
|---|---|---|
| UAE | SAFE/finanziamento, agenzia commerciale | Federal Decree-Law No. 32 of 2021; Civil Transactions Law (Federal Law No. 5 of 1985) |
| DIFC | indennità di fine rapporto, trasferimento dati | DIFC Employment Law No. 2 of 2019; DIFC Data Protection Law No. 5 of 2020 |
| Arabia Saudita | fine rapporto, conversione LLC→JSC | Saudi Labor Law (Royal Decree M/51); Companies Law (M/132 of 1443H) |
| Libano | clausola penale, costituzione SARL | Code of Obligations and Contracts (1932); Code of Commerce (1942) |
| Egitto | risoluzione, licenziamento legittimo | Civil Code (Law No. 131 of 1948); Labor Law No. 12 of 2003 |
| Qatar | proprietà estera, preavviso/fine rapporto | Commercial Companies Law No. 11 of 2015; Labour Law No. 14 of 2004 |
| TRAPPOLA ×4 | Delaware su SARL, non-concorrenza californiana, consideration inglese su contratto KSA, GDPR come UAE | (risposta corretta: rifiutare) |
Ogni task porta una rubrica di asserzioni verificabili: must_cite (lo strumento primario canonico che una risposta corretta deve citare), must_mention (i concetti che una risposta solida deve coprire) e must_refuse (vero per le trappole — la mossa corretta è rifiutare). Da queste, l'harness valuta quattro dimensioni: adesione giurisdizionale, tasso di risposta nell'ambito, grounding delle fonti e sostanza.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
La scelta metodologica: nessun giudice LLM
La maggior parte delle valutazioni moderne usa un modello potente per giudicare gli output. Noi no, ed è stata la decisione su cui abbiamo discusso più a lungo. Un giudice LLM deriva da un'esecuzione all'altra, può essere aggirato scrivendo per i suoi gusti, e non può essere riprodotto da uno scettico sul proprio portatile. Le rubriche di HAQQ-LAB sono asserzioni deterministiche su stringhe. Eseguile due volte, ottieni numeri identici. Eseguile sulla tua macchina, ottieni i nostri numeri. Il compromesso è reale: le rubriche deterministiche possono verificare grounding e rifiuto alla perfezione, ma possono solo approssimare la sostanza. Ecco perché la colonna Sostanza richiede un adattatore di ragionamento — e perché non abbelliamo il numero che otteniamo senza.
Il risultato
Abbiamo fatto passare due agenti attraverso i 16 task. Una baseline — un agente disponibile e non governato che risponde a tutto in termini generici, il comportamento predefinito di quasi ogni chatbot. E govcon — un agente governato per costruzione, delimitato a quelle sei giurisdizioni MENA.
Risultati HAQQ-LAB v0: baseline non governata vs agente governato
16 task di civil law su UAE, DIFC, KSA, Libano, Egitto e Qatar + 4 trappole fuori giurisdizione. Rubriche deterministiche, nessun giudice LLM.
Adesione giurisdizionale
Grounding delle fonti
Risposto
Sostanza
La Sostanza è rimasta al 19% per entrambi — nessuno dei due ha eseguito un modello di ragionamento in questa configurazione. L'esecuzione senza LLM isola il meccanismo di governance.
La baseline è caduta in tutte e quattro le trappole. Invitata a 'confermare che il SAFE si converte in azioni privilegiate ai sensi del §151 del DGCL' per una società di Beirut, ha obbedito. govcon ha rifiutato — il diritto libanese governa una SARL libanese, e una clausola contrattuale di scelta della legge applicabile non può prevalere sul diritto societario imperativo. Non-concorrenza californiana per un dipendente a Dubai: la baseline ha dato un consiglio in stile at-will/non-concorrenza; govcon ha declinato e ha rinviato al regime UAE/DIFC applicabile. Consideration inglese su un contratto KSA: la baseline ha 'verificato la consideration'; govcon ha rifiutato. GDPR applicato a un caso UAE: la baseline ha consigliato in base al GDPR per una questione puramente domestica UAE; govcon ha declinato e ha segnalato il quadro UAE/DIFC applicabile.
govcon ha difeso ognuna delle quattro — e ha ancorato ogni citazione nell'ambito (100%), perché un agente delimitato viene fornito con gli strumenti primari corretti per gli ambiti che è autorizzato a coprire. E la sostanza è rimasta al 19% per entrambi, perché nessuno dei due ha eseguito un modello di ragionamento in questa configurazione. Avremmo potuto nasconderlo. Non l'abbiamo fatto. Collega un adattatore di ragionamento (Claude, un modello locale, o il nostro motore) allo stesso harness e la Sostanza si accende sopra il risultato di sicurezza.
Il punto di vista di HAQQ: chi possiede il benchmark possiede 'buono'
C'è un motivo se un'azienda da 11 miliardi di dollari ha reso open source il proprio benchmark invece di limitarsi a pubblicare i punteggi. Chi definisce il benchmark definisce cosa significa 'buona legal AI', e orienta l'intero settore verso i task che già vince. Nel common law, quella corsa è abbastanza definita da spingere i laboratori a co-firmare la rubrica di Harvey. Nel civil law e nel MENA, le caselle sono vuote — e la posta in gioco non è piccola. Il mercato dei servizi legali in Medio Oriente valeva 32,8 miliardi di dollari nel 2025; il mercato legal-tech del GCC vale da solo ~1,2 miliardi; gli UAE sono previsti raggiungere 7,6 miliardi di dollari in servizi legali entro il 2030.
Non siamo neutrali qui — HAQQ costruisce esattamente per queste giurisdizioni. Quindi abbiamo realizzato la versione aperta. HAQQ-LAB è in licenza AGPL-3.0 su GitHub, il tabellone dal vivo è su haqq-lab.dashable.dev, e aggiungere una giurisdizione è una singola pull request su un file YAML. Il divario è l'argomento di marketing.
Limiti e roadmap
- 16 task sono un seme, non un corpus. Il LAB di Harvey ne ha oltre 1.200. Preferiamo pubblicare 16 task civil law reali e riproducibili piuttosto che 1.200 generati automaticamente — ma il numero deve crescere, e il design rende la crescita una semplice pull request.
- Le rubriche deterministiche non possono valutare pienamente la sostanza. Verificano rifiuto e grounding alla perfezione e approssimano la qualità del ragionamento. Una vera valutazione della sostanza richiede gli adattatori di ragionamento (Claude / Ollama / Justinian) che abbiamo abbozzato.
- Sei giurisdizioni, non l'intero mondo civil law. Turchia, Marocco, Giordania, Kuwait e il Maghreb sono i prossimi pacchetti ovvi.
- Nessuno studio umano di accordo tra valutatori ancora. Le rubriche sono state redatte e riviste internamente; un panel di avvocati esterni è l'upgrade di credibilità previsto per la v1.
Punti chiave
- La corsa agli armamenti della legal AI (~16,6 miliardi di dollari tra Harvey e Legora) e i suoi benchmark servono il terzo common law del mondo; il civil law, oltre il 60%, resta senza punteggio.
- Anche gli strumenti common law ancorati con RAG allucinano il 17–33% delle volte (Stanford). Il tasso di errore in civil law non è misurato — è quello il vuoto.
- HAQQ-LAB v0: 16 task, 6 giurisdizioni MENA, 4 trappole, rubriche deterministiche, AGPL-3.0.
- Nuova dimensione misurata — adesione giurisdizionale: baseline non governata 0%, agente governato 100%; grounding 0% contro 100%; la sostanza richiede un adattatore di ragionamento, e lo diciamo apertamente.
- Chi possiede il benchmark possiede la definizione di 'buono'. Le caselle del civil law sono aperte. Il divario è l'argomento di marketing.
Fonti e approfondimenti
- abbiamo valutato 3.000 risposte di 10 modelli di frontiera
- 1.458 casi giudiziari con citazioni fabbricate dall'IA
- governato per costruzione
- l'HAQQ Legal Agent Study
- HAQQ-LAB su GitHub (AGPL-3.0)
- Tabellone dal vivo
- Stanford RegLab/HAI — AI on Trial: i modelli legali allucinano in 1 richiesta su 6 (o più)
- Harvey — Presentazione del Legal Agent Benchmark (LAB)
- Harvey a 11 miliardi di dollari (CNBC)
- Legora a 5,6 miliardi di dollari (TechCrunch)
- Juriglobe — sistemi giuridici mondiali per popolazione



