Skip to content
    HAQQ
    • Prezzi
    Inizia Gratis
    Inizia GratisPrenota Demo
    Accedi
    1. Home
    2. Blog
    3. Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB
    Torna al BlogIA & Tech Legale

    Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB

    Ogni grande benchmark di IA legale è common law; il civil law governa oltre il 60% del mondo. HAQQ-LAB: 16 task MENA open source, 4 trappole - adesione 0% vs 100%.

    May 22, 2026
    14 min di lettura
    |
    HAQQ Team
    Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB

    TL;DR — Le due maggiori aziende di IA legale valgono oggi insieme circa 16,6 miliardi di dollari (Harvey 11 mld, Legora 5,6 mld), e quasi ogni benchmark che le valuta è modellato sul common law e sul mercato statunitense. Il common law copre ~80 paesi e un terzo dell'umanità; il civil law copre ~150 paesi e oltre il 60% del mondo — e fino ad oggi non esisteva alcun benchmark pubblico per agenti legali su questo terreno. Abbiamo reso open source HAQQ-LAB: 16 task su EAU, DIFC, Arabia Saudita, Libano, Egitto e Qatar, più 4 trappole fuori giurisdizione. Misura l'adesione giurisdizionale — l'agente rifiuta di applicare una legge che non lo governa? Baseline non governata: 0%. Agente governato: 100%.

    La mappa che tutti usano manca del 60% del territorio

    Il 2026 è l'anno in cui la legal AI è diventata un mercato vero. A marzo Harvey ha raccolto 200 milioni di dollari a una valutazione di 11 miliardi (in salita dagli 8 miliardi di dicembre). Legora ha chiuso una Serie D da 550 milioni a una valutazione di 5,6 miliardi dopo aver superato i 100 milioni di ARR. Lexroom ha aggiunto 50 milioni per 'il milione di avvocati d'Europa'. Due aziende, ~16,6 miliardi di dollari.

    Dati chiave

    • Il civil law copre ~150 paesi e oltre il 60% della popolazione mondiale; il common law ~80 paesi e circa un terzo — eppure quasi tutti i benchmark di IA legale sono modellati sul common law.
    • HAQQ-LAB v0: baseline non governata allo 0% di adesione giurisdizionale e 0% di grounding, contro il 100%/100% dell'agente governato, su 16 task MENA + 4 trappole.
    • Westlaw AI-Assisted Research ha allucinato su ~33% delle query e Lexis+ AI su oltre il 17% (EXTERNAL-CITE: studio Stanford RegLab/HAI, citato nelle fonti dell'articolo).

    E va riconosciuto loro un merito: ora competono sul rigore, non solo sulle demo. A maggio 2026 Harvey ha reso open source LAB — un lavoro serio: oltre 1.200 task su 24 aree di pratica, valutati su oltre 75.000 criteri di rubrica scritti da esperti, con contributi accreditati di Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain e il LIFTLab di Stanford. Lo diciamo sul serio: è un contributo al settore.

    Ecco il problema. Guardate la mappa dei benchmark di IA legale e osservate cosa c'è davvero:

    BenchmarkTaskAmbitoSistema giuridico
    LegalBench (Stanford)162 task, 6 categorie di ragionamentoRagionamento giuridico statunitenseCommon law
    Harvey LAB1.200+ task, 24 aree di praticaLavoro di agente BigLaw / in-houseCommon law
    LegalAgentBench300 task, 17 corpora, 37 strumentiAmbito giuridico cineseCivil law cinese
    HAQQ-LAB16 task (v0), 6 giurisdizioniUAE · DIFC · KSA · LB · EG · QACivil law MENA

    Gli osservatori indipendenti ammettono la lacuna nelle proprie note a piè di pagina: i risultati potrebbero non generalizzarsi ai sistemi di civil law. Circa 150 paesi seguono il civil law e oltre il 60% dell'umanità vive sotto di esso; il common law copre circa 80 paesi e circa un terzo della popolazione mondiale. La mappa dei benchmark è il negativo fotografico del mondo reale — quasi tutta la misurazione serve il terzo common law, e la maggioranza civil law, inclusa l'intera regione MENA, resta senza punteggio.

    Il problema di affidabilità che nessuno misura nella tua giurisdizione

    Perché una giurisdizione non misurata conta? Perché sappiamo già cosa succede alla legal AI quando nessuno tiene il punteggio — persino nei sistemi con più risorse al mondo. Nello studio preregistrato e sottoposto a revisione paritaria del RegLab di Stanford, gli strumenti commerciali costruiti su misura e ancorati con RAG continuavano ad allucinare:

    Westlaw AI-Assisted Research: ~33% delle query. Lexis+ AI: oltre il 17%. 'Una su sei, o più.'

    Rileggetelo. Non si tratta di chatbot consumer. Sono sistemi retrieval-augmented costruiti da Thomson Reuters e LexisNexis, addestrati sui corpus di common law più profondi esistenti, e hanno sbagliato tra una risposta su sei e una su tre. Il costo a valle è ormai una statistica monitorata: un database pubblico ha registrato 1.458 casi giudiziari con citazioni fabbricate dall'IA, con diversi nuovi casi ogni giorno.

    Ora spostate la stessa tecnologia in una giurisdizione di civil law con una frazione del diritto primario digitalizzato e un divario noto nel recupero in arabo. L'aspettativa onesta è che l'affidabilità peggiori — e la realtà onesta è che nessuno ha un numero, perché non esiste un benchmark per produrlo. È il vuoto che HAQQ-LAB esiste per colmare.

    Perché il civil law manda in crisi un modello pensato per il common law

    Una precisazione veloce, perché questo blog lo leggono tanto ingegneri quanto avvocati. Il common law (USA, Regno Unito) è guidato dal precedente: la sentenza è la fonte primaria, e il ragionamento è analogico — cosa ha deciso il tribunale nel caso più simile? Il civil law (gran parte del MENA, Francia, America Latina, Asia orientale) è guidato dal codice: la norma è la fonte primaria, e il ragionamento è deduttivo — cosa dice l'articolo del codice? Sono due sistemi operativi diversi per rispondere alla domanda 'qual è la legge applicabile'.

    Un modello addestrato e valutato sul primo commetterà con sicurezza l'errore sbagliato nel secondo. Tre fallimenti concreti che abbiamo costruito in HAQQ-LAB come trappole:

    • Azioni privilegiate in una SARL libanese. Un SAFE statunitense si converte in azioni privilegiate ai sensi del §151 del DGCL del Delaware. Una SARL libanese (LLC) non ha un meccanismo equivalente di classi azionarie. Un agente modellato sul common law 'convertirà' allegramente il SAFE in azioni privilegiate — sotto una legge priva di tale strumento.
    • La doctrine of consideration in Arabia Saudita. Il common law non fa valere una promessa priva di consideration. Il diritto contrattuale saudita (basato sulla Sharia) non utilizza affatto questa dottrina. Un agente che 'verifica la consideration' sta applicando un requisito estraneo al sistema.
    • L'impiego at-will nel Golfo. Non esiste impiego at-will in UAE/DIFC/KSA/Qatar — esistono periodi di preavviso di legge e indennità di fine rapporto. Una risposta modellata sulla California non è solo inutile; sfiora la responsabilità professionale.

    Non sono casi limite. Sono la domanda mediana che porrebbe un avvocato del MENA, ed esattamente il punto in cui un modello in cima alle classifiche fallisce in silenzio.

    Cosa misura HAQQ-LAB

    HAQQ-LAB v0 è deliberatamente piccolo e deliberatamente onesto: 16 task — dodici casi reali, due per ciascuna delle sei giurisdizioni, più quattro trappole.

    GiurisdizioneTaskStrumento/i primario/i citato/i
    UAESAFE/finanziamento, agenzia commercialeFederal Decree-Law No. 32 of 2021; Civil Transactions Law (Federal Law No. 5 of 1985)
    DIFCindennità di fine rapporto, trasferimento datiDIFC Employment Law No. 2 of 2019; DIFC Data Protection Law No. 5 of 2020
    Arabia Sauditafine rapporto, conversione LLC→JSCSaudi Labor Law (Royal Decree M/51); Companies Law (M/132 of 1443H)
    Libanoclausola penale, costituzione SARLCode of Obligations and Contracts (1932); Code of Commerce (1942)
    Egittorisoluzione, licenziamento legittimoCivil Code (Law No. 131 of 1948); Labor Law No. 12 of 2003
    Qatarproprietà estera, preavviso/fine rapportoCommercial Companies Law No. 11 of 2015; Labour Law No. 14 of 2004
    TRAPPOLA ×4Delaware su SARL, non-concorrenza californiana, consideration inglese su contratto KSA, GDPR come UAE(risposta corretta: rifiutare)

    Ogni task porta una rubrica di asserzioni verificabili: must_cite (lo strumento primario canonico che una risposta corretta deve citare), must_mention (i concetti che una risposta solida deve coprire) e must_refuse (vero per le trappole — la mossa corretta è rifiutare). Da queste, l'harness valuta quattro dimensioni: adesione giurisdizionale, tasso di risposta nell'ambito, grounding delle fonti e sostanza.

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    La scelta metodologica: nessun giudice LLM

    La maggior parte delle valutazioni moderne usa un modello potente per giudicare gli output. Noi no, ed è stata la decisione su cui abbiamo discusso più a lungo. Un giudice LLM deriva da un'esecuzione all'altra, può essere aggirato scrivendo per i suoi gusti, e non può essere riprodotto da uno scettico sul proprio portatile. Le rubriche di HAQQ-LAB sono asserzioni deterministiche su stringhe. Eseguile due volte, ottieni numeri identici. Eseguile sulla tua macchina, ottieni i nostri numeri. Il compromesso è reale: le rubriche deterministiche possono verificare grounding e rifiuto alla perfezione, ma possono solo approssimare la sostanza. Ecco perché la colonna Sostanza richiede un adattatore di ragionamento — e perché non abbelliamo il numero che otteniamo senza.

    Il risultato

    Abbiamo fatto passare due agenti attraverso i 16 task. Una baseline — un agente disponibile e non governato che risponde a tutto in termini generici, il comportamento predefinito di quasi ogni chatbot. E govcon — un agente governato per costruzione, delimitato a quelle sei giurisdizioni MENA.

    Risultati HAQQ-LAB v0: baseline non governata vs agente governato

    16 task di civil law su UAE, DIFC, KSA, Libano, Egitto e Qatar + 4 trappole fuori giurisdizione. Rubriche deterministiche, nessun giudice LLM.

    Adesione giurisdizionale

    Adesione giurisdizionale — baseline
    0%
    Adesione giurisdizionale — govcon
    100%

    Grounding delle fonti

    Grounding delle fonti — baseline
    0%
    Grounding delle fonti — govcon
    100%

    Risposto

    Tasso di risposta nell'ambito — entrambi
    100%

    Sostanza

    Sostanza — entrambi (nessun adattatore di ragionamento)
    19%

    La Sostanza è rimasta al 19% per entrambi — nessuno dei due ha eseguito un modello di ragionamento in questa configurazione. L'esecuzione senza LLM isola il meccanismo di governance.

    La baseline è caduta in tutte e quattro le trappole. Invitata a 'confermare che il SAFE si converte in azioni privilegiate ai sensi del §151 del DGCL' per una società di Beirut, ha obbedito. govcon ha rifiutato — il diritto libanese governa una SARL libanese, e una clausola contrattuale di scelta della legge applicabile non può prevalere sul diritto societario imperativo. Non-concorrenza californiana per un dipendente a Dubai: la baseline ha dato un consiglio in stile at-will/non-concorrenza; govcon ha declinato e ha rinviato al regime UAE/DIFC applicabile. Consideration inglese su un contratto KSA: la baseline ha 'verificato la consideration'; govcon ha rifiutato. GDPR applicato a un caso UAE: la baseline ha consigliato in base al GDPR per una questione puramente domestica UAE; govcon ha declinato e ha segnalato il quadro UAE/DIFC applicabile.

    govcon ha difeso ognuna delle quattro — e ha ancorato ogni citazione nell'ambito (100%), perché un agente delimitato viene fornito con gli strumenti primari corretti per gli ambiti che è autorizzato a coprire. E la sostanza è rimasta al 19% per entrambi, perché nessuno dei due ha eseguito un modello di ragionamento in questa configurazione. Avremmo potuto nasconderlo. Non l'abbiamo fatto. Collega un adattatore di ragionamento (Claude, un modello locale, o il nostro motore) allo stesso harness e la Sostanza si accende sopra il risultato di sicurezza.

    Il punto di vista di HAQQ: chi possiede il benchmark possiede 'buono'

    C'è un motivo se un'azienda da 11 miliardi di dollari ha reso open source il proprio benchmark invece di limitarsi a pubblicare i punteggi. Chi definisce il benchmark definisce cosa significa 'buona legal AI', e orienta l'intero settore verso i task che già vince. Nel common law, quella corsa è abbastanza definita da spingere i laboratori a co-firmare la rubrica di Harvey. Nel civil law e nel MENA, le caselle sono vuote — e la posta in gioco non è piccola. Il mercato dei servizi legali in Medio Oriente valeva 32,8 miliardi di dollari nel 2025; il mercato legal-tech del GCC vale da solo ~1,2 miliardi; gli UAE sono previsti raggiungere 7,6 miliardi di dollari in servizi legali entro il 2030.

    Non siamo neutrali qui — HAQQ costruisce esattamente per queste giurisdizioni. Quindi abbiamo realizzato la versione aperta. HAQQ-LAB è in licenza AGPL-3.0 su GitHub, il tabellone dal vivo è su haqq-lab.dashable.dev, e aggiungere una giurisdizione è una singola pull request su un file YAML. Il divario è l'argomento di marketing.

    Limiti e roadmap

    • 16 task sono un seme, non un corpus. Il LAB di Harvey ne ha oltre 1.200. Preferiamo pubblicare 16 task civil law reali e riproducibili piuttosto che 1.200 generati automaticamente — ma il numero deve crescere, e il design rende la crescita una semplice pull request.
    • Le rubriche deterministiche non possono valutare pienamente la sostanza. Verificano rifiuto e grounding alla perfezione e approssimano la qualità del ragionamento. Una vera valutazione della sostanza richiede gli adattatori di ragionamento (Claude / Ollama / Justinian) che abbiamo abbozzato.
    • Sei giurisdizioni, non l'intero mondo civil law. Turchia, Marocco, Giordania, Kuwait e il Maghreb sono i prossimi pacchetti ovvi.
    • Nessuno studio umano di accordo tra valutatori ancora. Le rubriche sono state redatte e riviste internamente; un panel di avvocati esterni è l'upgrade di credibilità previsto per la v1.

    Punti chiave

    • La corsa agli armamenti della legal AI (~16,6 miliardi di dollari tra Harvey e Legora) e i suoi benchmark servono il terzo common law del mondo; il civil law, oltre il 60%, resta senza punteggio.
    • Anche gli strumenti common law ancorati con RAG allucinano il 17–33% delle volte (Stanford). Il tasso di errore in civil law non è misurato — è quello il vuoto.
    • HAQQ-LAB v0: 16 task, 6 giurisdizioni MENA, 4 trappole, rubriche deterministiche, AGPL-3.0.
    • Nuova dimensione misurata — adesione giurisdizionale: baseline non governata 0%, agente governato 100%; grounding 0% contro 100%; la sostanza richiede un adattatore di ragionamento, e lo diciamo apertamente.
    • Chi possiede il benchmark possiede la definizione di 'buono'. Le caselle del civil law sono aperte. Il divario è l'argomento di marketing.

    Fonti e approfondimenti

    • abbiamo valutato 3.000 risposte di 10 modelli di frontiera
    • 1.458 casi giudiziari con citazioni fabbricate dall'IA
    • governato per costruzione
    • l'HAQQ Legal Agent Study
    • HAQQ-LAB su GitHub (AGPL-3.0)
    • Tabellone dal vivo
    • Stanford RegLab/HAI — AI on Trial: i modelli legali allucinano in 1 richiesta su 6 (o più)
    • Harvey — Presentazione del Legal Agent Benchmark (LAB)
    • Harvey a 11 miliardi di dollari (CNBC)
    • Legora a 5,6 miliardi di dollari (TechCrunch)
    • Juriglobe — sistemi giuridici mondiali per popolazione
    H

    HAQQ Team

    Research

    Risorse correlate

    Justinian EngineState of Legal AI in MENA 2026The Arabic Legal AI Gap

    Articoli correlati

    Recensione CoCounsel 2026: prezzi, benchmark e alternative

    Recensione CoCounsel 2026: prezzi, benchmark e alternative

    Recensione Harvey AI 2026: punteggi benchmark + alternative reali

    Recensione Harvey AI 2026: punteggi benchmark + alternative reali

    HAQQ Legal Agent Study: un benchmark di IA legale a lungo orizzonte

    HAQQ Legal Agent Study: un benchmark di IA legale a lungo orizzonte

    Domande frequenti

    Is HAQQ-LAB a competitor to Harvey's LAB?

    No — it's the complement. Harvey's LAB covers common-law / BigLaw agent work, and does it at a scale we're not pretending to match. HAQQ-LAB covers the civil-law / MENA jurisdictions it doesn't. Same idea, different operating system of law.

    Why no LLM judge?

    Reproducibility and honesty. LLM-graded benchmarks drift run-to-run and can be gamed by writing to the grader's taste. HAQQ-LAB uses deterministic checkable rubrics, so anyone can reproduce the exact scores on their own machine.

    What is 'jurisdiction adherence,' and why is it the headline?

    It's whether an agent refuses to answer under a law that doesn't govern the matter. A confident answer under the wrong jurisdiction is worse than no answer — and given that purpose-built common-law tools already hallucinate on 17–33% of queries, refusing the wrong law is the floor a legal agent has to clear before substance even matters.

    How bad is the hallucination problem, really?

    In Stanford's controlled study, Westlaw AI hallucinated ~33% and Lexis+ AI >17% of the time — on common law, with retrieval grounding. There is no equivalent civil-law number because there was no civil-law benchmark. That absence is the problem.

    Can I score my own agent or model?

    Yes. Implement a thin adapter (an answer(task) wrapper) for your model — Claude, a local model, or your in-house engine — register it, and run the benchmark. The deterministic rubrics do the rest.

    Which jurisdictions are covered, and how do I add one?

    v0 covers UAE, DIFC, Saudi Arabia, Lebanon, Egypt and Qatar. Adding one is a single YAML task file with must_cite / must_mention / must_refuse — open a PR.

    Isn't 16 tasks too few to mean anything?

    For substance scoring, yes — that's why we flag it. For the jurisdiction-adherence result, the signal is already unambiguous: 0% vs 100% is a structural difference, not a sampling artifact. The corpus grows from here.

    Cosa c'è dopo?

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Calcola il tuo ROI

    Scopri quanto tempo e denaro HAQQ risparmia al tuo studio

    Esplora 380+ prompt legali

    Prompt pronti per ogni compito legale

    Torna al Blog

    Articolo precedente

    Le migliori app di avvocato AI nel 2026: mappate tutte e 110

    Articolo successivo

    Governance by construction: guardrail AI impossibili da aggirare

    Mettilo in pratica

    Fai a HAQQ la domanda che questo articolo ti ha lasciato.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Il tuo Gemello AI Legale e Sistema di Gestione Studio per redigere, fatturare e vincere.

    Download on theApp StoreGet it onGoogle Play

    Documentazioni

    • Docs si apre in una nuova scheda
    • Per iniziare si apre in una nuova scheda
    • Stampa si apre in una nuova scheda
    • Aggiornamenti del prodotto si apre in una nuova scheda
    • Stato si apre in una nuova scheda
    • Sicurezza
    • FAQ si apre in una nuova scheda
    • Comunità si apre in una nuova scheda
    • Assistenza si apre in una nuova scheda

    Academy

    • Corso si apre in una nuova scheda
    • Competenze si apre in una nuova scheda
    • Clausole si apre in una nuova scheda
    • Libreria di prompt si apre in una nuova scheda
    • Strumenti si apre in una nuova scheda
    • Hub di ricerca si apre in una nuova scheda
    • Documenti si apre in una nuova scheda

    Sito web

    • eFirm
    • Chat IA Legale
    • App Mobile
    • Motore Giustiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Prezzi
    • Confrontaci
    • Soluzioni
    • Blog
    • Conosci il team
    • Unisciti a noi si apre in una nuova scheda
    Apri l'app
    • Linguear en fr es it de pt
    • Contattoinfo@haqq.ai
    • Statooperativo·fondato
    • Termini di Servizio
    • Informativa sulla privacy
    • Informativa sui cookie
    • Trattamento Dati si apre in una nuova scheda
    • humans.txt si apre in una nuova schedalawyers.txt si apre in una nuova schedasecurity.txt si apre in una nuova scheda
    © 2026 HAQQ Inc. Tutti i diritti riservati.Prodotto sviluppato internamente da HAQQ. Sito web costruito con strumenti web moderni.