In breve — 300 attività legali commerciali e transfrontaliere impegnative, 10 modelli di frontiera di 8 fornitori, 3.000 risposte valutate su una griglia a 35 punti a temperatura 0.
Claude Opus 4.8 vince nel complesso (30,02/35, primo su 130 attività). Grok 4.3 è la scelta più conveniente. GPT-5.5 è il più accurato (8,41/10, 3% di citazioni allucinate).
Il risultato principale: il 24% di tutte le 3.000 risposte citava o applicava una norma che non diceva ciò che il modello affermava. Nessun modello di frontiera è sicuro per fornire una risposta legale senza verifica.
Perché valutiamo l'IA legale in modo aperto
Cinque miliardi di persone non hanno accesso all'assistenza legale. È il problema che HAQQ esiste per risolvere. Ma sotto ogni demo di IA legale si nasconde una domanda portante: ci si può davvero fidare dell'output davanti a un cliente? "Un'IA ha risposto a una domanda legale" e "un'IA su cui potete mettere la vostra firma" sono affermazioni diverse, e la distanza tra le due è l'intero prodotto.
Dati chiave
- Il 24% delle 3.000 risposte valutate dei modelli di frontiera citava o applicava una norma che non diceva ciò che il modello affermava.
- Claude Opus 4.8 ha vinto 130 delle 300 attività legali (30,02/35 nel complesso); GPT-5.5 è stato il più accurato con 8,41/10 e un tasso di citazioni allucinate del 3%.
- Il costo per attività legale varia in un intervallo di 90 volte tra i modelli di frontiera: da 0,0009 $ (DeepSeek V3.2) a 0,082 $ (GPT-5.5).
Quindi lo misuriamo. Questo è il terzo articolo della nostra serie di benchmark: 100 domande legali reali di consumatori copriva l'angolo common law / consumatori. HAQQ-LAB è stato il primo benchmark pubblico di aderenza giurisdizionale in diritto civile / MENA. Questo report è il più ampio finora — lavoro legale commerciale e transfrontaliero, le pratiche che pagano le bollette di uno studio vero.
Se leggete una sola sezione, leggete Il divario di citazione. È il risultato che dovrebbe cambiare il modo in cui ogni studio acquista IA legale.
Come abbiamo condotto il benchmark
Abbiamo scritto 300 attività legali originali e specifiche — non quiz, ma pratiche reali con parti nominate, importi, date e norme applicabili. Redigere questa clausola. Rinegoziare questa disposizione. Strutturare questa transazione. Analizzare questo conflitto di leggi. Coprono 51 aree di pratica, oltre 20 giurisdizioni (il federale statunitense + Delaware / California / New York / Texas, Regno Unito, UE, EAU, DIFC, Arabia Saudita, Libano, Egitto, Qatar, Singapore, Australia, Canada, India, Brasile, Nigeria, OHADA, Giappone, Germania, Francia, Svizzera, oltre alle Convenzioni dell'Aja e le piazze offshore — Cayman, BVI, Bermuda).
Difficoltà fortemente ponderata: 114 attività di livello 5 su 5, 108 di livello 4, 22 di livello 3. Sono problemi multi-giurisdizione costruiti per mettere in crisi i modelli. Ogni attività è stata sottoposta a tutti e 10 i modelli con un prompt di sistema identico a temperatura 0, con un tetto di 6.000 token di output.
Ogni risposta è stata valutata su cinque dimensioni:
- Qualità (1-10) — profondità, completezza, utilizzabilità.
- Accuratezza (1-10) — correttezza giuridica; -5 per giurisprudenza allucinata, -3 per giurisdizione errata.
- Velocità (1-5) — latenza di risposta misurata, non giudicata.
- Stile (1-5) — struttura professionale.
- Creatività (1-5) — rischi non ovvi individuati, questioni transfrontaliere rilevate.
Qualità, Accuratezza, Stile e Creatività sono valutate da Claude Sonnet 4.6 secondo una griglia fissa. La velocità è calcolata dalla latenza reale. Il bias del giudice è trattato onestamente nelle avvertenze metodologiche — non lo nascondiamo.
La classifica: quale IA è migliore per il lavoro legale
Claude Opus 4.8 vince — nettamente
Opus si è classificato primo in 130 delle 300 attività — quasi il doppio di qualsiasi altro modello — e ha chiuso nella top 3 in 265 su 300. Registra la qualità più alta (8,9), un'accuratezza di alto livello (8,4), uno stile perfetto e la creatività più alta. La sua unica debolezza è la velocità: a 60,8 secondi è lento, e a 0,069 $/attività è tra i più costosi. Se volete la risposta singolarmente migliore e potete aspettare, è questo.
Grok 4.3: il 98% della qualità in 1/7 del tempo e 1/20 del costo
Il risultato più interessante della tabella. Grok 4.3 arriva secondo (28,98) ma lo fa in 8,8 secondi a 0,003 $ per attività — contro i 60,8 secondi e 0,069 $ di Opus. Per un prodotto rivolto al cliente dove latenza ed economia unitaria contano, Grok è probabilmente la scelta ingegneristica migliore. Vince persino più attività su ambiente/ESG, proprietà intellettuale e casi limite di chiunque altro.
GPT-5.5: il campione di accuratezza che raramente "vince"
GPT-5.5 registra l'accuratezza più alta del campo (8,41) e il tasso di allucinazione più basso (3%) — eppure si colloca quinto nel totale e ha vinto una sola attività in modo netto. Sbaglia raramente ed è raramente appariscente. È anche il più lento (134 secondi) e il più costoso (0,082 $). Per il lavoro legale, "raramente sbagliato" potrebbe essere la dimensione che conta di più, il che spiega esattamente perché un unico punteggio composito è fuorviante.
o3: il modello più divisivo del test
L'o3 di OpenAI ha vinto 66 attività in modo netto — la terza posizione tra tutti i modelli — eppure si colloca ottavo nel complesso, con un tasso di allucinazione del 32% e la seconda accuratezza più bassa (5,89). Quando o3 è buono è brillante; quando sbaglia, sbaglia con sicurezza, e costa caro. Questa variabilità è di per sé un rischio di acquisto.
Il fondo: Mistral e Llama
Mistral Large ha allucinato o applicato male le citazioni nel 64% delle sue risposte (accuratezza 4,74). Llama 4 Maverick è ultimo (20,01) — veloce ed economico, ma con qualità 4,8 e risposte piuttosto povere. "Citare norme reali" non è un problema risolto in fondo al mercato.
Il divario di citazione: il risultato più importante
Su tutte le 3.000 risposte, il 24% citava o applicava una norma che non diceva ciò che il modello affermava. Casi inventati. Norme applicate male. La dottrina giusta puntata sulla giurisdizione sbagliata. Non sono imprecisioni vaghe — il nostro giudice ha segnalato errori specifici e verificabili.
Un campione, uno per modello:
- Claude Opus 4.8: Computer Associates / Gemstar citati come precedenti di gun-jumping; caratterizzazioni non accurate.
- GPT-5.5: La citazione Hitz sembra fabbricata; 616 B.R. 374 non verificabile.
- Gemini 3.1 Pro: Citazione Halpin v. Riverstone non verificabile; probabile caso del Delaware allucinato.
- Grok 4.3: CBS v. Ziff-Davis citato in modo impreciso; il caso riguarda l'affidamento sulla garanzia, non la divulgazione.
- Claude Sonnet 4.6: Citazione Schrier non verificabile; il caso Biotronik è reale ma applicato male.
- o3: Le citazioni MSA Technology v Antec e GB Gas sembrano fabbricate o travisate.
- Qwen3.7 Max: Specht v. Netscape applicato male; non è un caso UCC di beni/servizi.
- DeepSeek V3.2: Citazione Crosstown Music non verificabile / applicata male.
- Mistral Large: Le citazioni N.Y. Gen. Oblig. Law §5-328 e UCC §2-515 sono dubbie / applicate male.
- Llama 4 Maverick: Caso Cavendish applicato male; non correlato alle clausole di prezzo.
Ogni singolo modello, inclusi i leader, ha fabbricato o applicato male una citazione da qualche parte nel test. Non è un problema riservato al fondo della classifica. Il modello più accurato dell'intero campo ha ottenuto solo 8,41 su 10. Il fondo è allarmante; il vertice non è sicuro.
Per contesto, gli strumenti incumbent soffrono dello stesso male. Test indipendenti hanno stimato il tasso di errore di Westlaw AI-Assisted Research a circa una richiesta su tre, e di Lexis+ AI sopra una su sei. Un modello più grande non ha risolto questo problema e, secondo i nostri dati, non lo risolverà.
Nessun modello vince in ogni area di pratica
Scomponete le 300 attività per area di pratica e il leader cambia continuamente. Su 51 aree di pratica: Claude Opus 4.8 ne vince 30, Grok 4.3 ne vince 13, o3 ne vince 6, e Gemini 3.1 Pro e Sonnet 4.6 ne vincono una ciascuno. In evidenza:
- Opus domina il nucleo dottrinale: fusioni e acquisizioni (30,6), conformità normativa (30,5), titoli, diritto penale d'impresa, fiscalità, diritto bancario, protezione dati, diritto del lavoro, commercio internazionale.
- Grok domina la creatività commerciale: proprietà intellettuale/tecnologia (30,2), ambiente/ESG (30,8), tutela dei consumatori, conformità/due diligence (31,4), casi limite.
- o3 spicca nelle operazioni transazionali: operazioni legali (31,1), titoli e finanza (30,9), appalti pubblici (31,1), immobiliare transfrontaliero.
- Gemini 3.1 Pro ottiene il miglior punteggio singolo in protezione della privacy e dei dati (31,4).
L'implicazione è diretta: un prodotto legale che scommette tutto su un solo modello lascia accuratezza sul tavolo in intere aree di pratica. L'architettura giusta instrada ogni attività verso il motore più probabile ad avere ragione — e poi verifica la risposta prima di consegnarla.
La tassa latenza-costo
La qualità non è gratuita, né uniforme. Il divario è enorme: GPT-5.5 (134 secondi) e Claude Sonnet 4.6 (102 secondi) sono circa 17 volte più lenti di Grok 4.3 (8,8 secondi) e Llama 4 Maverick (7,7 secondi). Il costo per attività varia in un intervallo di 90 volte, da DeepSeek V3.2 a 0,0009 $ a GPT-5.5 a 0,082 $. Grok 4.3 ottiene il secondo posto a 0,003 $.
Per un prodotto legale ad alto volume, il modello "migliore" su una classifica basata solo sulla qualità può essere la decisione commerciale sbagliata. L'obiettivo "qualità di Opus, alla velocità e al costo di Grok" è un problema di instradamento e verifica, non una scelta di modello singolo.
Vista per fornitore (unita a ogni run precedente)
Classifica dell'IA legale 2026: tutti i modelli ordinati per punteggio medio
Il run su 300 attività sopra valuta 10 modelli di frontiera su una griglia a 35 punti. Manteniamo anche una seconda classifica, più ampia: una valutazione su 50 attività con una griglia a 50 punti che aggiunge le piattaforme legali verticali che la maggior parte degli studi preseleziona davvero (Harvey, CoCounsel, LexisNexis +AI, Legora, Spellbook, Clio Duo) accanto ai modelli di frontiera. Quella tabella è pubblicata per intero sulla nostra pagina di confronto. Qui è ordinata per punteggio medio su tutte le 11 categorie di attività, così potete leggere un solo numero per modello invece di undici.
| Posizione | Modello | Media /50 | Media % |
|---|---|---|---|
| 1 | HAQQ (Justinian) | 47.5 | 95% |
| 2 | Claude Fable 5 | 44.0 | 88% |
| 3 | Claude Opus 4.7 | 42.1 | 84% |
| 4 | Mike OS | 41.8 | 84% |
| 5 | DeepSeek v4 Pro | 38.2 | 76% |
| 5 | Harvey | 38.2 | 76% |
| 7 | CoCounsel | 36.2 | 72% |
| 8 | Claude + plugin legali | 35.4 | 71% |
| 9 | Legora | 34.5 | 69% |
| 10 | ChatGPT 5.5 | 34.4 | 69% |
| 11 | LexisNexis +AI | 33.2 | 66% |
| 12 | Grok 4.3 | 31.4 | 63% |
| 13 | Gemini 3.1 Pro | 31.1 | 62% |
| 14 | Spellbook | 29.0 | 58% |
| 15 | Perplexity Sonar | 26.5 | 53% |
| 16 | Clio Duo | 25.2 | 50% |
| 17 | Meta Llama 4 | 23.1 | 46% |
| 18 | Mistral 3 | 21.2 | 42% |
| 19 | Qwen 3 Plus | 17.1 | 34% |
Questa classifica dice tre cose che il run su 300 attività non può dire. Primo, le piattaforme legali verticali si raggruppano a metà, non in testa: Harvey (38,2), CoCounsel (36,2), Legora (34,5) e LexisNexis +AI (33,2) si collocano tutte sotto i migliori modelli di frontiera grezzi. Ciò per cui un'azienda paga un fornitore di IA legale è il flusso di lavoro e l'involucro di sicurezza, non un punteggio più alto sulla risposta in sé. Secondo, DeepSeek v4 Pro è a pari merito esatto con Harvey a 38,2 — un modello a pesi aperti che eguaglia l'azienda di IA legale più valutata al mondo sulla qualità dell'output autonomo. Terzo, il divario è ampio: l'ultimo modello (Qwen 3 Plus, 34%) ottiene appena un terzo del punteggio di HAQQ (95%), quindi "quale IA legale" è una vera decisione, non un lancio di moneta.
Verifica di onestà: questa è la nostra classifica, e HAQQ vi arriva primo. Trattatela come dovreste trattare qualsiasi punteggio pubblicato da un fornitore — verificatelo. Ognuno dei 19 modelli e delle 11 categorie è sulla nostra pagina di confronto perché possiate controllare, e la griglia è descritta sotto. Notate anche cosa un punteggio per attività non può vedere: l'adozione a livello di studio, le certificazioni di sicurezza e i flussi di lavoro agentici su migliaia di documenti sono vere forze delle piattaforme verticali che questa tabella non misura.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Come valutiamo la classifica dell'IA legale
Due benchmark alimentano due classifiche, ed è importante sapere quale state leggendo.
- Il run su 300 attività di frontiera (il corpo di questo articolo): 300 attività commerciali e transfrontaliere originali, 10 modelli di frontiera, valutati su una griglia a 35 punti — Qualità, Accuratezza, Velocità, Stile, Creatività — a temperatura 0, con un tetto di 6.000 token di output. Ideale per "su quale modello grezzo dovrei costruire".
- Il run su 50 attività piattaforma (la tabella di classifica sopra, pubblicata su /compare-us): 11 categorie di attività valutate su una griglia a 50 punti che copre Sharia, norme, foro, clausole, rischio, allucinazione, formattazione, concisione, prontezza da partner e collegamento alle fonti. Aggiunge le piattaforme verticali che gli studi acquistano davvero. Ideale per "quale prodotto o modello dovrei preselezionare".
Entrambi condividono le stesse regole di casa. Prompt identici per ogni modello. Una griglia fissa e scritta invece di impressioni. Dati pubblicati perché chiunque possa rieseguire il run e verificarci. Ed entrambi valutano la qualità della risposta autonoma — che è l'ambito giusto per una classifica, e l'ambito sbagliato per una decisione d'acquisto, perché non può vedere l'adozione, la postura di sicurezza, o il livello di verifica con cui un vero prodotto legale serio avvolge il modello.
Non siamo gli unici a tenere il punteggio, e non dovreste affidarvi a una sola classifica. Lo studio preregistrato del RegLab di Stanford ha rilevato che gli strumenti di ricerca incumbent allucinano spesso — Westlaw AI-Assisted Research a circa una richiesta su tre e Lexis+ AI sopra una su sei. Il valutatore indipendente Vals AI mantiene una classifica pubblica di IA legale che, a giugno 2026, colloca anche Claude Fable 5 in testa al suo benchmark di ragionamento giuridico (88,6%), con i modelli di frontiera che vi ottengono circa l'80% contro il 71% degli avvocati umani sulla ricerca legale. Griglie diverse, insiemi di attività diversi, stessa direzione: i modelli di frontiera sono solidi nel ragionamento e inaffidabili sulle citazioni, e il divario tra loro si sta riducendo.
Quale IA è migliore per il diritto nel 2026? Dipende da cosa pesate
Non esiste una sola "migliore IA legale", e qualsiasi classifica che pretenda il contrario sta vendendo qualcosa. Leggete le due tabelle insieme e la risposta si divide in base a cosa state ottimizzando:
- Migliore qualità di risposta complessiva: Claude Opus 4.8 ha guidato il run su 300 attività di frontiera (30,02/35, 130 attività vinte). Sulla classifica piattaforma, Claude Fable 5 è il modello non-HAQQ più solido (44,0/50).
- Più accurato / meno allucinazioni: GPT-5.5 — accuratezza più alta (8,41/10) e tasso di citazioni allucinate più basso (3%) nel run su 300 attività, pur "vincendo" raramente un'attività in modo netto.
- Miglior rapporto qualità-prezzo (velocità e costo): Grok 4.3 — secondo in qualità in 8,8 secondi e circa 0,003 $ per attività, contro i 60,8 secondi e 0,069 $ di Opus.
- Migliore piattaforma legale verticale: Harvey guida il suo gruppo di pari sul run a 50 punti (media 38,2), davanti a CoCounsel, Legora e LexisNexis +AI — ma ognuna di esse resta dietro i migliori modelli di frontiera grezzi sull'output autonomo.
- Migliore per lavoro MENA, arabo e di diritto civile: HAQQ (Justinian) è primo sulla classifica piattaforma (47,5/50) con arabo nativo e oltre 80 giurisdizioni; verificatelo contro il campo su /compare-us.
Il punto più profondo sopravvive a ogni rimescolamento della classifica: nessun modello singolo vince in ogni area di pratica, il 24% delle risposte di frontiera cita norme che non le sostengono, e la posizione in classifica è la parte più piccola di un vero prodotto legale. Instradamento, verifica delle citazioni e governance giurisdizionale sono ciò che trasforma un numero su un grafico in una risposta su cui potete mettere la vostra firma.
Raggruppando i modelli per marchio del fornitore e unendo questo run con ogni run precedente dello stesso benchmark commerciale (indice da 0 a 100, ponderato per numero di valutazioni):
Il vertice è un plotone, non un'incoronazione. Il fornitore che scegliete conta meno di cosa costruite intorno.
Una nota sull'integrità del benchmark
Il nostro primo passaggio limitava le risposte a 1.200 token. Questo ha falsato silenziosamente il risultato: i modelli di ragionamento esaurivano il budget "pensando" e restituivano risposte vuote, mentre i modelli prolissi venivano tagliati a metà frase e il giudice li penalizzava. Ce ne siamo accorti, abbiamo scartato il run, e lo abbiamo rieseguito uniformemente a 6.000 token. La maggior parte dei modelli ha guadagnato 1,5-2,5 punti — ma Mistral e Llama sono peggiorati con più margine, perché la lunghezza aggiuntiva ha esposto più citazioni sbagliate. I tetti di output sono un pollice invisibile sulla bilancia in molte classifiche pubbliche. La nostra è aperta perché possiate vedere esattamente dove si collocava.
Cosa dimostrano davvero 3.000 risposte valutate
Il livello di ragionamento è in gran parte risolto. I modelli di frontiera individuano i problemi, strutturano l'analisi, e redigono come un collaboratore capace. Ciò che non sanno ancora fare è essere affidabili: citare in modo verificabile, rifiutare domande fuori giurisdizione, formulare le riserve appropriate, e avere ragione allo stesso modo due volte.
Quel divario non si colma con un modello più grande. Si colma con un livello sopra:
- Instradamento — inviare ogni pratica al motore più probabile ad avere ragione.
- Verifica delle citazioni — nessun riferimento non verificabile raggiunge il cliente.
- Governance giurisdizionale — la risposta nella giurisdizione sbagliata viene esclusa a monte, non filtrata dopo.
Quel livello è il prodotto. Il modello non è la barriera all'ingresso. Lo è il verificatore. È ciò che costruiamo in HAQQ.
Avvertenze metodologiche — perché un benchmark che non si può verificare è marketing
- Un solo run, temperatura 0. Trattate le classifiche come più affidabili dei decimali; leggete Opus e Grok come co-leader, non come un fotofinish.
- Il giudice è un modello Claude (Sonnet 4.6). Una legittima domanda di preferenza per sé stesso — se non fosse che un modello non-Claude (Grok) è a pari merito in testa e GPT-5.5 registra l'accuratezza più alta, quindi evidentemente non valuta su un terreno favorevole di casa. Un secondo giudizio da un altro modello è il prossimo passo di rafforzamento.
- L'indice per fornitore mescola griglie tra più run ed è indicativo.
- Ogni prompt, ogni risposta grezza e il codice di valutazione sono pubblicati. Clonatelo e verificateci.
Punti chiave da ricordare
- Claude Opus 4.8 è il modello singolo più solido per il lavoro legale commerciale; GPT-5.5 è il più accurato; Grok 4.3 è il miglior rapporto qualità-prezzo.
- Il 24% delle risposte legali dei modelli di frontiera cita norme che non le sostengono — non è sicuro il vertice, non solo il fondo.
- Nessun modello vince in ogni area di pratica; l'instradamento batte la scommessa su un modello solo.
- Costo e latenza variano di 90 e 17 volte — il "vincitore" basato solo sulla qualità può essere la scelta commerciale sbagliata.
- Il livello difendibile è instradamento + verifica delle citazioni + governance giurisdizionale, non il modello di base.
Terzo capitolo della serie di benchmark HAQQ, insieme al nostro benchmark di domande legali di consumatori e al nostro benchmark di diritto civile HAQQ-LAB. Curiosi di sapere come HAQQ trasforma questi risultati in un prodotto su cui un avvocato può mettere la firma? Scoprite il motore Justinian.



