In breve — Abbiamo valutato 19 strumenti di IA legale e modelli di frontiera con la stessa griglia a 50 punti su 11 categorie di attività. HAQQ è al primo posto (media 47,5/50). Siamo noi ad aver costruito HAQQ, e siamo noi ad aver costruito il benchmark: prendete quindi questa classifica con le pinze. La differenza tra questa lista e ogni altra classifica dei "migliori strumenti di IA legale": ogni punteggio, ogni categoria e i prompt di test sono pubblicati, quindi potete verificarci.
Cercate "migliori strumenti di IA legale 2026" e leggete i primi dieci risultati. Quasi tutti sono scritti da un fornitore, e quasi tutti classificano quel fornitore al primo posto. Nessun punteggio, nessuna griglia di valutazione, nessun modo di verificare alcunché. Solo aggettivi disposti in ordine lusinghiero.
Questa lista commette lo stesso peccato. HAQQ è al primo posto, ed è HAQQ ad averla scritta. La differenza è che questa classifica nasce da un benchmark con numeri pubblicati: 19 strumenti, 11 categorie di attività, una griglia a 50 punti, punteggi che potete consultare sulla nostra pagina di confronto e prompt che potete rieseguire dalla nostra libreria di prompt. Diffidate di noi, poi verificate.
Dati chiave: gli strumenti di IA legale nel 2026
- 19 strumenti testati con la stessa griglia a 50 punti su 11 categorie di attività legali; tutti i punteggi sono pubblicati.
- HAQQ ottiene una media di 47,5/50 e 49/50 nel test di punta a 10 dimensioni, il punteggio più alto tra i 19 modelli testati.
- Claude semplice (Fable 5, 44,0/50) supera quasi tutti i prodotti di IA legale dedicati, inclusi Harvey (38,2), CoCounsel (36,2), Legora (34,5) e Lexis+ AI (33,2).
- Mike OS, una piattaforma open source gratuita, raggiunge il livello degli 11 miliardi di dollari: 41,8/50, davanti a Harvey.
- Nessuno strumento è sicuro senza verifica: nel nostro benchmark separato su 300 attività, il 24% delle 3.000 risposte valutate citava o applicava una norma che non sosteneva quanto affermato.
Chi ha scritto questa classifica (da leggere prima della lista)
HAQQ Research ha condotto questo benchmark, e HAQQ arriva primo. È un conflitto d'interessi, punto. Non fingeremo il contrario, perché è esattamente ciò che fa il resto del settore.
Ecco cosa facciamo invece. La matrice completa dei punteggi per tutti i 19 strumenti su tutte le 11 categorie è online su haqq.ai/compare-us. I prompt di test provengono dalla nostra libreria di prompt pubblica. La griglia di punta valuta dieci dimensioni denominate: gestione della Sharia, citazione normativa, foro e giurisdizione, qualità delle clausole, identificazione dei rischi, allucinazione, formattazione, concisione, prontezza da partner e collegamento alle fonti. È un test interno, dichiarato come tale. Se una lista di un fornitore che state leggendo non vi offre almeno questo, chiedetevi perché.
Un'ultima dichiarazione: la griglia pesa molto la disciplina giurisdizionale e il collegamento alle fonti, perché è ciò che il lavoro dei nostri clienti richiede. Un benchmark somiglia sempre a chi lo scrive. Il nostro è costruito per il lavoro commerciale multi-giurisdizione a orientamento MENA, che è anche ciò per cui HAQQ è costruito. Il vantaggio di casa è strutturale. Ed è esattamente per questo che i numeri sono pubblici.
Come abbiamo classificato i migliori strumenti di IA legale
Ogni strumento ha eseguito gli stessi compiti in 11 categorie: una valutazione generica a 10 dimensioni, redazione contrattuale, ricerca legale, spiegazione del diritto, e sette tipi di documenti (contratto di lavoro, memorandum professionale, contratto di licenza, patto parasociale, contratto di consulenza, contratto commerciale, NDA). Ogni categoria è valutata su 50 punti. La classifica sottostante ordina per la media su tutte le 11 categorie.
Questo è il quarto capitolo della nostra serie di benchmark, dopo 300 attività commerciali su 10 modelli di frontiera, HAQQ-LAB, il primo benchmark pubblico di diritto civile e 100 domande legali reali di consumatori. Regola di casa costante: un benchmark che non si può verificare è marketing.
La classifica: i migliori strumenti di IA legale nel 2026
| Posizione | Strumento | Cos'è | Media /50 | Categoria più forte |
|---|---|---|---|---|
| 1 | HAQQ (Justinian) ★ | Piattaforma di IA legale, MENA + transfrontaliera | 47.5 | Generico + NDA (49) |
| 2 | Claude Fable 5 | Modello di frontiera (Anthropic) | 44.0 | Generico + NDA (45) |
| 3 | Claude Opus 4.7 | Modello di frontiera (Anthropic) | 42.1 | Ricerca, memorandum, NDA (43) |
| 4 | Mike OS | Piattaforma legale open source (gratuita) | 41.8 | Generico (44) |
| 5= | DeepSeek v4 Pro | Modello di frontiera | 38.2 | Generico (41) |
| 5= | Harvey | IA legale enterprise (valutazione 11 mld $) | 38.2 | Lavoro, patti parasociali, NDA (40) |
| 7 | CoCounsel | Assistente legale di Thomson Reuters | 36.2 | Memorandum professionale (39) |
| 8 | Claude + plugin legali | Modello di frontiera + livello di plugin legali | 35.4 | Generico (37) |
| 9 | Legora | Workspace di IA legale (valutazione 5,6 mld $) | 34.5 | NDA (37) |
| 10 | ChatGPT 5.5 | Modello di frontiera (OpenAI) | 34.4 | Spiegazione del diritto (42) |
| 11 | LexisNexis +AI | Incumbent della ricerca | 33.2 | Ricerca legale (41) |
| 12 | Grok 4.3 | Modello di frontiera (xAI) | 31.4 | Spiegazione del diritto (35) |
| 13 | Gemini 3.1 Pro | Modello di frontiera (Google) | 31.1 | Spiegazione del diritto (39) |
| 14 | Spellbook | Add-in Word per redazione contrattuale | 29.0 | Redazione contrattuale + NDA (34) |
| 15 | Perplexity Sonar | Assistente ancorato alla ricerca | 26.5 | Ricerca legale (38) |
| 16 | Clio Duo | Componente IA per gestione studio | 25.2 | NDA (27) |
| 17 | Meta Llama 4 | Modello a pesi aperti | 23.1 | Spiegazione del diritto (26) |
| 18 | Mistral 3 | Modello di frontiera | 21.2 | Spiegazione del diritto (24) |
| 19 | Qwen 3 Plus | Modello di frontiera | 17.1 | Spiegazione del diritto (19) |
#1 HAQQ — 47,5/50, e la voce di cui diffidare di più
HAQQ è primo in ognuna delle 11 categorie, con un picco di 49/50 sia nel test generico a 10 dimensioni sia nella redazione di NDA. La lettura onesta: questo è il nostro benchmark, ponderato verso il lavoro per cui HAQQ è stato costruito. Materie multi-giurisdizione, citazione a livello di norma, arabo e inglese, sistemi di diritto civile che la maggior parte degli strumenti tratta come un dettaglio secondario. Se il vostro lavoro si limita al diritto americano del Delaware, il divario tra HAQQ e il resto del campo sarà più stretto di quanto suggerisca questa tabella. Se il vostro lavoro attraversa i confini, non lo sarà.
A cosa serve: lavoro legale end-to-end dove la giurisdizione conta. Redazione, ricerca, revisione e contesto della pratica, con fonti cliccabili. Il motore sottostante è Justinian, che instrada ogni attività verso il miglior modello di frontiera e verifica l'output invece di fidarsi di un singolo modello. Questa scelta architetturale deriva direttamente dal risultato del benchmark qui sotto.
#2 e #3: Claude semplice batte quasi ogni prodotto di IA legale
Questo è il risultato che gli altri listicle non pubblicheranno. Una finestra di chat Claude nuda, senza alcun prodotto legale attorno, ottiene 44,0 (Fable 5) e 42,1 (Opus 4.7). Un punteggio superiore a Harvey, CoCounsel, Legora, Lexis+ AI e Spellbook. Gran parte del settore dell'IA legale vende un involucro che ottiene un punteggio inferiore al modello che avvolge.
Abbiamo scritto del perché questo accade in Claude non ha ucciso la legal tech: i prodotti aggiungono flusso di lavoro, permessi e livelli di dati, e molti di essi tassano silenziosamente il ragionamento del modello sottostante mentre lo fanno. L'involucro deve aggiungere verifica o governance giurisdizionale per giustificare il proprio prezzo. La maggior parte aggiunge solo un'interfaccia.
A cosa serve Claude semplice: analisi, prime bozze, spiegazione del diritto, ragionamento su documenti lunghi. A cosa non serve: un sistema di registrazione, un verificatore di citazioni, o uno strumento che sa quale giurisdizione regola la vostra pratica. Curiosamente, Claude con plugin legali ha ottenuto 35,4, sotto Claude semplice, nel nostro test. Più componenti non significa più accuratezza.
#4 Mike OS — il gratuito che mette in imbarazzo gli unicorni
Mike OS ottiene una media di 41,8/50. Un punteggio superiore a Harvey, che ha raccolto 200 milioni di dollari con una valutazione di 11 miliardi nel marzo 2026. Mike è gratuito. È una piattaforma legale open source che si autoospita con la propria chiave API, costruita dall'ex associate di Latham & Watkins William Chen, che dichiara di raggiungere la parità con Harvey e Legora, secondo Legal IT Insider e Artificial Lawyer (maggio 2026).
Abbiamo raccontato il momento Mike quando ha raggiunto la vetta di Hacker News nel nostro panorama del software legale open source. Il codice è grezzo e giovane, e l'autoospitalità è un lavoro vero che lo studio deve assumersi. Ma sulla qualità dell'output, il benchmark dice ciò che dice: il divario tra il gratuito-e-aperto e i prezzi a centinaia di dollari per postazione è più piccolo di quanto suggeriscano le fatture.
#5 - #11: le piattaforme legali enterprise
Harvey (38,2) è la scelta predefinita del BigLaw, a pari merito con DeepSeek v4 Pro nella nostra valutazione. I suoi risultati migliori sono nella redazione di documenti (40/50 su contratti di lavoro, patti parasociali e NDA). È costruito per gli acquisti enterprise: revisione di sicurezza, adozione a livello di studio, loghi prestigiosi. Se lo state valutando, abbiamo scritto una guida dedicata a Harvey, recensione e alternative.
CoCounsel (36,2) è la carta di Thomson Reuters, e il suo vantaggio è il dato: si appoggia a un secolo di giurisprudenza Westlaw, con circa un milione di utenti e un prezzo che abbiamo già riportato tra 220 e 500 dollari per utente al mese. Categoria migliore qui: memorandum professionali (39). Se la vostra pratica vive nella giurisprudenza statunitense e pagate già Westlaw, è la scelta con meno attrito in questa lista.
Legora (34,5) ha superato i 100 milioni di dollari di ARR e una valutazione di 5,6 miliardi nell'aprile 2026. È uno spazio di lavoro collaborativo, più forte nel nostro test sugli NDA (37). ChatGPT 5.5 (34,4) registra il miglior punteggio di spiegazione del diritto tra tutti gli strumenti non-HAQQ (42), il che corrisponde a come la maggior parte degli avvocati lo usa davvero: capire, non redigere. Lexis+ AI (33,2) è irregolare come ci si aspetterebbe: 41/50 in ricerca legale, il miglior punteggio di ricerca non di frontiera sul campo, e mediocre nella redazione.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
#12 - #16: specialisti con un buon asso nella manica
Spellbook (29,0) è un add-in di Word per la redazione contrattuale PMI, e i punteggi ne rispecchiano esattamente la forma: 34 in redazione contrattuale e NDA, 25 nel test generico. Se l'annotazione di contratti dentro Word è il vostro unico caso d'uso, questa posizione sottostima la sua utilità. Perplexity Sonar (26,5) ha lo stesso picco: 38 in ricerca legale, debole ovunque altrove. Clio Duo (25,2) è un componente IA aggiunto a una suite di gestione dello studio con 150.000 utenti; comprate Clio per la gestione dello studio, non per Duo.
Grok 4.3 (31,4) merita una nota di onestà. Nel nostro benchmark separato su 300 attività di frontiera era la scelta più conveniente dell'intero campo, e ha superato il CaseLaw v2 di Vals AI (79,31%) nel maggio 2026. Qui si colloca dodicesimo. Stesso modello, tre griglie di valutazione, tre verdetti. Non è una contraddizione, è proprio il punto: un benchmark misura la propria griglia, la nostra compresa.
#17 - #19: da non usare per il lavoro legale
Meta Llama 4 (23,1), Mistral 3 (21,2) e Qwen 3 Plus (17,1) sono al fondo. Coerente con il nostro test su 300 attività, dove Mistral Large ha allucinato o applicato male le citazioni nel 64% delle sue risposte. Sono modelli generalisti capaci. Per il lavoro legale, dove una citazione sbagliata espressa con sicurezza è un rischio professionale, non sono ancora nella conversazione.
Cosa non vi dicono i punteggi
- Questo è un test interno condotto da un fornitore. Dichiarato, pubblicato, verificabile, ma condotto da un fornitore. Pesatelo di conseguenza, e pesate a zero le liste di fornitori non dichiarate.
- La griglia ha una visione del mondo. Gestione della giurisdizione, sensibilità alla Sharia e collegamento alle fonti sono dimensioni valutate. Gli strumenti costruiti solo per il lavoro US/UK perdono punti su test per cui i loro creatori non hanno mai puntato.
- Le classifiche si muovono. Harvey, Legora e i laboratori di frontiera pubblicano aggiornamenti in continuazione. Trattate i livelli come più affidabili delle singole posizioni, e i pareggi (DeepSeek e Harvey a 38,2) esattamente come tali.
- Un punteggio composito nasconde i picchi. Lexis+ AI all'#11 resta lo strumento di ricerca da battere. Spellbook al #14 resta la scelta di redazione nativa Word. Fate corrispondere il picco al vostro carico di lavoro.
Il numero che conta più di qualsiasi classifica
Nel nostro benchmark su 300 attività di frontiera, il 24% delle 3.000 risposte valutate citava o applicava una norma che non diceva ciò che il modello affermava. Ogni modello, inclusi i leader, ha allucinato o applicato male almeno una citazione. Nemmeno gli incumbent sono immuni: test indipendenti hanno stimato il tasso di errore di Westlaw AI-Assisted Research a circa una richiesta su tre, e Lexis+ AI sopra una su sei, e un database pubblico ha registrato oltre 1.400 casi giudiziari con citazioni fabbricate dall'IA, come abbiamo riportato nell'approfondimento HAQQ-LAB.
Qualunque strumento scegliate da questa lista, scegliete prima il vostro processo di verifica. La classifica vi dice quale strumento fallisce meno. Nessuno di loro non fallisce mai.
Come scegliere il miglior strumento di IA per il vostro lavoro legale
- Lavoro transfrontaliero, MENA o in lingua araba: HAQQ. È il terreno che il benchmark premia perché è il terreno per cui l'abbiamo costruito.
- Ragionamento generale, bozze e spiegazione con budget limitato: Claude semplice. Batte la maggior parte dei prodotti legali a pagamento sull'output grezzo.
- Ricerca statunitense con citatori: Lexis+ AI o CoCounsel, specialmente se pagate già il database sottostante.
- Annotazione di contratti dentro Word: Spellbook.
- Requisiti di acquisto BigLaw: Harvey o Legora, e confrontateli con questa tabella durante il pilota.
- Budget zero, team tecnico: Mike OS, autoospitato con la vostra chiave API.
Punti chiave da ricordare
- Ogni lista dei "migliori strumenti di IA legale" è scritta da un fornitore. Pretendete punteggi pubblicati. Questa li ha; la maggior parte no.
- HAQQ guida con 47,5/50, con la riserva dichiarata che è il nostro benchmark, calibrato sul lavoro multi-giurisdizione.
- I modelli di frontiera grezzi superano la maggior parte dei prodotti legali. Se un involucro non aggiunge verifica o governance, sta sottraendo valore.
- Il gratuito è competitivo: l'open source Mike OS ha superato il leader di mercato da 11 miliardi di dollari.
- Nessuno strumento è sicuro senza verifica: il 24% delle risposte di frontiera citava norme che non le sostenevano. Comprate un processo di verifica, non un logo.
- Punteggi live del benchmark per tutti i 19 strumenti (pagina di confronto HAQQ)
- Miglior IA per il lavoro legale: 300 attività, 10 modelli di frontiera, 3.000 risposte valutate
- HAQQ-LAB: il benchmark di IA legale per il diritto civile
- Abbiamo testato l'IA su 100 domande legali reali
- Recensione Harvey AI e alternative
- Software legale open source nel 2026 (il momento Mike)
- Mike — piattaforma di IA legale open source
- Mike OSS: lo strumento di IA legale open source "cambia la trattativa" (Legal IT Insider, maggio 2026)
- Mike, la piattaforma di IA legale open source — intervista a Will Chen (Artificial Lawyer, maggio 2026)
- Legora raggiunge una valutazione di 5,6 miliardi di dollari (TechCrunch, aprile 2026)
Volete verificare la classifica invece di fidarvi? Ogni punteggio per categoria è online sulla pagina benchmark HAQQ, e i prompt di test sono nella libreria di prompt. Eseguiteli sulla vostra pila tecnologica. Se trovate uno strumento che ci supera sulle vostre pratiche, usatelo. È a questo che serve un benchmark.



