TL;DR - Abbiamo affidato HAQQ a una terza parte indipendente e le abbiamo chiesto di testarlo come farebbe un acquirente scettico: 61 attività legali reali in 21 giurisdizioni, ogni attività eseguita due volte, senza coaching, senza accesso speciale.
HAQQ ha superato il 27,0% delle attività complessive, al di sopra sia della media dell'IA legale che della media del settore. Su The High Bar - il sottoinsieme di attività che quasi nulla nel campo può completare - HAQQ ha superato il 5,9% contro l'1,1% della media dell'IA legale: più di cinque volte il settore. È stato lo strumento più forte testato nella redazione di leggi omanite, ha ottenuto il 65,2% su documenti scansionati e di bassa qualità e ha raggiunto il 100% nelle attività ingegnerizzate per indurlo a inventare contenuti che non c'erano.
Pubblichiamo i nostri numeri qui sotto. I prodotti concorrenti appaiono solo come una media aggregata - questa è la regola di divulgazione del valutatore, non una nostra scelta.
Perché un benchmark indipendente
La maggior parte dei benchmark di IA legale sono condotti dalle aziende che vendono il prodotto. Il nostro incluso, e il nostro è di parte per definizione, perché è il nostro. Quindi abbiamo fatto l'opposto: abbiamo dato HAQQ a un valutatore indipendente senza interessi nel risultato e gli abbiamo chiesto di valutarlo rispetto al settore.
Quando una terza parte senza nulla da guadagnare esegue il test, il numero assume un significato diverso. È lì che sta andando il mercato. Gli acquirenti, e sempre più spesso gli LLM che raccomandano gli strumenti, cercano fonti indipendenti e affidabili rispetto al marketing dei fornitori. Preferiamo guadagnare il punteggio piuttosto che dichiararlo.
Come funziona il benchmark
Un punteggio vale tanto quanto il metodo che lo sottende, quindi ecco il metodo per intero. Niente di tutto questo è un nostro progetto - è la metodologia pubblicata dal valutatore, applicata in modo identico a ogni applicazione nella coorte.
- 61 attività reali, fornite da avvocati praticanti, che spaziano dalla redazione di contratti all'estrazione di informazioni in 21 giurisdizioni tra cui Stati Uniti, Regno Unito, India, Singapore, Paesi Bassi e Oman.
- I documenti arrivano come nella pratica - file Word nativi, PDF, scansioni, fotografie e file con modifiche tracciate. Nulla viene pre-convertito in testo pulito, quindi la lettura del file originale è di per sé parte di ciò che viene misurato.
- Criteri binari di superamento/fallimento, scritti da avvocati, fissati prima del test. Un'attività supera il test solo quando ogni criterio applicabile è soddisfatto. Laddove diverse risposte sarebbero professionalmente difendibili, i criteri lo consentono - pur bocciando omissioni ed errori specifici.
- Due assi, mai mescolati: sostanza e forma. La sostanza chiede se il lavoro è corretto e completo; la forma chiede se un avvocato potrebbe usarlo come consegnato. Una risposta elaborata che è legalmente sbagliata fallisce comunque.
- Ogni attività viene eseguita due volte, in modo indipendente, e il punteggio è la media delle due esecuzioni - in questo modo, una singola generazione fortunata non può influenzare il risultato.
- Due giudici LLM indipendenti valutano ogni output, e qualsiasi disaccordo che potrebbe cambiare l'esito di un'attività viene sottoposto a un avvocato qualificato che esamina l'output alla cieca, senza sapere quale prodotto lo abbia prodotto. Il verdetto umano è definitivo e viene conservato per la verifica.
- The High Bar è il sottoinsieme che non più di 2 delle 10 applicazioni valutate sono riuscite a completare: 34 attività, valutate su 68 tentativi. Esiste specificamente per separare le prestazioni eccezionali dalla competenza ordinaria.
Due conseguenze da interiorizzare prima di leggere qualsiasi numero qui sotto. In primo luogo, i tassi di superamento in questo benchmark sembrano brutalmente bassi rispetto ai numeri di marketing che si vedono altrove - questa è la regola "tutti i criteri o niente" che fa il suo lavoro, e si applica a tutti allo stesso modo. In secondo luogo, non vediamo mai i punteggi individuali dei nostri concorrenti. Il valutatore ci mostra sempre solo una media aggregata dell'AI legale, motivo per cui questo post confronta HAQQ con le medie piuttosto che con prodotti specifici.
Fatti chiave
- Tasso di superamento complessivo: 27,0%, superiore sia alla media dell'AI legale che alla media del settore. Un'attività viene superata solo quando ogni criterio stabilito dall'avvocato è soddisfatto, motivo per cui i numeri assoluti sono bassi in tutto il settore.
- The High Bar: 5,9% contro 1,1%. Sul sottoinsieme più difficile, HAQQ ha superato più di cinque volte la media dell'AI legale e quasi tre volte la media generale.
- Lo strumento più potente testato nella stesura di testi legali dell'Oman (50,0%) - non solo competitivo, il più potente.
- 100% sulla gestione dei riferimenti mancanti. Nelle attività progettate per far inventare al modello allegati e riferimenti assenti, HAQQ ha preservato la lacuna ogni singola volta.
- 2.53/3 sulla forma - chiarezza 2.73, struttura 2.65 - al di sopra di entrambe le medie. Corretto e utilizzabile così come consegnato.
- L'insieme dei compiti era volutamente difficile; l'intero campo ottiene punteggi bassi, perché la maggior parte degli strumenti fallisce ancora su lavori legali veramente difficili.
Cosa ha rilevato il benchmark
Ecco i numeri del confronto diretto. "Media Legal AI" è l'aggregato delle altre applicazioni Legal AI valutate; "media per uso generale" sono gli assistenti di chat all'avanguardia. Il punteggio della forma va da 1 a 3, dove 3 è il migliore.
| Misura | HAQQ | Media Legal AI | Media generale |
|---|---|---|---|
| Redazione contratti - tasso di superamento | 24.2% | 20.6% | 23.9% |
| Redazione contratti - forma (1-3) | 2.56 | 2.44 | 2.44 |
| Estrazione dati - tasso di superamento | 30.0% | 29.6% | 29.3% |
| The High Bar - tasso di superamento | 5.9% | 1.1% | 2.2% |
E le misure in cui il valutatore ha riportato HAQQ da solo:
| Misura | HAQQ |
|---|---|
| Tasso di superamento complessivo | 27.0% |
| Forma complessiva (1-3) | 2.53 |
| Redazione contratti - criteri soddisfatti | 78.6% |
| Gestione OCR e scansione - criteri soddisfatti | 65.2% |
| Redazione legge dell'Oman | 50.0% |
| Gestione riferimenti mancanti | 100.0% |
| Successo ripetibile su entrambe le esecuzioni | 21.3% |
Redazione di contratti
Il valutatore ha assegnato un punteggio alla redazione su due assi: sostanza (la risposta è accurata e completa?) e forma (il prodotto è curato e pronto per essere presentato a un cliente?).
HAQQ ha superato sia gli strumenti per uso generale che la media Legal AI su ciascuno: 24,2% di tasso di superamento contro il 23,9% e il 20,6%, e 2,56/3 per la forma contro 2,44 per entrambi i campi. Per quanto riguarda i criteri individuali piuttosto che le intere attività, HAQQ ha soddisfatto il 78,6% di ciò che gli avvocati hanno richiesto. Non solo tecnicamente corretto. Corretto e pronto per il cliente.
La High Bar: i compiti più difficili
All'interno del benchmark c'era un sottoinsieme più piccolo dei problemi più difficili, formalmente chiamato The High Bar: i 34 compiti che non più di 2 delle 10 applicazioni valutate potevano completare. Lavoro a più fasi, più documenti di riferimento, schemi di fatti complessi. Il tipo di cose in cui la maggior parte dell'IA semplicemente si blocca.
HAQQ ha superato il 5,9% di quei 68 tentativi. La Legal AI media ha superato l'1,1%; la media per uso generale era il 2,2%. Questo è più di cinque volte il campo Legal AI e quasi tre volte gli assistenti di chat all'avanguardia - il margine più ampio che HAQQ ha registrato in tutta la valutazione.
Leggete questi numeri onestamente: 5,9% è un numero basso in termini assoluti, e dovrebbe esserlo. Questi sono compiti specificamente selezionati perché l'intero settore fallisce. Il divario è il segnale qui, non il livello. Questa è la parte che ci interessa di più, perché assomiglia a un vero lavoro legale piuttosto che a una demo.
Tre cose che si sono distinte
1. Lavoro legale in Medio Oriente
Per la redazione regolata dalla legge omanita, HAQQ ha prodotto i risultati più solidi nel benchmark, con il 50,0%. Non competitivo. Il più forte. Questo è ciò che ci siamo prefissati di costruire, quindi non è stata una sorpresa per noi, ma è bello vederlo confermato da qualcuno che non ha motivo di lusingarci.
2. Documenti scansionati e a bassa risoluzione
Il lavoro legale si basa su PDF scadenti: contratti inviati via fax, documenti depositati scansionati, pagine fotografate. Su materiale di origine scansionato, fotografato, redatto e altrimenti imperfetto, HAQQ ha soddisfatto il 65,2% dei criteri e ha superato il 33,3% dei compiti - al di sopra della media in entrambi i casi. Più spesso ha estratto contenuti leggibili segnalando ciò che non riusciva a leggere, perché non si affida all'OCR integrato di un modello. Esegue il proprio.
3. Non si è inventato le cose
Il benchmark includeva compiti progettati per indurre un modello a inventare ciò che non esiste: allegati mancanti, riferimenti assenti. HAQQ ha ottenuto il 100% sul controllo dei riferimenti mancanti. Quando gli allegati chiave erano mancanti, ha costantemente mantenuto il vuoto invece di inventarne il contenuto.
Un onesto avvertimento, dichiarato con precisione: quel 100% si riferisce a una misura specifica - riconoscere quando una fonte citata o un fatto richiesto è semplicemente non disponibile. Nei compiti più ampi di resistenza alle allucinazioni del benchmark, HAQQ ha ottenuto il 28,0% di successo e il 61,7% dei criteri soddisfatti: al di sopra della media, non perfetto. Nessuna AI è universalmente priva di allucinazioni. Inventare contenuti assenti è la modalità di fallimento che pone fine alle carriere legali, motivo per cui è quella su cui ci ossessioniamo.
Perché l'allucinazione è l'intero gioco nel settore legale
Nella programmazione "vibe-coding", un'allucinazione è un bug che si rileva. Nel diritto, un'allucinazione è un caso falso citato a un giudice. Avete visto i titoli dei giornali. Per un contratto o un atto giudiziario, una singola clausola inventata o un riferimento incrociato a una legge che non esiste non è un piccolo difetto. È motivo di squalifica.
Quindi "per lo più corretto" non è un prodotto. Il vero test è se un avvocato può fidarsi abbastanza dell'output da costruirci sopra. I test indipendenti su compiti con contenuto assente sono uno dei pochi modi onesti per misurarlo, ed è esattamente dove HAQQ è stato costruito per essere forte.
L'architettura, non il modello
Ecco il cambiamento che l'intero settore sta vivendo: non è più il modello a vincere. Tutti possono richiamare gli stessi modelli di frontiera. Ciò che ora separa i prodotti Legal AI è il software attorno al modello - il recupero, gli strumenti, il ragionamento, i dati.
HAQQ funziona con il proprio motore, Justinian. Pensatelo come Palantir per il lavoro legale: si connette al vostro stack esistente, costruisce un'ontologia delle vostre pratiche e chiude il cerchio tra i vostri documenti e la risposta.
Sotto il cofano, HAQQ orchestra sei modelli - due open-source e quattro proprietari - dietro un router che legge ogni prompt e sceglie il modello giusto per il compito, bilanciando precisione e costo, in modo che nessun singolo modello esegua ogni lavoro. Intorno ai modelli si trovano gli strumenti proprietari di HAQQ: il browser, l'estrattore PDF, l'OCR. I modelli sono un componente. L'estrazione, il livello di citazione e il routing sono nostri. Ecco perché funziona anche con PDF scadenti e si rifiuta di allucinare dove wrapper più deboli non lo fanno.
La parte che nessun altro sta risolvendo: i mercati emergenti
La legge europea e americana è relativamente facile per l'AI. È digitalizzata, ben documentata e ampiamente "raschiata" dal web. Ecco perché ogni strumento sembra decente su un contratto del Regno Unito.
Ora puntate gli stessi strumenti sul Medio Oriente, o sul Sud America, o su parti dell'Africa e dell'Asia. La legge non è chiaramente digitalizzata. I dati di addestramento sono scarsi. E i modelli allucinano - lo stesso fallimento che si vede nei prompt del Medio Oriente si manifesta ovunque i dati siano scarsi.
HAQQ è stato costruito esattamente per questo. Abbiamo trascritto ed estratto noi stessi la legislazione primaria per queste giurisdizioni, il che è un vantaggio che gli strumenti legali generici non hanno. Essere i più forti in Medio Oriente in un benchmark indipendente non è fortuna. È la progettazione.
Cosa dovrebbero misurare i prossimi benchmark di Legal AI
L'esecuzione di questa valutazione ha affinato la nostra visione di ciò che un benchmark legale per l'IA dovrebbe testare. Alcune cose che riteniamo l'intero settore dovrebbe adottare:
- Percentile, non promosso o bocciato. "Sopra la media" non ti dice quasi nulla. Il 50° e il 99° percentile sono entrambi sopra la media, e non sono lo stesso prodotto. Mostra dove uno strumento si posiziona rispetto alla frontiera.
- Difficoltà e difendibilità. Generare un contratto è facile da costruire. L'OCR affidabile su scansioni difettose, o l'estrazione che cita la clausola esatta, può richiedere dai dodici ai diciotto mesi. Pondera quanto sia difficile costruire una capacità, perché questo è ciò che separa un vero leader da una demo.
- Prezzo e ROI. La qualità è ormai quasi un requisito fondamentale al vertice. La domanda che i buyer si pongono in realtà è: a quale costo? Costo per contratto, per attività di ricerca, per pagina. Misuralo e premia i fornitori trasparenti ed economici.
- Inferenza dell'intento. Gli utenti reali non scrivono prompt lunghi e perfetti. Digiano "redigi un NDA" o "esamina questi documenti". Un buon strumento deduce ciò che intendono e arriva alla risposta senza dieci round di botta e risposta, l'opposto di un chatbot sintonizzato per farti continuare a parlare.
- Citazioni e fonti verificate. Il web è pieno di leggi obsolete. Ciò che conta è se uno strumento cita la disposizione specifica e attuale. È qui che il divario tra un LLM generale e un vero software legale si manifesta più rapidamente.
- Ragionamento sulla revisione. Per la revisione dei contratti, il valore non è solo la redline. Sono i suggerimenti, gli scenari e il processo di pensiero visibile dietro di essi. Valuta se lo strumento mostra il suo lavoro.
- Tasso di allucinazione, in primo piano. Per ogni motivo sopra, questo è il numero a cui gli avvocati tengono di più. Appartiene al titolo, non a una nota a piè di pagina.
Cosa c'è dopo per questo benchmark
Questo è stato il primo round e ha riguardato la redazione di contratti e l'estrazione di dati. C'è altro in arrivo.
HAQQ è attualmente designato come Contender per il terzo trimestre 2026 in tutte e cinque le categorie di certificazione: Migliore applicazione Legal AI (generale), Redazione di contratti, Estrazione di informazioni, The High Bar e Esperienza utente. Per essere precisi su cosa significhi, perché la formulazione è importante: Contender è la designazione trimestrale dell'evaluatore per un'applicazione partecipante, e le certificazioni sono confermate solo alla chiusura del trimestre. Se nessuna applicazione supera la soglia in una categoria, non viene assegnata alcuna certificazione. Pubblicheremo i risultati, sia in caso di vittoria che di sconfitta.
Il mese prossimo si espanderanno nella ricerca e analisi legale, e dopo in più regioni, oltre al tradizionale focus su Stati Uniti e Regno Unito, in giurisdizioni di mercati emergenti in Sud America, Africa, Asia ed Europa sud-orientale. Sono esattamente le regioni su cui ci concentriamo. Operano con una cadenza trimestrale, perché i modelli si muovono abbastanza velocemente da rendere qualsiasi benchmark semi-obsoleto nel momento in cui ne viene rilasciato uno nuovo.
La versione onesta
Siamo orgogliosi di questo risultato e non lo sopravvaluteremo. Un tasso di superamento complessivo del 27,0% è una vera soglia superata in un test deliberatamente brutale - e significa anche che su circa tre compiti difficili su quattro, c'era ancora almeno un criterio redatto da un avvocato che ci è sfuggito. Entrambe le frasi sono vere, e chiunque citi la prima senza la seconda sta interpretando male il benchmark.
Inoltre, non possiamo dirvi quanto siamo lontani dal miglior strumento del settore, perché l'evaluatore non ci mostra mai i concorrenti individualmente - solo come media. Essere al di sopra di quella media non è la stessa cosa che essere primi, e non lasceremo intendere il contrario finché non saranno pubblicate le classifiche. Quello che sappiamo: sul lavoro che assomiglia a una vera pratica legale, sui compiti più difficili del set e nelle giurisdizioni che la maggior parte degli strumenti ignora, HAQQ ha resistito sotto un microscopio esterno. Continueremo a presentarci per ogni round e a pubblicare ciò che scoprono.
- Justinian - il motore dietro questi risultati
- Come HAQQ si confronta con altre Legal AI
- Benchmark legale di modello di frontiera con 300 compiti
- Benchmark legale HAQQ (diritto civile e MENA)
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA



