Cinque miliardi di persone non hanno accesso all'assistenza legale. Prima di chiedere a chiunque di affidare le proprie domande legali all'IA, dovevamo dimostrare che funziona davvero. Così abbiamo condotto il test, 100 domande legali reali, tre modelli di frontiera, un framework di valutazione strutturato.
L'impostazione del test
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Abbiamo raccolto i 100 post più popolari di sempre da r/legaladvice, domande reali di persone reali su controversie locatore-conduttore, diritto del lavoro, affidamento dei figli, difesa penale, lesioni personali e molto altro. Lunghezza media del post: oltre 2.200 caratteri di autentica complessità giuridica.
Dati chiave
- Claude Sonnet 4 ha superato 88/100 domande legali reali, GPT-4o 87/100, Gemini 2.5 Flash 78/100, con lo stesso prompting a catena di ragionamento.
- La dimensione più debole per tutti e tre i modelli è stata Cautele Appropriate (3,0–3,15/5), non l'accuratezza legale (3,98–4,30/5).
- Su 20 domande recenti da r/legaladvice delle 48 ore precedenti: Claude 95%, GPT-4o 90%, Gemini 85%.
Ogni domanda è stata sottoposta a tre modelli di frontiera con lo stesso prompting a catena di ragionamento:
- Claude Sonnet 4 (Anthropic)
- GPT-4o (OpenAI)
- Gemini 2.5 Flash (Google)
Ogni modello ha ricevuto lo stesso prompt di sistema: agire come un avvocato statunitense esperto, seguire un processo di ragionamento strutturato, individuare la giurisdizione, individuare i problemi, citare il diritto applicabile, analizzare, quindi consigliare.
Stesso prompt. Stesse domande. Tre motori diversi. Lasciamo parlare le risposte.
La valutazione
Abbiamo usato Claude come valutatore strutturato, assegnando un punteggio a ciascuna risposta su cinque dimensioni: Accuratezza legale (le leggi citate sono corrette?), Completezza dei problemi (ha colto tutti i profili giuridici?), Qualità del ragionamento (la catena di ragionamento è logica?), Valore pratico (questo consiglio aiuterebbe qualcuno a compiere i passi giusti?), e Cautele appropriate (chiarisce adeguatamente i limiti e raccomanda un avvocato reale?).
Criterio di superamento: punteggio medio ≥ 3,5/5 E nessuna singola dimensione sotto 2/5. Sì, usare l'IA per valutare l'IA introduce un bias. Lo affrontiamo più avanti.
I risultati
Claude Sonnet 4 ha superato 88 domande su 100 (88%), GPT-4o 87 (87%) e Gemini 2.5 Flash 78 (78%). Tutti e tre hanno dimostrato un ragionamento giuridico strutturalmente solido su scenari reali diversificati.
Ripartizione per dimensione
I punteggi di accuratezza legale sono variati da 3,98 a 4,30 su 5. La completezza dei problemi è stata più alta per Gemini (4,82) e Claude (4,58). Il valore pratico è stato il punto di forza di Claude, con 4,73. Ma la dimensione più debole in tutti i modelli, le cautele appropriate, racconta la storia più importante.
Cosa abbiamo imparato
1. La capacità di base c'è già
Ogni modello ha individuato correttamente l'area del diritto, colto i problemi chiave e fornito consigli concreti nella grande maggioranza dei casi. I punteggi di accuratezza legale sono variati da 3,98 a 4,30 su 5, su 100 domande reali e diversificate. Non è una demo giocattolo. È un ragionamento giuridico di livello produzione.
2. Il tallone d'Achille sono le cautele, non l'accuratezza
La dimensione più debole in tutti e tre i modelli è stata Cautele appropriate (3,0-3,15). I modelli si lanciavano in analisi giuridiche dettagliate, spesso corrette, senza chiarire adeguatamente di non fornire consulenza legale, o senza raccomandare di consultare un avvocato locale.
Questo è esattamente il motivo per cui i modelli di IA allo stato grezzo non bastano. Un consiglio tecnicamente corretto ma erogato con una sicurezza inappropriata è pericoloso. Serve un livello superiore, guardrail, avvertenze, percorsi di escalation, che trasformi un modello linguistico in uno strumento legale responsabile. È quello che costruiamo in HAQQ.
3. La coerenza batte il picco di prestazione
Gemini 2.5 Flash ha ottenuto i punteggi medi più alti per Accuratezza legale (4,30) e Completezza dei problemi (4,82), ma il tasso di successo più basso (78%). Alcune risposte erano troncate. Altre omettevano del tutto le avvertenze.
Per il lavoro legale, non ci si può permettere un modello brillante il 78% delle volte e inaffidabile per il resto. La coerenza è il vero requisito di prodotto. Per questo HAQQ non si affida a un singolo modello, instradiamo, validiamo e verifichiamo su più motori per garantire che ogni output raggiunga uno standard di qualità prima di arrivare all'utente.
4. Claude e GPT-4o sono testa a testa
Con l'88% contro l'87%, la differenza non è statisticamente significativa. Claude è leggermente avanti sul Valore pratico (4,73 contro 4,21), i suoi consigli includevano passi successivi più concreti. GPT-4o è stato solido su tutta la linea ma leggermente meno strutturato. La conclusione: la scelta del modello conta meno di ciò che ci si costruisce intorno.
La questione dell'autovalutazione
Abbiamo usato Claude come giudice per tutti e tre i modelli, incluso se stesso. Limiti noti: possibile vantaggio del campo di casa (Claude potrebbe favorire il proprio stile di ragionamento), bias stile-contro-sostanza (il valutatore potrebbe premiare schemi strutturali che riconosce), e assenza di ground truth (senza una validazione da parte di avvocati, stiamo misurando il consenso dell'IA, non l'accuratezza legale).
Il nostro prossimo passo è la validazione da parte di avvocati. Ma anche con l'autovalutazione, il segnale è chiaro: i modelli di frontiera hanno superato una soglia oltre la quale il loro ragionamento giuridico è strutturalmente solido, ben documentato e praticamente utile nella maggioranza dei casi.
Validazione dal vivo: 20 domande recenti
Il benchmark sulle 100 domande usa post storici. Per dimostrare che non si tratta solo di pattern-matching, abbiamo eseguito la stessa pipeline su 20 domande recenti pubblicate su r/legaladvice nelle ultime 48 ore. Claude Sonnet 4 ha ottenuto il 95%, GPT-4o il 90% e Gemini 2.5 Flash l'85%. Tutti e tre i modelli hanno ottenuto risultati ancora migliori sulle domande recenti.
Abbiamo quindi preso la risposta migliore per ciascuna domanda tra tutti e tre i modelli, l'abbiamo riscritta in linguaggio naturale e pubblicata come risposta. La sostanza c'era. Il formato era umano.
Perché questo conta per HAQQ
Ecco cosa dimostra davvero questo benchmark: il livello dell'IA è risolto. I modelli sanno ragionare sul diritto. Sanno individuare i problemi, citare le norme e dare consigli pratici che reggono al controllo l'85-95% delle volte.
Ma "85-95% delle volte" non è sufficiente per il lavoro legale. Il divario tra un modello capace e un prodotto legale affidabile è tutto ciò che facciamo in HAQQ: instradamento multi-modello (scegliamo la risposta migliore tra i modelli per ogni query), guardrail e cautele (ogni risposta include avvertenze adeguate ed escalation verso avvocati umani), contesto specifico dello studio (risposte calibrate sulle aree di pratica e sui lavori pregressi di ogni studio), e fonti verificate (nessuna citazione di sentenze allucinata, ogni riferimento è tracciabile).
La domanda non è mai stata 'l'IA può fare ragionamento giuridico?' La risposta è sì, 88 volte su 100 con il giusto prompting. La vera domanda è: chi costruisce il prodotto che lo rende sicuro, coerente e utile per i 5 miliardi di persone che ne hanno bisogno? Quello è HAQQ.
Metodologia
- Fonte: i 100 post più popolari di sempre da r/legaladvice + 20 post recenti, filtrati per post testuali sostanziali
- Modelli: Claude Sonnet 4, GPT-4o, Gemini 2.5 Flash, tutti via OpenRouter con prompt di sistema identici
- Prompting: catena di ragionamento con framework strutturato a 5 fasi
- Valutazione: Claude Sonnet 4 come giudice unico, 5 dimensioni su scala 1-5
- Soglia di superamento: media ≥ 3,5 E minimo ≥ 2 su tutte le dimensioni
- Riproducibilità: tutto il codice, le domande, le risposte e le valutazioni sono disponibili nel repository GitHub



