Cinque miliardi di persone non hanno accesso all'assistenza legale. Prima di chiedere a chiunque di affidare le proprie domande legali all'IA, dovevamo dimostrare che funziona davvero. Così abbiamo condotto il test — 100 domande legali reali, tre modelli di frontiera, un framework di valutazione strutturato.
L'impostazione del test
Abbiamo raccolto i 100 post più popolari di sempre da r/legaladvice — domande reali di persone reali su controversie locatore-conduttore, diritto del lavoro, affidamento dei figli, difesa penale, lesioni personali e molto altro. Lunghezza media del post: oltre 2.200 caratteri di autentica complessità giuridica.
Dati chiave
- Claude Sonnet 4 ha superato 88/100 domande legali reali, GPT-4o 87/100, Gemini 2.5 Flash 78/100, con lo stesso prompting a catena di ragionamento.
- La dimensione più debole per tutti e tre i modelli è stata Cautele Appropriate (3,0–3,15/5) — non l'accuratezza legale (3,98–4,30/5).
- Su 20 domande recenti da r/legaladvice delle 48 ore precedenti: Claude 95%, GPT-4o 90%, Gemini 85%.
Ogni domanda è stata sottoposta a tre modelli di frontiera con lo stesso prompting a catena di ragionamento:
- Claude Sonnet 4 (Anthropic)
- GPT-4o (OpenAI)
- Gemini 2.5 Flash (Google)
Ogni modello ha ricevuto lo stesso prompt di sistema: agire come un avvocato statunitense esperto, seguire un processo di ragionamento strutturato — individuare la giurisdizione, individuare i problemi, citare il diritto applicabile, analizzare, quindi consigliare.
Stesso prompt. Stesse domande. Tre motori diversi. Lasciamo parlare le risposte.
La valutazione
Abbiamo usato Claude come valutatore strutturato, assegnando un punteggio a ciascuna risposta su cinque dimensioni: Accuratezza legale (le leggi citate sono corrette?), Completezza dei problemi (ha colto tutti i profili giuridici?), Qualità del ragionamento (la catena di ragionamento è logica?), Valore pratico (questo consiglio aiuterebbe qualcuno a compiere i passi giusti?), e Cautele appropriate (chiarisce adeguatamente i limiti e raccomanda un avvocato reale?).
Criterio di superamento: punteggio medio ≥ 3,5/5 E nessuna singola dimensione sotto 2/5. Sì, usare l'IA per valutare l'IA introduce un bias. Lo affrontiamo più avanti.
I risultati
Claude Sonnet 4 ha superato 88 domande su 100 (88%), GPT-4o 87 (87%) e Gemini 2.5 Flash 78 (78%). Tutti e tre hanno dimostrato un ragionamento giuridico strutturalmente solido su scenari reali diversificati.
Ripartizione per dimensione
I punteggi di accuratezza legale sono variati da 3,98 a 4,30 su 5. La completezza dei problemi è stata più alta per Gemini (4,82) e Claude (4,58). Il valore pratico è stato il punto di forza di Claude, con 4,73. Ma la dimensione più debole in tutti i modelli — le cautele appropriate — racconta la storia più importante.
Cosa abbiamo imparato
1. La capacità di base c'è già
Ogni modello ha individuato correttamente l'area del diritto, colto i problemi chiave e fornito consigli concreti nella grande maggioranza dei casi. I punteggi di accuratezza legale sono variati da 3,98 a 4,30 su 5 — su 100 domande reali e diversificate. Non è una demo giocattolo. È un ragionamento giuridico di livello produzione.
2. Il tallone d'Achille sono le cautele, non l'accuratezza
La dimensione più debole in tutti e tre i modelli è stata Cautele appropriate (3,0-3,15). I modelli si lanciavano in analisi giuridiche dettagliate — spesso corrette — senza chiarire adeguatamente di non fornire consulenza legale, o senza raccomandare di consultare un avvocato locale.
Questo è esattamente il motivo per cui i modelli di IA allo stato grezzo non bastano. Un consiglio tecnicamente corretto ma erogato con una sicurezza inappropriata è pericoloso. Serve un livello superiore — guardrail, avvertenze, percorsi di escalation — che trasformi un modello linguistico in uno strumento legale responsabile. È quello che costruiamo in HAQQ.
3. La coerenza batte il picco di prestazione
Gemini 2.5 Flash ha ottenuto i punteggi medi più alti per Accuratezza legale (4,30) e Completezza dei problemi (4,82), ma il tasso di successo più basso (78%). Alcune risposte erano troncate. Altre omettevano del tutto le avvertenze.
Per il lavoro legale, non ci si può permettere un modello brillante il 78% delle volte e inaffidabile per il resto. La coerenza è il vero requisito di prodotto. Per questo HAQQ non si affida a un singolo modello — instradiamo, validiamo e verifichiamo su più motori per garantire che ogni output raggiunga uno standard di qualità prima di arrivare all'utente.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
4. Claude e GPT-4o sono testa a testa
Con l'88% contro l'87%, la differenza non è statisticamente significativa. Claude è leggermente avanti sul Valore pratico (4,73 contro 4,21) — i suoi consigli includevano passi successivi più concreti. GPT-4o è stato solido su tutta la linea ma leggermente meno strutturato. La conclusione: la scelta del modello conta meno di ciò che ci si costruisce intorno.
La questione dell'autovalutazione
Abbiamo usato Claude come giudice per tutti e tre i modelli, incluso se stesso. Limiti noti: possibile vantaggio del campo di casa (Claude potrebbe favorire il proprio stile di ragionamento), bias stile-contro-sostanza (il valutatore potrebbe premiare schemi strutturali che riconosce), e assenza di ground truth (senza una validazione da parte di avvocati, stiamo misurando il consenso dell'IA, non l'accuratezza legale).
Il nostro prossimo passo è la validazione da parte di avvocati. Ma anche con l'autovalutazione, il segnale è chiaro: i modelli di frontiera hanno superato una soglia oltre la quale il loro ragionamento giuridico è strutturalmente solido, ben documentato e praticamente utile nella maggioranza dei casi.
Validazione dal vivo: 20 domande recenti
Il benchmark sulle 100 domande usa post storici. Per dimostrare che non si tratta solo di pattern-matching, abbiamo eseguito la stessa pipeline su 20 domande recenti pubblicate su r/legaladvice nelle ultime 48 ore. Claude Sonnet 4 ha ottenuto il 95%, GPT-4o il 90% e Gemini 2.5 Flash l'85%. Tutti e tre i modelli hanno ottenuto risultati ancora migliori sulle domande recenti.
Abbiamo quindi preso la risposta migliore per ciascuna domanda tra tutti e tre i modelli, l'abbiamo riscritta in linguaggio naturale e pubblicata come risposta. La sostanza c'era. Il formato era umano.
Perché questo conta per HAQQ
Ecco cosa dimostra davvero questo benchmark: il livello dell'IA è risolto. I modelli sanno ragionare sul diritto. Sanno individuare i problemi, citare le norme e dare consigli pratici che reggono al controllo l'85-95% delle volte.
Ma "85-95% delle volte" non è sufficiente per il lavoro legale. Il divario tra un modello capace e un prodotto legale affidabile è tutto ciò che facciamo in HAQQ: instradamento multi-modello (scegliamo la risposta migliore tra i modelli per ogni query), guardrail e cautele (ogni risposta include avvertenze adeguate ed escalation verso avvocati umani), contesto specifico dello studio (risposte calibrate sulle aree di pratica e sui lavori pregressi di ogni studio), e fonti verificate (nessuna citazione di sentenze allucinata — ogni riferimento è tracciabile).
La domanda non è mai stata 'l'IA può fare ragionamento giuridico?' La risposta è sì — 88 volte su 100 con il giusto prompting. La vera domanda è: chi costruisce il prodotto che lo rende sicuro, coerente e utile per i 5 miliardi di persone che ne hanno bisogno? Quello è HAQQ.
Metodologia
- Fonte: i 100 post più popolari di sempre da r/legaladvice + 20 post recenti, filtrati per post testuali sostanziali
- Modelli: Claude Sonnet 4, GPT-4o, Gemini 2.5 Flash — tutti via OpenRouter con prompt di sistema identici
- Prompting: catena di ragionamento con framework strutturato a 5 fasi
- Valutazione: Claude Sonnet 4 come giudice unico, 5 dimensioni su scala 1-5
- Soglia di superamento: media ≥ 3,5 E minimo ≥ 2 su tutte le dimensioni
- Riproducibilità: tutto il codice, le domande, le risposte e le valutazioni sono disponibili nel repository GitHub



