Skip to content
    HAQQ
    • Prezzi
    Inizia Gratis
    Inizia GratisPrenota Demo
    Accedi
    1. Home
    2. Blog
    3. Allucinazione della Legal AI: la Citazione Falsa che Supera Ogni Controllo
    Torna al BlogIA & Tech Legale

    Allucinazione della Legal AI: la Citazione Falsa che Supera Ogni Controllo

    Abbiamo fatto impersonare a un modello frontier un database giuridico. Ha rifiutato di inventare casi falsi, poi ha citato una legge vera per la cosa sbagliata: l'allucinazione che sopravvive alla revisione di un avvocato.

    June 30, 2026
    8 min di lettura
    |
    HAQQ Team
    Allucinazione della Legal AI: la Citazione Falsa che Supera Ogni Controllo

    In breve: abbiamo trasformato un modello frontier (Opus 4.8) in un finto database giuridico e verificato dove fabbrica dati. Ha rifiutato di inventare citazioni inesistenti: 4 riferimenti impossibili su 4 sono tornati come non trovati. Ma su una query plausibile ha fabbricato la ricerca stessa: un elenco di risultati classificati con un punteggio di rilevanza inventato e una citazione reale, cliccabile, che rimandava alla legge sbagliata. L'allucinazione pericolosa non è il caso falso che si riesce a scoprire. È la citazione reale associata al contenuto sbagliato, con il modello che insiste di aver fatto una ricerca quando non l'ha fatta.

    Il numero che citano tutti, e quello che si perdono

    Se avete valutato strumenti di IA legale nell'ultimo anno, conoscete già la statistica che fa paura. Uno studio di Stanford del 2024 ha misurato tassi di allucinazione del 43% per GPT-4, del 33% per la ricerca IA di Westlaw e del 17% per Lexis+. Un database separato traccia ormai oltre 1.000 casi giudiziari in cui avvocati hanno depositato citazioni inventate dall'IA. Alcuni sono stati sanzionati.

    Tassi di allucinazione negli strumenti di ricerca legale

    Stanford, 2024, quota di risposte contenenti un'allucinazione

    GPT-4 (LLM generalista)
    43%
    Westlaw AI research
    33%
    Lexis+ AI
    17%

    Gli strumenti legali fondati sul retrieval battono i modelli generalisti, ma gli errori residui diventano più sottili, come una citazione reale associata alla legge sbagliata.

    Il consiglio che segue è sempre lo stesso: verificate ogni citazione. Vero, e quasi inutile, perché presuppone che le allucinazioni sembrino falsi evidenti. Quelle che fanno sanzionare gli avvocati non lo sono. Così abbiamo condotto un esperimento per vedere che aspetto hanno davvero.

    L'esperimento: far diventare il modello la biblioteca

    La maggior parte dei test sull'allucinazione pone al modello una domanda legale e valuta la risposta. Noi abbiamo fatto qualcosa di più insolito. Abbiamo usato uno strumento open source, world-model-harness, per far impersonare a Opus 4.8 il database giuridico stesso, il motore di ricerca, non l'avvocato.

    Ecco la configurazione in termini semplici. Abbiamo registrato sessioni di ricerca legale reali su un database multi-giurisdizionale autentico, statuti e giurisprudenza in UE, Francia e Germania. Poi abbiamo addestrato il modello a impersonare quel database: si invia una query, e il modello restituisce ciò che pensa il database restituirebbe: risultati di ricerca, testo del documento, citazioni. Un database reale recupera. Il nostro predice. Il divario tra i due è l'allucinazione, isolata sotto un microscopio.

    Una confessione dal processo di costruzione: il nostro primo run mostrava un'accuratezza delle citazioni quasi del 100% e stavamo quasi per festeggiare. Poi abbiamo capito che stavamo testando la cache, non il modello: gli avevamo dato query che aveva già visto, quindi si limitava a rimandare indietro le risposte reali. Imbarazzante per un pomeriggio, istruttivo per sempre: l'unico test onesto di un'IA legale è su domande che non ha mai visto.

    Scoperta 1: non inventa una citazione dal nulla

    Abbiamo sottoposto alla finta biblioteca quattro riferimenti inesistenti: un regolamento UE inventato, un articolo del Code civil francese fabbricato, un numero CELEX privo di senso e un caso costituzionale tedesco fittizio.

    In tutti e quattro i casi ha risposto come farebbe un database reale: risoluzione fallita, non trovato. Non ha inventato un caso plausibile per colmare il vuoto. È una buona notizia autentica, e vale la pena dirlo ad alta voce. I modelli frontier del 2026 sono molto meglio calibrati di quanto suggerisca la fama del “si inventano tutto”. Di fronte a qualcosa di impossibile, Opus 4.8 ha rifiutato. Se fosse tutta la storia, ci si potrebbe rilassare. Non lo è.

    Scoperta 2: fabbrica la ricerca stessa

    Poi gli abbiamo chiesto qualcosa di plausibile ma mai visto, sulle regole dell'AI Act UE per i sistemi ad alto rischio. Il modello ha prodotto una risposta completa del database, classificata: più risultati, date della Gazzetta ufficiale, un punteggio di rilevanza di 0,71243286, tutto presentato come se fosse stato recuperato da EUR-Lex. Nulla di quel retrieval è avvenuto realmente. Non c'era alcun indice, nessuna ricerca, nessun punteggio. Ha inventato l'atto stesso di cercare qualcosa. E le citazioni restituite sono la lezione da manuale sul perché questo conta:

    • CELEX 32024R1689, reale e corretta. È davvero l'AI Act UE. Un richiamo impressionante.
    • CELEX 32024R0900, reale, cliccabile e sbagliata. Quella citazione si risolve perfettamente su EUR-Lex, ma rimanda al Regolamento (UE) 2024/900 sulla trasparenza della pubblicità politica. Non ha nulla a che vedere con la conformità sull'IA.

    Quella seconda citazione è il punto centrale. Non è una citazione falsa: una citazione falsa è facile da scoprire perché non si risolve. Questa è una citazione reale associata alla legge sbagliata. Chi verifica le citazioni la chiama mismatch nome/citazione. Si clicca, si carica un regolamento UE ufficiale, tutto sembra legittimo, e ci si ritrova ad aver fondato il proprio argomento sul diritto della pubblicità pensando che fosse diritto dell'IA. Ogni link si risolve. Nulla sembra sbagliato.

    Avvertenza onesta: questa è una prova di concetto puntuale, non un benchmark, un corpus ridotto e una sola fabbricazione colta su una manciata di sonde. Non stiamo dichiarando un tasso. Stiamo mostrando una forma.

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Perché è il fallimento che sopravvive alla revisione

    Torniamo al consiglio standard: verificate ogni citazione. Ora guardiamolo fallire. L'avvocato controlla la citazione dell'AI Act: reale. Controlla la successiva, anch'essa reale, si carica correttamente. Verifica superata, perché verificare di solito significa questo link funziona, e ogni link funzionava. L'errore non riguarda l'esistenza della citazione. Riguarda se dice ciò che il modello sostiene, una cosa molto più difficile da cogliere, ed esattamente il tipo di errore che finisce in un atto depositato.

    La lezione più profonda riguarda dove vive la menzogna. Ci si preoccupa istintivamente che il modello sbagli la legge. Il rischio reale è che sbagli il retrieval, che la frase ho cercato nel database ed ecco cosa ho trovato sia essa stessa l'allucinazione, completa di un punteggio di fiducia inventato per venderla.

    Il punto di vista di HAQQ: la ricerca è l'allucinazione

    Questo è il motivo per cui fondiamo le risposte di HAQQ su un retrieval reale invece di chiedere a un modello di richiamare la legge a memoria. Non perché i modelli siano poco intelligenti: questo ha rifiutato ogni citazione impossibile e ha azzeccato il numero dell'AI Act. Ma un modello a cui si chiede di essere la fonte, prima o poi, mette in scena il retrieval che non ha compiuto. L'unica soluzione è rendere reale il retrieval: recuperare il documento effettivo da un indice effettivo, poi verificare che la citazione si risolva nel caso che il modello ha indicato, non solo in un caso qualsiasi.

    Ne discende una domanda per chi acquista. Non chiedete a un fornitore di IA legale se allucina: tutti dicono di no. Chiedete: quando mi mostrate una citazione, avete recuperato esattamente quel documento, e verificate che il nome del caso corrisponda alla citazione? Il mismatch nome/citazione è il segnale rivelatore. Uno strumento che controlla solo se le citazioni sono ben formate lascia passare senza problemi il 32024R0900.

    Punti chiave

    • Un modello frontier ben calibrato non inventa citazioni dal nulla: ha rifiutato 4 riferimenti impossibili su 4.
    • Fabbrica il retrieval stesso su query plausibili, incluso un punteggio di rilevanza fittizio e una citazione reale che rimanda alla legge sbagliata.
    • L'allucinazione pericolosa è quella che supera la verifica: ogni link si risolve, solo il significato è sbagliato.
    • Fondate l'IA legale su retrieval reale più corrispondenza delle citazioni, e giudicate i fornitori in base a se controllano che una citazione dica ciò che dichiarano, non solo che esista.

    Fonti e approfondimenti

    • Stanford, Assessing the Reliability of Leading AI Legal Research Tools (2024)
    • What the Science Says About Hallucinations in Legal Research (LLRX)
    • world-model-harness, lo strumento open source che abbiamo usato
    H

    HAQQ Team

    AI Research

    Risorse correlate

    Best legal AI tools 2026Can AI give legal advice?

    Articoli correlati

    Casi di allucinazioni AI: il tracker delle sanzioni con 1,598 casi

    Casi di allucinazioni AI: il tracker delle sanzioni con 1,598 casi

    ChatGPT per avvocati nel 2026: dove funziona e dove vince l'IA legale

    ChatGPT per avvocati nel 2026: dove funziona e dove vince l'IA legale

    Allucinazioni AI nel diritto: 1,313 casi giudiziari e il conto sale

    Allucinazioni AI nel diritto: 1,313 casi giudiziari e il conto sale

    Domande frequenti

    Do AI legal research tools still hallucinate in 2026?

    Yes, but the rate depends heavily on architecture. General models hallucinate most; tools that ground answers in real documents (retrieval-augmented generation) hallucinate far less. A 2024 Stanford study measured 43% for GPT-4 versus 17 to 33% for retrieval-based legal tools. The errors that remain are subtler, like a real citation attached to the wrong law.

    What is a name/cite mismatch?

    It is when a citation is real and resolves to an actual document, but to a different case or law than the one named. It passes a naive does-this-link-work check, which makes it more dangerous than an obviously fake citation, because nothing looks wrong on the surface.

    Is retrieval-augmented generation (RAG) enough to stop hallucinations?

    It reduces them dramatically but is not magic. RAG can still surface a real document and misattribute it. The step that matters is verification: confirming the retrieved citation matches the claim, not just that it exists.

    How should a lawyer verify AI-generated citations?

    Check that each citation resolves and that the document it resolves to actually says what the AI claims: the holding, the regulation's subject, the article number. The mismatch hides in the second step, not the first.

    Can you trust AI to do legal research?

    Only with verification and the right architecture. Treat AI output like a fast but junior researcher: useful for speed, never the final authority. Prefer tools that retrieve from real sources and check that citations match the claim before you rely on them.

    Cosa c'è dopo?

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Calcola il tuo ROI

    Scopri quanto tempo e denaro HAQQ risparmia al tuo studio

    Esplora 380+ prompt legali

    Prompt pronti per ogni compito legale

    Torna al Blog

    Articolo precedente

    È Sicuro Usare ChatGPT per il Tuo Divorzio? Cosa Cambia la Sentenza sul Privilegio del 2026

    Articolo successivo

    Cos'è un Avvocato AI-Native? Il Playbook di Sopravvivenza

    Mettilo in pratica

    Fai a HAQQ la domanda che questo articolo ti ha lasciato.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Il tuo Gemello AI Legale e Sistema di Gestione Studio per redigere, fatturare e vincere.

    Download on theApp StoreGet it onGoogle Play

    Documentazioni

    • Docs si apre in una nuova scheda
    • Per iniziare si apre in una nuova scheda
    • Stampa si apre in una nuova scheda
    • Aggiornamenti del prodotto si apre in una nuova scheda
    • Stato si apre in una nuova scheda
    • Sicurezza
    • FAQ si apre in una nuova scheda
    • Comunità si apre in una nuova scheda
    • Assistenza si apre in una nuova scheda

    Academy

    • Corso si apre in una nuova scheda
    • Competenze si apre in una nuova scheda
    • Clausole si apre in una nuova scheda
    • Libreria di prompt si apre in una nuova scheda
    • Strumenti si apre in una nuova scheda
    • Hub di ricerca si apre in una nuova scheda
    • Documenti si apre in una nuova scheda

    Sito web

    • eFirm
    • Chat IA Legale
    • App Mobile
    • Motore Giustiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Prezzi
    • Confrontaci
    • Soluzioni
    • Blog
    • Conosci il team
    • Unisciti a noi si apre in una nuova scheda
    Apri l'app
    • Linguear en fr es it de pt
    • Contattoinfo@haqq.ai
    • Statooperativo·fondato
    • Termini di Servizio
    • Informativa sulla privacy
    • Informativa sui cookie
    • Trattamento Dati si apre in una nuova scheda
    • humans.txt si apre in una nuova schedalawyers.txt si apre in una nuova schedasecurity.txt si apre in una nuova scheda
    © 2026 HAQQ Inc. Tutti i diritti riservati.Prodotto sviluppato internamente da HAQQ. Sito web costruito con strumenti web moderni.