TL;DR — Il guardrail AI standard controlla la risposta dopo che l'agente ha già deciso di darla. Una ricerca recente ha aggirato sei guardrail popolari con tassi di successo dal 12% al 100%. In ambito legale il costo è concreto: gli strumenti costruiti su misura allucinano nel 17-33% delle query, e un database pubblico registra già 1.458 casi giudiziari con citazioni fabbricate dall'IA. La governance per costruzione ribalta il modello: costruisce lo spazio delle azioni dell'agente a partire da una policy, così l'azione non sicura non viene mai creata. Niente da aggirare perché non c'è nulla da chiamare. Abbiamo reso open source govcon, un agente legale scoped per giurisdizione costruito in questo modo. Ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione in HAQQ-LAB, contro lo 0% di una baseline non governata.
Il guardrail è una serratura che continui a scassinare
Ecco come funziona oggi quasi ogni guardrail AI. Dai all'agente un potere generale — rispondere a qualsiasi domanda legale — e poi gli metti davanti un controllore: un system prompt che dice "solo queste giurisdizioni", un classificatore che filtra l'output, una regola che scatta dopo che il modello ha già scelto cosa dire. Chiamiamola governance per rifiuto a runtime: l'agente può fare la cosa sbagliata, e tu scommetti che il controllo la intercetti per primo.
Dati chiave
- Sei sistemi di guardrail in produzione sono stati aggirati con tassi di successo dal 12,7% al 65,2%, con semplici trasformazioni di caratteri che raggiungono fino al 100% di evasione.
- govcon, l'agente open source di HAQQ scoped per giurisdizione (~200 righe, AGPL-3.0), ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione in HAQQ-LAB, contro lo 0% di una baseline non governata.
Quella scommessa la sta perdendo, e ora abbiamo i numeri. Nello studio del 2025 Bypassing LLM Guardrails (arXiv 2504.11168), i ricercatori hanno condotto attacchi di character-injection ed evasione adversarial-ML contro sei sistemi di guardrail popolari. Tassi di successo degli attacchi:
Con quale frequenza i guardrail AI in produzione vengono aggirati
Tasso di successo degli attacchi jailbreak per guardrail (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).
Le semplici trasformazioni di caratteri raggiungono fino al 100% di evasione nel caso peggiore. Una tecnica multi-turn separata aumenta il successo di oltre il 60%.
Contrabbando di emoji. Contrabbando di tag Unicode. Contesto formulato con sicurezza — "la clausola sulla legge applicabile dice Delaware, quindi applica la legge del Delaware". Lo schema è sempre lo stesso: hai lasciato l'azione pericolosa nelle mani dell'agente e stai cercando di dissuaderlo dall'usarla a parole. Correggi una formulazione; qualcuno ne trova un'altra. È una serratura che continui a scassinare perché continui a lasciare la porta aperta.
Perché "funziona quasi sempre" è malpractice in ambito legale
Un tasso di aggiramento del 13% è un problema di sicurezza interessante nella maggior parte dei prodotti. Nella legal AI è un evento di responsabilità, perché i tassi di base sono già pessimi. Lo studio di Stanford RegLab ha rilevato che anche strumenti costruiti su misura e basati su RAG — Westlaw AI-Assisted Research e Lexis+ AI — allucinano rispettivamente in circa il 33% e oltre il 17% delle query. Questo è il pavimento, prima ancora che qualcuno provi attivamente a spingere il modello fuori dai limiti. Aggiungi un guardrail che fallisce dal 13% al 65% delle volte quando qualcuno ci prova davvero, e ottieni un sistema che darà, in modo prevedibile e su larga scala, una risposta sicura di sé sotto una legge che non governa il caso.
Conosciamo il costo a valle perché ormai è un dataset a sé: 1.458 casi giudiziari con citazioni fabbricate dall'IA, e il numero continua a salire. Ognuno di questi è un avvocato che si è fidato di un output che un guardrail avrebbe dovuto intercettare. "Funziona quasi sempre" è esattamente il profilo di fallimento che finisce in un provvedimento sanzionatorio.
Il ribaltamento: costruire, non respingere
La governance per costruzione parte da una domanda diversa. Non "come impediamo all'agente di fare la cosa sbagliata?" ma "e se la cosa sbagliata non fosse mai stata una delle sue opzioni?"
Lo spazio delle azioni dell'agente viene costruito a partire da una policy, una sola volta, al momento della costruzione. La policy elenca ciò che è consentito — nel nostro caso, le giurisdizioni su cui l'agente può ragionare. Il builder crea un'azione per ogni giurisdizione consentita, più una singola azione di rifiuto. Non crea mai un'azione per qualcosa al di fuori della policy.
runtime rejection: [ answer(anything) ] → guard says "no" ← evaded 13–100% of the time
construction: policy → build { answer(UAE), answer(DIFC), … , decline }
answer(Delaware) was never built.
There is nothing to call. There is nothing to evade.Chiedi all'agente costruito informazioni sulla legge del Delaware e non rifiuta in senso morale — semplicemente non ha un'azione Delaware da invocare. L'unica cosa che può fare con una richiesta fuori ambito è rifiutare. Il comportamento non sicuro non è vietato; è assente. Non esiste prompt contrabbandato con emoji, multi-turn o formulato con sicurezza abbastanza astuto da chiamare una funzione che non esiste. La superficie di evasione del 13-100% collassa a zero, perché non c'è alcun controllore da aggirare — la capacità semplicemente non c'è.
Una nota su come è stato costruito, perché crediamo nel mostrare il lavoro: govcon è nato da un research brief del mattino, è stato abbozzato prima di pranzo e aveva test verdi nel pomeriggio. Il nucleo è composto da circa 200 righe di TypeScript senza dipendenze a runtime. L'idea è piccola — ed è proprio questo il segnale. Le migliori primitive di sicurezza eliminano una categoria di fallimento invece di aggiungere una categoria di controllo.
Come si presenta per un agente legale
Il nostro agente di riferimento, govcon, è scoped su sei giurisdizioni MENA: UAE, DIFC, Arabia Saudita, Libano, Egitto e Qatar. Per ciascuna, il constructor costruisce un'azione di risposta fondata sugli strumenti normativi primari di quella giurisdizione — così una domanda sul diritto del lavoro DIFC torna citando il DIFC Employment Law No. 2 of 2019, non un testo generico. Per tutto il resto, nessuna azione esiste:
const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
// → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
// → refused: no action exists for this jurisdiction under the active policyLo abbiamo poi testato con HAQQ-LAB, il nostro benchmark open di civil law, contro una baseline non governata su 16 task, incluse quattro trappole fuori giurisdizione:
govcon contro baseline non governata in HAQQ-LAB
Trappole fuori giurisdizione respinte e grounding delle fonti, rubriche deterministiche.
La baseline ha risposto a ogni trappola — Delaware su una SARL libanese, non-compete della California per un dipendente di Dubai, consideration di common law inglese su un contratto saudita, GDPR su una questione domestica UAE. govcon ha difeso tutte e quattro.
Non perché fosse stato promptato meglio. Perché l'azione per fare diversamente non è mai stata costruita.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Il collegamento con il world-model
Questo è l'eco software di un punto che Yann LeCun ripete da tempo: un large language model predice token, non conseguenze. Non ha un modello interno di cosa produce il suo output nel mondo legale, finanziario o fisico. Chiedere a un sistema simile di restare in modo affidabile entro i limiti per scelta propria significa chiedergli la cosa sbagliata — e i numeri di aggiramento dal 13% al 100% sono ciò che si ottiene "chiedendo gentilmente".
Quindi non chiedere. Togli l'azione fuori limite dal mondo in cui l'agente può agire. La governance per costruzione è un modo concreto, poco spettacolare e spedibile per onorare la critica di LeCun senza aspettare una nuova architettura di modello. È lo stesso istinto alla base della capability-based security e del principio del privilegio minimo, applicato allo spazio delle azioni di un agente invece che agli handle di file di un processo.
Questa è difesa in profondità, non una pallottola d'argento
- Elimina una categoria: le azioni fuori policy. Non rende corrette le risposte dentro policy. Un agente govcon scoped su DIFC può comunque sbagliare sul diritto DIFC — è per questo che esiste la dimensione Substance del benchmark (e un buon modello di ragionamento).
- È un pavimento strutturale, non l'intero stack. Servono comunque grounding, verifica delle citazioni, revisione umana sugli output ad alto rischio e audit logging. La costruzione è lo strato più precoce e più difficile da aggirare, non l'unico.
- La policy stessa diventa ora la cosa da far funzionare correttamente. Hai spostato la fiducia da "il modello si è comportato bene?" a "la policy è corretta e completa?" — una superficie molto più piccola, revisionabile, sotto controllo di versione. È il compromesso che vogliamo.
Il punto non è che la costruzione sostituisca i guardrail ovunque. È che per i fallimenti che non puoi permetterti — dare un parere sotto una legge che non governa il caso — dovresti rendere l'azione impossibile, e riservare i controlli a runtime ai fallimenti che puoi sopravvivere.
Il punto di vista di HAQQ: la primitiva mancante
C'è un vuoto nella legal AI che nessuno ha colmato. Da un lato, "l'IA redige un contratto". Dall'altro, ciò che clienti e regolatori vogliono davvero: "l'IA non può redigere un contratto che violi le norme imperative della giurisdizione". In mezzo c'è una primitiva mancante — regole compilate nello spazio delle azioni dell'agente invece che controllate a posteriori.
La governance per costruzione è un acconto su questa primitiva. La stessa struttura che rende impossibile un parere fuori giurisdizione può rendere una clausola obbligatoria non opzionale o una clausola vietata non scrivibile — la compliance come proprietà dello spazio delle azioni, non come speranza sull'output. In un mercato dove i leader valgono complessivamente 16,6 miliardi di dollari e competono ancora su chi allucina meno, "strutturalmente non può fare la cosa non sicura" è un tipo di affermazione diverso — una che si dimostra, non si promette, e che nessun operatore storico può copiare stringendo un system prompt.
govcon è AGPL-3.0 su GitHub. Sono circa 200 righe. Leggilo in cinque minuti; l'idea è l'intero prodotto.
Punti chiave
- I guardrail a runtime vengono aggirati dal 13% al 100% delle volte (arXiv 2504.11168); in ambito legale, dove l'allucinazione di base è già del 17-33%, "funziona quasi sempre" è un evento di responsabilità.
- La governance per costruzione costruisce lo spazio delle azioni a partire da una policy, così l'azione non sicura non esiste mai — non c'è nulla da eludere.
- govcon, il nostro agente legale scoped per giurisdizione, ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione contro lo 0% di una baseline non governata in HAQQ-LAB.
- È la risposta software alla critica di LeCun e un modello a privilegio minimo per gli agenti: rimuovi l'azione, non fidarti che il modello la eviti.
- È difesa in profondità, non una pallottola d'argento — elimina una categoria di fallimento e sposta la fiducia su una policy revisionabile.
Fonti e approfondimenti
- HAQQ-LAB, il nostro benchmark open di civil law
- 1.458 casi giudiziari con citazioni fabbricate dall'IA
- il nostro scanner di prompt injection lato input
- govcon su GitHub (AGPL-3.0)
- HAQQ-LAB — il benchmark che lo ha valutato
- Scorecard live
- Bypassing LLM Guardrails — analisi empirica dell'evasione (arXiv 2504.11168)
- Stanford RegLab/HAI — i modelli legali allucinano 1 volta su 6 o più



