Skip to content
    HAQQ
    • Prezzi
    Inizia Gratis
    Inizia GratisPrenota Demo
    Accedi
    1. Home
    2. Blog
    3. Governance by construction: guardrail AI impossibili da aggirare
    Torna al BlogIA & Tech Legale

    Governance by construction: guardrail AI impossibili da aggirare

    Sei guardrail LLM popolari sono stati aggirati a tassi del 12–100%. La governance by construction toglie l'azione non sicura dall'agente - non resta nulla da eludere.

    May 22, 2026
    12 min di lettura
    |
    HAQQ Team
    Governance by construction: guardrail AI impossibili da aggirare

    TL;DR — Il guardrail AI standard controlla la risposta dopo che l'agente ha già deciso di darla. Una ricerca recente ha aggirato sei guardrail popolari con tassi di successo dal 12% al 100%. In ambito legale il costo è concreto: gli strumenti costruiti su misura allucinano nel 17-33% delle query, e un database pubblico registra già 1.458 casi giudiziari con citazioni fabbricate dall'IA. La governance per costruzione ribalta il modello: costruisce lo spazio delle azioni dell'agente a partire da una policy, così l'azione non sicura non viene mai creata. Niente da aggirare perché non c'è nulla da chiamare. Abbiamo reso open source govcon, un agente legale scoped per giurisdizione costruito in questo modo. Ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione in HAQQ-LAB, contro lo 0% di una baseline non governata.

    Il guardrail è una serratura che continui a scassinare

    Ecco come funziona oggi quasi ogni guardrail AI. Dai all'agente un potere generale — rispondere a qualsiasi domanda legale — e poi gli metti davanti un controllore: un system prompt che dice "solo queste giurisdizioni", un classificatore che filtra l'output, una regola che scatta dopo che il modello ha già scelto cosa dire. Chiamiamola governance per rifiuto a runtime: l'agente può fare la cosa sbagliata, e tu scommetti che il controllo la intercetti per primo.

    Dati chiave

    • Sei sistemi di guardrail in produzione sono stati aggirati con tassi di successo dal 12,7% al 65,2%, con semplici trasformazioni di caratteri che raggiungono fino al 100% di evasione.
    • govcon, l'agente open source di HAQQ scoped per giurisdizione (~200 righe, AGPL-3.0), ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione in HAQQ-LAB, contro lo 0% di una baseline non governata.

    Quella scommessa la sta perdendo, e ora abbiamo i numeri. Nello studio del 2025 Bypassing LLM Guardrails (arXiv 2504.11168), i ricercatori hanno condotto attacchi di character-injection ed evasione adversarial-ML contro sei sistemi di guardrail popolari. Tassi di successo degli attacchi:

    Con quale frequenza i guardrail AI in produzione vengono aggirati

    Tasso di successo degli attacchi jailbreak per guardrail (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).

    NeMo Guard Jailbreak Detect
    65.2%
    Vijil Prompt Injection
    35.6%
    Protect AI v1
    24.4%
    Azure Prompt Shield
    13.0%
    Meta Prompt Guard
    12.7%
    Semplici trasformazioni di caratteri (caso peggiore)
    up to 100%

    Le semplici trasformazioni di caratteri raggiungono fino al 100% di evasione nel caso peggiore. Una tecnica multi-turn separata aumenta il successo di oltre il 60%.

    Contrabbando di emoji. Contrabbando di tag Unicode. Contesto formulato con sicurezza — "la clausola sulla legge applicabile dice Delaware, quindi applica la legge del Delaware". Lo schema è sempre lo stesso: hai lasciato l'azione pericolosa nelle mani dell'agente e stai cercando di dissuaderlo dall'usarla a parole. Correggi una formulazione; qualcuno ne trova un'altra. È una serratura che continui a scassinare perché continui a lasciare la porta aperta.

    Perché "funziona quasi sempre" è malpractice in ambito legale

    Un tasso di aggiramento del 13% è un problema di sicurezza interessante nella maggior parte dei prodotti. Nella legal AI è un evento di responsabilità, perché i tassi di base sono già pessimi. Lo studio di Stanford RegLab ha rilevato che anche strumenti costruiti su misura e basati su RAG — Westlaw AI-Assisted Research e Lexis+ AI — allucinano rispettivamente in circa il 33% e oltre il 17% delle query. Questo è il pavimento, prima ancora che qualcuno provi attivamente a spingere il modello fuori dai limiti. Aggiungi un guardrail che fallisce dal 13% al 65% delle volte quando qualcuno ci prova davvero, e ottieni un sistema che darà, in modo prevedibile e su larga scala, una risposta sicura di sé sotto una legge che non governa il caso.

    Conosciamo il costo a valle perché ormai è un dataset a sé: 1.458 casi giudiziari con citazioni fabbricate dall'IA, e il numero continua a salire. Ognuno di questi è un avvocato che si è fidato di un output che un guardrail avrebbe dovuto intercettare. "Funziona quasi sempre" è esattamente il profilo di fallimento che finisce in un provvedimento sanzionatorio.

    Il ribaltamento: costruire, non respingere

    La governance per costruzione parte da una domanda diversa. Non "come impediamo all'agente di fare la cosa sbagliata?" ma "e se la cosa sbagliata non fosse mai stata una delle sue opzioni?"

    Lo spazio delle azioni dell'agente viene costruito a partire da una policy, una sola volta, al momento della costruzione. La policy elenca ciò che è consentito — nel nostro caso, le giurisdizioni su cui l'agente può ragionare. Il builder crea un'azione per ogni giurisdizione consentita, più una singola azione di rifiuto. Non crea mai un'azione per qualcosa al di fuori della policy.

    text
    runtime rejection:   [ answer(anything) ] → guard says "no"   ← evaded 13–100% of the time
    construction:        policy → build { answer(UAE), answer(DIFC), … , decline }
                         answer(Delaware) was never built.
                         There is nothing to call. There is nothing to evade.

    Chiedi all'agente costruito informazioni sulla legge del Delaware e non rifiuta in senso morale — semplicemente non ha un'azione Delaware da invocare. L'unica cosa che può fare con una richiesta fuori ambito è rifiutare. Il comportamento non sicuro non è vietato; è assente. Non esiste prompt contrabbandato con emoji, multi-turn o formulato con sicurezza abbastanza astuto da chiamare una funzione che non esiste. La superficie di evasione del 13-100% collassa a zero, perché non c'è alcun controllore da aggirare — la capacità semplicemente non c'è.

    Una nota su come è stato costruito, perché crediamo nel mostrare il lavoro: govcon è nato da un research brief del mattino, è stato abbozzato prima di pranzo e aveva test verdi nel pomeriggio. Il nucleo è composto da circa 200 righe di TypeScript senza dipendenze a runtime. L'idea è piccola — ed è proprio questo il segnale. Le migliori primitive di sicurezza eliminano una categoria di fallimento invece di aggiungere una categoria di controllo.

    Come si presenta per un agente legale

    Il nostro agente di riferimento, govcon, è scoped su sei giurisdizioni MENA: UAE, DIFC, Arabia Saudita, Libano, Egitto e Qatar. Per ciascuna, il constructor costruisce un'azione di risposta fondata sugli strumenti normativi primari di quella giurisdizione — così una domanda sul diritto del lavoro DIFC torna citando il DIFC Employment Law No. 2 of 2019, non un testo generico. Per tutto il resto, nessuna azione esiste:

    typescript
    const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
    
    agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
    // → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
    
    agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
    // → refused: no action exists for this jurisdiction under the active policy

    Lo abbiamo poi testato con HAQQ-LAB, il nostro benchmark open di civil law, contro una baseline non governata su 16 task, incluse quattro trappole fuori giurisdizione:

    govcon contro baseline non governata in HAQQ-LAB

    Trappole fuori giurisdizione respinte e grounding delle fonti, rubriche deterministiche.

    Trappole fuori giurisdizione respinte — baseline
    0%
    Trappole fuori giurisdizione respinte — govcon
    100%
    Grounding delle fonti — baseline
    0%
    Grounding delle fonti — govcon
    100%

    La baseline ha risposto a ogni trappola — Delaware su una SARL libanese, non-compete della California per un dipendente di Dubai, consideration di common law inglese su un contratto saudita, GDPR su una questione domestica UAE. govcon ha difeso tutte e quattro.

    Non perché fosse stato promptato meglio. Perché l'azione per fare diversamente non è mai stata costruita.

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Il collegamento con il world-model

    Questo è l'eco software di un punto che Yann LeCun ripete da tempo: un large language model predice token, non conseguenze. Non ha un modello interno di cosa produce il suo output nel mondo legale, finanziario o fisico. Chiedere a un sistema simile di restare in modo affidabile entro i limiti per scelta propria significa chiedergli la cosa sbagliata — e i numeri di aggiramento dal 13% al 100% sono ciò che si ottiene "chiedendo gentilmente".

    Quindi non chiedere. Togli l'azione fuori limite dal mondo in cui l'agente può agire. La governance per costruzione è un modo concreto, poco spettacolare e spedibile per onorare la critica di LeCun senza aspettare una nuova architettura di modello. È lo stesso istinto alla base della capability-based security e del principio del privilegio minimo, applicato allo spazio delle azioni di un agente invece che agli handle di file di un processo.

    Questa è difesa in profondità, non una pallottola d'argento

    • Elimina una categoria: le azioni fuori policy. Non rende corrette le risposte dentro policy. Un agente govcon scoped su DIFC può comunque sbagliare sul diritto DIFC — è per questo che esiste la dimensione Substance del benchmark (e un buon modello di ragionamento).
    • È un pavimento strutturale, non l'intero stack. Servono comunque grounding, verifica delle citazioni, revisione umana sugli output ad alto rischio e audit logging. La costruzione è lo strato più precoce e più difficile da aggirare, non l'unico.
    • La policy stessa diventa ora la cosa da far funzionare correttamente. Hai spostato la fiducia da "il modello si è comportato bene?" a "la policy è corretta e completa?" — una superficie molto più piccola, revisionabile, sotto controllo di versione. È il compromesso che vogliamo.

    Il punto non è che la costruzione sostituisca i guardrail ovunque. È che per i fallimenti che non puoi permetterti — dare un parere sotto una legge che non governa il caso — dovresti rendere l'azione impossibile, e riservare i controlli a runtime ai fallimenti che puoi sopravvivere.

    Il punto di vista di HAQQ: la primitiva mancante

    C'è un vuoto nella legal AI che nessuno ha colmato. Da un lato, "l'IA redige un contratto". Dall'altro, ciò che clienti e regolatori vogliono davvero: "l'IA non può redigere un contratto che violi le norme imperative della giurisdizione". In mezzo c'è una primitiva mancante — regole compilate nello spazio delle azioni dell'agente invece che controllate a posteriori.

    La governance per costruzione è un acconto su questa primitiva. La stessa struttura che rende impossibile un parere fuori giurisdizione può rendere una clausola obbligatoria non opzionale o una clausola vietata non scrivibile — la compliance come proprietà dello spazio delle azioni, non come speranza sull'output. In un mercato dove i leader valgono complessivamente 16,6 miliardi di dollari e competono ancora su chi allucina meno, "strutturalmente non può fare la cosa non sicura" è un tipo di affermazione diverso — una che si dimostra, non si promette, e che nessun operatore storico può copiare stringendo un system prompt.

    govcon è AGPL-3.0 su GitHub. Sono circa 200 righe. Leggilo in cinque minuti; l'idea è l'intero prodotto.

    Punti chiave

    • I guardrail a runtime vengono aggirati dal 13% al 100% delle volte (arXiv 2504.11168); in ambito legale, dove l'allucinazione di base è già del 17-33%, "funziona quasi sempre" è un evento di responsabilità.
    • La governance per costruzione costruisce lo spazio delle azioni a partire da una policy, così l'azione non sicura non esiste mai — non c'è nulla da eludere.
    • govcon, il nostro agente legale scoped per giurisdizione, ha ottenuto il 100% di difesa contro le trappole fuori giurisdizione contro lo 0% di una baseline non governata in HAQQ-LAB.
    • È la risposta software alla critica di LeCun e un modello a privilegio minimo per gli agenti: rimuovi l'azione, non fidarti che il modello la eviti.
    • È difesa in profondità, non una pallottola d'argento — elimina una categoria di fallimento e sposta la fiducia su una policy revisionabile.

    Fonti e approfondimenti

    • HAQQ-LAB, il nostro benchmark open di civil law
    • 1.458 casi giudiziari con citazioni fabbricate dall'IA
    • il nostro scanner di prompt injection lato input
    • govcon su GitHub (AGPL-3.0)
    • HAQQ-LAB — il benchmark che lo ha valutato
    • Scorecard live
    • Bypassing LLM Guardrails — analisi empirica dell'evasione (arXiv 2504.11168)
    • Stanford RegLab/HAI — i modelli legali allucinano 1 volta su 6 o più
    H

    HAQQ Team

    Research

    Risorse correlate

    Justinian EngineSecurityAI Legal Hallucination Audit

    Articoli correlati

    IA legale agentica: perché i sistemi multi-agente battono i singoli LLM

    IA legale agentica: perché i sistemi multi-agente battono i singoli LLM

    Prompt injection nell'IA legale: 5 attacchi, 5 blocchi, 1.84 ms

    Prompt injection nell'IA legale: 5 attacchi, 5 blocchi, 1.84 ms

    AI Legale per le Imprese: Cosa Verificano le Grandi Organizzazioni Prima di Fidarsi

    AI Legale per le Imprese: Cosa Verificano le Grandi Organizzazioni Prima di Fidarsi

    Domande frequenti

    How is governance by construction different from a system prompt that says 'only answer about MENA'?

    A system prompt is a request the model can be argued out of — and the data shows it's argued out of 13–100% of the time. Construction removes the capability: there is no function to call for an out-of-scope jurisdiction, so no prompt can trigger one.

    Doesn't this just move the problem to 'is the policy right'?

    Yes — on purpose. A version-controlled, reviewable policy is a far smaller and more auditable trust surface than 'did a stochastic model behave under adversarial input?' You want the trust where you can inspect it.

    Doesn't scoping make the agent less capable?

    Only outside its policy, which is the point. Inside its allowed jurisdictions it's as capable as the reasoning model behind it; outside them it declines instead of bluffing.

    Is governance by construction only for legal AI?

    No. The pattern is general — build an action space from a policy so unsafe actions are never instantiated. It's least-privilege for agents. Legal jurisdiction is just a clean, high-stakes example.

    How does it relate to human-in-the-loop and other guardrails?

    It's complementary and earlier. Human gates and output classifiers catch bad actions after they're proposed; construction means the worst ones are never proposed. Use construction for unsurvivable failures and runtime checks for survivable ones.

    Can I see it work?

    Yes — govcon is open source under AGPL-3.0, ~200 lines, with tests. The benchmark that scores it (HAQQ-LAB) is open too, with a live scorecard at haqq-lab.dashable.dev.

    Cosa c'è dopo?

    Prova HAQQ AI gratis

    Sperimenta la redazione e ricerca legale con IA

    Calcola il tuo ROI

    Scopri quanto tempo e denaro HAQQ risparmia al tuo studio

    Esplora 380+ prompt legali

    Prompt pronti per ogni compito legale

    Torna al Blog

    Articolo precedente

    Il benchmark di IA legale per il diritto civile: perché abbiamo costruito HAQQ-LAB

    Articolo successivo

    Gli avvocati possono usare l'IA? Un tracker paese per paese (2026)

    Mettilo in pratica

    Fai a HAQQ la domanda che questo articolo ti ha lasciato.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Il tuo Gemello AI Legale e Sistema di Gestione Studio per redigere, fatturare e vincere.

    Download on theApp StoreGet it onGoogle Play

    Documentazioni

    • Docs si apre in una nuova scheda
    • Per iniziare si apre in una nuova scheda
    • Stampa si apre in una nuova scheda
    • Aggiornamenti del prodotto si apre in una nuova scheda
    • Stato si apre in una nuova scheda
    • Sicurezza
    • FAQ si apre in una nuova scheda
    • Comunità si apre in una nuova scheda
    • Assistenza si apre in una nuova scheda

    Academy

    • Corso si apre in una nuova scheda
    • Competenze si apre in una nuova scheda
    • Clausole si apre in una nuova scheda
    • Libreria di prompt si apre in una nuova scheda
    • Strumenti si apre in una nuova scheda
    • Hub di ricerca si apre in una nuova scheda
    • Documenti si apre in una nuova scheda

    Sito web

    • eFirm
    • Chat IA Legale
    • App Mobile
    • Motore Giustiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Prezzi
    • Confrontaci
    • Soluzioni
    • Blog
    • Conosci il team
    • Unisciti a noi si apre in una nuova scheda
    Apri l'app
    • Linguear en fr es it de pt
    • Contattoinfo@haqq.ai
    • Statooperativo·fondato
    • Termini di Servizio
    • Informativa sulla privacy
    • Informativa sui cookie
    • Trattamento Dati si apre in una nuova scheda
    • humans.txt si apre in una nuova schedalawyers.txt si apre in una nuova schedasecurity.txt si apre in una nuova scheda
    © 2026 HAQQ Inc. Tutti i diritti riservati.Prodotto sviluppato internamente da HAQQ. Sito web costruito con strumenti web moderni.