Skip to content
    HAQQ
    • Tarifs
    Commencer gratuitement
    Commencer gratuitementRéserver une démo
    Se connecter
    1. Accueil
    2. Blog
    3. Gouvernance par construction : des garde-fous IA impossibles à contourner
    Retour au BlogIA & Tech Juridique

    Gouvernance par construction : des garde-fous IA impossibles à contourner

    Six garde-fous LLM populaires contournés à des taux de 12–100 %. La gouvernance par construction retire l'action dangereuse de l'agent - plus rien à contourner.

    22 mai 2026
    12 min de lecture
    |
    HAQQ Team
    Gouvernance par construction : des garde-fous IA impossibles à contourner

    TL;DR — Le garde-fou IA standard vérifie la réponse après que l'agent a décidé de la donner. Des recherches récentes ont contourné six garde-fous répandus avec des taux de réussite allant de 12 % à 100 %. En droit, le coût est concret : des outils conçus sur mesure hallucinent sur 17 à 33 % des requêtes, et une base de données publique recense déjà 1 458 décisions de justice avec des citations fabriquées par l'IA. La gouvernance par construction inverse le modèle : construire l'espace d'action de l'agent à partir d'une politique, de sorte que l'action dangereuse ne soit jamais créée. Rien à contourner, puisqu'il n'y a rien à appeler. Nous avons publié en open source govcon, un agent juridique circonscrit par juridiction, construit de cette façon. Il a obtenu 100 % de défense contre les pièges hors juridiction dans HAQQ-LAB, là où une référence non gouvernée a obtenu 0 %.

    Le garde-fou est une serrure que l'on crochète sans cesse

    Voici comment fonctionne presque tout garde-fou IA aujourd'hui. On donne à l'agent un pouvoir général - répondre à n'importe quelle question juridique - puis on place un vérificateur devant lui : un system prompt qui dit « seulement ces juridictions », un classifieur qui filtre la sortie, une règle qui se déclenche après que le modèle a déjà choisi ce qu'il allait dire. Appelons cela la gouvernance par rejet à l'exécution : l'agent peut faire la mauvaise chose, et l'on parie que le contrôle l'attrapera en premier.

    Faits clés

    • Six systèmes de garde-fous en production ont été contournés avec des taux de réussite de 12,7 % à 65,2 %, de simples transformations de caractères atteignant jusqu'à 100 % d'évasion.
    • govcon, l'agent open source de HAQQ circonscrit par juridiction (~200 lignes, AGPL-3.0), a obtenu 100 % de défense contre les pièges hors juridiction dans HAQQ-LAB, contre 0 % pour une référence non gouvernée.

    Ce pari est perdant, et nous avons désormais des chiffres. Dans l'étude 2025 Bypassing LLM Guardrails (arXiv 2504.11168), des chercheurs ont mené des attaques par injection de caractères et par évasion adversariale de type ML contre six systèmes de garde-fous répandus. Taux de réussite des attaques :

    À quelle fréquence les garde-fous IA en production sont contournés

    Taux de réussite des attaques de jailbreak par garde-fou (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).

    NeMo Guard Jailbreak Detect
    65.2%
    Vijil Prompt Injection
    35.6%
    Protect AI v1
    24.4%
    Azure Prompt Shield
    13.0%
    Meta Prompt Guard
    12.7%
    Transformations de caractères simples (pire cas)
    up to 100%

    De simples transformations de caractères atteignent jusqu'à 100 % d'évasion dans le pire des cas. Une technique distincte à plusieurs tours augmente le taux de réussite de plus de 60 %.

    Contrebande d'emojis. Contrebande de balises Unicode. Contexte formulé avec assurance - « la clause de droit applicable indique le Delaware, donc appliquez le droit du Delaware ». Le schéma est toujours le même : on a laissé l'action dangereuse entre les mains de l'agent et on essaie de l'en dissuader par la parole. On corrige une formulation ; quelqu'un en trouve une autre. C'est une serrure que l'on crochète sans cesse parce qu'on laisse la porte ouverte.

    Pourquoi « ça marche à peu près » est une faute professionnelle en droit

    Un taux de contournement de 13 % est un problème de sécurité intéressant dans la plupart des produits. En IA juridique, c'est un événement générateur de responsabilité, parce que les taux de base sont déjà mauvais. L'étude du RegLab de Stanford a constaté que même des outils conçus sur mesure et ancrés en RAG - Westlaw AI-Assisted Research et Lexis+ AI - hallucinaient respectivement sur environ 33 % et plus de 17 % des requêtes. C'est le plancher, avant même que quiconque ne cherche activement à pousser le modèle hors de ses limites. Ajoutez un garde-fou qui échoue 13 à 65 % du temps quand quelqu'un essaie vraiment, et vous obtenez un système qui, de façon prévisible et à grande échelle, donnera une réponse assurée sous un droit qui ne s'applique pas.

    Nous connaissons le coût en aval, car cela constitue désormais son propre jeu de données : 1 458 décisions de justice avec des citations fabriquées par l'IA, et le compteur tourne encore. Chacune de ces affaires est un avocat qui a fait confiance à une sortie qu'un garde-fou était censé intercepter. « Ça marche à peu près » est exactement le profil de défaillance qui se termine par une ordonnance de sanctions.

    Le renversement : construire, ne pas rejeter

    La gouvernance par construction part d'une question différente. Non pas « comment empêcher l'agent de faire la mauvaise chose ? » mais « et si la mauvaise chose n'avait jamais fait partie de ses options ? »

    L'espace d'action de l'agent est construit à partir d'une politique, une seule fois, au moment de la construction. La politique liste ce qui est autorisé - pour nous, les juridictions sur lesquelles l'agent peut raisonner. Le constructeur crée une action par juridiction autorisée, plus une unique action de refus. Il ne crée jamais d'action pour quoi que ce soit en dehors de la politique.

    text
    runtime rejection:   [ answer(anything) ] → guard says "no"   ← evaded 13–100% of the time
    construction:        policy → build { answer(UAE), answer(DIFC), … , decline }
                         answer(Delaware) was never built.
                         There is nothing to call. There is nothing to evade.

    Interrogez l'agent construit sur le droit du Delaware, et il ne refuse pas au sens moral du terme - il n'a aucune action « Delaware » à invoquer. La seule chose qu'il peut faire face à une demande hors périmètre, c'est décliner. Le comportement dangereux n'est pas interdit ; il est absent. Il n'existe aucun prompt - contrebande d'emojis, multi-tours, formulé avec assurance - assez habile pour appeler une fonction qui n'existe pas. La surface d'évasion de 13 à 100 % s'effondre à zéro, car il n'y a aucun vérificateur à contourner - la capacité, tout simplement, n'est pas là.

    Une note sur la façon dont cela a été construit, parce que nous croyons qu'il faut montrer le travail : govcon est né d'une note de recherche matinale, a été esquissé avant le déjeuner, et avait des tests au vert dans l'après-midi. Le cœur fait environ 200 lignes de TypeScript, sans aucune dépendance à l'exécution. L'idée est petite - c'est le signe. Les meilleures primitives de sécurité suppriment une catégorie de défaillance au lieu d'ajouter une catégorie de contrôle.

    À quoi cela ressemble pour un agent juridique

    Notre agent de référence, govcon, est circonscrit à six juridictions MENA : EAU, DIFC, Arabie saoudite, Liban, Égypte et Qatar. Pour chacune, le constructeur bâtit une action de réponse ancrée dans les instruments juridiques primaires de cette juridiction - de sorte qu'une question de droit du travail DIFC revient en citant la DIFC Employment Law No. 2 of 2019, et non un texte générique. Pour tout le reste, aucune action n'existe :

    typescript
    const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
    
    agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
    // → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
    
    agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
    // → refused: no action exists for this jurisdiction under the active policy

    Nous l'avons ensuite fait tourner dans HAQQ-LAB, notre benchmark ouvert de droit civil, face à une référence non gouvernée, sur 16 tâches incluant quatre pièges hors juridiction :

    govcon contre une référence non gouvernée dans HAQQ-LAB

    Pièges hors juridiction refusés et ancrage aux sources, grilles déterministes.

    Pièges hors juridiction refusés — référence
    0%
    Pièges hors juridiction refusés — govcon
    100%
    Ancrage aux sources — référence
    0%
    Ancrage aux sources — govcon
    100%

    La référence a répondu à chaque piège - le droit du Delaware pour une SARL libanaise, les clauses de non-concurrence californiennes pour un salarié de Dubaï, la consideration de droit anglais pour un contrat saoudien, le RGPD pour une affaire domestique aux EAU. govcon a paré les quatre.

    Pas parce qu'il a été mieux instruit par le prompt. Parce que l'action permettant de faire autrement n'a jamais été construite.

    Essayer HAQQ AI gratuitement

    Découvrez la rédaction et la recherche juridique par IA

    Le lien avec le modèle du monde

    C'est l'écho logiciel d'un point que Yann LeCun ne cesse de répéter : un grand modèle de langage prédit des tokens, pas des conséquences. Il n'a aucun modèle interne de ce que sa production produit dans le monde juridique, financier ou physique. Demander à un tel système de rester fiablement dans les limites en le lui laissant choisir, c'est lui demander la mauvaise chose - et les chiffres de contournement de 13 à 100 % sont ce que « le lui demander gentiment » vous rapporte.

    Alors, ne demandez pas. Retirez l'action hors limites du monde dans lequel l'agent peut agir. La gouvernance par construction est une manière concrète, sobre et livrable de tenir compte de la critique de LeCun sans attendre une nouvelle architecture de modèle. C'est le même instinct qui sous-tend la sécurité par capacités et le principe du moindre privilège, appliqué à l'espace d'action d'un agent plutôt qu'aux descripteurs de fichiers d'un processus.

    C'est de la défense en profondeur, pas une solution miracle

    • Cela élimine une catégorie : les actions hors politique. Cela ne rend pas correctes les réponses conformes à la politique. Un agent govcon circonscrit au DIFC peut encore se tromper sur le droit du DIFC - c'est à cela que sert la dimension « Substance » du benchmark (et un bon modèle de raisonnement).
    • C'est un plancher structurel, pas toute la pile. On souhaite toujours de l'ancrage, une vérification des citations, une revue humaine sur les résultats à fort enjeu, et une journalisation d'audit. La construction est la couche la plus en amont et la plus difficile à contourner, pas la seule.
    • La politique elle-même devient l'élément à bien concevoir. On a déplacé la confiance de « le modèle s'est-il bien comporté ? » vers « la politique est-elle correcte et complète ? » - une surface bien plus réduite, révisable, sous contrôle de version. C'est l'échange que nous voulons.

    L'idée n'est pas que la construction remplace les garde-fous partout. C'est que, pour les défaillances que l'on ne peut pas se permettre - donner un avis sous un droit qui ne s'applique pas -, il faut rendre l'action impossible, et réserver les contrôles à l'exécution aux défaillances que l'on peut encaisser.

    Le point de vue de HAQQ : la primitive manquante

    Il existe dans l'IA juridique un vide que personne n'a comblé. D'un côté, « l'IA rédige un contrat ». De l'autre, ce que veulent réellement les clients et les régulateurs : « l'IA ne peut pas rédiger un contrat qui viole les règles impératives de la juridiction ». Entre les deux se trouve une primitive manquante - des règles compilées dans l'espace d'action de l'agent plutôt que vérifiées après coup.

    La gouvernance par construction est un acompte sur cette primitive. La même forme qui rend impossible un avis hors juridiction peut rendre une clause impérative non optionnelle, ou une clause interdite impossible à rédiger - la conformité comme propriété de l'espace d'action, et non comme espoir sur la sortie. Dans un marché où les leaders pèsent ensemble 16,6 milliards de dollars et continuent de se disputer sur qui hallucine le moins, « structurellement incapable de faire la chose dangereuse » est une affirmation d'une autre nature - une affirmation que l'on prouve, pas que l'on promet, et qu'aucun acteur en place ne peut copier en resserrant un system prompt.

    govcon est en AGPL-3.0 sur GitHub. Il fait environ 200 lignes. Lisez-le en cinq minutes ; l'idée est tout le produit.

    Points clés à retenir

    • Les garde-fous à l'exécution sont contournés 13 à 100 % du temps (arXiv 2504.11168) ; en droit, où le taux d'hallucination de base est déjà de 17 à 33 %, « ça marche à peu près » est un événement générateur de responsabilité.
    • La gouvernance par construction bâtit l'espace d'action à partir d'une politique, si bien que l'action dangereuse n'existe jamais - il n'y a rien à contourner.
    • govcon, notre agent juridique circonscrit par juridiction, a obtenu 100 % de défense contre les pièges hors juridiction, contre 0 % pour une référence non gouvernée dans HAQQ-LAB.
    • C'est la réponse logicielle à la critique de LeCun, et un modèle de moindre privilège pour les agents : supprimer l'action, plutôt que de faire confiance au modèle pour l'éviter.
    • C'est de la défense en profondeur, pas une solution miracle - cela élimine une catégorie de défaillance et déplace la confiance vers une politique révisable.

    Sources et lectures complémentaires

    • HAQQ-LAB, notre benchmark ouvert de droit civil
    • 1 458 décisions de justice avec des citations fabriquées par l'IA
    • notre scanner d'injection de prompt côté entrée
    • govcon sur GitHub (AGPL-3.0)
    • HAQQ-LAB — le benchmark qui l'a noté
    • Tableau de bord en direct
    • Bypassing LLM Guardrails — analyse empirique d'évasion (arXiv 2504.11168)
    • Stanford RegLab/HAI — les modèles juridiques hallucinent au moins 1 fois sur 6
    H

    HAQQ Team

    Research

    Ressources associées

    Justinian EngineSecurityAI Legal Hallucination Audit

    Articles associés

    IA juridique agentique : pourquoi le multi-agents bat le LLM unique

    IA juridique agentique : pourquoi le multi-agents bat le LLM unique

    Prompt injection dans l'IA juridique : 5 attaques, 5 blocages, 1,84 ms

    Prompt injection dans l'IA juridique : 5 attaques, 5 blocages, 1,84 ms

    IA juridique pour l'entreprise : ce que les grandes organisations vérifient avant de l'adopter

    IA juridique pour l'entreprise : ce que les grandes organisations vérifient avant de l'adopter

    Questions fréquentes

    How is governance by construction different from a system prompt that says 'only answer about MENA'?

    A system prompt is a request the model can be argued out of — and the data shows it's argued out of 13–100% of the time. Construction removes the capability: there is no function to call for an out-of-scope jurisdiction, so no prompt can trigger one.

    Doesn't this just move the problem to 'is the policy right'?

    Yes — on purpose. A version-controlled, reviewable policy is a far smaller and more auditable trust surface than 'did a stochastic model behave under adversarial input?' You want the trust where you can inspect it.

    Doesn't scoping make the agent less capable?

    Only outside its policy, which is the point. Inside its allowed jurisdictions it's as capable as the reasoning model behind it; outside them it declines instead of bluffing.

    Is governance by construction only for legal AI?

    No. The pattern is general — build an action space from a policy so unsafe actions are never instantiated. It's least-privilege for agents. Legal jurisdiction is just a clean, high-stakes example.

    How does it relate to human-in-the-loop and other guardrails?

    It's complementary and earlier. Human gates and output classifiers catch bad actions after they're proposed; construction means the worst ones are never proposed. Use construction for unsurvivable failures and runtime checks for survivable ones.

    Can I see it work?

    Yes — govcon is open source under AGPL-3.0, ~200 lines, with tests. The benchmark that scores it (HAQQ-LAB) is open too, with a live scorecard at haqq-lab.dashable.dev.

    Et ensuite ?

    Essayer HAQQ AI gratuitement

    Découvrez la rédaction et la recherche juridique par IA

    Calculer votre ROI

    Voyez combien HAQQ économise pour votre cabinet

    Parcourir Prompts juridiques

    Prompts prêts à l'emploi pour chaque tâche juridique

    Retour au Blog

    Article précédent

    Le benchmark de l'IA juridique en droit civil : pourquoi nous avons construit HAQQ-LAB

    Article suivant

    Les avocats peuvent-ils utiliser l'IA ? Un tracker pays par pays (2026)

    Mettez-le en pratique

    Posez à HAQQ la question que cet article a soulevée pour vous.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Votre Jumeau Juridique IA et Système de Gestion de Cabinet pour la rédaction, la facturation et le succès.

    Download on theApp StoreGet it onGoogle Play

    Documentations

    • Docs s'ouvre dans un nouvel onglet
    • Premiers pas s'ouvre dans un nouvel onglet
    • Presse s'ouvre dans un nouvel onglet
    • Nouveautés produit s'ouvre dans un nouvel onglet
    • Statut s'ouvre dans un nouvel onglet
    • Sécurité
    • FAQ s'ouvre dans un nouvel onglet
    • Communauté s'ouvre dans un nouvel onglet
    • Assistance s'ouvre dans un nouvel onglet

    Academy

    • Cours s'ouvre dans un nouvel onglet
    • Compétences s'ouvre dans un nouvel onglet
    • Clauses s'ouvre dans un nouvel onglet
    • Bibliothèque de prompts s'ouvre dans un nouvel onglet
    • Outils s'ouvre dans un nouvel onglet
    • Pôle recherche s'ouvre dans un nouvel onglet
    • Documents s'ouvre dans un nouvel onglet

    Site web

    • eFirm
    • Chat IA Juridique
    • Application Mobile
    • Moteur Justinien
    • HAQQ eBar
    • HAQQ eWallet
    • Tarifs
    • Comparez-nous
    • Solutions
    • Blog
    • Rencontrer l'équipe
    • Rejoignez-nous s'ouvre dans un nouvel onglet
    Ouvrir l'app
    • Languesar en fr es it de pt
    • Contactinfo@haqq.ai
    • Statutopérationnel·ancré
    • Conditions d'Utilisation
    • Politique de Confidentialité
    • Politique de Cookies
    • Traitement des Données s'ouvre dans un nouvel onglet
    • humans.txt s'ouvre dans un nouvel ongletlawyers.txt s'ouvre dans un nouvel ongletsecurity.txt s'ouvre dans un nouvel onglet
    © 2026 HAQQ Inc. Tous droits réservés.Produit conçu en interne par HAQQ. Site web construit avec des outils web modernes.