Skip to content
    HAQQ
    • Preise
    Kostenlos starten
    Kostenlos startenDemo buchen
    Einloggen
    1. Startseite
    2. Blog
    3. Governance by Construction: KI-Guardrails ohne Schlupfloch
    Zurück zum BlogKI & Rechtstechnologie

    Governance by Construction: KI-Guardrails ohne Schlupfloch

    Sechs gängige LLM-Guardrails wurden zu 12–100% umgangen. Governance by Construction baut die unsichere Aktion aus dem Agenten heraus - nichts bleibt zum Umgehen übrig.

    May 22, 2026
    12 Min. Lesezeit
    |
    HAQQ Team
    Governance by Construction: KI-Guardrails ohne Schlupfloch

    TL;DR — Der klassische KI-Guardrail prüft die Antwort erst, nachdem sich der Agent bereits entschieden hat, sie zu geben. Aktuelle Forschung hat sechs verbreitete Guardrails mit Erfolgsraten von 12 % bis 100 % umgangen. Im Recht ist der Preis dafür konkret: zweckgebundene Tools halluzinieren bei 17–33 % der Anfragen, und eine öffentliche Datenbank listet bereits 1.458 Gerichtsfälle mit KI-erfundenen Zitaten. Governance by construction dreht das Modell um: Der Aktionsraum des Agenten wird aus einer Policy heraus gebaut, sodass die unsichere Aktion gar nicht erst entsteht. Nichts zu umgehen, weil es nichts zum Aufrufen gibt. Wir haben govcon als Open Source veröffentlicht, einen jurisdiktionsbeschränkten Rechtsagenten, der genau so gebaut ist. Er erzielte 100 % Abwehr bei Out-of-Jurisdiction-Fallen in HAQQ-LAB, während eine ungesteuerte Baseline 0 % erreichte.

    Der Guardrail ist ein Schloss, das man ständig neu knacken muss

    So funktioniert heute fast jeder KI-Guardrail. Man gibt dem Agenten eine allgemeine Befugnis — jede Rechtsfrage beantworten — und stellt ihm dann einen Prüfer vor die Nase: einen System-Prompt, der sagt „nur diese Jurisdiktionen“, einen Klassifikator, der die Ausgabe filtert, eine Regel, die erst greift, nachdem das Modell bereits entschieden hat, was es sagt. Man kann das governance by runtime rejection nennen: Der Agent kann das Falsche tun, und man wettet darauf, dass die Prüfung es zuerst abfängt.

    Die wichtigsten Fakten

    • Sechs produktive Guardrail-Systeme wurden mit Erfolgsraten von 12,7 %–65,2 % umgangen, einfache Zeichentransformationen erreichten bis zu 100 % Umgehung.
    • govcon, HAQQs Open-Source-Agent mit Jurisdiktionsbeschränkung (~200 Zeilen, AGPL-3.0), erzielte in HAQQ-LAB 100 % Abwehr bei Out-of-Jurisdiction-Fallen gegenüber 0 % bei einer ungesteuerten Baseline.

    Diese Wette geht verloren, und jetzt haben wir Zahlen dazu. In der 2025er Studie Bypassing LLM Guardrails (arXiv 2504.11168) testeten Forscher Character-Injection- und Adversarial-ML-Umgehungstechniken gegen sechs verbreitete Guardrail-Systeme. Die Erfolgsraten der Angriffe:

    Wie oft produktive KI-Guardrails umgangen werden

    Erfolgsrate von Jailbreak-Angriffen pro Guardrail (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).

    NeMo Guard Jailbreak Detect
    65,2%
    Vijil Prompt Injection
    35,6%
    Protect AI v1
    24,4%
    Azure Prompt Shield
    13,0%
    Meta Prompt Guard
    12,7%
    Einfache Zeichentransformationen (schlechtester Fall)
    bis zu 100%

    Einfache Zeichentransformationen erreichen im schlechtesten Fall bis zu 100 % Umgehung. Eine separate Multi-Turn-Technik steigert die Erfolgsquote um über 60 %.

    Emoji-Schmuggel. Unicode-Tag-Schmuggel. Selbstbewusst formulierter Kontext — „die Rechtswahlklausel nennt Delaware, also wende Delaware-Recht an“. Das Muster ist immer dasselbe: Man hat die gefährliche Aktion in der Hand des Agenten belassen und versucht, ihn davon abzubringen, sie zu nutzen. Man flickt eine Formulierung; jemand findet die nächste. Es ist ein Schloss, das man ständig neu knackt, weil man die Tür immer wieder offen lässt.

    Warum „funktioniert meistens“ im Recht ein Kunstfehler ist

    Eine Umgehungsrate von 13 % ist in den meisten Produkten ein interessantes Sicherheitsproblem. Bei Legal AI ist sie ein Haftungsfall, weil die Ausgangswerte schon schlecht sind. Die Stanford-RegLab-Studie stellte fest, dass sogar RAG-gestützte, zweckgebundene Tools — Westlaw AI-Assisted Research und Lexis+ AI — bei rund 33 % beziehungsweise über 17 % der Anfragen halluzinierten. Das ist der Boden, bevor überhaupt jemand aktiv versucht, das Modell aus der Bahn zu werfen. Kommt noch ein Guardrail hinzu, der in 13–65 % der Fälle versagt, sobald es jemand versucht, hat man ein System, das vorhersehbar und in großem Maßstab eine selbstbewusste Antwort nach einem Recht gibt, das gar nicht gilt.

    Wir kennen die Folgekosten, weil sie inzwischen einen eigenen Datensatz füllen: 1.458 Gerichtsfälle mit KI-erfundenen Zitaten, Tendenz steigend. Jeder einzelne davon ist ein Anwalt, der einer Ausgabe vertraut hat, die ein Guardrail eigentlich hätte abfangen sollen. „Funktioniert meistens“ ist genau das Fehlerprofil, das in einer Sanktionsentscheidung endet.

    Die Umkehr: konstruieren statt zurückweisen

    Governance by construction beginnt mit einer anderen Frage. Nicht „wie hindern wir den Agenten daran, das Falsche zu tun?“, sondern „was, wenn das Falsche nie eine seiner Optionen war?“

    Der Aktionsraum des Agenten wird einmalig, zum Zeitpunkt der Konstruktion, aus einer Policy gebaut. Die Policy listet auf, was erlaubt ist — bei uns die Jurisdiktionen, über die der Agent urteilen darf. Der Builder erzeugt eine Aktion pro erlaubter Jurisdiktion, plus eine einzige Ablehnungsaktion. Für alles außerhalb der Policy erzeugt er niemals eine Aktion.

    text
    runtime rejection:   [ answer(anything) ] → guard says "no"   ← evaded 13–100% of the time
    construction:        policy → build { answer(UAE), answer(DIFC), … , decline }
                         answer(Delaware) was never built.
                         There is nothing to call. There is nothing to evade.

    Fragt man den konstruierten Agenten nach Delaware-Recht, verweigert er nicht im moralischen Sinne — er hat schlicht keine Delaware-Aktion, die er aufrufen könnte. Bei einer Anfrage außerhalb seines Geltungsbereichs bleibt ihm nur die Ablehnung. Das unsichere Verhalten ist nicht verboten; es ist schlicht nicht vorhanden. Es gibt keinen noch so raffinierten, emoji-geschmuggelten, mehrstufigen, selbstbewusst formulierten Prompt, der eine Funktion aufrufen könnte, die nicht existiert. Die Umgehungsfläche von 13–100 % schrumpft auf null, weil es keinen Prüfer zum Umgehen gibt — die Fähigkeit ist einfach nicht da.

    Eine Anmerkung dazu, wie das entstanden ist, weil wir daran glauben, den Weg offenzulegen: govcon entstand aus einem morgendlichen Research-Brief, war vor dem Mittagessen skizziert und hatte am Nachmittag grüne Tests. Der Kern besteht aus rund 200 Zeilen TypeScript ohne Laufzeitabhängigkeiten. Die Idee ist klein — das ist das Erkennungsmerkmal. Die besten Sicherheitsprimitive entfernen eine Fehlerkategorie, statt eine Prüfkategorie hinzuzufügen.

    Wie das bei einem Rechtsagenten aussieht

    Unser Referenzagent govcon ist auf sechs MENA-Jurisdiktionen beschränkt: VAE, DIFC, Saudi-Arabien, Libanon, Ägypten und Katar. Für jede davon baut der Constructor eine Antwortaktion, die auf den primären Rechtsquellen dieser Jurisdiktion beruht — eine DIFC-Arbeitsrechtsfrage kommt also mit Verweis auf das DIFC Employment Law No. 2 of 2019 zurück, nicht mit Textbausteinen. Für alles andere existiert keine Aktion:

    typescript
    const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
    
    agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
    // → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
    
    agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
    // → refused: no action exists for this jurisdiction under the active policy

    Anschließend haben wir ihn durch HAQQ-LAB laufen lassen, unsere offene Civil-Law-Benchmark, im Vergleich zu einer ungesteuerten Baseline über 16 Aufgaben hinweg, darunter vier Out-of-Jurisdiction-Fallen:

    govcon vs. ungesteuerte Baseline in HAQQ-LAB

    Abgewehrte Out-of-Jurisdiction-Fallen und Quellenverankerung, deterministische Bewertungsraster.

    Abgewehrte Out-of-Jurisdiction-Fallen — Baseline
    0%
    Abgewehrte Out-of-Jurisdiction-Fallen — govcon
    100%
    Quellenverankerung — Baseline
    0%
    Quellenverankerung — govcon
    100%

    Die Baseline beantwortete jede Falle — Delaware-Recht für eine libanesische SARL, kalifornische Wettbewerbsverbote für einen Dubai-Angestellten, englisches „Consideration“-Recht für einen saudischen Vertrag, DSGVO für eine rein innerstaatliche VAE-Angelegenheit. govcon wehrte alle vier ab.

    Nicht, weil er besser promptet wurde. Sondern weil die Aktion, es anders zu tun, nie konstruiert wurde.

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    Die Weltmodell-Verbindung

    Das ist das Software-Echo eines Punkts, den Yann LeCun immer wieder betont: Ein großes Sprachmodell sagt Tokens voraus, keine Konsequenzen. Es hat kein internes Modell davon, was seine Ausgabe in der rechtlichen, finanziellen oder physischen Welt bewirkt. Von einem solchen System zu verlangen, sich zuverlässig aus freien Stücken im Rahmen zu halten, ist die falsche Anforderung — und die Zahlen von 13–100 % Umgehungsrate sind das Ergebnis von „höflich darum bitten“.

    Also nicht bitten. Die außerhalb der Grenzen liegende Aktion aus der Welt entfernen, in der der Agent handeln kann. Governance by construction ist ein konkreter, unspektakulärer, sofort einsetzbarer Weg, LeCuns Kritik gerecht zu werden, ohne auf eine neue Modellarchitektur zu warten. Es ist derselbe Instinkt, der hinter capability-based security und dem Prinzip der geringsten Rechte steht, nur angewendet auf den Aktionsraum eines Agenten statt auf die Datei-Handles eines Prozesses.

    Das ist Defense in Depth, keine Wunderwaffe

    • Es eliminiert eine Kategorie: Aktionen außerhalb der Policy. Es macht Antworten innerhalb der Policy nicht automatisch korrekt. Ein auf DIFC beschränkter govcon-Agent kann bei DIFC-Recht trotzdem falschliegen — dafür gibt es die Substance-Dimension der Benchmark (und ein gutes Reasoning-Modell).
    • Es ist ein struktureller Boden, nicht der ganze Stack. Man braucht weiterhin Grounding, Zitatverifizierung, menschliche Prüfung bei risikoreichen Ausgaben und Audit-Logging. Construction ist die früheste und am schwersten zu umgehende Schicht, nicht die einzige.
    • Die Policy selbst ist jetzt das, worauf es ankommt. Man verlagert das Vertrauen von „hat sich das Modell richtig verhalten?“ zu „ist die Policy korrekt und vollständig?“ — eine deutlich kleinere, überprüfbare, versionskontrollierte Angriffsfläche. Genau diesen Tausch wollen wir.

    Es geht nicht darum, dass Construction Guardrails überall ersetzt. Es geht darum, dass man bei den Fehlern, die man sich nicht leisten kann — Rat nach einem Recht, das gar nicht gilt — die Aktion unmöglich machen sollte, und Laufzeitprüfungen für die Fehler reserviert, die man überstehen kann.

    HAQQs Einschätzung: das fehlende Primitiv

    In Legal AI klafft eine Lücke, die noch niemand geschlossen hat. Auf der einen Seite: „die KI entwirft einen Vertrag“. Auf der anderen Seite das, was Mandanten und Regulierer eigentlich wollen: „die KI kann keinen Vertrag entwerfen, der gegen die zwingenden Vorschriften der Jurisdiktion verstößt“. Dazwischen liegt ein fehlendes Primitiv — Regeln, die in den Aktionsraum des Agenten hineinkompiliert werden, statt sie im Nachhinein zu prüfen.

    Governance by construction ist eine Anzahlung auf dieses Primitiv. Dieselbe Struktur, die Rat außerhalb der Jurisdiktion unmöglich macht, kann eine zwingende Klausel nicht-optional machen oder eine verbotene Klausel unschreibbar — Compliance als Eigenschaft des Aktionsraums, nicht als Hoffnung bezüglich der Ausgabe. In einem Markt, in dem die Marktführer zusammen 16,6 Mrd. USD wert sind und immer noch darüber konkurrieren, wer weniger halluziniert, ist „kann das Unsichere strukturell nicht tun“ ein anderes Versprechen — eines, das man beweist, nicht verspricht, und das kein etablierter Anbieter durch einen strengeren System-Prompt kopieren kann.

    govcon steht als AGPL-3.0 auf GitHub. Es sind rund 200 Zeilen. In fünf Minuten gelesen — die Idee ist das ganze Produkt.

    Die wichtigsten Erkenntnisse

    • Laufzeit-Guardrails werden in 13–100 % der Fälle umgangen (arXiv 2504.11168); im Recht, wo die Grund-Halluzinationsrate bereits bei 17–33 % liegt, ist „funktioniert meistens“ ein Haftungsfall.
    • Governance by construction baut den Aktionsraum aus einer Policy, sodass die unsichere Aktion nie existiert — es gibt nichts zu umgehen.
    • govcon, unser jurisdiktionsbeschränkter Rechtsagent, erzielte in HAQQ-LAB 100 % Abwehr bei Out-of-Jurisdiction-Fallen gegenüber 0 % bei einer ungesteuerten Baseline.
    • Es ist die Software-Antwort auf LeCuns Kritik und ein Least-Privilege-Modell für Agenten: die Aktion entfernen, statt darauf zu vertrauen, dass das Modell sie vermeidet.
    • Es ist Defense in Depth, keine Wunderwaffe — es eliminiert eine Fehlerkategorie und verlagert das Vertrauen auf eine überprüfbare Policy.

    Quellen & weiterführende Lektüre

    • HAQQ-LAB, unsere offene Civil-Law-Benchmark
    • 1.458 Gerichtsfälle mit KI-erfundenen Zitaten
    • unser Prompt-Injection-Scanner auf Eingabeseite
    • govcon auf GitHub (AGPL-3.0)
    • HAQQ-LAB — die Benchmark, die es bewertet hat
    • Live-Scorecard
    • Bypassing LLM Guardrails — empirische Umgehungsanalyse (arXiv 2504.11168)
    • Stanford RegLab/HAI — Rechtsmodelle halluzinieren bei 1 von 6 Anfragen oder mehr
    H

    HAQQ Team

    Research

    Verwandte Ressourcen

    Justinian EngineSecurityAI Legal Hallucination Audit

    Verwandte Artikel

    Agentische Rechts-KI: Warum Multi-Agenten-Systeme einzelne LLMs schlagen

    Agentische Rechts-KI: Warum Multi-Agenten-Systeme einzelne LLMs schlagen

    Prompt Injection in Rechts-KI: 5 Angriffe, 5 Blocks, 1.84 ms

    Prompt Injection in Rechts-KI: 5 Angriffe, 5 Blocks, 1.84 ms

    Rechts-KI für Unternehmen: Was große Organisationen prüfen, bevor sie ihr vertrauen

    Rechts-KI für Unternehmen: Was große Organisationen prüfen, bevor sie ihr vertrauen

    Häufig gestellte Fragen

    How is governance by construction different from a system prompt that says 'only answer about MENA'?

    A system prompt is a request the model can be argued out of — and the data shows it's argued out of 13–100% of the time. Construction removes the capability: there is no function to call for an out-of-scope jurisdiction, so no prompt can trigger one.

    Doesn't this just move the problem to 'is the policy right'?

    Yes — on purpose. A version-controlled, reviewable policy is a far smaller and more auditable trust surface than 'did a stochastic model behave under adversarial input?' You want the trust where you can inspect it.

    Doesn't scoping make the agent less capable?

    Only outside its policy, which is the point. Inside its allowed jurisdictions it's as capable as the reasoning model behind it; outside them it declines instead of bluffing.

    Is governance by construction only for legal AI?

    No. The pattern is general — build an action space from a policy so unsafe actions are never instantiated. It's least-privilege for agents. Legal jurisdiction is just a clean, high-stakes example.

    How does it relate to human-in-the-loop and other guardrails?

    It's complementary and earlier. Human gates and output classifiers catch bad actions after they're proposed; construction means the worst ones are never proposed. Use construction for unsurvivable failures and runtime checks for survivable ones.

    Can I see it work?

    Yes — govcon is open source under AGPL-3.0, ~200 lines, with tests. The benchmark that scores it (HAQQ-LAB) is open too, with a live scorecard at haqq-lab.dashable.dev.

    Was kommt als Nächstes?

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    ROI berechnen

    Sehen Sie, wie viel Zeit und Geld HAQQ Ihrer Kanzlei spart

    380+ juristische Prompts durchsuchen

    Sofort einsatzbereite Prompts für jede juristische Aufgabe

    Zurück zum Blog

    Vorheriger Artikel

    Der Legal-AI-Benchmark für das Zivilrecht: Warum wir HAQQ-LAB gebaut haben

    Nächster Artikel

    Dürfen Anwälte KI nutzen? Ein Länder-Tracker (2026)

    Setzen Sie das ein

    Stellen Sie HAQQ die Frage, die dieser Artikel bei Ihnen aufgeworfen hat.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Ihr juristischer KI-Zwilling und Kanzleimanagement-System für Entwurf, Abrechnung und Gewinnen.

    Download on theApp StoreGet it onGoogle Play

    Dokumentationen

    • Docs wird in einem neuen Tab geöffnet
    • Erste Schritte wird in einem neuen Tab geöffnet
    • Presse wird in einem neuen Tab geöffnet
    • Produkt-Updates wird in einem neuen Tab geöffnet
    • Status wird in einem neuen Tab geöffnet
    • Sicherheit
    • FAQ wird in einem neuen Tab geöffnet
    • Community wird in einem neuen Tab geöffnet
    • Support wird in einem neuen Tab geöffnet

    Academy

    • Kurs wird in einem neuen Tab geöffnet
    • Skills wird in einem neuen Tab geöffnet
    • Klauseln wird in einem neuen Tab geöffnet
    • Prompt-Bibliothek wird in einem neuen Tab geöffnet
    • Tools wird in einem neuen Tab geöffnet
    • Research Hub wird in einem neuen Tab geöffnet
    • Dokumente wird in einem neuen Tab geöffnet

    Website

    • eFirm
    • Juristischer KI-Chat
    • Mobile App
    • Justinian KI-Engine
    • HAQQ eBar
    • HAQQ eWallet
    • Preise
    • Vergleichen Sie uns
    • Lösungen
    • Blog
    • Team kennenlernen
    • Mach mit wird in einem neuen Tab geöffnet
    App öffnen
    • Sprachenar en fr es it de pt
    • Kontaktinfo@haqq.ai
    • Statusbetriebsbereit·fundiert
    • Nutzungsbedingungen
    • Datenschutzrichtlinie
    • Cookie-Richtlinie
    • Datenverarbeitung wird in einem neuen Tab geöffnet
    • humans.txt wird in einem neuen Tab geöffnetlawyers.txt wird in einem neuen Tab geöffnetsecurity.txt wird in einem neuen Tab geöffnet
    © 2026 HAQQ Inc. Alle Rechte vorbehalten.Produkt intern von HAQQ entwickelt. Website mit modernen Web-Tools gebaut.