Skip to content
    HAQQ
    • Preise
    Kostenlos starten
    Kostenlos startenDemo buchen
    Einloggen
    1. Startseite
    2. Blog
    3. Legal-AI-Halluzination: Das gefälschte Zitat, das jede Prüfung besteht
    Zurück zum BlogKI & Rechtstechnologie

    Legal-AI-Halluzination: Das gefälschte Zitat, das jede Prüfung besteht

    Wir haben ein Frontier-Modell eine juristische Datenbank imitieren lassen. Es weigerte sich, erfundene Fälle zu erfinden, zitierte dann aber ein echtes Gesetz für den falschen Sachverhalt – die Halluzination, die eine anwaltliche Prüfung übersteht.

    June 30, 2026
    8 Min. Lesezeit
    |
    HAQQ Team
    Legal-AI-Halluzination: Das gefälschte Zitat, das jede Prüfung besteht

    TL;DR: Wir haben ein Frontier-Modell (Opus 4.8) in eine gefälschte Rechtsdatenbank verwandelt und geprüft, wo es Inhalte erfindet. Es weigerte sich, nicht existierende Zitate zu erfinden – 4 von 4 unmöglichen Referenzen kamen als „nicht gefunden" zurück. Bei einer plausiblen Anfrage erfand es jedoch die Suche selbst: eine gerankte Trefferliste mit einem frei erfundenen Relevanzwert und einem echten, anklickbaren Zitat, das auf das falsche Gesetz verwies. Die gefährliche Halluzination ist nicht der erfundene Fall, den man erwischt. Es ist das echte Zitat, das am falschen Inhalt hängt – und das Modell, das behauptet, etwas nachgeschlagen zu haben, obwohl es das nicht getan hat.

    Die Zahl, die jeder zitiert – und die, die alle übersehen

    Wer sich im letzten Jahr nach Legal AI umgesehen hat, kennt die erschreckende Statistik. Eine Stanford-Studie aus 2024 maß Halluzinationsraten von 43% bei GPT-4, 33% bei Westlaws KI-Recherche und 17% bei Lexis+. Eine separate Datenbank erfasst inzwischen über 1.000 Gerichtsfälle, in denen Anwälte von KI erfundene Zitate eingereicht haben. Manche wurden mit Geldstrafen belegt.

    Halluzinationsraten bei juristischen Recherchetools

    Stanford, 2024, Anteil der Antworten mit einer Halluzination

    GPT-4 (allgemeines LLM)
    43%
    Westlaw KI-Recherche
    33%
    Lexis+ AI
    17%

    Retrieval-gestützte Legal-Tools schlagen allgemeine Modelle, doch die verbleibenden Fehler werden subtiler – etwa ein echtes Zitat, das am falschen Gesetz hängt.

    Der Rat, der darauf folgt, ist immer derselbe: jedes Zitat verifizieren. Richtig, und fast nutzlos, denn er unterstellt, dass Halluzinationen wie offensichtliche Fälschungen aussehen. Die, die Anwälte in Sanktionen bringen, tun das nicht. Also haben wir ein Experiment durchgeführt, um zu sehen, wie sie tatsächlich aussehen.

    Das Experiment: das Modell zur Bibliothek machen

    Die meisten Halluzinationstests stellen einem Modell eine Rechtsfrage und bewerten die Antwort. Wir haben etwas Ungewöhnlicheres gemacht. Mit einem Open-Source-Tool, world-model-harness, ließen wir Opus 4.8 die Rechtsdatenbank selbst spielen – die Suchmaschine, nicht den Anwalt.

    Der Aufbau in einfachen Worten: Wir haben echte Rechtsrechercheläufe gegen eine reale, jurisdiktionsübergreifende Datenbank aufgezeichnet – Gesetze und Rechtsprechung aus der EU, Frankreich und Deutschland. Dann haben wir das Modell trainiert, diese Datenbank zu spielen: Man schickt eine Anfrage, es liefert zurück, was die Datenbank seiner Meinung nach liefern würde – Suchtreffer, Dokumenttext, Zitate. Eine echte Datenbank ruft ab. Unsere sagt voraus. Die Lücke zwischen beidem ist die Halluzination, isoliert unter dem Mikroskop.

    Ein Geständnis aus dem Bauprozess: Unser erster Durchlauf zeigte fast 100% Zitatgenauigkeit, und wir haben fast gefeiert. Dann merkten wir, dass wir den Cache testeten, nicht das Modell – wir hatten ihm Anfragen vorgelegt, die es bereits kannte, also gab es einfach die echten Antworten wieder zurück. Für einen Nachmittag peinlich, für immer lehrreich: Der einzig ehrliche Test einer Legal AI läuft mit Fragen, die sie noch nie gesehen hat.

    Befund 1: Es erfindet kein Zitat aus dem Nichts

    Wir haben der gefälschten Bibliothek vier Referenzen vorgelegt, die es nirgendwo gibt: eine erfundene EU-Verordnung, einen fingierten Artikel des französischen Code civil, eine sinnlose CELEX-Dokumentnummer und einen erfundenen deutschen Verfassungsgerichtsfall.

    Alle vier Male antwortete es so, wie es eine echte Datenbank tun würde: Auflösung fehlgeschlagen, nicht gefunden. Es hat keinen plausiblen Fall erfunden, um die Lücke zu füllen. Das ist tatsächlich eine gute Nachricht und es wert, laut ausgesprochen zu werden. Frontier-Modelle sind 2026 deutlich besser kalibriert, als der Ruf „die erfinden einfach alles" nahelegt. Nach etwas Unmöglichem gefragt, lehnte Opus 4.8 ab. Wäre das die ganze Geschichte, könnte man sich entspannen. Ist sie nicht.

    Befund 2: Es erfindet die Suche selbst

    Dann stellten wir ihm etwas Plausibles, aber Ungesehenes: eine Frage zu den Regeln des EU AI Acts für Hochrisikosysteme. Das Modell produzierte eine vollständige, gerankte Datenbankantwort: mehrere Treffer, Daten aus dem Amtsblatt, einen Relevanzwert von 0,71243286 – alles so präsentiert, als käme es direkt aus EUR-Lex. Nichts davon wurde tatsächlich abgerufen. Es gab keinen Index, keine Suche, keinen Score. Es hat den Akt des Nachschlagens frei erfunden. Und die Zitate, die es lieferte, sind das Musterbeispiel dafür, warum das wichtig ist:

    • CELEX 32024R1689, echt und korrekt. Das ist tatsächlich der EU AI Act. Beeindruckende Trefferquote.
    • CELEX 32024R0900, echt, anklickbar und falsch. Dieses Zitat löst sich auf EUR-Lex einwandfrei auf – zur Verordnung (EU) 2024/900 über die Transparenz politischer Werbung. Sie hat nichts mit KI-Konformität zu tun.

    Genau das zweite ist der springende Punkt. Es ist kein gefälschtes Zitat – ein gefälschtes Zitat ist leicht zu erwischen, weil es sich nicht auflöst. Das hier ist ein echtes Zitat, das am falschen Gesetz hängt. Zitatprüfer nennen das ein Name/Cite-Mismatch. Man klickt darauf, eine offizielle EU-Verordnung lädt, alles wirkt legitim – und man hat sein Argument gerade im Werberecht verankert, während man dachte, es sei KI-Recht. Jeder Link löst sich auf. Nichts sieht falsch aus.

    Ehrlicher Vorbehalt: Das ist ein scharfer Proof-of-Concept, kein Benchmark – ein kleiner Korpus und eine einzige erwischte Fabrikation über eine Handvoll Prüfungen hinweg. Wir behaupten keine Rate. Wir zeigen Ihnen ein Muster.

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    Warum dieser Fehler die Prüfung übersteht

    Zurück zum Standardrat: jedes Zitat verifizieren. Jetzt sehen wir, wie er versagt. Der Anwalt prüft das AI-Act-Zitat, echt. Prüft das nächste, auch echt, lädt einwandfrei. Verifizierung bestanden, denn Verifizierung bedeutet meist: funktioniert dieser Link, und jeder Link funktionierte. Der Fehler liegt nicht darin, ob das Zitat existiert. Er liegt darin, ob es das sagt, was das Modell behauptet hat – deutlich schwerer zu erwischen, und genau die Art von Fehler, die am Ende in einem Schriftsatz landet.

    Die tiefere Lehre betrifft, wo die Lüge eigentlich sitzt. Wir sorgen uns instinktiv, dass das Modell das Recht falsch versteht. Das eigentliche Risiko ist, dass es den Abruf falsch macht – dass der Satz „ich habe die Datenbank durchsucht und das gefunden" selbst die Halluzination ist, komplett mit einem gefälschten Konfidenzwert, der sie verkauft.

    HAQQs Einschätzung: Der Abruf ist die Halluzination

    Das ist der Grund, warum wir HAQQs Antworten in echtem Abruf verankern, statt ein Modell zu bitten, sich an das Recht aus dem Gedächtnis zu erinnern. Nicht weil Modelle dumm wären – dieses hier hat jedes unmögliche Zitat abgelehnt und die Nummer des AI Acts treffsicher genannt. Aber ein Modell, das zur Quelle gemacht wird, wird irgendwann den Abruf vortäuschen, den es nicht durchgeführt hat. Die einzige Lösung besteht darin, den Abruf echt zu machen: das tatsächliche Dokument aus einem tatsächlichen Index ziehen und dann verifizieren, dass sich das Zitat auf den Fall auflöst, den das Modell genannt hat – nicht nur auf irgendeinen Fall.

    Daraus folgt eine Frage für Käufer. Fragen Sie einen Legal-AI-Anbieter nicht, ob er halluziniert – jeder sagt nein. Fragen Sie stattdessen: Wenn Sie mir ein Zitat zeigen, haben Sie genau dieses Dokument abgerufen, und prüfen Sie, ob der Fallname zum Zitat passt? Das Name/Cite-Mismatch ist der Verräter. Ein Tool, das nur prüft, ob Zitate formal korrekt aussehen, lässt 32024R0900 anstandslos durchwinken.

    Die wichtigsten Erkenntnisse

    • Ein gut kalibriertes Frontier-Modell erfindet keine Zitate aus dem Nichts – es lehnte 4 von 4 unmöglichen Referenzen ab.
    • Bei plausiblen Anfragen erfindet es den Abruf selbst – inklusive gefälschtem Relevanzwert und einem echten Zitat, das auf das falsche Gesetz verweist.
    • Die gefährliche Halluzination ist die, die die Verifizierung besteht – jeder Link löst sich auf, nur der Inhalt stimmt nicht.
    • Legal AI in echtem Abruf plus Zitatabgleich verankern und Anbieter danach beurteilen, ob sie prüfen, dass ein Zitat das sagt, was sie behaupten – nicht nur, dass es existiert.

    Quellen & weiterführende Lektüre

    • Stanford: Assessing the Reliability of Leading AI Legal Research Tools (2024)
    • What the Science Says About Hallucinations in Legal Research (LLRX)
    • world-model-harness, das von uns verwendete Open-Source-Tool
    H

    HAQQ Team

    AI Research

    Verwandte Ressourcen

    Best legal AI tools 2026Can AI give legal advice?

    Verwandte Artikel

    KI-Halluzinationsfälle: Der Sanktions-Tracker mit 1,598 Fällen

    KI-Halluzinationsfälle: Der Sanktions-Tracker mit 1,598 Fällen

    ChatGPT für Anwälte 2026: Was es gut kann und wo juristische KI gewinnt

    ChatGPT für Anwälte 2026: Was es gut kann und wo juristische KI gewinnt

    KI-Halluzinationen im Recht: 1,313 Gerichtsverfahren  -  Tendenz steigend

    KI-Halluzinationen im Recht: 1,313 Gerichtsverfahren - Tendenz steigend

    Häufig gestellte Fragen

    Do AI legal research tools still hallucinate in 2026?

    Yes, but the rate depends heavily on architecture. General models hallucinate most; tools that ground answers in real documents (retrieval-augmented generation) hallucinate far less. A 2024 Stanford study measured 43% for GPT-4 versus 17 to 33% for retrieval-based legal tools. The errors that remain are subtler, like a real citation attached to the wrong law.

    What is a name/cite mismatch?

    It is when a citation is real and resolves to an actual document, but to a different case or law than the one named. It passes a naive does-this-link-work check, which makes it more dangerous than an obviously fake citation, because nothing looks wrong on the surface.

    Is retrieval-augmented generation (RAG) enough to stop hallucinations?

    It reduces them dramatically but is not magic. RAG can still surface a real document and misattribute it. The step that matters is verification: confirming the retrieved citation matches the claim, not just that it exists.

    How should a lawyer verify AI-generated citations?

    Check that each citation resolves and that the document it resolves to actually says what the AI claims: the holding, the regulation's subject, the article number. The mismatch hides in the second step, not the first.

    Can you trust AI to do legal research?

    Only with verification and the right architecture. Treat AI output like a fast but junior researcher: useful for speed, never the final authority. Prefer tools that retrieve from real sources and check that citations match the claim before you rely on them.

    Was kommt als Nächstes?

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    ROI berechnen

    Sehen Sie, wie viel Zeit und Geld HAQQ Ihrer Kanzlei spart

    380+ juristische Prompts durchsuchen

    Sofort einsatzbereite Prompts für jede juristische Aufgabe

    Zurück zum Blog

    Vorheriger Artikel

    Ist es sicher, ChatGPT für Ihre Scheidung zu nutzen? Was das Vertraulichkeitsurteil von 2026 ändert

    Nächster Artikel

    Was ist ein KI-nativer Anwalt? Der Überlebensplan

    Setzen Sie das ein

    Stellen Sie HAQQ die Frage, die dieser Artikel bei Ihnen aufgeworfen hat.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Ihr juristischer KI-Zwilling und Kanzleimanagement-System für Entwurf, Abrechnung und Gewinnen.

    Download on theApp StoreGet it onGoogle Play

    Dokumentationen

    • Docs wird in einem neuen Tab geöffnet
    • Erste Schritte wird in einem neuen Tab geöffnet
    • Presse wird in einem neuen Tab geöffnet
    • Produkt-Updates wird in einem neuen Tab geöffnet
    • Status wird in einem neuen Tab geöffnet
    • Sicherheit
    • FAQ wird in einem neuen Tab geöffnet
    • Community wird in einem neuen Tab geöffnet
    • Support wird in einem neuen Tab geöffnet

    Academy

    • Kurs wird in einem neuen Tab geöffnet
    • Skills wird in einem neuen Tab geöffnet
    • Klauseln wird in einem neuen Tab geöffnet
    • Prompt-Bibliothek wird in einem neuen Tab geöffnet
    • Tools wird in einem neuen Tab geöffnet
    • Research Hub wird in einem neuen Tab geöffnet
    • Dokumente wird in einem neuen Tab geöffnet

    Website

    • eFirm
    • Juristischer KI-Chat
    • Mobile App
    • Justinian KI-Engine
    • HAQQ eBar
    • HAQQ eWallet
    • Preise
    • Vergleichen Sie uns
    • Lösungen
    • Blog
    • Team kennenlernen
    • Mach mit wird in einem neuen Tab geöffnet
    App öffnen
    • Sprachenar en fr es it de pt
    • Kontaktinfo@haqq.ai
    • Statusbetriebsbereit·fundiert
    • Nutzungsbedingungen
    • Datenschutzrichtlinie
    • Cookie-Richtlinie
    • Datenverarbeitung wird in einem neuen Tab geöffnet
    • humans.txt wird in einem neuen Tab geöffnetlawyers.txt wird in einem neuen Tab geöffnetsecurity.txt wird in einem neuen Tab geöffnet
    © 2026 HAQQ Inc. Alle Rechte vorbehalten.Produkt intern von HAQQ entwickelt. Website mit modernen Web-Tools gebaut.