Skip to content
    HAQQ
    • Preise
    Kostenlos starten
    Kostenlos startenDemo buchen
    Einloggen
    1. Startseite
    2. Blog
    3. Jev in einer juristischen KI-Architektur: 8 Entscheidungsmuster und die Grenze, die wir gemessen haben
    KI & Rechtstechnologie

    Jev in einer juristischen KI-Architektur: 8 Entscheidungsmuster und die Grenze, die wir gemessen haben

    Wir haben TypeSafes Jev für unter 0,20 $ durch unseren Legal-Stack laufen lassen. Erfundene Fundstellen bewertete es höher als ehrliche.

    September 23, 2026
    20 Min. Lesezeit
    |
    HAQQ Team
    Jev in einer juristischen KI-Architektur: 8 Entscheidungsmuster und die Grenze, die wir gemessen haben

    Kurz gesagt: Wir haben weniger als 0,20 US-Dollar ausgegeben, um zu testen, ob ein Modell, das keinen Text generiert, in unseren Legal AI Stack gehört. Es gehört hinein - an drei Stellen. An einer davon läuft es bereits in Produktion. An drei weiteren Stellen hat es versagt, und eines dieser Versagen kehrte sich so vollständig um, dass Antworten mit gefälschten Zitaten höher bewertet wurden als ehrliche. Die daraus entstandene Regel ist der nützliche Teil: Diese Art von Modell ist stark, wenn ein Urteil eine objektive Antwort hat, die die gelieferten Beweise klären, und schwach, wo immer das Urteil Geschmackssache ist.

    Das Argument, und warum wir es ernst genommen haben

    Es gibt ein Argument, dass die meisten AI-Agenten ihre teuerste Ressource für Entscheidungen verschwenden, die niemals einen Satz benötigten. Eine Anfrage an das richtige Modell weiterzuleiten, ist eine Entscheidung. Zu entscheiden, ob ein Tool-Aufruf sicher ist, ist eine Entscheidung. Fünfzig abgerufene Dokumente zu ordnen, sind fünfzig Entscheidungen. Keine davon erzeugt Prosa, die jemand liest, doch alle werden einem Modell übergeben, das nach Wörtern abrechnet und in Absätzen antwortet.

    Im September 2026 lieferte TypeSafe AI ein Modell, das auf diesem Argument aufbaut. Jev ist das, was sie ein System One Modell nennen, und die definierende Eigenschaft ist, dass es überhaupt keinen Text generiert. Man POSTet einen Zustandsblock plus eine Reihe von typisierten Fragen, und man erhält kalibrierte Wahrscheinlichkeiten zurück, die alle in einem einzigen parallelen Roundtrip ausgewertet werden.

    Es gibt drei Primitive und keine vierte. Ein Noul ist eine Ja- oder Nein-Frage, die eine Wahrscheinlichkeit zwischen 0 und 1 zurückgibt, und diese Wahrscheinlichkeit ist das Vertrauen: 0,5 bedeutet einen Münzwurf, nicht mittlere Intensität. Eine Wahl wählt eine Option aus einer von Ihnen definierten Liste, und sie kann physisch keine Option zurückgeben, die Sie nicht deklariert haben. Eine Bewertung platziert die Eingabe auf einer geordneten Skala, die Sie in Worten beschreiben, und gibt den wahrscheinlichkeitsgewichteten Mittelwert zurück, so dass eine 70/30-Aufteilung über zwei Ebenen als 1,30 statt 1 oder 2 zurückkommt.

    Das ist die gesamte Oberfläche. Es kann nicht zusammenfassen, umschreiben, entwerfen, einen Abschnitt extrahieren oder etwas nachschlagen. Es hat keine Wissensbasis und keine Abrufmöglichkeit. Es beantwortet Fragen, deren Antwortraum Sie deklariert haben, über einen Zustand, den Sie ihm übergeben haben.

    Der Teil, der leicht zu übersehen ist

    Der Instinkt ist, dies als billigen, schnellen Klassifikator abzutun. Das unterschätzt jedoch, was sich tatsächlich geändert hat, nämlich nicht der Preis, sondern die Reihenfolge.

    Ein Sprachmodell schreibt ein Token nach dem anderen, sodass Token neun erst existieren kann, wenn Token acht existiert. Wenn Sie vier unabhängige Fragen zu einem Vertrag stellen, reihen sich diese vier unabhängigen Urteile hintereinander ein, kommen als Blob zurück, den Sie dann parsen, validieren und erneut versuchen, wenn die Form falsch ist. Jev löscht die Warteschlange. Sie deklarieren den Antwortraum im Voraus, und jede Frage wird gleichzeitig mit demselben Zustand gelöst. Text ist eine Linie, die man gehen muss. Ein Antwortraum ist ein Raum, den man auf einmal sieht.

    Frontier SprachmodellJev
    AusgabeEine Zeichenfolge, die Sie parsen und validierenEin typisierter Wert, auf den Ihr Code verzweigt
    ReihenfolgeSequentiell, jedes Token abhängig vom letztenKeine, alle Fragen parallel
    UnsicherheitVerborgen in selbstbewusster ProsaEine explizite Wahrscheinlichkeit für jede Option
    FehlermodusFehlgeformte Gestalt, erfundene Option, AblehnungEine schema-gültige falsche Antwort
    Kann es schreiben?Ja, das ist das ProduktNein. Kein Satz, kein Abschnitt, kein Code
    Kann es Dinge nachschlagen?Mit Tools, jaNie. Kein Abruf, keine Wissensbasis

    Diese Fehlermodus-Zeile ist diejenige, die im Recht zählt, und man sollte offen darüber sprechen. Die angebotene Garantie ist, dass Sie niemals einen Wert außerhalb Ihres Schemas erhalten werden. Es ist keine Garantie, dass der Wert richtig ist.

    Ein schemavalider Fehler erstattet dem falschen Klienten genauso schnell den Betrag wie ein fehlerhafter.

    Für ein Legal AI Unternehmen ist das interessante Wort in all dem kalibriert. Eine Zahl, auf die man im Code verzweigen kann, ist ein anderes Objekt als ein Absatz, den ein Anwalt lesen und dem er vertrauen muss. Wir haben in unserem Beitrag zur Orchestrierungsschicht geschrieben, dass der Teil der Legal AI, der bestimmt, ob die Zitate stimmen, von außen unsichtbar ist. Dies ist ein Kandidat, um einen Teil dieses unsichtbaren Bereichs auszufüllen.

    Also haben wir es über unseren gesamten Stack laufen lassen. Jede Messung unten ist unsere, auf unserem eigenen Korpus, und die, die schlecht liefen, sind auch hier.

    Was wir gemessen haben und was es gekostet hat

    Zehn Oberflächen, dreizehn geschlossene Tickets, insgesamt unter 0,20 $ Kosten. Das ist kein Prahlen mit Sparsamkeit. Es ist der Grund, warum das Experiment überhaupt durchgeführt werden konnte: Für den Bruchteil eines Cents pro Urteil kann man es sich leisten, jedes Ereignis zu überprüfen, anstatt Stichproben zu nehmen, und ein Nullergebnis kostet fast nichts, um es festzustellen.

    Latenz, gemessen an unserem eigenen Traffic mit einer offen gehaltenen warmen Verbindung: 292 ms im Median, 374 ms bei p90, 395 ms bei p95, über 40 Aufrufe hinweg. Allein die serverseitige Berechnung beträgt 112 ms. Unsere eigene erste Messung ergab 700 ms, und wir wiederholten diese Zahl intern eine Woche lang, bevor wir bemerkten, dass sie falsch war. Wir hatten nie eine Verbindung wiederverwendet, so dass jeder Aufruf für einen neuen Handshake bezahlte. Dieselbe API, dieselbe Modellversion, eine sorgfältige Messung des Falschen. Es ist eine kleine Verlegenheit und eine nützliche, denn es ist genau die Art von Fehler, die einen Benchmark einen Monat später unproduzierbar macht.

    Acht Muster, und welche wir tatsächlich getestet haben

    Sieben davon kursierten als Musterliste eines Entwicklers. Das achte ist unser eigenes, und es ist dasjenige, das sich für die juristische Arbeit als am wichtigsten erweist.

    • Modell-Routing. Vorhersage der Aufgabenkomplexität, Senden der einfachen Arbeit an ein kleines Modell und der schwierigen Arbeit an ein Spitzenmodell.
    • Risikoprüfungen bei Tool-Aufrufen. Bevor ein Agent ein Tool ausführt, bewerten Sie das Tool, seine Argumente und die aktuelle Aufgabe und geben Sie "zulassen", "blockieren" oder "menschliche Genehmigung" zurück.
    • Absichts- und Domänen-Triage. Klassifizieren Sie die Anfrage in eine feste Reihe von Absichten, bevor der Hauptagent mit der Überlegung beginnt. Im juristischen Bereich sind dies die Gerichtsbarkeit, der Rechtsbereich und das Ergebnis.
    • Schleifenentscheidungen. Nach jedem Agentenschritt vorhersagen, ob ein weiterer Schritt wahrscheinlich nützlich sein wird.
    • Abruf-Neubewertung. Bewerten Sie jede abgerufene Passage anhand der Abfrage und übergeben Sie nur die am höchsten bewerteten in den Kontext.
    • Leitplanken und Richtlinienprüfungen. Führen Sie Sicherheits- und Compliance-Prüfungen als schnelle Klassifizierungen durch, anstatt eine vollständige Begründungsantwort zu generieren.
    • Eskalation an einen Menschen. Vorhersagen, ob eine automatisierte Entscheidung zuverlässig genug ist, um ausgeführt zu werden.
    • Wörtliche Kontextverdichtung. Bewerten Sie jeden Schritt einer langen Agentenverfolgung danach, ob er noch dem Ziel dient, lassen Sie die unnötigen fallen und behalten Sie die überlebenden wörtlich bei.

    Wir haben nun sechs davon mit unseren eigenen Daten gemessen. Drei funktionieren, eine davon ist heute in Produktion. Drei funktionieren nicht. Die Misserfolge erhalten unten mehr Raum, weil sie instruktiver sind und weil niemand sonst sie veröffentlicht.

    Ein Hinweis zur Umgebung: Eine kleine Anzahl von Tools, die auf demselben Stack basieren, existiert bereits für die Überprüfung juristischer Zitate, alle innerhalb der letzten zwei Wochen ausgeliefert. Es handelt sich dabei eher um frühe Experimente als um funktionierende Produkte, und keines veröffentlicht eine Genauigkeitsangabe. Die Lücke, in die wir schreiben, ist nicht, dass niemand diese Idee hatte. Es ist, dass niemand veröffentlicht hat, was passiert, wenn man sie überprüft.

    Wo es funktioniert: Neubewertung des Abrufs

    Unser MENA-Gesetzeskorpus enthält 17.004 Artikel. Die Abfrage erfolgt zunächst lexikalisch, was bedeutet, dass eine Abfrage und ein Artikel, die unterschiedliche Wörter für dieselbe Verpflichtung verwenden, sich vollständig verfehlen können. Dies ist das übliche Versagen der juristischen Suche in jeder Sprache, und es ist im Arabischen schlimmer, wo die Morphologie eine größere Distanz zwischen einem Suchbegriff und seiner Übereinstimmung schafft.

    Wir nahmen 80 zurückgehaltene Abfragen, führten sie durch die bestehende Abfrage aus und ordneten dann die Kandidaten neu, indem wir eine Frage pro Kandidat stellten: Beantwortet dieser Artikel diese Frage?

    Neuanordnung eines Gesetzeskorpus mit 17.004 Artikeln

    Anteil von 80 zurückgehaltenen Abfragen, bei denen der richtige Artikel zuerst zurückkam

    Rein lexikalische Abfrage
    63.8%
    Nach Neuanordnung jedes Kandidaten
    85.0%
    Obergrenze: Was eine Abfrage jemals zutage fördern könnte
    88.8%

    Bei neun der 80 Abfragen wurde der richtige Artikel überhaupt nicht abgerufen, so dass kein Reranker ihn befördern konnte. Die Abfragen wurden aus den Stichprobenartikeln erstellt, was die lexikalische Abfrage schmeichelt, lesen Sie also das Delta und nicht die absoluten Zahlen.

    Der mittlere reziproke Rang verschob sich von 0,719 auf 0,869. Zehn von zehn manuell überprüften Fällen stimmten überein, darunter zwei, bei denen das Modell korrekterweise nichts beförderte, da kein gültiger Kandidat existierte. Gesamtkosten: 0,0245 $.

    Ein weiterer Vorbehalt. Unsere arabischen und englischen Artikel sind nach Gerichtsbarkeit aufgeteilt, jeder arabische ist ägyptisch und jeder englische ist emiratisch, daher unterstützt dieser Durchlauf keinerlei Aussage über Sprache.

    Es funktioniert, weil die Frage eine richtige Antwort hat. Ob dieser Artikel diese Frage beantwortet, wird durch den Artikel und die Frage selbst bestimmt, die beide dem Modell vorliegen.

    Wo es funktioniert: Antworten erkennen, die keine Antworten sind

    Bevor wir Jev einführten, bewerteten wir Benchmark-Antworten mit einem Sprachmodell, das als Richter fungierte. Dieser Richter war in einer spezifischen und schädlichen Weise großzügig. Er vergab eine perfekte 10,0 an 56 % der bewerteten Antworten, und bei einem Modell waren 90 % der Antworten in allen vier Dimensionen makellos. Ein Bewerter ohne Obergrenze misst nichts am oberen Ende seines Bereichs.

    Jev bewertete 0 % der Antworten mit 9,9 oder höher. Nützlicher war, dass es alle fünf abgeschnittenen API-Fehler im Set mit Wahrscheinlichkeiten zwischen 0,96 und 0,97 erkannte. Der frühere Richter hatte dieselben fünf mit 1 von 10 bewertet und sie in den Modellfähigkeitswert eingerechnet, was bedeutete, dass wir eine 10%ige Infrastrukturfehlerquote als rechtliche Inkompetenz gemeldet hatten. Der Ausschluss dieser Fehler verschob ein Modell von 5,80 auf 7,67.

    Das Wertvollste, was das Modell für unsere Benchmarks tat, war nicht die Beurteilung der Qualität. Es war die Feststellung, dass eine Zeichenfolge keine Antwort war.

    Wo es in der Produktion funktioniert: Das Regex-Muster des Compliance-Gates konnte es nicht sehen

    Dieser Fall ist aktuell und hat sich seinen Platz verdient, indem er etwas Peinliches aufdeckte.

    Wir überprüfen jeden öffentlichen Text vor der Veröffentlichung mit einem Preflight-Gate und gleichen ihn mit unseren eigenen Messaging-Regeln ab. Einige dieser Regeln sind rote Linien: Wir sagen nicht, dass wir Anwälte ersetzen, und wir behaupten nicht, dass unsere KI frei von Halluzinationen ist, denn beides ist nicht wahr und beides sind Behauptungen, die ein Regulierer genau prüfen würde.

    Ein französischer Entwurf, der wörtliche Verstöße gegen beide Regeln enthielt, passierte dieses Gate mit exit 0 und null Feststellungen. Die Regex-Muster waren nur englischsprachig. Die französische Formulierung für "wir ersetzen Anwälte" und die französische Formulierung für "unsere KI hat keine Halluzinationen" passierten eine Prüfung, die ihre englischen Äquivalente sofort gestoppt hätte.

    Eine semantische Überprüfung erkannte beides eindeutig: 0,90 bei der impliziten Behauptung, 0,95 bei der roten Linie der Anwaltserfassung, 0,83 bei der Einschätzung, wie ein Regulierer es lesen würde. Kosten pro Entwurf: etwa 0,00005 $, verteilt auf acht eingegebene Fragen in einer parallelen Anfrage.

    Das Ergebnis, das wir nicht erwartet hatten, ist, dass Regex und Semantik sich eher als komplementär denn als redundant erwiesen haben. Wir gingen davon aus, dass das eine das andere überflüssig machen würde, und haben in 35 realen Entwürfen gemessen, dass jede Regex-Regel mit einem semantischen Gegenstück eine andere Formulierung desselben Risikos erfasste. Die Regex erfasst die wörtliche Formulierung. Der semantische Durchlauf erfasst die Paraphrase. Unser eigenes Ticket sagte voraus, dass wir etwas abschaffen könnten, aber die Daten sagten nein.

    Wo es sich umkehrte: die Frage, ob ein Zitat begründet ist

    Nun der Fehler, der unser Denken neu geordnet hat.

    Wir baten Jev, die Begründung von 150 echten Rechtsantworten zu bewerten, die von drei führenden Modellen über 50 MENA- und UK-Prompts hinweg erstellt wurden. Begründung bedeutet hier: Werden die Behauptungen gestützt, sind die Zitate echt und korrekt verwendet? Dies ist die wichtigste Frage in der Rechts-KI, und es ist die Frage, die unser eigener Halluzinationsaudit immer wieder stellt.

    Antworten mit erfundenen Zitaten erreichten 3.21. Ehrliche Antworten erreichten 2.79. Die Korrelation zwischen dem Gesamtscore und den von Menschen überprüften Genauigkeitslabels betrug r = +0.02, das heißt, es gab keine.

    Die Überprüfung konnte die Fälschung nicht nur nicht erkennen. Sie belohnte sie.

    Sobald Sie sehen, warum, können Sie es nicht mehr ungeschehen machen. Artikel 5bis des Königlichen Dekrets M/13 klingt präzise, spezifisch und autoritär. Er existiert nicht. Ein Modell, das die Begründung allein aus dem Text beurteilen soll, hat nichts zum Vergleich, daher greift es auf die Merkmale zurück, die normalerweise mit begründetem Schreiben einhergehen: Spezifität, Zitierdichte, selbstbewusste Struktur. Fälschung erzeugt alle drei. Spezifität ist das, wonach Fälschung aussieht, daher belohnt jede Rubrik, die Spezifität belohnt, auch Fälschung.

    Ändern Sie nun eine Sache. Geben Sie dem Modell den Quelltext neben der Behauptung und fragen Sie, ob dieser Text diese Behauptung stützt. Bei einem separaten, reproduzierbaren Lauf mit 180 Paaren aus unserem eigenen Korpus erreichte das gehostete Modell eine AUC von 0,9962 und erfasste 94,4 % der Fehlzuordnungen bei einer Rate von null Fehlalarmen.

    Gleiches Modell. Gleiche Aufgabe im abstrakten Sinn. Gegenteiliges Ergebnis, weil eine Version ein Vergleich zwischen zwei Dingen vor ihm ist und die andere eine Wissenssuche, die es nicht durchführen kann.

    Noch ein Vorbehalt, denn er ist wichtiger als der Gewinn. Auf demselben 180-Paar-Set erzielt eine einfache Überprüfung der Eindämmung mit `grep` eine AUC von 0,9944 und fängt 98,9 %. Diese Paare wurden auf wörtlicher Eindämmung aufgebaut, wofür `grep` genau gemacht ist. Betrachten Sie 0,9962 eher als Untergrenze denn als Obergrenze und behandeln Sie die Begründung auf Paraphrasen-Ebene, wo ein getippter Klassifikator seinen Wert tatsächlich unter Beweis stellen sollte, als durch diesen Lauf ungetestet.

    Das Abrufen ist kein Implementierungsdetail unter dem Verifizierungsschritt. Das Abrufen ermöglicht die Verifizierung überhaupt erst.

    Wo es gegen einen Schrittzähler verlor: Schleifensteuerung

    Wir haben dies speziell für diesen Beitrag getestet, und es hat nicht überlebt.

    Das Muster besagt: Fragen Sie nach jedem Agentenschritt, ob ein weiterer Schritt wahrscheinlich nützlich ist, und stoppen Sie, wenn die Antwort nein ist. Wir haben den Test aus 52 unserer eigenen abgeschlossenen Agenten-Trajektorien erstellt, 1.750 markierte Schritte. Die Grundwahrheit für jeden Schritt war, ob der nächste Schritt tatsächlich Informationen ans Licht brachte, die nicht bereits irgendwo in der Trajektorie vorhanden waren, berechnet durch eine Regel, die wir bei 24 von 25 manuell überprüft haben.

    Vorhersage, ob ein Agent einen weiteren Schritt unternehmen sollte

    Fläche unter der ROC-Kurve, 1.750 markierte Schritte über 52 abgeschlossene Trajektorien

    Ein einfacher Zähler der bisher unternommenen Schritte (kostenlos)
    0.670
    Haben die letzten 3 Schritte etwas Neues ergeben (kostenlos)
    0.702
    Jev, eine getippte Frage pro Schritt (0,54 $)
    0.718

    Der Abstand zwischen Jev und dem zweiten freien Signal beträgt +0,017, mit einem 95%-Konfidenzintervall von -0,010 bis +0,051. Es übersteht keinen gepaarten Bootstrap. Gesparte Schritte bei Null Verlust nützlicher Arbeit: Null, für alle drei.

    Wir haben 0,54 $ bezahlt, um eine Funktion, die mit einer Mengendifferenz berechnet wurde, nicht zu übertreffen.

    Zwei Dinge darunter sind mehr wert als die Überschrift. Das erste ist, dass eine Flaute keine Erschöpfung ist. Die freie Regel unterbricht nach zwei aufeinanderfolgenden Schritten, die nichts Neues zurückgaben, als Orakel auf eigener Prämisse ausgeführt, beschädigte 30 der 31 Trajektorien, die sie stoppte. Agenten werden mitten in nützlicher Arbeit ständig still.

    Das zweite erklärt das gesamte Ergebnis. Teilt man die Zeilen danach, welche Art von Werkzeug der nächste Schritt verwendete, ändert sich das Bild vollständig: 0,742, wenn der nächste Schritt eine Datei schreibt oder bearbeitet, 0,695, wenn er liest oder sucht, und 0,597, fast Zufall, bei Shell-Befehlen, wo 59% unserer Zeilen leben.

    Es hat nie vorhergesagt, ob der Agent genug gelernt hatte. Es hat vorhergesagt, ob das nächste, was zurückkommt, eine Schreibbestätigung oder eine Ausgabeseite sein würde. Das ist ein Urteil über die Form des nächsten Ereignisses, nicht über den Zustand des Agentenwissens.

    Ganz ehrlich: Unser Korpus besteht aus Code- und Forschungsagenten, nicht aus juristischen Denkprozessen, und die Obergrenze der Einsparungen war von Anfang an niedrig, denn ein fertiges Transkript ist per Definition eines, das ungefähr dann aufhörte, als die Informationen aufhörten. Beide Fakten begrenzen, wie weit es sich verallgemeinern lässt. Keine rettet das Muster.

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    Wo es gegen einen regulären Ausdruck verlor: Werkzeugaufruf-Risikogates

    Das letzte Muster, das wir getestet haben, und das unangenehmste, denn wir wollten, dass dieses funktioniert.

    Wir betreiben eine Infrastruktur, die nicht offline gehen darf. Die Regel, die sie schützt, befindet sich derzeit in einer Konfigurationsdatei, die ein Agent lesen und befolgen soll. Eine Regel, die vom Lesen abhängt, ist keine Kontrolle. Ein Gate, das beim Aufruf feuert, ist es.

    Also haben wir 19.922 echte Werkzeugaufrufe aus 766 unserer eigenen Transkripte beschriftet, 284 davon bewertet und einen typisierten Klassifikator mit der Sperrliste verglichen, die man tatsächlich von Hand schreiben würde.

    Ground TruthnJevSperrliste, naivSperrliste, Stahlmensch
    Sicheres Lesen121120/121121/121120/121
    Zerstörend119106/119118/119118/119
    Könnte einen Live-Host offline nehmen4425/448/4420/44

    Wir verlangten, dass jeder destruktive Anruf abgefangen wird. Der Klassifikator erreichte 89,1 %, unterhalb beider Deny-Lists. Der Regex gewinnt die Klasse, für die der Test existierte.

    Darin steckt ein echter Gewinn. Bei der engen Frage, ob ein bestimmter Anruf einen Live-Host offline schalten könnte, wurden bei einer dedizierten Ja-oder-Nein-Frage 21 von 22 mit einer Fehlalarmrate von 3,4 % erfasst, während die stärkere von zwei handgeschriebenen Deny-Lists 8 von 22 erfasste. Vereinigt man beide, halbiert sich die Rate der durchrutschenden risikoreichen Anrufe. Bei elf Cent pro tausend Anrufe sind die Kosten nicht das, was Sie aufhält. Die Empfehlung, die sich daraus ergab, ist immer noch, den Regex zu versenden und den Klassifikator als zweite Meinung zu behalten, niemals als Tor.

    Das sauberste Ergebnis im gesamten Programm steckt in diesem Test, und es geht mehr darum, wie man fragt, als darum, was man fragt. Dasselbe Modell, dieselben Zeilen, derselbe Nachmittag. Die konkrete Frage, ob dieser Anruf einen dieser spezifischen Live-Hosts offline schalten kann, erreichte eine Rückrufquote von 95,5 % bei einer Fehlalarmrate von 3,4 %. Die abstrakte Frage, ob diese Aktion irreversibel ist, benötigte einen viel lockereren Schwellenwert, um eine vergleichbare Rückrufquote zu erreichen, und zog die Fehlalarmrate dabei auf 34,6 % hoch.

    Wir hatten dies bereits gelernt und als Maxime niedergeschrieben: Benenne den konkreten Test, nicht die abstrakte Kategorie. Dies ist das erste Mal, dass wir es als kontrollierten Vergleich statt als Anekdote haben, und die Größe der Lücke überraschte uns.

    Noch etwas aus diesem Test, mit seinen Einschränkungen. Wir haben versucht, den Klassifikator dazu zu bringen, blockierte Anrufe zu genehmigen, indem wir acht handgeschriebene Injection-Payloads über 384 gepaarte Anrufe hinweg verwendet haben, die im Befehl, in der Beschreibung und im Aufgabenkontext platziert wurden. Keiner hat einen blockierten Anruf zuverlässig in einen erlaubten umgewandelt. Das ist ein echtes und kleines Ergebnis: Acht Payloads, geschrieben von derselben Person, die den Test erstellt hat, sind kein Red Team, und eine Deny-List ist diesbezüglich konstruktionsbedingt und nicht zufällig immun.

    Das achte Muster, und warum es das rechtliche ist

    Alles oben Genannte ist der allgemeinen Agententechnik entlehnt. Dieses hier ist unser eigenes, und es entsteht aus einer Einschränkung, die nur im Recht wirklich zum Tragen kommt.

    Lange Agentenläufe überfüllen ihren Kontext, und die Standardlösung besteht darin, dass ein Sprachmodell die bisherige Spur zusammenfasst. Für die meisten Software ist das in Ordnung. Für die juristische Arbeit ist es eine stille Katastrophe, denn eine Zusammenfassung eines Gesetzes ist ein neues Dokument. Es enthält neue Wörter. Diese Wörter wurden von einem Modell geschrieben, nicht von einem Gesetzgeber, und jeder nachfolgende Schritt argumentiert nun über die Paraphrase statt über das Gesetz.

    Die Alternative ist, zu komprimieren, ohne zu paraphrasieren. Bewerten Sie jeden Schritt der Spur danach, ob er noch zum aktuellen Ziel beiträgt, lassen Sie diejenigen fallen, die dies nicht tun, und behalten Sie die Überlebenden Wort für Wort. Nichts wird umgeschrieben. Der Kontext wird kürzer, weil Dinge entfernt wurden, nicht weil Dinge neu formuliert wurden.

    Eine Zusammenfassung eines Gesetzes ist ein neues Dokument. Eine gefilterte Liste von Gesetzen sind immer noch die Gesetze.

    Dies ist das Muster, an dem wir am meisten interessiert sind und das wir noch nicht gemessen haben. Betrachten Sie es daher eher als Designposition denn als Ergebnis. Wir sprechen es laut aus, weil es die Art von Problem ist, für die ein Entscheidungsmodell ungewöhnlich gut geeignet ist, und weil wir noch niemanden gesehen haben, der Komprimierung als Korrektheitsanforderung statt als Kostenoptimierung betrachtet hat.

    Zwei Dinge über juristische Arbeit, vor denen Sie niemand warnt

    Es kann kein gescanntes Dokument erkennen. Jev verarbeitet Text. Ein sehr großer Teil echter juristischer Dokumente, insbesondere im gesamten MENA-Raum, liegt als Fotos von Papier vor. Das bedeutet, dass die vorgeschaltete Pipeline die gesamte Arbeit leistet, die bestimmt, ob es eine faire Eingabe erhält, und jede gemeldete Zuversicht ist abhängig von einem OCR-Schritt, von dem es nichts weiß. Offene Neuimplementierungen derselben Architektur, die auf bildverarbeitungsfähigen Basismodellen laufen, existieren bereits, was die Richtung ist, in die sich dies letztendlich entwickeln wird, aber das Ihnen heute vorliegende gehostete Modell ist blind.

    Juristische Abkürzungen machen es auf eine Weise kaputt, die wie ein Fehler aussieht und keiner ist. Wir baten es, eine Anfrage zur Überprüfung eines arabischen MSA zu klassifizieren und mit Korrekturen zu versehen. Die Legalität lag bei 0.30, was für eine eindeutig juristische Anfrage wie ein Fehlschlag aussieht. Isoliert man den Satz, löst sich das Bild auf: MSA allein erzielt 0.97, Master Services Agreement 0.98, ein MSA in arabischer Sprache 0.96, und Arabisches MSA bricht auf 0.30 zusammen. Das Wort Arabisch unmittelbar vor MSA vertauscht das Akronym von Master Services Agreement zu Modern Standard Arabic.

    Das Modell hat Recht. Der Satz ist tatsächlich mehrdeutig, und er wäre auch für einen menschlichen Leser mehrdeutig. Aber die juristische Arbeit im MENA-Raum erzeugt diese exakte Konstruktion ständig, sodass jede Pipeline, die auf einem Dokumentlabel routet, darauf stoßen wird, und in einem Benchmark wird es als Modellfehler gelesen, obwohl es sich um ein Artefakt der Eingangsmehrdeutigkeit handelt. Wenn Sie einen Klassifikator für juristische Texte evaluieren, überprüfen Sie auf eine mehrdeutige Abkürzung, bevor Sie schlussfolgern, dass das Modell Ihre Jurisdiktion nicht handhaben kann.

    Die Regel, die aus all dem hervorging

    Sechs Oberflächen, drei Gewinne, drei Verluste. Das Muster in den Verlusten ist das, was es sich lohnt mitzunehmen.

    Das Reranking funktioniert, weil die Frage „Beantwortet dieser Artikel diese Frage?“ eine Antwort hat, die der Artikel und die Frage miteinander klären. Die Zitiergrundlage funktioniert, wenn man die Quelle angibt, und kehrt sich um, wenn man sie nicht angibt, denn ohne die Quelle wird die Frage zu einer Wissensabfrage. Die Schleifensteuerung schlägt fehl, weil „Hat dieser Agent genug gelernt?“ durch nichts in der Trajektorie geklärt wird. Die Vorschläge für interne Links, die wir ebenfalls getestet haben, schlugen auf dieselbe Weise fehl: Auf die Frage, ob ein Leser einen echten Grund hätte, von einer Seite zur anderen zu klicken, lagen die Werte für 761 von Menschen kuratierte Links bei 0.582 für echte Links und 0.537 für Paare, die kein Redakteur jemals verbunden hatte, eine Differenz von 0.045, wobei die manuellen Prüfer bei 12 von 20 übereinstimmten.

    Bevor Sie auf einem Urteil aufbauen, fragen Sie, was die Grundwahrheit dafür ist. Wenn die ehrliche Antwort eine Redaktionspräferenz ist, rechnen Sie mit einer Lücke von etwa 0.05 und planen Sie einen Menschen ein.

    Dies ist dieselbe Grenze, die unsere eigene Untersuchung gefälschter Zitate aus der anderen Richtung gefunden hat, und deshalb beurteilen wir Tools danach, ob sie überprüfen, ob ein Zitat das besagt, was sie behaupten, und nicht nur, ob es existiert.

    Was wir jemandem erzählen würden, der Legal AI evaluiert

    Vier Dinge, nur eines davon betrifft dieses spezielle Modell.

    Fragen Sie, woran die Prüfung verankert ist. Unsere AI verifiziert Zitate ist keine Architektur. Das Überprüfen, ob ein Fall existiert, ist eine Datenbankabfrage. Das Überprüfen, ob der Fall das besagt, was die Antwort behauptet, ist ein Vergleich, und es benötigt den Quellabschnitt zum Zeitpunkt der Urteilsfindung. Produkte, die das Erste tun und es als das Zweite beschreiben, sind die Norm, nicht die Ausnahme.

    Fragen Sie nach der Fehlerquote, nicht nach der Erfolgsquote. Jedes Tool in dieser Kategorie veröffentlicht eine schmeichelhafte Zahl. Nur sehr wenige veröffentlichen, was sie gemessen und verloren haben. Unsere eigene Ehrlichkeit hat Grenzen, die es wert sind, genannt zu werden: Der erste automatisierte Durchlauf bei der Kennzeichnung dieses Tool-Call-Korpus war zu 86 % falsch in seiner wichtigsten Klasse, alles in die gleiche Richtung, und wir fanden es durch manuelle Überprüfung statt durch Genialität.

    Fragen Sie, womit der Benchmark bewertet wurde. Dies erwischt fast jeden. Ein Benchmark kann anhand der Ground Truth bewertet werden oder anhand der Übereinstimmung mit einem führenden Sprachmodell. Letzteres ist viel billiger und viel schwächer, da die Übereinstimmung mit GPT auch die Übereinstimmung mit GPT-Fehlern beinhaltet. Wenn ein Anbieter die Genauigkeit meldet, ist die Frage nicht, wie hoch die Zahl ist. Es ist, womit die Zahl verglichen wurde.

    Seien Sie vorsichtig mit einer Zahl, die behauptet und nicht gemessen wird. TypeSafes eigenes Launch-Diagramm zeigt eine Halluzinationsrate von 0 %, und die Fußnote darunter besagt, in ihren Worten, dass die Zahl nicht empirisch ist und konstruktionsbedingt hinzugefügt wird, weil die Schemaübereinstimmung erzwungen und nicht beobachtet wird. Sie legen es offen. Die Überschrift über dem Diagramm tut dies nicht. Die darunter liegende Behauptung ist wahr und eng gefasst: Sie werden niemals einen Wert außerhalb Ihres Schemas erhalten. Es ist keine Behauptung, dass der Wert richtig ist. Ein unabhängiger Analyst machte diesen Punkt eine Woche nach dem Start, und er ist berechtigt.

    Was sich für uns tatsächlich geändert hat

    Nicht die Kosten. Ein typisierter Sprachmodellaufruf spart ein paar Cents, und Cents waren nie das Problem.

    Was sich geändert hat, ist, dass eine Entscheidung, die das System bereits stillschweigend getroffen hat, jetzt eine Zahl trägt. Vertragsprüfung mit 0,91 gegenüber Rechtsstreitigkeiten mit 0,09 ist ein Weg, den Sie automatisieren und protokollieren können. 0,52 gegenüber 0,46 ist ein Münzwurf mit einem Etikett, und das bekommt ein Mensch. Ein Sprachmodell hätte in beiden Fällen die gleiche Antwort in einem selbstbewussten Satz gegeben, ohne eine Möglichkeit, die beiden Situationen zu unterscheiden.

    Für ein Produkt, bei dem falsch zu sein die gesamte Risikooberfläche darstellt, ist das mehr wert als jeder Geschwindigkeitsmultiplikator in einem Anbieterdiagramm.

    Die Gewohnheit, die wir beibehalten würden, selbst wenn wir nie eine weitere Anfrage senden würden: Gehen Sie Ihren Agenten durch und finden Sie jeden Anruf, der lediglich etwas auswählt. Welches Werkzeug als Nächstes. Ist das Spam. Ist dieser Block relevant. Benötigt dies einen Menschen. Ist dieser Unterschied riskant. Keine davon sind Schreibaufgaben. Es sind if-Anweisungen, die jemand an ein Grenzmodell ausgelagert hat, und die meisten davon benötigen keines.

    Wichtige Erkenntnisse

    • Ein Modell, das keinen Text generiert, ist ein echtes Werkzeug für eine rechtliche Anwendung, an den spezifischen Stellen, an denen eine Beurteilung ein Vergleich zwischen Dingen ist, die man ihm vorlegen kann.
    • Als es aufgefordert wurde, die Fundiertheit nur anhand von Text zu bewerten, bewertete es erfundene Zitate höher als ehrliche, 3,21 gegenüber 2,79, mit einer Korrelation zur tatsächlichen Genauigkeit von r = +0,02. Retrieval ist das, was die Verifizierung ermöglicht, nicht ein Implementierungsdetail darunter.
    • Es läuft produktiv auf unserem Compliance-Gate, wo es Rotstrich-Verletzungen in einem französischen Entwurf erkannte, die unser englischsprachiger Regex bei exit 0 übersah. Regex- und semantische Prüfungen erwiesen sich entgegen unserer eigenen Vorhersage als komplementär, nicht redundant.
    • Das Neuanordnen unseres Gesetzeskorpus mit 17.004 Artikeln erhöhte den Recall auf Rang 1 von 0,638 auf 0,850 für weniger als drei Cent.
    • Die Schleifensteuerung schlug einen kostenlosen Schrittzähler in einem gepaarten Test nicht, und ihre scheinbare Fähigkeit brach auf fast Zufall zusammen, sobald wir kontrollierten, welche Art von Aktion als Nächstes kam.
    • Ein Tool-Call-Risiko-Gate erinnerte an 89,1 % der destruktiven Aufrufe, wo eine handgeschriebene Deny-Liste 99,2 % abrief. Wir liefern den Regex aus.
    • Speziell für juristische Arbeiten: Es kann kein gescanntes Dokument lesen, und Arabisch MSA wird als Modernes Standardarabisch und nicht als Master Services Agreement gelesen, wodurch die juristische Relevanz von 0,97 auf 0,30 sinkt.
    • Die Kompaktierung sollte entfernen, nicht umschreiben. Eine Zusammenfassung eines Gesetzes ist ein neues Dokument.
    • Fragen Sie, was die Grundwahrheit für ein Urteil ist, bevor Sie darauf aufbauen. Keine Grundwahrheit, kein Werkzeug.

    Quellen und weiterführende Literatur

    • TypeSafe AI: Jev-Dokumentation und veröffentlichte Einschränkungen
    • Novel Cognition: Die Garantie, kann nicht halluzinieren, deckt Form ab, nicht Wahrheit
    • Wie Legal AI eine Zitierung erfindet
    • Audit für Legal AI-Halluzinationen
    • Die Orchestrierungsebene von Legal AI
    • Legal AI Benchmark 2026
    H

    HAQQ Team

    Editorial

    Verwandte Ressourcen

    How legal AI invents a citationAI Legal Hallucination AuditThe legal AI orchestration layerLegal AI Benchmark 2026

    Verwandte Artikel

    Beste KI für juristische Arbeit 2026? Wir bewerteten 3,000 Antworten

    Beste KI für juristische Arbeit 2026? Wir bewerteten 3,000 Antworten

    Was geschieht, bevor eine Rechts-KI Ihre Frage beantwortet

    Was geschieht, bevor eine Rechts-KI Ihre Frage beantwortet

    Legal-AI-Halluzination: Das gefälschte Zitat, das jede Prüfung besteht

    Legal-AI-Halluzination: Das gefälschte Zitat, das jede Prüfung besteht

    Häufig gestellte Fragen

    Can Jev detect AI hallucinations in legal citations?

    Only when you give it the source. We measured both setups on the same 150 legal answers. Asked to score groundedness from the answer text alone, it scored answers containing fabricated citations higher than honest ones, 3.21 against 2.79, with a correlation to human accuracy labels of r = +0.02. Handed the source passage alongside the claim and asked whether that passage supports that proposition, the same model reached an AUC of 0.9962 and caught 94.4% of misattributions at a zero false alarm rate on a separate 180-pair run. The model has no retrieval and no knowledge base, so a verification step without retrieval in front of it is not a verification step.

    What is Jev and how is it different from an LLM?

    Jev is TypeSafe AI's System One decision model, released in September 2026. It generates no text. You send a block of state plus typed questions and get back calibrated probabilities, all evaluated in one parallel round trip. There are three primitives: a noul returns the probability that a yes-or-no statement is true, a choice picks one option from a list you define, and a score places the input on an ordered scale you describe. A language model produces a string you parse and validate, one token at a time. Jev produces a typed value your code branches on, with every question resolved simultaneously.

    Is Jev accurate enough to use in legal work?

    It depends entirely on the question you ask it. In our own testing it moved recall at rank 1 on a 17,004-article statute corpus from 0.638 to 0.850, and it caught red-line compliance violations in a French draft that our English-only regex checks passed with zero findings. It also failed three tests: it scored fabricated citations higher than honest ones when judging groundedness from bare text, it did not beat a free step counter at deciding when an agent should stop, and it recalled 89.1% of destructive tool calls where a hand-written deny-list recalled 99.2%. The rule we derived is that it is strong where a judgment has an objective answer the supplied evidence settles, and weak where the judgment is a matter of taste.

    Does Jev work on Arabic legal documents?

    On Arabic legal text it classified 10 of 10 cases correctly across English, Arabic and French, though that fixture set was small and easy enough that every case came back at full confidence, so read it as parity holding on easy inputs rather than as proven parity. Two practical limits matter more. It cannot read a scanned document at all, and a large share of MENA legal documents arrive as photographs of paper. And legal abbreviations can be genuinely ambiguous: the phrase Arabic MSA scores 0.30 on legal-ness because the word Arabic flips the acronym from Master Services Agreement to Modern Standard Arabic, where MSA alone scores 0.97.

    What does a 0% hallucination rate actually mean?

    For a model with a fixed output schema it means the model cannot return a value you did not declare. That is a real and useful guarantee. It is not a guarantee that the value is correct. TypeSafe discloses this themselves in a footnote under their launch chart, which says the number is not empirical and is added by construction because the schema match is enforced rather than observed. A schema-valid wrong answer is still a wrong answer, and in legal work it causes exactly the same damage as a malformed one.

    How much does it cost to run decision checks on legal documents?

    In our own billing, the entire evaluation programme across ten surfaces cost under $0.20. Individual jobs: reranking 80 queries against a 17,004-article corpus cost $0.0245, a semantic compliance pass on one draft costs about $0.00005, and tool-call classification runs at roughly eleven cents per thousand calls. Cost is not what stops you adopting this. Whether the judgment has a ground truth is what stops you.

    Was kommt als Nächstes?

    HAQQ AI kostenlos testen

    Erleben Sie KI-gestützte juristische Recherche und Entwurf

    ROI berechnen

    Sehen Sie, wie viel Zeit und Geld HAQQ Ihrer Kanzlei spart

    380+ juristische Prompts durchsuchen

    Sofort einsatzbereite Prompts für jede juristische Aufgabe

    Zurück zum Blog

    Vorheriger Artikel

    Betreiberverantwortung bei KI: Was Microsofts neuer Verhaltenskodex Ihrer Kanzlei auferlegt

    Inhaltsverzeichnis

    20 Min. Lesezeit

    Share this

    Setzen Sie das ein

    Stellen Sie HAQQ die Frage, die dieser Artikel bei Ihnen aufgeworfen hat.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Ihr juristischer KI-Zwilling und Kanzleimanagement-System für Entwurf, Abrechnung und Gewinnen.

    Download on theApp StoreGet it onGoogle Play

    Dokumentationen

    • Docs wird in einem neuen Tab geöffnet
    • Erste Schritte wird in einem neuen Tab geöffnet
    • Newsroom wird in einem neuen Tab geöffnet
    • Produkt-Updates wird in einem neuen Tab geöffnet
    • Status wird in einem neuen Tab geöffnet
    • Sicherheit
    • FAQ wird in einem neuen Tab geöffnet
    • Community wird in einem neuen Tab geöffnet
    • Support wird in einem neuen Tab geöffnet

    Academy

    • Partner wird in einem neuen Tab geöffnet
    • Kurs wird in einem neuen Tab geöffnet
    • Rechtsnews wird in einem neuen Tab geöffnet
    • Skills wird in einem neuen Tab geöffnet
    • Klauseln wird in einem neuen Tab geöffnet
    • Prompt-Bibliothek wird in einem neuen Tab geöffnet
    • Tools wird in einem neuen Tab geöffnet
    • Research Hub wird in einem neuen Tab geöffnet
    • Dokumente wird in einem neuen Tab geöffnet

    Website

    • eFirm
    • Juristischer KI-Chat
    • Mobile App
    • Justinian KI-Engine
    • HAQQ eBar
    • HAQQ eWallet
    • Preise
    • Vergleichen Sie uns
    • Lösungen
    • Blog
    • Team kennenlernen
    • Mach mit wird in einem neuen Tab geöffnet
    App öffnen
    • Sprachenenarfresitdeptrohi
    • Kontaktinfo@haqq.ai
    • Statusbetriebsbereit·fundiert
    • Nutzungsbedingungen
    • Datenschutzrichtlinie
    • Cookie-Richtlinie
    • Datenverarbeitung
    • Menschen wird in einem neuen Tab geöffnetAnwälte wird in einem neuen Tab geöffnetSicherheit wird in einem neuen Tab geöffnet
    © 2026 HAQQ Inc. Alle Rechte vorbehalten.Produkt intern von HAQQ entwickelt. Website mit modernen Web-Tools gebaut.