Kurz gesagt: Wir haben weniger als 0,20 US-Dollar ausgegeben, um zu testen, ob ein Modell, das keinen Text generiert, in unseren Legal AI Stack gehört. Es gehört hinein - an drei Stellen. An einer davon läuft es bereits in Produktion. An drei weiteren Stellen hat es versagt, und eines dieser Versagen kehrte sich so vollständig um, dass Antworten mit gefälschten Zitaten höher bewertet wurden als ehrliche. Die daraus entstandene Regel ist der nützliche Teil: Diese Art von Modell ist stark, wenn ein Urteil eine objektive Antwort hat, die die gelieferten Beweise klären, und schwach, wo immer das Urteil Geschmackssache ist.
Das Argument, und warum wir es ernst genommen haben
Es gibt ein Argument, dass die meisten AI-Agenten ihre teuerste Ressource für Entscheidungen verschwenden, die niemals einen Satz benötigten. Eine Anfrage an das richtige Modell weiterzuleiten, ist eine Entscheidung. Zu entscheiden, ob ein Tool-Aufruf sicher ist, ist eine Entscheidung. Fünfzig abgerufene Dokumente zu ordnen, sind fünfzig Entscheidungen. Keine davon erzeugt Prosa, die jemand liest, doch alle werden einem Modell übergeben, das nach Wörtern abrechnet und in Absätzen antwortet.
Im September 2026 lieferte TypeSafe AI ein Modell, das auf diesem Argument aufbaut. Jev ist das, was sie ein System One Modell nennen, und die definierende Eigenschaft ist, dass es überhaupt keinen Text generiert. Man POSTet einen Zustandsblock plus eine Reihe von typisierten Fragen, und man erhält kalibrierte Wahrscheinlichkeiten zurück, die alle in einem einzigen parallelen Roundtrip ausgewertet werden.
Es gibt drei Primitive und keine vierte. Ein Noul ist eine Ja- oder Nein-Frage, die eine Wahrscheinlichkeit zwischen 0 und 1 zurückgibt, und diese Wahrscheinlichkeit ist das Vertrauen: 0,5 bedeutet einen Münzwurf, nicht mittlere Intensität. Eine Wahl wählt eine Option aus einer von Ihnen definierten Liste, und sie kann physisch keine Option zurückgeben, die Sie nicht deklariert haben. Eine Bewertung platziert die Eingabe auf einer geordneten Skala, die Sie in Worten beschreiben, und gibt den wahrscheinlichkeitsgewichteten Mittelwert zurück, so dass eine 70/30-Aufteilung über zwei Ebenen als 1,30 statt 1 oder 2 zurückkommt.
Das ist die gesamte Oberfläche. Es kann nicht zusammenfassen, umschreiben, entwerfen, einen Abschnitt extrahieren oder etwas nachschlagen. Es hat keine Wissensbasis und keine Abrufmöglichkeit. Es beantwortet Fragen, deren Antwortraum Sie deklariert haben, über einen Zustand, den Sie ihm übergeben haben.
Der Teil, der leicht zu übersehen ist
Der Instinkt ist, dies als billigen, schnellen Klassifikator abzutun. Das unterschätzt jedoch, was sich tatsächlich geändert hat, nämlich nicht der Preis, sondern die Reihenfolge.
Ein Sprachmodell schreibt ein Token nach dem anderen, sodass Token neun erst existieren kann, wenn Token acht existiert. Wenn Sie vier unabhängige Fragen zu einem Vertrag stellen, reihen sich diese vier unabhängigen Urteile hintereinander ein, kommen als Blob zurück, den Sie dann parsen, validieren und erneut versuchen, wenn die Form falsch ist. Jev löscht die Warteschlange. Sie deklarieren den Antwortraum im Voraus, und jede Frage wird gleichzeitig mit demselben Zustand gelöst. Text ist eine Linie, die man gehen muss. Ein Antwortraum ist ein Raum, den man auf einmal sieht.
| Frontier Sprachmodell | Jev | |
|---|---|---|
| Ausgabe | Eine Zeichenfolge, die Sie parsen und validieren | Ein typisierter Wert, auf den Ihr Code verzweigt |
| Reihenfolge | Sequentiell, jedes Token abhängig vom letzten | Keine, alle Fragen parallel |
| Unsicherheit | Verborgen in selbstbewusster Prosa | Eine explizite Wahrscheinlichkeit für jede Option |
| Fehlermodus | Fehlgeformte Gestalt, erfundene Option, Ablehnung | Eine schema-gültige falsche Antwort |
| Kann es schreiben? | Ja, das ist das Produkt | Nein. Kein Satz, kein Abschnitt, kein Code |
| Kann es Dinge nachschlagen? | Mit Tools, ja | Nie. Kein Abruf, keine Wissensbasis |
Diese Fehlermodus-Zeile ist diejenige, die im Recht zählt, und man sollte offen darüber sprechen. Die angebotene Garantie ist, dass Sie niemals einen Wert außerhalb Ihres Schemas erhalten werden. Es ist keine Garantie, dass der Wert richtig ist.
Ein schemavalider Fehler erstattet dem falschen Klienten genauso schnell den Betrag wie ein fehlerhafter.
Für ein Legal AI Unternehmen ist das interessante Wort in all dem kalibriert. Eine Zahl, auf die man im Code verzweigen kann, ist ein anderes Objekt als ein Absatz, den ein Anwalt lesen und dem er vertrauen muss. Wir haben in unserem Beitrag zur Orchestrierungsschicht geschrieben, dass der Teil der Legal AI, der bestimmt, ob die Zitate stimmen, von außen unsichtbar ist. Dies ist ein Kandidat, um einen Teil dieses unsichtbaren Bereichs auszufüllen.
Also haben wir es über unseren gesamten Stack laufen lassen. Jede Messung unten ist unsere, auf unserem eigenen Korpus, und die, die schlecht liefen, sind auch hier.
Was wir gemessen haben und was es gekostet hat
Zehn Oberflächen, dreizehn geschlossene Tickets, insgesamt unter 0,20 $ Kosten. Das ist kein Prahlen mit Sparsamkeit. Es ist der Grund, warum das Experiment überhaupt durchgeführt werden konnte: Für den Bruchteil eines Cents pro Urteil kann man es sich leisten, jedes Ereignis zu überprüfen, anstatt Stichproben zu nehmen, und ein Nullergebnis kostet fast nichts, um es festzustellen.
Latenz, gemessen an unserem eigenen Traffic mit einer offen gehaltenen warmen Verbindung: 292 ms im Median, 374 ms bei p90, 395 ms bei p95, über 40 Aufrufe hinweg. Allein die serverseitige Berechnung beträgt 112 ms. Unsere eigene erste Messung ergab 700 ms, und wir wiederholten diese Zahl intern eine Woche lang, bevor wir bemerkten, dass sie falsch war. Wir hatten nie eine Verbindung wiederverwendet, so dass jeder Aufruf für einen neuen Handshake bezahlte. Dieselbe API, dieselbe Modellversion, eine sorgfältige Messung des Falschen. Es ist eine kleine Verlegenheit und eine nützliche, denn es ist genau die Art von Fehler, die einen Benchmark einen Monat später unproduzierbar macht.
Acht Muster, und welche wir tatsächlich getestet haben
Sieben davon kursierten als Musterliste eines Entwicklers. Das achte ist unser eigenes, und es ist dasjenige, das sich für die juristische Arbeit als am wichtigsten erweist.
- Modell-Routing. Vorhersage der Aufgabenkomplexität, Senden der einfachen Arbeit an ein kleines Modell und der schwierigen Arbeit an ein Spitzenmodell.
- Risikoprüfungen bei Tool-Aufrufen. Bevor ein Agent ein Tool ausführt, bewerten Sie das Tool, seine Argumente und die aktuelle Aufgabe und geben Sie "zulassen", "blockieren" oder "menschliche Genehmigung" zurück.
- Absichts- und Domänen-Triage. Klassifizieren Sie die Anfrage in eine feste Reihe von Absichten, bevor der Hauptagent mit der Überlegung beginnt. Im juristischen Bereich sind dies die Gerichtsbarkeit, der Rechtsbereich und das Ergebnis.
- Schleifenentscheidungen. Nach jedem Agentenschritt vorhersagen, ob ein weiterer Schritt wahrscheinlich nützlich sein wird.
- Abruf-Neubewertung. Bewerten Sie jede abgerufene Passage anhand der Abfrage und übergeben Sie nur die am höchsten bewerteten in den Kontext.
- Leitplanken und Richtlinienprüfungen. Führen Sie Sicherheits- und Compliance-Prüfungen als schnelle Klassifizierungen durch, anstatt eine vollständige Begründungsantwort zu generieren.
- Eskalation an einen Menschen. Vorhersagen, ob eine automatisierte Entscheidung zuverlässig genug ist, um ausgeführt zu werden.
- Wörtliche Kontextverdichtung. Bewerten Sie jeden Schritt einer langen Agentenverfolgung danach, ob er noch dem Ziel dient, lassen Sie die unnötigen fallen und behalten Sie die überlebenden wörtlich bei.
Wir haben nun sechs davon mit unseren eigenen Daten gemessen. Drei funktionieren, eine davon ist heute in Produktion. Drei funktionieren nicht. Die Misserfolge erhalten unten mehr Raum, weil sie instruktiver sind und weil niemand sonst sie veröffentlicht.
Ein Hinweis zur Umgebung: Eine kleine Anzahl von Tools, die auf demselben Stack basieren, existiert bereits für die Überprüfung juristischer Zitate, alle innerhalb der letzten zwei Wochen ausgeliefert. Es handelt sich dabei eher um frühe Experimente als um funktionierende Produkte, und keines veröffentlicht eine Genauigkeitsangabe. Die Lücke, in die wir schreiben, ist nicht, dass niemand diese Idee hatte. Es ist, dass niemand veröffentlicht hat, was passiert, wenn man sie überprüft.
Wo es funktioniert: Neubewertung des Abrufs
Unser MENA-Gesetzeskorpus enthält 17.004 Artikel. Die Abfrage erfolgt zunächst lexikalisch, was bedeutet, dass eine Abfrage und ein Artikel, die unterschiedliche Wörter für dieselbe Verpflichtung verwenden, sich vollständig verfehlen können. Dies ist das übliche Versagen der juristischen Suche in jeder Sprache, und es ist im Arabischen schlimmer, wo die Morphologie eine größere Distanz zwischen einem Suchbegriff und seiner Übereinstimmung schafft.
Wir nahmen 80 zurückgehaltene Abfragen, führten sie durch die bestehende Abfrage aus und ordneten dann die Kandidaten neu, indem wir eine Frage pro Kandidat stellten: Beantwortet dieser Artikel diese Frage?
Neuanordnung eines Gesetzeskorpus mit 17.004 Artikeln
Anteil von 80 zurückgehaltenen Abfragen, bei denen der richtige Artikel zuerst zurückkam
Bei neun der 80 Abfragen wurde der richtige Artikel überhaupt nicht abgerufen, so dass kein Reranker ihn befördern konnte. Die Abfragen wurden aus den Stichprobenartikeln erstellt, was die lexikalische Abfrage schmeichelt, lesen Sie also das Delta und nicht die absoluten Zahlen.
Der mittlere reziproke Rang verschob sich von 0,719 auf 0,869. Zehn von zehn manuell überprüften Fällen stimmten überein, darunter zwei, bei denen das Modell korrekterweise nichts beförderte, da kein gültiger Kandidat existierte. Gesamtkosten: 0,0245 $.
Ein weiterer Vorbehalt. Unsere arabischen und englischen Artikel sind nach Gerichtsbarkeit aufgeteilt, jeder arabische ist ägyptisch und jeder englische ist emiratisch, daher unterstützt dieser Durchlauf keinerlei Aussage über Sprache.
Es funktioniert, weil die Frage eine richtige Antwort hat. Ob dieser Artikel diese Frage beantwortet, wird durch den Artikel und die Frage selbst bestimmt, die beide dem Modell vorliegen.
Wo es funktioniert: Antworten erkennen, die keine Antworten sind
Bevor wir Jev einführten, bewerteten wir Benchmark-Antworten mit einem Sprachmodell, das als Richter fungierte. Dieser Richter war in einer spezifischen und schädlichen Weise großzügig. Er vergab eine perfekte 10,0 an 56 % der bewerteten Antworten, und bei einem Modell waren 90 % der Antworten in allen vier Dimensionen makellos. Ein Bewerter ohne Obergrenze misst nichts am oberen Ende seines Bereichs.
Jev bewertete 0 % der Antworten mit 9,9 oder höher. Nützlicher war, dass es alle fünf abgeschnittenen API-Fehler im Set mit Wahrscheinlichkeiten zwischen 0,96 und 0,97 erkannte. Der frühere Richter hatte dieselben fünf mit 1 von 10 bewertet und sie in den Modellfähigkeitswert eingerechnet, was bedeutete, dass wir eine 10%ige Infrastrukturfehlerquote als rechtliche Inkompetenz gemeldet hatten. Der Ausschluss dieser Fehler verschob ein Modell von 5,80 auf 7,67.
Das Wertvollste, was das Modell für unsere Benchmarks tat, war nicht die Beurteilung der Qualität. Es war die Feststellung, dass eine Zeichenfolge keine Antwort war.
Wo es in der Produktion funktioniert: Das Regex-Muster des Compliance-Gates konnte es nicht sehen
Dieser Fall ist aktuell und hat sich seinen Platz verdient, indem er etwas Peinliches aufdeckte.
Wir überprüfen jeden öffentlichen Text vor der Veröffentlichung mit einem Preflight-Gate und gleichen ihn mit unseren eigenen Messaging-Regeln ab. Einige dieser Regeln sind rote Linien: Wir sagen nicht, dass wir Anwälte ersetzen, und wir behaupten nicht, dass unsere KI frei von Halluzinationen ist, denn beides ist nicht wahr und beides sind Behauptungen, die ein Regulierer genau prüfen würde.
Ein französischer Entwurf, der wörtliche Verstöße gegen beide Regeln enthielt, passierte dieses Gate mit exit 0 und null Feststellungen. Die Regex-Muster waren nur englischsprachig. Die französische Formulierung für "wir ersetzen Anwälte" und die französische Formulierung für "unsere KI hat keine Halluzinationen" passierten eine Prüfung, die ihre englischen Äquivalente sofort gestoppt hätte.
Eine semantische Überprüfung erkannte beides eindeutig: 0,90 bei der impliziten Behauptung, 0,95 bei der roten Linie der Anwaltserfassung, 0,83 bei der Einschätzung, wie ein Regulierer es lesen würde. Kosten pro Entwurf: etwa 0,00005 $, verteilt auf acht eingegebene Fragen in einer parallelen Anfrage.
Das Ergebnis, das wir nicht erwartet hatten, ist, dass Regex und Semantik sich eher als komplementär denn als redundant erwiesen haben. Wir gingen davon aus, dass das eine das andere überflüssig machen würde, und haben in 35 realen Entwürfen gemessen, dass jede Regex-Regel mit einem semantischen Gegenstück eine andere Formulierung desselben Risikos erfasste. Die Regex erfasst die wörtliche Formulierung. Der semantische Durchlauf erfasst die Paraphrase. Unser eigenes Ticket sagte voraus, dass wir etwas abschaffen könnten, aber die Daten sagten nein.
Wo es sich umkehrte: die Frage, ob ein Zitat begründet ist
Nun der Fehler, der unser Denken neu geordnet hat.
Wir baten Jev, die Begründung von 150 echten Rechtsantworten zu bewerten, die von drei führenden Modellen über 50 MENA- und UK-Prompts hinweg erstellt wurden. Begründung bedeutet hier: Werden die Behauptungen gestützt, sind die Zitate echt und korrekt verwendet? Dies ist die wichtigste Frage in der Rechts-KI, und es ist die Frage, die unser eigener Halluzinationsaudit immer wieder stellt.
Antworten mit erfundenen Zitaten erreichten 3.21. Ehrliche Antworten erreichten 2.79. Die Korrelation zwischen dem Gesamtscore und den von Menschen überprüften Genauigkeitslabels betrug r = +0.02, das heißt, es gab keine.
Die Überprüfung konnte die Fälschung nicht nur nicht erkennen. Sie belohnte sie.
Sobald Sie sehen, warum, können Sie es nicht mehr ungeschehen machen. Artikel 5bis des Königlichen Dekrets M/13 klingt präzise, spezifisch und autoritär. Er existiert nicht. Ein Modell, das die Begründung allein aus dem Text beurteilen soll, hat nichts zum Vergleich, daher greift es auf die Merkmale zurück, die normalerweise mit begründetem Schreiben einhergehen: Spezifität, Zitierdichte, selbstbewusste Struktur. Fälschung erzeugt alle drei. Spezifität ist das, wonach Fälschung aussieht, daher belohnt jede Rubrik, die Spezifität belohnt, auch Fälschung.
Ändern Sie nun eine Sache. Geben Sie dem Modell den Quelltext neben der Behauptung und fragen Sie, ob dieser Text diese Behauptung stützt. Bei einem separaten, reproduzierbaren Lauf mit 180 Paaren aus unserem eigenen Korpus erreichte das gehostete Modell eine AUC von 0,9962 und erfasste 94,4 % der Fehlzuordnungen bei einer Rate von null Fehlalarmen.
Gleiches Modell. Gleiche Aufgabe im abstrakten Sinn. Gegenteiliges Ergebnis, weil eine Version ein Vergleich zwischen zwei Dingen vor ihm ist und die andere eine Wissenssuche, die es nicht durchführen kann.
Noch ein Vorbehalt, denn er ist wichtiger als der Gewinn. Auf demselben 180-Paar-Set erzielt eine einfache Überprüfung der Eindämmung mit `grep` eine AUC von 0,9944 und fängt 98,9 %. Diese Paare wurden auf wörtlicher Eindämmung aufgebaut, wofür `grep` genau gemacht ist. Betrachten Sie 0,9962 eher als Untergrenze denn als Obergrenze und behandeln Sie die Begründung auf Paraphrasen-Ebene, wo ein getippter Klassifikator seinen Wert tatsächlich unter Beweis stellen sollte, als durch diesen Lauf ungetestet.
Das Abrufen ist kein Implementierungsdetail unter dem Verifizierungsschritt. Das Abrufen ermöglicht die Verifizierung überhaupt erst.
Wo es gegen einen Schrittzähler verlor: Schleifensteuerung
Wir haben dies speziell für diesen Beitrag getestet, und es hat nicht überlebt.
Das Muster besagt: Fragen Sie nach jedem Agentenschritt, ob ein weiterer Schritt wahrscheinlich nützlich ist, und stoppen Sie, wenn die Antwort nein ist. Wir haben den Test aus 52 unserer eigenen abgeschlossenen Agenten-Trajektorien erstellt, 1.750 markierte Schritte. Die Grundwahrheit für jeden Schritt war, ob der nächste Schritt tatsächlich Informationen ans Licht brachte, die nicht bereits irgendwo in der Trajektorie vorhanden waren, berechnet durch eine Regel, die wir bei 24 von 25 manuell überprüft haben.
Vorhersage, ob ein Agent einen weiteren Schritt unternehmen sollte
Fläche unter der ROC-Kurve, 1.750 markierte Schritte über 52 abgeschlossene Trajektorien
Der Abstand zwischen Jev und dem zweiten freien Signal beträgt +0,017, mit einem 95%-Konfidenzintervall von -0,010 bis +0,051. Es übersteht keinen gepaarten Bootstrap. Gesparte Schritte bei Null Verlust nützlicher Arbeit: Null, für alle drei.
Wir haben 0,54 $ bezahlt, um eine Funktion, die mit einer Mengendifferenz berechnet wurde, nicht zu übertreffen.
Zwei Dinge darunter sind mehr wert als die Überschrift. Das erste ist, dass eine Flaute keine Erschöpfung ist. Die freie Regel unterbricht nach zwei aufeinanderfolgenden Schritten, die nichts Neues zurückgaben, als Orakel auf eigener Prämisse ausgeführt, beschädigte 30 der 31 Trajektorien, die sie stoppte. Agenten werden mitten in nützlicher Arbeit ständig still.
Das zweite erklärt das gesamte Ergebnis. Teilt man die Zeilen danach, welche Art von Werkzeug der nächste Schritt verwendete, ändert sich das Bild vollständig: 0,742, wenn der nächste Schritt eine Datei schreibt oder bearbeitet, 0,695, wenn er liest oder sucht, und 0,597, fast Zufall, bei Shell-Befehlen, wo 59% unserer Zeilen leben.
Es hat nie vorhergesagt, ob der Agent genug gelernt hatte. Es hat vorhergesagt, ob das nächste, was zurückkommt, eine Schreibbestätigung oder eine Ausgabeseite sein würde. Das ist ein Urteil über die Form des nächsten Ereignisses, nicht über den Zustand des Agentenwissens.
Ganz ehrlich: Unser Korpus besteht aus Code- und Forschungsagenten, nicht aus juristischen Denkprozessen, und die Obergrenze der Einsparungen war von Anfang an niedrig, denn ein fertiges Transkript ist per Definition eines, das ungefähr dann aufhörte, als die Informationen aufhörten. Beide Fakten begrenzen, wie weit es sich verallgemeinern lässt. Keine rettet das Muster.
HAQQ AI kostenlos testen
Erleben Sie KI-gestützte juristische Recherche und Entwurf
Wo es gegen einen regulären Ausdruck verlor: Werkzeugaufruf-Risikogates
Das letzte Muster, das wir getestet haben, und das unangenehmste, denn wir wollten, dass dieses funktioniert.
Wir betreiben eine Infrastruktur, die nicht offline gehen darf. Die Regel, die sie schützt, befindet sich derzeit in einer Konfigurationsdatei, die ein Agent lesen und befolgen soll. Eine Regel, die vom Lesen abhängt, ist keine Kontrolle. Ein Gate, das beim Aufruf feuert, ist es.
Also haben wir 19.922 echte Werkzeugaufrufe aus 766 unserer eigenen Transkripte beschriftet, 284 davon bewertet und einen typisierten Klassifikator mit der Sperrliste verglichen, die man tatsächlich von Hand schreiben würde.
| Ground Truth | n | Jev | Sperrliste, naiv | Sperrliste, Stahlmensch |
|---|---|---|---|---|
| Sicheres Lesen | 121 | 120/121 | 121/121 | 120/121 |
| Zerstörend | 119 | 106/119 | 118/119 | 118/119 |
| Könnte einen Live-Host offline nehmen | 44 | 25/44 | 8/44 | 20/44 |
Wir verlangten, dass jeder destruktive Anruf abgefangen wird. Der Klassifikator erreichte 89,1 %, unterhalb beider Deny-Lists. Der Regex gewinnt die Klasse, für die der Test existierte.
Darin steckt ein echter Gewinn. Bei der engen Frage, ob ein bestimmter Anruf einen Live-Host offline schalten könnte, wurden bei einer dedizierten Ja-oder-Nein-Frage 21 von 22 mit einer Fehlalarmrate von 3,4 % erfasst, während die stärkere von zwei handgeschriebenen Deny-Lists 8 von 22 erfasste. Vereinigt man beide, halbiert sich die Rate der durchrutschenden risikoreichen Anrufe. Bei elf Cent pro tausend Anrufe sind die Kosten nicht das, was Sie aufhält. Die Empfehlung, die sich daraus ergab, ist immer noch, den Regex zu versenden und den Klassifikator als zweite Meinung zu behalten, niemals als Tor.
Das sauberste Ergebnis im gesamten Programm steckt in diesem Test, und es geht mehr darum, wie man fragt, als darum, was man fragt. Dasselbe Modell, dieselben Zeilen, derselbe Nachmittag. Die konkrete Frage, ob dieser Anruf einen dieser spezifischen Live-Hosts offline schalten kann, erreichte eine Rückrufquote von 95,5 % bei einer Fehlalarmrate von 3,4 %. Die abstrakte Frage, ob diese Aktion irreversibel ist, benötigte einen viel lockereren Schwellenwert, um eine vergleichbare Rückrufquote zu erreichen, und zog die Fehlalarmrate dabei auf 34,6 % hoch.
Wir hatten dies bereits gelernt und als Maxime niedergeschrieben: Benenne den konkreten Test, nicht die abstrakte Kategorie. Dies ist das erste Mal, dass wir es als kontrollierten Vergleich statt als Anekdote haben, und die Größe der Lücke überraschte uns.
Noch etwas aus diesem Test, mit seinen Einschränkungen. Wir haben versucht, den Klassifikator dazu zu bringen, blockierte Anrufe zu genehmigen, indem wir acht handgeschriebene Injection-Payloads über 384 gepaarte Anrufe hinweg verwendet haben, die im Befehl, in der Beschreibung und im Aufgabenkontext platziert wurden. Keiner hat einen blockierten Anruf zuverlässig in einen erlaubten umgewandelt. Das ist ein echtes und kleines Ergebnis: Acht Payloads, geschrieben von derselben Person, die den Test erstellt hat, sind kein Red Team, und eine Deny-List ist diesbezüglich konstruktionsbedingt und nicht zufällig immun.
Das achte Muster, und warum es das rechtliche ist
Alles oben Genannte ist der allgemeinen Agententechnik entlehnt. Dieses hier ist unser eigenes, und es entsteht aus einer Einschränkung, die nur im Recht wirklich zum Tragen kommt.
Lange Agentenläufe überfüllen ihren Kontext, und die Standardlösung besteht darin, dass ein Sprachmodell die bisherige Spur zusammenfasst. Für die meisten Software ist das in Ordnung. Für die juristische Arbeit ist es eine stille Katastrophe, denn eine Zusammenfassung eines Gesetzes ist ein neues Dokument. Es enthält neue Wörter. Diese Wörter wurden von einem Modell geschrieben, nicht von einem Gesetzgeber, und jeder nachfolgende Schritt argumentiert nun über die Paraphrase statt über das Gesetz.
Die Alternative ist, zu komprimieren, ohne zu paraphrasieren. Bewerten Sie jeden Schritt der Spur danach, ob er noch zum aktuellen Ziel beiträgt, lassen Sie diejenigen fallen, die dies nicht tun, und behalten Sie die Überlebenden Wort für Wort. Nichts wird umgeschrieben. Der Kontext wird kürzer, weil Dinge entfernt wurden, nicht weil Dinge neu formuliert wurden.
Eine Zusammenfassung eines Gesetzes ist ein neues Dokument. Eine gefilterte Liste von Gesetzen sind immer noch die Gesetze.
Dies ist das Muster, an dem wir am meisten interessiert sind und das wir noch nicht gemessen haben. Betrachten Sie es daher eher als Designposition denn als Ergebnis. Wir sprechen es laut aus, weil es die Art von Problem ist, für die ein Entscheidungsmodell ungewöhnlich gut geeignet ist, und weil wir noch niemanden gesehen haben, der Komprimierung als Korrektheitsanforderung statt als Kostenoptimierung betrachtet hat.
Zwei Dinge über juristische Arbeit, vor denen Sie niemand warnt
Es kann kein gescanntes Dokument erkennen. Jev verarbeitet Text. Ein sehr großer Teil echter juristischer Dokumente, insbesondere im gesamten MENA-Raum, liegt als Fotos von Papier vor. Das bedeutet, dass die vorgeschaltete Pipeline die gesamte Arbeit leistet, die bestimmt, ob es eine faire Eingabe erhält, und jede gemeldete Zuversicht ist abhängig von einem OCR-Schritt, von dem es nichts weiß. Offene Neuimplementierungen derselben Architektur, die auf bildverarbeitungsfähigen Basismodellen laufen, existieren bereits, was die Richtung ist, in die sich dies letztendlich entwickeln wird, aber das Ihnen heute vorliegende gehostete Modell ist blind.
Juristische Abkürzungen machen es auf eine Weise kaputt, die wie ein Fehler aussieht und keiner ist. Wir baten es, eine Anfrage zur Überprüfung eines arabischen MSA zu klassifizieren und mit Korrekturen zu versehen. Die Legalität lag bei 0.30, was für eine eindeutig juristische Anfrage wie ein Fehlschlag aussieht. Isoliert man den Satz, löst sich das Bild auf: MSA allein erzielt 0.97, Master Services Agreement 0.98, ein MSA in arabischer Sprache 0.96, und Arabisches MSA bricht auf 0.30 zusammen. Das Wort Arabisch unmittelbar vor MSA vertauscht das Akronym von Master Services Agreement zu Modern Standard Arabic.
Das Modell hat Recht. Der Satz ist tatsächlich mehrdeutig, und er wäre auch für einen menschlichen Leser mehrdeutig. Aber die juristische Arbeit im MENA-Raum erzeugt diese exakte Konstruktion ständig, sodass jede Pipeline, die auf einem Dokumentlabel routet, darauf stoßen wird, und in einem Benchmark wird es als Modellfehler gelesen, obwohl es sich um ein Artefakt der Eingangsmehrdeutigkeit handelt. Wenn Sie einen Klassifikator für juristische Texte evaluieren, überprüfen Sie auf eine mehrdeutige Abkürzung, bevor Sie schlussfolgern, dass das Modell Ihre Jurisdiktion nicht handhaben kann.
Die Regel, die aus all dem hervorging
Sechs Oberflächen, drei Gewinne, drei Verluste. Das Muster in den Verlusten ist das, was es sich lohnt mitzunehmen.
Das Reranking funktioniert, weil die Frage „Beantwortet dieser Artikel diese Frage?“ eine Antwort hat, die der Artikel und die Frage miteinander klären. Die Zitiergrundlage funktioniert, wenn man die Quelle angibt, und kehrt sich um, wenn man sie nicht angibt, denn ohne die Quelle wird die Frage zu einer Wissensabfrage. Die Schleifensteuerung schlägt fehl, weil „Hat dieser Agent genug gelernt?“ durch nichts in der Trajektorie geklärt wird. Die Vorschläge für interne Links, die wir ebenfalls getestet haben, schlugen auf dieselbe Weise fehl: Auf die Frage, ob ein Leser einen echten Grund hätte, von einer Seite zur anderen zu klicken, lagen die Werte für 761 von Menschen kuratierte Links bei 0.582 für echte Links und 0.537 für Paare, die kein Redakteur jemals verbunden hatte, eine Differenz von 0.045, wobei die manuellen Prüfer bei 12 von 20 übereinstimmten.
Bevor Sie auf einem Urteil aufbauen, fragen Sie, was die Grundwahrheit dafür ist. Wenn die ehrliche Antwort eine Redaktionspräferenz ist, rechnen Sie mit einer Lücke von etwa 0.05 und planen Sie einen Menschen ein.
Dies ist dieselbe Grenze, die unsere eigene Untersuchung gefälschter Zitate aus der anderen Richtung gefunden hat, und deshalb beurteilen wir Tools danach, ob sie überprüfen, ob ein Zitat das besagt, was sie behaupten, und nicht nur, ob es existiert.
Was wir jemandem erzählen würden, der Legal AI evaluiert
Vier Dinge, nur eines davon betrifft dieses spezielle Modell.
Fragen Sie, woran die Prüfung verankert ist. Unsere AI verifiziert Zitate ist keine Architektur. Das Überprüfen, ob ein Fall existiert, ist eine Datenbankabfrage. Das Überprüfen, ob der Fall das besagt, was die Antwort behauptet, ist ein Vergleich, und es benötigt den Quellabschnitt zum Zeitpunkt der Urteilsfindung. Produkte, die das Erste tun und es als das Zweite beschreiben, sind die Norm, nicht die Ausnahme.
Fragen Sie nach der Fehlerquote, nicht nach der Erfolgsquote. Jedes Tool in dieser Kategorie veröffentlicht eine schmeichelhafte Zahl. Nur sehr wenige veröffentlichen, was sie gemessen und verloren haben. Unsere eigene Ehrlichkeit hat Grenzen, die es wert sind, genannt zu werden: Der erste automatisierte Durchlauf bei der Kennzeichnung dieses Tool-Call-Korpus war zu 86 % falsch in seiner wichtigsten Klasse, alles in die gleiche Richtung, und wir fanden es durch manuelle Überprüfung statt durch Genialität.
Fragen Sie, womit der Benchmark bewertet wurde. Dies erwischt fast jeden. Ein Benchmark kann anhand der Ground Truth bewertet werden oder anhand der Übereinstimmung mit einem führenden Sprachmodell. Letzteres ist viel billiger und viel schwächer, da die Übereinstimmung mit GPT auch die Übereinstimmung mit GPT-Fehlern beinhaltet. Wenn ein Anbieter die Genauigkeit meldet, ist die Frage nicht, wie hoch die Zahl ist. Es ist, womit die Zahl verglichen wurde.
Seien Sie vorsichtig mit einer Zahl, die behauptet und nicht gemessen wird. TypeSafes eigenes Launch-Diagramm zeigt eine Halluzinationsrate von 0 %, und die Fußnote darunter besagt, in ihren Worten, dass die Zahl nicht empirisch ist und konstruktionsbedingt hinzugefügt wird, weil die Schemaübereinstimmung erzwungen und nicht beobachtet wird. Sie legen es offen. Die Überschrift über dem Diagramm tut dies nicht. Die darunter liegende Behauptung ist wahr und eng gefasst: Sie werden niemals einen Wert außerhalb Ihres Schemas erhalten. Es ist keine Behauptung, dass der Wert richtig ist. Ein unabhängiger Analyst machte diesen Punkt eine Woche nach dem Start, und er ist berechtigt.
Was sich für uns tatsächlich geändert hat
Nicht die Kosten. Ein typisierter Sprachmodellaufruf spart ein paar Cents, und Cents waren nie das Problem.
Was sich geändert hat, ist, dass eine Entscheidung, die das System bereits stillschweigend getroffen hat, jetzt eine Zahl trägt. Vertragsprüfung mit 0,91 gegenüber Rechtsstreitigkeiten mit 0,09 ist ein Weg, den Sie automatisieren und protokollieren können. 0,52 gegenüber 0,46 ist ein Münzwurf mit einem Etikett, und das bekommt ein Mensch. Ein Sprachmodell hätte in beiden Fällen die gleiche Antwort in einem selbstbewussten Satz gegeben, ohne eine Möglichkeit, die beiden Situationen zu unterscheiden.
Für ein Produkt, bei dem falsch zu sein die gesamte Risikooberfläche darstellt, ist das mehr wert als jeder Geschwindigkeitsmultiplikator in einem Anbieterdiagramm.
Die Gewohnheit, die wir beibehalten würden, selbst wenn wir nie eine weitere Anfrage senden würden: Gehen Sie Ihren Agenten durch und finden Sie jeden Anruf, der lediglich etwas auswählt. Welches Werkzeug als Nächstes. Ist das Spam. Ist dieser Block relevant. Benötigt dies einen Menschen. Ist dieser Unterschied riskant. Keine davon sind Schreibaufgaben. Es sind if-Anweisungen, die jemand an ein Grenzmodell ausgelagert hat, und die meisten davon benötigen keines.
Wichtige Erkenntnisse
- Ein Modell, das keinen Text generiert, ist ein echtes Werkzeug für eine rechtliche Anwendung, an den spezifischen Stellen, an denen eine Beurteilung ein Vergleich zwischen Dingen ist, die man ihm vorlegen kann.
- Als es aufgefordert wurde, die Fundiertheit nur anhand von Text zu bewerten, bewertete es erfundene Zitate höher als ehrliche, 3,21 gegenüber 2,79, mit einer Korrelation zur tatsächlichen Genauigkeit von r = +0,02. Retrieval ist das, was die Verifizierung ermöglicht, nicht ein Implementierungsdetail darunter.
- Es läuft produktiv auf unserem Compliance-Gate, wo es Rotstrich-Verletzungen in einem französischen Entwurf erkannte, die unser englischsprachiger Regex bei exit 0 übersah. Regex- und semantische Prüfungen erwiesen sich entgegen unserer eigenen Vorhersage als komplementär, nicht redundant.
- Das Neuanordnen unseres Gesetzeskorpus mit 17.004 Artikeln erhöhte den Recall auf Rang 1 von 0,638 auf 0,850 für weniger als drei Cent.
- Die Schleifensteuerung schlug einen kostenlosen Schrittzähler in einem gepaarten Test nicht, und ihre scheinbare Fähigkeit brach auf fast Zufall zusammen, sobald wir kontrollierten, welche Art von Aktion als Nächstes kam.
- Ein Tool-Call-Risiko-Gate erinnerte an 89,1 % der destruktiven Aufrufe, wo eine handgeschriebene Deny-Liste 99,2 % abrief. Wir liefern den Regex aus.
- Speziell für juristische Arbeiten: Es kann kein gescanntes Dokument lesen, und Arabisch MSA wird als Modernes Standardarabisch und nicht als Master Services Agreement gelesen, wodurch die juristische Relevanz von 0,97 auf 0,30 sinkt.
- Die Kompaktierung sollte entfernen, nicht umschreiben. Eine Zusammenfassung eines Gesetzes ist ein neues Dokument.
- Fragen Sie, was die Grundwahrheit für ein Urteil ist, bevor Sie darauf aufbauen. Keine Grundwahrheit, kein Werkzeug.



