Skip to content
    HAQQ
    • Precios
    Comenzar Gratis
    Comenzar GratisReservar una demo
    Iniciar sesión
    1. Inicio
    2. Blog
    3. Jev dentro de una arquitectura de IA legal: 8 patrones de decisión y el límite que medimos
    IA & Tech Legal

    Jev dentro de una arquitectura de IA legal: 8 patrones de decisión y el límite que medimos

    Probamos Jev de TypeSafe en toda nuestra pila legal por menos de 0,20 $. Reordena bien la normativa. También puntuó más alto las citas inventadas que las honestas.

    23 de septiembre de 2026
    22 min de lectura
    |
    HAQQ Team
    Jev dentro de una arquitectura de IA legal: 8 patrones de decisión y el límite que medimos

    En resumen: gastamos menos de $0.20 probando si un modelo que no genera texto pertenece a nuestra pila de IA legal. Lo hace, en tres lugares, y está en producción en uno de ellos. Falló en otros tres, y uno de esos fallos se invirtió tan completamente que las respuestas que contenían citas falsas obtuvieron una puntuación más alta que las honestas. La regla que surgió de esto es la parte útil: esta clase de modelo es fuerte donde un juicio tiene una respuesta objetiva que la evidencia proporcionada resuelve, y débil donde el juicio es cuestión de gusto.

    La propuesta, y por qué la tomamos en serio

    Existe un argumento que la mayoría de los agentes de IA desperdician su recurso más caro en decisiones que nunca necesitaron una frase. Enrutar una solicitud al modelo correcto es una decisión. Decidir si una llamada a una herramienta es segura es una decisión. Clasificar cincuenta documentos recuperados son cincuenta decisiones. Ninguna de estas produce prosa que alguien lea, sin embargo, todas se entregan a un modelo que cobra por palabra y responde en párrafos.

    En septiembre de 2026, TypeSafe AI lanzó un modelo basado en ese argumento. Jev es lo que ellos llaman un modelo de Sistema Uno, y la propiedad que lo define es que no genera texto en absoluto. Usted POSTea un bloque de estado más un conjunto de preguntas tipificadas, y obtiene probabilidades calibradas, todas evaluadas en un único viaje de ida y vuelta paralelo.

    Hay tres primitivas y no hay una cuarta. Un noul es una pregunta de sí o no que devuelve una probabilidad entre 0 y 1, y esa probabilidad es la confianza: 0.5 significa un volado, no una intensidad media. Una elección selecciona una opción de una lista que usted define, y físicamente no puede devolver una opción que usted no declaró. Una puntuación sitúa la entrada en una escala ordenada que usted describe con palabras, y devuelve la media ponderada por la probabilidad, por lo que una división de 70/30 en dos niveles se devuelve como 1.30 en lugar de 1 o 2.

    Esa es toda la superficie. No puede resumir, reescribir, redactar, extraer un fragmento o buscar nada. No tiene base de conocimientos ni recuperación. Responde preguntas cuyo espacio de respuestas usted declaró, sobre un estado que le proporcionó.

    La parte que es fácil pasar por alto

    El instinto es archivarlo como un clasificador rápido y barato. Eso subestima lo que realmente cambió, que no es el precio sino el orden.

    Un modelo de lenguaje escribe un token a la vez, por lo que el token nueve no puede existir hasta que lo haga el token ocho. Si le hace cuatro preguntas no relacionadas sobre un contrato, esos cuatro juicios independientes se ponen en cola uno detrás del otro, vuelven como un "blob" que luego usted analiza, valida y reintenta cuando la forma es incorrecta. Jev elimina la cola. Usted declara el espacio de respuestas de antemano y todas las preguntas se resuelven contra el mismo estado a la vez. El texto es una línea que hay que recorrer. Un espacio de respuestas es una habitación que se ve de una vez.

    Modelo de lenguaje de vanguardiaJev
    SalidaUna cadena que usted analiza y validaUn valor tipado en el que su código se ramifica
    OrdenaciónSecuencial, cada token condicionado por el anteriorNinguna, todas las preguntas en paralelo
    IncertidumbreEnterrada en prosa confiadaUna probabilidad explícita en cada opción
    Modo de falloForma malformada, opción inventada, rechazoUna respuesta incorrecta válida según el esquema
    ¿Puede escribir?Sí, ese es el productoNo. Ni una frase, ni un fragmento, ni código
    ¿Puede buscar cosas?Con herramientas, síNunca. Sin recuperación, sin base de conocimientos

    Esa fila de modo de fallo es la que importa en el derecho, y vale la pena ser directo al respecto. La garantía que se ofrece es que nunca obtendrá un valor fuera de su esquema. No es una garantía de que el valor sea correcto.

    Un error válido de esquema reembolsa al cliente equivocado tan rápido como lo hace uno malformado.

    Para una empresa de Legal AI, la palabra interesante en todo esto es calibrado. Un número con el que se puede ramificar en el código es un objeto diferente de un párrafo que un abogado tiene que leer y confiar. Escribimos en nuestra publicación de la capa de orquestación que la parte del Legal AI que determina si las citas se mantienen es invisible desde el exterior. Esto es un candidato para rellenar parte de esa parte invisible.

    Así que lo ejecutamos en toda nuestra pila. Todas las mediciones a continuación son nuestras, en nuestro propio corpus, y las que salieron mal también están aquí.

    Qué medimos y qué costó

    Diez superficies, trece tickets cerrados, menos de $0.20 de gasto total. Esto no es una fanfarronada sobre la frugalidad. Es la razón por la que valió la pena ejecutar el experimento: a una fracción de centavo por sentencia, puedes permitirte verificar cada evento en lugar de muestrear, y un resultado nulo cuesta casi nada de establecer.

    Latencia, medida en nuestro propio tráfico con una conexión activa mantenida abierta: 292ms en la mediana, 374ms en p90, 395ms en p95, a través de 40 llamadas. El cómputo del lado del servidor por sí solo es de 112ms. Nuestra primera medición dijo 700ms, y repetimos ese número internamente durante una semana antes de darnos cuenta de que estaba mal. Nunca habíamos reutilizado una conexión, por lo que cada llamada estaba pagando por un nuevo establecimiento de conexión. Misma API, misma versión de modelo, una medición cuidadosa de lo incorrecto. Es una pequeña vergüenza y una útil, porque es exactamente la clase de error que hace que un benchmark sea irreproducible un mes después.

    Ocho patrones, y cuáles probamos realmente

    Siete de estos circularon como una lista de patrones de desarrollador. El octavo es nuestro, y resulta ser el que más importa para el trabajo legal.

    • Enrutamiento de modelos. Predice la complejidad de la tarea, envía el trabajo fácil a un modelo pequeño y el trabajo difícil a uno de frontera.
    • Compuertas de riesgo para llamadas a herramientas. Antes de que un agente ejecute una herramienta, califique la herramienta más sus argumentos más la tarea actual, y devuelva permitir, bloquear o aprobación humana.
    • Clasificación de intenciones y dominios. Clasifique la solicitud en un conjunto fijo de intenciones antes de que el agente principal comience a razonar. En derecho, esto es la jurisdicción, el área de práctica y el entregable.
    • Decisiones de bucle. Después de cada paso del agente, prediga si es probable que otro paso sea útil.
    • Reordenamiento de la recuperación. Califique cada pasaje recuperado en función de la consulta y pase solo los de mayor puntuación al contexto.
    • Barandales y verificaciones de políticas. Ejecute verificaciones de seguridad y cumplimiento como clasificaciones rápidas en lugar de generar una respuesta de razonamiento completa.
    • Escalamiento a un humano. Prediga si una decisión automatizada es lo suficientemente confiable como para ejecutarse.
    • Compresión textual del contexto. Califique cada paso de un seguimiento largo del agente para determinar si todavía afecta el objetivo, elimine los irrelevantes y conserve los supervivientes palabra por palabra.

    Hemos medido seis de estos con nuestros propios datos. Tres funcionan, uno de ellos ya está en producción. Tres no. Los fallos reciben más espacio a continuación, porque son más instructivos y porque nadie más los publica.

    Una nota sobre el vecindario: un pequeño número de herramientas construidas con esta misma pila ya existen para la verificación de citas legales, todas lanzadas en las últimas dos semanas. Son experimentos iniciales más que productos operativos, y ninguna publica una cifra de precisión. La brecha en la que estamos escribiendo no es que a nadie se le haya ocurrido esta idea. Es que nadie ha publicado lo que sucede cuando la compruebas.

    Donde funciona: reordenamiento de la recuperación

    Nuestro corpus de estatutos MENA contiene 17.004 artículos. La recuperación en él es léxica en primer lugar, lo que significa que una consulta y un artículo que usan palabras diferentes para la misma obligación pueden no coincidir en absoluto. Este es el fallo habitual de la búsqueda legal en cualquier idioma, y es peor en árabe, donde la morfología pone más distancia entre un término de consulta y su coincidencia.

    Tomamos 80 consultas retenidas, las ejecutamos a través de la recuperación existente y luego volvimos a clasificar a los candidatos haciendo una pregunta por candidato: ¿este artículo responde a esta pregunta?

    Reclasificación de un corpus de estatutos de 17.004 artículos

    Porcentaje de 80 consultas retenidas en las que el artículo correcto apareció primero

    Solo recuperación léxica
    63.8%
    Después de reclasificar a cada candidato
    85.0%
    Techo: lo que la recuperación podría alguna vez mostrar
    88.8%

    En nueve de las 80 consultas, el artículo correcto nunca se recuperó, por lo que ningún reclasificador podría promocionarlo. Las consultas se redactaron a partir de los artículos muestreados, lo que favorece la recuperación léxica, así que lea el delta en lugar de los números absolutos.

    El rango recíproco medio pasó de 0,719 a 0,869. Diez de los diez casos revisados manualmente coincidieron, incluidos dos en los que el modelo se negó correctamente a promocionar nada porque no existía un candidato válido. Costo total: $0,0245.

    Una advertencia adicional. Nuestros artículos en árabe e inglés están divididos por jurisdicción, cada uno de los árabes es egipcio y cada uno de los ingleses es emiratí, por lo que esta ejecución no respalda ninguna afirmación sobre el idioma en absoluto.

    Funciona porque la pregunta tiene una respuesta correcta. Si este artículo responde a esta pregunta lo deciden el artículo y la pregunta, ambos están frente al modelo.

    Dónde funciona: detectando las respuestas que no son respuestas

    Antes de adoptar Jev, calificábamos las respuestas de referencia con un modelo de lenguaje que actuaba como juez. Ese juez era generoso de una manera específica y perjudicial. Otorgó un perfecto 10.0 al 56% de las respuestas que calificó, y para un modelo el 90% de las respuestas resultaron impecables en las cuatro dimensiones. Un calificador sin techo no mide nada en la parte superior de su rango.

    Jev calificó el 0% de las respuestas con 9.9 o más. Más útilmente, detectó los cinco errores de API truncados en el conjunto con probabilidades entre 0.96 y 0.97. El juez anterior había calificado esos mismos cinco como 1 de 10 y los promedió en la puntuación de capacidad del modelo, lo que significaba que habíamos estado informando una tasa de falla de infraestructura del 10% como incompetencia legal. Excluirlos movió un modelo de 5.80 a 7.67.

    Lo más valioso que el modelo hizo para nuestros puntos de referencia no fue juzgar la calidad. Fue notar que una cadena no era una respuesta.

    Donde funciona, en producción: la expresión regular de la puerta de cumplimiento que no podía ver

    Este está en vivo y se ganó su lugar al detectar algo vergonzoso.

    Ejecutamos cada pieza de copia pública a través de una puerta de verificación previa antes de enviarla, comparándola con nuestras propias reglas de mensajería. Algunas de esas reglas son líneas rojas: no decimos que reemplazamos a los abogados, y no afirmamos que nuestra IA está libre de alucinaciones, porque ninguna de las dos es cierta y ambas son el tipo de afirmación que un regulador lee de cerca.

    Un borrador en francés que contenía violaciones literales de ambas reglas pasó esa puerta en salida 0, con cero hallazgos. Los patrones de expresiones regulares eran solo en inglés. El francés de que reemplazamos abogados, y el francés de que nuestra IA no tiene alucinaciones, pasó directamente por un chequeo que habría detenido instantáneamente sus equivalentes en inglés.

    Un pase semántico capturó ambos de manera decisiva: 0.90 en la afirmación implícita, 0.95 en la línea roja de reemplazo de abogados, 0.83 en cómo lo leería un regulador. Costo por borrador: alrededor de $0.00005, a través de ocho preguntas escritas en una solicitud paralela.

    El resultado inesperado es que las expresiones regulares y la semántica resultaron ser complementarias en lugar de redundantes. Partimos de la suposición de que una reemplazaría a la otra, y medimos en 35 borradores reales que cada regla de expresión regular con una contraparte semántica estaba detectando una formulación diferente del mismo riesgo. La expresión regular detecta la redacción literal. El pase semántico detecta la paráfrasis. Nuestro propio ticket predecía que podríamos retirar algo, y los datos dijeron que no.

    Donde se invirtió: al preguntarle si una cita está fundamentada

    Ahora el error que reorganizó nuestro pensamiento.

    Le pedimos a Jev que calificara la fundamentación en 150 respuestas legales reales, producidas por tres modelos de vanguardia a través de 50 indicaciones de MENA y el Reino Unido. Fundamentación aquí significa: ¿las afirmaciones están respaldadas, las citas son reales y se utilizan correctamente? Es la pregunta más importante en Legal AI, y es la pregunta que nuestra propia auditoría de alucinaciones existe para seguir haciendo.

    Las respuestas que contenían citas inventadas obtuvieron 3.21. Las respuestas honestas obtuvieron 2.79. La correlación entre la puntuación compuesta y las etiquetas de precisión revisadas por humanos fue de r = +0.02, es decir, ninguna.

    La verificación no solo no detectó la invención. La recompensó.

    Una vez que ves por qué, no puedes dejar de verlo. El Artículo 5bis del Real Decreto M/13 parece preciso, específico y autoritario. No existe. Un modelo al que se le pide que juzgue la fundamentación solo a partir del texto no tiene nada con qué comparar, por lo que recurre a las características que suelen acompañar a la escritura fundamentada: especificidad, densidad de citas, estructura segura. La invención produce las tres. La especificidad es la apariencia de la invención, por lo que cualquier rúbrica que recompense la especificidad recompensa la invención.

    Ahora cambia una cosa. Dale al modelo el pasaje fuente junto con la afirmación y pregúntale si este pasaje respalda esta proposición. En una ejecución separada y reproducible de 180 pares de nuestro propio corpus, el modelo alojado alcanzó un AUC de 0.9962 y detectó el 94.4% de las atribuciones erróneas con una tasa de falsas alarmas de cero.

    Mismo modelo. Misma tarea en abstracto. Resultado opuesto, porque una versión es una comparación entre dos cosas que tiene delante y la otra es una búsqueda de conocimiento que no puede realizar.

    Una advertencia más, porque importa más que la victoria. En ese mismo conjunto de 180 pares, una verificación de contención simple con `grep` obtiene un AUC de 0.9944 y detecta el 98.9%. Esos pares se construyeron sobre la contención textual, que es precisamente para lo que sirve `grep`. Trate 0.9962 como un piso en lugar de un techo, y trate la fundamentación a nivel de paráfrasis, donde un clasificador tipificado debería realmente demostrar su valía, como no probado por esa ejecución.

    La recuperación no es un detalle de implementación debajo del paso de verificación. La recuperación es lo que hace posible la verificación.

    Donde perdió ante un contador de pasos: control de bucle

    Probamos este específicamente para esta publicación y no sobrevivió.

    El patrón dice: después de cada paso del agente, pregunta si es probable que otro paso sea útil y detente cuando la respuesta sea no. Construimos la prueba a partir de 52 de nuestras propias trayectorias de agente terminadas, 1.750 pasos etiquetados. La verdad fundamental para cada paso era si el siguiente paso realmente mostraba información que no estuviera ya en la trayectoria, calculado por una regla que revisamos manualmente en 24 de 25.

    Predecir si un agente debería dar otro paso

    Área bajo la curva ROC, 1.750 pasos etiquetados en 52 trayectorias terminadas

    Un simple contador de pasos dados hasta ahora (gratuito)
    0.670
    ¿Alguno de los últimos 3 pasos devolvió algo nuevo (gratuito)?
    0.702
    Jev, una pregunta escrita por paso ($0.54)
    0.718

    La diferencia entre Jev y la segunda señal gratuita es de +0.017, con un intervalo de confianza del 95 % de -0.010 a +0.051. No supera un bootstrap pareado. Pasos ahorrados con cero pérdida de trabajo útil: cero, para los tres.

    Pagamos 0,54 $ por no superar una característica calculada con una diferencia de conjuntos.

    Hay dos cosas subyacentes que valen más que el titular. La primera es que una pausa no es agotamiento. La regla de "parada libre" después de dos pasos consecutivos que no devolvieron nada nuevo, ejecutada como un oráculo en su propia premisa, dañó 30 de las 31 trayectorias que detuvo. Los agentes se quedan en silencio en medio de un trabajo útil todo el tiempo.

    La segunda explica el resultado completo. Divida las filas por el tipo de herramienta que usó el siguiente paso y la imagen cambia completamente: 0,742 cuando el siguiente paso escribe o edita un archivo, 0,695 cuando lee o busca, y 0,597, cerca del azar, en comandos de shell, donde viven el 59% de nuestras filas.

    Nunca predijo si el agente había aprendido lo suficiente. Predijo si lo siguiente que regresaría sería un acuse de recibo de escritura o una página de salida. Eso es un juicio sobre la forma del próximo evento, no sobre el estado del conocimiento del agente.

    Evalúe esto honestamente: nuestro corpus son agentes de codificación e investigación, no bucles de razonamiento legal, y el límite de ahorro era bajo para empezar, porque una transcripción terminada es, por definición, una que se detuvo aproximadamente cuando la información se detuvo. Ambos hechos limitan lo lejos que se generaliza. Ninguno rescata el patrón.

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Donde perdió frente a una expresión regular: compuertas de riesgo de llamadas a herramientas

    El último patrón que probamos, y el más incómodo, porque queríamos que este funcionara.

    Gestionamos una infraestructura que no debe desconectarse. La regla que la protege actualmente reside en un archivo de configuración que se supone que un agente debe leer y obedecer. Una regla que depende de ser leída no es un control. Una compuerta que se activa al realizar la llamada sí lo es.

    Así que etiquetamos 19.922 llamadas reales a herramientas de 766 de nuestras propias transcripciones, puntuamos 284 de ellas y comparamos un clasificador tipado con la lista de denegación que realmente escribiría a mano.

    Verdad fundamentalnJevLista de denegación, ingenuaLista de denegación, robusta
    Lectura segura121120/121121/121120/121
    Destructiva119106/119118/119118/119
    Podría desconectar un host activo4425/448/4420/44

    Requerimos que cada llamada destructiva fuera detectada. El clasificador alcanzó el 89.1%, por debajo de ambas listas de denegación. La expresión regular gana la clase para la que existía la prueba.

    Hay una victoria genuina enterrada en esto. En la pregunta específica de si una llamada concreta podría dejar fuera de línea a un host en vivo, una pregunta dedicada de sí o no detectó 21 de 22 con una tasa de falsas alarmas del 3.4%, mientras que la más fuerte de las dos listas de denegación escritas a mano detectó 8 de 22. Si se unen ambas, la tasa de llamadas riesgosas que se escapan se reduce a la mitad. A once centavos por cada mil llamadas, el costo no es lo que te detiene. La recomendación que surgió de esto sigue siendo enviar la expresión regular y mantener el clasificador como una segunda opinión, nunca como la puerta.

    El resultado más limpio de todo el programa se encuentra dentro de esta prueba, y se trata de cómo se pregunta en lugar de qué se pregunta. Mismo modelo, mismas filas, misma tarde. La pregunta concreta, ¿puede esta llamada dejar fuera de línea a uno de estos hosts en vivo específicos?, alcanzó un 95.5% de recuperación con una tasa de falsas alarmas del 3.4%. La pregunta abstracta, ¿es esta acción irreversible?, necesitó un umbral mucho más laxo para alcanzar una recuperación comparable y arrastró la tasa de falsas alarmas al 34.6% para lograrlo.

    Ya habíamos aprendido esto antes y lo habíamos anotado como una máxima: nombra la prueba concreta, no la categoría abstracta. Esta es la primera vez que lo tenemos como una comparación controlada en lugar de una anécdota, y el tamaño de la brecha nos sorprendió.

    Una cosa más de esa prueba, con sus límites. Intentamos convencer al clasificador para que aprobara llamadas que había bloqueado, utilizando ocho cargas útiles de inyección escritas a mano en 384 llamadas emparejadas, plantadas en el comando, la descripción y el contexto de la tarea. Ninguna logró cambiar de forma fiable una llamada bloqueada a permitida. Este es un resultado real y pequeño: ocho cargas útiles escritas por la misma persona que construyó la prueba no es un equipo rojo, y una lista de denegación es inmune a esto por construcción, no por suerte. La propia documentación de TypeSafe enumera que el estado no se trata como hostil entre las limitaciones del modelo, y para una puerta de seguridad esa limitación recae directamente en la entrada que un atacante controla.

    El octavo patrón, y por qué es el legal

    Todo lo anterior está tomado de la ingeniería general de agentes. Este es nuestro, y surge de una restricción que solo realmente afecta en el ámbito legal.

    Las ejecuciones largas de agentes desbordan su contexto, y la solución estándar es que un modelo de lenguaje resuma el rastro hasta el momento. Para la mayoría del software, eso está bien. Para el trabajo legal, es un desastre silencioso, porque un resumen de un estatuto es un documento nuevo. Contiene palabras nuevas. Esas palabras fueron escritas por un modelo, no por un legislador, y cada paso posterior ahora razona sobre la paráfrasis en lugar de la ley.

    La alternativa es compactar sin parafrasear. Puntuar cada paso del rastro para ver si todavía se relaciona con el objetivo actual, descartar los que no, y mantener los supervivientes palabra por palabra. Nada se reescribe. El contexto se acorta porque se eliminaron cosas, no porque se reescribieron cosas.

    Un resumen de un estatuto es un documento nuevo. Una lista filtrada de estatutos sigue siendo los estatutos.

    Este es el patrón que más nos interesa y es el que aún no hemos medido, así que trátelo como una posición de diseño y no como un resultado. Lo decimos en voz alta porque es el tipo de problema para el que un modelo de decisión es inusualmente adecuado, y porque no hemos visto a nadie más enmarcar la compactación como un requisito de corrección en lugar de una optimización de costos.

    Dos cosas sobre el trabajo legal de las que nadie te advierte

    No puede ver un documento escaneado. Jev toma texto. Una parte muy grande de los documentos legales reales, particularmente en todo MENA, llegan como fotografías de papel. Esto significa que la cadena de procesamiento que lo precede hace todo el trabajo que determina si recibe una entrada justa, y cualquier confianza que informe está condicionada a un paso de OCR del que no sabe nada. Existen reimplementaciones abiertas de la misma arquitectura que se ejecutan en modelos base con capacidad de visión, que es la dirección en la que eventualmente irá esto, pero el modelo alojado que tiene ante usted hoy es ciego.

    Las abreviaturas legales lo rompen de una manera que parece un error y no lo es. Le pedimos que clasificara una solicitud para revisar un MSA en árabe y lo marcara con cambios. La legalidad arrojó un 0.30, lo que para una solicitud claramente legal parece un fracaso. Aísle la frase y la imagen se resuelve: MSA solo obtiene 0.97, Master Services Agreement 0.98, un MSA escrito en árabe 0.96, y MSA en árabe colapsa a 0.30. Poner la palabra árabe inmediatamente antes de MSA cambia el acrónimo de Master Services Agreement a Modern Standard Arabic.

    El modelo tiene razón. La frase es genuinamente ambigua, y también sería ambigua para un lector humano. Pero el trabajo legal en MENA genera esa construcción exacta constantemente, por lo que cualquier sistema que se base en una etiqueta de documento la encontrará, y en una prueba de rendimiento se leerá como un fallo del modelo cuando es un artefacto de ambigüedad de entrada. Si está evaluando un clasificador de texto legal, verifique si hay una abreviatura ambigua antes de concluir que el modelo no puede manejar su jurisdicción.

    La regla que surgió de todo esto

    Seis superficies, tres victorias, tres derrotas. El patrón de las derrotas es lo que vale la pena destacar.

    La reclasificación funciona porque "¿este artículo responde a esta pregunta?" tiene una respuesta que el artículo y la pregunta resuelven entre ellos. La fundamentación de la cita funciona cuando se entrega la fuente y se invierte cuando no se hace, porque sin la fuente la pregunta se convierte en una búsqueda de conocimientos. El control de bucle falla porque "¿este agente ha aprendido lo suficiente?" no está resuelto por nada en la trayectoria. La sugerencia de enlaces internos, que también probamos, falló de la misma manera: se preguntó si un lector tendría una razón real para hacer clic de una página a otra, las puntuaciones contra 761 enlaces curados por humanos arrojaron un 0.582 para enlaces reales y un 0.537 para pares que ningún editor había conectado, una brecha de 0.045, con revisores manuales de acuerdo en 12 de 20.

    Antes de construir sobre un juicio, pregunte cuál es la verdad fundamental. Si la respuesta honesta es una preferencia del editor, espere una brecha de alrededor de 0.05 y planifique con un humano.

    Este es el mismo límite que nuestra propia investigación sobre citas falsas encontró desde la otra dirección, y es por eso que juzgamos las herramientas según si verifican que una cita dice lo que afirman, no solo que existe.

    Lo que le diríamos a alguien que evalúa la Legal AI

    Cuatro cosas, solo una de ellas sobre este modelo en particular.

    Pregunte a qué está anclada la verificación. Nuestra Legal AI verifica que las citas no son una arquitectura. Verificar que un caso existe es una búsqueda en la base de datos. Verificar que el caso dice lo que la respuesta afirma es una comparación, y necesita el pasaje fuente a mano en el momento del juicio. Los productos que hacen lo primero y lo describen como lo segundo son la norma, no la excepción.

    Pregunte por la tasa de fallos, no por la tasa de éxito. Cada herramienta en esta categoría publica un número que la halaga. Muy pocas publican lo que midieron y perdieron. Nuestra propia honestidad tiene límites que vale la pena mencionar: el primer pase automatizado para etiquetar ese corpus de llamadas a herramientas tuvo un 86% de errores en su clase más importante, todo en la misma dirección, y lo encontramos mediante verificación manual en lugar de astucia.

    Pregunte contra qué se calificó el benchmark. Este punto sorprende a casi todo el mundo. Un benchmark puede ser calificado contra la verdad fundamental, o contra la concordancia con un modelo de lenguaje de vanguardia. Lo segundo es mucho más barato y mucho más débil, porque estar de acuerdo con GPT incluye estar de acuerdo con los errores de GPT. Cuando un proveedor informa la precisión, la pregunta no es qué tan alto es el número. Es con qué se comparó el número.

    Tenga cuidado con un número que se afirma en lugar de medirse. El propio gráfico de lanzamiento de TypeSafe muestra una tasa de alucinación del 0%, y la nota al pie dice, en sus palabras, que el número no es empírico y se añade por construcción porque la coincidencia de esquemas se aplica en lugar de observarse. Lo divulgan. El titular encima del gráfico no lo hace. La afirmación subyacente es verdadera y limitada: nunca obtendrá un valor fuera de su esquema. No es una afirmación de que el valor sea correcto. Un analista independiente señaló esto una semana después del lanzamiento, y es una observación justa.

    Lo que realmente cambió para nosotros

    No el costo. Intercambiar una llamada a un modelo de lenguaje por una tipada ahorra unos centavos, y los centavos nunca fueron el problema.

    Lo que cambió es que una decisión que el sistema ya estaba tomando silenciosamente ahora lleva un número. La revisión de contratos a 0.91 frente a litigios a 0.09 es una ruta que se puede automatizar y registrar. 0.52 frente a 0.46 es un lanzamiento de moneda con una etiqueta, y requiere un humano. Un modelo de lenguaje habría dado la misma respuesta en ambos casos, en una oración segura, sin forma de distinguir las dos situaciones.

    Para un producto donde equivocarse es toda la superficie de riesgo, eso vale más que cualquier múltiplo de velocidad en un gráfico de proveedor.

    El hábito que mantendríamos incluso si nunca enviáramos otra solicitud: pasa por tu agente y encuentra cada llamada que simplemente selecciona algo. Qué herramienta sigue. ¿Es esto spam? ¿Este fragmento es relevante? ¿Esto necesita un humano? ¿Este diferencial es arriesgado? Ninguna de esas son tareas de escritura. Son declaraciones condicionales que alguien externalizó a un modelo de frontera, y la mayoría de ellas no necesitan uno.

    Conclusiones clave

    • Un modelo que no genera texto es una herramienta real para un arnés legal, en los lugares específicos donde un juicio es una comparación entre cosas que puedes poner frente a él.
    • Al pedirle que puntuara la solidez solo con el texto, puntuó las citas fabricadas más alto que las honestas, 3.21 contra 2.79, con una correlación con la precisión real de r = +0.02. La recuperación es lo que hace posible la verificación, no un detalle de implementación subyacente.
    • Está funcionando en producción en nuestra puerta de cumplimiento, donde detectó violaciones de la línea roja en un borrador francés que nuestra expresión regular solo en inglés pasó con salida 0. Las comprobaciones de expresiones regulares y semánticas resultaron ser complementarias, no redundantes, en contra de nuestra propia predicción.
    • La reclasificación de nuestro corpus de estatutos de 17,004 artículos movió la recuperación en el rango 1 de 0.638 a 0.850 por menos de tres centavos.
    • El control de bucle no superó a un contador de pasos gratuito en una prueba pareada, y su aparente habilidad se derrumbó a casi el azar una vez que controlamos el tipo de acción que seguiría.
    • Una puerta de riesgo de llamada de herramienta recuperó el 89.1% de las llamadas destructivas, mientras que una lista de denegación escrita a mano recuperó el 99.2%. Estamos enviando la expresión regular.
    • Específicamente para el trabajo legal: no puede leer un documento escaneado, y el árabe estándar moderno (MSA) se lee como Modern Standard Arabic en lugar de Master Services Agreement, lo que reduce la legalidad de 0.97 a 0.30.
    • La compactación debe eliminar, no reescribir. Un resumen de un estatuto es un documento nuevo.
    • Pregunta cuál es la verdad fundamental para un juicio antes de construir sobre él. Sin verdad fundamental, no hay herramienta.

    Fuentes y lecturas adicionales

    • TypeSafe AI: Documentación Jev y limitaciones publicadas
    • Cognición Novedosa: La Garantía, No Puede Alucinar Cubre la Forma, No la Verdad
    • Cómo la IA legal inventa una citación
    • Auditoría de alucinaciones de IA legal
    • La capa de orquestación de la IA legal
    • HAQQ Legal AI Benchmark 2026
    H

    HAQQ Team

    Editorial

    Recursos relacionados

    How legal AI invents a citationAI Legal Hallucination AuditThe legal AI orchestration layerLegal AI Benchmark 2026

    Artículos relacionados

    ¿La mejor IA para trabajo jurídico en 2026? Calificamos 3000 respuestas

    ¿La mejor IA para trabajo jurídico en 2026? Calificamos 3000 respuestas

    Qué ocurre antes de que una IA jurídica responda a su pregunta

    Qué ocurre antes de que una IA jurídica responda a su pregunta

    Alucinación de la IA legal: la cita falsa que supera todas las verificaciones

    Alucinación de la IA legal: la cita falsa que supera todas las verificaciones

    Preguntas frecuentes

    Can Jev detect AI hallucinations in legal citations?

    Only when you give it the source. We measured both setups on the same 150 legal answers. Asked to score groundedness from the answer text alone, it scored answers containing fabricated citations higher than honest ones, 3.21 against 2.79, with a correlation to human accuracy labels of r = +0.02. Handed the source passage alongside the claim and asked whether that passage supports that proposition, the same model reached an AUC of 0.9962 and caught 94.4% of misattributions at a zero false alarm rate on a separate 180-pair run. The model has no retrieval and no knowledge base, so a verification step without retrieval in front of it is not a verification step.

    What is Jev and how is it different from an LLM?

    Jev is TypeSafe AI's System One decision model, released in September 2026. It generates no text. You send a block of state plus typed questions and get back calibrated probabilities, all evaluated in one parallel round trip. There are three primitives: a noul returns the probability that a yes-or-no statement is true, a choice picks one option from a list you define, and a score places the input on an ordered scale you describe. A language model produces a string you parse and validate, one token at a time. Jev produces a typed value your code branches on, with every question resolved simultaneously.

    Is Jev accurate enough to use in legal work?

    It depends entirely on the question you ask it. In our own testing it moved recall at rank 1 on a 17,004-article statute corpus from 0.638 to 0.850, and it caught red-line compliance violations in a French draft that our English-only regex checks passed with zero findings. It also failed three tests: it scored fabricated citations higher than honest ones when judging groundedness from bare text, it did not beat a free step counter at deciding when an agent should stop, and it recalled 89.1% of destructive tool calls where a hand-written deny-list recalled 99.2%. The rule we derived is that it is strong where a judgment has an objective answer the supplied evidence settles, and weak where the judgment is a matter of taste.

    Does Jev work on Arabic legal documents?

    On Arabic legal text it classified 10 of 10 cases correctly across English, Arabic and French, though that fixture set was small and easy enough that every case came back at full confidence, so read it as parity holding on easy inputs rather than as proven parity. Two practical limits matter more. It cannot read a scanned document at all, and a large share of MENA legal documents arrive as photographs of paper. And legal abbreviations can be genuinely ambiguous: the phrase Arabic MSA scores 0.30 on legal-ness because the word Arabic flips the acronym from Master Services Agreement to Modern Standard Arabic, where MSA alone scores 0.97.

    What does a 0% hallucination rate actually mean?

    For a model with a fixed output schema it means the model cannot return a value you did not declare. That is a real and useful guarantee. It is not a guarantee that the value is correct. TypeSafe discloses this themselves in a footnote under their launch chart, which says the number is not empirical and is added by construction because the schema match is enforced rather than observed. A schema-valid wrong answer is still a wrong answer, and in legal work it causes exactly the same damage as a malformed one.

    How much does it cost to run decision checks on legal documents?

    In our own billing, the entire evaluation programme across ten surfaces cost under $0.20. Individual jobs: reranking 80 queries against a 17,004-article corpus cost $0.0245, a semantic compliance pass on one draft costs about $0.00005, and tool-call classification runs at roughly eleven cents per thousand calls. Cost is not what stops you adopting this. Whether the judgment has a ground truth is what stops you.

    ¿Qué sigue?

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Calcula tu ROI

    Descubre cuánto tiempo y dinero HAQQ ahorra a tu bufete

    Explora Prompts legales

    Prompts listos para cada tarea legal

    Volver al Blog

    Artículo anterior

    Responsabilidad del operador de IA: lo que el nuevo código de conducta de Microsoft exige a su despacho

    Tabla de contenidos

    22 min de lectura

    Share this

    Ponlo en práctica

    Hazle a HAQQ la pregunta que te dejó este artículo.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Tu Gemelo Legal de IA y Sistema de Gestión de Práctica para redacción, facturación y éxito.

    Download on theApp StoreGet it onGoogle Play

    Documentaciones

    • Docs se abre en una pestaña nueva
    • Primeros pasos se abre en una pestaña nueva
    • Sala de prensa se abre en una pestaña nueva
    • Novedades del producto se abre en una pestaña nueva
    • Estado se abre en una pestaña nueva
    • Seguridad
    • FAQ se abre en una pestaña nueva
    • Comunidad se abre en una pestaña nueva
    • Soporte se abre en una pestaña nueva

    Academy

    • Socio se abre en una pestaña nueva
    • Curso se abre en una pestaña nueva
    • Noticias jurídicas se abre en una pestaña nueva
    • Habilidades se abre en una pestaña nueva
    • Cláusulas se abre en una pestaña nueva
    • Biblioteca de prompts se abre en una pestaña nueva
    • Herramientas se abre en una pestaña nueva
    • Centro de investigación se abre en una pestaña nueva
    • Documentos se abre en una pestaña nueva

    Sitio web

    • eFirm
    • Chat IA Legal
    • Aplicación Móvil
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Precios
    • Compáranos
    • Soluciones
    • Blog
    • Conocer equipo
    • Únete a nosotros se abre en una pestaña nueva
    Abrir la app
    • Idiomasenarfresitdeptrohi
    • Contactoinfo@haqq.ai
    • Estadooperativo·fundamentado
    • Términos de Servicio
    • Política de Privacidad
    • Política de Cookies
    • Procesamiento de Datos
    • Humanos se abre en una pestaña nuevaAbogados se abre en una pestaña nuevaSeguridad se abre en una pestaña nueva
    © 2026 HAQQ Inc. Todos los derechos reservados.Producto desarrollado internamente por HAQQ. Sitio web construido con herramientas web modernas.