TL;DR - Entregamos HAQQ a un tercero independiente y le pedimos que lo probara como lo haría un comprador escéptico: 61 tareas legales reales en 21 jurisdicciones, cada tarea ejecutada dos veces, sin asesoramiento ni acceso especial.
HAQQ superó el 27.0% de las tareas en general, por encima del promedio de Legal AI y del promedio de la industria. En The High Bar - el subconjunto de tareas que casi nada en el campo puede completar - HAQQ superó el 5.9% frente al 1.1% del promedio de Legal AI: más de cinco veces el campo. Fue la herramienta más fuerte probada en la redacción de leyes de Omán, obtuvo 65.2% en documentos escaneados y de baja calidad, y alcanzó el 100% en las tareas diseñadas para incitarla a inventar contenido que no existía.
Estamos publicando nuestros propios números a continuación. Los productos de la competencia aparecen solo como un promedio agregado; esa es la regla de divulgación del evaluador, no nuestra elección.
Por qué un benchmark independiente
La mayoría de los benchmarks de Legal AI son ejecutados por las empresas que venden el producto. Incluido el nuestro, y el nuestro está sesgado por definición, porque es nuestro. Así que hicimos lo contrario: entregamos HAQQ a un evaluador independiente sin intereses en el resultado y le pedimos que lo calificara frente al campo.
Cuando un tercero sin nada que ganar realiza la prueba, el número significa algo diferente. Ahí es hacia donde se dirige el mercado. Los compradores, y cada vez más los LLM que recomiendan herramientas, buscan fuentes independientes confiables en lugar del marketing del proveedor. Preferimos ganarnos la puntuación que reclamarla.
Cómo funciona el benchmark
Una puntuación solo vale tanto como el método que la respalda, así que aquí está el método completo. Nada de esto es nuestro diseño - es la metodología publicada del evaluador, aplicada idénticamente a cada aplicación en la cohorte.
- 61 tareas reales, aportadas por abogados en ejercicio, que abarcan la redacción de contratos y la extracción de información en 21 jurisdicciones, incluyendo Estados Unidos, Reino Unido, India, Singapur, Países Bajos y Omán.
- Los documentos llegan como lo hacen en la práctica - archivos Word nativos, PDFs, escaneos, fotografías y archivos con cambios controlados. Nada se preconvierte en texto limpio, por lo que leer el archivo original es parte de lo que se mide.
- Criterios binarios de aprobación/rechazo, escritos por abogados, fijados antes de las pruebas. Una tarea se aprueba solo cuando todos los criterios aplicables se cumplen. Donde varias respuestas serían profesionalmente defendibles, los criterios lo permiten - aunque sigan reprobando omisiones y errores específicos.
- Dos ejes, nunca mezclados: sustancia y forma. La sustancia pregunta si el trabajo es correcto y completo; la forma pregunta si un abogado podría usarlo tal como fue entregado. Una respuesta pulida que es legalmente incorrecta aún falla.
- Cada tarea se ejecuta dos veces, de forma independiente, y la puntuación es el promedio de las dos ejecuciones - así, una única generación afortunada no puede alterar el resultado.
- Dos jueces de LLM independientes califican cada resultado, y cualquier desacuerdo que pudiera cambiar si una tarea se aprueba o no es escalado a un abogado calificado que revisa el resultado a ciegas, sin saber qué producto lo produjo. El veredicto humano es final y se conserva para auditoría.
- The High Bar es el subconjunto que no más de 2 de las 10 aplicaciones evaluadas pudieron completar: 34 tareas, puntuadas en 68 intentos. Existe específicamente para separar el rendimiento excepcional de la competencia ordinaria.
Dos consecuencias que vale la pena internalizar antes de leer cualquier número a continuación. Primero, las tasas de aprobación en este benchmark parecen brutalmente bajas en comparación con los números de marketing que se ven en otros lugares - esa es la regla de todo o nada haciendo su trabajo, y se aplica a todos por igual. Segundo, nunca vemos las puntuaciones individuales de nuestros competidores. El evaluador solo nos muestra un promedio agregado de Legal AI, razón por la cual esta publicación compara HAQQ con promedios en lugar de con productos específicos.
Datos clave
- Tasa de aprobación general: 27.0%, por encima del promedio de Legal AI y del promedio de la industria. Una tarea solo se aprueba cuando cada criterio redactado por abogados se cumple, por lo que los números absolutos son bajos en todo el campo.
- The High Bar: 5.9% vs 1.1%. En el subconjunto más difícil, HAQQ aprobó más de cinco veces más a menudo que el promedio de Legal AI, y casi tres veces el promedio de propósito general.
- La herramienta más potente probada en la redacción de leyes omaníes (50.0%) - no competitiva, la más potente.
- 100% en el manejo de referencias faltantes. En tareas diseñadas para hacer que un modelo invente anexos y referencias ausentes, HAQQ preservó la brecha en todo momento.
- 2.53/3 en forma - claridad 2.73, estructura 2.65 - por encima de ambos promedios. Correcto y utilizable tal como se entrega.
- El conjunto de tareas fue deliberadamente difícil; todo el campo puntúa bajo, porque la mayoría de las herramientas aún fallan en trabajos legales genuinamente difíciles.
Lo que encontró el estudio comparativo
Aquí están los números comparativos. "Legal AI avg" es el promedio de otras aplicaciones de Legal AI evaluadas; "general-purpose avg" son los asistentes de chat más avanzados. La forma se puntúa del 1 al 3, donde 3 es la mejor.
| Medida | HAQQ | Legal AI promedio | Promedio general |
|---|---|---|---|
| Redacción de contratos - tasa de aprobación | 24.2% | 20.6% | 23.9% |
| Redacción de contratos - formulario (1-3) | 2.56 | 2.44 | 2.44 |
| Extracción de datos - tasa de aprobación | 30.0% | 29.6% | 29.3% |
| El listón alto - tasa de aprobación | 5.9% | 1.1% | 2.2% |
Y las medidas donde el evaluador reportó HAQQ por sí mismo:
| Medida | HAQQ |
|---|---|
| Tasa de aprobación general | 27.0% |
| Formulario general (1-3) | 2.53 |
| Redacción de contratos - criterios cumplidos | 78.6% |
| Manejo de OCR y escaneo - criterios cumplidos | 65.2% |
| Redacción de leyes omaníes | 50.0% |
| Manejo de referencias faltantes | 100.0% |
| Éxito repetible en ambas ejecuciones | 21.3% |
Redacción de contratos
El evaluador calificó la redacción en dos ejes: sustancia (¿la respuesta es precisa y completa?) y forma (¿el entregable está pulido y listo para presentar a un cliente?).
HAQQ superó tanto a las herramientas de propósito general como al promedio de Legal AI en cada uno: una tasa de aprobación del 24.2% frente al 23.9% y 20.6%, y 2.56/3 en forma frente al 2.44 para ambos campos. En cuanto a criterios individuales, en lugar de tareas completas, HAQQ satisfizo el 78.6% de lo que los abogados pidieron. No solo técnicamente correcto. Correcto y listo para el cliente.
El nivel más alto: las tareas más difíciles
Dentro del estudio comparativo se encontraba un conjunto más pequeño de los problemas más difíciles, formalmente llamado The High Bar: las 34 tareas que no más de 2 de las 10 aplicaciones evaluadas pudieron completar. Trabajo de varios pasos, múltiples documentos de referencia, patrones de hechos complejos. El tipo de cosas donde la mayoría de la IA simplemente falla.
HAQQ aprobó el 5.9% de esos 68 intentos. El Legal AI promedio aprobó el 1.1%; el promedio de propósito general fue del 2.2%. Eso es más de cinco veces el campo de Legal AI y casi tres veces los asistentes de chat más avanzados - el margen más amplio que HAQQ registró en toda la evaluación.
Lea esos números honestamente: 5.9% es un número bajo en términos absolutos, y debería serlo. Estas son tareas seleccionadas específicamente porque toda la industria falla en ellas. La brecha es la señal aquí, no el nivel. Esta es la parte que más nos importa, porque parece un trabajo legal real en lugar de una demostración.
Tres cosas que destacaron
1. Trabajo legal en Oriente Medio
En la redacción de documentos regidos por la legislación omaní, HAQQ obtuvo los resultados más sólidos en el punto de referencia, con un 50,0%. No competitivo. El más fuerte. Eso es lo que nos propusimos construir, por lo que no fue una sorpresa para nosotros, pero es bueno verlo confirmado por alguien que no tiene motivos para halagarnos.
2. Documentos escaneados y de baja resolución
El trabajo legal se basa en PDF defectuosos: contratos enviados por fax, expedientes escaneados, páginas fotografiadas. En material fuente escaneado, fotografiado, redactado y, por lo demás, imperfecto, HAQQ cumplió el 65,2% de los criterios y superó el 33,3% de las tareas por completo — por encima del promedio en ambos. Con mayor frecuencia, extrajo contenido legible mientras señalaba lo que no podía leer, porque no se apoya en el OCR incorporado de un modelo. Ejecuta el suyo propio.
3. No inventó cosas
El punto de referencia incluía tareas diseñadas para incitar a un modelo a inventar lo que no existe: anexos faltantes, referencias ausentes. HAQQ obtuvo una puntuación del 100% en el punto de control de referencias faltantes. Cuando faltaban anexos clave, preservó consistentemente la brecha en lugar de inventar su contenido.
Una salvedad honesta, expresada con precisión: ese 100% se refiere a una medida específica — reconocer cuándo una fuente referenciada o un hecho solicitado simplemente no está disponible. En las tareas más amplias de resistencia a las alucinaciones del punto de referencia, HAQQ obtuvo un 28.0% de aprobación y un 61.7% de criterios cumplidos: por encima del promedio, no perfecto. Ninguna IA está universalmente libre de alucinaciones. Inventar contenido ausente es el modo de fallo que acaba con carreras en el ámbito legal, por lo que es en lo que nos obsesionamos.
Por qué la alucinación es todo el juego en el ámbito legal
En la codificación por intuición, una alucinación es un error que detectas. En el ámbito legal, una alucinación es un caso falso citado a un juez. Ya has visto los titulares. Para un contrato o una presentación judicial, una sola cláusula inventada o una referencia cruzada a una ley que no existe no es un pequeño inconveniente. Es descalificador.
Así que "mayormente correcto" no es un producto. El verdadero estándar es si un abogado puede confiar lo suficiente en el resultado como para basarse en él. Las pruebas independientes en tareas de contenido ausente son una de las pocas formas honestas de medir eso, y es exactamente para lo que HAQQ fue diseñado para ser fuerte.
La arquitectura, no el modelo
Aquí está el cambio que toda la industria está experimentando: ya no es el modelo lo que gana. Cualquiera puede usar los mismos modelos de vanguardia. Lo que ahora diferencia a los productos de Legal AI es el software que rodea al modelo - la recuperación, las herramientas, el razonamiento, los datos.
HAQQ funciona con su propio motor, Justinian. Piense en él como un Palantir para el trabajo legal: se conecta a su pila existente, construye una ontología de sus asuntos y cierra el ciclo entre sus documentos y la respuesta.
Bajo el capó, HAQQ orquesta seis modelos - dos de código abierto y cuatro propietarios - detrás de un enrutador que lee cada instrucción y elige el modelo adecuado para la tarea, equilibrando la precisión con el costo, de modo que ningún modelo único ejecute cada trabajo. Alrededor de los modelos se encuentran las propias herramientas de HAQQ: el navegador, el extractor de PDF, el OCR. Los modelos son un componente. La extracción, la capa de citas y el enrutamiento son nuestros. Por eso funciona con PDFs defectuosos y se niega a alucinar donde otras soluciones más superficiales no lo hacen.
La parte que nadie más está resolviendo: los mercados emergentes
El derecho europeo y americano es relativamente fácil para la IA. Está digitalizado, bien documentado y rastreado sin cesar. Por eso cada herramienta parece decente en un contrato del Reino Unido.
Ahora dirija las mismas herramientas a Oriente Medio, o Sudamérica, o partes de África y Asia. La ley no está limpiamente digitalizada. Los datos de entrenamiento son escasos. Y los modelos alucinan - el mismo fallo que se ve en las instrucciones de Oriente Medio aparece en todas partes donde los datos son escasos.
HAQQ fue construido precisamente para esto. Hemos inscrito y extraído el derecho primario para estas jurisdicciones nosotros mismos, lo que es una ventaja que las herramientas legales de propósito general no tienen. Ser el más fuerte en Oriente Medio en un benchmark independiente no es suerte. Es el diseño.
Qué deberían medir los próximos benchmarks de Legal AI
La realización de esta evaluación agudizó nuestra visión sobre lo que debería evaluar un punto de referencia de Legal AI. Algunas cosas que creemos que todo el campo debería adoptar:
- Percentil, no aprobado o reprobado. "Por encima del promedio" no dice casi nada. Los percentiles 50 y 99 están ambos por encima del promedio, y no son el mismo producto. Muestra dónde se sitúa una herramienta en relación con la frontera.
- Dificultad y capacidad de defensa. Generar un contrato es fácil de construir. Un OCR fiable en escaneos defectuosos, o una extracción que cite la cláusula exacta, puede llevar de doce a dieciocho meses. Pondera lo difícil que es construir una capacidad, porque eso es lo que separa a un líder real de una demostración.
- Precio y ROI. La calidad está cerca de las apuestas de mesa en la cima ahora. La pregunta que realmente hacen los compradores es: ¿a qué costo? Costo por contrato, por tarea de investigación, por página. Mídelo y recompensa a los proveedores que son transparentes y asequibles.
- Inferencia de intenciones. Los usuarios reales no escriben indicaciones largas y perfectas. Escriben "redactar un NDA" o "revisar estos documentos". Una buena herramienta infiere lo que quieren decir y llega a la respuesta sin diez rondas de idas y venidas, lo opuesto a un chatbot sintonizado para mantenerte hablando.
- Citas y fuentes verificadas. La web está llena de leyes desactualizadas. Lo que importa es si una herramienta cita la disposición específica y actual. Aquí es donde la brecha entre un LLM general y un software legal real se hace más evidente.
- Razonamiento en la revisión. Para la revisión de contratos, el valor no es solo la línea roja. Son las sugerencias, los escenarios y el proceso de pensamiento visible detrás de ellos. Califica si la herramienta muestra su trabajo.
- Tasa de alucinación, al frente y al centro. Por todas las razones anteriores, este es el número que más les importa a los abogados. Pertenece al titular, no a una nota al pie.
¿Qué sigue para este punto de referencia?
Esta fue la primera ronda y cubrió la redacción de contratos y la extracción de datos. Hay más por venir.
HAQQ ha sido designada actualmente como Contendiente para el tercer trimestre de 2026 en las cinco categorías de certificación: Mejor aplicación de Legal AI (general), Redacción de contratos, Extracción de información, The High Bar y Experiencia de usuario. Para ser exactos sobre lo que esto significa, porque la redacción importa: Contendiente es la designación trimestral del evaluador para una aplicación participante, y las certificaciones solo se confirman una vez que finaliza el trimestre. Si ninguna aplicación supera el umbral en una categoría, no se otorga ninguna certificación allí. Publicaremos dónde nos ubicamos, ganemos o perdamos.
El próximo mes se expandirán a la investigación y el análisis legal, y después a más regiones, más allá del enfoque tradicional de EE. UU. y el Reino Unido, hacia jurisdicciones de mercados emergentes en América del Sur, África, Asia y el sudeste de Europa. Esas son exactamente las regiones en las que nos enfocamos. Funcionan con una cadencia trimestral, porque los modelos se mueven lo suficientemente rápido como para que cualquier punto de referencia esté medio obsoleto en el momento en que se lanza uno nuevo.
La versión honesta
Estamos orgullosos de este resultado y no vamos a exagerarlo. Una tasa de aprobación general del 27.0% es un verdadero listón superado en una prueba deliberadamente brutal - y también significa que en aproximadamente tres de cada cuatro tareas difíciles, todavía había al menos un criterio elaborado por un abogado que no cumplimos. Ambas frases son verdaderas, y cualquiera que cite la primera sin la segunda está malinterpretando el punto de referencia.
Tampoco podemos decir qué tan lejos estamos de la mejor herramienta en el campo, porque el evaluador nunca nos muestra a los competidores individualmente - solo como un promedio. Estar por encima de ese promedio no es lo mismo que ser el primero, y no daremos a entender lo contrario hasta que se publiquen las clasificaciones. Lo que sí sabemos: en el trabajo que se parece a la práctica legal real, en las tareas más difíciles del conjunto y en las jurisdicciones que la mayoría de las herramientas ignoran, HAQQ resistió bajo un microscopio externo. Seguiremos presentándonos en cada ronda y publicando lo que encuentren.
- Justinian - el motor detrás de estos resultados
- Cómo se compara HAQQ con otras Legal AI
- Punto de referencia legal de modelo de frontera de 300 tareas
- HAQQ Legal Benchmark (derecho civil y MENA)
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA



