Skip to content
    HAQQ
    • Precios
    Comenzar Gratis
    Comenzar GratisReservar una demo
    Iniciar sesión
    1. Inicio
    2. Blog
    3. Benchmark de IA jurídica 2026: cómo se desempeñó HAQQ en una evaluación independiente
    Volver al BlogIA & Tech Legal

    Benchmark de IA jurídica 2026: cómo se desempeñó HAQQ en una evaluación independiente

    Un evaluador independiente puso a prueba a HAQQ con tareas jurídicas difíciles. Superó las medias de la IA jurídica y del sector, lideró en derecho de Oriente Medio y no alucinó.

    23 de julio de 2026
    12 min de lectura
    |
    HAQQ Research
    Benchmark de IA jurídica 2026: cómo se desempeñó HAQQ en una evaluación independiente

    TL;DR - Entregamos HAQQ a un tercero independiente y le pedimos que lo probara como lo haría un comprador escéptico: 61 tareas legales reales en 21 jurisdicciones, cada tarea ejecutada dos veces, sin asesoramiento ni acceso especial.

    HAQQ superó el 27.0% de las tareas en general, por encima del promedio de Legal AI y del promedio de la industria. En The High Bar - el subconjunto de tareas que casi nada en el campo puede completar - HAQQ superó el 5.9% frente al 1.1% del promedio de Legal AI: más de cinco veces el campo. Fue la herramienta más fuerte probada en la redacción de leyes de Omán, obtuvo 65.2% en documentos escaneados y de baja calidad, y alcanzó el 100% en las tareas diseñadas para incitarla a inventar contenido que no existía.

    Estamos publicando nuestros propios números a continuación. Los productos de la competencia aparecen solo como un promedio agregado; esa es la regla de divulgación del evaluador, no nuestra elección.

    Por qué un benchmark independiente

    La mayoría de los benchmarks de Legal AI son ejecutados por las empresas que venden el producto. Incluido el nuestro, y el nuestro está sesgado por definición, porque es nuestro. Así que hicimos lo contrario: entregamos HAQQ a un evaluador independiente sin intereses en el resultado y le pedimos que lo calificara frente al campo.

    Cuando un tercero sin nada que ganar realiza la prueba, el número significa algo diferente. Ahí es hacia donde se dirige el mercado. Los compradores, y cada vez más los LLM que recomiendan herramientas, buscan fuentes independientes confiables en lugar del marketing del proveedor. Preferimos ganarnos la puntuación que reclamarla.

    Cómo funciona el benchmark

    Una puntuación solo vale tanto como el método que la respalda, así que aquí está el método completo. Nada de esto es nuestro diseño - es la metodología publicada del evaluador, aplicada idénticamente a cada aplicación en la cohorte.

    • 61 tareas reales, aportadas por abogados en ejercicio, que abarcan la redacción de contratos y la extracción de información en 21 jurisdicciones, incluyendo Estados Unidos, Reino Unido, India, Singapur, Países Bajos y Omán.
    • Los documentos llegan como lo hacen en la práctica - archivos Word nativos, PDFs, escaneos, fotografías y archivos con cambios controlados. Nada se preconvierte en texto limpio, por lo que leer el archivo original es parte de lo que se mide.
    • Criterios binarios de aprobación/rechazo, escritos por abogados, fijados antes de las pruebas. Una tarea se aprueba solo cuando todos los criterios aplicables se cumplen. Donde varias respuestas serían profesionalmente defendibles, los criterios lo permiten - aunque sigan reprobando omisiones y errores específicos.
    • Dos ejes, nunca mezclados: sustancia y forma. La sustancia pregunta si el trabajo es correcto y completo; la forma pregunta si un abogado podría usarlo tal como fue entregado. Una respuesta pulida que es legalmente incorrecta aún falla.
    • Cada tarea se ejecuta dos veces, de forma independiente, y la puntuación es el promedio de las dos ejecuciones - así, una única generación afortunada no puede alterar el resultado.
    • Dos jueces de LLM independientes califican cada resultado, y cualquier desacuerdo que pudiera cambiar si una tarea se aprueba o no es escalado a un abogado calificado que revisa el resultado a ciegas, sin saber qué producto lo produjo. El veredicto humano es final y se conserva para auditoría.
    • The High Bar es el subconjunto que no más de 2 de las 10 aplicaciones evaluadas pudieron completar: 34 tareas, puntuadas en 68 intentos. Existe específicamente para separar el rendimiento excepcional de la competencia ordinaria.

    Dos consecuencias que vale la pena internalizar antes de leer cualquier número a continuación. Primero, las tasas de aprobación en este benchmark parecen brutalmente bajas en comparación con los números de marketing que se ven en otros lugares - esa es la regla de todo o nada haciendo su trabajo, y se aplica a todos por igual. Segundo, nunca vemos las puntuaciones individuales de nuestros competidores. El evaluador solo nos muestra un promedio agregado de Legal AI, razón por la cual esta publicación compara HAQQ con promedios en lugar de con productos específicos.

    Datos clave

    • Tasa de aprobación general: 27.0%, por encima del promedio de Legal AI y del promedio de la industria. Una tarea solo se aprueba cuando cada criterio redactado por abogados se cumple, por lo que los números absolutos son bajos en todo el campo.
    • The High Bar: 5.9% vs 1.1%. En el subconjunto más difícil, HAQQ aprobó más de cinco veces más a menudo que el promedio de Legal AI, y casi tres veces el promedio de propósito general.
    • La herramienta más potente probada en la redacción de leyes omaníes (50.0%) - no competitiva, la más potente.
    • 100% en el manejo de referencias faltantes. En tareas diseñadas para hacer que un modelo invente anexos y referencias ausentes, HAQQ preservó la brecha en todo momento.
    • 2.53/3 en forma - claridad 2.73, estructura 2.65 - por encima de ambos promedios. Correcto y utilizable tal como se entrega.
    • El conjunto de tareas fue deliberadamente difícil; todo el campo puntúa bajo, porque la mayoría de las herramientas aún fallan en trabajos legales genuinamente difíciles.

    Lo que encontró el estudio comparativo

    Aquí están los números comparativos. "Legal AI avg" es el promedio de otras aplicaciones de Legal AI evaluadas; "general-purpose avg" son los asistentes de chat más avanzados. La forma se puntúa del 1 al 3, donde 3 es la mejor.

    MedidaHAQQLegal AI promedioPromedio general
    Redacción de contratos - tasa de aprobación24.2%20.6%23.9%
    Redacción de contratos - formulario (1-3)2.562.442.44
    Extracción de datos - tasa de aprobación30.0%29.6%29.3%
    El listón alto - tasa de aprobación5.9%1.1%2.2%

    Y las medidas donde el evaluador reportó HAQQ por sí mismo:

    MedidaHAQQ
    Tasa de aprobación general27.0%
    Formulario general (1-3)2.53
    Redacción de contratos - criterios cumplidos78.6%
    Manejo de OCR y escaneo - criterios cumplidos65.2%
    Redacción de leyes omaníes50.0%
    Manejo de referencias faltantes100.0%
    Éxito repetible en ambas ejecuciones21.3%

    Redacción de contratos

    El evaluador calificó la redacción en dos ejes: sustancia (¿la respuesta es precisa y completa?) y forma (¿el entregable está pulido y listo para presentar a un cliente?).

    HAQQ superó tanto a las herramientas de propósito general como al promedio de Legal AI en cada uno: una tasa de aprobación del 24.2% frente al 23.9% y 20.6%, y 2.56/3 en forma frente al 2.44 para ambos campos. En cuanto a criterios individuales, en lugar de tareas completas, HAQQ satisfizo el 78.6% de lo que los abogados pidieron. No solo técnicamente correcto. Correcto y listo para el cliente.

    El nivel más alto: las tareas más difíciles

    Dentro del estudio comparativo se encontraba un conjunto más pequeño de los problemas más difíciles, formalmente llamado The High Bar: las 34 tareas que no más de 2 de las 10 aplicaciones evaluadas pudieron completar. Trabajo de varios pasos, múltiples documentos de referencia, patrones de hechos complejos. El tipo de cosas donde la mayoría de la IA simplemente falla.

    HAQQ aprobó el 5.9% de esos 68 intentos. El Legal AI promedio aprobó el 1.1%; el promedio de propósito general fue del 2.2%. Eso es más de cinco veces el campo de Legal AI y casi tres veces los asistentes de chat más avanzados - el margen más amplio que HAQQ registró en toda la evaluación.

    Lea esos números honestamente: 5.9% es un número bajo en términos absolutos, y debería serlo. Estas son tareas seleccionadas específicamente porque toda la industria falla en ellas. La brecha es la señal aquí, no el nivel. Esta es la parte que más nos importa, porque parece un trabajo legal real en lugar de una demostración.

    Tres cosas que destacaron

    1. Trabajo legal en Oriente Medio

    En la redacción de documentos regidos por la legislación omaní, HAQQ obtuvo los resultados más sólidos en el punto de referencia, con un 50,0%. No competitivo. El más fuerte. Eso es lo que nos propusimos construir, por lo que no fue una sorpresa para nosotros, pero es bueno verlo confirmado por alguien que no tiene motivos para halagarnos.

    2. Documentos escaneados y de baja resolución

    El trabajo legal se basa en PDF defectuosos: contratos enviados por fax, expedientes escaneados, páginas fotografiadas. En material fuente escaneado, fotografiado, redactado y, por lo demás, imperfecto, HAQQ cumplió el 65,2% de los criterios y superó el 33,3% de las tareas por completo — por encima del promedio en ambos. Con mayor frecuencia, extrajo contenido legible mientras señalaba lo que no podía leer, porque no se apoya en el OCR incorporado de un modelo. Ejecuta el suyo propio.

    3. No inventó cosas

    El punto de referencia incluía tareas diseñadas para incitar a un modelo a inventar lo que no existe: anexos faltantes, referencias ausentes. HAQQ obtuvo una puntuación del 100% en el punto de control de referencias faltantes. Cuando faltaban anexos clave, preservó consistentemente la brecha en lugar de inventar su contenido.

    Una salvedad honesta, expresada con precisión: ese 100% se refiere a una medida específica — reconocer cuándo una fuente referenciada o un hecho solicitado simplemente no está disponible. En las tareas más amplias de resistencia a las alucinaciones del punto de referencia, HAQQ obtuvo un 28.0% de aprobación y un 61.7% de criterios cumplidos: por encima del promedio, no perfecto. Ninguna IA está universalmente libre de alucinaciones. Inventar contenido ausente es el modo de fallo que acaba con carreras en el ámbito legal, por lo que es en lo que nos obsesionamos.

    Por qué la alucinación es todo el juego en el ámbito legal

    En la codificación por intuición, una alucinación es un error que detectas. En el ámbito legal, una alucinación es un caso falso citado a un juez. Ya has visto los titulares. Para un contrato o una presentación judicial, una sola cláusula inventada o una referencia cruzada a una ley que no existe no es un pequeño inconveniente. Es descalificador.

    Así que "mayormente correcto" no es un producto. El verdadero estándar es si un abogado puede confiar lo suficiente en el resultado como para basarse en él. Las pruebas independientes en tareas de contenido ausente son una de las pocas formas honestas de medir eso, y es exactamente para lo que HAQQ fue diseñado para ser fuerte.

    La arquitectura, no el modelo

    Aquí está el cambio que toda la industria está experimentando: ya no es el modelo lo que gana. Cualquiera puede usar los mismos modelos de vanguardia. Lo que ahora diferencia a los productos de Legal AI es el software que rodea al modelo - la recuperación, las herramientas, el razonamiento, los datos.

    HAQQ funciona con su propio motor, Justinian. Piense en él como un Palantir para el trabajo legal: se conecta a su pila existente, construye una ontología de sus asuntos y cierra el ciclo entre sus documentos y la respuesta.

    Bajo el capó, HAQQ orquesta seis modelos - dos de código abierto y cuatro propietarios - detrás de un enrutador que lee cada instrucción y elige el modelo adecuado para la tarea, equilibrando la precisión con el costo, de modo que ningún modelo único ejecute cada trabajo. Alrededor de los modelos se encuentran las propias herramientas de HAQQ: el navegador, el extractor de PDF, el OCR. Los modelos son un componente. La extracción, la capa de citas y el enrutamiento son nuestros. Por eso funciona con PDFs defectuosos y se niega a alucinar donde otras soluciones más superficiales no lo hacen.

    La parte que nadie más está resolviendo: los mercados emergentes

    El derecho europeo y americano es relativamente fácil para la IA. Está digitalizado, bien documentado y rastreado sin cesar. Por eso cada herramienta parece decente en un contrato del Reino Unido.

    Ahora dirija las mismas herramientas a Oriente Medio, o Sudamérica, o partes de África y Asia. La ley no está limpiamente digitalizada. Los datos de entrenamiento son escasos. Y los modelos alucinan - el mismo fallo que se ve en las instrucciones de Oriente Medio aparece en todas partes donde los datos son escasos.

    HAQQ fue construido precisamente para esto. Hemos inscrito y extraído el derecho primario para estas jurisdicciones nosotros mismos, lo que es una ventaja que las herramientas legales de propósito general no tienen. Ser el más fuerte en Oriente Medio en un benchmark independiente no es suerte. Es el diseño.

    Qué deberían medir los próximos benchmarks de Legal AI

    La realización de esta evaluación agudizó nuestra visión sobre lo que debería evaluar un punto de referencia de Legal AI. Algunas cosas que creemos que todo el campo debería adoptar:

    • Percentil, no aprobado o reprobado. "Por encima del promedio" no dice casi nada. Los percentiles 50 y 99 están ambos por encima del promedio, y no son el mismo producto. Muestra dónde se sitúa una herramienta en relación con la frontera.
    • Dificultad y capacidad de defensa. Generar un contrato es fácil de construir. Un OCR fiable en escaneos defectuosos, o una extracción que cite la cláusula exacta, puede llevar de doce a dieciocho meses. Pondera lo difícil que es construir una capacidad, porque eso es lo que separa a un líder real de una demostración.
    • Precio y ROI. La calidad está cerca de las apuestas de mesa en la cima ahora. La pregunta que realmente hacen los compradores es: ¿a qué costo? Costo por contrato, por tarea de investigación, por página. Mídelo y recompensa a los proveedores que son transparentes y asequibles.
    • Inferencia de intenciones. Los usuarios reales no escriben indicaciones largas y perfectas. Escriben "redactar un NDA" o "revisar estos documentos". Una buena herramienta infiere lo que quieren decir y llega a la respuesta sin diez rondas de idas y venidas, lo opuesto a un chatbot sintonizado para mantenerte hablando.
    • Citas y fuentes verificadas. La web está llena de leyes desactualizadas. Lo que importa es si una herramienta cita la disposición específica y actual. Aquí es donde la brecha entre un LLM general y un software legal real se hace más evidente.
    • Razonamiento en la revisión. Para la revisión de contratos, el valor no es solo la línea roja. Son las sugerencias, los escenarios y el proceso de pensamiento visible detrás de ellos. Califica si la herramienta muestra su trabajo.
    • Tasa de alucinación, al frente y al centro. Por todas las razones anteriores, este es el número que más les importa a los abogados. Pertenece al titular, no a una nota al pie.

    ¿Qué sigue para este punto de referencia?

    Esta fue la primera ronda y cubrió la redacción de contratos y la extracción de datos. Hay más por venir.

    HAQQ ha sido designada actualmente como Contendiente para el tercer trimestre de 2026 en las cinco categorías de certificación: Mejor aplicación de Legal AI (general), Redacción de contratos, Extracción de información, The High Bar y Experiencia de usuario. Para ser exactos sobre lo que esto significa, porque la redacción importa: Contendiente es la designación trimestral del evaluador para una aplicación participante, y las certificaciones solo se confirman una vez que finaliza el trimestre. Si ninguna aplicación supera el umbral en una categoría, no se otorga ninguna certificación allí. Publicaremos dónde nos ubicamos, ganemos o perdamos.

    El próximo mes se expandirán a la investigación y el análisis legal, y después a más regiones, más allá del enfoque tradicional de EE. UU. y el Reino Unido, hacia jurisdicciones de mercados emergentes en América del Sur, África, Asia y el sudeste de Europa. Esas son exactamente las regiones en las que nos enfocamos. Funcionan con una cadencia trimestral, porque los modelos se mueven lo suficientemente rápido como para que cualquier punto de referencia esté medio obsoleto en el momento en que se lanza uno nuevo.

    La versión honesta

    Estamos orgullosos de este resultado y no vamos a exagerarlo. Una tasa de aprobación general del 27.0% es un verdadero listón superado en una prueba deliberadamente brutal - y también significa que en aproximadamente tres de cada cuatro tareas difíciles, todavía había al menos un criterio elaborado por un abogado que no cumplimos. Ambas frases son verdaderas, y cualquiera que cite la primera sin la segunda está malinterpretando el punto de referencia.

    Tampoco podemos decir qué tan lejos estamos de la mejor herramienta en el campo, porque el evaluador nunca nos muestra a los competidores individualmente - solo como un promedio. Estar por encima de ese promedio no es lo mismo que ser el primero, y no daremos a entender lo contrario hasta que se publiquen las clasificaciones. Lo que sí sabemos: en el trabajo que se parece a la práctica legal real, en las tareas más difíciles del conjunto y en las jurisdicciones que la mayoría de las herramientas ignoran, HAQQ resistió bajo un microscopio externo. Seguiremos presentándonos en cada ronda y publicando lo que encuentren.

    • Justinian - el motor detrás de estos resultados
    • Cómo se compara HAQQ con otras Legal AI
    • Punto de referencia legal de modelo de frontera de 300 tareas
    • HAQQ Legal Benchmark (derecho civil y MENA)

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    H

    HAQQ Research

    Benchmark Series

    Recursos relacionados

    M&A Due Diligence AI: Single Prompt vs a 3-Agent SwarmWhat an AI-Drafted Motion Costs: $1.67 Routed, $4.55 SloppyThe Justinian engineState of the Art in Agentic Legal AI

    Artículos relacionados

    Por qué ChatGPT les falla a los abogados: notas de 3 abogados de EE. UU.

    Por qué ChatGPT les falla a los abogados: notas de 3 abogados de EE. UU.

    Alternativas a Spellbook: las mejores herramientas de redacción de contratos con IA en 2026

    Alternativas a Spellbook: las mejores herramientas de redacción de contratos con IA en 2026

    Estadísticas de IA legal 2026: cuántos abogados usan IA realmente

    Estadísticas de IA legal 2026: cuántos abogados usan IA realmente

    Preguntas frecuentes

    Who ran the HAQQ legal AI benchmark?

    An independent third-party evaluator with no commercial stake in HAQQ, running a published methodology applied identically to every application in the cohort. We do not name the evaluator here. Their reports are private by default, but a vendor may publish its own results, which is why HAQQ's full numbers appear in this article while competing products are shown only as an aggregate average.

    How did HAQQ perform in the benchmark?

    HAQQ passed 27.0% of tasks overall and scored 2.53 out of 3 on form, above both the legal-AI average and the industry average. On contract drafting it passed 24.2% against 20.6% for the legal-AI average and 23.9% for general-purpose AI, with a form score of 2.56 against 2.44 for both. On data extraction it passed 30.0% against 29.6% and 29.3%. On The High Bar, the benchmark's hardest subset, it passed 5.9% against 1.1% for the average legal AI.

    What is The High Bar in the legal AI benchmark?

    The High Bar is the subset of tasks that no more than 2 of the 10 evaluated applications could complete: 34 tasks scored across 68 attempts. It exists to separate exceptional performance from ordinary competence. HAQQ passed 5.9% of those attempts, compared with 1.1% for the average legal AI and 2.2% for general-purpose AI — more than five times the legal-AI field. Absolute numbers are low by design, because these are tasks the whole industry fails.

    How is the legal AI benchmark scored?

    61 real tasks contributed by practising lawyers, across 21 jurisdictions, presented as native Word files, PDFs, scans and documents with tracked changes rather than pre-converted text. Every task has binary pass/fail criteria written by lawyers and fixed before testing, and a task passes only when every applicable criterion is met. Substance and form are scored separately and never blended. Every task is run twice independently, two LLM judges grade each output, and any disagreement that could change a pass is escalated to a qualified lawyer who reviews it blind.

    Does HAQQ hallucinate?

    HAQQ scored 100% on the benchmark's missing-reference checkpoint: when key schedules or referenced sources were unavailable, it preserved the gap instead of inventing the contents. On the broader hallucination-resistance tasks it passed 28.0% and met 61.7% of criteria, above average but not perfect. No AI is universally hallucination-free, but inventing absent content is the failure mode that matters most in law, and it is the one HAQQ is built to resist.

    What is the Justinian engine?

    Justinian is HAQQ's own hybrid architecture. It connects to your existing stack, builds an ontology of your matters, and orchestrates six models (two open-source, four proprietary) behind a router, with HAQQ's own OCR, extraction and citation tools around them. It does not rely on a model's built-in OCR, which is why it holds up on scanned and low-resolution documents.

    Is HAQQ good for Middle Eastern and emerging-market law?

    Yes. On drafting governed by Omani law, HAQQ produced the strongest results in the independent benchmark, at 50.0%. HAQQ has inscribed and extracted primary law for jurisdictions that are poorly digitized, across the Middle East and other emerging markets, where general-purpose tools tend to hallucinate.

    Can I see HAQQ's benchmark score?

    Yes. HAQQ's own results are published in full: 27.0% overall pass rate, 2.53 out of 3 on form, 24.2% on contract drafting, 30.0% on data extraction and 5.9% on The High Bar. Competing legal AI products appear only as an aggregate average, because the evaluator does not disclose any application's individual result to another vendor.

    Has HAQQ been certified by the benchmark?

    Not yet. HAQQ is currently designated a Contender for Q3 2026 in all five certification categories: Best Legal AI Application (Overall), Contract Drafting, Information Extraction, The High Bar, and User Experience. Contender is the evaluator's in-quarter designation; certifications are confirmed only when the quarter closes, and if no application clears the threshold in a category, no certification is awarded there.

    ¿Qué sigue?

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Calcula tu ROI

    Descubre cuánto tiempo y dinero HAQQ ahorra a tu bufete

    Explora Prompts legales

    Prompts listos para cada tarea legal

    Volver al Blog

    Artículo anterior

    Precios de la IA jurídica en 2026: todos los precios publicados y todos los proveedores que no publican ninguno

    Artículo siguiente

    Enmiendas al Reglamento de IA de la UE 2026: qué ha cambiado el Reglamento (UE) 2026/1744

    Ponlo en práctica

    Hazle a HAQQ la pregunta que te dejó este artículo.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Tu Gemelo Legal de IA y Sistema de Gestión de Práctica para redacción, facturación y éxito.

    Download on theApp StoreGet it onGoogle Play

    Documentaciones

    • Docs se abre en una pestaña nueva
    • Primeros pasos se abre en una pestaña nueva
    • Sala de prensa se abre en una pestaña nueva
    • Novedades del producto se abre en una pestaña nueva
    • Estado se abre en una pestaña nueva
    • Seguridad
    • FAQ se abre en una pestaña nueva
    • Comunidad se abre en una pestaña nueva
    • Soporte se abre en una pestaña nueva

    Academy

    • Socio se abre en una pestaña nueva
    • Curso se abre en una pestaña nueva
    • Noticias jurídicas se abre en una pestaña nueva
    • Habilidades se abre en una pestaña nueva
    • Cláusulas se abre en una pestaña nueva
    • Biblioteca de prompts se abre en una pestaña nueva
    • Herramientas se abre en una pestaña nueva
    • Centro de investigación se abre en una pestaña nueva
    • Documentos se abre en una pestaña nueva

    Sitio web

    • eFirm
    • Chat IA Legal
    • Aplicación Móvil
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Precios
    • Compáranos
    • Soluciones
    • Blog
    • Conocer equipo
    • Únete a nosotros se abre en una pestaña nueva
    Abrir la app
    • Idiomasar en fr es it de pt
    • Contactoinfo@haqq.ai
    • Estadooperativo·fundamentado
    • Términos de Servicio
    • Política de Privacidad
    • Política de Cookies
    • Procesamiento de Datos
    • humans.txt se abre en una pestaña nuevalawyers.txt se abre en una pestaña nuevasecurity.txt se abre en una pestaña nueva
    © 2026 HAQQ Inc. Todos los derechos reservados.Producto desarrollado internamente por HAQQ. Sitio web construido con herramientas web modernas.