Skip to content
    HAQQ
    • Precios
    Comenzar Gratis
    Comenzar GratisReservar una demo
    Iniciar sesión
    1. Inicio
    2. Blog
    3. El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB
    Volver al BlogIA & Tech Legal

    El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB

    Todos los grandes benchmarks de IA legal son de common law; el derecho civil rige más del 60 % del mundo. HAQQ-LAB: 16 tareas MENA open source, 4 trampas - adherencia del 0 % vs 100 %.

    22 de mayo de 2026
    14 min de lectura
    |
    HAQQ Team
    El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB

    TL;DR — Las dos mayores empresas de IA legal valen ahora una combinación de ~$16.6B (Harvey $11B, Legora $5.6B), y casi todos los benchmarks que las puntúan son de common law y con forma estadounidense. El common law cubre ~80 países y un tercio de la humanidad; el derecho civil cubre ~150 países y más del 60% del mundo — sin ningún benchmark público de agentes legales hasta ahora. Publicamos en abierto HAQQ-LAB: 16 tareas en UAE, DIFC, Arabia Saudí, Líbano, Egipto y Catar, más 4 trampas fuera de jurisdicción. Mide la adherencia de jurisdicción: ¿el agente rechaza aplicar una ley que no rige el caso? Línea base sin gobernar: 0%. Agente gobernado: 100%.

    El mapa que todos usan le falta el 60% del territorio

    2026 es el año en que la IA legal se convirtió en un mercado real. Harvey recaudó $200M en marzo a una valoración de $11B (frente a los $8B de diciembre). Legora cerró una Serie D de $550M a $5.6B tras superar los $100M de ARR. Lexroom sumó $50M para 'el millón de abogados de Europa'. Dos empresas, ~$16.6B.

    Datos clave

    • El derecho civil cubre ~150 países y más del 60% de la población mundial; el common law, ~80 países y cerca de un tercio — y aun así casi todos los benchmarks de IA legal son de common law.
    • HAQQ-LAB v0: línea base sin gobernar con 0% de adherencia de jurisdicción y 0% de grounding, frente al agente gobernado con 100%/100% en 16 tareas MENA + 4 trampas.
    • Westlaw AI-Assisted Research alucinó en ~33% de las consultas y Lexis+ AI en >17% (EXTERNAL-CITE: estudio de Stanford RegLab/HAI, enlazado en las fuentes del artículo).

    Y hay que reconocerles el mérito: ahora compiten en rigor, no solo en demos. En mayo de 2026 Harvey publicó en abierto LAB — un trabajo serio: más de 1,200 tareas en 24 áreas de práctica, evaluadas con más de 75,000 criterios de rúbrica escritos por expertos, con contribuciones acreditadas de Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain y el LIFTLab de Stanford. Lo decimos en serio: eso es una contribución al campo.

    Aquí está la trampa. Abre el mapa de benchmarks de IA legal y mira qué hay realmente en él:

    BenchmarkTareasAlcanceSistema legal
    LegalBench (Stanford)162 tareas, 6 categorías de razonamientoRazonamiento legal en EE. UU.Common law
    Harvey LAB1,200+ tareas, 24 áreas de prácticaTrabajo de agentes BigLaw / in-houseCommon law
    LegalAgentBench300 tareas, 17 corpus, 37 herramientasDominio legal chinoDerecho civil chino
    HAQQ-LAB16 tareas (v0), 6 jurisdiccionesUAE · DIFC · KSA · LB · EG · QADerecho civil MENA

    Los propios rastreadores independientes admiten el hueco en sus notas al pie: los hallazgos pueden no generalizarse a sistemas de derecho civil. Cerca de 150 países funcionan bajo derecho civil y más del 60% de la humanidad vive bajo él; el common law cubre unos 80 países y cerca de un tercio de la población mundial. El mapa de benchmarks es el negativo fotográfico del mundo real — casi toda la medición sirve al tercio de common law, y la mayoría de derecho civil, incluida toda MENA, queda sin puntuar.

    El problema de fiabilidad que nadie mide en tu jurisdicción

    ¿Por qué importa una jurisdicción sin medir? Porque ya sabemos qué le pasa a la IA legal cuando nadie lleva la cuenta — incluso en los sistemas mejor dotados de recursos del planeta. En el estudio preregistrado y revisado por pares de Stanford RegLab, las herramientas comerciales especializadas, con grounding vía RAG, aun así alucinaron:

    Westlaw AI-Assisted Research: ~33% de las consultas. Lexis+ AI: >17%. 'Uno de cada seis, o más.'

    Léelo de nuevo. No son chatbots de consumo. Son sistemas de recuperación aumentada construidos por Thomson Reuters y LexisNexis, entrenados sobre los corpus de common law más profundos que existen, y fallaron entre uno de cada seis y uno de cada tres respuestas. El coste posterior ya es una estadística que se rastrea: una base de datos pública ha registrado 1,458 casos judiciales con citas fabricadas por IA, con varios casos nuevos cada día.

    Ahora traslada esa misma tecnología a una jurisdicción de derecho civil con una fracción del derecho primario digitalizado y una brecha conocida en la recuperación en árabe. La expectativa honesta es que la fiabilidad empeora — y la realidad honesta es que nadie tiene una cifra, porque no hay benchmark que la produzca. Ese es el vacío que HAQQ-LAB existe para llenar.

    Por qué el derecho civil rompe un modelo pensado para common law

    Un repaso rápido, porque este blog lo leen tanto ingenieros como abogados. El common law (EE. UU., Reino Unido) se rige por el precedente: el caso es la fuente primaria, y el razonamiento es analógico — ¿qué hizo el tribunal en el caso más parecido? El derecho civil (la mayor parte de MENA, Francia, América Latina, Asia Oriental) se rige por el código: el estatuto es la fuente primaria, y el razonamiento es deductivo — ¿qué dice el artículo del código? Son dos sistemas operativos distintos para 'qué es la ley'.

    Un modelo entrenado y evaluado sobre el primero hará con confianza lo incorrecto en el segundo. Tres fallos concretos que integramos en HAQQ-LAB como trampas:

    • Acciones preferentes en una SARL libanesa. Un SAFE estadounidense se convierte en acciones preferentes bajo la DGCL §151 de Delaware. Una SARL libanesa (sociedad de responsabilidad limitada) no tiene ese tipo de mecanismo de clases de acciones. Un agente moldeado por el common law 'convertirá alegremente el SAFE en acciones preferentes' — bajo una ley que no tiene tal instrumento.
    • La doctrina de la consideration en Arabia Saudí. El common law no hace cumplir una promesa sin consideration. El derecho contractual saudí (basado en la sharía) no usa esa doctrina en absoluto. Un agente que 'comprueba la consideration' está aplicando un requisito ajeno.
    • El empleo at-will en el Golfo. No existe el empleo at-will en UAE/DIFC/KSA/Catar — hay periodos de preaviso y prestaciones de fin de servicio establecidos por ley. Una respuesta entrenada al estilo de California no es solo poco útil; roza la mala praxis.

    No son casos límite. Son la pregunta mediana que haría un abogado de MENA, y el punto exacto donde un modelo líder del ranking falla en silencio.

    Qué mide HAQQ-LAB

    HAQQ-LAB v0 es deliberadamente pequeño y deliberadamente honesto: 16 tareas — doce asuntos reales, dos por cada una de seis jurisdicciones, más cuatro trampas.

    JurisdicciónTareasInstrumento(s) primario(s) citado(s)
    UAEfinanciación SAFE, agencia comercialLey Federal por Decreto n.º 32 de 2021; Ley de Transacciones Civiles (Ley Federal n.º 5 de 1985)
    DIFCindemnización de fin de servicio, transferencia de datosLey de Empleo del DIFC n.º 2 de 2019; Ley de Protección de Datos del DIFC n.º 5 de 2020
    Arabia Saudífin de servicio, conversión de LLC a JSCLey Laboral saudí (Decreto Real M/51); Ley de Sociedades (M/132 de 1443H)
    Líbanocláusula penal, constitución de SARLCódigo de Obligaciones y Contratos (1932); Código de Comercio (1942)
    Egiptorescisión, despido lícitoCódigo Civil (Ley n.º 131 de 1948); Ley Laboral n.º 12 de 2003
    Catarpropiedad extranjera, preaviso/fin de servicioLey de Sociedades Comerciales n.º 11 de 2015; Ley Laboral n.º 14 de 2004
    TRAMPA ×4Delaware sobre SARL, no-competencia de California, consideration inglesa en KSA, GDPR-como-UAE(respuesta correcta: rechazar)

    Cada tarea lleva una rúbrica de afirmaciones verificables: must_cite (el instrumento primario canónico que una respuesta correcta debe nombrar), must_mention (los conceptos que una respuesta sólida debe cubrir) y must_refuse (verdadero para las trampas — el movimiento correcto es declinar). A partir de ahí, el arnés puntúa cuatro dimensiones: adherencia de jurisdicción, tasa de respuestas dentro del alcance, grounding de fuentes y sustancia.

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    La decisión metodológica: sin juez LLM

    La mayoría de las evaluaciones modernas usan un modelo potente para calificar las salidas. Nosotros no, y esta fue la decisión que más discutimos. Un juez LLM varía de una ejecución a otra, se puede manipular escribiendo para su gusto, y un escéptico no puede reproducirlo en su laptop. Las rúbricas de HAQQ-LAB son afirmaciones deterministas basadas en texto. Ejecútalo dos veces, obtén las mismas cifras. Ejecútalo en tu máquina, obtén nuestras cifras. El trade-off es real: las rúbricas deterministas pueden verificar el grounding y el rechazo a la perfección, pero solo pueden aproximar la sustancia. Por eso la columna de Sustancia necesita un adaptador de razonamiento — y por eso no maquillamos la cifra que obtenemos sin uno.

    El resultado

    Hicimos correr dos agentes por las 16 tareas. Una línea base — un agente servicial y sin gobernar que responde todo en términos genéricos, el comportamiento por defecto de casi cualquier chatbot. Y govcon — un agente gobernado por construcción, acotado a esas seis jurisdicciones de MENA.

    Resultados de HAQQ-LAB v0: línea base sin gobernar vs. agente gobernado

    16 tareas de derecho civil en UAE, DIFC, KSA, Líbano, Egipto y Catar + 4 trampas fuera de jurisdicción. Rúbricas deterministas, sin juez LLM.

    Adherencia de jurisdicción

    Adherencia de jurisdicción — línea base
    0%
    Adherencia de jurisdicción — govcon
    100%

    Grounding de fuentes

    Grounding de fuentes — línea base
    0%
    Grounding de fuentes — govcon
    100%

    Respondido

    Tasa de respuestas dentro del alcance — ambos
    100%

    Sustancia

    Sustancia — ambos (sin adaptador de razonamiento)
    19%

    La Sustancia se quedó en 19% para ambos — ninguno usó un modelo de razonamiento en esta configuración. La ejecución sin LLM aísla el mecanismo de gobernanza.

    La línea base cayó en las cuatro trampas. Al pedirle 'confirmar que el SAFE se convierte en acciones preferentes bajo la DGCL §151' para una empresa de Beirut, obedeció. govcon se negó — el derecho libanés rige una SARL libanesa, y una cláusula contractual de elección de ley no puede anular el derecho societario imperativo. No-competencia de California para un empleado en Dubái: la línea base dio consejo de empleo at-will/no-competencia; govcon declinó y señaló el régimen de UAE/DIFC aplicable. Consideration inglesa en un contrato de KSA: la línea base 'comprobó la consideration'; govcon se negó. GDPR-como-UAE: la línea base aconsejó bajo el GDPR en un asunto puramente doméstico de UAE; govcon declinó y señaló el marco de UAE/DIFC aplicable.

    govcon defendió cada caso — y fundamentó cada cita dentro del alcance (100%) porque un agente acotado se despliega con los instrumentos primarios correctos para los alcances que tiene permitidos. Y la Sustancia se quedó en 19% para ambos, porque ninguno usó un modelo de razonamiento en esta configuración. Podríamos haberlo ocultado. No lo hicimos. Conecta un adaptador de razonamiento (Claude, un modelo local, o nuestro propio motor) al mismo arnés y la Sustancia se dispara sobre el resultado de seguridad.

    La lectura de HAQQ: quien es dueño del benchmark es dueño de 'lo bueno'

    Hay una razón por la que una empresa de $11B publicó en abierto su benchmark en vez de solo publicar puntuaciones. Quien define el benchmark define qué significa 'buena IA legal', y dirige a todo el sector hacia las tareas que ya gana. En common law, esa carrera está lo bastante resuelta como para que los grandes laboratorios cofirmen la rúbrica de Harvey. En derecho civil y en MENA, las casillas están vacías — y lo que está en juego no es poco. El mercado de servicios legales de Oriente Medio fue de $32.8B en 2025; solo el mercado de legal tech del GCC ronda los $1.2B; se proyecta que UAE llegue a $7.6B en servicios legales para 2030.

    No somos neutrales aquí — HAQQ construye exactamente para estas jurisdicciones. Así que hicimos la versión abierta. HAQQ-LAB es AGPL-3.0 en GitHub, el scorecard en vivo está en haqq-lab.dashable.dev, y añadir una jurisdicción es un solo archivo YAML. El vacío es el marketing.

    Limitaciones y hoja de ruta

    • 16 tareas son una semilla, no un corpus. LAB de Harvey tiene más de 1,200. Preferimos publicar 16 tareas reales y reproducibles de derecho civil antes que 1,200 generadas por máquina — pero la cifra tiene que crecer, y el diseño convierte ese crecimiento en un pull request.
    • Las rúbricas deterministas no pueden puntuar la sustancia por completo. Verifican el rechazo y el grounding a la perfección y aproximan la calidad del razonamiento. Puntuar la sustancia de verdad necesita los adaptadores de razonamiento (Claude / Ollama / Justinian) que ya hemos dejado listos.
    • Seis jurisdicciones, no todo el mundo de derecho civil. Turquía, Marruecos, Jordania, Kuwait y el Magreb son los siguientes paquetes obvios.
    • Todavía no hay un estudio humano de inter-rater. Las rúbricas fueron redactadas y revisadas internamente; un panel externo de abogados es la mejora de credibilidad para la v1.

    Puntos clave

    • La carrera armamentista de la IA legal (~$16.6B entre Harvey y Legora) y sus benchmarks sirven al tercio de common law del mundo; el 60%+ de derecho civil queda sin puntuar.
    • Incluso las herramientas de common law con grounding vía RAG alucinan entre el 17% y el 33% de las veces (Stanford). La tasa de fallo en derecho civil no está medida — ese es el vacío.
    • HAQQ-LAB v0: 16 tareas, 6 jurisdicciones de MENA, 4 trampas, rúbricas deterministas, AGPL-3.0.
    • Nueva dimensión puntuada — adherencia de jurisdicción: línea base sin gobernar 0%, agente gobernado 100%; grounding 0% vs. 100%; la sustancia necesita un adaptador de razonamiento, y lo decimos abiertamente.
    • Quien es dueño del benchmark es dueño de la definición de 'lo bueno'. Las casillas de derecho civil están libres. El vacío es el marketing.

    Fuentes y lecturas adicionales

    • calificamos 3.000 respuestas de 10 modelos de frontera
    • 1.458 casos judiciales con citas fabricadas por IA
    • gobernado por construcción
    • el HAQQ Legal Agent Study
    • HAQQ-LAB en GitHub (AGPL-3.0)
    • Scorecard en vivo
    • Stanford RegLab/HAI — AI on Trial: Legal Models Hallucinate in 1 of 6 (or more)
    • Harvey — Introducing the Legal Agent Benchmark (LAB)
    • Harvey a $11B (CNBC)
    • Legora a $5.6B (TechCrunch)
    • Juriglobe — sistemas legales del mundo por población
    H

    HAQQ Team

    Research

    Recursos relacionados

    Justinian EngineState of Legal AI in MENA 2026The Arabic Legal AI Gap

    Artículos relacionados

    Análisis de CoCounsel 2026: precio, benchmark y alternativas

    Análisis de CoCounsel 2026: precio, benchmark y alternativas

    Análisis de Harvey AI 2026: puntuaciones de benchmark + alternativas reales

    Análisis de Harvey AI 2026: puntuaciones de benchmark + alternativas reales

    HAQQ Legal Agent Study: un benchmark de IA legal de largo horizonte

    HAQQ Legal Agent Study: un benchmark de IA legal de largo horizonte

    Preguntas frecuentes

    Is HAQQ-LAB a competitor to Harvey's LAB?

    No — it's the complement. Harvey's LAB covers common-law / BigLaw agent work, and does it at a scale we're not pretending to match. HAQQ-LAB covers the civil-law / MENA jurisdictions it doesn't. Same idea, different operating system of law.

    Why no LLM judge?

    Reproducibility and honesty. LLM-graded benchmarks drift run-to-run and can be gamed by writing to the grader's taste. HAQQ-LAB uses deterministic checkable rubrics, so anyone can reproduce the exact scores on their own machine.

    What is 'jurisdiction adherence,' and why is it the headline?

    It's whether an agent refuses to answer under a law that doesn't govern the matter. A confident answer under the wrong jurisdiction is worse than no answer — and given that purpose-built common-law tools already hallucinate on 17–33% of queries, refusing the wrong law is the floor a legal agent has to clear before substance even matters.

    How bad is the hallucination problem, really?

    In Stanford's controlled study, Westlaw AI hallucinated ~33% and Lexis+ AI >17% of the time — on common law, with retrieval grounding. There is no equivalent civil-law number because there was no civil-law benchmark. That absence is the problem.

    Can I score my own agent or model?

    Yes. Implement a thin adapter (an answer(task) wrapper) for your model — Claude, a local model, or your in-house engine — register it, and run the benchmark. The deterministic rubrics do the rest.

    Which jurisdictions are covered, and how do I add one?

    v0 covers UAE, DIFC, Saudi Arabia, Lebanon, Egypt and Qatar. Adding one is a single YAML task file with must_cite / must_mention / must_refuse — open a PR.

    Isn't 16 tasks too few to mean anything?

    For substance scoring, yes — that's why we flag it. For the jurisdiction-adherence result, the signal is already unambiguous: 0% vs 100% is a structural difference, not a sampling artifact. The corpus grows from here.

    ¿Qué sigue?

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Calcula tu ROI

    Descubre cuánto tiempo y dinero HAQQ ahorra a tu bufete

    Explora Prompts legales

    Prompts listos para cada tarea legal

    Volver al Blog

    Artículo anterior

    Las mejores apps de abogado con IA en 2026: mapeamos las 110

    Artículo siguiente

    Gobernanza por construcción: guardarraíles de IA imposibles de evadir

    Ponlo en práctica

    Hazle a HAQQ la pregunta que te dejó este artículo.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Tu Gemelo Legal de IA y Sistema de Gestión de Práctica para redacción, facturación y éxito.

    Download on theApp StoreGet it onGoogle Play

    Documentaciones

    • Docs se abre en una pestaña nueva
    • Primeros pasos se abre en una pestaña nueva
    • Prensa se abre en una pestaña nueva
    • Novedades del producto se abre en una pestaña nueva
    • Estado se abre en una pestaña nueva
    • Seguridad
    • FAQ se abre en una pestaña nueva
    • Comunidad se abre en una pestaña nueva
    • Soporte se abre en una pestaña nueva

    Academy

    • Curso se abre en una pestaña nueva
    • Habilidades se abre en una pestaña nueva
    • Cláusulas se abre en una pestaña nueva
    • Biblioteca de prompts se abre en una pestaña nueva
    • Herramientas se abre en una pestaña nueva
    • Centro de investigación se abre en una pestaña nueva
    • Documentos se abre en una pestaña nueva

    Sitio web

    • eFirm
    • Chat IA Legal
    • Aplicación Móvil
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Precios
    • Compáranos
    • Soluciones
    • Blog
    • Conocer equipo
    • Únete a nosotros se abre en una pestaña nueva
    Abrir la app
    • Idiomasar en fr es it de pt
    • Contactoinfo@haqq.ai
    • Estadooperativo·fundamentado
    • Términos de Servicio
    • Política de Privacidad
    • Política de Cookies
    • Procesamiento de Datos se abre en una pestaña nueva
    • humans.txt se abre en una pestaña nuevalawyers.txt se abre en una pestaña nuevasecurity.txt se abre en una pestaña nueva
    © 2026 HAQQ Inc. Todos los derechos reservados.Producto desarrollado internamente por HAQQ. Sitio web construido con herramientas web modernas.