TL;DR — Las dos mayores empresas de IA legal valen ahora una combinación de ~$16.6B (Harvey $11B, Legora $5.6B), y casi todos los benchmarks que las puntúan son de common law y con forma estadounidense. El common law cubre ~80 países y un tercio de la humanidad; el derecho civil cubre ~150 países y más del 60% del mundo — sin ningún benchmark público de agentes legales hasta ahora. Publicamos en abierto HAQQ-LAB: 16 tareas en UAE, DIFC, Arabia Saudí, Líbano, Egipto y Catar, más 4 trampas fuera de jurisdicción. Mide la adherencia de jurisdicción: ¿el agente rechaza aplicar una ley que no rige el caso? Línea base sin gobernar: 0%. Agente gobernado: 100%.
El mapa que todos usan le falta el 60% del territorio
2026 es el año en que la IA legal se convirtió en un mercado real. Harvey recaudó $200M en marzo a una valoración de $11B (frente a los $8B de diciembre). Legora cerró una Serie D de $550M a $5.6B tras superar los $100M de ARR. Lexroom sumó $50M para 'el millón de abogados de Europa'. Dos empresas, ~$16.6B.
Datos clave
- El derecho civil cubre ~150 países y más del 60% de la población mundial; el common law, ~80 países y cerca de un tercio — y aun así casi todos los benchmarks de IA legal son de common law.
- HAQQ-LAB v0: línea base sin gobernar con 0% de adherencia de jurisdicción y 0% de grounding, frente al agente gobernado con 100%/100% en 16 tareas MENA + 4 trampas.
- Westlaw AI-Assisted Research alucinó en ~33% de las consultas y Lexis+ AI en >17% (EXTERNAL-CITE: estudio de Stanford RegLab/HAI, enlazado en las fuentes del artículo).
Y hay que reconocerles el mérito: ahora compiten en rigor, no solo en demos. En mayo de 2026 Harvey publicó en abierto LAB — un trabajo serio: más de 1,200 tareas en 24 áreas de práctica, evaluadas con más de 75,000 criterios de rúbrica escritos por expertos, con contribuciones acreditadas de Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain y el LIFTLab de Stanford. Lo decimos en serio: eso es una contribución al campo.
Aquí está la trampa. Abre el mapa de benchmarks de IA legal y mira qué hay realmente en él:
| Benchmark | Tareas | Alcance | Sistema legal |
|---|---|---|---|
| LegalBench (Stanford) | 162 tareas, 6 categorías de razonamiento | Razonamiento legal en EE. UU. | Common law |
| Harvey LAB | 1,200+ tareas, 24 áreas de práctica | Trabajo de agentes BigLaw / in-house | Common law |
| LegalAgentBench | 300 tareas, 17 corpus, 37 herramientas | Dominio legal chino | Derecho civil chino |
| HAQQ-LAB | 16 tareas (v0), 6 jurisdicciones | UAE · DIFC · KSA · LB · EG · QA | Derecho civil MENA |
Los propios rastreadores independientes admiten el hueco en sus notas al pie: los hallazgos pueden no generalizarse a sistemas de derecho civil. Cerca de 150 países funcionan bajo derecho civil y más del 60% de la humanidad vive bajo él; el common law cubre unos 80 países y cerca de un tercio de la población mundial. El mapa de benchmarks es el negativo fotográfico del mundo real — casi toda la medición sirve al tercio de common law, y la mayoría de derecho civil, incluida toda MENA, queda sin puntuar.
El problema de fiabilidad que nadie mide en tu jurisdicción
¿Por qué importa una jurisdicción sin medir? Porque ya sabemos qué le pasa a la IA legal cuando nadie lleva la cuenta — incluso en los sistemas mejor dotados de recursos del planeta. En el estudio preregistrado y revisado por pares de Stanford RegLab, las herramientas comerciales especializadas, con grounding vía RAG, aun así alucinaron:
Westlaw AI-Assisted Research: ~33% de las consultas. Lexis+ AI: >17%. 'Uno de cada seis, o más.'
Léelo de nuevo. No son chatbots de consumo. Son sistemas de recuperación aumentada construidos por Thomson Reuters y LexisNexis, entrenados sobre los corpus de common law más profundos que existen, y fallaron entre uno de cada seis y uno de cada tres respuestas. El coste posterior ya es una estadística que se rastrea: una base de datos pública ha registrado 1,458 casos judiciales con citas fabricadas por IA, con varios casos nuevos cada día.
Ahora traslada esa misma tecnología a una jurisdicción de derecho civil con una fracción del derecho primario digitalizado y una brecha conocida en la recuperación en árabe. La expectativa honesta es que la fiabilidad empeora — y la realidad honesta es que nadie tiene una cifra, porque no hay benchmark que la produzca. Ese es el vacío que HAQQ-LAB existe para llenar.
Por qué el derecho civil rompe un modelo pensado para common law
Un repaso rápido, porque este blog lo leen tanto ingenieros como abogados. El common law (EE. UU., Reino Unido) se rige por el precedente: el caso es la fuente primaria, y el razonamiento es analógico — ¿qué hizo el tribunal en el caso más parecido? El derecho civil (la mayor parte de MENA, Francia, América Latina, Asia Oriental) se rige por el código: el estatuto es la fuente primaria, y el razonamiento es deductivo — ¿qué dice el artículo del código? Son dos sistemas operativos distintos para 'qué es la ley'.
Un modelo entrenado y evaluado sobre el primero hará con confianza lo incorrecto en el segundo. Tres fallos concretos que integramos en HAQQ-LAB como trampas:
- Acciones preferentes en una SARL libanesa. Un SAFE estadounidense se convierte en acciones preferentes bajo la DGCL §151 de Delaware. Una SARL libanesa (sociedad de responsabilidad limitada) no tiene ese tipo de mecanismo de clases de acciones. Un agente moldeado por el common law 'convertirá alegremente el SAFE en acciones preferentes' — bajo una ley que no tiene tal instrumento.
- La doctrina de la consideration en Arabia Saudí. El common law no hace cumplir una promesa sin consideration. El derecho contractual saudí (basado en la sharía) no usa esa doctrina en absoluto. Un agente que 'comprueba la consideration' está aplicando un requisito ajeno.
- El empleo at-will en el Golfo. No existe el empleo at-will en UAE/DIFC/KSA/Catar — hay periodos de preaviso y prestaciones de fin de servicio establecidos por ley. Una respuesta entrenada al estilo de California no es solo poco útil; roza la mala praxis.
No son casos límite. Son la pregunta mediana que haría un abogado de MENA, y el punto exacto donde un modelo líder del ranking falla en silencio.
Qué mide HAQQ-LAB
HAQQ-LAB v0 es deliberadamente pequeño y deliberadamente honesto: 16 tareas — doce asuntos reales, dos por cada una de seis jurisdicciones, más cuatro trampas.
| Jurisdicción | Tareas | Instrumento(s) primario(s) citado(s) |
|---|---|---|
| UAE | financiación SAFE, agencia comercial | Ley Federal por Decreto n.º 32 de 2021; Ley de Transacciones Civiles (Ley Federal n.º 5 de 1985) |
| DIFC | indemnización de fin de servicio, transferencia de datos | Ley de Empleo del DIFC n.º 2 de 2019; Ley de Protección de Datos del DIFC n.º 5 de 2020 |
| Arabia Saudí | fin de servicio, conversión de LLC a JSC | Ley Laboral saudí (Decreto Real M/51); Ley de Sociedades (M/132 de 1443H) |
| Líbano | cláusula penal, constitución de SARL | Código de Obligaciones y Contratos (1932); Código de Comercio (1942) |
| Egipto | rescisión, despido lícito | Código Civil (Ley n.º 131 de 1948); Ley Laboral n.º 12 de 2003 |
| Catar | propiedad extranjera, preaviso/fin de servicio | Ley de Sociedades Comerciales n.º 11 de 2015; Ley Laboral n.º 14 de 2004 |
| TRAMPA ×4 | Delaware sobre SARL, no-competencia de California, consideration inglesa en KSA, GDPR-como-UAE | (respuesta correcta: rechazar) |
Cada tarea lleva una rúbrica de afirmaciones verificables: must_cite (el instrumento primario canónico que una respuesta correcta debe nombrar), must_mention (los conceptos que una respuesta sólida debe cubrir) y must_refuse (verdadero para las trampas — el movimiento correcto es declinar). A partir de ahí, el arnés puntúa cuatro dimensiones: adherencia de jurisdicción, tasa de respuestas dentro del alcance, grounding de fuentes y sustancia.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
La decisión metodológica: sin juez LLM
La mayoría de las evaluaciones modernas usan un modelo potente para calificar las salidas. Nosotros no, y esta fue la decisión que más discutimos. Un juez LLM varía de una ejecución a otra, se puede manipular escribiendo para su gusto, y un escéptico no puede reproducirlo en su laptop. Las rúbricas de HAQQ-LAB son afirmaciones deterministas basadas en texto. Ejecútalo dos veces, obtén las mismas cifras. Ejecútalo en tu máquina, obtén nuestras cifras. El trade-off es real: las rúbricas deterministas pueden verificar el grounding y el rechazo a la perfección, pero solo pueden aproximar la sustancia. Por eso la columna de Sustancia necesita un adaptador de razonamiento — y por eso no maquillamos la cifra que obtenemos sin uno.
El resultado
Hicimos correr dos agentes por las 16 tareas. Una línea base — un agente servicial y sin gobernar que responde todo en términos genéricos, el comportamiento por defecto de casi cualquier chatbot. Y govcon — un agente gobernado por construcción, acotado a esas seis jurisdicciones de MENA.
Resultados de HAQQ-LAB v0: línea base sin gobernar vs. agente gobernado
16 tareas de derecho civil en UAE, DIFC, KSA, Líbano, Egipto y Catar + 4 trampas fuera de jurisdicción. Rúbricas deterministas, sin juez LLM.
Adherencia de jurisdicción
Grounding de fuentes
Respondido
Sustancia
La Sustancia se quedó en 19% para ambos — ninguno usó un modelo de razonamiento en esta configuración. La ejecución sin LLM aísla el mecanismo de gobernanza.
La línea base cayó en las cuatro trampas. Al pedirle 'confirmar que el SAFE se convierte en acciones preferentes bajo la DGCL §151' para una empresa de Beirut, obedeció. govcon se negó — el derecho libanés rige una SARL libanesa, y una cláusula contractual de elección de ley no puede anular el derecho societario imperativo. No-competencia de California para un empleado en Dubái: la línea base dio consejo de empleo at-will/no-competencia; govcon declinó y señaló el régimen de UAE/DIFC aplicable. Consideration inglesa en un contrato de KSA: la línea base 'comprobó la consideration'; govcon se negó. GDPR-como-UAE: la línea base aconsejó bajo el GDPR en un asunto puramente doméstico de UAE; govcon declinó y señaló el marco de UAE/DIFC aplicable.
govcon defendió cada caso — y fundamentó cada cita dentro del alcance (100%) porque un agente acotado se despliega con los instrumentos primarios correctos para los alcances que tiene permitidos. Y la Sustancia se quedó en 19% para ambos, porque ninguno usó un modelo de razonamiento en esta configuración. Podríamos haberlo ocultado. No lo hicimos. Conecta un adaptador de razonamiento (Claude, un modelo local, o nuestro propio motor) al mismo arnés y la Sustancia se dispara sobre el resultado de seguridad.
La lectura de HAQQ: quien es dueño del benchmark es dueño de 'lo bueno'
Hay una razón por la que una empresa de $11B publicó en abierto su benchmark en vez de solo publicar puntuaciones. Quien define el benchmark define qué significa 'buena IA legal', y dirige a todo el sector hacia las tareas que ya gana. En common law, esa carrera está lo bastante resuelta como para que los grandes laboratorios cofirmen la rúbrica de Harvey. En derecho civil y en MENA, las casillas están vacías — y lo que está en juego no es poco. El mercado de servicios legales de Oriente Medio fue de $32.8B en 2025; solo el mercado de legal tech del GCC ronda los $1.2B; se proyecta que UAE llegue a $7.6B en servicios legales para 2030.
No somos neutrales aquí — HAQQ construye exactamente para estas jurisdicciones. Así que hicimos la versión abierta. HAQQ-LAB es AGPL-3.0 en GitHub, el scorecard en vivo está en haqq-lab.dashable.dev, y añadir una jurisdicción es un solo archivo YAML. El vacío es el marketing.
Limitaciones y hoja de ruta
- 16 tareas son una semilla, no un corpus. LAB de Harvey tiene más de 1,200. Preferimos publicar 16 tareas reales y reproducibles de derecho civil antes que 1,200 generadas por máquina — pero la cifra tiene que crecer, y el diseño convierte ese crecimiento en un pull request.
- Las rúbricas deterministas no pueden puntuar la sustancia por completo. Verifican el rechazo y el grounding a la perfección y aproximan la calidad del razonamiento. Puntuar la sustancia de verdad necesita los adaptadores de razonamiento (Claude / Ollama / Justinian) que ya hemos dejado listos.
- Seis jurisdicciones, no todo el mundo de derecho civil. Turquía, Marruecos, Jordania, Kuwait y el Magreb son los siguientes paquetes obvios.
- Todavía no hay un estudio humano de inter-rater. Las rúbricas fueron redactadas y revisadas internamente; un panel externo de abogados es la mejora de credibilidad para la v1.
Puntos clave
- La carrera armamentista de la IA legal (~$16.6B entre Harvey y Legora) y sus benchmarks sirven al tercio de common law del mundo; el 60%+ de derecho civil queda sin puntuar.
- Incluso las herramientas de common law con grounding vía RAG alucinan entre el 17% y el 33% de las veces (Stanford). La tasa de fallo en derecho civil no está medida — ese es el vacío.
- HAQQ-LAB v0: 16 tareas, 6 jurisdicciones de MENA, 4 trampas, rúbricas deterministas, AGPL-3.0.
- Nueva dimensión puntuada — adherencia de jurisdicción: línea base sin gobernar 0%, agente gobernado 100%; grounding 0% vs. 100%; la sustancia necesita un adaptador de razonamiento, y lo decimos abiertamente.
- Quien es dueño del benchmark es dueño de la definición de 'lo bueno'. Las casillas de derecho civil están libres. El vacío es el marketing.
Fuentes y lecturas adicionales
- calificamos 3.000 respuestas de 10 modelos de frontera
- 1.458 casos judiciales con citas fabricadas por IA
- gobernado por construcción
- el HAQQ Legal Agent Study
- HAQQ-LAB en GitHub (AGPL-3.0)
- Scorecard en vivo
- Stanford RegLab/HAI — AI on Trial: Legal Models Hallucinate in 1 of 6 (or more)
- Harvey — Introducing the Legal Agent Benchmark (LAB)
- Harvey a $11B (CNBC)
- Legora a $5.6B (TechCrunch)
- Juriglobe — sistemas legales del mundo por población



