Resumen — 300 tareas legales comerciales y transfronterizas exigentes, 10 modelos de frontera de 8 proveedores, 3.000 respuestas evaluadas con una rúbrica de 35 puntos a temperatura 0.
Claude Opus 4.8 gana en general (30,02/35, primero en 130 tareas). Grok 4.3 es la opción de mejor valor. GPT-5.5 es el más preciso (8,41/10, 3% de citas alucinadas).
El hallazgo principal: el 24% de las 3.000 respuestas citaba o aplicaba derecho que no decía lo que el modelo afirmaba. Ningún modelo de frontera es seguro para entregar una respuesta legal sin verificar.
Por qué evaluamos la IA legal en abierto
Cinco mil millones de personas no pueden acceder a ayuda legal. Ese es el problema que HAQQ existe para resolver. Pero debajo de cada demo de IA legal hay una pregunta de fondo: ¿puedes realmente confiar en el resultado delante de un cliente? "Una IA respondió a una pregunta legal" y "una IA a la que puedes poner tu nombre" son afirmaciones distintas, y la distancia entre ellas es todo el producto.
Datos clave
- El 24% de las 3.000 respuestas evaluadas de modelos de frontera citaba o aplicaba derecho que no decía lo que el modelo afirmaba.
- Claude Opus 4.8 ganó 130 de las 300 tareas legales (30,02/35 en general); GPT-5.5 fue el más preciso con 8,41/10 y una tasa de citas alucinadas del 3%.
- El coste por tarea legal abarca un rango de 90x entre modelos de frontera: 0,0009 $ (DeepSeek V3.2) frente a 0,082 $ (GPT-5.5).
Así que lo medimos. Esta es la tercera entrega de nuestra serie de benchmarks: 100 preguntas legales de consumidores fue el ángulo de common law / consumidor. HAQQ-LAB fue el primer benchmark público de adherencia jurisdiccional en derecho civil / MENA. Este informe es el más grande hasta la fecha: trabajo legal comercial y transfronterizo, los asuntos que pagan las facturas de un despacho real.
Si solo lees una sección, lee La brecha de citas. Es el hallazgo que debería cambiar cómo cada despacho compra IA legal.
Cómo ejecutamos el benchmark
Escribimos 300 tareas legales originales y específicas, no trivialidades, sino asuntos reales con partes nombradas, cantidades en dólares, fechas y estatutos aplicables. Redacta esta cláusula. Marca esta disposición. Estructura esta transacción. Analiza este conflicto de leyes. Abarcan 51 áreas de práctica, más de 20 jurisdicciones (EE. UU. federal + Delaware / California / Nueva York / Texas, Reino Unido, UE, EAU, DIFC, Arabia Saudí, Líbano, Egipto, Catar, Singapur, Australia, Canadá, India, Brasil, Nigeria, OHADA, Japón, Alemania, Francia, Suiza, además de los Convenios de La Haya y jurisdicciones offshore: Caimán, BVI, Bermudas).
Dificultad ponderada al alza: 114 tareas de nivel 5 de 5, 108 de nivel 4, 22 de nivel 3. Son problemas multijurisdiccionales construidos para romper modelos. Cada tarea se envió a los 10 modelos con un prompt de sistema idéntico a temperatura 0, con un tope de 6.000 tokens de salida.
Cada respuesta se puntuó en cinco dimensiones:
- Calidad (1–10) — profundidad, integridad, capacidad de acción.
- Precisión (1–10) — corrección legal; −5 por jurisprudencia alucinada, −3 por jurisdicción incorrecta.
- Velocidad (1–5) — latencia de respuesta medida, no juzgada.
- Estilo (1–5) — estructura profesional.
- Creatividad (1–5) — riesgos no obvios, problemas interjurisdiccionales detectados.
Calidad, Precisión, Estilo y Creatividad las puntúa Claude Sonnet 4.6 con una rúbrica fija. La Velocidad se calcula a partir de la latencia real. El sesgo del juez se aborda con honestidad en las salvedades; no lo ocultamos.
La clasificación: qué IA es la mejor para el trabajo legal
Claude Opus 4.8 gana, con claridad
Opus se llevó el primer puesto en 130 de las 300 tareas, casi el doble que cualquier otro modelo, y terminó entre los tres primeros en 265 de 300. Registra la mayor calidad (8,9), precisión de primer nivel (8,4), estilo perfecto y la mayor creatividad. Su única debilidad es la velocidad: con 60,8 s es lento, y con 0,069 $/tarea está entre los más caros. Si quieres la mejor respuesta individual y puedes esperarla, es esta.
Grok 4.3: el 98% de la calidad en 1/7 del tiempo y 1/20 del coste
El resultado más interesante de la tabla. Grok 4.3 queda segundo (28,98) pero lo hace en 8,8 segundos a 0,003 $ por tarea, frente a los 60,8 s y 0,069 $ de Opus. Para un producto de cara al cliente donde la latencia y la economía unitaria importan, Grok es discutiblemente la mejor elección de ingeniería. Incluso gana más tareas medioambientales/ESG, de PI y de casos límite que cualquier otro.
GPT-5.5: el campeón de precisión que rara vez "gana"
GPT-5.5 registra la mayor precisión del campo (8,41) y la tasa de alucinación más baja (3%), y sin embargo queda quinto en total y solo ganó una tarea en solitario. Rara vez se equivoca y rara vez destaca. También es el más lento (134 s) y el más caro (0,082 $). Para el trabajo legal, "rara vez se equivoca" puede ser la dimensión que más importa, precisamente por lo que una puntuación compuesta única induce a error.
o3: el modelo más polarizante de la prueba
El o3 de OpenAI ganó 66 tareas en solitario, el tercer mejor de cualquier modelo, y sin embargo queda octavo en general, con una tasa de alucinación del 32% y la segunda precisión más baja (5,89). Cuando o3 acierta es brillante; cuando se equivoca, lo hace con confianza y a un coste alto. Esa varianza es en sí misma un riesgo de contratación.
El suelo: Mistral y Llama
Mistral Large alucinó o aplicó mal citas en el 64% de sus respuestas (precisión 4,74). Llama 4 Maverick quedó último (20,01): rápido y barato, pero con calidad 4,8 y las respuestas más pobres. "Cita derecho real" no está resuelto en la parte baja del mercado.
La brecha de citas: el hallazgo que más importa
En las 3.000 respuestas, el 24% citaba o aplicaba derecho que no decía lo que el modelo afirmaba. Casos inventados. Estatutos mal aplicados. La doctrina correcta señalando la jurisdicción equivocada. No son fallos vagos; nuestro juez marcó errores específicos y verificables.
Una muestra, una por modelo:
- Claude Opus 4.8: Computer Associates / Gemstar citados como precedentes de gun-jumping; no son caracterizaciones precisas.
- GPT-5.5: La cita de Hitz parece fabricada; 616 B.R. 374 no se puede verificar.
- Gemini 3.1 Pro: La cita de Halpin v. Riverstone no se puede verificar; probablemente un caso de Delaware alucinado.
- Grok 4.3: CBS v. Ziff-Davis citado de forma inexacta; el caso trata sobre confianza en garantías, no sobre divulgación.
- Claude Sonnet 4.6: La cita de Schrier no se puede verificar; el caso Biotronik es real pero se aplica mal.
- o3: Las citas de MSA Technology v Antec y GB Gas parecen fabricadas o tergiversadas.
- Qwen3.7 Max: Specht v. Netscape aplicado mal; no es un caso de bienes/servicios bajo el UCC.
- DeepSeek V3.2: La cita de Crosstown Music no se puede verificar / se aplica mal.
- Mistral Large: Las citas de N.Y. Gen. Oblig. Law §5-328 y UCC §2-515 son dudosas / se aplican mal.
- Llama 4 Maverick: El caso Cavendish se aplica mal; no guarda relación con cláusulas de precio.
Cada modelo, incluidos los líderes, fabricó o aplicó mal una cita en algún punto de la prueba. Esto no es un problema solo de la parte baja de la tabla. El modelo más preciso de todo el campo apenas alcanzó 8,41 sobre 10. El suelo es alarmante; el techo no es seguro.
Para contexto, las herramientas incumbentes tienen la misma enfermedad. Pruebas independientes han situado la Investigación Asistida por IA de Westlaw en aproximadamente una tasa de error de uno de cada tres, y Lexis+ AI por encima de uno de cada seis. Un modelo más grande no ha arreglado esto, y según nuestra evidencia, no lo hará.
Ningún modelo gana en todas las áreas de práctica
Desglosa las 300 tareas por área de práctica y el líder cambia constantemente. En 51 áreas de práctica: Claude Opus 4.8 gana 30, Grok 4.3 gana 13, o3 gana 6, y Gemini 3.1 Pro y Sonnet 4.6 se llevan una cada uno. Destacados:
- Opus domina el núcleo doctrinal: fusiones y adquisiciones (30,6), cumplimiento normativo (30,5), valores, penal/de cuello blanco, fiscal, banca, privacidad de datos, laboral, comercio internacional.
- Grok es dueño de la creatividad comercial: PI/derecho tecnológico (30,2), medioambiental/ESG (30,8), protección al consumidor, cumplimiento/debida diligencia (31,4), casos límite.
- o3 destaca en operaciones transaccionales: operaciones legales (31,1), valores y finanzas (30,9), contratación y adquisiciones gubernamentales (31,1), bienes raíces transfronterizos.
- Gemini 3.1 Pro se lleva la mejor puntuación individual en privacidad y protección de datos (31,4).
La implicación es directa: un producto legal que lo apuesta todo a un solo modelo deja precisión sobre la mesa en áreas de práctica enteras. La arquitectura correcta dirige cada tarea al motor con más probabilidades de acertar y luego verifica la respuesta antes de entregarla.
El impuesto de latencia y coste
La calidad no es gratis, ni uniforme. El rango es enorme: GPT-5.5 (134 s) y Claude Sonnet 4.6 (102 s) son ~17 veces más lentos que Grok 4.3 (8,8 s) y Llama 4 Maverick (7,7 s). El coste por tarea abarca un rango de 90 veces, desde DeepSeek V3.2 a 0,0009 $ hasta GPT-5.5 a 0,082 $. Grok 4.3 entrega el segundo puesto a 0,003 $.
Para un producto legal de alto volumen, el modelo "mejor" en una clasificación solo por calidad puede ser la decisión de negocio equivocada. El objetivo de calidad-Opus a velocidad y coste de Grok es un problema de enrutamiento y verificación, no una elección de un solo modelo.
Vista a nivel de proveedor (fusionada con cada ejecución previa)
Clasificación de IA legal 2026: cada modelo ordenado por puntuación media
La prueba de 300 tareas de arriba califica 10 modelos de frontera con una rúbrica de 35 puntos. También mantenemos una segunda clasificación, más amplia: una evaluación de 50 tareas con una rúbrica de 50 puntos que añade las plataformas legales verticales que la mayoría de despachos realmente preseleccionan (Harvey, CoCounsel, LexisNexis +AI, Legora, Spellbook, Clio Duo) junto a los modelos de frontera. Esa tabla está publicada en su totalidad en nuestra página de comparación. Aquí está ordenada por puntuación media en las 11 categorías de tareas, para que puedas leer un número por modelo en vez de once.
| Posición | Modelo | Media /50 | Media % |
|---|---|---|---|
| 1 | HAQQ (Justinian) | 47,5 | 95% |
| 2 | Claude Fable 5 | 44,0 | 88% |
| 3 | Claude Opus 4.7 | 42,1 | 84% |
| 4 | Mike OS | 41,8 | 84% |
| 5 | DeepSeek v4 Pro | 38,2 | 76% |
| 5 | Harvey | 38,2 | 76% |
| 7 | CoCounsel | 36,2 | 72% |
| 8 | Claude + plugins legales | 35,4 | 71% |
| 9 | Legora | 34,5 | 69% |
| 10 | ChatGPT 5.5 | 34,4 | 69% |
| 11 | LexisNexis +AI | 33,2 | 66% |
| 12 | Grok 4.3 | 31,4 | 63% |
| 13 | Gemini 3.1 Pro | 31,1 | 62% |
| 14 | Spellbook | 29,0 | 58% |
| 15 | Perplexity Sonar | 26,5 | 53% |
| 16 | Clio Duo | 25,2 | 50% |
| 17 | Meta Llama 4 | 23,1 | 46% |
| 18 | Mistral 3 | 21,2 | 42% |
| 19 | Qwen 3 Plus | 17,1 | 34% |
Esta clasificación dice tres cosas que la prueba de 300 tareas no puede. Primero, las plataformas legales verticales se agrupan en el medio, no en la cima: Harvey (38,2), CoCounsel (36,2), Legora (34,5) y LexisNexis +AI (33,2) quedan todas por debajo de los mejores modelos de frontera puros. Lo que una empresa paga a un proveedor de IA legal es el flujo de trabajo y el envoltorio de seguridad, no una puntuación más alta en la respuesta en sí. Segundo, DeepSeek v4 Pro empata con Harvey en exactamente 38,2: un modelo de pesos abiertos igualando a la empresa de IA legal más valiosa del mundo en calidad de salida por sí sola. Tercero, la dispersión es amplia: el modelo del fondo (Qwen 3 Plus, 34%) puntúa apenas un tercio del 95% de HAQQ, así que "qué IA legal" es una decisión real, no una moneda al aire.
Control de honestidad: esta es nuestra clasificación, y HAQQ queda primero en ella. Trátala como deberías tratar cualquier puntuación publicada por un proveedor: verifícala. Cada uno de los 19 modelos y de las 11 categorías está en nuestra página de comparación para que lo compruebes. Nota también lo que una puntuación por tarea no puede ver: el despliegue a escala de despacho, las certificaciones de seguridad y los flujos de trabajo agénticos sobre miles de documentos son fortalezas reales de las plataformas verticales que esta tabla no mide.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
Cómo puntuamos la clasificación de IA legal
Dos benchmarks alimentan dos clasificaciones, e importa cuál estás leyendo.
- La prueba de 300 tareas de frontera (el cuerpo de este artículo): 300 tareas comerciales y transfronterizas originales, 10 modelos de frontera, puntuadas con una rúbrica de 35 puntos (Calidad, Precisión, Velocidad, Estilo, Creatividad) a temperatura 0, con un tope de 6.000 tokens de salida. La mejor para "sobre qué modelo puro debería construir".
- La prueba de 50 tareas de plataformas (la tabla de clasificación de arriba, publicada en /compare-us): 11 categorías de tareas puntuadas con una rúbrica de 50 puntos que cubre sharía, estatuto, foro, cláusula, riesgo, alucinación, formato, brevedad, preparación para socios y vinculación de fuentes. Añade las plataformas legales verticales que los despachos realmente compran. La mejor para "qué producto o modelo debería preseleccionar".
Ambas comparten las mismas reglas de la casa. Prompts idénticos para cada modelo. Una rúbrica fija y escrita, en lugar de intuición. Datos publicados para que cualquiera pueda clonar la ejecución y verificarnos. Y ambas puntúan la calidad de la respuesta aislada, que es el alcance correcto para una clasificación y el alcance equivocado para una decisión de compra, porque no puede ver el despliegue, la postura de seguridad o la capa de verificación con la que un producto legal serio envuelve al modelo.
No somos los únicos llevando la cuenta, y no deberías depender de una sola clasificación. El estudio preregistrado de Stanford RegLab encontró que las herramientas de investigación incumbentes alucinan a menudo: Westlaw AI-Assisted Research en aproximadamente una de cada tres consultas y Lexis+ AI por encima de una de cada seis. El evaluador independiente Vals AI mantiene una clasificación legal pública que, a junio de 2026, también sitúa a Claude Fable 5 en lo más alto de su benchmark de razonamiento legal (88,6%), con los modelos de frontera puntuando allí alrededor del 80% frente al 71% de los abogados humanos en investigación jurídica. Rúbricas distintas, conjuntos de tareas distintos, misma dirección de avance: los modelos de frontera son fuertes en razonamiento y poco fiables en citas, y la brecha entre ellos se está estrechando.
¿Qué IA es la mejor para el derecho en 2026? Depende de qué pondere
No existe una única "mejor IA legal", y cualquier clasificación que pretenda lo contrario está vendiendo algo. Lee las dos tablas juntas y la respuesta se divide según qué estés optimizando:
- Mejor calidad de respuesta en general: Claude Opus 4.8 lideró la prueba de 300 tareas de frontera (30,02/35, 130 tareas ganadas). En la clasificación de plataformas, Claude Fable 5 es el modelo más fuerte fuera de HAQQ (44,0/50).
- Más preciso / menos alucinaciones: GPT-5.5, la mayor precisión (8,41/10) y la tasa de citas alucinadas más baja (3%) en la prueba de 300 tareas, aunque rara vez "gana" una tarea en solitario.
- Mejor valor (velocidad y coste): Grok 4.3, segundo en calidad a 8,8 segundos y unos 0,003 $ por tarea, frente a los 60,8 segundos y 0,069 $ de Opus.
- Mejor plataforma legal vertical: Harvey lidera a su grupo de pares en la prueba de 50 puntos (media de 38,2), por delante de CoCounsel, Legora y LexisNexis +AI, pero cada una de ellas queda por detrás de los mejores modelos de frontera puros en salida aislada.
- Mejor para MENA, árabe y derecho civil: HAQQ (Justinian) lidera la clasificación de plataformas (47,5/50) con árabe nativo y más de 80 jurisdicciones; verifícalo frente al campo en /compare-us.
El punto más profundo sobrevive a cada reordenación de la clasificación: ningún modelo gana en todas las áreas de práctica, el 24% de las respuestas de frontera cita derecho que no las respalda, y la posición en la clasificación es la parte más pequeña de un producto legal real. El enrutamiento, la verificación de citas y la gobernanza de jurisdicción son donde un número en un gráfico se convierte en una respuesta a la que puedes poner tu nombre.
Colapsando los modelos a su marca de proveedor y fusionando esta ejecución con cada ejecución previa del mismo benchmark comercial (índice 0–100, ponderado por número de evaluaciones):
La cima es un grupo, no una coronación. Qué proveedor elijas importa menos que lo que construyas alrededor de él.
Una nota sobre la integridad del benchmark
Nuestra primera pasada limitó las respuestas a 1.200 tokens. Eso amañó silenciosamente el resultado: los modelos de razonamiento quemaban el presupuesto "pensando" y devolvían respuestas vacías, mientras que los modelos más extensos se cortaban a mitad de frase y el juez los penalizaba. Lo detectamos, descartamos la ejecución y la repetimos de manera uniforme a 6.000 tokens. La mayoría de los modelos ganaron entre 1,5 y 2,5 puntos, pero Mistral y Llama empeoraron con más margen, porque la extensión adicional expuso más citas incorrectas. Los topes de salida son un dedo invisible en la balanza en muchas clasificaciones públicas. La nuestra está a la vista para que veas exactamente dónde estuvo.
Lo que 3.000 respuestas evaluadas realmente demuestran
La capa de razonamiento está en gran medida resuelta. Los modelos de frontera detectan problemas, estructuran el análisis y redactan como un asociado capaz. Lo que todavía no pueden hacer es ser de confianza: citar de forma verificable, rechazar preguntas fuera de jurisdicción, incluir las advertencias adecuadas y acertar de la misma manera dos veces.
Esa brecha no se cierra con un modelo más grande. Se cierra con una capa encima:
- Enrutamiento — enviar cada asunto al motor con más probabilidades de acertar.
- Verificación de citas — ninguna referencia no verificable llega al cliente.
- Gobernanza de jurisdicción — la respuesta de jurisdicción equivocada se construye de forma que no ocurra, no se filtra después.
Esa capa es el producto. El modelo no es el foso. El verificador sí lo es. Es lo que construimos en HAQQ.
Salvedades — porque un benchmark que no puedes comprobar es marketing
- Una sola ejecución, temperatura 0. Trata las posiciones como más fiables que los decimales; lee a Opus y Grok como colíderes, no como un final fotográfico.
- El juez es un modelo Claude (Sonnet 4.6). Una pregunta justa de auto-preferencia, salvo que un modelo que no es Claude (Grok) empata en la cima y GPT-5.5 registra la mayor precisión, así que claramente no está calificando con ventaja propia. Un rejuicio con un segundo modelo es el siguiente paso para reforzarlo.
- El índice de proveedor mezcla rúbricas entre ejecuciones y es orientativo.
- Cada prompt, cada respuesta en bruto y el código de puntuación están publicados. Clónalo y verifícanos.
Conclusiones clave
- Claude Opus 4.8 es el modelo individual más fuerte para el trabajo legal comercial; GPT-5.5 es el más preciso; Grok 4.3 es el de mejor valor.
- El 24% de las respuestas legales de modelos de frontera cita derecho que no las respalda: el techo no es seguro, no solo el suelo.
- Ningún modelo gana en todas las áreas de práctica; el enrutamiento supera a apostar por uno solo.
- El coste y la latencia varían 90 y 17 veces: el "ganador" solo por calidad puede ser la decisión de negocio equivocada.
- La capa defendible es enrutamiento + verificación de citas + gobernanza de jurisdicción, no el modelo base.
Tercera entrega de la serie de benchmarks de HAQQ, junto con nuestro benchmark de preguntas legales de consumidores y el benchmark de derecho civil de HAQQ-LAB. ¿Curiosidad por cómo HAQQ convierte estos hallazgos en un producto que un abogado puede firmar? Mira el motor Justinian.



