Resumen — Puntuamos 19 herramientas de IA legal y modelos de frontera con la misma rúbrica de 50 puntos en 11 categorías de tareas. HAQQ ocupa el puesto #1 (media de 47,5/50). Nosotros construimos HAQQ, y construimos el benchmark, así que trata este ranking con sospecha. La diferencia entre esta lista y cualquier otra lista de "mejores herramientas de IA legal": cada puntuación, cada categoría y los prompts de prueba están publicados, para que puedas verificarnos.
Busca "mejores herramientas de IA legal 2026" y lee los diez primeros resultados. Casi todos están escritos por un proveedor, y casi todos colocan a ese proveedor en primer lugar. Sin puntuaciones, sin rúbrica, sin forma de verificar nada. Solo adjetivos ordenados de la forma más favorecedora.
Esta lista comete el mismo pecado. HAQQ es el #1, y HAQQ la escribió. La diferencia es que este ranking sale de un benchmark con cifras publicadas: 19 herramientas, 11 categorías de tareas, una rúbrica de 50 puntos, puntuaciones que puedes inspeccionar en nuestra página de comparación y prompts que puedes volver a ejecutar desde nuestra biblioteca de prompts. Desconfía de nosotros, y luego verifica.
Datos clave: herramientas de IA legal en 2026
- 19 herramientas probadas con la misma rúbrica de 50 puntos en 11 categorías de tareas legales; todas las puntuaciones publicadas.
- HAQQ obtiene una media de 47,5/50 y 49/50 en la prueba insignia de 10 dimensiones, la más alta de los 19 modelos probados.
- Claude puro (Fable 5, 44,0/50) supera a casi todos los productos de IA legal dedicados, incluidos Harvey (38,2), CoCounsel (36,2), Legora (34,5) y Lexis+ AI (33,2).
- Mike OS, una plataforma gratuita de código abierto, empata con el nivel de los 11.000 M$: 41,8/50, por delante de Harvey.
- Ninguna herramienta es segura sin verificar: en nuestro benchmark independiente de 300 tareas, el 24% de 3.000 respuestas evaluadas citaba o aplicaba derecho que no respaldaba la afirmación.
Quién escribió este ranking (lee esto antes de la lista)
HAQQ Research realizó este benchmark, y HAQQ queda en primer lugar. Eso es un conflicto de interés, sin rodeos. No vamos a fingir lo contrario, porque fingir es justo lo que hace el resto de la categoría.
Esto es lo que hacemos en su lugar. La matriz completa de puntuaciones de las 19 herramientas en las 11 categorías está en vivo en haqq.ai/compare-us. Los prompts de prueba proceden de nuestra biblioteca pública de prompts. La rúbrica insignia califica diez dimensiones nombradas: manejo de la sharía, cita de estatutos, foro y jurisdicción, calidad de cláusulas, identificación de riesgos, alucinación, formato, brevedad, preparación para socios y vinculación de fuentes. Es una prueba interna, revelada como prueba interna. Si una lista de proveedores que estás leyendo no te da al menos eso, pregúntate por qué.
Una revelación más: la rúbrica pondera fuertemente la disciplina de jurisdicción y la vinculación de fuentes, porque eso es lo que exige el trabajo de nuestros clientes. Un benchmark siempre se parece a quien lo escribe. El nuestro está construido para trabajo comercial multijurisdiccional, con inflexión MENA, que es también para lo que está construido HAQQ. La ventaja de jugar en casa es estructural. Por eso mismo las cifras son públicas.
Cómo clasificamos las mejores herramientas de IA legal
Cada herramienta ejecutó las mismas tareas en 11 categorías: una evaluación genérica de 10 dimensiones, redacción de contratos, investigación jurídica, explicación del derecho y siete tipos de documentos (contrato de trabajo, memorando profesional, contrato de licencia, pacto de socios, contrato de consultoría, contrato comercial, NDA). Cada categoría se puntúa sobre 50. El ranking siguiente ordena por la media de las 11.
Esta es la cuarta entrega de nuestra serie de benchmarks, después de 300 tareas comerciales en 10 modelos de frontera, HAQQ-LAB, el primer benchmark público de agentes de derecho civil y 100 preguntas legales reales de consumidores. La misma regla de la casa en todas: un benchmark que no puedes comprobar es marketing.
El ranking: las mejores herramientas de IA legal en 2026
| Posición | Herramienta | Qué es | Media /50 | Categoría más fuerte |
|---|---|---|---|---|
| 1 | HAQQ (Justinian) ★ | Plataforma de IA legal, MENA + transfronteriza | 47,5 | Genérica + NDA (49) |
| 2 | Claude Fable 5 | Modelo de frontera (Anthropic) | 44,0 | Genérica + NDA (45) |
| 3 | Claude Opus 4.7 | Modelo de frontera (Anthropic) | 42,1 | Investigación, memorando, NDA (43) |
| 4 | Mike OS | Plataforma legal de código abierto (gratis) | 41,8 | Genérica (44) |
| 5= | DeepSeek v4 Pro | Modelo de frontera | 38,2 | Genérica (41) |
| 5= | Harvey | IA legal empresarial (valoración de 11.000 M$) | 38,2 | Empleo, socios, NDA (40) |
| 7 | CoCounsel | Asistente legal de Thomson Reuters | 36,2 | Memorando profesional (39) |
| 8 | Claude + plugins legales | Modelo de frontera + capa de plugins legales | 35,4 | Genérica (37) |
| 9 | Legora | Espacio de trabajo de IA legal (valoración de 5.600 M$) | 34,5 | NDA (37) |
| 10 | ChatGPT 5.5 | Modelo de frontera (OpenAI) | 34,4 | Explicación del derecho (42) |
| 11 | LexisNexis +AI | Incumbente de investigación | 33,2 | Investigación jurídica (41) |
| 12 | Grok 4.3 | Modelo de frontera (xAI) | 31,4 | Explicación del derecho (35) |
| 13 | Gemini 3.1 Pro | Modelo de frontera (Google) | 31,1 | Explicación del derecho (39) |
| 14 | Spellbook | Complemento de Word para redacción de contratos | 29,0 | Redacción de contratos + NDA (34) |
| 15 | Perplexity Sonar | Asistente basado en búsqueda | 26,5 | Investigación jurídica (38) |
| 16 | Clio Duo | Complemento de IA para gestión de despacho | 25,2 | NDA (27) |
| 17 | Meta Llama 4 | Modelo de pesos abiertos | 23,1 | Explicación del derecho (26) |
| 18 | Mistral 3 | Modelo de frontera | 21,2 | Explicación del derecho (24) |
| 19 | Qwen 3 Plus | Modelo de frontera | 17,1 | Explicación del derecho (19) |
#1 HAQQ — 47,5/50, y la entrada de la que más deberías desconfiar
HAQQ encabeza cada una de las 11 categorías, con un pico de 49/50 tanto en la prueba genérica de 10 dimensiones como en la redacción de NDA. La lectura honesta: es nuestro benchmark, ponderado hacia el trabajo para el que se construyó HAQQ. Importa el multijurisdiccional, la cita a nivel de estatuto, el árabe y el inglés, los sistemas de derecho civil que la mayoría de herramientas tratan como algo secundario. Si tu trabajo es una dieta exclusivamente de Delaware con jurisprudencia estadounidense, la brecha entre HAQQ y el resto será más estrecha de lo que sugiere esta tabla. Si tu trabajo cruza fronteras, no lo será.
Para qué sirve: trabajo legal de extremo a extremo donde la jurisdicción importa. Redacción, investigación, revisión y contexto de asunto, con fuentes en las que puedes hacer clic. El motor que hay debajo es Justinian, que dirige cada tarea al mejor modelo de frontera y verifica el resultado en lugar de confiar en un único modelo. Esa decisión de arquitectura viene directamente del hallazgo del benchmark que ves más abajo.
#2 y #3: Claude puro supera a casi todos los productos de IA legal
Este es el hallazgo que las demás listas no publicarán. Una ventana de chat de Claude sin más, sin producto legal alrededor, puntúa 44,0 (Fable 5) y 42,1 (Opus 4.7). Eso está por delante de Harvey, CoCounsel, Legora, Lexis+ AI y Spellbook. Gran parte de la categoría de IA legal vende un envoltorio que puntúa por debajo del modelo que envuelve.
Escribimos sobre por qué ocurre esto en Claude no mató al legal tech: los productos añaden flujo de trabajo, permisos y capas de datos, y muchos de ellos gravan silenciosamente el razonamiento del modelo subyacente mientras lo hacen. El envoltorio tiene que añadir verificación o gobernanza de jurisdicción para justificar su precio. La mayoría añade una interfaz.
Para qué sirve Claude puro: análisis, primeros borradores, explicar el derecho, razonamiento sobre documentos largos. Para qué no sirve: un sistema de registro, un verificador de citas o una herramienta que sepa qué jurisdicción rige tu asunto. Curiosamente, Claude con plugins legales puntuó 35,4, por debajo de Claude puro, en nuestra prueba. Más piezas móviles no es más precisión.
#4 Mike OS — el gratuito que avergüenza a los unicornios
Mike OS promedia 41,8/50. Eso está por delante de Harvey, que levantó 200 M$ con una valoración de 11.000 M$ en marzo de 2026. Mike es gratuito. Es una plataforma legal de código abierto que autoalojas con tu propia clave de API, construida por William Chen, exasociado de Latham & Watkins, quien afirma alcanzar la paridad con Harvey y Legora, según Legal IT Insider y Artificial Lawyer (mayo de 2026).
Cubrimos el momento Mike cuando llegó a lo más alto de Hacker News en nuestro panorama del software legal de código abierto. El código es tosco y joven, y autoalojarlo es trabajo real que tu despacho tiene que asumir. Pero en calidad de salida, el benchmark dice lo que dice: la brecha entre lo gratuito y abierto y los cientos de dólares por puesto es más pequeña de lo que sugieren las facturas.
#5 a #11: las plataformas legales empresariales
Harvey (38,2) es la opción por defecto de BigLaw, empatada con DeepSeek v4 Pro en nuestra puntuación. Sus mejores resultados son la redacción de documentos (40/50 en contratos de trabajo, pactos de socios y NDA). Está construido para la contratación empresarial: revisión de seguridad, despliegue en todo el despacho, logotipos de prestigio. Si lo estás evaluando, escribimos una guía dedicada de reseña y alternativas a Harvey.
CoCounsel (36,2) es la apuesta de Thomson Reuters, y su foso son los datos: se apoya sobre un siglo de jurisprudencia de Westlaw, con cerca de un millón de usuarios y precios que hemos reportado antes entre 220 y 500 dólares por usuario al mes. Mejor categoría aquí: memorandos profesionales (39). Si tu práctica vive dentro de la jurisprudencia estadounidense y ya pagas por Westlaw, es la opción de menor fricción de esta lista.
Legora (34,5) superó los 100 M$ de ARR y una valoración de 5.600 M$ en abril de 2026. Es una apuesta de espacio de trabajo colaborativo, más fuerte en nuestra prueba en NDA (37). ChatGPT 5.5 (34,4) obtiene la mejor puntuación en explicación del derecho de cualquier herramienta que no sea HAQQ (42), lo que coincide con cómo la mayoría de abogados lo usan de verdad: para entender, no para redactar. Lexis+ AI (33,2) es irregular de la manera esperada: 41/50 en investigación jurídica, la mejor puntuación de investigación fuera de los modelos de frontera, y mediocre en redacción.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
#12 a #16: especialistas con un buen truco
Spellbook (29,0) es un complemento de Word para redacción de contratos de pymes, y las puntuaciones muestran exactamente esa forma: 34 en redacción de contratos y NDA, 25 en la prueba genérica. Si el marcado de contratos dentro de Word es todo tu caso de uso, su puesto aquí infravalora su utilidad. Perplexity Sonar (26,5) tiene el mismo pico: 38 en investigación jurídica, débil en todo lo demás. Clio Duo (25,2) es un complemento de IA sobre un paquete de gestión de despacho con 150.000 usuarios; compra Clio para gestión de despacho, no para Duo.
Grok 4.3 (31,4) merece una nota de honestidad. En nuestro benchmark independiente de 300 tareas de frontera fue la opción de mejor valor de todo el campo, y lideró CaseLaw v2 de Vals AI (79,31%) en mayo de 2026. Aquí ocupa el puesto doce. El mismo modelo, tres rúbricas, tres veredictos. Eso no es una contradicción, es todo el argumento: un benchmark mide su propia rúbrica, el nuestro incluido.
#17 a #19: no uses estas para trabajo legal
Meta Llama 4 (23,1), Mistral 3 (21,2) y Qwen 3 Plus (17,1) ocupan el suelo. Esto coincide con nuestra prueba de 300 tareas, donde Mistral Large alucinó o aplicó mal citas en el 64% de sus respuestas. Son modelos generales capaces. Para el trabajo legal, donde una cita segura pero equivocada es una responsabilidad profesional, todavía no están en la conversación.
Lo que las puntuaciones no te dicen
- Esto es una prueba interna realizada por el proveedor. Revelada, publicada, verificable, pero realizada por el proveedor. Pondérala en consecuencia, y pondera a cero las listas de proveedores no reveladas.
- La rúbrica tiene una cosmovisión. El manejo de jurisdicción, la conciencia de la sharía y la vinculación de fuentes son dimensiones puntuadas. Las herramientas construidas solo para trabajo de EE. UU./Reino Unido pierden puntos en pruebas para las que sus constructores nunca apuntaron.
- Los rankings se mueven. Harvey, Legora y los laboratorios de frontera lanzan constantemente. Trata los niveles como más fiables que las posiciones individuales, y los empates (DeepSeek y Harvey en 38,2) como exactamente eso.
- Un compuesto oculta picos. Lexis+ AI en el #11 sigue siendo la herramienta de investigación a batir. Spellbook en el #14 sigue siendo la opción de redacción nativa de Word. Haz coincidir el pico con tu carga de trabajo.
La cifra que importa más que cualquier ranking
En nuestro benchmark de 300 tareas de frontera, el 24% de 3.000 respuestas evaluadas citaba o aplicaba derecho que no decía lo que el modelo afirmaba. Todos los modelos, incluidos los líderes, fabricaron o aplicaron mal al menos una cita. Los incumbentes tampoco son inmunes: pruebas independientes han situado la Investigación Asistida por IA de Westlaw en aproximadamente una tasa de error de uno de cada tres, y Lexis+ AI por encima de uno de cada seis, y una base de datos pública ha registrado más de 1.400 casos judiciales que involucran citas fabricadas por IA, como reportamos en el informe de HAQQ-LAB.
Elijas la herramienta que elijas de esta lista, elige primero tu proceso de verificación. El ranking te dice qué herramienta falla menos. Ninguna de ellas falla nunca.
Cómo elegir la mejor herramienta de IA para tu trabajo legal
- Trabajo transfronterizo, MENA o en árabe: HAQQ. Este es el terreno que premia el benchmark porque es el terreno para el que lo construimos.
- Razonamiento general, borradores y explicación con presupuesto ajustado: Claude puro. Supera a la mayoría de productos legales de pago en salida bruta.
- Investigación en EE. UU. con citadores: Lexis+ AI o CoCounsel, especialmente si ya pagas por la base de datos subyacente.
- Marcado de contratos dentro de Word: Spellbook.
- Requisitos de contratación de BigLaw: Harvey o Legora, y compáralos con esta tabla durante el piloto.
- Presupuesto cero, equipo técnico: Mike OS, autoalojado con tu propia clave de API.
Conclusiones clave
- Toda lista de "mejores herramientas de IA legal" está escrita por un proveedor. Exige puntuaciones publicadas. Esta las tiene; la mayoría no.
- HAQQ lidera con 47,5/50, con la salvedad revelada de que es nuestro benchmark, afinado para el trabajo multijurisdiccional.
- Los modelos de frontera puros superan a la mayoría de productos legales. Si un envoltorio no añade verificación o gobernanza, está restando valor.
- Lo gratuito es competitivo: Mike OS, de código abierto, superó al líder de mercado de 11.000 M$.
- Ninguna herramienta es segura sin verificar: el 24% de las respuestas de frontera citaba derecho que no las respaldaba. Compra un proceso de verificación, no un logotipo.
- Puntuaciones del benchmark en vivo para las 19 herramientas (página de comparación de HAQQ)
- La mejor IA para trabajo legal: 300 tareas, 10 modelos de frontera, 3.000 respuestas evaluadas
- HAQQ-LAB: el benchmark de IA legal de derecho civil
- Pusimos a prueba la IA con 100 preguntas legales reales
- Reseña y alternativas a Harvey AI
- Software legal de código abierto en 2026 (el momento Mike)
- Mike — plataforma de IA legal de código abierto
- Mike OSS: la herramienta de IA legal de código abierto "cambia la negociación" (Legal IT Insider, mayo de 2026)
- Mike, la plataforma de IA legal de código abierto — entrevista con Will Chen (Artificial Lawyer, mayo de 2026)
- Legora alcanza una valoración de 5.600 M$ (TechCrunch, abril de 2026)
¿Quieres comprobar el ranking en lugar de confiar en él? Cada puntuación por categoría está en vivo en la página de benchmark de HAQQ, y los prompts de prueba están en la biblioteca de prompts. Ejecútalos contra tu propia pila de herramientas. Si encuentras una herramienta que nos supere en tus asuntos, úsala. Para eso sirve un benchmark.



