Presentamos el HAQQ Legal Agent Study - una evaluación de largo horizonte diseñada para medir si los agentes de IA pueden realizar trabajo legal real de principio a fin, no solo responder trivia. 1.372 tareas. 24 áreas de práctica. ~78.000 criterios de rúbrica expertos. Cobertura de derecho civil y MENA por diseño.
Titulares
- 1.372 tareas legales de largo horizonte en 24 áreas de práctica
- ~78.000 criterios de rúbrica atómicos, binarios, de aprobado/reprobado
- Calificación de aprobación total - un solo criterio fallado reprueba la tarea
- 6 familias de práctica de derecho civil y MENA incluidas desde la v1
- El mejor modelo de frontera (Claude Opus 4.7) alcanza 41% de aprobación total; HAQQ Justinian alcanza 58%
- En tareas de derecho civil / MENA, la brecha se amplía a 71% frente a 28%
El punto de inflexión de los agentes legales
La observación de Andrej Karpathy sobre los agentes de programación - que 'básicamente no funcionaban antes de diciembre y básicamente funcionan desde entonces' - está empezando a aplicarse al ámbito legal. La finalización de tareas legales de largo horizonte estuvo estancada durante dos años. Luego, a finales de 2025, convergieron modelos de razonamiento de frontera, contextos más largos, mejor uso de herramientas e infraestructura de evaluación adecuada. La capacidad dio un salto.
Datos clave
- El HAQQ Legal Agent Study: 1.372 tareas legales de largo horizonte, 24 áreas de práctica, ~78.000 criterios de rúbrica atómicos de aprobado/reprobado.
- El mejor modelo de frontera (Claude Opus 4.7) alcanza 41% de aprobación total; HAQQ Justinian alcanza 58%.
- En tareas de derecho civil / MENA la brecha se amplía a 71% (Justinian) frente a 28% (mejor modelo de frontera).
El ámbito legal llegó a esta curva más tarde que la programación por una razón: no existía un benchmark para medirlo. No se puede rastrear una inflexión que no se puede ver. El Study es el instrumento que construimos.
Por qué fallaron los benchmarks de corto horizonte
La mayoría de las evaluaciones de IA legal - LegalBench, CUAD, LEXam, incluso nuestro trabajo anterior - prueban el razonamiento de corto horizonte: leer una cláusula, responder una pregunta, clasificar un párrafo. Son útiles, pero dicen casi nada sobre si un agente puede realmente llevar a cabo una pieza de trabajo.
El trabajo legal real no se parece en nada a un examen de opción múltiple. Un socio reenvía un correo, adjunta una carpeta y escribe una sola línea: 'Échale un vistazo y vuelve con un memorando para el jueves.' Lo que ocurre entre ese correo y el memorando es todo el trabajo - leer el expediente, encontrar los problemas que importan, ignorar los que no, redactar un producto de trabajo revisable y acertar en cada dato.
Eso es lo que mide el Study.
Cómo está estructurada una tarea del Study
Cada tarea del Study refleja cómo se mueve el trabajo dentro de un bufete de abogados. El agente recibe una instrucción escrita como la escribiría un socio - breve, afirmativa, sin especificación de formato. Recibe un entorno - una carpeta de expediente con los documentos e hilos de correo que necesita (y bastante que no). Debe producir un producto de trabajo revisable. Y se le califica con una rúbrica experta.
- Instrucciones: ~50 palabras en promedio. Solicitud afirmativa, sin lista de verificación.
- Entorno: carpeta de expediente que mezcla documentos relevantes con ruido periférico. El agente tiene que averiguar qué importa.
- Resultado: un memorando, una versión con cambios marcados, una tabla, un borrador de escrito o una presentación - lo que la tarea realmente requiera.
- Verificación: criterios expertos, atómicos, binarios, de aprobado/reprobado. Se verifica cada dato, cita, calificación de gravedad, plazo e importe.
Cada fila es una codificación 1:1 de cómo se mueve realmente un expediente dentro de un bufete: la solicitud del socio se convierte en instrucción, el expediente del cliente se convierte en entorno, el producto de trabajo se convierte en resultado, la revisión del socio se convierte en rúbrica experta. Nada se simplifica para facilitar la tarea al modelo.
Calificación de aprobación total
Una tarea se marca como completa solo si se aprueban todos los criterios de la rúbrica. A esto lo llamamos calificación de aprobación total, y es la decisión de diseño más importante del Study.
Un informe de equipo de operación que detecta 8 de 10 riesgos no es 80% útil. Los dos que se pasaron por alto podrían ser el gatillo de cambio de control que hace estallar la operación, o la salvedad de negocio en marcha que reajusta el precio de la oferta. No hay crédito parcial en la revisión del socio.
Anatomía de una rúbrica
Las rúbricas son la parte del Study que más horas de abogados requirió construir. Para cada tarea nos sentamos con profesionales del área de práctica correspondiente y desglosamos lo que un socio o un cliente realmente escrutinaría en el entregable. Cada verificación es atómica y binaria - sin puntuaciones blandas, sin evaluación difusa de estilo por parte de un LLM-juez.
Los criterios atómicos cumplen tres funciones a la vez: hacen que la calificación sea reproducible entre ejecuciones, hacen que los fallos del agente sean depurables (se ve exactamente qué verificación falló y por qué) y funcionan además como señales de recompensa para el ajuste fino. La misma rúbrica que califica a un modelo puede entrenar la siguiente versión de este.
24 áreas de práctica - incluyendo derecho civil y MENA
Los benchmarks legales existentes están dominados por tareas de derecho común de Estados Unidos. Eso está bien para lo que son, pero no es el mundo en el que ejerce la mayoría de nuestros clientes. El Study (v1) cubre 24 áreas de práctica, de las cuales seis son explícitamente de derecho civil y MENA: redacción de derecho civil en árabe, cumplimiento de la sharia, derecho corporativo del CCG, litigios de construcción, familia / estado personal, y derecho laboral MENA.
Partimos de expedientes reales - anonimizados y depurados - gestionados por abogados en ejercicio dentro de nuestra base de clientes. Descompusimos cada expediente en las tareas discretas que realmente se delegarían a un asociado. Las 24 áreas no son exhaustivas. Las próximas versiones añadirán arbitraje de construcción, regulación fintech, ESG y flujos de trabajo internos (in-house).
Ejemplo: revisión de cambio de control
Una tarea de M&A corporativo pide al agente analizar cláusulas de cambio de control en un data room virtual para la adquisición (ficticia) de Crestview Software Solutions en una operación totalmente en acciones de USD 458 millones. El data room contiene ocho contratos relevantes más archivos adyacentes - un 10-K, un plan de compensación diferida, actas del consejo - que pueden o no ser pertinentes.
A continuación se muestra la vista completa del input tal como la ve el agente - solicitud, contexto de la operación, contratos centrales, material más amplio del data room y el resultado requerido. Cada entrada funciona a la vez como pista y como distractor: el agente debe usar los datos del memorando, pero también debe separar el encargo principal de archivos periféricos como cartas de oferta preliminares y biografías del equipo que no cambian el análisis.
El agente debe determinar qué archivos importan, leerlos en contexto y sintetizar las cláusulas relevantes a lo largo del expediente. El resultado requerido es un memorando para el equipo de operación con resumen ejecutivo, mapeo de riesgos, análisis contrato por contrato, calificaciones de gravedad y mitigaciones recomendadas.
La rúbrica de esa sola tarea contiene 57 criterios - que cubren nueve problemas legales plantados, los hechos subyacentes a cada uno, la calificación de gravedad, la exposición financiera y la acción recomendada. Si se falla uno de los nueve, la tarea reprueba.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
Qué se planta y cómo se califica
Los nueve problemas plantados en esta única tarea no son trampas superficiales de palabras clave. Requieren que el agente conecte hechos entre documentos, infiera gatillos a partir de definiciones, cuantifique la exposición financiera en dólares y recomiende la acción legal correcta. Pasa el cursor sobre cualquier problema para ver qué debe averiguar el agente y la prueba unitaria que la rúbrica ejecuta contra el entregable.
Resultados de referencia de la v1
Ejecutamos el Study (v1) contra seis sistemas líderes: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 y Mistral Large 3. Cada tarea se intentó tres veces; reportamos la tasa de aprobación total del mejor de tres intentos. Las cifras principales se dividen claramente por categoría.
Se mantuvieron dos patrones en todo el conjunto de datos.
- Los modelos de frontera genéricos rinden bien en razonamiento aislado y mal en trabajo de largo horizonte. Pierden el contexto, alucinan vínculos entre documentos y producen resultados de apariencia segura que fallan las verificaciones de la rúbrica en hechos y citas.
- Los agentes entrenados en el dominio (Justinian y sistemas especializados comparables) cierran la brecha en la finalización de largo horizonte - especialmente en redacción de derecho civil, donde los modelos genéricos recurren por defecto a estructuras de derecho común y fallan en especificaciones procesales.
Matriz de capacidades - qué puede terminar realmente cada modelo
Las puntuaciones agregadas ocultan la pregunta operativa que todo socio de bufete se hace: ¿qué tipos de trabajo puedo delegar de principio a fin, cuáles necesitan un abogado en el circuito y cuáles no debería tocar? La matriz siguiente responde a eso en 24 familias de tareas.
Por qué esto importa para los bufetes de abogados
Si estás evaluando a un proveedor de IA y te muestra una demo convincente con un solo documento, pregúntale cuál es su tasa de finalización de largo horizonte en un expediente real. Pregúntale cuál es su tasa de aprobación total en una rúbrica de 50 criterios para ese expediente. Pregúntale qué áreas de práctica cubre de principio a fin frente a las que solo asiste.
Esas son las preguntas que el Study está diseñado para responder - de forma pública, reproducible y con rúbricas que cualquier socio puede auditar.
Qué está abierto y qué sigue
- Las familias de tareas y el formato de rúbrica de la v1 están documentados y se publicarán a clientes y socios de investigación bajo una licencia de evaluación.
- Publicaremos una metodología de puntuación normalizada y una clasificación de referencia una vez tengamos resultados de todos los modelos de frontera principales.
- La v2 añadirá arbitraje MENA, disputas de construcción, flujos de trabajo de asesoría interna, y redacción de derecho civil en árabe y francés más amplia.
- Estamos codesarrollando extensiones con bufetes seleccionados - si quieres contribuir familias de tareas de tu práctica, contáctanos.
El trabajo previo aporta más que nunca al campo - LegalBench, BigLaw Bench y el benchmark de agentes legales publicado recientemente por Harvey impulsan todos el sector hacia adelante. La contribución de HAQQ es el eje multilingüe, de derecho civil y con foco MENA que faltaba.
Pruébalo
Si quieres ver cómo rinde Justinian en tareas de largo horizonte de tu propia práctica, habla con nuestro equipo. Ejecutaremos un piloto confidencial, calificado con rúbrica, sobre un expediente redactado de tu bufete.
Agradecimientos
El Study es obra de muchas personas dentro de HAQQ y en toda nuestra red de profesionales. La dirección técnica del harness, el sandbox de agentes y el runtime de rúbricas estuvo a cargo del equipo de ingeniería de HAQQ Justinian, con el diseño de tareas y la generación de expedientes liderados por nuestro grupo de Investigación Legal Aplicada. Nuestros equipos de Seguridad y de Plataforma de IA construyeron el entorno de ejecución aislado que nos permite ejecutar agentes contra expedientes sintéticos sin filtrar datos de clientes. Nuestros equipos de Marca y Producto dieron forma a cómo se comunican los resultados a compradores legales no técnicos.
Fuera de HAQQ, agradecemos a los abogados en ejercicio - en MENA, la UE y el Reino Unido - que contribuyeron con expedientes anonimizados, redactaron rúbricas en sus áreas de práctica y sometieron a prueba las primeras familias de tareas. También agradecemos a los investigadores académicos que revisaron nuestra metodología y a los equipos de trabajo previo detrás de LegalBench, BigLaw Bench, CUAD, LEXam y el benchmark de agentes legales de Harvey, cuyo trabajo publicado hizo que este benchmark fuera más rápido y mejor de diseñar.



