Skip to content
    HAQQ
    • Precios
    Comenzar Gratis
    Comenzar GratisReservar una demo
    Iniciar sesión
    1. Inicio
    2. Blog
    3. HAQQ Legal Agent Study: un benchmark de IA legal de largo horizonte
    Volver al BlogIA & Tech Legal

    HAQQ Legal Agent Study: un benchmark de IA legal de largo horizonte

    1.372 tareas legales de largo horizonte, 24 áreas de práctica, ~78.000 criterios de rúbrica, calificación todo-o-nada. El primer benchmark de agentes legales para derecho civil y MENA.

    6 de mayo de 2026
    11 min de lectura
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study: un benchmark de IA legal de largo horizonte

    Presentamos el HAQQ Legal Agent Study - una evaluación de largo horizonte diseñada para medir si los agentes de IA pueden realizar trabajo legal real de principio a fin, no solo responder trivia. 1.372 tareas. 24 áreas de práctica. ~78.000 criterios de rúbrica expertos. Cobertura de derecho civil y MENA por diseño.

    Titulares

    • 1.372 tareas legales de largo horizonte en 24 áreas de práctica
    • ~78.000 criterios de rúbrica atómicos, binarios, de aprobado/reprobado
    • Calificación de aprobación total - un solo criterio fallado reprueba la tarea
    • 6 familias de práctica de derecho civil y MENA incluidas desde la v1
    • El mejor modelo de frontera (Claude Opus 4.7) alcanza 41% de aprobación total; HAQQ Justinian alcanza 58%
    • En tareas de derecho civil / MENA, la brecha se amplía a 71% frente a 28%

    El punto de inflexión de los agentes legales

    La observación de Andrej Karpathy sobre los agentes de programación - que 'básicamente no funcionaban antes de diciembre y básicamente funcionan desde entonces' - está empezando a aplicarse al ámbito legal. La finalización de tareas legales de largo horizonte estuvo estancada durante dos años. Luego, a finales de 2025, convergieron modelos de razonamiento de frontera, contextos más largos, mejor uso de herramientas e infraestructura de evaluación adecuada. La capacidad dio un salto.

    Datos clave

    • El HAQQ Legal Agent Study: 1.372 tareas legales de largo horizonte, 24 áreas de práctica, ~78.000 criterios de rúbrica atómicos de aprobado/reprobado.
    • El mejor modelo de frontera (Claude Opus 4.7) alcanza 41% de aprobación total; HAQQ Justinian alcanza 58%.
    • En tareas de derecho civil / MENA la brecha se amplía a 71% (Justinian) frente a 28% (mejor modelo de frontera).

    El ámbito legal llegó a esta curva más tarde que la programación por una razón: no existía un benchmark para medirlo. No se puede rastrear una inflexión que no se puede ver. El Study es el instrumento que construimos.

    Por qué fallaron los benchmarks de corto horizonte

    La mayoría de las evaluaciones de IA legal - LegalBench, CUAD, LEXam, incluso nuestro trabajo anterior - prueban el razonamiento de corto horizonte: leer una cláusula, responder una pregunta, clasificar un párrafo. Son útiles, pero dicen casi nada sobre si un agente puede realmente llevar a cabo una pieza de trabajo.

    El trabajo legal real no se parece en nada a un examen de opción múltiple. Un socio reenvía un correo, adjunta una carpeta y escribe una sola línea: 'Échale un vistazo y vuelve con un memorando para el jueves.' Lo que ocurre entre ese correo y el memorando es todo el trabajo - leer el expediente, encontrar los problemas que importan, ignorar los que no, redactar un producto de trabajo revisable y acertar en cada dato.

    Eso es lo que mide el Study.

    Cómo está estructurada una tarea del Study

    Cada tarea del Study refleja cómo se mueve el trabajo dentro de un bufete de abogados. El agente recibe una instrucción escrita como la escribiría un socio - breve, afirmativa, sin especificación de formato. Recibe un entorno - una carpeta de expediente con los documentos e hilos de correo que necesita (y bastante que no). Debe producir un producto de trabajo revisable. Y se le califica con una rúbrica experta.

    • Instrucciones: ~50 palabras en promedio. Solicitud afirmativa, sin lista de verificación.
    • Entorno: carpeta de expediente que mezcla documentos relevantes con ruido periférico. El agente tiene que averiguar qué importa.
    • Resultado: un memorando, una versión con cambios marcados, una tabla, un borrador de escrito o una presentación - lo que la tarea realmente requiera.
    • Verificación: criterios expertos, atómicos, binarios, de aprobado/reprobado. Se verifica cada dato, cita, calificación de gravedad, plazo e importe.

    Cada fila es una codificación 1:1 de cómo se mueve realmente un expediente dentro de un bufete: la solicitud del socio se convierte en instrucción, el expediente del cliente se convierte en entorno, el producto de trabajo se convierte en resultado, la revisión del socio se convierte en rúbrica experta. Nada se simplifica para facilitar la tarea al modelo.

    Calificación de aprobación total

    Una tarea se marca como completa solo si se aprueban todos los criterios de la rúbrica. A esto lo llamamos calificación de aprobación total, y es la decisión de diseño más importante del Study.

    Un informe de equipo de operación que detecta 8 de 10 riesgos no es 80% útil. Los dos que se pasaron por alto podrían ser el gatillo de cambio de control que hace estallar la operación, o la salvedad de negocio en marcha que reajusta el precio de la oferta. No hay crédito parcial en la revisión del socio.

    Anatomía de una rúbrica

    Las rúbricas son la parte del Study que más horas de abogados requirió construir. Para cada tarea nos sentamos con profesionales del área de práctica correspondiente y desglosamos lo que un socio o un cliente realmente escrutinaría en el entregable. Cada verificación es atómica y binaria - sin puntuaciones blandas, sin evaluación difusa de estilo por parte de un LLM-juez.

    Los criterios atómicos cumplen tres funciones a la vez: hacen que la calificación sea reproducible entre ejecuciones, hacen que los fallos del agente sean depurables (se ve exactamente qué verificación falló y por qué) y funcionan además como señales de recompensa para el ajuste fino. La misma rúbrica que califica a un modelo puede entrenar la siguiente versión de este.

    24 áreas de práctica - incluyendo derecho civil y MENA

    Los benchmarks legales existentes están dominados por tareas de derecho común de Estados Unidos. Eso está bien para lo que son, pero no es el mundo en el que ejerce la mayoría de nuestros clientes. El Study (v1) cubre 24 áreas de práctica, de las cuales seis son explícitamente de derecho civil y MENA: redacción de derecho civil en árabe, cumplimiento de la sharia, derecho corporativo del CCG, litigios de construcción, familia / estado personal, y derecho laboral MENA.

    Partimos de expedientes reales - anonimizados y depurados - gestionados por abogados en ejercicio dentro de nuestra base de clientes. Descompusimos cada expediente en las tareas discretas que realmente se delegarían a un asociado. Las 24 áreas no son exhaustivas. Las próximas versiones añadirán arbitraje de construcción, regulación fintech, ESG y flujos de trabajo internos (in-house).

    Ejemplo: revisión de cambio de control

    Una tarea de M&A corporativo pide al agente analizar cláusulas de cambio de control en un data room virtual para la adquisición (ficticia) de Crestview Software Solutions en una operación totalmente en acciones de USD 458 millones. El data room contiene ocho contratos relevantes más archivos adyacentes - un 10-K, un plan de compensación diferida, actas del consejo - que pueden o no ser pertinentes.

    A continuación se muestra la vista completa del input tal como la ve el agente - solicitud, contexto de la operación, contratos centrales, material más amplio del data room y el resultado requerido. Cada entrada funciona a la vez como pista y como distractor: el agente debe usar los datos del memorando, pero también debe separar el encargo principal de archivos periféricos como cartas de oferta preliminares y biografías del equipo que no cambian el análisis.

    El agente debe determinar qué archivos importan, leerlos en contexto y sintetizar las cláusulas relevantes a lo largo del expediente. El resultado requerido es un memorando para el equipo de operación con resumen ejecutivo, mapeo de riesgos, análisis contrato por contrato, calificaciones de gravedad y mitigaciones recomendadas.

    La rúbrica de esa sola tarea contiene 57 criterios - que cubren nueve problemas legales plantados, los hechos subyacentes a cada uno, la calificación de gravedad, la exposición financiera y la acción recomendada. Si se falla uno de los nueve, la tarea reprueba.

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Qué se planta y cómo se califica

    Los nueve problemas plantados en esta única tarea no son trampas superficiales de palabras clave. Requieren que el agente conecte hechos entre documentos, infiera gatillos a partir de definiciones, cuantifique la exposición financiera en dólares y recomiende la acción legal correcta. Pasa el cursor sobre cualquier problema para ver qué debe averiguar el agente y la prueba unitaria que la rúbrica ejecuta contra el entregable.

    Resultados de referencia de la v1

    Ejecutamos el Study (v1) contra seis sistemas líderes: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 y Mistral Large 3. Cada tarea se intentó tres veces; reportamos la tasa de aprobación total del mejor de tres intentos. Las cifras principales se dividen claramente por categoría.

    Se mantuvieron dos patrones en todo el conjunto de datos.

    • Los modelos de frontera genéricos rinden bien en razonamiento aislado y mal en trabajo de largo horizonte. Pierden el contexto, alucinan vínculos entre documentos y producen resultados de apariencia segura que fallan las verificaciones de la rúbrica en hechos y citas.
    • Los agentes entrenados en el dominio (Justinian y sistemas especializados comparables) cierran la brecha en la finalización de largo horizonte - especialmente en redacción de derecho civil, donde los modelos genéricos recurren por defecto a estructuras de derecho común y fallan en especificaciones procesales.

    Matriz de capacidades - qué puede terminar realmente cada modelo

    Las puntuaciones agregadas ocultan la pregunta operativa que todo socio de bufete se hace: ¿qué tipos de trabajo puedo delegar de principio a fin, cuáles necesitan un abogado en el circuito y cuáles no debería tocar? La matriz siguiente responde a eso en 24 familias de tareas.

    Por qué esto importa para los bufetes de abogados

    Si estás evaluando a un proveedor de IA y te muestra una demo convincente con un solo documento, pregúntale cuál es su tasa de finalización de largo horizonte en un expediente real. Pregúntale cuál es su tasa de aprobación total en una rúbrica de 50 criterios para ese expediente. Pregúntale qué áreas de práctica cubre de principio a fin frente a las que solo asiste.

    Esas son las preguntas que el Study está diseñado para responder - de forma pública, reproducible y con rúbricas que cualquier socio puede auditar.

    Qué está abierto y qué sigue

    • Las familias de tareas y el formato de rúbrica de la v1 están documentados y se publicarán a clientes y socios de investigación bajo una licencia de evaluación.
    • Publicaremos una metodología de puntuación normalizada y una clasificación de referencia una vez tengamos resultados de todos los modelos de frontera principales.
    • La v2 añadirá arbitraje MENA, disputas de construcción, flujos de trabajo de asesoría interna, y redacción de derecho civil en árabe y francés más amplia.
    • Estamos codesarrollando extensiones con bufetes seleccionados - si quieres contribuir familias de tareas de tu práctica, contáctanos.

    El trabajo previo aporta más que nunca al campo - LegalBench, BigLaw Bench y el benchmark de agentes legales publicado recientemente por Harvey impulsan todos el sector hacia adelante. La contribución de HAQQ es el eje multilingüe, de derecho civil y con foco MENA que faltaba.

    Pruébalo

    Si quieres ver cómo rinde Justinian en tareas de largo horizonte de tu propia práctica, habla con nuestro equipo. Ejecutaremos un piloto confidencial, calificado con rúbrica, sobre un expediente redactado de tu bufete.

    • Habla con nuestro equipo
    • Ver los benchmarks de Justinian
    • Compara HAQQ

    Agradecimientos

    El Study es obra de muchas personas dentro de HAQQ y en toda nuestra red de profesionales. La dirección técnica del harness, el sandbox de agentes y el runtime de rúbricas estuvo a cargo del equipo de ingeniería de HAQQ Justinian, con el diseño de tareas y la generación de expedientes liderados por nuestro grupo de Investigación Legal Aplicada. Nuestros equipos de Seguridad y de Plataforma de IA construyeron el entorno de ejecución aislado que nos permite ejecutar agentes contra expedientes sintéticos sin filtrar datos de clientes. Nuestros equipos de Marca y Producto dieron forma a cómo se comunican los resultados a compradores legales no técnicos.

    Fuera de HAQQ, agradecemos a los abogados en ejercicio - en MENA, la UE y el Reino Unido - que contribuyeron con expedientes anonimizados, redactaron rúbricas en sus áreas de práctica y sometieron a prueba las primeras familias de tareas. También agradecemos a los investigadores académicos que revisaron nuestra metodología y a los equipos de trabajo previo detrás de LegalBench, BigLaw Bench, CUAD, LEXam y el benchmark de agentes legales de Harvey, cuyo trabajo publicado hizo que este benchmark fuera más rápido y mejor de diseñar.

    Lecturas relacionadas

    • HAQQ-LAB, nuestro benchmark de derecho civil de código abierto
    • nuestro benchmark de 3.000 respuestas con 10 modelos de frontera
    • el panorama de la IA legal de código abierto, incluidos los benchmarks abiertos
    S

    Stephane Boghossian

    Head of Growth

    Recursos relacionados

    JustinianLegal AI ChatCompare HAQQSecurity

    Artículos relacionados

    El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB

    El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB

    Por qué ChatGPT les falla a los abogados: notas de 3 abogados de EE. UU.

    Por qué ChatGPT les falla a los abogados: notas de 3 abogados de EE. UU.

    IA legal en árabe: la brecha está en el retrieval, no en el contenido

    IA legal en árabe: la brecha está en el retrieval, no en el contenido

    Preguntas frecuentes

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    ¿Qué sigue?

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Calcula tu ROI

    Descubre cuánto tiempo y dinero HAQQ ahorra a tu bufete

    Explora Prompts legales

    Prompts listos para cada tarea legal

    Volver al Blog

    Artículo anterior

    ¿Puede la IA planificar un litigio? Construimos un planificador GOAP

    Artículo siguiente

    Generador de testamento con IA: cómo redactar un testamento por jurisdicción con HAQQ

    Ponlo en práctica

    Hazle a HAQQ la pregunta que te dejó este artículo.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Tu Gemelo Legal de IA y Sistema de Gestión de Práctica para redacción, facturación y éxito.

    Download on theApp StoreGet it onGoogle Play

    Documentaciones

    • Docs se abre en una pestaña nueva
    • Primeros pasos se abre en una pestaña nueva
    • Prensa se abre en una pestaña nueva
    • Novedades del producto se abre en una pestaña nueva
    • Estado se abre en una pestaña nueva
    • Seguridad
    • FAQ se abre en una pestaña nueva
    • Comunidad se abre en una pestaña nueva
    • Soporte se abre en una pestaña nueva

    Academy

    • Curso se abre en una pestaña nueva
    • Habilidades se abre en una pestaña nueva
    • Cláusulas se abre en una pestaña nueva
    • Biblioteca de prompts se abre en una pestaña nueva
    • Herramientas se abre en una pestaña nueva
    • Centro de investigación se abre en una pestaña nueva
    • Documentos se abre en una pestaña nueva

    Sitio web

    • eFirm
    • Chat IA Legal
    • Aplicación Móvil
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Precios
    • Compáranos
    • Soluciones
    • Blog
    • Conocer equipo
    • Únete a nosotros se abre en una pestaña nueva
    Abrir la app
    • Idiomasar en fr es it de pt
    • Contactoinfo@haqq.ai
    • Estadooperativo·fundamentado
    • Términos de Servicio
    • Política de Privacidad
    • Política de Cookies
    • Procesamiento de Datos se abre en una pestaña nueva
    • humans.txt se abre en una pestaña nuevalawyers.txt se abre en una pestaña nuevasecurity.txt se abre en una pestaña nueva
    © 2026 HAQQ Inc. Todos los derechos reservados.Producto desarrollado internamente por HAQQ. Sitio web construido con herramientas web modernas.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion