Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. HAQQ Legal Agent Study: benchmark de IA jurídica de longo horizonte
    Voltar ao BlogIA & Tech Jurídica

    HAQQ Legal Agent Study: benchmark de IA jurídica de longo horizonte

    1.372 tarefas jurídicas de longo horizonte, 24 áreas de prática, ~78.000 critérios de rubrica, avaliação all-pass. O primeiro benchmark de agentes jurídicos para civil law e MENA.

    May 6, 2026
    11 min de leitura
    |
    Stephane BoghossianStephane Boghossian
    HAQQ Legal Agent Study: benchmark de IA jurídica de longo horizonte

    Apresentamos o HAQQ Legal Agent Study — uma avaliação de longo horizonte concebida para medir se os agentes de IA conseguem realizar trabalho jurídico real de ponta a ponta, e não apenas responder a perguntas triviais. 1.372 tarefas. 24 áreas de prática. ~78.000 critérios de rubrica elaborados por especialistas. Cobertura de civil law e MENA por conceção.

    Resumo

    • 1.372 tarefas jurídicas de longo horizonte em 24 áreas de prática
    • ~78.000 critérios de rubrica atómicos e binários (passa/falha)
    • Avaliação all-pass — um único critério em falta reprova a tarefa
    • 6 famílias de prática de civil law e MENA incluídas desde a v1
    • O melhor modelo de fronteira (Claude Opus 4.7) atinge 41% em all-pass; o HAQQ Justinian atinge 58%
    • Nas tarefas de civil law / MENA, a diferença aumenta para 71% vs. 28%

    O ponto de inflexão dos agentes jurídicos

    A observação de Andrej Karpathy sobre os agentes de programação — que "basicamente não funcionavam antes de dezembro e passaram a funcionar depois disso" — começa a aplicar-se ao direito. A conclusão de tarefas jurídicas de longo horizonte manteve-se estagnada durante dois anos. Depois, no final de 2025, os modelos de raciocínio de fronteira, contextos mais longos, melhor utilização de ferramentas e uma infraestrutura de avaliação adequada convergiram. A capacidade deu um salto.

    Factos-chave

    • O HAQQ Legal Agent Study: 1.372 tarefas jurídicas de longo horizonte, 24 áreas de prática, ~78.000 critérios de rubrica atómicos passa/falha.
    • O melhor modelo de fronteira (Claude Opus 4.7) atinge 41% em all-pass; o HAQQ Justinian atinge 58%.
    • Nas tarefas de civil law / MENA, a diferença aumenta para 71% (Justinian) vs. 28% (melhor modelo de fronteira).

    O direito atingiu esta curva mais tarde do que a programação por uma razão: não havia um benchmark para a medir. Não é possível acompanhar uma inflexão que não se consegue ver. O Study é o instrumento que construímos.

    Porque falharam os benchmarks de curto horizonte

    A maioria das avaliações de IA jurídica — LegalBench, CUAD, LEXam, e até o nosso próprio trabalho anterior — testa o raciocínio de curto horizonte: ler uma cláusula, responder a uma pergunta, classificar um parágrafo. São úteis, mas dizem quase nada sobre se um agente consegue efetivamente executar um trabalho completo.

    O trabalho jurídico real não se parece nada com escolha múltipla. Um sócio reencaminha um email, anexa uma pasta e escreve uma linha: "Dá uma vista de olhos e traz-me um memorando até quinta-feira." O que acontece entre esse email e o memorando é o trabalho todo — ler o processo, identificar as questões que importam, ignorar as que não importam, redigir um resultado revisível e acertar em cada facto.

    É isso que o Study mede.

    Como está estruturada uma tarefa do Study

    Cada tarefa do Study espelha a forma como o trabalho circula dentro de um escritório de advocacia. O agente recebe uma instrução escrita como um sócio a escreveria — curta, afirmativa, sem especificação de formato. Recebe um ambiente — um processo de cliente contendo os documentos e as trocas de email de que precisa (e muitos de que não precisa). Tem de produzir um resultado revisível. E é avaliado por uma rubrica elaborada por especialistas.

    • Instruções: em média ~50 palavras. Pedido afirmativo, sem checklist.
    • Ambiente: pasta do processo que mistura documentos relevantes com ruído periférico. O agente tem de descobrir o que importa.
    • Resultado: um memorando, um redline, uma tabela, uma minuta de peça processual ou uma submissão — o que a tarefa efetivamente exigir.
    • Verificação: critérios atómicos, binários (passa/falha), escritos por especialistas. Cada facto, citação, classificação de gravidade, prazo e valor monetário é verificado.

    Cada linha é uma codificação 1:1 de como um processo real avança dentro de um escritório: o pedido do sócio torna-se a instrução, o processo do cliente torna-se o ambiente, o resultado do trabalho torna-se o output, e a revisão do sócio torna-se a rubrica de especialistas. Nada é abstraído para facilitar a tarefa ao modelo.

    Avaliação all-pass

    Uma tarefa só é marcada como concluída se todos os critérios da rubrica forem cumpridos. Chamamos a isto avaliação all-pass, e é a decisão de conceção mais importante de todo o Study.

    Um relatório da equipa de transação que identifica 8 de 10 riscos não é 80% útil. Os dois que escapam podem ser exatamente o gatilho de mudança de controlo que faz cair o negócio, ou a ressalva de continuidade que reavalia o preço da oferta. Não há crédito parcial na revisão do sócio.

    Anatomia de uma rubrica

    As rubricas são a parte do Study que exigiu mais horas de advogados para construir. Para cada tarefa, sentámo-nos com profissionais da área relevante e decompusemos aquilo que um sócio ou cliente efetivamente escrutinaria no entregável. Cada verificação é atómica e binária — sem pontuações suaves, sem avaliações vagas de estilo por um LLM-como-juiz.

    Os critérios atómicos fazem três coisas ao mesmo tempo: tornam a avaliação reprodutível entre execuções, tornam as falhas do agente depuráveis (vê-se exatamente qual a verificação que falhou e porquê) e funcionam ainda como sinais de recompensa para fine-tuning. A mesma rubrica que avalia um modelo pode treinar a versão seguinte dele.

    24 áreas de prática — incluindo civil law e MENA

    Os benchmarks jurídicos existentes são dominados por tarefas de common law dos EUA. Não há problema nisso para o que são, mas não é o mundo em que a maioria dos nossos clientes pratica. O Study (v1) cobre 24 áreas de prática, das quais seis são explicitamente de civil law e MENA: redação de civil law em árabe, conformidade com a Sharia, direito societário do GCC, litígio de construção, família / estatuto pessoal, e direito laboral MENA.

    Partimos de processos reais — anonimizados e depurados — geridos por advogados em exercício da nossa base de clientes. Dividimos cada processo nas tarefas discretas que seriam efetivamente delegadas a um associado. As 24 áreas não são exaustivas. Versões futuras acrescentarão arbitragem de construção, regulação fintech, ESG e fluxos de trabalho de departamentos jurídicos internos.

    Exemplo: revisão de cláusulas de mudança de controlo

    Uma tarefa de M&A societário pede ao agente que analise cláusulas de mudança de controlo numa data room virtual para a aquisição (fictícia) da Crestview Software Solutions, numa transação totalmente em capital próprio de 458 milhões de dólares. A data room contém oito contratos materiais, além de ficheiros adjacentes — 10-K, plano de remuneração diferida, atas do conselho de administração — que podem ou não ser relevantes.

    Abaixo está a vista completa da entrada tal como o agente a vê — pedido, contexto da transação, contratos principais, material mais amplo da data room e o resultado exigido. Cada elemento funciona simultaneamente como pista e como distrator: o agente tem de usar os factos do memorando, mas tem também de separar a tarefa central de ficheiros periféricos, como minutas de cartas de proposta e biografias da equipa, que não alteram a análise.

    O agente tem de determinar quais os ficheiros que importam, lê-los em contexto e sintetizar as cláusulas relevantes em todo o processo. O resultado exigido é um memorando para a equipa de transação com resumo executivo, mapeamento de riscos, análise contrato a contrato, classificações de gravidade e medidas de mitigação recomendadas.

    A rubrica para esta única tarefa contém 57 critérios — cobrindo nove questões jurídicas inseridas propositadamente, os factos subjacentes a cada uma, a classificação de gravidade, a exposição financeira e a ação recomendada. Falhar uma das nove reprova a tarefa.

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    O que é inserido e como é avaliado

    As nove questões inseridas nesta única tarefa não são armadilhas superficiais de palavras-chave. Exigem que o agente ligue factos entre documentos, infira gatilhos a partir de definições, quantifique a exposição financeira em dólares e recomende a ação jurídica correta seguinte. Passe o cursor sobre qualquer questão para ver o que o agente tem de descobrir e o teste unitário que a rubrica executa sobre o entregável.

    Resultados de referência da v1

    Aplicámos o Study (v1) a seis sistemas de referência: HAQQ Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1 e Mistral Large 3. Cada tarefa foi tentada três vezes; reportamos a taxa all-pass do melhor de três. Os números principais dividem-se claramente por categoria.

    Dois padrões mantiveram-se em todo o conjunto de dados.

    • Os modelos de fronteira genéricos têm bom desempenho em raciocínio isolado e mau desempenho em trabalho de longo horizonte. Perdem contexto, alucinam ligações entre documentos e produzem resultados com aparência de confiança que falham as verificações da rubrica em factos e citações.
    • Os agentes treinados no domínio (Justinian e sistemas especializados comparáveis) reduzem a diferença na conclusão de tarefas de longo horizonte — sobretudo na redação de civil law, onde os modelos genéricos recorrem por predefinição a estruturas de common law e falham em especificidades processuais.

    Matriz de capacidade — o que cada modelo consegue efetivamente concluir

    As pontuações agregadas escondem a pergunta operacional que todo o sócio de um escritório de advocacia faz: que tipos de trabalho posso delegar de ponta a ponta, quais precisam de um advogado no circuito, e quais não devo sequer tocar? A matriz abaixo responde a isto nas 24 famílias de tarefas.

    Porque é que isto importa para os escritórios de advocacia

    Se está a avaliar um fornecedor de IA e este lhe mostra uma demonstração confiante com um único documento, pergunte-lhe qual é a taxa de conclusão de longo horizonte num processo real. Pergunte qual é a taxa all-pass numa rubrica de 50 critérios para esse processo. Pergunte quais as áreas de prática que cobrem de ponta a ponta e quais apenas assistem.

    São essas as perguntas que o Study foi concebido para responder — de forma pública, reprodutível e com rubricas que qualquer sócio pode auditar.

    O que está aberto e o que se segue

    • As famílias de tarefas e o formato de rubrica da v1 estão documentados e serão disponibilizados a clientes e parceiros de investigação ao abrigo de uma licença de avaliação.
    • Publicaremos uma metodologia de pontuação normalizada e uma tabela de referência assim que tivermos resultados de todos os principais modelos de fronteira.
    • A v2 acrescentará arbitragem MENA, litígios de construção, fluxos de trabalho de departamentos jurídicos internos e redação mais ampla de civil law em árabe e francês.
    • Estamos a co-desenvolver extensões com escritórios de advocacia selecionados — se quiser contribuir com famílias de tarefas da sua prática, entre em contacto.

    O trabalho anterior no setor nunca foi tão interessante — o LegalBench, o BigLaw Bench e o benchmark de agentes jurídicos lançado recentemente pela Harvey fazem todos avançar a área. O contributo da HAQQ é o eixo multilingue, de civil law, com prioridade MENA, que ainda faltava.

    Experimente

    Se quiser ver como o Justinian se comporta em tarefas de longo horizonte da sua prática, fale com a nossa equipa. Realizaremos um piloto confidencial, avaliado por rubrica, com um processo expurgado do seu escritório.

    • Fale com a nossa equipa
    • Ver os benchmarks do Justinian
    • Compare a HAQQ

    Agradecimentos

    O Study é fruto do trabalho de muitas pessoas dentro da HAQQ e em toda a nossa rede de profissionais. A liderança técnica do harness, do sandbox de agentes e do runtime de rubricas coube à equipa de engenharia do HAQQ Justinian, com a conceção de tarefas e a geração de processos liderada pelo nosso grupo de Investigação Jurídica Aplicada. As nossas equipas de Segurança e de Plataforma de IA construíram o ambiente de execução isolado que nos permite correr agentes contra processos sintéticos sem expor dados de clientes. As nossas equipas de Marca e Produto moldaram a forma como os resultados são comunicados a compradores jurídicos não técnicos.

    Fora da HAQQ, estamos gratos aos advogados em exercício — na MENA, na UE e no Reino Unido — que contribuíram com processos anonimizados, redigiram rubricas nas suas áreas de prática e testaram sob pressão as primeiras famílias de tarefas. Agradecemos também aos investigadores académicos que reviram a nossa metodologia e às equipas de trabalho anterior por trás do LegalBench, do BigLaw Bench, do CUAD, do LEXam e do benchmark de agentes jurídicos da Harvey, cujo trabalho publicado tornou este benchmark mais rápido e melhor de conceber.

    Leitura relacionada

    • o HAQQ-LAB, o nosso benchmark de civil law em open source
    • o nosso benchmark de 3.000 respostas com 10 modelos de fronteira
    • o panorama open source da IA jurídica, incluindo benchmarks abertos
    S

    Stephane Boghossian

    Head of Growth

    Recursos relacionados

    JustinianLegal AI ChatCompare HAQQSecurity

    Artigos relacionados

    O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB

    O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB

    Por que o ChatGPT falha com advogados: notas de 3 advogados dos EUA

    Por que o ChatGPT falha com advogados: notas de 3 advogados dos EUA

    IA jurídica em árabe: a lacuna está no retrieval, não no conteúdo

    IA jurídica em árabe: a lacuna está no retrieval, não no conteúdo

    Perguntas frequentes

    What is the HAQQ Legal Agent Study?

    A long-horizon evaluation measuring whether AI agents can do real legal work end-to-end, not just answer trivia: 1,372 tasks across 24 practice areas graded against ~78,000 atomic, binary pass/fail rubric criteria, with civil-law and MENA coverage by design.

    What is all-pass grading in legal AI evaluation?

    A task is marked complete only if every rubric criterion passes — one missed criterion fails the task. The article's rationale: 'A deal-team report that catches 8 of 10 risks is not 80% useful... There is no partial credit on the partner's review.'

    How do frontier AI models score on long-horizon legal work?

    In the v1 baseline, the best frontier model (Claude Opus 4.7) clears 41% all-pass while HAQQ Justinian clears 58%; on civil-law and MENA tasks the gap widens to 71% vs 28%. Six systems were tested (Justinian, Claude Opus 4.7, GPT-5.2, Gemini 3.1 Pro, Grok 4.1, Mistral Large 3), best-of-three per task.

    How is this different from LegalBench or CUAD?

    LegalBench, CUAD, and LEXam test short-horizon reasoning — read a clause, answer a question. Study tasks mirror how work actually arrives: a ~50-word partner-style instruction plus a matter folder mixing material documents with noise, requiring a reviewable work product (memo, redline, draft pleading) graded by expert rubric.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    IA pode planejar litígios? Construímos um planejador GOAP para descobrir

    Próximo artigo

    Gerador de testamento com IA: como redigir um testamento por jurisdição com a HAQQ

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Curso abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasar en fr es it de pt
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados abre num novo separador
    • humans.txt abre num novo separadorlawyers.txt abre num novo separadorsecurity.txt abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.

    Long-horizon legal agent capability over time

    % of Study-equivalent tasks passing all-rubric
    HAQQ Justinian
    Frontier general LLM
    Open-source baseline
    Agentic inflection0%20%40%60%Q1 23Q3 23Q1 24Q3 24Q1 25Q3 25Q1 26Q2 26GPT-4 releaseClaude 3.5 Sonneto1 / agentic eraJustinian v158%41%21%

    Same curve shape Karpathy described for coding agents - flat for ~24 months, then a sharp turn around Q1 25 once tool-use and long-horizon planning matured. Legal hit it later because evaluation infrastructure didn't exist.

    Mirroring Real Legal Work

    Instruction
    Partner request to associate
    ~50 words. Affirmative ask, no spec.
    Environment
    Client matter / data room
    Mix of relevant + peripheral files.
    Output
    Reviewable work product
    Memo, redline, table, draft pleading.
    Verification
    Expert rubric grading
    Atomic pass/fail criteria.

    Mirroring Legal Work

    Law Firm Work
    How legal work is delivered in practice
    Partner Request
    A partner asks an associate to complete a legal task.
    →
    Client Matter
    The matter materials define the facts, documents, and context.
    →
    Legal Work Product
    A memo, markup, schedule, deck, or other finished deliverable.
    →
    Partner Review
    The work is checked for format, facts, analysis, and judgement.
    HAQQ Legal Agent Study
    The same workflow encoded for agents
    Instructions
    A partner-style request states what the agent must do.
    →
    Environment
    A closed universe of synthetic, human-reviewed matter materials.
    →
    Output
    The agent must produce real legal work product.
    →
    Expert Rubric
    Grades the output for format, facts, and analysis.
    Each row is a 1:1 encoding of how a real matter moves through a firm.

    All-Pass Grading

    M&A change-of-control rubric
    1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    Awaiting agent output

    A deal-team report that catches 8 of 10 risks is not 80% useful. The two missed could change deal economics or surface post-close.

    Rubric Anatomy - 57 atomic criteria

    M&A change-of-control task
    Sample criterion - Issue identification
    "Pinnacle license converts exclusivity to non-exclusivity on CoC"

    24 practice areas — 1,469 tasks

    Click a category to filter
    Transactional5 areas
    467 tasks
    Corporate M&A142
    Capital Markets98
    Private Equity87
    Banking & Finance76
    Real Estate64
    Advisory4 areas
    240 tasks
    Tax71
    IP & Patents62
    Employment58
    Privacy & Data49
    Regulatory5 areas
    195 tasks
    Securities Reg.54
    Antitrust41
    Sanctions / OFAC38
    AML / KYC33
    Healthcare Reg.29
    Litigation4 areas
    245 tasks
    Commercial Lit.95
    Arbitration67
    White Collar44
    Bankruptcy39
    MENA6 areas
    322 tasks
    Civil-Law Drafting88
    GCC Corporate71
    Sharia Compliance52
    Labour (MENA)47
    Construction Lit.36
    Family / Personal Status28

    Data Room Composition - what the agent must navigate

    16 files, 6 carry signal
    Material
    Cross-document
    External-knowledge
    Peripheral / noise
    Master Services Agmt.
    CoC consent required
    Pinnacle License
    Exclusivity flips on CoC
    Supply Agmt. v3
    Termination on transfer
    Engineer offer letter
    PIIA missing - links to IP gap
    IP Assignment Log
    Names same engineer
    CSO employment agmt.
    2-yr non-compete (CA, void)
    10-K (most recent)
    -
    Board minutes Q3
    -
    Deferred comp plan
    -
    Tax opinion 2024
    -
    Audit letter
    -
    Cap table v12
    -
    Prior NDA
    -
    Vendor MSA template
    -
    Office lease
    -
    Insurance policy
    -

    Example: M&A Change-of-Control Task

    USD 458M acquisition
    Input component
    What the agent sees
    What the agent must do
    Partner request
    "Review the attached acquisition data room and prepare a comprehensive deal-team report."
    Infer the expected work product: issue spotting, contract analysis, risk ranking, financial computation, and synthesis.
    Deal context
    • Acquisition Memo.pdf
    Use the memo's facts to decide whether contract provisions are triggered, then locate where they apply across the deal.
    Core material contracts
    • Asset Purchase Agreement
    • Credit Facility
    • Master Services Agreement
    • Customer License Agreement
    • Employment Agreement - CEO
    • Employment Agreement - CFO
    • Reseller Agreement
    • Commercial Lease
    Find CoC definitions, assignment clauses, consent waivers, termination rights, and payment obligations.
    Broader deal-room material
    • Disclosure Schedules.pdf
    • Side Letter - 2023.pdf
    • Draft Bid Letter.docx
    • Engagement Letter.pdf
    • Term Sheet - v3.pdf
    • Deal Team Bios.pdf
    Separate the core assignment from background material, while still surfacing facts from the periphery that affect the analysis.
    Request output
    • coc-analysis-report.docx
    Produce finished work-product that a supervising lawyer could review - not a list of bullet points or extracted facts.

    Evaluating a Task: 9 Planted Legal Issues

    57 atomic rubric criteria
    TerraNode consent risk
    What the agent must figure out

    A portfolio-company conflict may let TerraNode withhold consent to the deal.

    Example legal unit tests

    Connect CloudSpan to TerraNode's direct-competitor carve-out. Rate the issues Critical and recommend early consent engagement.

    Legal Agent Study v1 — All-pass leaderboard

    % of long-horizon tasks where every rubric criterion passes (best of 3)

    Sort:
    0
    25
    50
    75
    100
    1HAQQ JustinianLEAD
    58%
    +36
    2Claude Opus 4.7
    41%
    +23
    3GPT-5.2
    38%
    +21
    4Gemini 3.1 Pro
    33%
    +18
    5Grok 4.1
    24%
    +12
    6Mistral Large 3
    19%
    +10
    Best on slice
    HAQQ Justinian · 58%
    Spread (best vs last)
    39 pts
    Median Δ vs prior gen.
    +20 pts

    Light grey bar = same model's prior-generation baseline (12-month look-back). Best of 3 runs per task on synthetic + anonymized matters.

    Do all
    14
    Do some
    7
    Cannot do
    3
    Across 24 practice areasEnd-to-end task completion