Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB
    Voltar ao BlogIA & Tech Jurídica

    O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB

    Todo grande benchmark de IA jurídica é de common law; o civil law rege 60%+ do mundo. HAQQ-LAB: 16 tarefas MENA open source, 4 armadilhas - 0% vs 100% de aderência.

    May 22, 2026
    14 min de leitura
    |
    HAQQ Team
    O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB

    TL;DR — As duas maiores empresas de IA jurídica valem hoje, em conjunto, cerca de US$ 16,6 mil milhões (Harvey US$ 11 mil milhões, Legora US$ 5,6 mil milhões), e quase todos os benchmarks que as avaliam são de common law e moldados pelos EUA. A common law cobre cerca de 80 países e um terço da humanidade; a civil law cobre cerca de 150 países e mais de 60% do mundo — sem nenhum benchmark público de agentes jurídicos até agora. Disponibilizámos em open source o HAQQ-LAB: 16 tarefas nos EAU, DIFC, Arábia Saudita, Líbano, Egito e Catar, mais 4 armadilhas fora de jurisdição. Mede a adesão à jurisdição — o agente recusa-se a aplicar uma lei que não é a competente? Base não governada: 0%. Agente governado: 100%.

    O mapa que todos usam está a ignorar 60% do território

    2026 é o ano em que a IA jurídica se tornou um mercado real. A Harvey captou US$ 200 milhões numa avaliação de US$ 11 mil milhões em março (subindo de US$ 8 mil milhões em dezembro). A Legora fechou uma Série D de US$ 550 milhões avaliada em US$ 5,6 mil milhões depois de ultrapassar US$ 100 milhões em receita anual. A Lexroom acrescentou US$ 50 milhões para 'o milhão de advogados da Europa.' Duas empresas, cerca de US$ 16,6 mil milhões.

    Factos-chave

    • A civil law cobre cerca de 150 países e mais de 60% da população mundial; a common law cobre cerca de 80 países e cerca de um terço — no entanto, quase todos os benchmarks de IA jurídica são de common law.
    • HAQQ-LAB v0: base não governada com 0% de adesão à jurisdição e 0% de fundamentação factual, face a 100%/100% num agente governado, em 16 tarefas MENA mais 4 armadilhas.
    • A Westlaw AI-Assisted Research alucinou em cerca de 33% das consultas e a Lexis+ AI em mais de 17% (CITAÇÃO EXTERNA: estudo do Stanford RegLab/HAI, ligado nas fontes do artigo).

    E, para lhes dar crédito, estão agora a competir em rigor, não apenas em demonstrações. Em maio de 2026 a Harvey disponibilizou em open source o LAB — um trabalho sério: mais de 1.200 tarefas em 24 áreas de prática, avaliadas por mais de 75.000 critérios de rubrica escritos por especialistas, com contribuições creditadas da Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain e do LIFTLab de Stanford. Achamos mesmo que se trata de uma contribuição para a área.

    Eis o problema. Olhe para o mapa dos benchmarks de IA jurídica e veja o que lá está representado:

    BenchmarkTarefasÂmbitoSistema jurídico
    LegalBench (Stanford)162 tarefas, 6 categorias de raciocínioRaciocínio jurídico dos EUACommon law
    Harvey LAB1.200+ tarefas, 24 áreas de práticaTrabalho de agente para grandes escritórios / departamentos jurídicosCommon law
    LegalAgentBench300 tarefas, 17 corpora, 37 ferramentasDomínio jurídico chinêsCivil law chinesa
    HAQQ-LAB16 tarefas (v0), 6 jurisdiçõesEAU · DIFC · Arábia Saudita · Líbano · Egito · CatarCivil law da região MENA

    Os próprios observadores independentes admitem a lacuna nas suas notas de rodapé: os resultados podem não se generalizar a sistemas de civil law. Cerca de 150 países funcionam sob civil law e mais de 60% da humanidade vive sob esse regime; a common law cobre cerca de 80 países e cerca de um terço da população mundial. O mapa dos benchmarks é o negativo fotográfico do mundo real — quase toda a medição serve o terço de common law, e a maioria de civil law, incluindo toda a região MENA, permanece por avaliar.

    O problema de fiabilidade que ninguém está a medir na sua jurisdição

    Porque importa uma jurisdição não medida? Porque já sabemos o que acontece à IA jurídica quando ninguém está a contar os pontos — mesmo nos sistemas mais bem dotados de recursos do planeta. No estudo pré-registado e revisto por pares do Stanford RegLab, as ferramentas comerciais construídas de propósito, com fundamentação por RAG, ainda assim alucinaram:

    Westlaw AI-Assisted Research: cerca de 33% das consultas. Lexis+ AI: mais de 17%. 'Uma em cada seis ou mais.'

    Leia isto outra vez. Não são chatbots de consumo. São sistemas de recuperação aumentada construídos pela Thomson Reuters e pela LexisNexis, treinados sobre os corpora de common law mais profundos que existem, e ainda assim erraram entre uma em seis e uma em três respostas. O custo a jusante é já uma estatística monitorizada: uma base de dados pública já registou 1.458 processos judiciais com citações fabricadas por IA, com vários novos casos a surgir todos os dias.

    Agora leve essa mesma tecnologia para uma jurisdição de civil law com uma fração do direito primário digitalizado e uma lacuna conhecida na recuperação em árabe. A expectativa honesta é que a fiabilidade piore — e a realidade honesta é que ninguém tem um número, porque não existe benchmark que o produza. É esse o vazio que o HAQQ-LAB existe para preencher.

    Porque é que a civil law quebra um modelo pensado para common law

    Um resumo rápido, porque este blog é lido tanto por engenheiros como por advogados. A common law (EUA, Reino Unido) é orientada por precedentes: o caso é a fonte primária, e o raciocínio é analógico — o que fez o tribunal no caso mais semelhante? A civil law (a maior parte da região MENA, França, América Latina, Ásia Oriental) é orientada por códigos: o diploma legal é a fonte primária, e o raciocínio é dedutivo — o que diz o artigo do código? São sistemas operativos diferentes para definir 'o que é a lei.'

    Um modelo treinado e avaliado com base no primeiro fará, com confiança, a coisa errada no segundo. Três falhas concretas que embutimos no HAQQ-LAB como armadilhas:

    • Ações preferenciais numa SARL libanesa. Um SAFE norte-americano converte-se em ações preferenciais ao abrigo da DGCL §151 do Delaware. Uma SARL libanesa (equivalente a uma LLC) não tem um mecanismo equivalente de classes de ações. Um agente moldado por common law vai, com toda a confiança, 'converter o SAFE em ações preferenciais' — ao abrigo de uma lei que não prevê esse instrumento.
    • A doutrina da consideration na Arábia Saudita. A common law não executa uma promessa sem consideration. O direito contratual saudita (baseado na Sharia) não utiliza essa doutrina de todo. Um agente que 'verifica a existência de consideration' está a aplicar um requisito estrangeiro.
    • Emprego at-will no Golfo. Não existe emprego at-will nos EAU/DIFC/Arábia Saudita/Catar — existem períodos de pré-aviso legais e direitos de fim de serviço. Uma resposta treinada segundo o padrão da Califórnia não é apenas inútil; está próxima da negligência profissional.

    Estes não são casos-limite. São a pergunta mediana que um advogado da região MENA faria, e o ponto exato onde um modelo líder de tabela classificativa falha silenciosamente.

    O que o HAQQ-LAB mede

    O HAQQ-LAB v0 é deliberadamente pequeno e deliberadamente honesto: 16 tarefas — doze matérias reais, duas em cada uma das seis jurisdições, mais quatro armadilhas.

    JurisdiçãoTarefasInstrumento(s) primário(s) citado(s)
    EAUFinanciamento/SAFE, agência comercialDecreto-Lei Federal n.º 32 de 2021; Lei das Transações Civis (Lei Federal n.º 5 de 1985)
    DIFCGratificação de fim de contrato, transferência de dadosLei do Emprego da DIFC n.º 2 de 2019; Lei de Proteção de Dados da DIFC n.º 5 de 2020
    Arábia SauditaFim de serviço, conversão de LLC para SJCLei do Trabalho saudita (Decreto Real M/51); Lei das Sociedades (M/132 de 1443H)
    LíbanoCláusula penal, constituição de SARLCódigo das Obrigações e dos Contratos (1932); Código Comercial (1942)
    EgitoResolução contratual, despedimento lícitoCódigo Civil (Lei n.º 131 de 1948); Lei do Trabalho n.º 12 de 2003
    CatarPropriedade estrangeira, pré-aviso/fim de serviçoLei das Sociedades Comerciais n.º 11 de 2015; Lei do Trabalho n.º 14 de 2004
    ARMADILHA ×4Delaware aplicado a uma SARL, não-concorrência da Califórnia, consideration inglesa na Arábia Saudita, RGPD tratado como lei dos EAU(resposta correta: recusar)

    Cada tarefa tem uma rubrica de afirmações verificáveis: must_cite (o instrumento primário canónico que uma resposta correta tem de citar), must_mention (os conceitos que uma resposta sólida tem de cobrir) e must_refuse (verdadeiro para as armadilhas — a atitude correta é recusar). A partir daí, o motor de avaliação pontua quatro dimensões: adesão à jurisdição, taxa de resposta dentro do âmbito, fundamentação nas fontes e substância.

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    A escolha metodológica: sem juiz-LLM

    A maioria das avaliações modernas usa um modelo forte para classificar os resultados. Nós não usamos, e esta foi a decisão que mais tempo discutimos. Um juiz-LLM oscila de execução para execução, pode ser manipulado escrevendo para o seu gosto, e não pode ser reproduzido por um cético num portátil. As rubricas do HAQQ-LAB são afirmações determinísticas de texto. Execute duas vezes, obtenha números idênticos. Execute na sua máquina, obtenha os nossos números. O compromisso é real: rubricas determinísticas conseguem verificar fundamentação e recusa na perfeição, mas só conseguem aproximar a substância. É por isso que a coluna Substância precisa de um adaptador de raciocínio — e é por isso que não empolamos o número que obtemos sem um.

    O resultado

    Fizemos correr dois agentes pelas 16 tarefas. Um baseline — um agente prestável e não governado, que responde a tudo em termos genéricos, o comportamento por defeito de quase todos os chatbots. E o govcon — um agente governado por construção, delimitado a essas seis jurisdições MENA.

    Resultados do HAQQ-LAB v0: baseline não governado vs. agente governado

    16 tarefas de civil law nos EAU, DIFC, Arábia Saudita, Líbano, Egito e Catar, mais 4 armadilhas fora de jurisdição. Rubricas determinísticas, sem juiz-LLM.

    Adesão à jurisdição

    Adesão à jurisdição — baseline
    0%
    Adesão à jurisdição — govcon
    100%

    Fundamentação nas fontes

    Fundamentação nas fontes — baseline
    0%
    Fundamentação nas fontes — govcon
    100%

    Respondeu

    Taxa de resposta dentro do âmbito — ambos
    100%

    Substância

    Substância — ambos (sem adaptador de raciocínio)
    19%

    A Substância ficou em 19% em ambos — nenhum dos dois correu um modelo de raciocínio nesta configuração. A execução sem LLM isola o mecanismo de governação.

    O baseline caiu nas quatro armadilhas. Pedido para 'confirmar que o SAFE se converte em ações preferenciais ao abrigo da DGCL §151' para uma empresa de Beirute, obedeceu. O govcon recusou — a lei libanesa rege uma SARL libanesa, e uma cláusula contratual de escolha de lei não pode sobrepor-se ao direito societário imperativo. Não-concorrência da Califórnia para um funcionário no Dubai: o baseline deu conselhos de at-will/não-concorrência; o govcon recusou e apontou para o regime aplicável dos EAU/DIFC. Consideration inglesa num contrato saudita: o baseline 'verificou a existência de consideration'; o govcon recusou. RGPD tratado como lei dos EAU: o baseline aconselhou ao abrigo do RGPD numa matéria puramente doméstica dos EAU; o govcon recusou e assinalou o enquadramento aplicável dos EAU/DIFC.

    O govcon defendeu-se em todos os casos — e fundamentou todas as citações dentro do âmbito (100%), porque um agente delimitado é entregue já com os instrumentos primários corretos para os âmbitos que lhe são permitidos. E a Substância ficou em 19% para ambos, porque nenhum correu um modelo de raciocínio nesta configuração. Podíamos ter escondido isso. Não escondemos. Ligue um adaptador de raciocínio (Claude, um modelo local, ou o nosso próprio motor) ao mesmo motor de avaliação e a Substância dispara em cima do resultado de segurança.

    A visão da HAQQ: quem é dono do benchmark é dono do 'bom'

    Há uma razão para uma empresa avaliada em US$ 11 mil milhões ter disponibilizado o seu benchmark em open source em vez de simplesmente publicar pontuações. Quem define o benchmark define o que significa 'boa IA jurídica', e orienta todo o setor para as tarefas em que já vence. Na common law, essa corrida já está suficientemente decidida para que os laboratórios estejam a coassinar a rubrica da Harvey. Na civil law e na região MENA, as casas ainda estão vazias — e o que está em jogo não é pequeno. O mercado de serviços jurídicos do Médio Oriente valia US$ 32,8 mil milhões em 2025; só o mercado de legal tech do GCC vale cerca de US$ 1,2 mil milhões; prevê-se que os EAU atinjam US$ 7,6 mil milhões em serviços jurídicos até 2030.

    Não somos neutros aqui — a HAQQ constrói exatamente para estas jurisdições. Por isso fizemos a versão aberta. O HAQQ-LAB está em AGPL-3.0 no GitHub, a tabela classificativa ao vivo está em haqq-lab.dashable.dev, e acrescentar uma jurisdição é um único ficheiro YAML. A lacuna é o marketing.

    Limitações e roteiro

    • 16 tarefas é uma semente, não um corpus. O LAB da Harvey tem mais de 1.200. Preferimos lançar 16 tarefas de civil law reais e reprodutíveis a 1.200 geradas por máquina — mas o número tem de crescer, e o desenho torna esse crescimento um simples pull request.
    • Rubricas determinísticas não conseguem pontuar a substância na totalidade. Verificam a recusa e a fundamentação na perfeição e aproximam a qualidade do raciocínio. A pontuação real da substância precisa dos adaptadores de raciocínio (Claude / Ollama / Justinian) que já preparámos.
    • Seis jurisdições, não todo o mundo de civil law. Turquia, Marrocos, Jordânia, Kuwait e o Magrebe são os próximos pacotes óbvios.
    • Ainda sem estudo de concordância entre avaliadores humanos. As rubricas foram escritas e revistas internamente; um painel externo de advogados é a melhorada de credibilidade para a v1.

    Principais conclusões

    • A corrida ao armamento da IA jurídica (cerca de US$ 16,6 mil milhões entre Harvey e Legora) e os seus benchmarks servem o terço de common law do mundo; a maioria de civil law, mais de 60%, permanece por avaliar.
    • Mesmo as ferramentas de common law fundamentadas em RAG alucinam entre 17% e 33% das vezes (Stanford). A taxa de falha em civil law não está medida — é esse o vazio.
    • HAQQ-LAB v0: 16 tarefas, 6 jurisdições MENA, 4 armadilhas, rubricas determinísticas, AGPL-3.0.
    • Nova dimensão avaliada — adesão à jurisdição: baseline não governado 0%, agente governado 100%; fundamentação 0% vs. 100%; a substância precisa de um adaptador de raciocínio, e dizemo-lo abertamente.
    • Quem é dono do benchmark é dono da definição de 'bom.' As casas de civil law estão vazias. A lacuna é o marketing.

    Fontes e leitura complementar

    • avaliámos 3.000 respostas de 10 modelos de fronteira
    • 1.458 processos judiciais com citações fabricadas por IA
    • governado por construção
    • o Estudo do Agente Jurídico HAQQ
    • HAQQ-LAB no GitHub (AGPL-3.0)
    • Tabela classificativa ao vivo
    • Stanford RegLab/HAI — AI on Trial: Legal Models Hallucinate in 1 of 6 (or more)
    • Harvey — Introducing the Legal Agent Benchmark (LAB)
    • Harvey avaliada em US$ 11 mil milhões (CNBC)
    • Legora avaliada em US$ 5,6 mil milhões (TechCrunch)
    • Juriglobe — sistemas jurídicos do mundo por população
    H

    HAQQ Team

    Research

    Recursos relacionados

    Justinian EngineState of Legal AI in MENA 2026The Arabic Legal AI Gap

    Artigos relacionados

    Análise do CoCounsel 2026: preços, benchmark e alternativas

    Análise do CoCounsel 2026: preços, benchmark e alternativas

    Análise do Harvey AI 2026: notas de benchmark + alternativas reais

    Análise do Harvey AI 2026: notas de benchmark + alternativas reais

    HAQQ Legal Agent Study: benchmark de IA jurídica de longo horizonte

    HAQQ Legal Agent Study: benchmark de IA jurídica de longo horizonte

    Perguntas frequentes

    Is HAQQ-LAB a competitor to Harvey's LAB?

    No — it's the complement. Harvey's LAB covers common-law / BigLaw agent work, and does it at a scale we're not pretending to match. HAQQ-LAB covers the civil-law / MENA jurisdictions it doesn't. Same idea, different operating system of law.

    Why no LLM judge?

    Reproducibility and honesty. LLM-graded benchmarks drift run-to-run and can be gamed by writing to the grader's taste. HAQQ-LAB uses deterministic checkable rubrics, so anyone can reproduce the exact scores on their own machine.

    What is 'jurisdiction adherence,' and why is it the headline?

    It's whether an agent refuses to answer under a law that doesn't govern the matter. A confident answer under the wrong jurisdiction is worse than no answer — and given that purpose-built common-law tools already hallucinate on 17–33% of queries, refusing the wrong law is the floor a legal agent has to clear before substance even matters.

    How bad is the hallucination problem, really?

    In Stanford's controlled study, Westlaw AI hallucinated ~33% and Lexis+ AI >17% of the time — on common law, with retrieval grounding. There is no equivalent civil-law number because there was no civil-law benchmark. That absence is the problem.

    Can I score my own agent or model?

    Yes. Implement a thin adapter (an answer(task) wrapper) for your model — Claude, a local model, or your in-house engine — register it, and run the benchmark. The deterministic rubrics do the rest.

    Which jurisdictions are covered, and how do I add one?

    v0 covers UAE, DIFC, Saudi Arabia, Lebanon, Egypt and Qatar. Adding one is a single YAML task file with must_cite / must_mention / must_refuse — open a PR.

    Isn't 16 tasks too few to mean anything?

    For substance scoring, yes — that's why we flag it. For the jurisdiction-adherence result, the signal is already unambiguous: 0% vs 100% is a structural difference, not a sampling artifact. The corpus grows from here.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    Melhores apps de advogado com IA em 2026: mapeamos os 110

    Próximo artigo

    Governança por construção: guardrails de IA impossíveis de contornar

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Curso abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasar en fr es it de pt
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados abre num novo separador
    • humans.txt abre num novo separadorlawyers.txt abre num novo separadorsecurity.txt abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.