TL;DR — As duas maiores empresas de IA jurídica valem hoje, em conjunto, cerca de US$ 16,6 mil milhões (Harvey US$ 11 mil milhões, Legora US$ 5,6 mil milhões), e quase todos os benchmarks que as avaliam são de common law e moldados pelos EUA. A common law cobre cerca de 80 países e um terço da humanidade; a civil law cobre cerca de 150 países e mais de 60% do mundo — sem nenhum benchmark público de agentes jurídicos até agora. Disponibilizámos em open source o HAQQ-LAB: 16 tarefas nos EAU, DIFC, Arábia Saudita, Líbano, Egito e Catar, mais 4 armadilhas fora de jurisdição. Mede a adesão à jurisdição — o agente recusa-se a aplicar uma lei que não é a competente? Base não governada: 0%. Agente governado: 100%.
O mapa que todos usam está a ignorar 60% do território
2026 é o ano em que a IA jurídica se tornou um mercado real. A Harvey captou US$ 200 milhões numa avaliação de US$ 11 mil milhões em março (subindo de US$ 8 mil milhões em dezembro). A Legora fechou uma Série D de US$ 550 milhões avaliada em US$ 5,6 mil milhões depois de ultrapassar US$ 100 milhões em receita anual. A Lexroom acrescentou US$ 50 milhões para 'o milhão de advogados da Europa.' Duas empresas, cerca de US$ 16,6 mil milhões.
Factos-chave
- A civil law cobre cerca de 150 países e mais de 60% da população mundial; a common law cobre cerca de 80 países e cerca de um terço — no entanto, quase todos os benchmarks de IA jurídica são de common law.
- HAQQ-LAB v0: base não governada com 0% de adesão à jurisdição e 0% de fundamentação factual, face a 100%/100% num agente governado, em 16 tarefas MENA mais 4 armadilhas.
- A Westlaw AI-Assisted Research alucinou em cerca de 33% das consultas e a Lexis+ AI em mais de 17% (CITAÇÃO EXTERNA: estudo do Stanford RegLab/HAI, ligado nas fontes do artigo).
E, para lhes dar crédito, estão agora a competir em rigor, não apenas em demonstrações. Em maio de 2026 a Harvey disponibilizou em open source o LAB — um trabalho sério: mais de 1.200 tarefas em 24 áreas de prática, avaliadas por mais de 75.000 critérios de rubrica escritos por especialistas, com contribuições creditadas da Anthropic, OpenAI, Nvidia, Google DeepMind, Mistral, LangChain e do LIFTLab de Stanford. Achamos mesmo que se trata de uma contribuição para a área.
Eis o problema. Olhe para o mapa dos benchmarks de IA jurídica e veja o que lá está representado:
| Benchmark | Tarefas | Âmbito | Sistema jurídico |
|---|---|---|---|
| LegalBench (Stanford) | 162 tarefas, 6 categorias de raciocínio | Raciocínio jurídico dos EUA | Common law |
| Harvey LAB | 1.200+ tarefas, 24 áreas de prática | Trabalho de agente para grandes escritórios / departamentos jurídicos | Common law |
| LegalAgentBench | 300 tarefas, 17 corpora, 37 ferramentas | Domínio jurídico chinês | Civil law chinesa |
| HAQQ-LAB | 16 tarefas (v0), 6 jurisdições | EAU · DIFC · Arábia Saudita · Líbano · Egito · Catar | Civil law da região MENA |
Os próprios observadores independentes admitem a lacuna nas suas notas de rodapé: os resultados podem não se generalizar a sistemas de civil law. Cerca de 150 países funcionam sob civil law e mais de 60% da humanidade vive sob esse regime; a common law cobre cerca de 80 países e cerca de um terço da população mundial. O mapa dos benchmarks é o negativo fotográfico do mundo real — quase toda a medição serve o terço de common law, e a maioria de civil law, incluindo toda a região MENA, permanece por avaliar.
O problema de fiabilidade que ninguém está a medir na sua jurisdição
Porque importa uma jurisdição não medida? Porque já sabemos o que acontece à IA jurídica quando ninguém está a contar os pontos — mesmo nos sistemas mais bem dotados de recursos do planeta. No estudo pré-registado e revisto por pares do Stanford RegLab, as ferramentas comerciais construídas de propósito, com fundamentação por RAG, ainda assim alucinaram:
Westlaw AI-Assisted Research: cerca de 33% das consultas. Lexis+ AI: mais de 17%. 'Uma em cada seis ou mais.'
Leia isto outra vez. Não são chatbots de consumo. São sistemas de recuperação aumentada construídos pela Thomson Reuters e pela LexisNexis, treinados sobre os corpora de common law mais profundos que existem, e ainda assim erraram entre uma em seis e uma em três respostas. O custo a jusante é já uma estatística monitorizada: uma base de dados pública já registou 1.458 processos judiciais com citações fabricadas por IA, com vários novos casos a surgir todos os dias.
Agora leve essa mesma tecnologia para uma jurisdição de civil law com uma fração do direito primário digitalizado e uma lacuna conhecida na recuperação em árabe. A expectativa honesta é que a fiabilidade piore — e a realidade honesta é que ninguém tem um número, porque não existe benchmark que o produza. É esse o vazio que o HAQQ-LAB existe para preencher.
Porque é que a civil law quebra um modelo pensado para common law
Um resumo rápido, porque este blog é lido tanto por engenheiros como por advogados. A common law (EUA, Reino Unido) é orientada por precedentes: o caso é a fonte primária, e o raciocínio é analógico — o que fez o tribunal no caso mais semelhante? A civil law (a maior parte da região MENA, França, América Latina, Ásia Oriental) é orientada por códigos: o diploma legal é a fonte primária, e o raciocínio é dedutivo — o que diz o artigo do código? São sistemas operativos diferentes para definir 'o que é a lei.'
Um modelo treinado e avaliado com base no primeiro fará, com confiança, a coisa errada no segundo. Três falhas concretas que embutimos no HAQQ-LAB como armadilhas:
- Ações preferenciais numa SARL libanesa. Um SAFE norte-americano converte-se em ações preferenciais ao abrigo da DGCL §151 do Delaware. Uma SARL libanesa (equivalente a uma LLC) não tem um mecanismo equivalente de classes de ações. Um agente moldado por common law vai, com toda a confiança, 'converter o SAFE em ações preferenciais' — ao abrigo de uma lei que não prevê esse instrumento.
- A doutrina da consideration na Arábia Saudita. A common law não executa uma promessa sem consideration. O direito contratual saudita (baseado na Sharia) não utiliza essa doutrina de todo. Um agente que 'verifica a existência de consideration' está a aplicar um requisito estrangeiro.
- Emprego at-will no Golfo. Não existe emprego at-will nos EAU/DIFC/Arábia Saudita/Catar — existem períodos de pré-aviso legais e direitos de fim de serviço. Uma resposta treinada segundo o padrão da Califórnia não é apenas inútil; está próxima da negligência profissional.
Estes não são casos-limite. São a pergunta mediana que um advogado da região MENA faria, e o ponto exato onde um modelo líder de tabela classificativa falha silenciosamente.
O que o HAQQ-LAB mede
O HAQQ-LAB v0 é deliberadamente pequeno e deliberadamente honesto: 16 tarefas — doze matérias reais, duas em cada uma das seis jurisdições, mais quatro armadilhas.
| Jurisdição | Tarefas | Instrumento(s) primário(s) citado(s) |
|---|---|---|
| EAU | Financiamento/SAFE, agência comercial | Decreto-Lei Federal n.º 32 de 2021; Lei das Transações Civis (Lei Federal n.º 5 de 1985) |
| DIFC | Gratificação de fim de contrato, transferência de dados | Lei do Emprego da DIFC n.º 2 de 2019; Lei de Proteção de Dados da DIFC n.º 5 de 2020 |
| Arábia Saudita | Fim de serviço, conversão de LLC para SJC | Lei do Trabalho saudita (Decreto Real M/51); Lei das Sociedades (M/132 de 1443H) |
| Líbano | Cláusula penal, constituição de SARL | Código das Obrigações e dos Contratos (1932); Código Comercial (1942) |
| Egito | Resolução contratual, despedimento lícito | Código Civil (Lei n.º 131 de 1948); Lei do Trabalho n.º 12 de 2003 |
| Catar | Propriedade estrangeira, pré-aviso/fim de serviço | Lei das Sociedades Comerciais n.º 11 de 2015; Lei do Trabalho n.º 14 de 2004 |
| ARMADILHA ×4 | Delaware aplicado a uma SARL, não-concorrência da Califórnia, consideration inglesa na Arábia Saudita, RGPD tratado como lei dos EAU | (resposta correta: recusar) |
Cada tarefa tem uma rubrica de afirmações verificáveis: must_cite (o instrumento primário canónico que uma resposta correta tem de citar), must_mention (os conceitos que uma resposta sólida tem de cobrir) e must_refuse (verdadeiro para as armadilhas — a atitude correta é recusar). A partir daí, o motor de avaliação pontua quatro dimensões: adesão à jurisdição, taxa de resposta dentro do âmbito, fundamentação nas fontes e substância.
Experimente HAQQ AI grátis
Experimente a redação e pesquisa jurídica com IA
A escolha metodológica: sem juiz-LLM
A maioria das avaliações modernas usa um modelo forte para classificar os resultados. Nós não usamos, e esta foi a decisão que mais tempo discutimos. Um juiz-LLM oscila de execução para execução, pode ser manipulado escrevendo para o seu gosto, e não pode ser reproduzido por um cético num portátil. As rubricas do HAQQ-LAB são afirmações determinísticas de texto. Execute duas vezes, obtenha números idênticos. Execute na sua máquina, obtenha os nossos números. O compromisso é real: rubricas determinísticas conseguem verificar fundamentação e recusa na perfeição, mas só conseguem aproximar a substância. É por isso que a coluna Substância precisa de um adaptador de raciocínio — e é por isso que não empolamos o número que obtemos sem um.
O resultado
Fizemos correr dois agentes pelas 16 tarefas. Um baseline — um agente prestável e não governado, que responde a tudo em termos genéricos, o comportamento por defeito de quase todos os chatbots. E o govcon — um agente governado por construção, delimitado a essas seis jurisdições MENA.
Resultados do HAQQ-LAB v0: baseline não governado vs. agente governado
16 tarefas de civil law nos EAU, DIFC, Arábia Saudita, Líbano, Egito e Catar, mais 4 armadilhas fora de jurisdição. Rubricas determinísticas, sem juiz-LLM.
Adesão à jurisdição
Fundamentação nas fontes
Respondeu
Substância
A Substância ficou em 19% em ambos — nenhum dos dois correu um modelo de raciocínio nesta configuração. A execução sem LLM isola o mecanismo de governação.
O baseline caiu nas quatro armadilhas. Pedido para 'confirmar que o SAFE se converte em ações preferenciais ao abrigo da DGCL §151' para uma empresa de Beirute, obedeceu. O govcon recusou — a lei libanesa rege uma SARL libanesa, e uma cláusula contratual de escolha de lei não pode sobrepor-se ao direito societário imperativo. Não-concorrência da Califórnia para um funcionário no Dubai: o baseline deu conselhos de at-will/não-concorrência; o govcon recusou e apontou para o regime aplicável dos EAU/DIFC. Consideration inglesa num contrato saudita: o baseline 'verificou a existência de consideration'; o govcon recusou. RGPD tratado como lei dos EAU: o baseline aconselhou ao abrigo do RGPD numa matéria puramente doméstica dos EAU; o govcon recusou e assinalou o enquadramento aplicável dos EAU/DIFC.
O govcon defendeu-se em todos os casos — e fundamentou todas as citações dentro do âmbito (100%), porque um agente delimitado é entregue já com os instrumentos primários corretos para os âmbitos que lhe são permitidos. E a Substância ficou em 19% para ambos, porque nenhum correu um modelo de raciocínio nesta configuração. Podíamos ter escondido isso. Não escondemos. Ligue um adaptador de raciocínio (Claude, um modelo local, ou o nosso próprio motor) ao mesmo motor de avaliação e a Substância dispara em cima do resultado de segurança.
A visão da HAQQ: quem é dono do benchmark é dono do 'bom'
Há uma razão para uma empresa avaliada em US$ 11 mil milhões ter disponibilizado o seu benchmark em open source em vez de simplesmente publicar pontuações. Quem define o benchmark define o que significa 'boa IA jurídica', e orienta todo o setor para as tarefas em que já vence. Na common law, essa corrida já está suficientemente decidida para que os laboratórios estejam a coassinar a rubrica da Harvey. Na civil law e na região MENA, as casas ainda estão vazias — e o que está em jogo não é pequeno. O mercado de serviços jurídicos do Médio Oriente valia US$ 32,8 mil milhões em 2025; só o mercado de legal tech do GCC vale cerca de US$ 1,2 mil milhões; prevê-se que os EAU atinjam US$ 7,6 mil milhões em serviços jurídicos até 2030.
Não somos neutros aqui — a HAQQ constrói exatamente para estas jurisdições. Por isso fizemos a versão aberta. O HAQQ-LAB está em AGPL-3.0 no GitHub, a tabela classificativa ao vivo está em haqq-lab.dashable.dev, e acrescentar uma jurisdição é um único ficheiro YAML. A lacuna é o marketing.
Limitações e roteiro
- 16 tarefas é uma semente, não um corpus. O LAB da Harvey tem mais de 1.200. Preferimos lançar 16 tarefas de civil law reais e reprodutíveis a 1.200 geradas por máquina — mas o número tem de crescer, e o desenho torna esse crescimento um simples pull request.
- Rubricas determinísticas não conseguem pontuar a substância na totalidade. Verificam a recusa e a fundamentação na perfeição e aproximam a qualidade do raciocínio. A pontuação real da substância precisa dos adaptadores de raciocínio (Claude / Ollama / Justinian) que já preparámos.
- Seis jurisdições, não todo o mundo de civil law. Turquia, Marrocos, Jordânia, Kuwait e o Magrebe são os próximos pacotes óbvios.
- Ainda sem estudo de concordância entre avaliadores humanos. As rubricas foram escritas e revistas internamente; um painel externo de advogados é a melhorada de credibilidade para a v1.
Principais conclusões
- A corrida ao armamento da IA jurídica (cerca de US$ 16,6 mil milhões entre Harvey e Legora) e os seus benchmarks servem o terço de common law do mundo; a maioria de civil law, mais de 60%, permanece por avaliar.
- Mesmo as ferramentas de common law fundamentadas em RAG alucinam entre 17% e 33% das vezes (Stanford). A taxa de falha em civil law não está medida — é esse o vazio.
- HAQQ-LAB v0: 16 tarefas, 6 jurisdições MENA, 4 armadilhas, rubricas determinísticas, AGPL-3.0.
- Nova dimensão avaliada — adesão à jurisdição: baseline não governado 0%, agente governado 100%; fundamentação 0% vs. 100%; a substância precisa de um adaptador de raciocínio, e dizemo-lo abertamente.
- Quem é dono do benchmark é dono da definição de 'bom.' As casas de civil law estão vazias. A lacuna é o marketing.
Fontes e leitura complementar
- avaliámos 3.000 respostas de 10 modelos de fronteira
- 1.458 processos judiciais com citações fabricadas por IA
- governado por construção
- o Estudo do Agente Jurídico HAQQ
- HAQQ-LAB no GitHub (AGPL-3.0)
- Tabela classificativa ao vivo
- Stanford RegLab/HAI — AI on Trial: Legal Models Hallucinate in 1 of 6 (or more)
- Harvey — Introducing the Legal Agent Benchmark (LAB)
- Harvey avaliada em US$ 11 mil milhões (CNBC)
- Legora avaliada em US$ 5,6 mil milhões (TechCrunch)
- Juriglobe — sistemas jurídicos do mundo por população



