TL;DR — 300 tarefas jurídicas comerciais e transfronteiriças exigentes, 10 modelos de fronteira de 8 fornecedores, 3,000 respostas avaliadas numa grelha de 35 pontos à temperatura 0.
Claude Opus 4.8 vence no geral (30.02/35, primeiro lugar em 130 tarefas). Grok 4.3 é a melhor relação qualidade-preço. GPT-5.5 é o mais preciso (8.41/10, 3% de citações alucinadas).
A conclusão principal: 24% de todas as 3,000 respostas citaram ou aplicaram lei que não corresponde ao que o modelo afirmava. Nenhum modelo de fronteira é seguro para publicar uma resposta jurídica sem verificação.
Porque testamos IA jurídica em aberto
Cinco mil milhões de pessoas não conseguem aceder a ajuda jurídica. É esse o problema que a HAQQ existe para resolver. Mas por trás de qualquer demonstração de IA jurídica está uma questão fundamental: pode confiar realmente no resultado diante de um cliente? "Uma IA respondeu a uma pergunta jurídica" e "uma IA em que pode apor o seu nome" são afirmações diferentes, e a distância entre elas é todo o produto.
Principais factos
- 24% das 3,000 respostas avaliadas de modelos de fronteira citaram ou aplicaram lei que não corresponde ao que o modelo afirmava.
- O Claude Opus 4.8 venceu 130 das 300 tarefas jurídicas (30.02/35 no geral); o GPT-5.5 foi o mais preciso, com 8.41/10 e uma taxa de citações alucinadas de 3%.
- O custo por tarefa jurídica varia até 90× entre modelos de fronteira: $0.0009 (DeepSeek V3.2) a $0.082 (GPT-5.5).
Por isso medimos. Este é o terceiro artigo da nossa série de benchmarks: 100 perguntas jurídicas de consumidores abordou a perspetiva de common law / consumidor. O HAQQ-LAB foi o primeiro benchmark público de aderência jurisdicional em civil law / MENA. Este relatório é o maior até agora — trabalho jurídico comercial e transfronteiriço, os processos que pagam as contas de um escritório real.
Se só ler uma secção, leia A Lacuna das Citações. É a conclusão que devia mudar a forma como cada escritório compra IA jurídica.
Como realizámos o benchmark
Escrevemos 300 tarefas jurídicas originais e específicas — nada de trivialidades, processos reais com partes nomeadas, valores em dólares, datas e legislação aplicável. Redigir esta cláusula. Fazer o redline desta disposição. Estruturar esta transação. Analisar este conflito de leis. Abrangem 51 áreas de prática, mais de 20 jurisdições (EUA federal + Delaware / Califórnia / Nova Iorque / Texas, Reino Unido, UE, EAU, DIFC, Arábia Saudita, Líbano, Egito, Catar, Singapura, Austrália, Canadá, Índia, Brasil, Nigéria, OHADA, Japão, Alemanha, França, Suíça, além das Convenções de Haia e praças offshore — Ilhas Caimão, BVI, Bermudas).
Dificuldade fortemente ponderada: 114 tarefas de nível 5 de 5, 108 de nível 4, 22 de nível 3. São problemas multijurisdicionais concebidos para desafiar os modelos. Cada tarefa foi enviada aos 10 modelos com o mesmo prompt de sistema, à temperatura 0, com um limite de 6,000 tokens de saída.
Cada resposta foi avaliada em cinco dimensões:
- Qualidade (1–10) — profundidade, completude, aplicabilidade prática.
- Precisão (1–10) — correção jurídica; −5 por jurisprudência alucinada, −3 por jurisdição errada.
- Velocidade (1–5) — latência de resposta medida, não avaliada subjetivamente.
- Estilo (1–5) — estrutura profissional.
- Criatividade (1–5) — riscos não óbvios, questões interjurisdicionais identificadas.
Qualidade, Precisão, Estilo e Criatividade são avaliados pelo Claude Sonnet 4.6 face a uma grelha fixa. A Velocidade é calculada a partir da latência real. O viés do avaliador é tratado com honestidade nas ressalvas — não o escondemos.
A tabela classificativa: qual é a melhor IA para o trabalho jurídico
Claude Opus 4.8 vence — claramente
O Opus ficou em primeiro lugar em 130 das 300 tarefas — quase o dobro de qualquer outro modelo — e terminou no top 3 em 265 das 300. Regista a maior qualidade (8.9), precisão de topo (8.4), estilo perfeito e a maior criatividade. A sua única fraqueza é a velocidade: com 60.8s é lento e, a $0.069/tarefa, está entre os mais caros. Se quiser a melhor resposta possível e puder esperar por ela, é esta.
Grok 4.3: 98% da qualidade em 1/7 do tempo e 1/20 do custo
O resultado mais interessante da tabela. O Grok 4.3 fica em segundo lugar (28.98), mas fá-lo em 8.8 segundos a $0.003 por tarefa — contra os 60.8s e $0.069 do Opus. Para um produto voltado para o cliente, onde a latência e a economia unitária importam, o Grok é possivelmente a melhor escolha de engenharia. Ganha até mais tarefas de ambiente/ESG, propriedade intelectual e casos-limite do que qualquer outro.
GPT-5.5: o campeão de precisão que raramente "vence"
O GPT-5.5 regista a maior precisão do campo (8.41) e a menor taxa de alucinação (3%) — mas fica em quinto lugar no total e venceu apenas uma tarefa. Raramente erra e raramente impressiona. É também o mais lento (134s) e o mais caro ($0.082). Para o trabalho jurídico, "raramente errar" pode ser a dimensão que mais importa, e é exatamente por isso que uma pontuação composta única induz em erro.
o3: o modelo mais polarizador do teste
O o3 da OpenAI venceu 66 tarefas — o terceiro melhor resultado de qualquer modelo — mas ocupa o oitavo lugar no geral, com uma taxa de alucinação de 32% e a segunda pior precisão (5.89). Quando o o3 é bom, é brilhante; quando erra, erra com confiança e a um custo elevado. Essa variabilidade é, em si mesma, um risco de aquisição.
O piso: Mistral e Llama
O Mistral Large alucinou ou aplicou mal citações em 64% das suas respostas (precisão 4.74). O Llama 4 Maverick ficou em último lugar (20.01) — rápido e barato, mas com qualidade de 4.8 e as respostas mais fracas. "Citar lei real" ainda não está resolvido na base do mercado.
A lacuna das citações: a conclusão mais importante
Nas 3,000 respostas, 24% citaram ou aplicaram lei que não corresponde ao que o modelo afirmava. Processos inventados. Estatutos mal aplicados. A doutrina certa apontada para a jurisdição errada. Não são falhas vagas — o nosso avaliador assinalou erros específicos e verificáveis.
Uma amostra, um exemplo por modelo:
- Claude Opus 4.8: Computer Associates / Gemstar citados como precedentes de "gun-jumping"; caracterizações incorretas.
- GPT-5.5: A citação Hitz parece fabricada; 616 B.R. 374 não é verificável.
- Gemini 3.1 Pro: A citação Halpin v. Riverstone não é verificável; provavelmente um processo de Delaware alucinado.
- Grok 4.3: CBS v. Ziff-Davis citado incorretamente; o processo diz respeito à confiança em garantias, não à divulgação.
- Claude Sonnet 4.6: A citação Schrier não é verificável; o processo Biotronik é real, mas mal aplicado.
- o3: As citações MSA Technology v Antec e GB Gas parecem fabricadas ou distorcidas.
- Qwen3.7 Max: Specht v. Netscape mal aplicado; não é um caso de bens/serviços ao abrigo do UCC.
- DeepSeek V3.2: A citação Crosstown Music não é verificável / foi mal aplicada.
- Mistral Large: As citações N.Y. Gen. Oblig. Law §5-328 e UCC §2-515 são duvidosas / mal aplicadas.
- Llama 4 Maverick: O processo Cavendish foi mal aplicado; não tem relação com cláusulas de preço.
Todos os modelos, incluindo os líderes, fabricaram ou aplicaram mal uma citação em algum momento do teste. Isto não é um problema apenas do fundo da tabela. O modelo mais preciso de todo o campo obteve apenas 8.41 em 10. O piso é alarmante; o teto não é seguro.
Para contextualizar, as ferramentas estabelecidas sofrem do mesmo mal. Testes independentes situam o Westlaw AI-Assisted Research numa taxa de erro de aproximadamente um em três, e o Lexis+ AI acima de um em seis. Um modelo maior não resolveu isto e, com base nas nossas provas, não o fará.
Nenhum modelo vence em todas as áreas de prática
Ao desagregar as 300 tarefas por área de prática, o líder muda constantemente. Nas 51 áreas de prática: o Claude Opus 4.8 vence em 30, o Grok 4.3 em 13, o o3 em 6, e o Gemini 3.1 Pro e o Sonnet 4.6 ganham uma cada. Destaques:
- O Opus domina o núcleo doutrinal: Fusões e Aquisições (30.6), Conformidade Regulatória (30.5), Valores Mobiliários, Direito Penal/Colarinho Branco, Fiscal, Bancário, Proteção de Dados, Laboral, Comércio Internacional.
- O Grok domina a criatividade comercial: Propriedade Intelectual/Direito Tecnológico (30.2), Ambiente/ESG (30.8), Proteção do Consumidor, Conformidade/Due Diligence (31.4), casos-limite.
- O o3 destaca-se em operações transacionais: Operações Jurídicas (31.1), Valores Mobiliários e Finanças (30.9), Contratos e Contratação Pública (31.1), imobiliário transfronteiriço.
- O Gemini 3.1 Pro obtém a melhor pontuação isolada em Privacidade e Proteção de Dados (31.4).
A implicação é direta: um produto jurídico que aposta tudo num único modelo deixa precisão por conquistar em áreas de prática inteiras. A arquitetura correta encaminha cada tarefa para o motor com maior probabilidade de acertar — e depois verifica a resposta antes de a publicar.
O custo de latência e preço
A qualidade não é gratuita, nem uniforme. A dispersão é enorme: o GPT-5.5 (134s) e o Claude Sonnet 4.6 (102s) são cerca de 17× mais lentos do que o Grok 4.3 (8.8s) e o Llama 4 Maverick (7.7s). O custo por tarefa varia até 90×, desde o DeepSeek V3.2 a $0.0009 até ao GPT-5.5 a $0.082. O Grok 4.3 alcança o segundo lugar a $0.003.
Para um produto jurídico de elevado volume, o modelo "melhor" numa tabela classificativa baseada apenas na qualidade pode ser a decisão de negócio errada. O objetivo de qualidade-Opus à velocidade e custo do Grok é um problema de encaminhamento e verificação, não a escolha de um único modelo.
Perspetiva por fornecedor (combinada com todas as execuções anteriores)
Tabela classificativa de IA jurídica 2026: todos os modelos ordenados pela pontuação média
A execução de 300 tarefas acima avalia 10 modelos de fronteira numa grelha de 35 pontos. Mantemos também uma segunda tabela, mais alargada: uma avaliação de 50 tarefas numa grelha de 50 pontos que junta as plataformas jurídicas verticais que a maioria dos escritórios de facto considera (Harvey, CoCounsel, LexisNexis +AI, Legora, Spellbook, Clio Duo) aos modelos de fronteira. Essa tabela está publicada na íntegra na nossa página de comparação. Aqui está ordenada pela pontuação média nas 11 categorias de tarefas, para que possa ler um único número por modelo em vez de onze.
| Posição | Modelo | Média /50 | Média % |
|---|---|---|---|
| 1 | HAQQ (Justinian) | 47.5 | 95% |
| 2 | Claude Fable 5 | 44.0 | 88% |
| 3 | Claude Opus 4.7 | 42.1 | 84% |
| 4 | Mike OS | 41.8 | 84% |
| 5 | DeepSeek v4 Pro | 38.2 | 76% |
| 5 | Harvey | 38.2 | 76% |
| 7 | CoCounsel | 36.2 | 72% |
| 8 | Claude + plugins jurídicos | 35.4 | 71% |
| 9 | Legora | 34.5 | 69% |
| 10 | ChatGPT 5.5 | 34.4 | 69% |
| 11 | LexisNexis +AI | 33.2 | 66% |
| 12 | Grok 4.3 | 31.4 | 63% |
| 13 | Gemini 3.1 Pro | 31.1 | 62% |
| 14 | Spellbook | 29.0 | 58% |
| 15 | Perplexity Sonar | 26.5 | 53% |
| 16 | Clio Duo | 25.2 | 50% |
| 17 | Meta Llama 4 | 23.1 | 46% |
| 18 | Mistral 3 | 21.2 | 42% |
| 19 | Qwen 3 Plus | 17.1 | 34% |
Esta tabela revela três coisas que a execução de 300 tarefas não consegue mostrar. Primeiro, as plataformas jurídicas verticais concentram-se no meio da tabela, não no topo: Harvey (38.2), CoCounsel (36.2), Legora (34.5) e LexisNexis +AI (33.2) ficam todas abaixo dos melhores modelos de fronteira em bruto. O que uma empresa paga a um fornecedor de IA jurídica é o fluxo de trabalho e a camada de segurança, não uma pontuação mais alta na própria resposta. Segundo, o DeepSeek v4 Pro empata com a Harvey exatamente em 38.2 — um modelo de pesos abertos a igualar, na qualidade da resposta isolada, a empresa de IA jurídica mais valiosa do mundo. Terceiro, a dispersão é ampla: o modelo mais fraco (Qwen 3 Plus, 34%) pontua pouco mais de um terço dos 95% da HAQQ, pelo que 'qual a IA jurídica' é uma decisão real, não um jogo de sorte.
Verificação de honestidade: esta é a nossa tabela classificativa, e a HAQQ ocupa o primeiro lugar. Trate-a como deve tratar qualquer pontuação publicada por um fornecedor — verifique-a. Todos os 19 modelos e as 11 categorias estão na nossa página de comparação para que possa confirmar, e a grelha de avaliação está descrita abaixo. Note também o que uma pontuação por tarefa não consegue captar: a implementação em toda a organização, as certificações de segurança e os fluxos de trabalho agênticos em milhares de documentos são pontos fortes reais das plataformas verticais que esta tabela não mede.
Experimente HAQQ AI grátis
Experimente a redação e pesquisa jurídica com IA
Como avaliamos a tabela classificativa de IA jurídica
Dois benchmarks alimentam duas tabelas classificativas, e importa saber qual está a ler.
- A execução de 300 tarefas de fronteira (o corpo deste artigo): 300 tarefas originais comerciais e transfronteiriças, 10 modelos de fronteira, avaliados numa grelha de 35 pontos — Qualidade, Precisão, Velocidade, Estilo, Criatividade — à temperatura 0, com um limite de 6,000 tokens de saída. A melhor para responder a 'em que modelo em bruto devo construir'.
- A execução de 50 tarefas de plataformas (a tabela acima, publicada em /compare-us): 11 categorias de tarefas avaliadas numa grelha de 50 pontos que abrange Sharia, estatuto, foro, cláusula, risco, alucinação, formatação, brevidade, prontidão para sócios e ligação a fontes. Junta as plataformas jurídicas verticais que os escritórios de facto compram. A melhor para responder a 'que produto ou modelo devo pré-selecionar'.
Ambos partilham as mesmas regras da casa. Prompts idênticos para todos os modelos. Uma grelha fixa e escrita, em vez de impressões subjetivas. Dados publicados para que qualquer pessoa possa reproduzir a execução e verificar-nos. E ambos avaliam a qualidade da resposta isolada — o que é o âmbito correto para uma tabela classificativa e o âmbito errado para uma decisão de compra, porque não consegue ver a implementação, a postura de segurança ou a camada de verificação que um produto jurídico sério constrói em torno do modelo.
Não somos os únicos a avaliar, e não deve confiar apenas numa tabela classificativa. O estudo pré-registado do RegLab de Stanford concluiu que as ferramentas de investigação estabelecidas alucinam com frequência — o Westlaw AI-Assisted Research em aproximadamente uma em três consultas e o Lexis+ AI acima de uma em seis. O avaliador independente Vals AI mantém uma tabela classificativa jurídica pública que, em junho de 2026, também coloca o Claude Fable 5 no topo do seu benchmark de raciocínio jurídico (88.6%), com os modelos de fronteira a rondar os 80% face a 71% para advogados humanos em investigação jurídica. Grelhas diferentes, conjuntos de tarefas diferentes, mesma direção: os modelos de fronteira são fortes em raciocínio e pouco fiáveis em citações, e a diferença entre eles está a estreitar-se.
Qual é a melhor IA para o direito em 2026? Depende do que valoriza
Não existe uma única 'melhor IA jurídica', e qualquer tabela classificativa que finja o contrário está a vender algo. Leia as duas tabelas em conjunto e a resposta divide-se consoante o que está a otimizar:
- Melhor qualidade de resposta no geral: o Claude Opus 4.8 liderou a execução de 300 tarefas de fronteira (30.02/35, 130 tarefas vencidas). Na tabela classificativa de plataformas, o Claude Fable 5 é o modelo não-HAQQ mais forte (44.0/50).
- Mais preciso / menos alucinações: GPT-5.5 — maior precisão (8.41/10) e a menor taxa de citações alucinadas (3%) na execução de 300 tarefas, ainda que raramente 'vença' uma tarefa em pleno.
- Melhor relação qualidade-preço (velocidade e custo): Grok 4.3 — segundo em qualidade a 8.8 segundos e cerca de $0.003 por tarefa, contra os 60.8 segundos e $0.069 do Opus.
- Melhor plataforma jurídica vertical: a Harvey lidera o seu grupo de pares na execução de 50 pontos (média de 38.2), à frente de CoCounsel, Legora e LexisNexis +AI — mas todas ficam atrás dos melhores modelos de fronteira em bruto na resposta isolada.
- Melhor para MENA, árabe e civil law: a HAQQ (Justinian) ocupa o primeiro lugar na tabela classificativa de plataformas (47.5/50), com árabe nativo e mais de 80 jurisdições; verifique-a face ao campo em /compare-us.
A conclusão mais profunda sobrevive a qualquer reorganização da tabela: nenhum modelo vence em todas as áreas de prática, 24% das respostas de fronteira citam lei que não as sustenta, e a posição na tabela classificativa é a parte mais pequena de um produto jurídico real. O encaminhamento, a verificação de citações e a governação jurisdicional são onde um número num gráfico se transforma numa resposta em que pode apor o seu nome.
Ao agregar os modelos pela marca do fornecedor e combinar esta execução com todas as execuções anteriores do mesmo benchmark comercial (índice de 0–100, ponderado pelo número de avaliações):
O topo é um agrupamento, não uma coroação. Qual fornecedor escolher importa menos do que aquilo que constrói à volta dele.
Uma nota sobre a integridade do benchmark
A nossa primeira execução limitava as respostas a 1,200 tokens. Isso viciava discretamente o resultado: os modelos de raciocínio gastavam o orçamento a "pensar" e devolviam respostas vazias, enquanto os modelos mais extensos eram cortados a meio da frase e o avaliador penalizava-os. Detetámos o problema, descartámos a execução e repetimo-la de forma uniforme com 6,000 tokens. A maioria dos modelos ganhou entre 1.5 e 2.5 pontos — mas o Mistral e o Llama pioraram com mais espaço, porque a extensão adicional expôs mais citações incorretas. Os limites de resposta são um enviesamento invisível em muitas tabelas classificativas públicas. A nossa está em aberto para que veja exatamente onde se situou.
O que 3,000 respostas avaliadas realmente provam
A camada de raciocínio está largamente resolvida. Os modelos de fronteira identificam problemas, estruturam análises e redigem como um associado competente. O que ainda não conseguem fazer é ser confiáveis: citar de forma verificável, recusar perguntas fora da sua jurisdição, ressalvar de forma adequada e acertar da mesma forma duas vezes.
Essa lacuna não se fecha com um modelo maior. Fecha-se com uma camada por cima:
- Encaminhamento — enviar cada processo para o motor com maior probabilidade de acertar.
- Verificação de citações — nenhuma referência não verificável chega ao cliente.
- Governação jurisdicional — a resposta para a jurisdição errada é impedida na origem, não filtrada depois.
Essa camada é o produto. O modelo não é o fosso competitivo. O verificador é. É isso que construímos na HAQQ.
Ressalvas — porque um benchmark que não se pode verificar é marketing
- Execução única, temperatura 0. Trate as posições como mais fiáveis do que as casas decimais; leia Opus e Grok como colíderes, não como um final por fotografia.
- O avaliador é um modelo Claude (Sonnet 4.6). Uma questão justa de autopreferência — exceto que um modelo não-Claude (Grok) empata no topo e o GPT-5.5 regista a maior precisão, pelo que claramente não está a avaliar em terreno familiar. Uma segunda reavaliação com outro modelo é o próximo passo de robustez.
- O índice por fornecedor combina grelhas de diferentes execuções e é indicativo.
- Cada prompt, cada resposta em bruto e o código de avaliação estão publicados. Reproduza-o e verifique-nos.
Principais conclusões
- O Claude Opus 4.8 é o modelo isolado mais forte para trabalho jurídico comercial; o GPT-5.5 é o mais preciso; o Grok 4.3 é a melhor relação qualidade-preço.
- 24% das respostas jurídicas de modelos de fronteira citam lei que não as sustenta — o teto não é seguro, não apenas o piso.
- Nenhum modelo vence em todas as áreas de prática; o encaminhamento vence apostar tudo num só.
- O custo e a latência variam 90× e 17× — o "vencedor" baseado apenas na qualidade pode ser a escolha de negócio errada.
- A camada defensável é encaminhamento + verificação de citações + governação jurisdicional, não o modelo base.
Terceira parte da série de benchmarks da HAQQ, juntamente com o nosso benchmark de perguntas jurídicas de consumidores e o benchmark HAQQ-LAB de civil law. Tem curiosidade em saber como a HAQQ transforma estas conclusões num produto que os advogados podem assinar? Veja o motor Justinian.



