TL;DR — Avaliámos 19 ferramentas de IA jurídica e modelos de fronteira na mesma grelha de 50 pontos em 11 categorias de tarefas. A HAQQ ocupa o #1 (média de 47.5/50). Construímos a HAQQ e construímos o benchmark, por isso trate esta classificação com desconfiança. A diferença entre esta lista e todas as outras listas de "melhores ferramentas de IA jurídica": todas as pontuações, todas as categorias e os prompts de teste estão publicados, para que nos possa verificar.
Procure "best legal AI tools 2026" e leia os dez primeiros resultados. Quase todos são escritos por um fornecedor, e quase todos colocam esse fornecedor em primeiro lugar. Sem pontuações, sem grelha de avaliação, sem forma de verificar seja o que for. Apenas adjetivos organizados de forma lisonjeira.
Esta lista comete o mesmo pecado. A HAQQ é #1, e foi a HAQQ que a escreveu. A diferença é que esta classificação vem de um benchmark com números publicados: 19 ferramentas, 11 categorias de tarefas, uma grelha de 50 pontos, pontuações que pode inspecionar na nossa página de comparação e prompts que pode reexecutar a partir da nossa biblioteca de prompts. Desconfie de nós e depois verifique.
Factos principais: ferramentas de IA jurídica em 2026
- 19 ferramentas testadas na mesma grelha de 50 pontos em 11 categorias de tarefas jurídicas; todas as pontuações publicadas.
- A HAQQ pontua 47.5/50 em média e 49/50 no teste principal de 10 dimensões, a pontuação mais alta dos 19 modelos testados.
- O Claude puro (Fable 5, 44.0/50) supera quase todos os produtos de IA jurídica dedicados, incluindo Harvey (38.2), CoCounsel (36.2), Legora (34.5) e Lexis+ AI (33.2).
- O Mike OS, uma plataforma gratuita e de código aberto, empata com o patamar dos $11B: 41.8/50, à frente da Harvey.
- Nenhuma ferramenta é segura sem verificação: no nosso benchmark separado de 300 tarefas de fronteira, 24% das 3,000 respostas avaliadas citaram ou aplicaram lei que não sustentava a afirmação.
Quem escreveu esta classificação (leia isto antes da lista)
A HAQQ Research realizou este benchmark, e a HAQQ fica em primeiro lugar. Isso é um conflito de interesses, sem rodeios. Não vamos fingir o contrário, porque fingir é o que o resto da categoria faz.
Eis o que fazemos em vez disso. A matriz completa de pontuações para as 19 ferramentas nas 11 categorias está publicada em haqq.ai/compare-us. Os prompts de teste vêm da nossa biblioteca de prompts pública. A grelha principal avalia dez dimensões nomeadas: tratamento da Sharia, citação de estatutos, foro e jurisdição, qualidade de cláusulas, identificação de risco, alucinação, formatação, brevidade, prontidão para sócios e ligação a fontes. É um teste interno, divulgado como teste interno. Se uma lista de fornecedor que está a ler não lhe dá pelo menos isto, pergunte-se porquê.
Mais uma divulgação: a grelha pondera fortemente a disciplina jurisdicional e a ligação a fontes, porque é isso que o trabalho dos nossos clientes exige. Um benchmark parece sempre com o seu autor. O nosso foi construído para trabalho comercial multijurisdicional, com inclinação MENA, que é também aquilo para que a HAQQ foi construída. A vantagem de jogar em casa é estrutural. É exatamente por isso que os números são públicos.
Como classificámos as melhores ferramentas de IA jurídica
Cada ferramenta executou as mesmas tarefas em 11 categorias: uma avaliação genérica de 10 dimensões, redação de contratos, investigação jurídica, explicação do direito e sete tipos de documentos (contrato de trabalho, parecer profissional, contrato de licenciamento, acordo de acionistas, contrato de consultoria, contrato comercial, NDA). Cada categoria é pontuada em 50. A classificação abaixo ordena pela média nas 11 categorias.
Este é o quarto artigo da nossa série de benchmarks, depois de 300 tarefas comerciais em 10 modelos de fronteira, do HAQQ-LAB, o primeiro benchmark público de agentes em civil law, e de 100 perguntas jurídicas reais de consumidores. A mesma regra da casa em todos: um benchmark que não se pode verificar é marketing.
A classificação: as melhores ferramentas de IA jurídica em 2026
| Posição | Ferramenta | O que é | Média /50 | Categoria mais forte |
|---|---|---|---|---|
| 1 | HAQQ (Justinian) ★ | Plataforma de IA jurídica, MENA + transfronteiriço | 47.5 | Genérico + NDA (49) |
| 2 | Claude Fable 5 | Modelo de fronteira (Anthropic) | 44.0 | Genérico + NDA (45) |
| 3 | Claude Opus 4.7 | Modelo de fronteira (Anthropic) | 42.1 | Investigação, parecer, NDA (43) |
| 4 | Mike OS | Plataforma jurídica de código aberto (gratuita) | 41.8 | Genérico (44) |
| 5= | DeepSeek v4 Pro | Modelo de fronteira | 38.2 | Genérico (41) |
| 5= | Harvey | IA jurídica empresarial (avaliação de $11B) | 38.2 | Laboral, acionistas, NDA (40) |
| 7 | CoCounsel | Assistente jurídico da Thomson Reuters | 36.2 | Parecer profissional (39) |
| 8 | Claude + plugins jurídicos | Modelo de fronteira + camada de plugins jurídicos | 35.4 | Genérico (37) |
| 9 | Legora | Espaço de trabalho de IA jurídica (avaliação de $5.6B) | 34.5 | NDA (37) |
| 10 | ChatGPT 5.5 | Modelo de fronteira (OpenAI) | 34.4 | Explicação do direito (42) |
| 11 | LexisNexis +AI | Incumbente de investigação | 33.2 | Investigação jurídica (41) |
| 12 | Grok 4.3 | Modelo de fronteira (xAI) | 31.4 | Explicação do direito (35) |
| 13 | Gemini 3.1 Pro | Modelo de fronteira (Google) | 31.1 | Explicação do direito (39) |
| 14 | Spellbook | Suplemento do Word para redação de contratos | 29.0 | Redação de contratos + NDA (34) |
| 15 | Perplexity Sonar | Assistente baseado em pesquisa | 26.5 | Investigação jurídica (38) |
| 16 | Clio Duo | Complemento de IA para gestão de escritório | 25.2 | NDA (27) |
| 17 | Meta Llama 4 | Modelo de pesos abertos | 23.1 | Explicação do direito (26) |
| 18 | Mistral 3 | Modelo de fronteira | 21.2 | Explicação do direito (24) |
| 19 | Qwen 3 Plus | Modelo de fronteira | 17.1 | Explicação do direito (19) |
#1 HAQQ — 47.5/50, e a entrada em que deve confiar menos
A HAQQ lidera em todas as 11 categorias, atingindo o pico de 49/50 tanto no teste genérico de 10 dimensões como na redação de NDA. A leitura honesta: este é o nosso benchmark, ponderado para o trabalho para o qual a HAQQ foi construída. Processos multijurisdicionais, citação ao nível do estatuto, árabe e inglês, sistemas de civil law que a maioria das ferramentas trata como um pormenor secundário. Se o seu trabalho for uma dieta exclusiva de jurisprudência norte-americana de Delaware, a diferença entre a HAQQ e o campo será mais estreita do que esta tabela sugere. Se o seu trabalho atravessa fronteiras, não será.
Para que serve: trabalho jurídico de ponta a ponta onde a jurisdição importa. Redação, investigação, revisão e contexto de processos, com fontes em que pode clicar. O motor por trás é o Justinian, que encaminha cada tarefa para o melhor modelo de fronteira e verifica o resultado em vez de confiar num único modelo. Essa escolha de arquitetura resulta diretamente da conclusão do benchmark abaixo.
#2 e #3: o Claude puro supera quase todos os produtos de IA jurídica
Esta é a conclusão que as outras listas não vão publicar. Uma janela de chat do Claude em bruto, sem qualquer produto jurídico à volta, pontua 44.0 (Fable 5) e 42.1 (Opus 4.7). Isso está à frente de Harvey, CoCounsel, Legora, Lexis+ AI e Spellbook. A maior parte da categoria de IA jurídica vende um invólucro que pontua abaixo do modelo que envolve.
Escrevemos sobre porque isto acontece em o Claude não matou a legal tech: os produtos acrescentam fluxo de trabalho, permissões e camadas de dados, e muitos deles penalizam discretamente o raciocínio do modelo subjacente ao fazê-lo. O invólucro tem de acrescentar verificação ou governação jurisdicional para justificar o seu preço. A maioria acrescenta apenas uma interface.
Para que serve o Claude puro: análise, primeiras minutas, explicação do direito, raciocínio sobre documentos longos. Para que não serve: um sistema de registo, um verificador de citações ou uma ferramenta que saiba qual a jurisdição que rege o seu processo. Curiosamente, o Claude com plugins jurídicos pontuou 35.4, abaixo do Claude puro, no nosso teste. Mais peças móveis não significa mais precisão.
#4 Mike OS — a gratuita que envergonha os unicórnios
O Mike OS tem uma média de 41.8/50. Isso está à frente da Harvey, que angariou $200M numa avaliação de $11B em março de 2026. O Mike é gratuito. É uma plataforma jurídica de código aberto que aloja você mesmo com a sua própria chave de API, construída pelo ex-associado da Latham & Watkins William Chen, que afirma atingir paridade com a Harvey e a Legora, segundo a Legal IT Insider e a Artificial Lawyer (maio de 2026).
Cobrimos o momento Mike quando chegou ao topo do Hacker News no nosso panorama do software jurídico de código aberto. O código é rudimentar e jovem, e autoalojar é trabalho real que o seu escritório tem de assumir. Mas, em qualidade de resultado, o benchmark diz o que diz: a diferença entre gratuito e aberto e centenas de dólares por utilizador é menor do que as faturas sugerem.
#5 a #11: as plataformas jurídicas empresariais
A Harvey (38.2) é a escolha padrão da BigLaw, empatada com a DeepSeek v4 Pro na nossa pontuação. Os seus melhores resultados são na redação de documentos (40/50 em trabalho laboral, acionistas e NDA). Foi construída para aquisição empresarial: revisão de segurança, implementação em toda a organização, logótipos de prestígio. Se a estiver a avaliar, escrevemos um guia dedicado de análise e alternativas à Harvey.
O CoCounsel (36.2) é a aposta da Thomson Reuters, e o seu fosso competitivo são os dados: assenta sobre um século de jurisprudência da Westlaw, com cerca de um milhão de utilizadores e preços que já reportámos entre $220 e $500 por utilizador por mês. Melhor categoria aqui: pareceres profissionais (39). Se a sua prática vive dentro da jurisprudência norte-americana e já paga pela Westlaw, é a escolha de menor atrito desta lista.
A Legora (34.5) ultrapassou $100M ARR e uma avaliação de $5.6B em abril de 2026. É uma aposta em espaço de trabalho colaborativo, mais forte no nosso teste em NDAs (37). O ChatGPT 5.5 (34.4) regista a melhor pontuação isolada em explicação do direito de qualquer ferramenta não-HAQQ (42), o que corresponde à forma como a maioria dos advogados o usa de facto: compreensão, não redação. O Lexis+ AI (33.2) é irregular da forma esperada: 41/50 em investigação jurídica, a melhor pontuação de investigação não-fronteira do campo, e medíocre na redação.
Experimente HAQQ AI grátis
Experimente a redação e pesquisa jurídica com IA
#12 a #16: especialistas com um bom truque
O Spellbook (29.0) é um suplemento do Word para redação de contratos de PME, e as pontuações mostram exatamente essa forma: 34 em redação de contratos e NDAs, 25 no teste genérico. Se a marcação de contratos dentro do Word for o seu único caso de uso, esta posição subestima a sua utilidade. O Perplexity Sonar (26.5) tem o mesmo pico: 38 em investigação jurídica, fraco em tudo o resto. O Clio Duo (25.2) é um complemento de IA a uma suite de gestão de escritório com 150,000 utilizadores; compre o Clio pela gestão de escritório, não pelo Duo.
O Grok 4.3 (31.4) merece uma nota de honestidade. No nosso benchmark separado de 300 tarefas de fronteira, foi a melhor relação qualidade-preço de todo o campo, e liderou o CaseLaw v2 da Vals AI (79.31%) em maio de 2026. Aqui ocupa o décimo segundo lugar. O mesmo modelo, três grelhas, três veredictos. Isso não é uma contradição, é exatamente o ponto: um benchmark mede a sua própria grelha, o nosso incluído.
#17 a #19: não use estas ferramentas para trabalho jurídico
O Meta Llama 4 (23.1), o Mistral 3 (21.2) e o Qwen 3 Plus (17.1) ocupam o fundo da tabela. Isto corresponde à nossa execução de 300 tarefas, onde o Mistral Large alucinou ou aplicou mal citações em 64% das suas respostas. São modelos gerais competentes. Para o trabalho jurídico, onde uma citação errada e confiante é uma responsabilidade profissional, ainda não estão na conversa.
O que as pontuações não lhe dizem
- Este é um teste interno realizado pelo fornecedor. Divulgado, publicado, verificável, mas realizado pelo fornecedor. Pondere-o em conformidade, e atribua peso zero a listas de fornecedores não divulgadas.
- A grelha tem uma visão do mundo. O tratamento jurisdicional, o conhecimento da Sharia e a ligação a fontes são dimensões pontuadas. Ferramentas construídas apenas para o trabalho EUA/Reino Unido perdem pontos em testes para os quais os seus criadores nunca visaram.
- As classificações mudam. A Harvey, a Legora e os laboratórios de fronteira lançam atualizações constantemente. Trate os patamares como mais fiáveis do que posições isoladas, e os empates (DeepSeek e Harvey em 38.2) exatamente como isso.
- Uma pontuação composta esconde picos. O Lexis+ AI em #11 continua a ser a ferramenta de investigação a bater. O Spellbook em #14 continua a ser a escolha de redação nativa do Word. Faça corresponder o pico à sua carga de trabalho.
O número que importa mais do que qualquer classificação
No nosso benchmark de 300 tarefas de fronteira, 24% das 3,000 respostas avaliadas citaram ou aplicaram lei que não corresponde ao que o modelo afirmava. Todos os modelos, incluindo os líderes, fabricaram ou aplicaram mal pelo menos uma citação. Os incumbentes também não são imunes: testes independentes situam o Westlaw AI-Assisted Research numa taxa de erro de aproximadamente um em três, e o Lexis+ AI acima de um em seis, e uma base de dados pública já registou mais de 1,400 processos judiciais envolvendo citações fabricadas por IA, como reportámos no artigo do HAQQ-LAB.
Seja qual for a ferramenta que escolher desta lista, escolha primeiro o seu processo de verificação. A classificação diz-lhe qual a ferramenta que falha menos. Nenhuma delas nunca falha.
Como escolher a melhor ferramenta de IA para o seu trabalho jurídico
- Trabalho transfronteiriço, MENA ou em língua árabe: HAQQ. Esta é a faixa que o benchmark recompensa porque é a faixa para a qual construímos.
- Raciocínio geral, minutas e explicação com orçamento reduzido: Claude puro. Supera a maioria dos produtos jurídicos pagos na resposta em bruto.
- Investigação nos EUA com citadores: Lexis+ AI ou CoCounsel, especialmente se já pagar pela base de dados subjacente.
- Marcação de contratos dentro do Word: Spellbook.
- Requisitos de aquisição da BigLaw: Harvey ou Legora, e compare-as com esta tabela durante o piloto.
- Orçamento zero, equipa técnica: Mike OS, autoalojado com a sua própria chave de API.
Principais conclusões
- Todas as listas de "melhores ferramentas de IA jurídica" são escritas por fornecedores. Exija pontuações publicadas. Esta tem-nas; a maioria não.
- A HAQQ lidera com 47.5/50, com a ressalva divulgada de que é o nosso benchmark, ajustado para trabalho multijurisdicional.
- Os modelos de fronteira em bruto superam a maioria dos produtos jurídicos. Se um invólucro não acrescenta verificação ou governação, está a subtrair valor.
- O gratuito é competitivo: o Mike OS, de código aberto, superou o líder de mercado avaliado em $11B.
- Nenhuma ferramenta é segura sem verificação: 24% das respostas de fronteira citaram lei que não as sustentava. Compre um processo de verificação, não um logótipo.
- Pontuações do benchmark em direto para as 19 ferramentas (página de comparação da HAQQ)
- Melhor IA para o trabalho jurídico: 300 tarefas, 10 modelos de fronteira, 3,000 respostas avaliadas
- HAQQ-LAB: o benchmark de IA jurídica em civil law
- Testámos a IA em 100 perguntas jurídicas reais
- Análise da Harvey AI e alternativas
- Software jurídico de código aberto em 2026 (o momento Mike)
- Mike — plataforma de IA jurídica de código aberto
- Mike OSS: ferramenta de IA jurídica de código aberto "muda a negociação" (Legal IT Insider, maio de 2026)
- Mike, a Plataforma de IA Jurídica de Código Aberto — entrevista com Will Chen (Artificial Lawyer, maio de 2026)
- Legora atinge avaliação de $5.6B (TechCrunch, abril de 2026)
Quer verificar a classificação em vez de confiar nela? Todas as pontuações por categoria estão em direto na página de benchmark da HAQQ, e os prompts de teste estão na biblioteca de prompts. Execute-os na sua própria stack. Se encontrar uma ferramenta que nos supere nos seus processos, use-a. É para isso que serve um benchmark.



