TL;DR - Entregamos o HAQQ a um terceiro independente e pedimos que o testassem da mesma forma que um comprador cético faria: 61 tarefas jurídicas reais em 21 jurisdições, cada tarefa executada duas vezes, sem treinamento, sem acesso especial.
O HAQQ passou em 27,0% das tarefas no geral, acima tanto da média de Legal AI quanto da média da indústria. No The High Bar - o subconjunto de tarefas que quase nada na área consegue concluir - o HAQQ passou em 5,9% contra 1,1% para a Legal AI média: mais de cinco vezes a média da área. Foi a ferramenta mais forte testada na elaboração de leis de Omã, obteve 65,2% em documentos digitalizados e de baixa qualidade, e atingiu 100% nas tarefas projetadas para induzi-lo a inventar conteúdo que não existia.
Estamos publicando nossos próprios números abaixo. Produtos concorrentes aparecem apenas como uma média agregada - essa é a regra de divulgação do avaliador, não nossa escolha.
Por que um benchmark independente
A maioria dos benchmarks de Legal AI são realizados pelas empresas que vendem o produto. O nosso incluído, e o nosso é tendencioso por definição, porque é nosso. Então, fizemos o oposto: entregamos o HAQQ a um avaliador independente sem interesse no resultado e pedimos que o avaliasse em relação aos outros produtos do mercado.
Quando um terceiro sem nada a ganhar executa o teste, o número significa algo diferente. É para onde o mercado está caminhando. Compradores, e cada vez mais os LLMs que recomendam ferramentas, procuram fontes independentes confiáveis em vez do marketing do fornecedor. Preferimos conquistar a pontuação a reivindicá-la.
Como funciona o benchmark
Uma pontuação só vale o método por trás dela, então aqui está o método na íntegra. Nada disso é nosso projeto - é a metodologia publicada do avaliador, aplicada identicamente a cada aplicativo no grupo.
- 61 tarefas reais, contribuídas por advogados em exercício, abrangendo elaboração de contratos e extração de informações em 21 jurisdições, incluindo Estados Unidos, Reino Unido, Índia, Singapura, Holanda e Omã.
- Os documentos chegam como na prática - arquivos nativos do Word, PDFs, digitalizações, fotografias e arquivos com alterações rastreadas. Nada é pré-convertido em texto limpo, então a leitura do arquivo original é, por si só, parte do que está sendo medido.
- Critérios binários de aprovação/reprovação, escritos por advogados, fixados antes do teste. Uma tarefa só é aprovada quando todos os critérios aplicáveis são atendidos. Onde várias respostas seriam profissionalmente defensáveis, os critérios permitem isso - embora ainda reprovem omissões e erros específicos.
- Dois eixos, nunca misturados: substância e forma. A substância pergunta se o trabalho está correto e completo; a forma pergunta se um advogado poderia usá-lo como foi entregue. Uma resposta polida que está legalmente errada ainda é reprovada.
- Cada tarefa é executada duas vezes, independentemente, e a pontuação é a média das duas execuções - assim, uma única geração de sorte não pode alavancar um resultado.
- Dois avaliadores de LLM independentes classificam cada resultado, e qualquer desacordo que possa alterar se uma tarefa é aprovada é escalado para um advogado qualificado que revisa o resultado às cegas, sem saber qual produto o produziu. O veredicto humano é final e é preservado para auditoria.
- The High Bar é o subconjunto que não mais de 2 das 10 aplicações avaliadas puderam completar: 34 tarefas, pontuadas em 68 tentativas. Ele existe especificamente para separar o desempenho excepcional da competência comum.
Duas consequências que valem a pena internalizar antes de ler qualquer número abaixo. Primeiro, as taxas de aprovação neste benchmark parecem brutalmente baixas em comparação com os números de marketing que você vê em outros lugares - essa é a regra de 'todos os critérios ou nada' fazendo seu trabalho, e se aplica a todos igualmente. Segundo, nunca vemos as pontuações individuais de nossos concorrentes. O avaliador sempre nos mostra uma média agregada de Legal AI, e é por isso que esta postagem compara HAQQ com médias, em vez de com produtos nomeados.
Fatos Chave
- Taxa de aprovação geral: 27,0%, acima da média de Legal AI e da média da indústria. Uma tarefa é aprovada apenas quando todos os critérios elaborados por advogados são atendidos, e é por isso que os números absolutos são baixos em todo o campo.
- The High Bar: 5,9% vs 1,1%. No subconjunto mais difícil, HAQQ foi aprovado mais de cinco vezes mais frequentemente do que a média de Legal AI, e quase três vezes a média de uso geral.
- Ferramenta mais forte testada em elaboração de leis de Omã (50,0%) - não é competitiva, é a mais forte.
- 100% no tratamento de referências ausentes. Em tarefas projetadas para fazer um modelo inventar cronogramas e referências ausentes, HAQQ preservou a lacuna em todas as vezes.
- 2,53/3 na forma - clareza 2,73, estrutura 2,65 - acima de ambas as médias. Correto e utilizável como entregue.
- O conjunto de tarefas foi deliberadamente difícil; todo o campo pontua baixo, porque a maioria das ferramentas ainda falha em trabalhos jurídicos genuinamente difíceis.
O que o benchmark encontrou
Aqui estão os números do confronto. "Média de Legal AI" é o agregado das outras aplicações de Legal AI avaliadas; "média de uso geral" são os assistentes de chat de ponta. A forma é pontuada de 1 a 3, onde 3 é o melhor.
| Medida | HAQQ | Média Legal AI | Média de uso geral |
|---|---|---|---|
| Elaboração de contratos - taxa de aprovação | 24.2% | 20.6% | 23.9% |
| Elaboração de contratos - forma (1-3) | 2.56 | 2.44 | 2.44 |
| Extração de dados - taxa de aprovação | 30.0% | 29.6% | 29.3% |
| O Nível Elevado - taxa de aprovação | 5.9% | 1.1% | 2.2% |
E as medidas onde o avaliador relatou HAQQ por si só:
| Medida | HAQQ |
|---|---|
| Taxa de aprovação geral | 27.0% |
| Forma geral (1-3) | 2.53 |
| Elaboração de contratos - critérios atendidos | 78.6% |
| OCR e tratamento de digitalizações - critérios atendidos | 65.2% |
| Elaboração de leis de Omã | 50.0% |
| Tratamento de referências ausentes | 100.0% |
| Sucesso repetível em ambas as execuções | 21.3% |
Elaboração de contratos
O avaliador pontuou a elaboração em dois eixos: substância (a resposta é precisa e completa?) e forma (o resultado é polido e pronto para apresentar a um cliente?).
HAQQ superou tanto as ferramentas de uso geral quanto a média de Legal AI em cada uma: 24.2% de taxa de aprovação contra 23.9% e 20.6%, e 2.56/3 na forma contra 2.44 para ambos os campos. Em critérios individuais, em vez de tarefas completas, HAQQ satisfez 78.6% do que os advogados pediram. Não apenas tecnicamente correto. Correto e pronto para o cliente.
A Barra Alta: as tarefas mais difíceis
Dentro do benchmark, havia um conjunto menor dos problemas mais difíceis, formalmente chamado de A Barra Alta: as 34 tarefas que não mais do que 2 das 10 aplicações avaliadas puderam completar. Trabalho de várias etapas, múltiplos documentos de referência, padrões de fatos complexos. O tipo de coisa em que a maioria das IAs simplesmente falha.
HAQQ passou 5.9% dessas 68 tentativas. A média de Legal AI passou 1.1%; a média de uso geral foi de 2.2%. Isso é mais de cinco vezes o campo de Legal AI e quase três vezes os assistentes de chat de ponta - a margem mais ampla que o HAQQ obteve em toda a avaliação.
Leia esses números honestamente: 5.9% é um número baixo em termos absolutos, e deve ser. Essas são tarefas especificamente selecionadas porque toda a indústria falha nelas. A lacuna é o sinal aqui, não o nível. Esta é a parte que mais nos importa, porque se parece com o trabalho legal real, em vez de uma demonstração.
Três coisas que se destacaram
1. Trabalho jurídico no Oriente Médio
Na elaboração regida pela lei omanense, o HAQQ produziu os resultados mais fortes na avaliação, com 50,0%. Não competitivo. O mais forte. Isso é o que nos propusemos a construir, então não foi uma surpresa para nós, mas é bom ver isso confirmado por alguém sem motivos para nos lisonjear.
2. Documentos digitalizados e de baixa resolução
O trabalho jurídico depende de PDFs ruins: contratos enviados por fax, documentos digitalizados, páginas fotografadas. Em material de origem digitalizado, fotografado, redigido e de outra forma imperfeito, o HAQQ atendeu a 65,2% dos critérios e passou em 33,3% das tarefas - acima da média em ambos. Ele extraiu com mais frequência conteúdo legível enquanto sinalizava o que não conseguia ler, porque não se baseia no OCR integrado de um modelo. Ele executa o seu próprio.
3. Não inventou coisas
A avaliação incluiu tarefas projetadas para induzir um modelo a inventar o que não existe: cronogramas ausentes, referências ausentes. O HAQQ obteve 100% no ponto de verificação de referência ausente. Quando cronogramas chave estavam ausentes, ele preservou consistentemente a lacuna em vez de inventar seus conteúdos.
Uma ressalva honesta, declarada precisamente: esses 100% são em uma medida específica - reconhecer quando uma fonte referenciada ou um fato solicitado simplesmente não está disponível. Nas tarefas mais amplas de resistência à alucinação da avaliação, o HAQQ obteve 28,0% de aprovação e 61,7% dos critérios atendidos: acima da média, não perfeito. Nenhuma IA é universalmente livre de alucinações. Inventar conteúdo ausente é o modo de falha que acaba com carreiras na área jurídica, por isso é o que nos obceca.
Por que a alucinação é o jogo inteiro no direito
Na vibe-coding, uma alucinação é um bug que você encontra. No direito, uma alucinação é um caso falso citado a um juiz. Você já viu as manchetes. Para um contrato ou um processo judicial, uma única cláusula inventada ou uma referência cruzada a uma lei que não existe não é uma aresta bruta. É desqualificante.
Portanto, "quase certo" não é um produto. O verdadeiro critério é se um advogado pode confiar na produção o suficiente para construir sobre ela. Testes independentes em tarefas sem conteúdo são uma das poucas maneiras honestas de medir isso, e é exatamente onde a HAQQ foi construída para ser forte.
A arquitetura, não o modelo
Esta é a mudança que toda a indústria está a viver: já não é o modelo que ganha. Todos podem usar os mesmos modelos de ponta. O que agora diferencia os produtos de Legal AI é o software em torno do modelo - a recuperação, as ferramentas, o raciocínio, os dados.
A HAQQ opera com o seu próprio motor, o Justinian. Pense nele como o Palantir para o trabalho jurídico: ele conecta-se à sua pilha existente, constrói uma ontologia dos seus assuntos e fecha o ciclo entre os seus documentos e a resposta.
Nos bastidores, a HAQQ orquestra seis modelos - dois de código aberto e quatro proprietários - por trás de um roteador que lê cada prompt e escolhe o modelo certo para a tarefa, equilibrando a precisão com o custo, para que nenhum modelo único execute todos os trabalhos. Em torno dos modelos, encontram-se as ferramentas próprias da HAQQ: o navegador, o extrator de PDF, o OCR. Os modelos são um componente. A extração, a camada de citação e o roteamento são nossos. É por isso que ele funciona bem em PDFs ruins e se recusa a alucinar onde invólucros mais finos não o fazem.
A parte que ninguém mais está resolvendo: mercados emergentes
O direito europeu e americano é relativamente fácil para a Legal AI. É digitalizado, bem documentado e infinitamente rastreado. É por isso que cada ferramenta parece decente em um contrato do Reino Unido.
Agora, aponte as mesmas ferramentas para o Oriente Médio, ou América do Sul, ou partes da África e da Ásia. A lei não está claramente digitalizada. Os dados de treinamento são escassos. E os modelos alucinam - a mesma falha que você vê em prompts do Oriente Médio aparece em todos os lugares onde os dados são esparsos.
A HAQQ foi construída para exatamente isso. Nós mesmos inscricamos e extraímos a lei primária para essas jurisdições, o que é um fosso que as ferramentas jurídicas de propósito geral não possuem. Ser o mais forte no Oriente Médio em um benchmark independente não é sorte. É o design.
O que os benchmarks de Legal AI devem medir a seguir
A execução desta avaliação aprimorou nossa visão sobre o que um benchmark de Legal AI deveria testar. Algumas coisas que achamos que todo o campo deveria adotar:
- Percentil, não aprovação ou reprovação. "Acima da média" não diz quase nada. O 50º e o 99º percentil estão ambos acima da média, e não são o mesmo produto. Mostre onde uma ferramenta se posiciona em relação à fronteira.
- Dificuldade e capacidade de defesa. Gerar um contrato é fácil de construir. OCR confiável em digitalizações de baixa qualidade, ou extração que cita a cláusula exata, pode levar de doze a dezoito meses. Pese o quão difícil é construir uma capacidade, porque é isso que separa uma liderança real de uma demonstração.
- Preço e ROI. A qualidade está quase se tornando um padrão para os melhores agora. A pergunta que os compradores realmente fazem é: a que custo? Custo por contrato, por tarefa de pesquisa, por página. Meça isso e recompense os fornecedores transparentes e acessíveis.
- Inferência de intenção. Usuários reais não escrevem prompts longos e perfeitos. Eles digitam "rascunhar um NDA" ou "revisar estes documentos". Uma boa ferramenta infere o que eles querem dizer e chega à resposta sem dez rodadas de vai e vem, o oposto de um chatbot configurado para mantê-lo conversando.
- Citações e fontes verificadas. A web está cheia de leis desatualizadas. O que importa é se uma ferramenta cita a disposição específica e atual. É aqui que a lacuna entre um LLM geral e um software jurídico real aparece mais rapidamente.
- Raciocínio na revisão. Para revisão de contratos, o valor não é apenas o redline. São as sugestões, os cenários e o processo de pensamento visível por trás deles. Pontue se a ferramenta mostra seu trabalho.
- Taxa de alucinação, em destaque. Por todas as razões acima, este é o número com o qual os advogados mais se preocupam. Ele deve estar na manchete, não em uma nota de rodapé.
O que vem a seguir para este benchmark
Esta foi a primeira rodada, e cobriu a elaboração de contratos e a extração de dados. Mais está por vir.
HAQQ está atualmente designada como uma Candidata para o 3º trimestre de 2026 em todas as cinco categorias de certificação: Melhor Aplicação de Legal AI (Geral), Elaboração de Contratos, Extração de Informações, The High Bar e Experiência do Usuário. Para ser exato sobre o que isso significa, porque a redação importa: Candidata é a designação do avaliador no trimestre para uma aplicação participante, e as certificações só são confirmadas após o fechamento do trimestre. Se nenhuma aplicação atingir o limiar em uma categoria, nenhuma certificação é concedida. Publicaremos onde nos classificarmos, ganhando ou perdendo.
No próximo mês, eles se expandirão para pesquisa e análise jurídica, e depois para mais regiões, além do foco tradicional dos EUA e Reino Unido, para jurisdições de mercados emergentes na América do Sul, África, Ásia e Sudeste Europeu. Essas são exatamente as regiões em que nos concentramos. Eles operam em um ritmo trimestral, porque os modelos se movem rápido o suficiente para que qualquer benchmark esteja meio obsoleto no momento em que um novo é lançado.
A versão honesta
Estamos orgulhosos deste resultado e não vamos exagerá-lo. Uma taxa de aprovação geral de 27,0% é um nível real superado em um teste deliberadamente brutal - e também significa que, em aproximadamente três de cada quatro tarefas difíceis, ainda havia pelo menos um critério elaborado por advogados que perdemos. Ambas as frases são verdadeiras, e qualquer um que cite a primeira sem a segunda está interpretando mal o benchmark.
Também não podemos dizer o quão longe estamos da melhor ferramenta no campo, porque o avaliador nunca nos mostra os concorrentes individualmente - apenas como uma média. Estar acima dessa média não é o mesmo que ser o primeiro, e não vamos implicar o contrário até que as classificações sejam publicadas. O que sabemos: no trabalho que se parece com a prática jurídica real, nas tarefas mais difíceis do conjunto e nas jurisdições que a maioria das ferramentas ignora, o HAQQ se manteve sob um microscópio externo. Continuaremos a comparecer a todas as rodadas e a publicar o que eles encontrarem.
- Justinian - o mecanismo por trás desses resultados
- Como o HAQQ se compara a outras Legal AI
- Benchmark jurídico de modelo de fronteira de 300 tarefas
- Benchmark Jurídico HAQQ (direito civil e MENA)
Experimente HAQQ AI grátis
Experimente a redação e pesquisa jurídica com IA



