Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. Benchmark de IA jurídica 2026: o desempenho da HAQQ numa avaliação independente
    Voltar ao BlogIA & Tech Jurídica

    Benchmark de IA jurídica 2026: o desempenho da HAQQ numa avaliação independente

    Um avaliador independente testou a HAQQ em tarefas jurídicas difíceis. Superou as médias da IA jurídica e do setor, liderou no direito do Médio Oriente e não alucinou.

    July 23, 2026
    12 min de leitura
    |
    HAQQ Research
    Benchmark de IA jurídica 2026: o desempenho da HAQQ numa avaliação independente

    TL;DR - Entregamos o HAQQ a um terceiro independente e pedimos que o testassem da mesma forma que um comprador cético faria: 61 tarefas jurídicas reais em 21 jurisdições, cada tarefa executada duas vezes, sem treinamento, sem acesso especial.

    O HAQQ passou em 27,0% das tarefas no geral, acima tanto da média de Legal AI quanto da média da indústria. No The High Bar - o subconjunto de tarefas que quase nada na área consegue concluir - o HAQQ passou em 5,9% contra 1,1% para a Legal AI média: mais de cinco vezes a média da área. Foi a ferramenta mais forte testada na elaboração de leis de Omã, obteve 65,2% em documentos digitalizados e de baixa qualidade, e atingiu 100% nas tarefas projetadas para induzi-lo a inventar conteúdo que não existia.

    Estamos publicando nossos próprios números abaixo. Produtos concorrentes aparecem apenas como uma média agregada - essa é a regra de divulgação do avaliador, não nossa escolha.

    Por que um benchmark independente

    A maioria dos benchmarks de Legal AI são realizados pelas empresas que vendem o produto. O nosso incluído, e o nosso é tendencioso por definição, porque é nosso. Então, fizemos o oposto: entregamos o HAQQ a um avaliador independente sem interesse no resultado e pedimos que o avaliasse em relação aos outros produtos do mercado.

    Quando um terceiro sem nada a ganhar executa o teste, o número significa algo diferente. É para onde o mercado está caminhando. Compradores, e cada vez mais os LLMs que recomendam ferramentas, procuram fontes independentes confiáveis em vez do marketing do fornecedor. Preferimos conquistar a pontuação a reivindicá-la.

    Como funciona o benchmark

    Uma pontuação só vale o método por trás dela, então aqui está o método na íntegra. Nada disso é nosso projeto - é a metodologia publicada do avaliador, aplicada identicamente a cada aplicativo no grupo.

    • 61 tarefas reais, contribuídas por advogados em exercício, abrangendo elaboração de contratos e extração de informações em 21 jurisdições, incluindo Estados Unidos, Reino Unido, Índia, Singapura, Holanda e Omã.
    • Os documentos chegam como na prática - arquivos nativos do Word, PDFs, digitalizações, fotografias e arquivos com alterações rastreadas. Nada é pré-convertido em texto limpo, então a leitura do arquivo original é, por si só, parte do que está sendo medido.
    • Critérios binários de aprovação/reprovação, escritos por advogados, fixados antes do teste. Uma tarefa só é aprovada quando todos os critérios aplicáveis são atendidos. Onde várias respostas seriam profissionalmente defensáveis, os critérios permitem isso - embora ainda reprovem omissões e erros específicos.
    • Dois eixos, nunca misturados: substância e forma. A substância pergunta se o trabalho está correto e completo; a forma pergunta se um advogado poderia usá-lo como foi entregue. Uma resposta polida que está legalmente errada ainda é reprovada.
    • Cada tarefa é executada duas vezes, independentemente, e a pontuação é a média das duas execuções - assim, uma única geração de sorte não pode alavancar um resultado.
    • Dois avaliadores de LLM independentes classificam cada resultado, e qualquer desacordo que possa alterar se uma tarefa é aprovada é escalado para um advogado qualificado que revisa o resultado às cegas, sem saber qual produto o produziu. O veredicto humano é final e é preservado para auditoria.
    • The High Bar é o subconjunto que não mais de 2 das 10 aplicações avaliadas puderam completar: 34 tarefas, pontuadas em 68 tentativas. Ele existe especificamente para separar o desempenho excepcional da competência comum.

    Duas consequências que valem a pena internalizar antes de ler qualquer número abaixo. Primeiro, as taxas de aprovação neste benchmark parecem brutalmente baixas em comparação com os números de marketing que você vê em outros lugares - essa é a regra de 'todos os critérios ou nada' fazendo seu trabalho, e se aplica a todos igualmente. Segundo, nunca vemos as pontuações individuais de nossos concorrentes. O avaliador sempre nos mostra uma média agregada de Legal AI, e é por isso que esta postagem compara HAQQ com médias, em vez de com produtos nomeados.

    Fatos Chave

    • Taxa de aprovação geral: 27,0%, acima da média de Legal AI e da média da indústria. Uma tarefa é aprovada apenas quando todos os critérios elaborados por advogados são atendidos, e é por isso que os números absolutos são baixos em todo o campo.
    • The High Bar: 5,9% vs 1,1%. No subconjunto mais difícil, HAQQ foi aprovado mais de cinco vezes mais frequentemente do que a média de Legal AI, e quase três vezes a média de uso geral.
    • Ferramenta mais forte testada em elaboração de leis de Omã (50,0%) - não é competitiva, é a mais forte.
    • 100% no tratamento de referências ausentes. Em tarefas projetadas para fazer um modelo inventar cronogramas e referências ausentes, HAQQ preservou a lacuna em todas as vezes.
    • 2,53/3 na forma - clareza 2,73, estrutura 2,65 - acima de ambas as médias. Correto e utilizável como entregue.
    • O conjunto de tarefas foi deliberadamente difícil; todo o campo pontua baixo, porque a maioria das ferramentas ainda falha em trabalhos jurídicos genuinamente difíceis.

    O que o benchmark encontrou

    Aqui estão os números do confronto. "Média de Legal AI" é o agregado das outras aplicações de Legal AI avaliadas; "média de uso geral" são os assistentes de chat de ponta. A forma é pontuada de 1 a 3, onde 3 é o melhor.

    MedidaHAQQMédia Legal AIMédia de uso geral
    Elaboração de contratos - taxa de aprovação24.2%20.6%23.9%
    Elaboração de contratos - forma (1-3)2.562.442.44
    Extração de dados - taxa de aprovação30.0%29.6%29.3%
    O Nível Elevado - taxa de aprovação5.9%1.1%2.2%

    E as medidas onde o avaliador relatou HAQQ por si só:

    MedidaHAQQ
    Taxa de aprovação geral27.0%
    Forma geral (1-3)2.53
    Elaboração de contratos - critérios atendidos78.6%
    OCR e tratamento de digitalizações - critérios atendidos65.2%
    Elaboração de leis de Omã50.0%
    Tratamento de referências ausentes100.0%
    Sucesso repetível em ambas as execuções21.3%

    Elaboração de contratos

    O avaliador pontuou a elaboração em dois eixos: substância (a resposta é precisa e completa?) e forma (o resultado é polido e pronto para apresentar a um cliente?).

    HAQQ superou tanto as ferramentas de uso geral quanto a média de Legal AI em cada uma: 24.2% de taxa de aprovação contra 23.9% e 20.6%, e 2.56/3 na forma contra 2.44 para ambos os campos. Em critérios individuais, em vez de tarefas completas, HAQQ satisfez 78.6% do que os advogados pediram. Não apenas tecnicamente correto. Correto e pronto para o cliente.

    A Barra Alta: as tarefas mais difíceis

    Dentro do benchmark, havia um conjunto menor dos problemas mais difíceis, formalmente chamado de A Barra Alta: as 34 tarefas que não mais do que 2 das 10 aplicações avaliadas puderam completar. Trabalho de várias etapas, múltiplos documentos de referência, padrões de fatos complexos. O tipo de coisa em que a maioria das IAs simplesmente falha.

    HAQQ passou 5.9% dessas 68 tentativas. A média de Legal AI passou 1.1%; a média de uso geral foi de 2.2%. Isso é mais de cinco vezes o campo de Legal AI e quase três vezes os assistentes de chat de ponta - a margem mais ampla que o HAQQ obteve em toda a avaliação.

    Leia esses números honestamente: 5.9% é um número baixo em termos absolutos, e deve ser. Essas são tarefas especificamente selecionadas porque toda a indústria falha nelas. A lacuna é o sinal aqui, não o nível. Esta é a parte que mais nos importa, porque se parece com o trabalho legal real, em vez de uma demonstração.

    Três coisas que se destacaram

    1. Trabalho jurídico no Oriente Médio

    Na elaboração regida pela lei omanense, o HAQQ produziu os resultados mais fortes na avaliação, com 50,0%. Não competitivo. O mais forte. Isso é o que nos propusemos a construir, então não foi uma surpresa para nós, mas é bom ver isso confirmado por alguém sem motivos para nos lisonjear.

    2. Documentos digitalizados e de baixa resolução

    O trabalho jurídico depende de PDFs ruins: contratos enviados por fax, documentos digitalizados, páginas fotografadas. Em material de origem digitalizado, fotografado, redigido e de outra forma imperfeito, o HAQQ atendeu a 65,2% dos critérios e passou em 33,3% das tarefas - acima da média em ambos. Ele extraiu com mais frequência conteúdo legível enquanto sinalizava o que não conseguia ler, porque não se baseia no OCR integrado de um modelo. Ele executa o seu próprio.

    3. Não inventou coisas

    A avaliação incluiu tarefas projetadas para induzir um modelo a inventar o que não existe: cronogramas ausentes, referências ausentes. O HAQQ obteve 100% no ponto de verificação de referência ausente. Quando cronogramas chave estavam ausentes, ele preservou consistentemente a lacuna em vez de inventar seus conteúdos.

    Uma ressalva honesta, declarada precisamente: esses 100% são em uma medida específica - reconhecer quando uma fonte referenciada ou um fato solicitado simplesmente não está disponível. Nas tarefas mais amplas de resistência à alucinação da avaliação, o HAQQ obteve 28,0% de aprovação e 61,7% dos critérios atendidos: acima da média, não perfeito. Nenhuma IA é universalmente livre de alucinações. Inventar conteúdo ausente é o modo de falha que acaba com carreiras na área jurídica, por isso é o que nos obceca.

    Por que a alucinação é o jogo inteiro no direito

    Na vibe-coding, uma alucinação é um bug que você encontra. No direito, uma alucinação é um caso falso citado a um juiz. Você já viu as manchetes. Para um contrato ou um processo judicial, uma única cláusula inventada ou uma referência cruzada a uma lei que não existe não é uma aresta bruta. É desqualificante.

    Portanto, "quase certo" não é um produto. O verdadeiro critério é se um advogado pode confiar na produção o suficiente para construir sobre ela. Testes independentes em tarefas sem conteúdo são uma das poucas maneiras honestas de medir isso, e é exatamente onde a HAQQ foi construída para ser forte.

    A arquitetura, não o modelo

    Esta é a mudança que toda a indústria está a viver: já não é o modelo que ganha. Todos podem usar os mesmos modelos de ponta. O que agora diferencia os produtos de Legal AI é o software em torno do modelo - a recuperação, as ferramentas, o raciocínio, os dados.

    A HAQQ opera com o seu próprio motor, o Justinian. Pense nele como o Palantir para o trabalho jurídico: ele conecta-se à sua pilha existente, constrói uma ontologia dos seus assuntos e fecha o ciclo entre os seus documentos e a resposta.

    Nos bastidores, a HAQQ orquestra seis modelos - dois de código aberto e quatro proprietários - por trás de um roteador que lê cada prompt e escolhe o modelo certo para a tarefa, equilibrando a precisão com o custo, para que nenhum modelo único execute todos os trabalhos. Em torno dos modelos, encontram-se as ferramentas próprias da HAQQ: o navegador, o extrator de PDF, o OCR. Os modelos são um componente. A extração, a camada de citação e o roteamento são nossos. É por isso que ele funciona bem em PDFs ruins e se recusa a alucinar onde invólucros mais finos não o fazem.

    A parte que ninguém mais está resolvendo: mercados emergentes

    O direito europeu e americano é relativamente fácil para a Legal AI. É digitalizado, bem documentado e infinitamente rastreado. É por isso que cada ferramenta parece decente em um contrato do Reino Unido.

    Agora, aponte as mesmas ferramentas para o Oriente Médio, ou América do Sul, ou partes da África e da Ásia. A lei não está claramente digitalizada. Os dados de treinamento são escassos. E os modelos alucinam - a mesma falha que você vê em prompts do Oriente Médio aparece em todos os lugares onde os dados são esparsos.

    A HAQQ foi construída para exatamente isso. Nós mesmos inscricamos e extraímos a lei primária para essas jurisdições, o que é um fosso que as ferramentas jurídicas de propósito geral não possuem. Ser o mais forte no Oriente Médio em um benchmark independente não é sorte. É o design.

    O que os benchmarks de Legal AI devem medir a seguir

    A execução desta avaliação aprimorou nossa visão sobre o que um benchmark de Legal AI deveria testar. Algumas coisas que achamos que todo o campo deveria adotar:

    • Percentil, não aprovação ou reprovação. "Acima da média" não diz quase nada. O 50º e o 99º percentil estão ambos acima da média, e não são o mesmo produto. Mostre onde uma ferramenta se posiciona em relação à fronteira.
    • Dificuldade e capacidade de defesa. Gerar um contrato é fácil de construir. OCR confiável em digitalizações de baixa qualidade, ou extração que cita a cláusula exata, pode levar de doze a dezoito meses. Pese o quão difícil é construir uma capacidade, porque é isso que separa uma liderança real de uma demonstração.
    • Preço e ROI. A qualidade está quase se tornando um padrão para os melhores agora. A pergunta que os compradores realmente fazem é: a que custo? Custo por contrato, por tarefa de pesquisa, por página. Meça isso e recompense os fornecedores transparentes e acessíveis.
    • Inferência de intenção. Usuários reais não escrevem prompts longos e perfeitos. Eles digitam "rascunhar um NDA" ou "revisar estes documentos". Uma boa ferramenta infere o que eles querem dizer e chega à resposta sem dez rodadas de vai e vem, o oposto de um chatbot configurado para mantê-lo conversando.
    • Citações e fontes verificadas. A web está cheia de leis desatualizadas. O que importa é se uma ferramenta cita a disposição específica e atual. É aqui que a lacuna entre um LLM geral e um software jurídico real aparece mais rapidamente.
    • Raciocínio na revisão. Para revisão de contratos, o valor não é apenas o redline. São as sugestões, os cenários e o processo de pensamento visível por trás deles. Pontue se a ferramenta mostra seu trabalho.
    • Taxa de alucinação, em destaque. Por todas as razões acima, este é o número com o qual os advogados mais se preocupam. Ele deve estar na manchete, não em uma nota de rodapé.

    O que vem a seguir para este benchmark

    Esta foi a primeira rodada, e cobriu a elaboração de contratos e a extração de dados. Mais está por vir.

    HAQQ está atualmente designada como uma Candidata para o 3º trimestre de 2026 em todas as cinco categorias de certificação: Melhor Aplicação de Legal AI (Geral), Elaboração de Contratos, Extração de Informações, The High Bar e Experiência do Usuário. Para ser exato sobre o que isso significa, porque a redação importa: Candidata é a designação do avaliador no trimestre para uma aplicação participante, e as certificações só são confirmadas após o fechamento do trimestre. Se nenhuma aplicação atingir o limiar em uma categoria, nenhuma certificação é concedida. Publicaremos onde nos classificarmos, ganhando ou perdendo.

    No próximo mês, eles se expandirão para pesquisa e análise jurídica, e depois para mais regiões, além do foco tradicional dos EUA e Reino Unido, para jurisdições de mercados emergentes na América do Sul, África, Ásia e Sudeste Europeu. Essas são exatamente as regiões em que nos concentramos. Eles operam em um ritmo trimestral, porque os modelos se movem rápido o suficiente para que qualquer benchmark esteja meio obsoleto no momento em que um novo é lançado.

    A versão honesta

    Estamos orgulhosos deste resultado e não vamos exagerá-lo. Uma taxa de aprovação geral de 27,0% é um nível real superado em um teste deliberadamente brutal - e também significa que, em aproximadamente três de cada quatro tarefas difíceis, ainda havia pelo menos um critério elaborado por advogados que perdemos. Ambas as frases são verdadeiras, e qualquer um que cite a primeira sem a segunda está interpretando mal o benchmark.

    Também não podemos dizer o quão longe estamos da melhor ferramenta no campo, porque o avaliador nunca nos mostra os concorrentes individualmente - apenas como uma média. Estar acima dessa média não é o mesmo que ser o primeiro, e não vamos implicar o contrário até que as classificações sejam publicadas. O que sabemos: no trabalho que se parece com a prática jurídica real, nas tarefas mais difíceis do conjunto e nas jurisdições que a maioria das ferramentas ignora, o HAQQ se manteve sob um microscópio externo. Continuaremos a comparecer a todas as rodadas e a publicar o que eles encontrarem.

    • Justinian - o mecanismo por trás desses resultados
    • Como o HAQQ se compara a outras Legal AI
    • Benchmark jurídico de modelo de fronteira de 300 tarefas
    • Benchmark Jurídico HAQQ (direito civil e MENA)

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    H

    HAQQ Research

    Benchmark Series

    Recursos relacionados

    M&A Due Diligence AI: Single Prompt vs a 3-Agent SwarmWhat an AI-Drafted Motion Costs: $1.67 Routed, $4.55 SloppyThe Justinian engineState of the Art in Agentic Legal AI

    Artigos relacionados

    Por que o ChatGPT falha com advogados: notas de 3 advogados dos EUA

    Por que o ChatGPT falha com advogados: notas de 3 advogados dos EUA

    Alternativas ao Spellbook: As Melhores Ferramentas de Redação de Contratos com IA em 2026

    Alternativas ao Spellbook: As Melhores Ferramentas de Redação de Contratos com IA em 2026

    Estatísticas de IA jurídica 2026: quantos advogados usam IA de fato

    Estatísticas de IA jurídica 2026: quantos advogados usam IA de fato

    Perguntas frequentes

    Who ran the HAQQ legal AI benchmark?

    An independent third-party evaluator with no commercial stake in HAQQ, running a published methodology applied identically to every application in the cohort. We do not name the evaluator here. Their reports are private by default, but a vendor may publish its own results, which is why HAQQ's full numbers appear in this article while competing products are shown only as an aggregate average.

    How did HAQQ perform in the benchmark?

    HAQQ passed 27.0% of tasks overall and scored 2.53 out of 3 on form, above both the legal-AI average and the industry average. On contract drafting it passed 24.2% against 20.6% for the legal-AI average and 23.9% for general-purpose AI, with a form score of 2.56 against 2.44 for both. On data extraction it passed 30.0% against 29.6% and 29.3%. On The High Bar, the benchmark's hardest subset, it passed 5.9% against 1.1% for the average legal AI.

    What is The High Bar in the legal AI benchmark?

    The High Bar is the subset of tasks that no more than 2 of the 10 evaluated applications could complete: 34 tasks scored across 68 attempts. It exists to separate exceptional performance from ordinary competence. HAQQ passed 5.9% of those attempts, compared with 1.1% for the average legal AI and 2.2% for general-purpose AI — more than five times the legal-AI field. Absolute numbers are low by design, because these are tasks the whole industry fails.

    How is the legal AI benchmark scored?

    61 real tasks contributed by practising lawyers, across 21 jurisdictions, presented as native Word files, PDFs, scans and documents with tracked changes rather than pre-converted text. Every task has binary pass/fail criteria written by lawyers and fixed before testing, and a task passes only when every applicable criterion is met. Substance and form are scored separately and never blended. Every task is run twice independently, two LLM judges grade each output, and any disagreement that could change a pass is escalated to a qualified lawyer who reviews it blind.

    Does HAQQ hallucinate?

    HAQQ scored 100% on the benchmark's missing-reference checkpoint: when key schedules or referenced sources were unavailable, it preserved the gap instead of inventing the contents. On the broader hallucination-resistance tasks it passed 28.0% and met 61.7% of criteria, above average but not perfect. No AI is universally hallucination-free, but inventing absent content is the failure mode that matters most in law, and it is the one HAQQ is built to resist.

    What is the Justinian engine?

    Justinian is HAQQ's own hybrid architecture. It connects to your existing stack, builds an ontology of your matters, and orchestrates six models (two open-source, four proprietary) behind a router, with HAQQ's own OCR, extraction and citation tools around them. It does not rely on a model's built-in OCR, which is why it holds up on scanned and low-resolution documents.

    Is HAQQ good for Middle Eastern and emerging-market law?

    Yes. On drafting governed by Omani law, HAQQ produced the strongest results in the independent benchmark, at 50.0%. HAQQ has inscribed and extracted primary law for jurisdictions that are poorly digitized, across the Middle East and other emerging markets, where general-purpose tools tend to hallucinate.

    Can I see HAQQ's benchmark score?

    Yes. HAQQ's own results are published in full: 27.0% overall pass rate, 2.53 out of 3 on form, 24.2% on contract drafting, 30.0% on data extraction and 5.9% on The High Bar. Competing legal AI products appear only as an aggregate average, because the evaluator does not disclose any application's individual result to another vendor.

    Has HAQQ been certified by the benchmark?

    Not yet. HAQQ is currently designated a Contender for Q3 2026 in all five certification categories: Best Legal AI Application (Overall), Contract Drafting, Information Extraction, The High Bar, and User Experience. Contender is the evaluator's in-quarter designation; certifications are confirmed only when the quarter closes, and if no application clears the threshold in a category, no certification is awarded there.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    Preços de IA jurídica em 2026: todos os preços publicados e todos os fornecedores que não publicam nenhum

    Próximo artigo

    Alterações ao Regulamento de IA da UE 2026: o que mudou com o Regulamento (UE) 2026/1744

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Sala de imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Parceiro abre num novo separador
    • Curso abre num novo separador
    • Notícias jurídicas abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasar en fr es it de pt
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados
    • humans.txt abre num novo separadorlawyers.txt abre num novo separadorsecurity.txt abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.