Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. Jev dentro de uma arquitetura de IA jurídica: 8 padrões de decisão e o limite que medimos
    IA & Tech Jurídica

    Jev dentro de uma arquitetura de IA jurídica: 8 padrões de decisão e o limite que medimos

    Testámos o Jev da TypeSafe na nossa stack jurídica por menos de 0,20 $. Pontuou citações inventadas acima das honestas.

    September 23, 2026
    21 min de leitura
    |
    HAQQ Team
    Jev dentro de uma arquitetura de IA jurídica: 8 padrões de decisão e o limite que medimos

    Em resumo: gastamos menos de $0.20 testando se um modelo que não gera texto pertence à nossa pilha de Legal AI. Sim, em três lugares, e está em produção em um deles. Falhou em mais três, e uma dessas falhas inverteu tão completamente que respostas contendo citações fabricadas pontuaram mais alto do que as honestas. A regra que surgiu disso é a parte útil: esta classe de modelo é forte onde um julgamento tem uma resposta objetiva que a evidência fornecida resolve, e fraca onde o julgamento é de gosto.

    A proposta, e por que a levamos a sério

    Há um argumento circulando de que a maioria dos agentes de IA desperdiça seu recurso mais caro em decisões que nunca precisaram de uma frase. Encaminhar uma solicitação para o modelo certo é uma decisão. Decidir se uma chamada de ferramenta é segura é uma decisão. Classificar cinquenta documentos recuperados são cinquenta decisões. Nenhuma delas produz prosa que alguém lê, mas todas são entregues a um modelo que cobra por palavra e responde em parágrafos.

    Em setembro de 2026, a TypeSafe AI lançou um modelo baseado nesse argumento. Jev é o que eles chamam de modelo de Sistema Um, e a propriedade definidora é que ele não gera texto algum. Você POSTA um bloco de estado mais um conjunto de perguntas tipadas, e recebe probabilidades calibradas, todas avaliadas em uma única viagem de ida e volta paralela.

    Existem três primitivos e não há um quarto. Um noul é uma pergunta de sim ou não que retorna uma probabilidade entre 0 e 1, e essa probabilidade é a confiança: 0.5 significa um cara ou coroa, não intensidade média. Uma choice escolhe uma opção de uma lista que você define, e fisicamente não pode retornar uma opção que você não declarou. Um score coloca a entrada em uma escala ordenada que você descreve em palavras, e retorna a média ponderada pela probabilidade, então uma divisão 70/30 entre dois níveis retorna como 1.30 em vez de 1 ou 2.

    Essa é a superfície completa. Ele não pode resumir, reescrever, rascunhar, extrair um trecho ou pesquisar algo. Não tem base de conhecimento e nenhuma recuperação. Ele responde a perguntas cujo espaço de resposta você declarou, sobre um estado que você forneceu.

    A parte que é fácil de perder

    O instinto é arquivar isso como um classificador barato e rápido. Isso subestima o que realmente mudou, que não é o preço, mas a ordenação.

    Um modelo de linguagem escreve um token de cada vez, então o token nove não pode existir até que o token oito exista. Faça quatro perguntas não relacionadas sobre um contrato e esses quatro julgamentos independentes se enfileiram um após o outro, retornam como um blob que você então analisa, valida e tenta novamente quando o formato está errado. Jev exclui a fila. Você declara o espaço de resposta antecipadamente e todas as perguntas são resolvidas contra o mesmo estado de uma vez. Texto é uma linha que você tem que andar. Um espaço de resposta é uma sala que você vê de uma vez.

    Modelo de linguagem de fronteiraJev
    SaídaUma string que você analisa e validaUm valor tipado em que seu código se ramifica
    OrdenaçãoSequencial, cada token condicionado ao últimoNenhuma, todas as perguntas em paralelo
    IncertezaEnterrada em prosa confianteUma probabilidade explícita em cada opção
    Modo de falhaFormato malformado, opção inventada, recusaUma resposta errada válida para o esquema
    Pode escrever?Sim, esse é o produtoNão. Nem uma frase, nem um trecho, nem código
    Pode pesquisar coisas?Com ferramentas, simNunca. Nenhuma recuperação, nenhuma base de conhecimento

    Essa linha de modo de falha é a que importa na lei, e vale a pena ser direto sobre isso. A garantia oferecida é que você nunca obterá um valor fora do seu esquema. Não é uma garantia de que o valor esteja correto.

    Um erro válido de esquema reembolsa o cliente errado tão rapidamente quanto um erro malformado.

    Para uma empresa de Legal AI, a palavra interessante em tudo isso é calibrado. Um número que você pode usar no código é um objeto diferente de um parágrafo que um advogado precisa ler e confiar. Escrevemos em nossa publicação sobre a camada de orquestração de Legal AI que a parte da Legal AI que determina se as citações são válidas é invisível de fora. Isso é um candidato para preencher parte dessa parte invisível.

    Então, nós o executamos em toda a nossa pilha. Cada medição abaixo é nossa, em nosso próprio corpus, e as que deram errado também estão aqui.

    O que medimos e quanto custou

    Dez superfícies, treze tickets fechados, menos de US$ 0,20 em gastos totais. Isso não é um alarde sobre frugalidade. É a razão pela qual o experimento valeu a pena ser executado: por uma fração de centavo por julgamento, você pode se dar ao luxo de verificar cada evento em vez de amostrar, e um resultado nulo custa quase nada para ser estabelecido.

    Latência, medida em nosso próprio tráfego com uma conexão ativa mantida aberta: 292ms na mediana, 374ms no p90, 395ms no p95, em 40 chamadas. O tempo de computação apenas do lado do servidor é de 112ms. Nossa primeira medição disse 700ms, e repetimos esse número internamente por uma semana antes de percebermos que estava errado. Nunca havíamos reutilizado uma conexão, então cada chamada estava pagando por um novo handshake. Mesma API, mesma versão do modelo, uma medição cuidadosa da coisa errada. É um pequeno constrangimento e útil, porque é exatamente a classe de erro que torna um benchmark irreproduzível um mês depois.

    Oito padrões, e quais nós realmente testamos

    Sete deles circularam como uma lista de padrões de desenvolvedor. O oitavo é nosso, e é o que se mostra mais importante para o trabalho jurídico.

    • Roteamento de modelo. Prever a complexidade da tarefa, enviar o trabalho fácil para um modelo pequeno e o trabalho difícil para um modelo de ponta.
    • Comportas de risco de chamada de ferramenta. Antes que um agente execute uma ferramenta, pontue a ferramenta, seus argumentos e a tarefa atual, e retorne "permitir", "bloquear" ou "aprovação humana".
    • Triagem de intenção e domínio. Classifique a solicitação em um conjunto fixo de intenções antes que o agente principal comece a raciocinar. No direito, isso é a jurisdição, a área de prática e o produto final.
    • Decisões de loop. Após cada etapa do agente, preveja se outra etapa provavelmente será útil.
    • Re-classificação de recuperação. Pontue cada passagem recuperada em relação à consulta e passe apenas as de maior pontuação para o contexto.
    • Guardrails e verificações de política. Execute verificações de segurança e conformidade como classificações rápidas, em vez de gerar uma resposta de raciocínio completa.
    • Escalação para um humano. Preveja se uma decisão automatizada é suficientemente confiável para ser executada.
    • Compactação textual do contexto. Pontue cada etapa de um longo rastreamento de agente para verificar se ela ainda se relaciona com o objetivo, elimine as irrelevantes e mantenha as restantes palavra por palavra.

    Já medimos seis deles em nossos próprios dados. Três funcionam, um deles em produção hoje. Três não funcionam. As falhas recebem mais espaço abaixo, porque são mais instrutivas e porque ninguém mais as está publicando.

    Uma nota sobre o ambiente: um pequeno número de ferramentas construídas sobre essa mesma pilha já existe para verificação de citações legais, todas lançadas nas últimas duas semanas. São experimentos iniciais, em vez de produtos operacionais, e nenhum publica um número de precisão. A lacuna em que estamos escrevendo não é que ninguém teve essa ideia. É que ninguém publicou o que acontece quando você a verifica.

    Onde funciona: recuperação por re-classificação

    O nosso corpus de estatutos MENA contém 17.004 artigos. A recuperação de dados é lexical em primeiro lugar, o que significa que uma consulta e um artigo que utilizam palavras diferentes para a mesma obrigação podem falhar completamente. Esta é a falha comum da pesquisa jurídica em qualquer idioma, e é pior em árabe, onde a morfologia cria uma distância maior entre um termo de pesquisa e a sua correspondência.

    Pegámos em 80 consultas retidas, executámo-las através da recuperação existente e, em seguida, reordenámos os candidatos, fazendo uma pergunta por candidato: este artigo responde a esta pergunta.

    Reordenar um corpus de estatutos de 17.004 artigos

    Percentagem de 80 consultas retidas em que o artigo correto foi o primeiro a ser recuperado

    Apenas recuperação lexical
    63.8%
    Após reordenar cada candidato
    85.0%
    Teto: o que a recuperação poderia alguma vez trazer à superfície
    88.8%

    Em nove das 80 consultas, o artigo correto nunca foi recuperado, pelo que nenhum reordenador o poderia promover. As consultas foram escritas a partir dos artigos amostrados, o que favorece a recuperação lexical, por isso, leia a diferença em vez dos números absolutos.

    A classificação recíproca média passou de 0,719 para 0,869. Dez em dez casos verificados manualmente concordaram, incluindo dois em que o modelo recusou corretamente promover qualquer coisa porque não existia nenhum candidato válido. Custo total: 0,0245 $.

    Mais um aviso. Os nossos artigos em árabe e inglês são separados por jurisdição, sendo todos os artigos árabes egípcios e todos os artigos ingleses dos Emirados Árabes Unidos, pelo que esta execução não suporta qualquer afirmação sobre a linguagem.

    Funciona porque a pergunta tem uma resposta certa. Se este artigo responde a esta pergunta, é determinado pelo artigo e pela pergunta, ambos estão perante o modelo.

    Onde funciona: identificar as respostas que não são respostas.

    Antes de adotarmos o Jev, avaliávamos as respostas de referência com um modelo de linguagem atuando como juiz. Esse juiz era generoso de uma forma específica e prejudicial. Ele concedeu um perfeito 10.0 a 56% das respostas que pontuou, e para um modelo, 90% das respostas voltaram impecáveis em todas as quatro dimensões. Um avaliador sem teto não está a medir nada no topo da sua escala.

    O Jev pontuou 0% das respostas com 9.9 ou acima. Mais utilmente, ele identificou todos os cinco erros de API truncados no conjunto com probabilidades entre 0.96 e 0.97. O juiz anterior tinha pontuado esses mesmos cinco como 1 de 10 e os tinha incluído na pontuação de capacidade do modelo, o que significava que estávamos a relatar uma taxa de falha de infraestrutura de 10% como incompetência legal. Excluí-los fez um modelo passar de 5.80 para 7.67.

    A coisa mais valiosa que o modelo fez para as nossas referências não foi julgar a qualidade. Foi perceber que uma sequência não era uma resposta.

    Onde funciona, em produção: o regex do portão de conformidade não conseguia ver

    Este está em vigor e ganhou o seu lugar ao identificar algo embaraçoso.

    Nós executamos cada peça de texto público através de um portão de pré-verificação antes de ser publicada, verificando-a contra as nossas próprias regras de mensagens. Algumas dessas regras são linhas vermelhas: não dizemos que substituímos advogados, e não afirmamos que a nossa Legal AI está livre de alucinações, porque nenhuma das duas é verdadeira e ambas são o tipo de afirmação que um regulador lê atentamente.

    Um rascunho francês contendo violações literais de ambas as regras passou por esse portão com saída 0, com zero constatações. Os padrões regex eram apenas em inglês. O francês para 'substituímos advogados' e o francês para 'a nossa Legal AI não tem alucinações' passaram diretamente por uma verificação que teria parado os seus equivalentes em inglês instantaneamente.

    Uma passagem semântica apanhou ambos decisivamente: 0.90 na alegação implícita, 0.95 na linha vermelha de substituição de advogado, 0.83 sobre como um regulador a leria. Custo por rascunho: cerca de $0.00005, através de oito perguntas digitadas num pedido paralelo.

    O resultado que não esperávamos é que as expressões regulares e a semântica se revelaram complementares em vez de redundantes. Partimos do princípio de que uma iria aposentar a outra, e medimos, em 35 rascunhos reais, que cada regra de expressão regular com uma contrapartida semântica estava a capturar uma redação diferente do mesmo risco. A expressão regular captura a redação literal. A passagem semântica captura a paráfrase. O nosso próprio bilhete previa que poderíamos aposentar algo, e os dados disseram que não.

    Onde inverteu: perguntar se uma citação tem fundamento

    Agora, a falha que reorganizou o nosso pensamento.

    Pedimos a Jev que avaliasse o fundamento em 150 respostas jurídicas reais, produzidas por três modelos de ponta em 50 solicitações do Médio Oriente e Norte de África e do Reino Unido. O fundamento aqui significa: as alegações são sustentadas, as citações são reais e usadas corretamente. É a questão mais importante na Legal AI, e é a questão que a nossa própria auditoria de alucinação existe para continuar a fazer.

    As respostas que continham citações fabricadas obtiveram uma pontuação de 3.21. As respostas honestas obtiveram uma pontuação de 2.79. A correlação entre a pontuação composta e as etiquetas de precisão revistas por humanos foi de r = +0.02, ou seja, nenhuma.

    A verificação não só não conseguiu detetar a fabricação. Ela recompensou-a.

    Depois de se ver porquê, não se consegue desver. O Artigo 5ºbis do Decreto Real M/13 parece preciso, específico e autoritário. Não existe. Um modelo pedido para julgar o fundamento apenas a partir do texto não tem nada para comparar, por isso volta aos recursos que geralmente acompanham a escrita fundamentada: especificidade, densidade de citação, estrutura confiante. A fabricação produz todos os três. A especificidade é o que a fabricação parece ser, então qualquer rubrica que recompense a especificidade recompensa a fabricação.

    Agora, mude uma coisa. Entregue ao modelo a passagem original juntamente com a alegação e pergunte se esta passagem apoia esta proposição. Numa execução separada e reproduzível de 180 pares do nosso próprio corpus, o modelo hospedado atingiu uma AUC de 0.9962 e detetou 94.4% das atribuições erradas com uma taxa de falsos alarmes nula.

    Mesmo modelo. Mesma tarefa em abstrato. Resultado oposto, porque uma versão é uma comparação entre duas coisas à sua frente e a outra é uma pesquisa de conhecimento que não consegue realizar.

    Mais uma ressalva, porque importa mais do que a vitória. Nesse mesmo conjunto de 180 pares, uma simples verificação de contenção com `grep` obteve uma AUC de 0.9944 e detetou 98.9%. Esses pares foram construídos com base na contenção verbatim, que é precisamente para o que `grep` serve. Trate 0.9962 como um piso em vez de um teto, e trate o fundamento ao nível da paráfrase, onde um classificador tipado deveria realmente justificar a sua utilidade, como não testado por essa execução.

    A recuperação não é um detalhe de implementação subjacente à etapa de verificação. A recuperação é o que torna a verificação possível.

    Onde perdeu para um contador de passos: controle de loop

    Testamos este especificamente para este post, e ele não sobreviveu.

    O padrão diz: após cada passo do agente, pergunte se outro passo provavelmente será útil e pare quando a resposta for não. Construímos o teste a partir de 52 de nossas próprias trajetórias de agente concluídas, 1.750 passos rotulados. A verdade fundamental para cada passo era se o próximo passo realmente trazia informações que ainda não estavam em algum lugar na trajetória, calculado por uma regra que verificamos manualmente em 24 de 25 casos.

    Prever se um agente deve dar outro passo

    Área sob a curva ROC, 1.750 passos rotulados em 52 trajetórias concluídas

    Um contador simples de passos dados até agora (gratuito)
    0.670
    Algum dos últimos 3 passos retornou algo novo (gratuito)
    0.702
    Jev, uma pergunta digitada por passo (US$ 0,54)
    0.718

    A diferença entre Jev e o segundo sinal gratuito é de +0,017, com um intervalo de confiança de 95% de -0,010 a +0,051. Não ultrapassa um bootstrap pareado. Passos economizados com perda zero de trabalho útil: zero, para todos os três.

    Pagamos US$ 0,54 para não superar um recurso computado com uma diferença de conjunto.

    Duas coisas subjacentes a isso valem mais do que a manchete. A primeira é que uma calmaria não é exaustão. A regra livre para após dois passos consecutivos que não retornaram nada de novo, executada como um oráculo em sua própria premissa, danificou 30 das 31 trajetórias que parou. Agentes ficam em silêncio no meio de um trabalho útil o tempo todo.

    A segunda explica todo o resultado. Divida as linhas pelo tipo de ferramenta que o próximo passo usou e a imagem muda completamente: 0,742 quando o próximo passo escreve ou edita um arquivo, 0,695 quando ele lê ou pesquisa, e 0,597, perto da chance, em comandos de shell, onde 59% de nossas linhas vivem.

    Nunca previu se o agente havia aprendido o suficiente. Previu se a próxima coisa que voltaria seria um reconhecimento de escrita ou uma página de saída. Isso é um julgamento sobre a forma do próximo evento, não sobre o estado do conhecimento do agente.

    Avalie isso honestamente: nosso corpus são agentes de codificação e pesquisa, não loops de raciocínio jurídico, e o teto de economia era baixo para começar, porque uma transcrição finalizada é, por definição, aquela que parou aproximadamente quando a informação parou. Ambos os fatos limitam o quão longe isso se generaliza. Nenhum resgata o padrão.

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Onde perdeu para uma expressão regular: "risk gates" de chamada de ferramenta

    O último padrão que testamos, e o mais desconfortável, porque queríamos que este funcionasse.

    Executamos infraestrutura que não deve sair do ar. A regra que a protege atualmente vive em um arquivo de configuração que um agente deve ler e obedecer. Uma regra que depende de ser lida não é um controle. Um "gate" que dispara na chamada é.

    Então, rotulamos 19.922 chamadas de ferramentas reais de 766 de nossas próprias transcrições, pontuamos 284 delas e comparamos um classificador digitado com a lista de negação que você realmente escreveria à mão.

    Verdade fundamentalnJevLista de negação, ingênuaLista de negação, "steelman"
    Leitura segura121120/121121/121120/121
    Destrutivo119106/119118/119118/119
    Poderia derrubar um host ativo4425/448/4420/44

    Exigimos que todas as chamadas destrutivas fossem interceptadas. O classificador atingiu 89,1%, abaixo de ambas as listas de negação. A regex vence a classe para a qual o teste existia.

    Há uma vitória genuína nisso. Na questão específica de saber se uma chamada específica poderia tirar um host ativo do ar, uma pergunta dedicada de sim ou não interceptou 21 de 22 com uma taxa de alarme falso de 3,4%, enquanto a mais forte das duas listas de negação escritas manualmente interceptou 8 de 22. Unindo as duas, a taxa de chamadas arriscadas que escapam é reduzida pela metade. A onze centavos por mil chamadas, o custo não é o que o impede. A recomendação que saiu disso ainda é enviar a regex e manter o classificador como uma segunda opinião, nunca como o portão.

    O resultado mais limpo de todo o programa está dentro deste teste, e é sobre como você pergunta, e não o que você pergunta. Mesmo modelo, mesmas linhas, mesma tarde. A pergunta concreta, esta chamada pode tirar um desses hosts ativos específicos do ar, atingiu 95,5% de recall com uma taxa de alarme falso de 3,4%. A pergunta abstrata, esta ação é irreversível, precisou de um limiar muito mais frouxo para atingir um recall comparável e arrastou a taxa de alarme falso para 34,6% para chegar lá.

    Já havíamos aprendido isso antes e o havíamos anotado como um aforismo: nomeie o teste concreto, não a categoria abstrata. Esta é a primeira vez que o temos como uma comparação controlada, e não como uma anedota, e o tamanho da lacuna nos surpreendeu.

    Mais uma coisa desse teste, com seus limites. Tentamos convencer o classificador a aprovar chamadas que ele havia bloqueado, usando oito payloads de injeção escritos manualmente em 384 chamadas pareadas, inseridos no comando, na descrição e no contexto da tarefa. Nenhum inverteu de forma confiável uma chamada bloqueada para permitida. Esse é um resultado real e pequeno: oito payloads escritos pela mesma pessoa que construiu o teste não são uma equipe vermelha, e uma lista de negação é imune a isso por construção, e não por sorte. A própria documentação do TypeSafe lista que o estado não é tratado como hostil entre as limitações do modelo, e para um portão de segurança essa limitação recai diretamente sobre a entrada que um invasor controla.

    O oitavo padrão, e por que ele é o legal

    Tudo o que precede foi emprestado da engenharia de agentes em geral. Este é nosso, e surge de uma restrição que só realmente se manifesta na lei.

    Execuções longas de agentes transbordam seu contexto, e a solução padrão é ter um modelo de linguagem que resuma o rastreamento até então. Para a maioria dos softwares, isso é bom. Para o trabalho jurídico, é um desastre silencioso, porque um resumo de um estatuto é um novo documento. Ele tem novas palavras. Essas palavras foram escritas por um modelo, não por um legislador, e cada etapa subsequente agora raciocina sobre a paráfrase, e não sobre a lei.

    A alternativa é compactar sem parafrasear. Pontuar cada etapa do rastreamento para saber se ela ainda se relaciona com o objetivo atual, descartar as que não se relacionam e manter as sobreviventes palavra por palavra. Nada é reescrito. O contexto fica mais curto porque as coisas foram removidas, não porque as coisas foram reformuladas.

    Um resumo de um estatuto é um novo documento. Uma lista filtrada de estatutos ainda são os estatutos.

    Este é o padrão em que estamos mais interessados e é o que ainda não medimos, então trate-o como uma posição de design e não como um resultado. Estamos a dizê-lo em voz alta porque é o tipo de problema para o qual um modelo de decisão é excecionalmente adequado e porque não vimos mais ninguém enquadrar a compactação como um requisito de correção em vez de uma otimização de custos.

    Duas coisas sobre o trabalho jurídico sobre as quais ninguém avisa

    Não consegue ver um documento digitalizado. Jev aceita texto. Uma parte muito grande de documentos jurídicos reais, particularmente no Médio Oriente e Norte de África, chegam como fotografias de papel. Isso significa que o pipeline à frente faz todo o trabalho que determina se ele obtém uma entrada justa, e qualquer confiança que ele relata está condicionada a uma etapa de OCR sobre a qual ele não sabe nada. Reimplementações abertas da mesma arquitetura a serem executadas em modelos de base com capacidade de visão existem, que é a direção para a qual isso eventualmente irá, mas o modelo hospedado à sua frente hoje é cego.

    As abreviações jurídicas estragam-no de uma forma que parece um erro, mas não é. Pedimos-lhe para classificar um pedido para rever um MSA árabe e editá-lo. A juridicidade voltou com 0.30, o que para um pedido claramente jurídico parece uma falha. Isole a frase e a imagem resolve-se: MSA sozinho pontua 0.97, Master Services Agreement 0.98, um MSA escrito em árabe 0.96, e MSA árabe colapsa para 0.30. Colocar a palavra árabe imediatamente antes de MSA transforma o acrónimo de Master Services Agreement para Modern Standard Arabic.

    O modelo está certo. A frase é genuinamente ambígua, e seria ambígua para um leitor humano também. Mas o trabalho jurídico do Médio Oriente e Norte de África gera essa construção exata constantemente, então qualquer pipeline que roteia numa etiqueta de documento irá encontrá-la, e num benchmark será lido como uma falha do modelo quando é um artefato de ambiguidade de entrada. Se está a avaliar um classificador em texto jurídico, verifique se há uma abreviação ambígua antes de concluir que o modelo não consegue lidar com a sua jurisdição.

    A regra que resultou de tudo isto

    Seis superfícies, três vitórias, três derrotas. O padrão nas derrotas é o que vale a pena reter.

    A reranking funciona porque 'este artigo responde a esta pergunta' tem uma resposta que o artigo e a pergunta resolvem entre si. A fundamentação da citação funciona quando se entrega a fonte e inverte quando não o faz, porque sem a fonte a pergunta torna-se uma consulta de conhecimento. O controlo de loop falha porque 'este agente aprendeu o suficiente' não é resolvido por nada na trajetória. A sugestão de link interno, que também testamos, falhou da mesma forma: questionados se um leitor teria um motivo real para clicar de uma página para outra, as pontuações contra 761 links curados por humanos voltaram a 0.582 para links reais e 0.537 para pares que nenhum editor jamais conectou, uma diferença de 0.045, com verificadores manuais a concordar em 12 de 20.

    Antes de construir um julgamento, pergunte qual é a verdade fundamental para ele. Se a resposta honesta for uma preferência do editor, espere uma lacuna de cerca de 0.05 e planeie um humano.

    Esta é a mesma fronteira que a nossa própria investigação de citação falsa encontrou do outro lado, e é por isso que avaliamos as ferramentas pela verificação de que uma citação diz o que elas afirmam, e não apenas que existe.

    O que diríamos a alguém que esteja a avaliar Legal AI

    Quatro coisas, apenas uma delas sobre este modelo em particular.

    Pergunte a que o cheque está ancorado. A nossa IA verifica citações não é uma arquitetura. Verificar se um caso existe é uma pesquisa em base de dados. Verificar se o caso diz o que a resposta afirma é uma comparação, e requer que a passagem da fonte esteja em mãos no momento do julgamento. Produtos que fazem o primeiro e o descrevem como o segundo são a norma, não a exceção.

    Pergunte pela taxa de falha, não pela taxa de sucesso. Cada ferramenta nesta categoria publica um número que a lisonjeia. Muito poucas publicam o que mediram e perderam. A nossa própria honestidade tem limites que vale a pena mencionar: a primeira passagem automatizada na rotulagem desse corpus de chamadas de ferramentas estava 86% errada na sua classe mais importante, tudo na mesma direção, e nós encontrámo-lo por verificação manual em vez de por astúcia.

    Pergunte contra o que o benchmark foi pontuado. Este apanha quase toda a gente. Um benchmark pode ser pontuado contra a verdade fundamental, ou contra a concordância com um modelo de linguagem de ponta. O segundo é muito mais barato e muito mais fraco, porque concordar com o GPT inclui concordar com os erros do GPT. Quando um fornecedor reporta precisão, a questão não é quão alto é o número. É com o que o número foi comparado.

    Tenha cuidado com um número que é afirmado em vez de medido. O gráfico de lançamento da TypeSafe mostra uma taxa de alucinação de 0%, e a nota de rodapé abaixo diz, nas suas próprias palavras, que o número não é empírico e é adicionado por construção porque a correspondência do esquema é imposta em vez de observada. Eles divulgam-no. O título acima do gráfico não. A afirmação subjacente é verdadeira e restrita: nunca obterá um valor fora do seu esquema. Não é uma afirmação de que o valor está certo. Um analista independente fez este ponto uma semana após o lançamento, e é um ponto justo.

    O que realmente mudou para nós

    Não o custo. Trocar uma chamada de modelo de linguagem por uma tipificada economiza cêntimos, e os cêntimos nunca foram o problema.

    O que mudou é que uma decisão que o sistema já estava a tomar silenciosamente agora carrega um número. A revisão de contrato em 0.91 contra litígios em 0.09 é uma rota que pode automatizar e registar. 0.52 contra 0.46 é um lançamento de moeda com um rótulo, e isso requer um humano. Um modelo de linguagem teria dado a mesma resposta em ambos os casos, numa frase confiante, sem forma de distinguir as duas situações.

    Para um produto onde estar errado é toda a superfície de risco, isso vale mais do que qualquer múltiplo de velocidade num gráfico de fornecedor.

    O hábito que manteríamos mesmo que nunca enviássemos outro pedido: passe pelo seu agente e encontre todas as chamadas que meramente selecionam algo. Qual ferramenta usar em seguida. Isto é spam. Este pedaço é relevante. Isso precisa de um humano. Este diff é arriscado. Nenhuma dessas são tarefas de escrita. São declarações condicionais que alguém terceirizou para um modelo de ponta, e a maioria delas não precisa de um.

    Principais Conclusões

    • Um modelo que não gera texto é uma ferramenta real para um arnês jurídico, nos lugares específicos onde um julgamento é uma comparação entre coisas que você pode apresentar a ele.
    • Solicitado a pontuar a fundamentação apenas em texto, ele pontuou citações fabricadas mais alto do que as honestas, 3,21 contra 2,79, com uma correlação com a precisão real de r = +0,02. A recuperação é o que torna a verificação possível, não um detalhe de implementação abaixo dela.
    • Está em produção no nosso portão de conformidade, onde detectou violações de "red-line" num rascunho francês que a nossa regex apenas em inglês passou com saída 0. A regex e as verificações semânticas revelaram-se complementares, não redundantes, contrariamente à nossa própria previsão.
    • A reclassificação do nosso corpus estatutário de 17.004 artigos aumentou o recall na classificação 1 de 0,638 para 0,850 por menos de três centavos.
    • O controle de loop não superou um contador de passos gratuito em um teste pareado, e sua aparente habilidade caiu para quase ao acaso depois que controlamos o tipo de ação que viria a seguir.
    • Um "tool-call risk gate" recuperou 89,1% das chamadas destrutivas, enquanto uma lista de negação escrita à mão recuperou 99,2%. Estamos enviando a regex.
    • Para trabalho jurídico especificamente: ele não consegue ler um documento digitalizado, e o MSA Árabe é lido como Árabe Padrão Moderno, em vez de Master Services Agreement, reduzindo a "legal-ness" de 0,97 para 0,30.
    • A compactação deve remover, não reescrever. Um resumo de um estatuto é um novo documento.
    • Pergunte qual é a verdade fundamental para um julgamento antes de construir sobre ele. Sem verdade fundamental, sem ferramenta.

    Fontes e leitura adicional

    • TypeSafe AI: Documentação Jev e limitações publicadas
    • Cognição Inovadora: A Garantia, Não Pode Ter Alucinações Abrange a Forma, Não a Verdade
    • Como a Legal AI inventa uma citação
    • Auditoria de Alucinações da Legal AI
    • A camada de orquestração da Legal AI
    • Legal AI Benchmark 2026
    H

    HAQQ Team

    Editorial

    Recursos relacionados

    How legal AI invents a citationAI Legal Hallucination AuditThe legal AI orchestration layerLegal AI Benchmark 2026

    Artigos relacionados

    Melhor IA para trabalho jurídico em 2026? Avaliamos 3.000 respostas

    Melhor IA para trabalho jurídico em 2026? Avaliamos 3.000 respostas

    O que acontece antes de uma IA jurídica responder à sua questão

    O que acontece antes de uma IA jurídica responder à sua questão

    Alucinação de IA Jurídica: A Citação Falsa Que Passa em Todas as Verificações

    Alucinação de IA Jurídica: A Citação Falsa Que Passa em Todas as Verificações

    Perguntas frequentes

    Can Jev detect AI hallucinations in legal citations?

    Only when you give it the source. We measured both setups on the same 150 legal answers. Asked to score groundedness from the answer text alone, it scored answers containing fabricated citations higher than honest ones, 3.21 against 2.79, with a correlation to human accuracy labels of r = +0.02. Handed the source passage alongside the claim and asked whether that passage supports that proposition, the same model reached an AUC of 0.9962 and caught 94.4% of misattributions at a zero false alarm rate on a separate 180-pair run. The model has no retrieval and no knowledge base, so a verification step without retrieval in front of it is not a verification step.

    What is Jev and how is it different from an LLM?

    Jev is TypeSafe AI's System One decision model, released in September 2026. It generates no text. You send a block of state plus typed questions and get back calibrated probabilities, all evaluated in one parallel round trip. There are three primitives: a noul returns the probability that a yes-or-no statement is true, a choice picks one option from a list you define, and a score places the input on an ordered scale you describe. A language model produces a string you parse and validate, one token at a time. Jev produces a typed value your code branches on, with every question resolved simultaneously.

    Is Jev accurate enough to use in legal work?

    It depends entirely on the question you ask it. In our own testing it moved recall at rank 1 on a 17,004-article statute corpus from 0.638 to 0.850, and it caught red-line compliance violations in a French draft that our English-only regex checks passed with zero findings. It also failed three tests: it scored fabricated citations higher than honest ones when judging groundedness from bare text, it did not beat a free step counter at deciding when an agent should stop, and it recalled 89.1% of destructive tool calls where a hand-written deny-list recalled 99.2%. The rule we derived is that it is strong where a judgment has an objective answer the supplied evidence settles, and weak where the judgment is a matter of taste.

    Does Jev work on Arabic legal documents?

    On Arabic legal text it classified 10 of 10 cases correctly across English, Arabic and French, though that fixture set was small and easy enough that every case came back at full confidence, so read it as parity holding on easy inputs rather than as proven parity. Two practical limits matter more. It cannot read a scanned document at all, and a large share of MENA legal documents arrive as photographs of paper. And legal abbreviations can be genuinely ambiguous: the phrase Arabic MSA scores 0.30 on legal-ness because the word Arabic flips the acronym from Master Services Agreement to Modern Standard Arabic, where MSA alone scores 0.97.

    What does a 0% hallucination rate actually mean?

    For a model with a fixed output schema it means the model cannot return a value you did not declare. That is a real and useful guarantee. It is not a guarantee that the value is correct. TypeSafe discloses this themselves in a footnote under their launch chart, which says the number is not empirical and is added by construction because the schema match is enforced rather than observed. A schema-valid wrong answer is still a wrong answer, and in legal work it causes exactly the same damage as a malformed one.

    How much does it cost to run decision checks on legal documents?

    In our own billing, the entire evaluation programme across ten surfaces cost under $0.20. Individual jobs: reranking 80 queries against a 17,004-article corpus cost $0.0245, a semantic compliance pass on one draft costs about $0.00005, and tool-call classification runs at roughly eleven cents per thousand calls. Cost is not what stops you adopting this. Whether the judgment has a ground truth is what stops you.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    Responsabilidade do operador de IA: o que o novo código de conduta da Microsoft impõe ao seu escritório

    Índice

    21 min de leitura

    Share this

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Sala de imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Parceiro abre num novo separador
    • Curso abre num novo separador
    • Notícias jurídicas abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasenarfresitdeptrohi
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados
    • Humanos abre num novo separadorAdvogados abre num novo separadorSegurança abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.