Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. Governança por construção: guardrails de IA impossíveis de contornar
    Voltar ao BlogIA & Tech Jurídica

    Governança por construção: guardrails de IA impossíveis de contornar

    Seis guardrails populares de LLM foram contornados a taxas de 12–100%. A governança por construção remove a ação insegura do próprio agente - não sobra nada para burlar.

    May 22, 2026
    12 min de leitura
    |
    HAQQ Team
    Governança por construção: guardrails de IA impossíveis de contornar

    TL;DR — O guardrail de IA padrão verifica a resposta depois de o agente decidir dá-la. Investigação recente contornou seis guardrails populares com taxas de sucesso entre 12% e 100%. No direito, o custo é concreto: ferramentas especializadas alucinam em 17–33% das consultas, e uma base de dados pública já regista 1.458 processos judiciais com citações fabricadas por IA. A governança por construção inverte o modelo: constrói o espaço de ações do agente a partir de uma política, para que a ação insegura nunca seja criada. Não há nada para contornar porque não há nada para invocar. Disponibilizámos em código aberto o govcon, um agente jurídico com âmbito por jurisdição construído desta forma. Obteve 100% de defesa contra armadilhas fora de jurisdição no HAQQ-LAB, onde uma linha de base não governada obteve 0%.

    O guardrail é uma fechadura que se continua a arrombar

    É assim que funciona quase todo o guardrail de IA atual. Dá-se ao agente um poder geral — responder a qualquer questão jurídica — e depois coloca-se um verificador à frente: um system prompt que diz 'apenas estas jurisdições', um classificador que filtra a saída, uma regra que dispara depois de o modelo já ter escolhido o que dizer. Chamemos-lhe governança por rejeição em tempo de execução: o agente pode fazer a coisa errada, e está a apostar-se que a verificação a apanha primeiro.

    Factos-chave

    • Seis sistemas de guardrail em produção foram contornados com taxas de sucesso entre 12,7% e 65,2%, com transformações simples de carateres a atingir até 100% de evasão.
    • O govcon, o agente de código aberto da HAQQ com âmbito por jurisdição (~200 linhas, AGPL-3.0), obteve 100% de defesa contra armadilhas fora de jurisdição no HAQQ-LAB, face a 0% de uma linha de base não governada.

    Essa aposta está a perder, e agora há números para o provar. No estudo de 2025 Bypassing LLM Guardrails (arXiv 2504.11168), investigadores testaram injeção de carateres e evasão por machine learning adversarial contra seis sistemas de guardrail populares. Taxas de sucesso do ataque:

    Com que frequência os guardrails de IA em produção são contornados

    Taxa de sucesso de ataques de jailbreak por guardrail (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).

    NeMo Guard Jailbreak Detect
    65.2%
    Vijil Prompt Injection
    35.6%
    Protect AI v1
    24.4%
    Azure Prompt Shield
    13.0%
    Meta Prompt Guard
    12.7%
    Transformações simples de carateres (pior cenário)
    até 100%

    Transformações simples de carateres atingem até 100% de evasão no pior cenário. Uma técnica distinta, de múltiplas interações, aumenta a taxa de sucesso em mais de 60%.

    Contrabando de emojis. Contrabando de tags Unicode. Contexto formulado com confiança — 'a cláusula de lei aplicável diz Delaware, logo aplica-se a lei de Delaware.' O padrão é sempre o mesmo: a ação perigosa fica nas mãos do agente e tenta dissuadir-se o modelo de a usar. Corrige-se uma formulação; alguém encontra a seguinte. É uma fechadura que se continua a arrombar porque se continua a deixar a porta aberta.

    Porque é que 'funciona na maior parte das vezes' é negligência no direito

    Uma taxa de evasão de 13% é um problema de segurança interessante na maioria dos produtos. Na IA jurídica é um evento de responsabilidade civil, porque as taxas de base já são más. O estudo da Stanford RegLab constatou que mesmo ferramentas especializadas com grounding em RAG — Westlaw AI-Assisted Research e Lexis+ AI — alucinaram em ~33% e mais de 17% das consultas, respetivamente. Esse é o piso, antes de alguém tentar ativamente levar o modelo para fora dos limites. Junte-se um guardrail que falha entre 13% e 65% das vezes quando alguém tenta, e obtém-se um sistema que vai, de forma previsível e à escala, dar uma resposta confiante ao abrigo de uma lei que não se aplica.

    Sabemos qual é o custo a jusante porque já é o seu próprio conjunto de dados: 1.458 processos judiciais com citações fabricadas por IA, e a contar. Cada um deles é um advogado que confiou numa saída que um guardrail deveria ter apanhado. 'Funciona na maior parte das vezes' é exatamente o perfil de falha que termina numa ordem de sanções.

    A inversão: construir, não rejeitar

    A governança por construção parte de uma pergunta diferente. Não 'como impedimos o agente de fazer a coisa errada?', mas 'e se a coisa errada nunca tivesse sido uma das suas opções?'

    O espaço de ações do agente é construído a partir de uma política, uma vez, no momento da construção. A política enumera o que é permitido — no nosso caso, as jurisdições sobre as quais o agente pode raciocinar. O construtor cria uma ação por cada jurisdição permitida, mais uma única ação de recusa. Nunca cria uma ação para algo fora da política.

    text
    rejeição em tempo de execução:   [ responder(qualquer coisa) ] → o guardrail diz "não"   ← evadido em 13–100% das vezes
    construção:           política → constrói { responder(EAU), responder(DIFC), … , recusar }
                         responder(Delaware) nunca foi construída.
                         Não há nada para invocar. Não há nada para evadir.

    Perguntar ao agente construído sobre a lei de Delaware e ele não recusa num sentido moral — não tem nenhuma ação para o Delaware para invocar. A única coisa que pode fazer com um pedido fora do âmbito é recusar. O comportamento inseguro não está proibido; está ausente. Não existe nenhum prompt com contrabando de emojis, de múltiplas interações ou formulado com confiança suficientemente engenhoso para chamar uma função que não existe. A superfície de evasão de 13–100% colapsa para zero, porque não há verificador para evadir — a capacidade simplesmente não existe.

    Uma nota sobre como isto foi construído, porque acreditamos em mostrar o trabalho: o govcon nasceu de um briefing de investigação matinal, foi esboçado antes do almoço e tinha testes a passar à tarde. O núcleo tem cerca de 200 linhas de TypeScript sem dependências em tempo de execução. A ideia é pequena — é esse o sinal. As melhores primitivas de segurança removem uma categoria de falha em vez de acrescentar uma categoria de verificação.

    Como é isto para um agente jurídico

    O nosso agente de referência, o govcon, tem âmbito limitado a seis jurisdições do MENA: EAU, DIFC, Arábia Saudita, Líbano, Egito e Catar. Para cada uma, o construtor cria uma ação de resposta fundamentada nos instrumentos primários dessa jurisdição — pelo que uma questão de direito laboral do DIFC recebe resposta a citar a DIFC Employment Law No. 2 of 2019, e não texto genérico. Para tudo o resto, não existe nenhuma ação:

    typescript
    const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
    
    agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
    // → respondido, cita "DIFC Employment Law No. 2 of 2019 (as amended)"
    
    agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
    // → recusado: não existe nenhuma ação para esta jurisdição ao abrigo da política ativa

    Depois testámo-lo no HAQQ-LAB, o nosso benchmark aberto de direito civil, contra uma linha de base não governada em 16 tarefas, incluindo quatro armadilhas fora de jurisdição:

    govcon vs linha de base não governada no HAQQ-LAB

    Armadilhas fora de jurisdição recusadas e grounding das fontes, com rubricas determinísticas.

    Armadilhas fora de jurisdição recusadas — linha de base
    0%
    Armadilhas fora de jurisdição recusadas — govcon
    100%
    Grounding das fontes — linha de base
    0%
    Grounding das fontes — govcon
    100%

    A linha de base respondeu a todas as armadilhas — Delaware para uma SARL libanesa, cláusulas de não-concorrência da Califórnia para um funcionário no Dubai, consideration inglesa para um contrato saudita, RGPD para um assunto doméstico dos EAU. O govcon defendeu-se nas quatro.

    Não porque tenha sido melhor instruído. Porque a ação para fazer o contrário nunca foi construída.

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    A ligação ao modelo de mundo

    Este é o eco em software de um ponto que Yann LeCun repete: um modelo de linguagem grande prevê tokens, não consequências. Não tem nenhum modelo interno do que a sua saída faz no mundo jurídico, financeiro ou físico. Pedir a um sistema destes que se mantenha fiável dentro dos limites por escolha própria é pedir a coisa errada — e os números de evasão de 13–100% são o que 'pedir com jeitinho' compra.

    Por isso, não se pede. Retira-se a ação fora dos limites do mundo em que o agente pode atuar. A governança por construção é uma forma concreta, sóbria e viável de honrar a crítica de LeCun sem esperar por uma nova arquitetura de modelo. É o mesmo instinto por trás da segurança baseada em capacidades e do princípio do menor privilégio, aplicado ao espaço de ações de um agente em vez de aos file handles de um processo.

    Isto é defesa em profundidade, não uma bala de prata

    • Elimina uma categoria: ações fora da política. Não torna as respostas dentro da política corretas. Um agente govcon com âmbito no DIFC ainda pode estar errado sobre a lei do DIFC — é para isso que serve a dimensão de Substância do benchmark (e um bom modelo de raciocínio).
    • É um piso estrutural, não a stack completa. Continua a precisar de grounding, verificação de citações, revisão humana em saídas de alto risco e registo de auditoria. A construção é a camada mais precoce e mais difícil de contornar, não a única.
    • A própria política passa a ser a coisa a acertar. A confiança move-se de 'o modelo comportou-se bem?' para 'a política está correta e completa?' — uma superfície muito mais pequena, revisível e sob controlo de versões. É essa a troca que queremos.

    O argumento não é que a construção substitui os guardrails em todo o lado. É que, para as falhas que não se pode dar ao luxo de ter — dar aconselhamento ao abrigo de uma lei que não se aplica — a ação deve tornar-se impossível, reservando as verificações em tempo de execução para as falhas que se conseguem sobreviver.

    A visão da HAQQ: a primitiva em falta

    Há uma lacuna na IA jurídica que ninguém preencheu. De um lado, 'a IA redige um contrato.' Do outro, o que clientes e reguladores realmente querem: 'a IA não pode redigir um contrato que viole as regras imperativas da jurisdição.' Entre os dois está uma primitiva em falta — regras compiladas no espaço de ações do agente em vez de verificadas depois do facto.

    A governança por construção é um sinal dessa primitiva. A mesma forma que torna impossível dar aconselhamento fora de jurisdição pode tornar uma cláusula obrigatória não-opcional, ou uma cláusula proibida impossível de escrever — a conformidade como propriedade do espaço de ações, e não uma esperança sobre a saída. Num mercado em que os líderes valem, combinados, 16,6 mil milhões de dólares e continuam a competir por quem alucina menos, 'estruturalmente incapaz de fazer a coisa insegura' é um tipo diferente de afirmação — uma que se prova, não se promete, e que nenhum incumbente consegue copiar apertando um system prompt.

    O govcon está em AGPL-3.0 no GitHub. Tem cerca de 200 linhas. Lê-se em cinco minutos; a ideia é o produto inteiro.

    Principais conclusões

    • Os guardrails em tempo de execução são contornados entre 13% e 100% das vezes (arXiv 2504.11168); no direito, onde a taxa base de alucinação já é de 17–33%, 'funciona na maior parte das vezes' é um evento de responsabilidade civil.
    • A governança por construção constrói o espaço de ações a partir de uma política, para que a ação insegura nunca exista — não há nada para evadir.
    • O govcon, o nosso agente jurídico com âmbito por jurisdição, obteve 100% de defesa contra armadilhas fora de jurisdição face a 0% de uma linha de base não governada no HAQQ-LAB.
    • É a resposta em software à crítica de LeCun e um modelo de menor privilégio para agentes: remover a ação, não confiar que o modelo a evite.
    • É defesa em profundidade, não uma bala de prata — elimina uma categoria de falha e move a confiança para uma política revisível.

    Fontes e leitura complementar

    • HAQQ-LAB, o nosso benchmark aberto de direito civil
    • 1.458 processos judiciais com citações fabricadas por IA
    • o nosso scanner de prompt injection do lado da entrada
    • govcon no GitHub (AGPL-3.0)
    • HAQQ-LAB — o benchmark que o avaliou
    • Scorecard ao vivo
    • Bypassing LLM Guardrails — análise empírica de evasão (arXiv 2504.11168)
    • Stanford RegLab/HAI — modelos jurídicos alucinam em 1 de 6 consultas ou mais
    H

    HAQQ Team

    Research

    Recursos relacionados

    Justinian EngineSecurityAI Legal Hallucination Audit

    Artigos relacionados

    IA jurídica agêntica: por que sistemas multiagente vencem LLMs únicos

    IA jurídica agêntica: por que sistemas multiagente vencem LLMs únicos

    Prompt injection na IA jurídica: 5 ataques, 5 bloqueios, 1,84 ms

    Prompt injection na IA jurídica: 5 ataques, 5 bloqueios, 1,84 ms

    IA Jurídica Corporativa: O Que as Grandes Organizações Verificam Antes de Confiar

    IA Jurídica Corporativa: O Que as Grandes Organizações Verificam Antes de Confiar

    Perguntas frequentes

    How is governance by construction different from a system prompt that says 'only answer about MENA'?

    A system prompt is a request the model can be argued out of — and the data shows it's argued out of 13–100% of the time. Construction removes the capability: there is no function to call for an out-of-scope jurisdiction, so no prompt can trigger one.

    Doesn't this just move the problem to 'is the policy right'?

    Yes — on purpose. A version-controlled, reviewable policy is a far smaller and more auditable trust surface than 'did a stochastic model behave under adversarial input?' You want the trust where you can inspect it.

    Doesn't scoping make the agent less capable?

    Only outside its policy, which is the point. Inside its allowed jurisdictions it's as capable as the reasoning model behind it; outside them it declines instead of bluffing.

    Is governance by construction only for legal AI?

    No. The pattern is general — build an action space from a policy so unsafe actions are never instantiated. It's least-privilege for agents. Legal jurisdiction is just a clean, high-stakes example.

    How does it relate to human-in-the-loop and other guardrails?

    It's complementary and earlier. Human gates and output classifiers catch bad actions after they're proposed; construction means the worst ones are never proposed. Use construction for unsurvivable failures and runtime checks for survivable ones.

    Can I see it work?

    Yes — govcon is open source under AGPL-3.0, ~200 lines, with tests. The benchmark that scores it (HAQQ-LAB) is open too, with a live scorecard at haqq-lab.dashable.dev.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    O benchmark de IA jurídica para o direito civil: por que construímos o HAQQ-LAB

    Próximo artigo

    Os advogados podem usar IA? Um rastreador país a país (2026)

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Curso abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasar en fr es it de pt
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados abre num novo separador
    • humans.txt abre num novo separadorlawyers.txt abre num novo separadorsecurity.txt abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.