Skip to content
    HAQQ
    • Precios
    Comenzar Gratis
    Comenzar GratisReservar una demo
    Iniciar sesión
    1. Inicio
    2. Blog
    3. Gobernanza por construcción: guardarraíles de IA imposibles de evadir
    Volver al BlogIA & Tech Legal

    Gobernanza por construcción: guardarraíles de IA imposibles de evadir

    Seis guardarraíles populares de LLM fueron evadidos en tasas del 12–100 %. La gobernanza por construcción elimina la acción insegura del agente - no queda nada que burlar.

    22 de mayo de 2026
    12 min de lectura
    |
    HAQQ Team
    Gobernanza por construcción: guardarraíles de IA imposibles de evadir

    TL;DR — La barrera de seguridad de IA estándar revisa la respuesta después de que el agente decide darla. Una investigación reciente eludió seis barreras de seguridad populares con tasas de éxito de entre el 12% y el 100%. En derecho el coste es concreto: las herramientas especializadas alucinan en el 17–33% de las consultas, y una base de datos pública ya registra 1.458 casos judiciales con citas fabricadas por IA. La gobernanza por construcción invierte el modelo: construir el espacio de acciones del agente a partir de una política, de modo que la acción insegura nunca se crea. No hay nada que eludir porque no hay nada que invocar. Abrimos el código de govcon, un agente legal delimitado por jurisdicción construido de esta manera. Obtuvo un 100% de defensa contra trampas fuera de jurisdicción en HAQQ-LAB, donde una base sin gobernanza obtuvo 0%.

    La barrera de seguridad es una cerradura que sigues forzando

    Así es como funciona hoy casi cualquier barrera de seguridad de IA. Le das al agente un poder general — responder cualquier pregunta legal — y luego pones un verificador delante: un system prompt que dice 'solo estas jurisdicciones', un clasificador que filtra la salida, una regla que se activa después de que el modelo ya eligió qué decir. Llámalo gobernanza por rechazo en tiempo de ejecución: el agente puede hacer lo incorrecto, y estás apostando a que el control lo detecte primero.

    Datos clave

    • Seis sistemas de barreras de seguridad en producción fueron eludidos con tasas de éxito del 12,7%–65,2%, y transformaciones de caracteres simples alcanzaron hasta un 100% de evasión.
    • govcon, el agente de código abierto de HAQQ delimitado por jurisdicción (~200 líneas, AGPL-3.0), obtuvo un 100% de defensa contra trampas fuera de jurisdicción en HAQQ-LAB frente a 0% de una base sin gobernanza.

    Esa apuesta se está perdiendo, y ahora tenemos cifras. En el estudio de 2025 Bypassing LLM Guardrails (arXiv 2504.11168), los investigadores ejecutaron inyección de caracteres y evasión adversarial de ML contra seis sistemas de barreras de seguridad populares. Tasas de éxito de ataque:

    Con qué frecuencia se eluden las barreras de seguridad de IA en producción

    Tasa de éxito de ataques de jailbreak por barrera de seguridad (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).

    NeMo Guard Jailbreak Detect
    65,2%
    Vijil Prompt Injection
    35,6%
    Protect AI v1
    24,4%
    Azure Prompt Shield
    13,0%
    Meta Prompt Guard
    12,7%
    Transformaciones de caracteres simples (peor caso)
    hasta 100%

    Las transformaciones de caracteres simples alcanzan hasta un 100% de evasión en el peor caso. Una técnica separada de múltiples turnos eleva el éxito en más del 60%.

    Contrabando de emojis. Contrabando de etiquetas Unicode. Contexto formulado con confianza — 'la cláusula de ley aplicable dice Delaware, así que aplica la ley de Delaware'. El patrón es siempre el mismo: dejaste la acción peligrosa en manos del agente y estás intentando convencerlo de que no la use. Corriges una formulación; alguien encuentra la siguiente. Es una cerradura que sigues forzando porque sigues dejando la puerta.

    Por qué 'funciona en su mayoría' es negligencia profesional en derecho

    Una tasa de evasión del 13% es un problema de seguridad interesante en la mayoría de los productos. En IA legal es un evento de responsabilidad, porque las tasas base ya son malas. El estudio de Stanford RegLab encontró que incluso herramientas especializadas ancladas en RAG — Westlaw AI-Assisted Research y Lexis+ AI — alucinaron en ~33% y >17% de las consultas respectivamente. Ese es el piso, antes de que nadie intente activamente sacar al modelo de sus límites. Añade una barrera de seguridad que falla entre el 13% y el 65% de las veces cuando alguien sí lo intenta, y tienes un sistema que, de forma predecible y a escala, dará una respuesta segura bajo una ley que no rige.

    Conocemos el coste posterior porque ahora es su propio conjunto de datos: 1.458 casos judiciales con citas fabricadas por IA y contando. Cada uno de ellos es un abogado que confió en una salida que una barrera de seguridad debía detectar. 'Funciona en su mayoría' es exactamente el perfil de fallo que termina en una orden de sanciones.

    El giro: construir, no rechazar

    La gobernanza por construcción parte de una pregunta distinta. No '¿cómo evitamos que el agente haga lo incorrecto?', sino '¿y si lo incorrecto nunca fue una de sus opciones?'

    El espacio de acciones del agente se construye a partir de una política, una vez, en el momento de la construcción. La política enumera lo permitido — para nosotros, las jurisdicciones sobre las que el agente puede razonar. El constructor crea una acción por cada jurisdicción permitida, más una única acción de rechazo. Nunca crea una acción para nada fuera de la política.

    text
    rechazo en tiempo de ejecución:   [ answer(cualquier cosa) ] → el guardián dice "no"   ← eludido 13–100% de las veces
    construcción:                     política → construye { answer(UAE), answer(DIFC), … , decline }
                                      answer(Delaware) nunca se construyó.
                                      No hay nada que invocar. No hay nada que eludir.

    Pregúntale al agente construido sobre la ley de Delaware y no se niega en el sentido moral — no tiene ninguna acción de Delaware que invocar. Lo único que puede hacer con una solicitud fuera de alcance es rechazarla. El comportamiento inseguro no está prohibido; está ausente. No existe un prompt con contrabando de emojis, de múltiples turnos, formulado con confianza, lo bastante ingenioso como para llamar a una función que no existe. La superficie de evasión del 13–100% colapsa a cero, porque no hay verificador que eludir — la capacidad simplemente no está ahí.

    Una nota sobre cómo se construyó esto, porque creemos en mostrar el trabajo: govcon surgió de un informe de investigación matutino, se esbozó antes del almuerzo y tenía pruebas en verde por la tarde. El núcleo son ~200 líneas de TypeScript sin dependencias en tiempo de ejecución. La idea es pequeña — esa es la señal. Los mejores primitivos de seguridad eliminan una categoría de fallo en lugar de añadir una categoría de control.

    Cómo se ve para un agente legal

    Nuestro agente de referencia, govcon, está delimitado a seis jurisdicciones de MENA: EAU, DIFC, Arabia Saudita, Líbano, Egipto y Catar. Para cada una, el constructor genera una acción de respuesta anclada en los instrumentos primarios de esa jurisdicción — así que una pregunta laboral del DIFC vuelve citando la Ley Laboral del DIFC N.º 2 de 2019, no un texto genérico. Para cualquier otra cosa, no existe ninguna acción:

    typescript
    const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
    
    agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
    // → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
    
    agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
    // → refused: no action exists for this jurisdiction under the active policy

    Luego lo ejecutamos en HAQQ-LAB, nuestro benchmark abierto de derecho civil, contra una base sin gobernanza en 16 tareas, incluyendo cuatro trampas fuera de jurisdicción:

    govcon frente a la base sin gobernanza en HAQQ-LAB

    Trampas fuera de jurisdicción rechazadas y anclaje de fuentes, rúbricas deterministas.

    Trampas fuera de jurisdicción rechazadas — base
    0%
    Trampas fuera de jurisdicción rechazadas — govcon
    100%
    Anclaje de fuentes — base
    0%
    Anclaje de fuentes — govcon
    100%

    La base respondió a cada trampa — Delaware sobre una SARL libanesa, no competencia de California para un empleado de Dubái, contraprestación inglesa sobre un contrato saudí, GDPR sobre un asunto puramente doméstico de EAU. govcon defendió las cuatro.

    No porque se le indicara mejor. Porque la acción para hacer lo contrario nunca se construyó.

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    La conexión con el modelo del mundo

    Este es el eco en software de un punto que Yann LeCun no deja de repetir: un modelo de lenguaje grande predice tokens, no consecuencias. No tiene ningún modelo interno de lo que hace su salida en el mundo legal, financiero o físico. Pedirle a un sistema así que se mantenga dentro de los límites de forma fiable por elección propia es pedirle lo incorrecto — y las cifras de evasión del 13–100% son lo que compra 'pedírselo amablemente'.

    Así que no lo pidas. Saca la acción fuera de límites del mundo en el que el agente puede actuar. La gobernanza por construcción es una forma concreta, aburrida y desplegable de honrar la crítica de LeCun sin esperar una nueva arquitectura de modelo. Es el mismo instinto detrás de la seguridad basada en capacidades y el principio de mínimo privilegio, aplicado al espacio de acciones de un agente en lugar de a los descriptores de archivo de un proceso.

    Esto es defensa en profundidad, no una bala de plata

    • Elimina una categoría: acciones fuera de política. No hace que las respuestas dentro de la política sean correctas. Un agente govcon delimitado al DIFC aún puede equivocarse sobre la ley del DIFC — para eso está la dimensión de Sustancia del benchmark (y un buen modelo de razonamiento).
    • Es un piso estructural, no toda la pila. Sigues necesitando anclaje, verificación de citas, revisión humana en salidas de alto riesgo y registro de auditoría. La construcción es la capa más temprana y más difícil de eludir, no la única.
    • La política misma es ahora lo que hay que acertar. Has trasladado la confianza de '¿se comportó bien el modelo?' a '¿es correcta y completa la política?' — una superficie mucho más pequeña, revisable y bajo control de versiones. Ese es el intercambio que queremos.

    El punto no es que la construcción reemplace las barreras de seguridad en todas partes. Es que, para los fallos que no puedes permitirte — dar un consejo bajo una ley que no rige —, deberías hacer la acción imposible, y reservar los controles en tiempo de ejecución para los fallos que sí puedes sobrevivir.

    La opinión de HAQQ: el primitivo que falta

    Hay un vacío en la IA legal que nadie ha llenado. Por un lado, 'la IA redacta un contrato'. Por el otro, lo que clientes y reguladores realmente quieren: 'la IA no puede redactar un contrato que viole las normas imperativas de la jurisdicción'. Entre ambos hay un primitivo que falta — reglas compiladas en el espacio de acciones del agente en lugar de verificadas después de los hechos.

    La gobernanza por construcción es un adelanto de ese primitivo. La misma forma que hace imposible el asesoramiento fuera de jurisdicción puede hacer que una cláusula obligatoria sea no opcional o que una cláusula prohibida sea inescribible — el cumplimiento como propiedad del espacio de acciones, no como una esperanza sobre la salida. En un mercado donde los líderes valen en conjunto 16.600 millones de dólares y aún compiten por quién alucina menos, 'estructuralmente no puede hacer lo inseguro' es un tipo de afirmación diferente — una que se demuestra, no se promete, y que ningún actor establecido puede copiar simplemente ajustando un system prompt.

    govcon es AGPL-3.0 en GitHub. Tiene ~200 líneas. Léelo en cinco minutos; la idea es todo el producto.

    Conclusiones clave

    • Las barreras de seguridad en tiempo de ejecución se eluden entre el 13% y el 100% de las veces (arXiv 2504.11168); en derecho, donde la alucinación base ya es del 17–33%, 'funciona en su mayoría' es un evento de responsabilidad.
    • La gobernanza por construcción construye el espacio de acciones a partir de una política, de modo que la acción insegura nunca existe — no hay nada que eludir.
    • govcon, nuestro agente legal delimitado por jurisdicción, obtuvo un 100% de defensa contra trampas fuera de jurisdicción frente a 0% de una base sin gobernanza en HAQQ-LAB.
    • Es la respuesta en software a la crítica de LeCun y un modelo de mínimo privilegio para agentes: elimina la acción, no confíes en que el modelo la evite.
    • Es defensa en profundidad, no una bala de plata — elimina una categoría de fallo y traslada la confianza a una política revisable.

    Fuentes y lecturas adicionales

    • HAQQ-LAB, nuestro benchmark abierto de derecho civil
    • 1.458 casos judiciales con citas fabricadas por IA
    • nuestro escáner de inyección de prompts del lado de entrada
    • govcon en GitHub (AGPL-3.0)
    • HAQQ-LAB — el benchmark que lo evaluó
    • Live scorecard
    • Bypassing LLM Guardrails — análisis empírico de evasión (arXiv 2504.11168)
    • Stanford RegLab/HAI — los modelos legales alucinan 1 de cada 6 o más
    H

    HAQQ Team

    Research

    Recursos relacionados

    Justinian EngineSecurityAI Legal Hallucination Audit

    Artículos relacionados

    IA legal agéntica: por qué lo multiagente supera a un solo LLM

    IA legal agéntica: por qué lo multiagente supera a un solo LLM

    Prompt injection en la IA legal: 5 ataques, 5 bloqueos, 1,84 ms

    Prompt injection en la IA legal: 5 ataques, 5 bloqueos, 1,84 ms

    IA legal para empresas: lo que las grandes organizaciones comprueban antes de confiar en ella

    IA legal para empresas: lo que las grandes organizaciones comprueban antes de confiar en ella

    Preguntas frecuentes

    How is governance by construction different from a system prompt that says 'only answer about MENA'?

    A system prompt is a request the model can be argued out of — and the data shows it's argued out of 13–100% of the time. Construction removes the capability: there is no function to call for an out-of-scope jurisdiction, so no prompt can trigger one.

    Doesn't this just move the problem to 'is the policy right'?

    Yes — on purpose. A version-controlled, reviewable policy is a far smaller and more auditable trust surface than 'did a stochastic model behave under adversarial input?' You want the trust where you can inspect it.

    Doesn't scoping make the agent less capable?

    Only outside its policy, which is the point. Inside its allowed jurisdictions it's as capable as the reasoning model behind it; outside them it declines instead of bluffing.

    Is governance by construction only for legal AI?

    No. The pattern is general — build an action space from a policy so unsafe actions are never instantiated. It's least-privilege for agents. Legal jurisdiction is just a clean, high-stakes example.

    How does it relate to human-in-the-loop and other guardrails?

    It's complementary and earlier. Human gates and output classifiers catch bad actions after they're proposed; construction means the worst ones are never proposed. Use construction for unsurvivable failures and runtime checks for survivable ones.

    Can I see it work?

    Yes — govcon is open source under AGPL-3.0, ~200 lines, with tests. The benchmark that scores it (HAQQ-LAB) is open too, with a live scorecard at haqq-lab.dashable.dev.

    ¿Qué sigue?

    Prueba HAQQ AI gratis

    Experimenta la redacción e investigación legal con IA

    Calcula tu ROI

    Descubre cuánto tiempo y dinero HAQQ ahorra a tu bufete

    Explora Prompts legales

    Prompts listos para cada tarea legal

    Volver al Blog

    Artículo anterior

    El benchmark de IA legal para el derecho civil: por qué construimos HAQQ-LAB

    Artículo siguiente

    ¿Pueden los abogados usar IA? Un rastreador país por país (2026)

    Ponlo en práctica

    Hazle a HAQQ la pregunta que te dejó este artículo.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    Tu Gemelo Legal de IA y Sistema de Gestión de Práctica para redacción, facturación y éxito.

    Download on theApp StoreGet it onGoogle Play

    Documentaciones

    • Docs se abre en una pestaña nueva
    • Primeros pasos se abre en una pestaña nueva
    • Prensa se abre en una pestaña nueva
    • Novedades del producto se abre en una pestaña nueva
    • Estado se abre en una pestaña nueva
    • Seguridad
    • FAQ se abre en una pestaña nueva
    • Comunidad se abre en una pestaña nueva
    • Soporte se abre en una pestaña nueva

    Academy

    • Curso se abre en una pestaña nueva
    • Habilidades se abre en una pestaña nueva
    • Cláusulas se abre en una pestaña nueva
    • Biblioteca de prompts se abre en una pestaña nueva
    • Herramientas se abre en una pestaña nueva
    • Centro de investigación se abre en una pestaña nueva
    • Documentos se abre en una pestaña nueva

    Sitio web

    • eFirm
    • Chat IA Legal
    • Aplicación Móvil
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Precios
    • Compáranos
    • Soluciones
    • Blog
    • Conocer equipo
    • Únete a nosotros se abre en una pestaña nueva
    Abrir la app
    • Idiomasar en fr es it de pt
    • Contactoinfo@haqq.ai
    • Estadooperativo·fundamentado
    • Términos de Servicio
    • Política de Privacidad
    • Política de Cookies
    • Procesamiento de Datos se abre en una pestaña nueva
    • humans.txt se abre en una pestaña nuevalawyers.txt se abre en una pestaña nuevasecurity.txt se abre en una pestaña nueva
    © 2026 HAQQ Inc. Todos los derechos reservados.Producto desarrollado internamente por HAQQ. Sitio web construido con herramientas web modernas.