TL;DR — La barrera de seguridad de IA estándar revisa la respuesta después de que el agente decide darla. Una investigación reciente eludió seis barreras de seguridad populares con tasas de éxito de entre el 12% y el 100%. En derecho el coste es concreto: las herramientas especializadas alucinan en el 17–33% de las consultas, y una base de datos pública ya registra 1.458 casos judiciales con citas fabricadas por IA. La gobernanza por construcción invierte el modelo: construir el espacio de acciones del agente a partir de una política, de modo que la acción insegura nunca se crea. No hay nada que eludir porque no hay nada que invocar. Abrimos el código de govcon, un agente legal delimitado por jurisdicción construido de esta manera. Obtuvo un 100% de defensa contra trampas fuera de jurisdicción en HAQQ-LAB, donde una base sin gobernanza obtuvo 0%.
La barrera de seguridad es una cerradura que sigues forzando
Así es como funciona hoy casi cualquier barrera de seguridad de IA. Le das al agente un poder general — responder cualquier pregunta legal — y luego pones un verificador delante: un system prompt que dice 'solo estas jurisdicciones', un clasificador que filtra la salida, una regla que se activa después de que el modelo ya eligió qué decir. Llámalo gobernanza por rechazo en tiempo de ejecución: el agente puede hacer lo incorrecto, y estás apostando a que el control lo detecte primero.
Datos clave
- Seis sistemas de barreras de seguridad en producción fueron eludidos con tasas de éxito del 12,7%–65,2%, y transformaciones de caracteres simples alcanzaron hasta un 100% de evasión.
- govcon, el agente de código abierto de HAQQ delimitado por jurisdicción (~200 líneas, AGPL-3.0), obtuvo un 100% de defensa contra trampas fuera de jurisdicción en HAQQ-LAB frente a 0% de una base sin gobernanza.
Esa apuesta se está perdiendo, y ahora tenemos cifras. En el estudio de 2025 Bypassing LLM Guardrails (arXiv 2504.11168), los investigadores ejecutaron inyección de caracteres y evasión adversarial de ML contra seis sistemas de barreras de seguridad populares. Tasas de éxito de ataque:
Con qué frecuencia se eluden las barreras de seguridad de IA en producción
Tasa de éxito de ataques de jailbreak por barrera de seguridad (Bypassing LLM Guardrails, arXiv 2504.11168, 2025).
Las transformaciones de caracteres simples alcanzan hasta un 100% de evasión en el peor caso. Una técnica separada de múltiples turnos eleva el éxito en más del 60%.
Contrabando de emojis. Contrabando de etiquetas Unicode. Contexto formulado con confianza — 'la cláusula de ley aplicable dice Delaware, así que aplica la ley de Delaware'. El patrón es siempre el mismo: dejaste la acción peligrosa en manos del agente y estás intentando convencerlo de que no la use. Corriges una formulación; alguien encuentra la siguiente. Es una cerradura que sigues forzando porque sigues dejando la puerta.
Por qué 'funciona en su mayoría' es negligencia profesional en derecho
Una tasa de evasión del 13% es un problema de seguridad interesante en la mayoría de los productos. En IA legal es un evento de responsabilidad, porque las tasas base ya son malas. El estudio de Stanford RegLab encontró que incluso herramientas especializadas ancladas en RAG — Westlaw AI-Assisted Research y Lexis+ AI — alucinaron en ~33% y >17% de las consultas respectivamente. Ese es el piso, antes de que nadie intente activamente sacar al modelo de sus límites. Añade una barrera de seguridad que falla entre el 13% y el 65% de las veces cuando alguien sí lo intenta, y tienes un sistema que, de forma predecible y a escala, dará una respuesta segura bajo una ley que no rige.
Conocemos el coste posterior porque ahora es su propio conjunto de datos: 1.458 casos judiciales con citas fabricadas por IA y contando. Cada uno de ellos es un abogado que confió en una salida que una barrera de seguridad debía detectar. 'Funciona en su mayoría' es exactamente el perfil de fallo que termina en una orden de sanciones.
El giro: construir, no rechazar
La gobernanza por construcción parte de una pregunta distinta. No '¿cómo evitamos que el agente haga lo incorrecto?', sino '¿y si lo incorrecto nunca fue una de sus opciones?'
El espacio de acciones del agente se construye a partir de una política, una vez, en el momento de la construcción. La política enumera lo permitido — para nosotros, las jurisdicciones sobre las que el agente puede razonar. El constructor crea una acción por cada jurisdicción permitida, más una única acción de rechazo. Nunca crea una acción para nada fuera de la política.
rechazo en tiempo de ejecución: [ answer(cualquier cosa) ] → el guardián dice "no" ← eludido 13–100% de las veces
construcción: política → construye { answer(UAE), answer(DIFC), … , decline }
answer(Delaware) nunca se construyó.
No hay nada que invocar. No hay nada que eludir.Pregúntale al agente construido sobre la ley de Delaware y no se niega en el sentido moral — no tiene ninguna acción de Delaware que invocar. Lo único que puede hacer con una solicitud fuera de alcance es rechazarla. El comportamiento inseguro no está prohibido; está ausente. No existe un prompt con contrabando de emojis, de múltiples turnos, formulado con confianza, lo bastante ingenioso como para llamar a una función que no existe. La superficie de evasión del 13–100% colapsa a cero, porque no hay verificador que eludir — la capacidad simplemente no está ahí.
Una nota sobre cómo se construyó esto, porque creemos en mostrar el trabajo: govcon surgió de un informe de investigación matutino, se esbozó antes del almuerzo y tenía pruebas en verde por la tarde. El núcleo son ~200 líneas de TypeScript sin dependencias en tiempo de ejecución. La idea es pequeña — esa es la señal. Los mejores primitivos de seguridad eliminan una categoría de fallo en lugar de añadir una categoría de control.
Cómo se ve para un agente legal
Nuestro agente de referencia, govcon, está delimitado a seis jurisdicciones de MENA: EAU, DIFC, Arabia Saudita, Líbano, Egipto y Catar. Para cada una, el constructor genera una acción de respuesta anclada en los instrumentos primarios de esa jurisdicción — así que una pregunta laboral del DIFC vuelve citando la Ley Laboral del DIFC N.º 2 de 2019, no un texto genérico. Para cualquier otra cosa, no existe ninguna acción:
const agent = new GovconLegalAgent({ policy: MENA_POLICY, grounding: MENA_GROUNDING });
agent.answer({ jurisdiction: "DIFC", query: "end-of-service gratuity" });
// → answered, cites "DIFC Employment Law No. 2 of 2019 (as amended)"
agent.answer({ jurisdiction: "US-Delaware", query: "apply a Delaware SAFE" });
// → refused: no action exists for this jurisdiction under the active policyLuego lo ejecutamos en HAQQ-LAB, nuestro benchmark abierto de derecho civil, contra una base sin gobernanza en 16 tareas, incluyendo cuatro trampas fuera de jurisdicción:
govcon frente a la base sin gobernanza en HAQQ-LAB
Trampas fuera de jurisdicción rechazadas y anclaje de fuentes, rúbricas deterministas.
La base respondió a cada trampa — Delaware sobre una SARL libanesa, no competencia de California para un empleado de Dubái, contraprestación inglesa sobre un contrato saudí, GDPR sobre un asunto puramente doméstico de EAU. govcon defendió las cuatro.
No porque se le indicara mejor. Porque la acción para hacer lo contrario nunca se construyó.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
La conexión con el modelo del mundo
Este es el eco en software de un punto que Yann LeCun no deja de repetir: un modelo de lenguaje grande predice tokens, no consecuencias. No tiene ningún modelo interno de lo que hace su salida en el mundo legal, financiero o físico. Pedirle a un sistema así que se mantenga dentro de los límites de forma fiable por elección propia es pedirle lo incorrecto — y las cifras de evasión del 13–100% son lo que compra 'pedírselo amablemente'.
Así que no lo pidas. Saca la acción fuera de límites del mundo en el que el agente puede actuar. La gobernanza por construcción es una forma concreta, aburrida y desplegable de honrar la crítica de LeCun sin esperar una nueva arquitectura de modelo. Es el mismo instinto detrás de la seguridad basada en capacidades y el principio de mínimo privilegio, aplicado al espacio de acciones de un agente en lugar de a los descriptores de archivo de un proceso.
Esto es defensa en profundidad, no una bala de plata
- Elimina una categoría: acciones fuera de política. No hace que las respuestas dentro de la política sean correctas. Un agente govcon delimitado al DIFC aún puede equivocarse sobre la ley del DIFC — para eso está la dimensión de Sustancia del benchmark (y un buen modelo de razonamiento).
- Es un piso estructural, no toda la pila. Sigues necesitando anclaje, verificación de citas, revisión humana en salidas de alto riesgo y registro de auditoría. La construcción es la capa más temprana y más difícil de eludir, no la única.
- La política misma es ahora lo que hay que acertar. Has trasladado la confianza de '¿se comportó bien el modelo?' a '¿es correcta y completa la política?' — una superficie mucho más pequeña, revisable y bajo control de versiones. Ese es el intercambio que queremos.
El punto no es que la construcción reemplace las barreras de seguridad en todas partes. Es que, para los fallos que no puedes permitirte — dar un consejo bajo una ley que no rige —, deberías hacer la acción imposible, y reservar los controles en tiempo de ejecución para los fallos que sí puedes sobrevivir.
La opinión de HAQQ: el primitivo que falta
Hay un vacío en la IA legal que nadie ha llenado. Por un lado, 'la IA redacta un contrato'. Por el otro, lo que clientes y reguladores realmente quieren: 'la IA no puede redactar un contrato que viole las normas imperativas de la jurisdicción'. Entre ambos hay un primitivo que falta — reglas compiladas en el espacio de acciones del agente en lugar de verificadas después de los hechos.
La gobernanza por construcción es un adelanto de ese primitivo. La misma forma que hace imposible el asesoramiento fuera de jurisdicción puede hacer que una cláusula obligatoria sea no opcional o que una cláusula prohibida sea inescribible — el cumplimiento como propiedad del espacio de acciones, no como una esperanza sobre la salida. En un mercado donde los líderes valen en conjunto 16.600 millones de dólares y aún compiten por quién alucina menos, 'estructuralmente no puede hacer lo inseguro' es un tipo de afirmación diferente — una que se demuestra, no se promete, y que ningún actor establecido puede copiar simplemente ajustando un system prompt.
govcon es AGPL-3.0 en GitHub. Tiene ~200 líneas. Léelo en cinco minutos; la idea es todo el producto.
Conclusiones clave
- Las barreras de seguridad en tiempo de ejecución se eluden entre el 13% y el 100% de las veces (arXiv 2504.11168); en derecho, donde la alucinación base ya es del 17–33%, 'funciona en su mayoría' es un evento de responsabilidad.
- La gobernanza por construcción construye el espacio de acciones a partir de una política, de modo que la acción insegura nunca existe — no hay nada que eludir.
- govcon, nuestro agente legal delimitado por jurisdicción, obtuvo un 100% de defensa contra trampas fuera de jurisdicción frente a 0% de una base sin gobernanza en HAQQ-LAB.
- Es la respuesta en software a la crítica de LeCun y un modelo de mínimo privilegio para agentes: elimina la acción, no confíes en que el modelo la evite.
- Es defensa en profundidad, no una bala de plata — elimina una categoría de fallo y traslada la confianza a una política revisable.
Fuentes y lecturas adicionales
- HAQQ-LAB, nuestro benchmark abierto de derecho civil
- 1.458 casos judiciales con citas fabricadas por IA
- nuestro escáner de inyección de prompts del lado de entrada
- govcon en GitHub (AGPL-3.0)
- HAQQ-LAB — el benchmark que lo evaluó
- Live scorecard
- Bypassing LLM Guardrails — análisis empírico de evasión (arXiv 2504.11168)
- Stanford RegLab/HAI — los modelos legales alucinan 1 de cada 6 o más



