Cinco mil millones de personas no tienen acceso a ayuda legal. Antes de pedirle a nadie que confíe en la IA para sus preguntas legales, necesitábamos demostrar que realmente funciona. Así que hicimos la prueba: 100 preguntas legales reales, tres modelos de frontera, un marco de evaluación estructurado.
El planteamiento
Extrajimos las 100 publicaciones más populares de todos los tiempos de r/legaladvice: preguntas reales de personas reales que abarcan disputas entre arrendador e inquilino, derecho laboral, batallas por la custodia, defensa penal, lesiones personales, y todo lo demás. Longitud media de la publicación: más de 2.200 caracteres de complejidad legal genuina.
Datos clave
- Claude Sonnet 4 aprobó 88/100 preguntas legales reales, GPT-4o 87/100, y Gemini 2.5 Flash 78/100, bajo un prompting de cadena de razonamiento idéntico.
- La dimensión más débil para los tres modelos fue Advertencias Apropiadas (3,0–3,15/5), no la precisión legal (3,98–4,30/5).
- En 20 preguntas nuevas de r/legaladvice de las 48 horas previas: Claude 95%, GPT-4o 90%, Gemini 85%.
Cada pregunta se procesó a través de tres modelos de frontera con un prompting de cadena de razonamiento idéntico:
- Claude Sonnet 4 (Anthropic)
- GPT-4o (OpenAI)
- Gemini 2.5 Flash (Google)
Todos los modelos recibieron el mismo prompt de sistema: actuar como un abogado estadounidense experimentado, seguir un proceso de razonamiento estructurado — identificar la jurisdicción, detectar los problemas, citar el derecho aplicable, analizar y luego aconsejar.
Mismo prompt. Mismas preguntas. Tres motores distintos. Que hablen las respuestas.
La evaluación
Usamos Claude como evaluador estructurado, calificando cada respuesta en cinco dimensiones: Precisión Legal (¿son correctas las leyes citadas?), Integridad de Cuestiones (¿detectó todos los problemas legales?), Calidad del Razonamiento (¿es lógica la cadena de razonamiento?), Valor Práctico (¿ayudaría este consejo a alguien a dar los siguientes pasos correctos?), y Advertencias Apropiadas (¿incluye los descargos adecuados y recomienda un abogado real?).
Criterio de aprobación: puntuación media ≥ 3,5/5 Y ninguna dimensión individual por debajo de 2/5. Sí, usar IA para evaluar IA introduce sesgo. Lo abordamos más abajo.
Los resultados
Claude Sonnet 4 aprobó 88 de 100 preguntas (88%), GPT-4o aprobó 87 (87%) y Gemini 2.5 Flash aprobó 78 (78%). Los tres demostraron un razonamiento legal estructuralmente sólido en escenarios diversos del mundo real.
Desglose por dimensión
Las puntuaciones de precisión legal oscilaron entre 3,98 y 4,30 sobre 5. La Integridad de Cuestiones fue más alta para Gemini (4,82) y Claude (4,58). El Valor Práctico fue la dimensión más fuerte de Claude, con 4,73. Pero la dimensión más débil en todos los modelos, Advertencias Apropiadas, es la que cuenta la historia más importante.
Lo que aprendimos
1. La capacidad en bruto ya está aquí
Todos los modelos identificaron el área de derecho correcta, detectaron los problemas clave y ofrecieron un consejo accionable en la gran mayoría de los casos. Las puntuaciones de precisión legal oscilaron entre 3,98 y 4,30 sobre 5, en 100 preguntas diversas del mundo real. Esto no es una demo de juguete. Esto es razonamiento legal de nivel de producción.
2. El talón de Aquiles son las advertencias, no la precisión
La dimensión más débil en los tres modelos fue Advertencias Apropiadas (3,0-3,15). Los modelos se lanzaban a un análisis legal detallado — a menudo correcto — sin advertir adecuadamente que no están ofreciendo asesoría legal, o sin recomendar que la persona consulte a un abogado local.
Esta es exactamente la razón por la que los modelos de IA en bruto no son suficientes. Un consejo técnicamente correcto entregado con una confianza inapropiada es peligroso. Se necesita una capa adicional — barreras de seguridad, descargos de responsabilidad, rutas de escalamiento — que convierta un modelo de lenguaje en una herramienta legal responsable. Eso es lo que construimos en HAQQ.
3. La consistencia vence al rendimiento máximo
Gemini 2.5 Flash tuvo las puntuaciones medias más altas en Precisión Legal (4,30) e Integridad de Cuestiones (4,82), y sin embargo la tasa de aprobación más baja (78%). Algunas respuestas quedaron truncadas. Otras se saltaron los descargos de responsabilidad por completo.
Para el trabajo legal, no puedes permitirte un modelo que sea brillante el 78% del tiempo y poco fiable el resto. La consistencia es el requisito del producto. Por eso HAQQ no depende de un solo modelo — enrutamos, validamos y verificamos entre múltiples motores para asegurar que cada resultado cumple un estándar de calidad antes de llegar al usuario.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
4. Claude y GPT-4o van cabeza a cabeza
Con 88% frente a 87%, la diferencia no es estadísticamente significativa. Claude se adelantó ligeramente en Valor Práctico (4,73 frente a 4,21) — su consejo incluía pasos siguientes más concretos. GPT-4o fue sólido en general pero ligeramente menos estructurado. La conclusión: la elección del modelo importa menos que lo que construyes alrededor de él.
La cuestión de la autoevaluación
Usamos Claude como juez para los tres modelos, incluido él mismo. Limitaciones conocidas: posible ventaja de local (Claude podría favorecer su propio estilo de razonamiento), sesgo de forma frente a fondo (el evaluador podría premiar patrones estructurales que reconoce), y ausencia de verdad de referencia (sin validación de abogados, estamos midiendo consenso entre IA, no precisión legal).
Nuestro próximo paso es la validación por abogados. Pero incluso con autoevaluación, la señal es clara: los modelos de frontera han cruzado un umbral en el que su razonamiento legal es estructuralmente sólido, está bien citado y es prácticamente útil en la mayoría de los casos.
Validación en vivo: 20 preguntas nuevas
El benchmark de las 100 mejores usa publicaciones históricas. Para demostrar que esto no es solo reconocimiento de patrones, ejecutamos el mismo proceso sobre 20 preguntas nuevas publicadas en r/legaladvice en las últimas 48 horas. Claude Sonnet 4 obtuvo 95%, GPT-4o alcanzó 90% y Gemini 2.5 Flash llegó a 85%. Los tres modelos rindieron incluso mejor en preguntas nuevas.
Después tomamos la mejor respuesta para cada pregunta entre los tres modelos, la reescribimos en lenguaje natural y la publicamos como respuesta. La sustancia estaba ahí. El formato era humano.
Por qué esto importa para HAQQ
Esto es lo que este benchmark realmente demuestra: la capa de IA está resuelta. Los modelos pueden razonar sobre el derecho. Pueden detectar problemas, citar leyes y dar consejos prácticos que resisten el escrutinio entre el 85% y el 95% de las veces.
Pero "entre el 85% y el 95% de las veces" no es suficientemente bueno para el trabajo legal. La brecha entre un modelo capaz y un producto legal confiable es todo lo que hacemos en HAQQ: enrutamiento multimodelo (elegimos la mejor respuesta entre modelos para cada consulta), barreras de seguridad y advertencias (cada respuesta incluye descargos adecuados y escalamiento a abogados humanos), contexto específico de la firma (respuestas específicas a las áreas de práctica y el trabajo previo de cada firma), y fuentes verificadas (sin citas de casos alucinadas — cada referencia es rastreable).
La pregunta nunca fue 'puede la IA razonar legalmente'. La respuesta es sí — 88 de cada 100 veces con el prompting correcto. La pregunta real es: ¿quién construye el producto que lo hace seguro, consistente y útil para los 5.000 millones de personas que lo necesitan? Ese es HAQQ.
Metodología
- Fuente: las 100 publicaciones más populares de r/legaladvice (de todos los tiempos) + 20 publicaciones nuevas, filtradas para quedarse con publicaciones de texto sustanciales
- Modelos: Claude Sonnet 4, GPT-4o, Gemini 2.5 Flash — todos a través de OpenRouter con prompts de sistema idénticos
- Prompting: cadena de razonamiento con un marco estructurado de razonamiento legal de 5 pasos
- Evaluación: Claude Sonnet 4 como evaluador único, 5 dimensiones en una escala de 1 a 5
- Umbral de aprobación: media ≥ 3,5 Y mínimo ≥ 2 en todas las dimensiones
- Reproducibilidad: todo el código, las preguntas, las respuestas y las evaluaciones están disponibles en el repositorio de GitHub



