La humanidad ha decidido que, si una máquina escribe algo con suficiente confianza, tiene que ser correcto. Los abogados, por desgracia, no tienen ese lujo. A los tribunales no les importa cuán fluido suene un argumento. Les importa si el procedimiento es correcto y si la ley realmente aplica.
Así que hicimos un experimento sencillo.
El prompt
"Prepara una estrategia de litigio bajo la ley de Nueva York para una factura impagada de 250.000 dólares."
Dimos el mismo prompt a varios modelos de lenguaje líderes. Los modelos evaluados: HAQQ, GPT-5.2, Claude Opus 4.6, Gemini 3.1 Pro, Perplexity Sonar, Mistral Large 3 y Grok 4.1.
El objetivo no era ver quién escribía el párrafo más bonito. Era ver qué sistema podía producir algo que realmente se pareciera a una estrategia de litigio real.
Porque en el trabajo legal, sonar correcto y ser correcto son cosas muy distintas.
Por qué importa este caso de uso
Las facturas impagadas son una de las disputas comerciales más habituales. Una factura impagada de 250.000 dólares se sitúa en un incómodo punto medio, donde el monto es lo bastante grande como para justificar el litigio, pero lo bastante pequeño como para que la eficiencia importe.
Una estrategia competente bajo la ley de Nueva York suele incluir:
- Evaluar el contrato y la evidencia
- Determinar las causas de acción (incumplimiento de contrato, cuenta liquidada)
- Identificar atajos procesales como CPLR §3213
- Elegir el foro correcto
- Planificar la fase de descubrimiento y el juicio sumario
- Diseñar una estrategia de cobro después de la sentencia
Ese último punto es el que más gente olvida. Ganar el caso no es el objetivo. Cobrar es el objetivo.
Qué buscamos
En lugar de juzgar la calidad de la escritura, evaluamos los resultados con criterios legales prácticos:
- Precisión jurídica — ¿Identificó correctamente el modelo el marco legal aplicable?
- Comprensión procesal — ¿Reflejó cómo funciona realmente el litigio en los tribunales de Nueva York?
- Pensamiento estratégico — ¿Priorizó la vía más rápida hacia el cobro?
- Citas / Autoridades — ¿Hizo referencia a la CPLR y al procedimiento específico de Nueva York?
- Estructura — ¿Estaba el resultado organizado para uso práctico?
- Calidad lista para el cliente — ¿Podría entregarse al cliente sin reescribirlo?
Estos factores determinan si una respuesta es útil para un abogado o solo un resumen que impresiona a simple vista.
Qué produjeron los modelos
La mayoría de los sistemas generaron algo que parecía una estrategia de litigio. Pero al leer con detenimiento aparecen diferencias importantes. Algunos resultados se leen como una explicación general de cómo funcionan las demandas. Otros se asemejan a un memorando interno de litigio.
Aquí está la comparación de alto nivel:
Benchmark de LLM — Estrategia de litigio (ley de Nueva York)
| Modelo | Precisión jurídica | Profundidad procesal | Pensamiento estratégico | Citas / Autoridades | Estructura | Calidad lista para el cliente | Fortaleza clave | Debilidad clave |
|---|---|---|---|---|---|---|---|---|
| HAQQ | 9,5 | 9,5 | 9 | 9 | 9,5 | 9,5 | Memorando de litigio completo con ejecución, descubrimiento, embargo, referencias a la CPLR | Algo extenso; cierta repetición |
| Claude Opus 4.6 | 9 | 8,5 | 9 | 9 | 9 | 8,5 | Razonamiento jurídico sólido + citas de casos | Algo teórico; menos detalle procesal |
| GPT-5.2 | 8,5 | 8,5 | 9 | 7 | 8,5 | 8,5 | Guía práctica de litigio con árbol de decisión | Menos referencias estatutarias |
| Gemini 3.1 Pro | 8 | 8 | 8 | 7,5 | 8 | 8 | Identifica claramente la estrategia acelerada de la CPLR 3213 | Análisis más breve; menos tácticas de ejecución |
| Grok 4.1 | 7,5 | 7 | 7 | 7 | 7,5 | 7 | Panorama general claro | Carece de profundidad en la mecánica del litigio |
| Mistral Large 3 | 7 | 7 | 6,5 | 6 | 7 | 6,5 | Proceso paso a paso fácil de leer | Análisis jurídico superficial |
| Perplexity Sonar | 6 | 6 | 6 | 6 | 6,5 | 6 | Incluye fuentes | Varias imprecisiones jurídicas |
Las diferencias reales
La mayor separación no fue de estilo. Fue de conciencia procesal.
Las respuestas más sólidas incluían elementos como:
- Juicio sumario en lugar de demanda bajo CPLR §3213
- Reclamaciones por incumplimiento de contrato y cuenta liquidada
- Estrategia de requerimiento previo al litigio
- Análisis de jurisdicción y foro
- Planificación de la fase de descubrimiento
- Mecanismos de ejecución posteriores a la sentencia
Muchas respuestas más débiles se quedaban en: "Presenta una demanda y reclama daños." Lo cual suena bien, pero ignora la mitad del trabajo real.
El paso que la mayoría de la IA se salta
Un patrón fue especialmente claro. La mayoría de los modelos se centra intensamente en presentar el caso. Pocos piensan a fondo en cobrar la sentencia.
Pero en la práctica, las estrategias de cobro suelen implicar:
- Notificaciones de embargo preventivo
- Embargos bancarios
- Órdenes de entrega de bienes
- Gravámenes sobre propiedades
- Descubrimiento posterior a la sentencia
Un abogado que piensa en el litigio desde el inicio ya se está preguntando: "Si ganamos, ¿cómo cobramos realmente?" Los sistemas entrenados sobre todo con texto general de internet suelen pasar por alto esa realidad.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
El problema del riesgo
Los modelos de IA genéricos están optimizados para generar lenguaje convincente. Eso funciona bien para muchas tareas. En el trabajo legal, sin embargo, el modo de fallo es peligroso. No porque la respuesta esté mal escrita. Porque está equivocada con confianza.
Pequeños errores procesales pueden provocar:
- Reclamaciones desestimadas
- Plazos perdidos
- Sentencias inejecutables
- Exposición a responsabilidad por negligencia profesional
Por eso a los profesionales del derecho les importa menos la creatividad y más la calibración.
Qué demuestra este experimento
De este sencillo benchmark surgieron dos conclusiones.
Primera, los modelos de lenguaje modernos ya son capaces de producir análisis jurídico útil cuando el problema está claramente definido.
Segunda, existe una diferencia significativa entre los sistemas de IA generales y los sistemas diseñados específicamente para flujos de trabajo legales.
El razonamiento jurídico requiere un pensamiento estructurado sobre jurisdicción, procedimiento, evidencia y ejecución. Esos elementos rara vez aparecen de forma natural en las respuestas de IA general. Deben modelarse de manera intencional.
La implicación más amplia
La IA ya se está convirtiendo en una herramienta estándar para los abogados. Pero la pregunta no es si la IA puede escribir algo que suene a asesoría legal. La pregunta es si puede producir un trabajo que cumpla con los estándares de la profesión.
Un memorando legal no se juzga por el tono. Se juzga por si la estrategia se sostiene cuando la impugna la contraparte y el tribunal. Y ese es un listón mucho más alto que generar texto convincente.
Reflexión final
Los benchmarks suelen medir quién escribe el párrafo más impresionante. Los benchmarks legales deberían medir algo distinto. Qué sistema se mantiene preciso, procesal y disciplinado bajo riesgo. Porque en el trabajo legal, el peligro no es ser aburrido. Es estar equivocado con confianza.



