Una moción de desestimación federal, redactada de principio a fin por IA, cuesta $1.67 en coste bruto de modelo. El mismo flujo de trabajo, ejecutado de principio a fin con el modelo más capaz, cuesta $4.55. Mismo resultado. Misma entrada. Misma rúbrica. La diferencia de 2.7x se debe a una única decisión arquitectónica: qué modelo ejecuta cada etapa.
La mayoría de los despachos que usan IA hoy están pagando la factura de todo-Opus y nunca ven la versión de $1.67, porque nadie configuró el enrutador.
Datos clave
- El primer borrador representa el 63% de toda la factura de IA de una moción de desestimación: una sola llamada a Opus cuesta más que las otras 15 llamadas combinadas (escenario modelado, precios de modelo reales y verificados).
- La verificación de citas es el 1.6% de la factura: ocho llamadas a Haiku, $0.0272 en total; con Opus, la misma etapa cuesta ~16 veces más sin ninguna mejora de calidad.
- El enrutamiento todo-Opus cuesta 2.7 veces la factura con enrutamiento mixto: una sobreprima del 171.5% por un resultado funcionalmente idéntico.
Este artículo trata sobre a dónde va realmente el dinero dentro de un escrito redactado por IA, por qué la etapa de verificación de citas es el 1.6% de la factura (y por qué debería seguir siéndolo), y qué implican estas cifras para cómo los despachos deberían cobrar a sus clientes el trabajo hecho con IA.
Qué medimos (y qué no)
Primero, una aclaración honesta, porque las cifras son la base de todo lo que sigue.
Estas cifras no provienen de instrumentar un asunto real de un cliente en producción. Provienen de un pequeño arnés de código abierto -un envoltorio ligero alrededor del SDK del LLM que registra el recuento de tokens por llamada, el modelo, la etiqueta de la etapa y el coste calculado- aplicado a tres escenarios legales modelados:
- Moción de desestimación (investigación, redacción, verificación de citas, revisión)
- Revisión de un NDA (una sola pasada de contrato)
- Primera pasada de discovery (100 documentos, marcado de relevancia + privilegio)
Estamos modelando en lugar de medir porque todavía estamos conectando la instrumentación a producción. Eso está en camino. Por ahora: los precios de los modelos son reales (verificados con las páginas de precios de los proveedores el 2026-05-05). La estructura de costes es real. Los volúmenes exactos de tokens son estimaciones realistas basadas en el aspecto de una moción de 15 páginas, un memorando de investigación de tamaño medio y un veredicto de verificación de citas de un párrafo.
La palanca que describe este artículo -el enrutamiento de modelos- no depende del volumen exacto. Depende de las proporciones de coste entre etapas. Si divides los volúmenes a la mitad, el panorama es el mismo. Si los triplicas, también. La conclusión se mantiene en cualquier caso.
La factura de la moción de desestimación, línea por línea
El arnés ejecutó 16 llamadas en cuatro etapas. Factura total: $1.6742.
Aquí hay dos hallazgos que deberían reorganizar cómo piensas tu presupuesto de IA.
Primero: el borrador es el 63% de toda la factura. Una sola llamada. Contexto de entrada largo (memorandos de investigación más la plantilla del despacho más los hechos del cliente), salida larga (una moción de 15 páginas). Esa única invocación a Opus cuesta más que las otras 15 llamadas combinadas. Si quieres abaratar este flujo de trabajo, hay exactamente un lugar que merece la pena optimizar, y es el lugar que no puedes degradar sin consecuencias en la calidad.
Segundo: la verificación de citas es el 1.6% de la factura. Ocho llamadas, $0.0272. Verificar citas contra las autoridades recuperadas es mecánico, estructurado, repetible y fácil de comprobar después. Haiku lo hace bien. Ejecutar las mismas ocho llamadas en Opus multiplicaría el coste de esta etapa por aproximadamente 16 veces, para un resultado que, en nuestras pruebas, no es mejor.
La mayoría de los despachos que leen esto hacen justo lo contrario. Eligieron un solo modelo para todo, normalmente Opus, porque "usa el mejor modelo" es la historia por defecto cuando nadie en el equipo hace las cuentas de coste. Están pagando tarifas de Opus por verificar citas. Ese es un error evitable.
La palanca de 2.7x
Mismo flujo de trabajo. Mismos prompts. Mismos recuentos de tokens de entrada. Tres estrategias de enrutamiento.
Todo-Opus cuesta 2.7 veces la factura mixta. Este es el valor por defecto para la mayoría de los despachos que hoy dicen "usamos IA". Elegir un modelo, conectarlo a cada etapa, publicar. El resultado es una sobreprima del 171.5% sobre un pipeline enrutado que produce un resultado funcionalmente idéntico.
Todo-Haiku es 6.9 veces más barato que la factura mixta, y está mal. Haiku, si se le pide redactar una moción federal de 15 páginas, alucinará citas. Se le escaparán distinciones sutiles del estándar de alegación. Es un excelente verificador de citas y un mal primer redactor. El ingeniero obsesionado con el coste recurre al todo-Haiku y termina exponiendo al despacho a responsabilidad por negligencia profesional. No lo hagas.
La rebaja en la verificación de citas es asimétrica. Pasar la verificación de citas de Haiku a Sonnet te cuesta un 4.5%. Pasarla a Opus te cuesta un 28.8%. Estás pagando precios de Opus por una tarea que tiene una verdad de referencia casi perfecta (¿existe la cita? ¿coincide la referencia exacta?). Ahí no hay ninguna mejora de modelo premium que capturar.
El camino intermedio no es una concesión. Es la arquitectura racional. Opus donde tiene que estarlo: razonamiento generativo con libertad de acción. Sonnet donde necesitas un buen criterio de nivel medio: síntesis de investigación, revisiones puntuales. Haiku donde la tarea es estructurada y verificable: búsqueda de citas, veredictos de relevancia, clasificación.
Dónde Haiku es suficiente (y dónde no)
La tentación tras ver estas cifras es bajar todo un nivel. Resístela. La decisión de enrutamiento es por etapa, por tarea, y exige un criterio real sobre lo que se le está pidiendo al modelo.
Haiku es suficiente para la verificación de citas contra una autoridad recuperada, la revisión de relevancia de primera pasada en un lote de discovery, el triaje de marcado de privilegio, la extracción estructurada (partes, fecha de entrada en vigor, ley aplicable) y la clasificación de entrada.
Haiku no es suficiente para redactar prosa argumentativa bajo un estándar de alegación, sintetizar jurisprudencia en un memorando estratégico, detectar el problema que no está en la rúbrica, o cualquier cosa donde el modo de fallo sea "un sinsentido que parece plausible".
Sonnet es la opción correcta por defecto para la síntesis de investigación (leer cinco casos, devolver un memorando enfocado), las revisiones puntuales y la revisión de contratos de riesgo medio, donde Haiku se queda corto y Opus es excesivo.
Opus se gana su tarifa en el primer borrador del escrito real, la detección de problemas novedosos en patrones de hechos poco habituales y el puñado de tareas donde realmente no te puedes permitir "casi correcto".
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
Los otros escenarios - economías unitarias distintas
La moción de desestimación es la cifra estrella. Los otros dos escenarios muestran hasta qué punto el "coste medio de IA por asunto" es engañoso.
Revisión de un solo NDA. Una llamada a Sonnet. 5,000 tokens de entrada, 800 de salida. Coste: $0.027. Dos centavos y medio. Un despacho que haga 200 de estas al mes gasta $5.40 en inferencia, en un flujo de trabajo que antes consumía horas de paralegal y asociado.
Primera pasada de discovery en 100 documentos. 100 llamadas a Haiku, ~4,000 de entrada cada una, ~150 de salida. Coste: $0.38. Menos que un café por lo que antes era medio día de triaje de un abogado contratista. Con mil documentos son $3.80. Con diez mil, $38.
El escenario de trabajo profundo (la moción) y los escenarios de triaje de alto volumen (NDA, discovery) viven en barrios de coste distintos. Una tarjeta de precios de '$1 por asunto' no funciona, porque $1 es un margen del 60% en un lote de discovery y una pérdida del 40% en una moción contenciosa. Necesitas niveles de precio por resultado que se ajusten a la forma de inferencia subyacente.
Qué significa esto para el precio de los servicios legales
El modelo por horas asume que el coste es el tiempo del abogado. La IA invierte eso. El coste de producir un primer borrador competente cae en tres órdenes de magnitud. El coste de revisarlo se mantiene igual.
Eso rompe la facturación por horas como mecanismo de precio para el trabajo aumentado por IA. No como unidad de contabilidad interna -la planificación de capacidad sigue necesitando horas-, sino como lo que aparece en la factura del cliente.
Lo que sobrevive:
- Tarifa plana por tipo de asunto. $499 por una moción de desestimación. $99 por una revisión de NDA. $1,499 por un paquete de diligencia debida. El suelo del margen es el coste de la IA (pequeño). El techo del margen es la disposición a pagar del cliente (mucho mayor). Ambos extremos son conocibles.
- Suscripción por asiento. El despacho paga por abogado y por mes. El coste de inferencia se amortiza en toda la plantilla.
- Resultado / éxito. Base más baja, honorario de éxito. El coste de la IA es un error de redondeo frente al resultado.
Lo que muere: facturar al cliente por horas un escrito que el modelo redactó en 90 segundos. No porque los clientes no vayan a pagarlo -los directores jurídicos sofisticados ya se niegan-, sino porque un competidor cotizará el mismo escrito a una tarifa plana que supere tu factura por horas en un 50% y aun así conservará un margen del 95%.
Qué deberían hacer los despachos esta semana
Si te llevas una sola cosa de este artículo, que sea el hábito de instrumentar. La solución es pequeña.
- Envuelve cada llamada a la IA con un rastreador. Etiqueta de etapa, modelo, tokens de entrada, tokens de salida, coste, latencia, marca de tiempo. JSONL, un registro por línea. Veinte líneas de código. No puedes enrutar lo que no mides.
- Por defecto, verificación de citas en Haiku, redacción en Opus, investigación y revisiones en Sonnet. Es el cambio de configuración de mayor apalancamiento en todo el stack. Audítalo cada mes.
- Cotiza los asuntos aumentados por IA a tarifa fija, no por horas.
- Publica tu enrutamiento de modelos como un artefacto de transparencia. Los clientes empezarán a preguntar qué modelo tocó su trabajo.
- Vuelve a calcular cada mes. Los precios de los proveedores cambian. Llegan nuevas generaciones de modelos.
Lo que viene a continuación de nuestra parte
Las cifras de este artículo están modeladas. Son realistas, la estructura de costes es real y el hallazgo sobre el enrutamiento es sólido. Pero "modelado" no es "medido". Estamos conectando el mismo rastreador a HAQQ Legal AI en producción este mes. Dentro de T+30 días publicaremos el seguimiento: los mismos escenarios, asuntos reales de clientes, registros anonimizados, desglose completo por etapa y por modelo.
Si las cifras resultan materialmente distintas a estos modelos, eso en sí mismo será lo más útil que podamos publicar. En cualquier caso, será honesto.



