Un motion-to-dismiss federale, redatto dall'inizio alla fine dall'IA, costa 1,67 $ in puro costo di modello. Lo stesso flusso di lavoro, eseguito dall'inizio alla fine sul modello più capace disponibile, costa 4,55 $. Stesso output. Stesso input. Stessa griglia di valutazione. La differenza di 2,7x dipende da un'unica decisione architetturale: quale modello gestisce quale fase.
La maggior parte degli studi che usa l'IA oggi paga la bolletta tutta-Opus e non vede mai la versione da 1,67 $, perché nessuno ha collegato il router.
Dati chiave
- La prima bozza rappresenta il 63% dell'intera bolletta IA per un motion-to-dismiss — una singola chiamata a Opus costa più delle altre 15 chiamate messe insieme (scenario modellato, prezzi dei modelli reali e verificati).
- Il cite-checking è l'1,6% della bolletta: otto chiamate a Haiku, 0,0272 $ in totale; su Opus la stessa fase costa circa 16 volte di più senza alcun guadagno in qualità.
- Il routing tutto-Opus costa 2,7 volte la bolletta con routing misto — un sovrapprezzo del 171,5% per un output funzionalmente identico.
Questo articolo spiega dove finiscono davvero i soldi in un atto redatto dall'IA, perché la fase di cite-check pesa l'1,6% della bolletta (e dovrebbe restare così), e cosa significano questi numeri per il modo in cui gli studi dovrebbero fare pricing del lavoro IA verso i clienti.
Cosa abbiamo misurato (e cosa no)
Prima la trasparenza, perché questi numeri sono portanti.
Queste cifre non provengono dalla strumentazione di una pratica cliente reale. Provengono da un piccolo harness open — un sottile wrapper attorno all'SDK dell'LLM che registra, per ogni chiamata, il conteggio dei token, il modello, l'etichetta di fase e il costo calcolato — applicato a tre scenari legali modellati:
- Motion-to-dismiss (ricerca, bozza, cite-check, revisione)
- Revisione di un NDA (singolo passaggio su un contratto)
- Prima scrematura in discovery (100 documenti, flag di pertinenza + privilegio)
Stiamo modellando anziché misurando perché la strumentazione in produzione è ancora in fase di collegamento. Arriverà. Per ora: i prezzi dei modelli sono reali (verificati sulle pagine di pricing dei vendor al 2026-05-05). La struttura dei costi è reale. I volumi esatti di token sono stime realistiche basate su cosa sono, in pratica, un atto di 15 pagine, un memo di ricerca di media dimensione e un verdetto di cite-check di un paragrafo.
La leva descritta in questo articolo — il model routing — non dipende dal volume esatto. Dipende dai rapporti di costo tra le fasi. Dimezza i volumi e il quadro non cambia. Triplicali e resta lo stesso. La conclusione regge in ogni caso.
La bolletta del motion-to-dismiss, voce per voce
L'harness ha eseguito 16 chiamate su quattro fasi. Bolletta totale: 1,6742 $.
Ci sono due osservazioni qui che dovrebbero riorganizzare il modo in cui pensi al tuo budget IA.
Primo: la bozza è il 63% dell'intera bolletta. Una sola chiamata. Contesto in ingresso lungo (memo di ricerca più il template dello studio più i fatti del cliente), output lungo (un atto di 15 pagine). Quella singola invocazione a Opus costa più delle altre 15 chiamate messe insieme. Se vuoi rendere più economico questo flusso di lavoro, c'è esattamente un punto su cui vale la pena ottimizzare — ed è il punto che non puoi declassare senza conseguenze sulla qualità.
Secondo: il cite-checking è l'1,6% della bolletta. Otto chiamate, 0,0272 $. Verificare le citazioni rispetto alle fonti recuperate è meccanico, strutturato, ripetibile e facile da controllare a posteriori. Haiku lo fa bene. Eseguire le stesse otto chiamate su Opus moltiplicherebbe il costo di questa fase per circa 16 volte, per un output che, nei nostri test, non è migliore.
La maggior parte degli studi che legge questo articolo fa l'opposto. Ha scelto un unico modello per tutto — di solito Opus, perché 'usa il modello migliore' è la storia di default quando nessuno nel team fa i conti sui costi. Paga tariffe Opus per il cite-checking. È un errore evitabile.
La leva del 2,7x
Stesso flusso di lavoro. Stessi prompt. Stesso conteggio di token in ingresso. Tre strategie di routing.
Tutto-Opus costa 2,7 volte la bolletta mista. È il default per la maggior parte degli studi che oggi 'usa l'IA'. Scegli un modello, collegalo a ogni fase, spedisci. Il risultato è un sovrapprezzo del 171,5% rispetto a una pipeline con routing che produce un output funzionalmente identico.
Tutto-Haiku costa 6,9 volte meno della bolletta mista — ed è sbagliato. Haiku, se gli chiedi di redigere un atto federale di 15 pagine, allucinerà citazioni. Mancherà distinzioni sottili sullo standard di pleading. È un ottimo cite-checker e un pessimo primo redattore. L'ingegnere ossessionato dai costi punta su tutto-Haiku e si espone a malpractice. Non farlo.
Il declassamento del cite-check è asimmetrico. Spostare il cite-check da Haiku a Sonnet costa il 4,5% in più. Spostarlo su Opus costa il 28,8% in più. Stai pagando tariffe Opus per un compito che ha una verità di base quasi perfetta (la citazione esiste? il rimando corrisponde?). Non c'è alcun guadagno da modello premium da catturare lì.
La via di mezzo non è un compromesso. È l'architettura razionale. Opus dove deve esserci — ragionamento generativo con margine di libertà. Sonnet dove serve un giudizio solido di livello medio — sintesi di ricerca, revisioni mirate. Haiku dove il compito è strutturato e verificabile — ricerca di citazioni, verdetti di pertinenza, classificazione.
Dove Haiku basta (e dove no)
La tentazione, dopo aver visto questi numeri, è spingere tutto verso il livello inferiore. Resisti. La decisione di routing è per fase, per compito — e richiede un giudizio reale su cosa si sta effettivamente chiedendo al modello.
Haiku è sufficiente per la verifica delle citazioni contro una fonte recuperata, la prima scrematura di pertinenza su un batch di discovery, il flag di triage sul privilegio, l'estrazione strutturata (parti, data di efficacia, legge applicabile) e la classificazione in fase di intake.
Haiku non è sufficiente per redigere prosa argomentativa sotto uno standard di pleading, sintetizzare la giurisprudenza in un memo strategico, individuare il problema che non è nella griglia di valutazione, o qualsiasi compito il cui modo di fallire è 'nonsense dall'aspetto plausibile'.
Sonnet è il default corretto per la sintesi di ricerca (leggi cinque sentenze, restituisci un memo mirato), le revisioni mirate e la revisione contrattuale a rischio medio, dove Haiku è troppo leggero e Opus è eccessivo.
Opus guadagna la sua tariffa su la prima bozza dell'atto vero e proprio, l'individuazione di problemi inediti in scenari fattuali non familiari e la manciata di compiti in cui non puoi davvero permetterti un risultato 'quasi corretto'.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Gli altri scenari — un'economia unitaria diversa
Il motion-to-dismiss è il numero di punta. Gli altri due scenari mostrano quanto possa fuorviare un 'costo IA medio per pratica'.
Revisione di un singolo NDA. Una chiamata a Sonnet. 5.000 token in ingresso, 800 in uscita. Costo: 0,027 $. Due centesimi e mezzo. Uno studio che ne fa 200 al mese spende 5,40 $ in inferenza per un flusso di lavoro che prima consumava ore di paralegal e collaboratori.
Prima scrematura di discovery su 100 documenti. 100 chiamate a Haiku, circa 4.000 token in ingresso ciascuna, circa 150 in uscita. Costo: 0,38 $. Meno di un caffè per quella che una volta era mezza giornata di triage da parte di un contract attorney. Su mille documenti sono 3,80 $. Su diecimila, 38 $.
Lo scenario di lavoro profondo (l'atto) e gli scenari di triage ad alto volume (NDA, discovery) vivono in due fasce di costo diverse. Un listino '1 $ a pratica' non funziona, perché 1 $ è il 60% di margine su un batch di discovery e una perdita del 40% su un atto contestato. Servono livelli di pricing per output che rispecchino la forma dell'inferenza sottostante.
Cosa significa per il pricing legale
Il modello orario dà per scontato che il costo sia il tempo dell'avvocato. L'IA lo ribalta. Il costo di produrre una prima bozza competente crolla di tre ordini di grandezza. Il costo di revisionarla resta lo stesso.
Questo rompe la fatturazione oraria come meccanismo di pricing per il lavoro assistito dall'IA. Non come unità di contabilità interna — la pianificazione della capacità richiede ancora ore — ma come voce sulla fattura al cliente.
Cosa sopravvive:
- Parcella fissa per tipo di pratica. 499 $ per un motion-to-dismiss. 99 $ per una revisione di NDA. 1.499 $ per un pacchetto di due diligence. Il pavimento del margine è il costo IA (piccolo). Il tetto del margine è la disponibilità a pagare del cliente (molto più ampio). Entrambi gli estremi sono conoscibili.
- Abbonamento per postazione. Lo studio paga per avvocato al mese. Il costo di inferenza si ammortizza su tutto l'organico.
- Risultato / contingency. Base più bassa, success fee. Il costo IA è un errore di arrotondamento rispetto al risultato.
Cosa muore: fatturare al cliente a ora per un atto che il modello ha scritto in 90 secondi. Non perché i clienti non vogliano pagarlo — i general counsel più sofisticati già rifiutano — ma perché un concorrente quoterà lo stesso atto a parcella fissa, battendo la tua fattura oraria del 50%, e manterrà comunque il 95% di margine.
Cosa dovrebbero fare gli studi questa settimana
Se prendi una sola cosa da questo articolo, prendi l'abitudine alla strumentazione. La correzione è piccola.
- Avvolgi ogni chiamata IA in un tracker. Etichetta di fase, modello, token in ingresso, token in uscita, costo, latenza, timestamp. JSONL, un record per riga. Venti righe di codice. Non puoi instradare ciò che non misuri.
- Imposta di default Haiku per il cite-check, Opus per la redazione, Sonnet per ricerca e revisioni. È la modifica di configurazione a più alta leva nell'intero stack. Verificala ogni mese.
- Quota le pratiche assistite dall'IA a parcella fissa, non a ora.
- Pubblica il tuo routing dei modelli come artefatto di trasparenza. I clienti inizieranno a chiedere quale modello ha toccato il loro lavoro.
- Ricalcola ogni mese. I prezzi dei vendor si muovono. Arrivano nuove generazioni di modelli.
Cosa arriva dopo da parte nostra
I numeri di questo articolo sono modellati. Sono realistici, la struttura dei costi è reale e il risultato sul routing è solido. Ma 'modellato' non è 'misurato'. Stiamo collegando lo stesso tracker a HAQQ Legal AI in produzione questo mese. Tra T+30 giorni pubblicheremo il seguito: stessi scenari, pratiche clienti reali, log anonimizzati, ripartizione completa per fase e per modello.
Se i numeri risultassero significativamente diversi da questi modelli, sarebbe di per sé la cosa più utile che possiamo pubblicare. In ogni caso, sarà onesto.



