L'umanità ha deciso che se una macchina scrive qualcosa con sufficiente sicurezza, deve essere corretto. Gli avvocati, purtroppo, non si possono permettere questo lusso. I tribunali non si preoccupano di quanto suoni fluente un argomento. Si preoccupano se la procedura è corretta e se la norma si applica davvero.
Così abbiamo condotto un esperimento semplice.
Il prompt
"Prepara una strategia di contenzioso secondo la legge di New York per una fattura non pagata di 250.000 dollari."
Abbiamo dato lo stesso prompt a diversi modelli linguistici leader. I modelli testati: HAQQ, GPT-5.2, Claude Opus 4.6, Gemini 3.1 Pro, Perplexity Sonar, Mistral Large 3 e Grok 4.1.
L'obiettivo non era vedere chi scrivesse il paragrafo più elegante. Era vedere quale sistema riuscisse a produrre qualcosa che assomigliasse davvero a una strategia di contenzioso reale.
Perché nel lavoro legale, suonare corretto ed essere corretto sono due cose molto diverse.
Perché questo caso d'uso conta
Le fatture non pagate sono una delle controversie commerciali più comuni. Una fattura non pagata da 250.000 dollari si colloca in quella zona intermedia scomoda dove l'importo è abbastanza alto da giustificare il contenzioso, ma abbastanza contenuto da rendere l'efficienza determinante.
Una strategia competente secondo la legge di New York include tipicamente:
- Valutazione del contratto e delle prove
- Individuazione delle cause dell'azione (violazione contrattuale, account stated)
- Individuazione di scorciatoie procedurali come la CPLR §3213
- Scelta del foro corretto
- Pianificazione della discovery e del giudizio sommario
- Progettazione di una strategia di recupero dopo la sentenza
Quest'ultimo punto è quello che quasi tutti dimenticano. Vincere la causa non è l'obiettivo. Farsi pagare lo è.
Cosa abbiamo valutato
Invece di giudicare la qualità della scrittura, abbiamo valutato i risultati con criteri legali pratici:
- Accuratezza giuridica — Il modello ha individuato correttamente il quadro normativo rilevante?
- Comprensione procedurale — Riflette come funziona davvero il contenzioso nei tribunali di New York?
- Pensiero strategico — Ha dato priorità al percorso più rapido verso il recupero del credito?
- Citazioni / Fonti — Ha fatto riferimento alla CPLR e alla procedura specifica di New York?
- Struttura — Il risultato era organizzato per un uso pratico?
- Qualità pronta per il cliente — Potrebbe essere consegnato a un cliente senza doverlo riscrivere?
Questi fattori determinano se una risposta è utile a un avvocato o è solo una sintesi dall'aspetto impressionante.
Cosa hanno prodotto i modelli
La maggior parte dei sistemi ha generato qualcosa che assomigliava a una strategia di contenzioso. Ma leggendo con attenzione emergono differenze importanti. Alcuni risultati si leggono come una spiegazione generale di come funzionano le cause legali. Altri assomigliavano a una memoria interna di contenzioso.
Ecco il confronto a colpo d'occhio:
Benchmark LLM — Strategia di contenzioso (legge di New York)
| Modello | Accuratezza giuridica | Profondità procedurale | Pensiero strategico | Citazioni / Fonti | Struttura | Qualità pronta per il cliente | Punto di forza | Punto debole |
|---|---|---|---|---|---|---|---|---|
| HAQQ | 9,5 | 9,5 | 9 | 9 | 9,5 | 9,5 | Memoria di causa completa con esecuzione, discovery, sequestro, riferimenti alla CPLR | Leggermente prolisso; qualche ripetizione |
| Claude Opus 4.6 | 9 | 8,5 | 9 | 9 | 9 | 8,5 | Ragionamento giuridico solido + citazioni di giurisprudenza | Leggermente teorico; meno dettaglio procedurale |
| GPT-5.2 | 8,5 | 8,5 | 9 | 7 | 8,5 | 8,5 | Playbook di contenzioso pratico con albero decisionale | Meno riferimenti normativi |
| Gemini 3.1 Pro | 8 | 8 | 8 | 7,5 | 8 | 8 | Individua chiaramente la strategia fast-track CPLR 3213 | Analisi più breve; meno tattiche di esecuzione |
| Grok 4.1 | 7,5 | 7 | 7 | 7 | 7,5 | 7 | Panoramica chiara di alto livello | Manca di profondità nei meccanismi di contenzioso |
| Mistral Large 3 | 7 | 7 | 6,5 | 6 | 7 | 6,5 | Processo a fasi di facile lettura | Analisi giuridica superficiale |
| Perplexity Sonar | 6 | 6 | 6 | 6 | 6,5 | 6 | Include le fonti | Diverse imprecisioni giuridiche |
Le differenze reali
La separazione più grande non era lo stile. Era la consapevolezza procedurale.
Le risposte forti includevano elementi come:
- Giudizio sommario in luogo di citazione ai sensi della CPLR §3213
- Azioni per violazione contrattuale e account stated
- Strategia di diffida pre-contenzioso
- Analisi di giurisdizione e foro
- Pianificazione della discovery
- Meccanismi di esecuzione post-sentenza
Molte risposte più deboli si fermavano a: "Presenta una causa e persegui il risarcimento dei danni." Il che suona bene, ma ignora metà del lavoro reale.
Il passaggio che la maggior parte dell'IA si perde
Uno schema era particolarmente chiaro. La maggior parte dei modelli si concentra pesantemente sul deposito della causa. Pochi pensano in profondità a come recuperare la somma dovuta dopo la sentenza.
Ma nella pratica, le strategie di recupero spesso comportano:
- Avvisi di sequestro conservativo (restraining notices)
- Pignoramenti bancari
- Ordini di consegna dei beni (turnover orders)
- Ipoteche giudiziali sui beni
- Discovery post-sentenza
Un avvocato che pensa al contenzioso fin dall'inizio si sta già chiedendo: "Se vinciamo, come recuperiamo davvero la somma?" I sistemi addestrati principalmente su testo internet generico spesso trascurano questa realtà.
Prova HAQQ AI gratis
Sperimenta la redazione e ricerca legale con IA
Il problema del rischio
I modelli di IA generici sono ottimizzati per generare un linguaggio convincente. Funziona bene per molti compiti. Nel lavoro legale, però, la modalità di fallimento è pericolosa. Non perché la risposta sia scritta male. Perché è sbagliata con sicurezza.
Piccoli errori procedurali possono portare a:
- Cause respinte
- Scadenze mancate
- Sentenze non eseguibili
- Esposizione a responsabilità professionale
Ecco perché ai professionisti legali interessa meno la creatività e più la calibrazione.
Cosa dimostra questo esperimento
Da questo semplice benchmark sono emerse due considerazioni.
Primo, i modelli linguistici moderni sono già in grado di produrre analisi legali utili quando il problema è definito con chiarezza.
Secondo, esiste una differenza significativa tra sistemi di IA generici e sistemi progettati appositamente per i workflow legali.
Il ragionamento giuridico richiede un pensiero strutturato su giurisdizione, procedura, prove ed esecuzione. Questi elementi raramente emergono in modo naturale nelle risposte dell'IA generica. Devono essere modellati intenzionalmente.
L'implicazione più ampia
L'IA sta già diventando uno strumento standard per gli avvocati. Ma la domanda non è se l'IA può scrivere qualcosa che suona come un parere legale. La domanda è se può produrre un lavoro che soddisfi gli standard della professione.
Una memoria legale non si giudica dal tono. Si giudica da come regge quando viene messa alla prova dalla controparte e dal tribunale. Ed è un livello molto più alto rispetto a generare un testo convincente.
Considerazione finale
I benchmark spesso misurano chi scrive il paragrafo più impressionante. I benchmark legali dovrebbero misurare qualcosa di diverso. Quale sistema resta accurato, procedurale e disciplinato sotto pressione. Perché nel lavoro legale, il pericolo non è essere noiosi. È essere sbagliati con sicurezza.



