Skip to content
    HAQQ
    • Preços
    Começar Grátis
    Começar GrátisAgendar uma Demo
    Entrar
    1. Início
    2. Blog
    3. Quanto custa uma petição redigida por IA: US$ 1,67 com roteamento, US$ 4,55 sem
    Voltar ao BlogIA & Tech Jurídica

    Quanto custa uma petição redigida por IA: US$ 1,67 com roteamento, US$ 4,55 sem

    Uma petição de arquivamento redigida por IA custa US$ 1,67 - ou US$ 4,55 se tudo rodar no maior modelo. Para onde vai o dinheiro, etapa a etapa, e como corrigir.

    May 5, 2026
    9 min de leitura
    |
    Stephane BoghossianStephane Boghossian
    Quanto custa uma petição redigida por IA: US$ 1,67 com roteamento, US$ 4,55 sem

    Uma petição de arquivamento federal, redigida do início ao fim por IA, custa US$ 1,67 em custo bruto de modelo. O mesmo fluxo de trabalho, executado do início ao fim no modelo mais capaz, custa US$ 4,55. Mesmo resultado. Mesmo input. Mesma grelha de avaliação. A diferença de 2,7x resulta de uma única decisão arquitetural: que modelo executa que etapa.

    A maioria dos escritórios que usa IA hoje está a pagar a conta do 'tudo em Opus' e nunca vê a versão de US$ 1,67, porque ninguém configurou o roteador.

    Factos-chave

    • O primeiro rascunho representa 63% de toda a conta de IA de uma petição de arquivamento — uma única chamada ao Opus custa mais do que as outras 15 chamadas combinadas (cenário modelado, preços de modelo reais e verificados).
    • A verificação de citações representa 1,6% da conta: oito chamadas ao Haiku, US$ 0,0272 no total; no Opus, a mesma etapa custa cerca de 16x mais, sem ganho de qualidade.
    • O roteamento 'tudo em Opus' custa 2,7x a conta do roteamento misto — um prémio de 171,5% por um resultado funcionalmente idêntico.

    Este artigo é sobre para onde vai realmente o dinheiro dentro de uma peça redigida por IA, porque é que a etapa de verificação de citações é 1,6% da conta (e deve continuar a ser), e o que a matemática significa para a forma como os escritórios devem precificar o trabalho de IA junto dos clientes.

    O que medimos (e o que não medimos)

    Primeiro uma nota de transparência, porque os números aqui sustentam todo o argumento.

    Estes números não vêm da instrumentação de um caso real de cliente. Vêm de um pequeno harness aberto - um wrapper fino em torno do SDK do LLM que regista, por chamada, a contagem de tokens, o modelo, o rótulo da etapa e o custo calculado - aplicado a três cenários jurídicos modelados:

    • Petição de arquivamento (pesquisa, redação, verificação de citações, revisão)
    • Revisão de NDA (uma única passagem pelo contrato)
    • Primeira triagem de discovery (100 documentos, sinalização de relevância + privilégio)

    Estamos a modelar em vez de medir porque ainda estamos a instalar a instrumentação em produção. Isso está a caminho. Por agora: os preços dos modelos são reais (verificados nas páginas de preços dos fornecedores em 05/05/2026). A estrutura de custos é real. Os volumes exatos de tokens são estimativas realistas, baseadas no que são petições de 15 páginas, memorandos de pesquisa de dimensão média e veredictos de verificação de citações de um parágrafo.

    A alavanca que este artigo descreve - o roteamento de modelos - não depende do volume exato. Depende das proporções de custo entre etapas. Reduza os volumes a metade e o retrato mantém-se. Triplique-os e mantém-se igual. A conclusão vale de qualquer forma.

    A conta da petição de arquivamento, linha a linha

    O harness executou 16 chamadas em quatro etapas. Conta total: US$ 1,6742.

    Há aqui duas conclusões que deveriam reorganizar a forma como pensa o seu orçamento de IA.

    Primeira: a redação representa 63% de toda a conta. Uma única chamada. Contexto de entrada longo (memorandos de pesquisa mais o modelo do escritório mais os factos do cliente), output longo (uma petição de 15 páginas). Essa única invocação ao Opus custa mais do que as outras 15 chamadas combinadas. Se quiser tornar este fluxo de trabalho mais barato, há exatamente um sítio que vale a pena otimizar - e é precisamente o sítio onde não pode descer de modelo sem consequências para a qualidade.

    Segunda: a verificação de citações é 1,6% da conta. Oito chamadas, US$ 0,0272. Verificar citações contra as fontes recuperadas é uma tarefa mecânica, estruturada, repetível e fácil de conferir depois. O Haiku faz isso bem. Executar as mesmas oito chamadas no Opus multiplicaria o custo desta etapa por cerca de 16x, para um resultado que, nos nossos testes, não é melhor.

    A maioria dos escritórios a ler isto está a fazer o oposto. Escolheram um único modelo para tudo - normalmente o Opus, porque 'usar o melhor modelo' é a história por defeito quando ninguém na equipa está a fazer as contas de custo. Estão a pagar preços de Opus para verificar citações. Esse é um erro evitável.

    A alavanca de 2,7x

    Mesmo fluxo de trabalho. Mesmos prompts. Mesma contagem de tokens de entrada. Três estratégias de roteamento.

    Tudo em Opus custa 2,7x a conta mista. É a opção por defeito da maioria dos escritórios que hoje diz 'usamos IA'. Escolhem um modelo, ligam-no a todas as etapas, lançam. O resultado é um prémio de 171,5% sobre um pipeline com roteamento que produz um resultado funcionalmente idêntico.

    Tudo em Haiku é 6,9x mais barato do que a conta mista - e está errado. Pedido para redigir uma petição federal de 15 páginas, o Haiku vai alucinar citações. Vai perder distinções subtis de pleading standard. É um excelente verificador de citações e um mau redator principal. O engenheiro obcecado com custos opta pelo tudo-em-Haiku e acaba por expor o escritório a risco de malpractice. Não faça isto.

    A descida de modelo na verificação de citações é assimétrica. Passar a verificação de citações do Haiku para o Sonnet custa-lhe 4,5%. Passá-la para o Opus custa-lhe 28,8%. Está a pagar preços de Opus por uma tarefa com uma verdade de referência quase perfeita (a citação existe? o pinpoint corresponde?). Não há aqui nenhum ganho de qualidade de modelo premium a capturar.

    O caminho do meio não é um compromisso. É a arquitetura racional. Opus onde tem de ser - raciocínio generativo com margem de liberdade. Sonnet onde é preciso um julgamento sólido de nível intermédio - síntese de pesquisa, revisões focadas. Haiku onde a tarefa é estruturada e verificável - procura de citações, veredictos de relevância, classificação.

    Onde o Haiku chega (e onde não chega)

    A tentação depois de ver estes números é empurrar tudo para um nível mais baixo. Resista. A decisão de roteamento é por etapa, por tarefa - e exige julgamento real sobre o que se está a pedir ao modelo.

    O Haiku chega para verificar citações contra uma fonte recuperada, fazer a primeira revisão de relevância num lote de discovery, triagem de sinalização de privilégio, extração estruturada (partes, data de entrada em vigor, lei aplicável) e classificação de entrada.

    O Haiku não chega para redigir prosa argumentativa sob um pleading standard, sintetizar jurisprudência num memorando estratégico, identificar a questão que não está na grelha, ou seja o que for cujo modo de falha seja 'disparate com aparência plausível.'

    O Sonnet é a opção certa por defeito para síntese de pesquisa (ler cinco casos, devolver um memorando focado), revisões focadas e revisão de contratos de risco intermédio, onde o Haiku é demasiado ligeiro e o Opus é exagero.

    O Opus justifica o seu preço no primeiro rascunho da peça propriamente dita, na identificação de questões novas em padrões factuais pouco familiares, e no punhado de tarefas em que genuinamente não se pode dar ao luxo de 'quase certo.'

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Os outros cenários - economia unitária diferente

    A petição de arquivamento é o número de destaque. Os outros dois cenários mostram como o 'custo médio de IA por processo' pode induzir gravemente em erro.

    Revisão de um único NDA. Uma chamada ao Sonnet. 5.000 tokens de entrada, 800 de saída. Custo: US$ 0,027. Dois cêntimos e meio. Um escritório que faz 200 destas por mês está a gastar US$ 5,40 em inferência para um fluxo de trabalho que antes consumia horas de paralegal e de associado.

    Primeira triagem de discovery com 100 documentos. 100 chamadas ao Haiku, ~4.000 tokens de entrada cada, ~150 de saída. Custo: US$ 0,38. Menos do que um café para o que antes era meio dia de triagem por um contract attorney. Com mil documentos, isto são US$ 3,80. Com dez mil, US$ 38.

    O cenário de trabalho profundo (a petição) e os cenários de triagem de alto volume (NDA, discovery) vivem em vizinhanças de custo diferentes. Uma tabela de preços de 'US$ 1 por processo' não funciona, porque US$ 1 é uma margem de 60% num lote de discovery e uma perda de 40% numa petição contestada. É preciso ter níveis de preço por tipo de resultado que correspondam ao perfil de inferência subjacente.

    O que isto significa para a precificação jurídica

    O modelo por hora assume que o custo é o tempo do advogado. A IA inverte isso. O custo de produzir um primeiro rascunho competente cai três ordens de grandeza. O custo de o rever mantém-se igual.

    Isso quebra a faturação por hora como mecanismo de precificação para trabalho aumentado por IA. Não como unidade de contabilidade interna - o planeamento de capacidade continua a precisar de horas - mas como o item que aparece na fatura do cliente.

    O que sobrevive:

    • Tarifa fixa por tipo de processo. US$ 499 por uma petição de arquivamento. US$ 99 por uma revisão de NDA. US$ 1.499 por um pacote de diligência. O piso da margem é o custo de IA (pequeno). O teto da margem é a disponibilidade do cliente para pagar (muito maior). As duas pontas são conhecíveis.
    • Subscrição por utilizador. O escritório paga por advogado por mês. O custo de inferência é amortizado por todo o quadro de pessoal.
    • Resultado / contingência. Base mais baixa, honorário de êxito. O custo de IA é um erro de arredondamento face ao resultado.

    O que morre: faturar o cliente à hora por uma peça que o modelo escreveu em 90 segundos. Não porque os clientes não vão pagar - os general counsels mais sofisticados já não pagam - mas porque um concorrente vai orçamentar a mesma peça a uma tarifa fixa que bate a sua conta por hora em 50% e ainda assim mantém 95% de margem.

    O que os escritórios deveriam fazer esta semana

    Se levar apenas uma coisa deste artigo, que seja o hábito de instrumentar. A correção é pequena.

    • Envolva cada chamada de IA num tracker. Rótulo da etapa, modelo, tokens de entrada, tokens de saída, custo, latência, timestamp. JSONL, um registo por linha. Vinte linhas de código. Não se pode rotear aquilo que não se mede.
    • Defina o Haiku por defeito para a verificação de citações, o Opus para a redação, e o Sonnet para a pesquisa e as revisões. É a alteração de configuração com maior alavancagem em todo o stack. Audite-a mensalmente.
    • Orçamente os processos aumentados por IA a tarifa fixa, não à hora.
    • Publique o seu roteamento de modelos como um artefacto de transparência. Os clientes vão começar a perguntar que modelo tocou no seu trabalho.
    • Recalcule mensalmente. Os preços dos fornecedores mudam. Novas gerações de modelos chegam.

    O que vem a seguir da nossa parte

    Os números deste artigo são modelados. São realistas, a estrutura de custos é real, e a conclusão sobre o roteamento é robusta. Mas 'modelado' não é 'medido'. Estamos a instalar o mesmo tracker na HAQQ Legal AI em produção este mês. Em T+30 dias publicaremos o seguimento: os mesmos cenários, processos reais de clientes, registos anonimizados, e uma repartição completa por etapa e por modelo.

    Se os números saírem materialmente diferentes destes modelos, isso é, em si, a coisa mais útil que podemos publicar. De uma forma ou de outra, será honesto.

    Leitura relacionada

    • como uma ontologia jurídica reduziu os custos de IA por mensagem em 97%
    • o imposto de latência e custo em 10 modelos de fronteira
    • single-prompt vs. multi-agente numa data room de 30 documentos
    • o planeador GOAP de litígios que construímos e testámos
    S

    Stephane Boghossian

    Head of Growth

    Recursos relacionados

    PricingROI CalculatorLegal AI ChatEnterprise

    Artigos relacionados

    Avaliações da Spellbook AI 2026: preços, recursos e alternativas à Spellbook

    Avaliações da Spellbook AI 2026: preços, recursos e alternativas à Spellbook

    Alternativas ao Spellbook: As Melhores Ferramentas de Redação de Contratos com IA em 2026

    Alternativas ao Spellbook: As Melhores Ferramentas de Redação de Contratos com IA em 2026

    Análise do CoCounsel 2026: preços, benchmark e alternativas

    Análise do CoCounsel 2026: preços, benchmark e alternativas

    Perguntas frequentes

    How much does it cost to draft a motion to dismiss with AI?

    In the article's modeled scenario (real vendor prices verified 2026-05-05, realistic token volumes), a federal motion-to-dismiss drafted end-to-end by AI costs $1.67 in raw model cost with routed models — or $4.55 running every stage on the most capable model. Same output, same input; the 2.7x difference is which model runs which stage.

    What is model routing in legal AI?

    Assigning a different model tier to each workflow stage: Opus for generative drafting under latitude, Sonnet for research synthesis and focused revisions, Haiku for structured verifiable tasks like citation lookup and relevance verdicts. The all-Opus default costs 2.7x the routed bill — a 171.5% premium for functionally identical output.

    Which AI model should check legal citations?

    A small model. Cite-checking is mechanical, structured, and easy to verify — it was 1.6% of the bill ($0.0272 across eight Haiku calls) in the modeled motion. Running the same calls on Opus multiplies that stage's cost roughly 16x for output that, in the article's testing, is no better.

    How much does AI contract review cost per document?

    A single NDA review is one Sonnet call — about $0.027. A 100-document discovery first-pass on Haiku costs about $0.38; at ten thousand documents, $38. The article's point: deep-work matters and high-volume triage live in different cost neighborhoods, so flat 'per matter' pricing misleads.

    Should law firms bill hourly for AI-assisted work?

    The article argues hourly billing dies as the client-facing price for AI-augmented work: AI drops first-draft cost by three orders of magnitude while review cost stays flat. What survives: flat fee per matter type, per-seat subscriptions, and outcome-based pricing — because a competitor will quote the same brief at a flat fee that beats the hourly bill by 50% and still keep 95% margin.

    O que vem a seguir?

    Experimente HAQQ AI grátis

    Experimente a redação e pesquisa jurídica com IA

    Calcule seu ROI

    Veja quanto tempo e dinheiro o HAQQ economiza para seu escritório

    Explore Prompts jurídicos

    Prompts prontos para cada tarefa jurídica

    Voltar ao Blog

    Artigo anterior

    HAQQ Legal AI lança os Project Workspaces: um único lar para cada matéria jurídica

    Próximo artigo

    IA pode planejar litígios? Construímos um planejador GOAP para descobrir

    Ponha isto a trabalhar

    Faça ao HAQQ a pergunta que este artigo lhe levantou.

    HAQQ across all devices
    HAQQ Legal AI Platform Logo

    O seu Gémeo IA Jurídico & Sistema de Gestão de Prática para redigir, faturar e vencer.

    Download on theApp StoreGet it onGoogle Play

    Documentações

    • Docs abre num novo separador
    • Primeiros passos abre num novo separador
    • Imprensa abre num novo separador
    • Atualizações do produto abre num novo separador
    • Estado abre num novo separador
    • Segurança
    • FAQ abre num novo separador
    • Comunidade abre num novo separador
    • Apoio abre num novo separador

    Academy

    • Curso abre num novo separador
    • Competências abre num novo separador
    • Cláusulas abre num novo separador
    • Biblioteca de prompts abre num novo separador
    • Ferramentas abre num novo separador
    • Centro de investigação abre num novo separador
    • Documentos abre num novo separador

    Site

    • eFirm
    • Chat IA Jurídico
    • App Móvel
    • Motor Justiniano
    • HAQQ eBar
    • HAQQ eWallet
    • Preços
    • Compare-nos
    • Soluções
    • Blog
    • Conhecer a equipa
    • Junte-se a nós abre num novo separador
    Abrir a app
    • Idiomasar en fr es it de pt
    • Contatoinfo@haqq.ai
    • Estadooperacional·fundamentado
    • Termos de Serviço
    • Política de Privacidade
    • Política de Cookies
    • Processamento de Dados abre num novo separador
    • humans.txt abre num novo separadorlawyers.txt abre num novo separadorsecurity.txt abre num novo separador
    © 2026 HAQQ Inc. Todos os direitos reservados.Produto desenvolvido internamente pela HAQQ. Site construído com ferramentas web modernas.

    Per-Stage Routing

    One motion = 5 model calls, only 1 hits the flagship

    nano

    Classify intent

    1cr

    mini

    Extract facts

    4cr

    mini

    Cite-check rule

    6cr

    flagship

    Draft motion

    32cr

    mini

    QA pass

    5cr

    Total: 48 credits · Naive flagship-only: 160 credits

    Cost per Motion to Dismiss

    Same output quality, three routing strategies

    Always flagship160 cr
    Cheap-only(low quality)28 cr
    HAQQ adaptive routing48 cr

    Task → Model Matrix

    TaskNanoMiniFlagship
    Intent classification
    Date / amount extraction
    Statute lookup
    Cite verification
    Multi-step argument drafting
    Cross-jurisdiction reasoning