Um sujeito lançou um projeto chamado Mike numa terça-feira. Dois commits. Oito horas de idade. Quando fui dormir, já tinha 130 estrelas no GitHub e estava no topo do Hacker News.
Mike é um clone de código aberto de Harvey e Legora. Auto-hospedável, traga sua própria chave de API, sem preço por assento. O código em si é "cru" - alguém nos comentários apontou corretamente que é basicamente uma chamada de autenticação Supabase e cinco tabelas de banco de dados. Mas esse não é realmente o ponto.
Fatos Chave
- O CourtListener do Free Law Project hospeda 250 milhões de páginas de dados de tribunais dos EUA, gratuitamente, e a maioria das startups de Legal AI o utilizam sem dar os devidos créditos.
- O Caselaw Access Project de Harvard digitalizou 360 anos de jurisprudência dos EUA: 6,9 milhões de casos, totalmente abertos desde 2024.
- A HAQQ atende mais de 17.000 equipes jurídicas em mais de 200 jurisdições, mantendo a infraestrutura não diferenciadora de código aberto.
O ponto é a reação.
Centenas de comentários. Tópicos no Reddit. Debates no LinkedIn. Advogados perguntando por que não poderiam simplesmente pedir para seu associado criar algo semelhante em um fim de semana. Construtores perguntando por que isso não tinha acontecido há cinco anos.
Li tudo duas vezes. E quanto mais lia, mais parecia um momento. Não porque Mike em si irá interromper algo - provavelmente não o fará. Mas porque a tecnologia jurídica finalmente pegou o "bug" do código aberto, e uma vez que isso começa, não dá para voltar atrás.
Por que o setor jurídico foi o último a chegar aqui
Todas as outras indústrias tiveram código aberto anos atrás. A saúde tem OpenMRS. O setor financeiro tem Hyperledger. O e-commerce tem Magento. Até os cantos mais "chatos" das empresas têm suas coisas.
O setor jurídico basicamente não tinha nada. E as razões nunca foram sobre tecnologia.
A primeira razão é que os escritórios de advocacia lucram sendo ineficientes. Desculpe - eu sei que isso soa duro. Mas a hora faturável cria um incentivo perverso: se você automatiza uma tarefa de 10 horas para 1 hora, você acabou de apagar 9 horas de receita. Então, por que algum sócio contribuiria para um projeto que faz isso?
A segunda razão é o segredo do molho. Os escritórios guardam seus bancos de petições e modelos como segredos comerciais, porque eles meio que são. Você não pode abrir o código-fonte de sua estratégia de litígio quando pode estar usando-a contra o escritório da rua no próximo mês.
A terceira razão é o medo do licenciamento. As associações de advogados não se movem rapidamente. As equipes de conformidade entram em pânico com a GPL. A maioria dos advogados que leem as palavras 'código aberto' imaginam um adolescente de moletom roubando dados de clientes, não um mantenedor do kernel Linux.
E a quarta - aquela de que ninguém fala o suficiente - é que a Thomson Reuters e a LexisNexis construíram suas fortalezas em torno de dados, não de software. KeyCite e Shepard's são taxonomias que levaram décadas para serem construídas. Replicá-las custa centenas de milhões. Então, mesmo que você quisesse lançar uma pilha legal de código aberto, a camada de dados subjacente estava trancada.
Esse é o mundo em que temos trabalhado. É também o mundo que está começando a rachar.
O que realmente está sendo construído agora
Tenho mantido uma lista em andamento. Alguns deles têm anos e finalmente estão recebendo atenção. Alguns foram lançados este mês. O espaço é muito maior do que a maioria das pessoas percebe. Deixe-me tentar organizá-lo.
A camada de dados - a base para tudo o mais
Free Law Project é a organização mais subestimada na Legal Tech. Eles administram o CourtListener (250 milhões de páginas de dados de tribunais dos EUA, gratuitos), RECAP (uma extensão de navegador que retira processos federais do PACER e os coloca em domínio público), eyecite (o parser de citações de fato dos EUA) e Juriscraper (scrapers Python para centenas de tribunais dos EUA). 138 repositórios. A maioria das startups de Legal AI treina com seus dados e não os credita. Elas deveriam.
Harvard's Caselaw Access Project digitalizou 360 anos de jurisprudência dos EUA. 6,9 milhões de casos, totalmente abertos desde 2024. Se você está construindo algo que precisa de precedentes legais americanos, é por aí que você começa.
Pile of Law - 256 GB de texto jurídico em 35 sub-corpora, hospedado no Hugging Face. O mais próximo de 'The Pile' para o direito. Quase todo LLM jurídico aberto treina com uma parte dele.
Find Case Law (Arquivos Nacionais do Reino Unido) - Julgamentos do Reino Unido publicados como XML LegalDocML legível por máquina, com feeds Atom. Este é o esquema padrão-ouro. Outros países deveriam copiá-lo.
EUR-Lex / Cellar - Toda a legislação da UE e a jurisprudência do TJUE, com um endpoint SPARQL. Provavelmente o corpus jurídico aberto mais estruturado da Terra. Subutilizado fora da academia.
OpenLegalData é o equivalente alemão - decisões judiciais alemãs gratuitas, normalizadas em portais oficiais fragmentados.
Corpus Jurídico Indiano / InLegalBERT do IIT Kharagpur abrange julgamentos da Suprema Corte e dos Tribunais Superiores indianos. A maioria das jurisdições fora dos EUA está criticamente subatendida, e a Índia é uma das poucas com um trabalho sério de corpus aberto.
O Brasil tem wrappers construídos pela comunidade em torno da API DataJud do CNJ, expondo mais de 100 milhões de registros de casos - mantidos pela comunidade, frágeis, importantes. Mesmo padrão: tecnicamente público, praticamente não-raspável, até que alguém abra a ponte em código-fonte.
Legal Data Hunter é um pequeno exemplo da longa cauda aqui - um projeto Scrapy + FastAPI que busca estatutos e publicações de diários oficiais em sites governamentais e os normaliza. Não é um carro-chefe, mas é emblemático. A Legal AI funciona com centenas de scrappers mantidos individualmente como este. Eles são a espinha dorsal sem glamour que ninguém financia.
- o Estudo de Agentes Jurídicos HAQQ (1.372 tarefas de longo horizonte)
- HAQQ Legal Benchmark, nosso benchmark de direito civil de código aberto
- o nosso relatório de campo sobre o webinar jurídico da Anthropic
- Free Law Project
- Caselaw Access Project (Harvard)
- Pile of Law (Hugging Face)
- Find Case Law (RU)
- EUR-Lex
- OpenLegalData
- InLegalBERT
Bibliotecas NLP e pesos abertos
Blackstone - Pipeline spaCy para texto jurídico do Reino Unido e da Commonwealth. Raro NER jurídico não-americano.
LexNLP - Biblioteca Python para extração de entidades legais, citações, durações, dinheiro, partes. Pré-LLM, mas ainda incluída na maioria das ferramentas comerciais que você já ouviu falar.
Legal-BERT (nlpaueb) - BERT pré-treinado em legislação da UE, ECHR, contratos dos EUA. Citado mais de mil vezes. Fundamental.
Saul (Equall.ai) - primeiro LLM de pesos abertos, com pré-treinamento continuado em corpora jurídica. Prova que a receita de 'pré-treinar um Llama de domínio' funciona para o direito.
CUAD (Atticus Project) - 13.000 cláusulas rotuladas por especialistas em 510 contratos, 41 categorias, CC BY 4.0. Quase todos os produtos de Legal AI de contrato do mundo treinam ou avaliam com base no CUAD, admitam ou não.
Benchmarks
LegalBench - 162 tarefas de raciocínio jurídico concebidas por advogados, da Stanford e da Hazy Research. É o benchmark que os laboratórios de fronteira reportam agora. Substituindo o LexGLUE na prática.
LexGLUE - a suíte mais antiga (ECtHR, SCOTUS, EUR-Lex, LEDGAR, CaseHOLD, UNFAIR-ToS). Ainda útil para comparar modelos OSS honestamente.
Legal Benchmarks AI é a versão voltada para o profissional. Sem fornecedor. Seu benchmark de elaboração de contratos colocou 14 ferramentas e um grupo de advogados humanos no mesmo sistema de pontuação, com metodologia aberta. Não se pode melhorar o que não se pode medir, e até recentemente ninguém estava medindo a Legal AI a sério.
Aplicações, agentes e habilidades de IA
Mike - o queridinho do Hacker News. Código bruto, sinal real.
Lawvable / awesome-legal-skills é aquele ao qual eu sempre volto. Um registo curado de arquivos SKILL.md escritos por profissionais reais da Clifford Chance, Baker McKenzie, e outros. Insira um no Claude, Codex, Gemini CLI, ou qualquer ferramenta que suporte o formato e você o terá ensinado a fazer uma classificação da Lei de IA da UE, uma avaliação de violação do GDPR, uma triagem de NDA, uma assignation de référé em francês. Mais de quarenta habilidades na última vez que verifiquei, crescendo semanalmente. Mais próximo de como o conhecimento jurídico realmente se move entre humanos do que qualquer produto de IA monolítico que eu tenha visto.
Divulgação: HAQQ é co-mantenedor de awesome-legal-skills.
lawskills-hub (Harvard LIL) é o parente institucional. Um registro comunitário de habilidades de agentes para fluxos de trabalho legais, com curadoria do Library Innovation Lab de Harvard. Mesmo padrão, sinal de confiança diferente. O fato de Harvard estar colocando seu nome em um registro de habilidades mostra que o formato vai se manter.
anthropic-skills - O repositório oficial de habilidades da Anthropic. Os profissionais estão bifurcando subconjuntos para trabalho jurídico. É daí que o padrão SKILL.md surgiu. A Anthropic também lançou um plugin 'Claude for Legal' em abril de 2026; sua própria equipe jurídica usa habilidades internamente e tem sido bastante pública sobre isso.
Atticus Project - organização sem fins lucrativos por trás do CUAD e de uma crescente biblioteca de ferramentas de PLN para contratos. O mais próximo que a Legal AI tem de um órgão acadêmico de padrões.
ContraxSuite (LexPredict) - plataforma de análise de contratos de código aberto. Pré-LLM, licenciado sob GPL, mas o pipeline de revisão de contratos OSS mais completo já construído. Envelhece bem como linha de base.
OLAW da Harvard LIL - bancada de trabalho Legal AI aberta para pesquisa RAG, integrando IA com APIs legais como CourtListener.
Os "cookbooks" jurídicos do LangChain e do LlamaIndex não são projetos jurídicos, mas são a base sobre a qual toda demonstração de RAG jurídico é executada. Vale a pena saber onde vivem os carregadores SEC/EDGAR, os padrões de "chunking" de contratos e os auxiliares de fundamentação de citações.
LawGPT, ChatLaw, DISC-LawLLM, Lawyer LLaMA e uma longa lista de projetos acadêmicos de Legal-LLM no Hugging Face. A maioria são protótipos de pesquisa que não sobrevivem ao contato com a prática real - mas alguns dos chineses (ChatLaw, DISC-LawLLM de Fudan) são realmente bons e subutilizados fora da China.
As demos RAG no estilo Casetext agora são uma categoria própria - há um pequeno exército de desenvolvedores independentes lançando 'clones do Harvey em 200 linhas' usando LlamaIndex ou LangChain sobre o CourtListener. A maioria são brinquedos. Alguns estão silenciosamente se transformando em produtos reais.
Tópicos do GitHub como gpt-legal-chatbot, legal-rag e legal-agent geram dezenas de projetos todos os meses. A qualidade é extremamente variável. Vale a pena escanear se você estiver pesquisando a arte anterior antes de construir.
- Mike (mikeoss.com)
- habilidades-legais-impressionantes (Lawvable)
- centro-de-habilidades-legais (Harvard LIL)
- habilidades-antrópicas
- Projeto Atticus
- ContraxSuite
- LangChain
- LlamaIndex
O que a HAQQ enviou para os bens comuns
Devo ser específico sobre esta parte, já que você perguntou.
Nomos é a nossa interface legal de agente nativo de código aberto. Auto-hospedável. Com foco em habilidades. Projetado para ser o 'Cursor para o direito' no sentido de que o Legal AI Engine e o advogado são usuários de primeira classe do mesmo espaço de trabalho. Nós o usamos internamente para o trabalho da HAQQ.
LegalMD é um dialeto Markdown para documentos legais - quatro primitivos tipados (`@party`, `@cite`, `@clause`, `@deadline`) com um parser TypeScript, um resolvedor que verifica citações contra dados legais abertos, dois renderizadores (HTML e JSON), e uma extensão VS Code. Licença MIT. A tese é que os advogados não deveriam estar a escrever contratos em DOCX em 2026, tal como os programadores não deveriam estar a escrever código em Word. Inicial, mas já disponível.
Master Claude for Legal é um pacote de habilidades comunitário. Cinco habilidades iniciais funcionais (triagem de NDA, comparação de versões de várias partes, resumo de reuniões, verificador de citações, síntese de status), documentos de referência cobrindo arquitetura de privilégios e endurecimento de permissões MCP, três modelos (política de Legal AI da firma, explicador de dados para clientes, questionário de segurança de fornecedores). MIT. Construído como a versão longa do webinar Claude for Legal Teams da Anthropic - vinte mil registos, cinquenta e uma perguntas, metade sem resposta.
awesome-legaltech é exatamente o que parece - uma lista curada de projetos de legal tech, de código aberto sempre que possível, comerciais quando vale a pena conhecer. Contribuições são bem-vindas.
awesome-legal-skills é o registo da Lawvable mencionado acima. Somos co-mantenedores.
Legal Data Hunter - a nossa camada interna de "scraper" para procurar estatutos, regulamentos e publicações oficiais em sites governamentais nas jurisdições em que operamos. Partes disto já são públicas. Mais será de código aberto nos próximos dois trimestres à medida que padronizamos o esquema.
Há mais a caminho. Parte está em repositórios privados até ser estável o suficiente para não nos envergonhar. O princípio é consistente: tudo o que não é diferenciação central do produto é empurrado de volta para os "commons". Parsers, esquemas, "scrapers", "harnesses" de avaliação, registos de habilidades - nada disso é o "fosso" da HAQQ. O nosso "fosso" é a profundidade de jurisdição, o treinamento específico da firma e a camada de produto que torna tudo isso utilizável para um advogado em atividade.
Experimente HAQQ AI grátis
Experimente a redação e pesquisa jurídica com IA
Automação de documentos, A2J, e-discovery
Docassemble existe há muito tempo e alimenta sistemas de autoajuda judicial em vários estados dos EUA. Se você já preencheu um formulário judicial gratuito online, há uma boa chance de o Docassemble estar por trás dele. Silencioso, durável, construído por um advogado-programador que nunca parou de produzir.
Open Decision é a resposta mais moderna e nativa da web, vinda de Berlim. Construtor de árvore de decisão com licença MIT para autoajuda jurídica. Ativo.
Document Assembly Line do Suffolk LIT Lab - construído sobre o Docassemble, automatiza formulários judiciais em vários estados dos EUA. Código aberto, bem mantido, profundamente sem glamour, profundamente importante.
Aleph (OCCRP) - plataforma de documentos investigativos que realiza OCR, NER, pesquisa cross-doc em escala. Não é específico para a área jurídica, mas é o análogo OSS mais próximo do Relativity ou Nuix para investigações e trabalhos adjacentes a litígios. Jornalistas o utilizam. Escritórios de advogados de demandantes também deveriam.
opensource.legal - OpenContracts para anotação, Docxodus para marcação de DOCX em WebAssembly, Python-Redlines, CAML para marcar artigos jurídicos. Infraestrutura enfadonha, enormemente valiosa.
Taxonomia LMSS da SALI Alliance - não é código, mas uma ontologia aberta que todo projeto sério de Legal AI eventualmente adota. Vale a pena saber que existe.
Guia de Código Aberto do GitHub sobre questões legais não é um produto, mas se você está atuando neste espaço e não entende a diferença entre MIT, Apache 2.0 e AGPL, leia-o antes de lançar qualquer coisa.
Deixei de fora uma dúzia a mais. Sobreviventes no estilo ROSS, experimentos com contratos inteligentes, scrapers regionais de nicho, repositórios de hackathon semi-acabados que discretamente se transformaram em infraestrutura. O ecossistema é real agora. Há dois anos, eu conseguia encaixar todo o cenário de Legal AI de código aberto em um slide. Não consigo mais.
- Docassemble
- Decisão Aberta
- Linha de Montagem de Documentos Suffolk LIT
- Aleph (OCCRP)
- opensource.legal
- SALI Alliance
- Guia de Código Aberto do GitHub - Legal
Aquilo de que ninguém fala: dados
Aqui está a parte que não cabe no site de marketing.
O gargalo na Legal AI não são os modelos. Nem mesmo as ferramentas. São os dados.
O trabalho que realmente importa para os clientes - memorandos, documentos de transação, produções de descoberta, cartas de liquidação, aconselhamento interno, as marcações que um sócio sênior faz às 2h da manhã - é privilegiado, confidencial ou contratualmente trancado dentro das empresas. Nada disso pode ser divulgado. Nada disso pode ser publicamente avaliado. Nada disso pode ser usado para treinar um Legal AI Engine que outra empresa verá. A decisão Heppner que mencionei anteriormente tornou isso ainda mais explícito.
O que resta em aberto - pareceres publicados, estatutos, registros EDGAR, 510 contratos da CUAD - é uma fatia minúscula e não representativa. Apelação. Empresa de capital aberto. Idioma inglês. Orientado para os EUA. É por isso que benchmarks como o LegalBench parecem limitados. É por isso que os modelos de contrato se ajustam excessivamente à CUAD. É por isso que o verdadeiro fosso de todo fornecedor sério de Legal AI é um pipeline de dados privado, e não uma escolha de arquitetura.
Isso cria um teto estrutural para o código aberto. O OSS pode fornecer excelentes encanamentos (eyecite, Juriscraper, Docassemble, Aleph, Open Decision) e excelentes Legal AI Engines de dados públicos (Legal-BERT, Saul, InLegalBERT). Mas não consegue fechar o ciclo do produto de trabalho que define a prática real. Você não pode abrir o código do que você não tem acesso.
Portanto, a fronteira interessante do OSS não é 'GPT aberto para o direito'. É avaliação federada. Geração de dados sintéticos. Ajuste fino que preserva a privacidade. Mercados de habilidades que permitem às empresas manter seus dados privados e compartilhar o comportamento. Essa é a área onde o código aberto ainda tem alavancagem real em 2026, e é a área que mais me entusiasma.
O corolário, a propósito, é que a camada de dados jurídicos públicos importa mais do que nunca. Todo governo que abre seus estatutos e jurisprudência em formato legível por máquina expande a superfície onde o código aberto pode competir em pé de igualdade. O Arquivo Nacional do Reino Unido acertou com o LegalDocML. A UE acertou a maior parte com o EUR-Lex. A maioria das outras jurisdições, incluindo aquelas em que a HAQQ opera, não o fez. Vemos isso todos os dias. Estatutos bloqueados em PDFs. Decisões judiciais publicadas uma vez e nunca indexadas. Diários oficiais que existem apenas como imagens digitalizadas. Desenvolvedores solo construindo scrapers como o Legal Data Hunter para corrigir isso uma lei por vez.
Se você quer saber onde está o verdadeiro gargalo, é aí.
Os argumentos que continuo vendo e o que realmente penso
Toda vez que um desses projetos chega ao Hacker News ou Reddit, os mesmos argumentos surgem. Deixe-me apresentar os que acho interessantes.
É apenas um wrapper em torno de um LLM.
Sim. Assim como o Cursor. Assim como o Harvey. Assim como, francamente, a maioria do que está sendo lançado agora em qualquer vertical de IA. O wrapper é onde o produto reside - precisão da citação, manipulação de documentos, orquestração de fluxo de trabalho, modelo de implantação, postura de segurança. Dizer 'é apenas um wrapper' é como dizer 'seu carro é apenas um chassi em torno de um motor'. Tecnicamente verdadeiro. Completamente sem sentido.
O Copyleft matará a adoção empresarial.
Com este, eu realmente concordo. Escritórios de advocacia não vão licenciar GPL a sua pilha interna. Qualquer um que esteja a distribuir Legal AI de código aberto deve escolher Apache 2.0 ou MIT, ponto final. As equipas que entenderem isso ganharão adoção. As equipas que não entenderem serão elogiadas no Twitter e ignoradas nas aquisições.
Grandes escritórios nunca usarão código aberto para trabalho jurídico.
Eles já usam. Todo escritório de advocacia do mundo opera com Linux, Postgres e centenas de outras peças de código aberto. A questão não é se eles usarão OSS - eles estão literalmente a digitar este comentário num navegador Chromium. A questão é se eles confiarão no código aberto para a camada específica do jurídico. E a resposta é: eles confiarão, mas apenas quando for algo que possam auto-hospedar, auditar e proteger. Que é exatamente o que o bom código aberto permite.
A IA quebra o sigilo advogado-cliente.
A decisão Heppner que todos continuam a citar era sobre um serviço público de chatbot. Não era sobre um escritório a executar a sua própria instância nos seus próprios servidores com as suas próprias chaves. A auto-hospedagem é a história do privilégio. E o código aberto é a única maneira de a maioria dos escritórios conseguir auto-hospedar sem um contrato do tamanho de um Harvey.
Onde a HAQQ realmente se posiciona
Devo dizer o óbvio: a HAQQ não é de código aberto. Somos uma empresa apoiada por capital de risco que constrói um produto comercial. Temos nove mil e oitocentos escritórios a pagar-nos em oitenta e poucos países. Nada disso vai mudar.
Mas toda a nossa pilha é executada em código aberto. Usamos Postgres, Next.js, Python, Node, SDKs de todos os fornecedores de modelos, dezenas de bibliotecas pelas quais nunca pagamos e nunca poderíamos ter construído. Publicamos as nossas próprias habilidades e bibliotecas de IA de volta. Enviamos PRs para o upstream. Patrocinamos projetos quando podemos.
E aqui está o que eu continuo a dizer à nossa equipa: mais código aberto em tecnologia jurídica é bom para nós, não mau para nós. Isso eleva o nível. Quando o CourtListener existe, quando o LegalBench existe, quando o Lawvable existe, cada construtor neste espaço - incluindo nós - pode competir no que realmente importa. Que é se o produto resolve um problema real para um advogado real.
Se o Mike, o Docassemble ou o OpenContracts ajudarem um profissional liberal em qualquer lugar a servir melhor os seus clientes, isso é uma vitória. Não estamos no negócio de impedir que outras pessoas construam. Estamos no negócio de garantir que os cinco biliões de pessoas que não podem pagar ajuda jurídica a recebam.
A era do "walled garden" da tecnologia jurídica está a terminar. Nunca iria durar.
O que eu esperaria a seguir
Algumas previsões, baixa confiança no timing, alta confiança na direção:
- A questão do licenciamento é resolvida. O Apache 2.0 vence no setor jurídico. Qualquer pessoa que use AGPL ou copyleft terá dificuldades com a aquisição empresarial até que faça uma nova licença.
- O autoalojamento torna-se um dado adquirido. O argumento do privilégio vai levar as firmas de advogados Am Law a implementações privadas rapidamente. Projetos com imagens Docker limpas e infraestrutura sã vão comer uma grande parte do "almoço" do Harvey.
- Dados jurídicos abertos tornam-se globais. Os EUA têm o CourtListener. A maioria das outras jurisdições não tem nada comparável. Quem abrir os dados dos tribunais no Brasil, Índia, Indonésia, Nigéria - essas pessoas vão moldar a próxima década. Estamos a trabalhar na nossa parte disso.
- As "skills" tornam-se a unidade do conhecimento jurídico. Lawvable é pioneiro, mas correto. "Skills" de IA modulares, criadas por profissionais e controladas por versão estão mais próximas de como os advogados realmente partilham conhecimento do que monólitos ajustados. Estamos a reconstruir partes do nosso próprio produto em torno desta ideia.
- O momento Mike vai repetir-se. A cada poucas semanas agora, alguém vai lançar um projeto de fim de semana que recebe demasiada atenção e pouca análise. A maioria não importará. Alguns sim. Preste atenção a quais deles os advogados (não apenas os engenheiros) continuam a voltar.
O que me continua a vir à mente é que o "open source" na tecnologia jurídica não é uma ameaça para os advogados. Não é uma ameaça para bons produtos de Legal AI. É a camada de infraestrutura que torna ambos melhores.
Os construtores estão finalmente a aparecer. Os dados estão a abrir-se. As ferramentas estão a tornar-se reais.
Se você está construindo algo neste espaço - de código aberto ou não - eu adoraria saber. Entre em contato comigo em stephane@haqq.ai.



