Un tipo lanzó un proyecto llamado Mike un martes. Dos commits. Ocho horas de vida. Para cuando me fui a dormir ya tenía 130 estrellas en GitHub y estaba en el primer puesto de Hacker News.
Mike es un clon de código abierto de Harvey y Legora. Autoalojable, trae tu propia clave de API, sin precio por asiento. El código en sí es tosco - alguien en los comentarios señaló, con razón, que es básicamente una llamada de autenticación de Supabase y cinco tablas de base de datos. Pero ese no es realmente el punto.
Datos clave
- CourtListener, de Free Law Project, aloja 250 millones de páginas de datos judiciales de EE. UU., gratis, y la mayoría de las startups de IA legal entrenan con ellos sin dar crédito.
- El Caselaw Access Project de Harvard digitalizó 360 años de jurisprudencia estadounidense: 6,9 millones de casos, totalmente abiertos desde 2024.
- HAQQ tiene cerca de 9.800 despachos que pagan en más de 200 países, mientras mantiene abierta la infraestructura que no diferencia.
El punto es la reacción.
Cientos de comentarios. Hilos en Reddit. Debates en LinkedIn. Abogados preguntando por qué no podían simplemente pedirle a su asociado que armara algo similar en un fin de semana. Constructores preguntando por qué esto no había pasado hace cinco años.
Leí todo el hilo dos veces. Y cuanto más leía, más sentía que era un momento. No porque Mike vaya a disrumpir nada - probablemente no lo hará. Sino porque la legaltech finalmente atrapó el bicho del código abierto, y una vez que eso empieza, ya no se puede detener.
Por qué el derecho fue el último vertical en llegar aquí
Todas las demás industrias tuvieron código abierto hace años. La salud tiene OpenMRS. Las fintech tienen Hyperledger. El comercio electrónico tiene Magento. Incluso los rincones más aburridos de la empresa tienen lo suyo.
El derecho no tenía prácticamente nada. Y las razones nunca fueron sobre tecnología.
La primera razón es que los despachos de abogados ganan dinero siendo ineficientes. Perdón, sé que suena duro. Pero la hora facturable crea un incentivo perverso: si automatizas una tarea de 10 horas y la reduces a 1, acabas de borrar 9 horas de ingresos. ¿Por qué entonces un socio contribuiría a un proyecto que hace eso?
La segunda razón es el asunto de la salsa secreta. Los despachos guardan sus bancos de escritos y plantillas como secretos comerciales, porque en cierto modo lo son. No puedes abrir el código de tu estrategia de litigio cuando podrías estar usándola contra el despacho de la esquina el mes que viene.
La tercera razón es el miedo a las licencias. Los colegios de abogados no se mueven rápido. Los equipos de cumplimiento entran en pánico ante la GPL. La mayoría de los asesores legales que leen las palabras 'código abierto' imaginan a un adolescente con capucha robando datos de clientes, no a un mantenedor del kernel de Linux.
Y la cuarta - de la que nadie habla lo suficiente - es que Thomson Reuters y LexisNexis construyeron sus fosos alrededor de los datos, no del software. KeyCite y Shepard's son taxonomías que tardaron décadas en construirse. Replicarlas cuesta cientos de millones. Así que incluso si quisieras lanzar una pila legal de código abierto, la capa de datos que hay debajo estaba bajo llave.
Ese es el mundo en el que hemos estado trabajando. También es el mundo que está empezando a agrietarse.
Lo que realmente se está construyendo ahora mismo
He estado llevando una lista continua. Algunos de estos proyectos tienen años y por fin están recibiendo atención. Otros se lanzaron este mes. El espacio es mucho más grande de lo que la mayoría cree. Déjame intentar organizarlo.
La capa de datos - lo que sostiene todo lo demás
Free Law Project es la organización más infravalorada de la legaltech. Gestionan CourtListener (250 millones de páginas de datos judiciales de EE. UU., gratis), RECAP (una extensión de navegador que saca las presentaciones federales de PACER hacia el dominio público), eyecite (el analizador de citas de facto en EE. UU.) y Juriscraper (scrapers en Python para cientos de tribunales estadounidenses). 138 repositorios. La mayoría de las startups de IA legal entrenan con sus datos y no les dan crédito. Deberían.
El Caselaw Access Project de Harvard digitalizó 360 años de jurisprudencia estadounidense. 6,9 millones de casos, totalmente abiertos desde 2024. Si estás construyendo algo que necesita precedente legal estadounidense, ahí es donde empiezas.
Pile of Law - 256 GB de texto legal en 35 subcorpus, alojado en Hugging Face. Lo más parecido a 'The Pile' para el derecho. Casi todo LLM legal abierto entrena con una porción de él.
Find Case Law (Archivo Nacional del Reino Unido) - sentencias del Reino Unido publicadas como XML legible por máquina en formato LegalDocML, con feeds Atom. Este es el estándar de esquema por excelencia. Otros países deberían copiarlo.
EUR-Lex / Cellar - toda la legislación de la UE y la jurisprudencia del TJUE, con un endpoint SPARQL. Probablemente el corpus legal abierto más estructurado del planeta. Infrautilizado fuera del ámbito académico.
OpenLegalData es el equivalente alemán: decisiones judiciales alemanas gratuitas, normalizadas a partir de portales oficiales fragmentados.
Indian Legal Corpus / InLegalBERT del IIT Kharagpur cubre sentencias del Tribunal Supremo y los Altos Tribunales de la India. La mayoría de las jurisdicciones fuera de EE. UU. están críticamente desatendidas, y la India es una de las pocas con trabajo serio de corpus abierto.
Brasil cuenta con envoltorios construidos por la comunidad alrededor de la API DataJud del CNJ, que expone más de 100 millones de registros de casos: mantenidos por la comunidad, frágiles, importantes. El mismo patrón: técnicamente público, prácticamente inaccesible mediante scraping, hasta que alguien abre el código del puente.
Legal Data Hunter es un pequeño ejemplo de la cola larga aquí: un proyecto en Scrapy + FastAPI que rastrea estatutos y publicaciones de gacetas en sitios gubernamentales y los normaliza. No es un buque insignia, pero es emblemático. La IA legal funciona sobre cientos de scrapers mantenidos en solitario como este. Son la columna vertebral poco glamurosa que nadie financia.
- el HAQQ Legal Agent Study (1.372 tareas de largo horizonte)
- HAQQ-LAB, nuestro benchmark de derecho civil de código abierto
- nuestro reportaje sobre el webinar legal de Anthropic
- Free Law Project
- Caselaw Access Project (Harvard)
- Pile of Law (Hugging Face)
- Find Case Law (Reino Unido)
- EUR-Lex
- OpenLegalData
- InLegalBERT
Librerías de PLN y pesos abiertos
Blackstone - pipeline de spaCy para texto legal del Reino Unido y la Commonwealth. Un raro NER legal fuera de EE. UU.
LexNLP - librería de Python para extraer entidades legales, citas, plazos, dinero, partes. Anterior a los LLM pero aún integrada dentro de la mitad de las herramientas comerciales de las que has oído hablar.
Legal-BERT (nlpaueb) - BERT preentrenado con legislación de la UE, el CEDH y contratos de EE. UU. Citado más de mil veces. Fundacional.
Saul (Equall.ai) - el primer LLM de pesos abiertos con preentrenamiento continuado sobre corpus legales. Demuestra que la receta de 'preentrenar un Llama en un dominio' funciona para el derecho.
CUAD (Atticus Project) - 13.000 cláusulas etiquetadas por expertos en 510 contratos, 41 categorías, CC BY 4.0. Casi todo producto de IA para contratos en el mundo entrena o evalúa con CUAD, lo admita o no.
Benchmarks
LegalBench - 162 tareas de razonamiento legal diseñadas por abogados, de Stanford y Hazy Research. El benchmark sobre el que hoy reportan los laboratorios de frontera. Reemplazando a LexGLUE en la práctica.
LexGLUE - la suite más antigua (TEDH, Tribunal Supremo de EE. UU., EUR-Lex, LEDGAR, CaseHOLD, UNFAIR-ToS). Sigue siendo útil para comparar modelos de código abierto con honestidad.
Legal Benchmarks AI es la versión orientada al practicante. Libre de proveedores. Su benchmark de redacción de contratos puso a 14 herramientas y un grupo de abogados humanos en el mismo sistema de puntuación, con metodología abierta. No puedes mejorar lo que no puedes medir, y hasta hace poco nadie medía la IA legal en serio.
Aplicaciones de IA, agentes y skills
Mike - el consentido de Hacker News. Código tosco, señal real.
Lawvable / awesome-legal-skills es al que sigo volviendo. Un registro curado de archivos SKILL.md escritos por practicantes reales de Clifford Chance, Baker McKenzie y otros. Suelta uno en Claude, Codex, Gemini CLI o cualquier herramienta compatible con el formato y le habrás enseñado a hacer una clasificación bajo la Ley de IA de la UE, una evaluación de brecha del RGPD, un triaje de NDA, una référé de asignación en francés. Más de cuarenta skills la última vez que lo revisé, creciendo cada semana. Más cercano a cómo el conocimiento legal realmente se mueve entre humanos que cualquier producto de IA monolítico que haya visto.
Divulgación: HAQQ es co-mantenedor de awesome-legal-skills.
lawskills-hub (Harvard LIL) es el primo institucional. Un registro comunitario de skills de agentes para flujos de trabajo legales, curado por el Library Innovation Lab de Harvard. Mismo patrón, distinta señal de confianza. El hecho de que Harvard esté poniendo su nombre en un registro de skills dice que el formato va a quedarse.
anthropic-skills - el repositorio oficial de skills de Anthropic. Los practicantes están haciendo forks de subconjuntos para trabajo legal. De aquí salió originalmente el estándar SKILL.md. Anthropic también lanzó un plugin 'Claude for Legal' en abril de 2026; su propio equipo legal usa skills internamente y ha sido bastante público al respecto.
Atticus Project - la organización sin fines de lucro detrás de CUAD y una biblioteca creciente de herramientas de PLN para contratos. Lo más cercano que tiene la IA legal a un organismo académico de estándares.
ContraxSuite (LexPredict) - plataforma de análisis de contratos de núcleo abierto. Anterior a los LLM, licenciada bajo GPL, pero el pipeline de revisión de contratos de código abierto más completo jamás construido. Envejece bien como línea base.
OLAW del Harvard LIL - banco de trabajo de IA legal abierta para investigación en RAG, integrando IA con APIs legales como CourtListener.
LangChain y LlamaIndex y sus recetarios legales no son proyectos legales, pero son la plomería sobre la que corre toda demo de RAG legal. Vale la pena saber dónde viven los loaders de SEC/EDGAR, los patrones de fragmentación de contratos y los ayudantes de fundamentación de citas.
LawGPT, ChatLaw, DISC-LawLLM, Lawyer LLaMA y una larga cola de proyectos académicos de LLM legales en Hugging Face. La mayoría son prototipos de investigación que no sobreviven al contacto con la práctica real, pero algunos de los de lengua china (ChatLaw, DISC-LawLLM de Fudan) son realmente buenos y están infrautilizados fuera de China.
Las demos de RAG al estilo Casetext son ya una categoría propia: hay un pequeño ejército de desarrolladores solitarios lanzando 'clones de Harvey en 200 líneas' usando LlamaIndex o LangChain sobre CourtListener. La mayoría son juguetes. Unos pocos se están convirtiendo silenciosamente en productos reales.
Temas de GitHub como gpt-legal-chatbot, legal-rag y legal-agent sacan a la luz docenas de proyectos cada mes. La calidad es enormemente variable. Vale la pena revisarlos si estás investigando antecedentes antes de construir.
- Mike (mikeoss.com)
- awesome-legal-skills (Lawvable)
- lawskills-hub (Harvard LIL)
- anthropic-skills
- Atticus Project
- ContraxSuite
- LangChain
- LlamaIndex
Lo que HAQQ ha aportado a los bienes comunes
Debería ser específico en esta parte ya que lo preguntaste.
Nomos es nuestra interfaz legal nativa para agentes, de código abierto. Autoalojable. Skills primero. Diseñada para ser el 'Cursor para el derecho' en el sentido de que el motor de IA legal y el abogado son ambos usuarios de primera clase del mismo espacio de trabajo. Lo usamos internamente para el trabajo de HAQQ.
LegalMD es un dialecto de Markdown para documentos legales: cuatro primitivas tipadas (`@party`, `@cite`, `@clause`, `@deadline`) con un parser en TypeScript, un resolver que verifica citas contra datos legales abiertos, dos renderizadores (HTML y JSON), y una extensión de VS Code. Licenciado bajo MIT. La tesis es que los abogados no deberían estar escribiendo contratos en DOCX en 2026, igual que los desarrolladores no deberían escribir código en Word. Temprano pero en marcha.
Master Claude for Legal es un paquete de skills comunitario. Cinco skills iniciales funcionales (triaje de NDA, diff de versiones multipartes, resumen de reunión, verificador de citas, síntesis de estado), documentos de referencia que cubren arquitectura de privilegio y endurecimiento de permisos MCP, tres plantillas (política de IA del despacho, explicador de datos para clientes, cuestionario de seguridad de proveedores). MIT. Construido como la versión extendida del webinar Claude for Legal Teams de Anthropic: veinte mil inscripciones, cincuenta y una preguntas, la mitad sin responder.
awesome-legaltech es exactamente lo que suena: una lista curada de proyectos de legaltech, de código abierto donde es posible, comerciales cuando vale la pena conocerlos. Se aceptan contribuciones.
awesome-legal-skills es el registro de Lawvable mencionado arriba. Lo co-mantenemos.
Legal Data Hunter - nuestra capa interna de scraping para rastrear estatutos, reglamentos y publicaciones de gacetas en sitios gubernamentales de las jurisdicciones en las que operamos. Partes de esto ya son públicas. Más se abrirá al código abierto en los próximos dos trimestres a medida que estandaricemos el esquema.
Hay más por venir. Parte está en repositorios privados hasta que sea lo bastante estable como para no avergonzarnos. El principio es consistente: todo lo que no sea diferenciación central del producto se devuelve a los bienes comunes. Parsers, esquemas, scrapers, arneses de evaluación, registros de skills: nada de eso es el foso de HAQQ. Nuestro foso es la profundidad jurisdiccional, el entrenamiento específico por despacho, y la capa de producto que hace que todo eso sea utilizable para un abogado en ejercicio.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
Automatización documental, A2J, e-discovery
Docassemble existe desde hace tiempo y da soporte a sistemas de autoayuda judicial en varios estados de EE. UU. Si alguna vez llenaste un formulario judicial gratuito en línea, hay bastantes probabilidades de que Docassemble estuviera detrás. Discreto, duradero, construido por un abogado-programador que simplemente siguió lanzando código.
Open Decision es la respuesta más moderna y nativa de la web, de Berlín. Constructor de árboles de decisión con licencia MIT para autoayuda legal. Activo.
Document Assembly Line del Suffolk LIT Lab - construido sobre Docassemble, automatiza formularios judiciales en varios estados de EE. UU. Código abierto, bien mantenido, profundamente poco atractivo, profundamente importante.
Aleph (OCCRP) - plataforma de documentos de investigación que hace OCR, NER y búsqueda entre documentos a escala. No es específica del derecho, pero es el análogo de código abierto más cercano a Relativity o Nuix para investigaciones y trabajo adyacente al litigio. Los periodistas lo usan. Los despachos de demandantes también deberían.
opensource.legal - OpenContracts para anotación, Docxodus para redlines de DOCX en WebAssembly, Python-Redlines, CAML para marcar artículos legales. Infraestructura poco vistosa, enormemente valiosa.
Taxonomía LMSS de SALI Alliance - no es código, sino una ontología abierta que todo proyecto serio de IA legal adopta tarde o temprano. Vale la pena saber que existe.
La Guía de código abierto de GitHub sobre temas legales no es un producto, pero si estás lanzando algo en este espacio y no entiendes la diferencia entre MIT, Apache 2.0 y AGPL, léela antes de subir nada.
Dejé fuera una docena más. Sobrevivientes al estilo ROSS, experimentos con contratos inteligentes, scrapers regionales de nicho, repositorios de hackathon a medio terminar que silenciosamente se convirtieron en infraestructura. El ecosistema ya es real. Hace dos años podía caber todo el panorama de IA legal de código abierto en una sola diapositiva. Ya no puedo.
- Docassemble
- Open Decision
- Suffolk LIT Document Assembly Line
- Aleph (OCCRP)
- opensource.legal
- SALI Alliance
- GitHub Open Source Guide - Legal
Lo que nadie menciona: los datos
Aquí está la parte que no encaja en el sitio de marketing.
El cuello de botella en la IA legal no son los modelos. Ni siquiera son las herramientas. Son los datos.
El trabajo que realmente le importa a los clientes - memorandos, documentos de operaciones, producciones de discovery, cartas de acuerdo, asesoría interna, los redlines que hace un socio senior a las 2 de la madrugada - está protegido por privilegio, es confidencial o está encerrado contractualmente dentro de los despachos. Nada de eso puede publicarse. Nada de eso puede medirse públicamente. Nada de eso puede usarse para entrenar un motor de IA legal que otro despacho vaya a ver. La sentencia Heppner que mencioné antes acaba de hacer esto aún más explícito.
Lo que queda en abierto - dictámenes publicados, estatutos, presentaciones ante la SEC en EDGAR, los 510 contratos de CUAD - es una porción diminuta y no representativa. De apelación. De empresas públicas. En inglés. Sesgada hacia EE. UU. Por eso benchmarks como LegalBench se sienten limitados. Por eso los modelos de contratos sobreajustan a CUAD. Por eso el verdadero foso de todo proveedor serio de IA legal es un pipeline de datos privado, no una decisión de arquitectura.
Esto crea un techo estructural para el código abierto. El código abierto puede lanzar plomería excelente (eyecite, Juriscraper, Docassemble, Aleph, Open Decision) y excelentes motores de IA legal con datos públicos (Legal-BERT, Saul, InLegalBERT). Pero no puede cerrar el ciclo sobre el trabajo entregable que define la práctica real. No puedes abrir el código de lo que no tienes acceso.
Así que la frontera interesante del código abierto no es 'un GPT abierto para el derecho'. Es la evaluación federada. La generación de datos sintéticos. El ajuste fino que preserva la privacidad. Los mercados de skills que dejan a los despachos mantener sus datos privados mientras comparten el comportamiento. Ese es el carril donde el código abierto todavía tiene apalancamiento real en 2026, y es el carril que más me entusiasma.
El corolario, por cierto, es que la capa de datos legales públicos importa más que nunca. Cada gobierno que abre sus estatutos y jurisprudencia en formato legible por máquina amplía la superficie donde el código abierto puede competir en igualdad de condiciones. El Archivo Nacional del Reino Unido lo clavó con LegalDocML. La UE acertó en gran parte con EUR-Lex. La mayoría de las demás jurisdicciones, incluidas aquellas en las que opera HAQQ, no lo han hecho. Lo vemos todos los días. Estatutos encerrados en PDF. Sentencias judiciales publicadas una vez y nunca indexadas. Gacetas que existen solo como imágenes escaneadas. Desarrolladores solitarios construyendo scrapers como Legal Data Hunter para arreglarlo ley por ley.
Si quieres saber dónde está el verdadero cuello de botella, está ahí.
Los argumentos que sigo viendo, y lo que realmente pienso
Cada vez que uno de estos proyectos llega a Hacker News o Reddit, aparecen los mismos argumentos. Déjame repasar los que me parecen interesantes.
Es solo un envoltorio alrededor de un LLM.
Sí. Igual que Cursor. Igual que Harvey. Igual que, francamente, la mayor parte de lo que se lanza hoy en cualquier vertical de IA. El envoltorio es donde vive el producto: precisión de citas, manejo de documentos, orquestación de flujos de trabajo, modelo de despliegue, postura de seguridad. Decir 'es solo un envoltorio' es como decir 'tu auto es solo un chasis alrededor de un motor'. Técnicamente cierto. Completamente fuera de foco.
El copyleft matará la adopción empresarial.
Con este estoy de acuerdo. Los despachos de abogados no van a poner GPL a su pila interna. Cualquiera que lance IA legal de código abierto debería elegir Apache 2.0 o MIT, punto. Los equipos que entiendan esto ganarán adopción. Los que no, recibirán amor en Twitter y serán ignorados en las compras.
Los grandes despachos nunca usarán código abierto para trabajo legal.
Ya lo hacen. Todo despacho de abogados del mundo corre sobre Linux, Postgres y otras cien piezas de código abierto. La pregunta no es si usarán OSS - literalmente están escribiendo ese comentario en un navegador Chromium. La pregunta es si confiarán en el código abierto para la capa específica del derecho. Y la respuesta es: lo harán, pero solo cuando sea algo que puedan autoalojar, auditar y blindar. Que es exactamente lo que habilita el buen código abierto.
La IA rompe el privilegio abogado-cliente.
La sentencia Heppner que todos siguen citando era sobre un servicio público de chatbot. No era sobre un despacho corriendo su propia instancia en sus propios servidores con sus propias claves. El autoalojamiento es la historia del privilegio. Y el código abierto es la única forma en que la mayoría de los despachos llega a autoalojar sin un contrato del tamaño de Harvey.
Dónde se posiciona realmente HAQQ
Debería decir lo obvio: HAQQ no es de código abierto. Somos una empresa respaldada por capital de riesgo construyendo un producto comercial. Tenemos nueve mil ochocientos despachos pagando en más de ochenta países. Nada de eso va a cambiar.
Pero toda nuestra pila corre sobre código abierto. Usamos Postgres, Next.js, Python, Node, los SDK de todos los proveedores de modelos, docenas de librerías que nunca pagamos y nunca podríamos haber construido. Publicamos de vuelta nuestras propias skills y librerías de IA. Enviamos pull requests aguas arriba. Patrocinamos proyectos cuando podemos.
Y esto es lo que le sigo diciendo a nuestro equipo: más código abierto en legaltech es bueno para nosotros, no malo. Eleva el piso. Cuando existe CourtListener, cuando existe LegalBench, cuando existe Lawvable, todo constructor en este espacio, incluidos nosotros, puede competir en lo que realmente importa. Que es si el producto resuelve un problema real para un abogado real.
Si Mike o Docassemble u OpenContracts ayudan a un practicante independiente en algún lugar a servir mejor a sus clientes, eso es una victoria. No estamos en el negocio de impedir que otros construyan. Estamos en el negocio de asegurarnos de que los cinco mil millones de personas que no pueden pagar ayuda legal realmente reciban algo.
La era del jardín amurallado en legaltech está terminando. Nunca iba a durar.
Qué vigilaría a continuación
Algunas predicciones, baja confianza en el momento, alta confianza en la dirección:
- La cuestión de las licencias se resuelve. Apache 2.0 gana en el derecho. Quien lance AGPL o copyleft tendrá problemas con las compras empresariales hasta que relicencie.
- El autoalojamiento se convierte en algo obligatorio. El argumento del privilegio va a empujar a los despachos Am Law hacia despliegues privados rápido. Los proyectos con imágenes Docker limpias e infraestructura sensata se comerán buena parte del almuerzo de Harvey.
- Los datos legales abiertos se vuelven globales. EE. UU. tiene CourtListener. La mayoría de las demás jurisdicciones no tienen nada comparable. Quien abra los datos judiciales en Brasil, India, Indonesia, Nigeria, esa gente va a moldear la próxima década. Estamos trabajando en nuestra parte de esto.
- Las skills se convierten en la unidad del conocimiento legal. Lawvable es temprano pero acertado. Las skills de IA modulares, escritas por practicantes y con control de versiones están más cerca de cómo los abogados realmente comparten conocimiento que los monolitos con ajuste fino. Estamos reconstruyendo partes de nuestro propio producto alrededor de esta idea.
- El momento Mike se repetirá. Cada pocas semanas, alguien lanzará un proyecto de fin de semana que recibe demasiada atención y no suficiente escrutinio. La mayoría no importará. Algunos sí. Presta atención a cuáles siguen usando los abogados de verdad, no solo los ingenieros.
A lo que sigo volviendo es que el código abierto en legaltech no es una amenaza para los abogados. Tampoco es una amenaza para los buenos productos de IA legal. Es la capa de infraestructura que hace mejores a ambos.
Los constructores por fin están apareciendo. Los datos se están abriendo. Las herramientas se están volviendo reales.
Si estás construyendo algo en este espacio, de código abierto o no, me encantaría saberlo. Escríbeme a stephane@haqq.ai.



