Los grandes modelos de lenguaje — GPT-5, Claude Opus, Gemini y otros — ya no son curiosidades experimentales. Están transformando cómo los abogados redactan contratos, analizan jurisprudencia, realizan due diligence y se comunican con sus clientes. Sin embargo, la mayoría de los profesionales del derecho todavía no tiene una comprensión clara de qué son realmente estas herramientas, cómo funcionan y dónde fallan.
Datos clave
- Estudios muestran tasas de alucinación del 69–88 % en consultas legales dirigidas a modelos de propósito general (EXTERNAL-CITE: investigación académica citada en el artículo).
- Una página de texto equivale aproximadamente a 375–400 tokens.
- Las preguntas de seguimiento específicas mejoran la calidad de la salida de los LLM en aproximadamente un 20 %; la retroalimentación vaga la deteriora (EXTERNAL-CITE: investigación de NeurIPS citada en el artículo).
Esta guía cierra esa brecha. Está escrita para abogados en ejercicio que quieren usar los LLM de forma eficaz sin necesidad de un título en informática. Cubrimos los fundamentos, las aplicaciones prácticas, los riesgos reales y las técnicas de prompting que separan el uso productivo de la dependencia excesiva y peligrosa.
La regla más importante de todas: NUNCA te fíes de las citas de jurisprudencia que te ofrezca un LLM — incluidas las de herramientas específicamente diseñadas para el ámbito legal — a menos que hayas verificado personalmente que el caso citado existe y dice exactamente lo que estás citando.
¿Qué es un gran modelo de lenguaje?
Un LLM es un tipo de inteligencia artificial entrenada con enormes cantidades de texto — libros, artículos, sitios web, escritos judiciales y documentos legales. En lugar de almacenar hechos como lo haría una base de datos, aprende patrones estadísticos sobre cómo se usa el lenguaje. Cuando escribes un prompt, el modelo predice la palabra siguiente más probable, una palabra a la vez, basándose en los patrones que ha absorbido.
Piénsalo menos como un motor de búsqueda y más como un asociado extraordinariamente bien leído. Ha tenido contacto con prácticamente todos los documentos legales, tratados y comentarios de jurisprudencia públicos jamás publicados. Pero no recupera información almacenada: genera respuestas a partir de patrones aprendidos. Esta distinción fundamental explica tanto sus notables capacidades como sus peligrosos modos de fallo.
Entre los LLM más usados están GPT-5 de OpenAI (el motor de ChatGPT), Claude Opus de Anthropic, Gemini 2.5 Pro de Google, LLaMA 4 de Meta y Medium 3 de Mistral. Cada uno tiene fortalezas distintas: Claude sobresale en el tono y el análisis de documentos extensos, GPT-5 en el razonamiento estructurado, y Gemini en el manejo de ventanas de contexto muy amplias.
Cómo funcionan realmente los LLM: la mecánica que todo abogado debería entender
Tokenización: fragmentar el lenguaje en piezas
Antes de poder procesar tu prompt, un LLM divide el texto en unidades más pequeñas llamadas tokens. Un token puede ser una palabra, parte de una palabra o un signo de puntuación. Por ejemplo, la expresión «cláusula penal» puede procesarse como uno o dos tokens, según el entrenamiento del modelo. Una página de texto equivale aproximadamente a 375–400 tokens.
Entender los tokens importa porque los LLM tienen límites estrictos sobre cuántos pueden procesar a la vez. La ventana de contexto de GPT-5 es de aproximadamente 128.000 tokens (~300 páginas). Superar ese límite hace que el modelo empiece a descartar información — normalmente desde la mitad del documento, no desde el principio ni el final.
El mecanismo de atención: cómo los modelos encuentran lo que importa
A diferencia de un humano que lee de forma secuencial, un LLM examina simultáneamente todos los tokens de tu prompt mediante un «mecanismo de atención». Esto permite al modelo ponderar la importancia de cada palabra frente a todas las demás. Cuando encuentra «banco» en tu prompt, la atención le ayuda a determinar si te refieres a una entidad financiera o a un asiento, fijándose en el contexto circundante, como «cuenta de ahorros» o «parque».
Para los abogados, esto tiene una implicación práctica decisiva: la forma en que planteas tu prompt — qué palabras enfatizas, qué contexto aportas, cómo estructuras la pregunta — determina directamente la calidad de la respuesta. El modelo no se limita a leer tus palabras: las está ponderando unas frente a otras.
Entrenamiento, fine-tuning y RLHF
Los LLM atraviesan tres etapas de desarrollo. El preentrenamiento expone al modelo a miles de millones de tokens de texto, enseñándole los patrones del lenguaje. El fine-tuning afina después el modelo para dominios específicos — una plataforma de IA legal puede afinarse con sentencias judiciales, contratos y expedientes regulatorios. Por último, el Reinforcement Learning from Human Feedback (RLHF) utiliza evaluadores humanos para clasificar las salidas del modelo, enseñándole a producir respuestas precisas, profesionales y bien estructuradas.
Por eso una herramienta de IA legal diseñada específicamente para ello, como HAQQ, supera sistemáticamente a un ChatGPT genérico en tareas legales: combina la comprensión lingüística amplia del modelo base con un fine-tuning específico del dominio y la retroalimentación de profesionales del derecho.
El problema de la alucinación: por qué los LLM fabrican información
La alucinación no es un fallo puntual: es una característica inherente a la forma en que los LLM generan texto. Como el modelo predice la palabra siguiente más probable a partir de patrones, en lugar de recuperar hechos verificados, puede producir respuestas que suenan autorizadas pero están completamente fabricadas. Citas de jurisprudencia inventadas, normas inexistentes y fallos citados incorrectamente son habituales.
Estudios muestran tasas de alucinación del 69–88 % en consultas legales dirigidas a modelos de propósito general. Incluso cuando le das al modelo el texto real de una sentencia y le pides que la resuma, puede citar mal ciertos pasajes, porque genera texto a partir de patrones en lugar de copiar de las fuentes. Algunos estudios muestran que los modelos pueden incluso «insistir» cuando se les cuestiona, reafirmando con confianza citas fabricadas.
Las consecuencias son reales. En Mata v. Avianca (2023), un abogado presentó un escrito con seis citas de jurisprudencia fabricadas y generadas por ChatGPT. El tribunal sancionó tanto al abogado como al despacho. Varios colegios de abogados han emitido desde entonces opiniones deontológicas que exigen a los abogados verificar todas las citas generadas por IA.
Los LLM no saben que están alucinando. El modelo genera el mismo tipo de prosa segura y bien estructurada tanto si está enunciando un hecho verificado como si está inventando un caso de la nada. Tu criterio profesional — no el nivel de confianza del modelo — es la única salvaguarda.
Por qué los LLM dan respuestas distintas a la misma pregunta
Si le haces la misma pregunta dos veces a un LLM, a menudo obtendrás respuestas diferentes. Esto es intencional. El modelo introduce aleatoriedad controlada (regida por un parámetro de «temperatura») al elegir la siguiente palabra que predecir. Una temperatura baja produce respuestas más predecibles y centradas. Una temperatura alta produce salidas más variadas y creativas.
Para el trabajo legal que exige precisión — análisis de contratos, cumplimiento normativo — conviene una temperatura baja. Para hacer lluvia de ideas sobre estrategias de litigio o generar argumentos creativos, una temperatura más alta puede ser útil. La mayoría de las plataformas de IA legal gestionan esto de forma automática, pero entender el mecanismo ayuda a explicar por qué varían los resultados.
El prompting en la práctica: la analogía del asociado
El modelo mental más productivo para trabajar con LLM es tratarlos como a un asociado junior extraordinariamente bien informado pero sin contexto. Lo han leído todo, pero no saben nada sobre tu caso concreto, las prioridades de tu cliente o los estándares de tu despacho. La calidad de su trabajo es directamente proporcional a la calidad de tu encargo.
Regla 1: sé absurdamente específico
La especificidad está considerada la técnica de prompting de mayor impacto, tanto por Anthropic como por OpenAI. Nunca digas «revisa este NDA». En su lugar: «Identifica todas las obligaciones de no competencia, no captación de clientes y confidencialidad. Para cada una, indica la actividad restringida, el alcance geográfico, la duración y las excepciones. Señala cualquier disposición que sobreviva a un cambio de control».
La diferencia en la calidad del resultado es enorme. Un prompt vago produce un resumen genérico que tú mismo podrías haber escrito. Un prompt específico produce un análisis sección por sección con citas a las disposiciones exactas — un trabajo que realmente hace avanzar tu caso.
Regla 2: usa el marco IRAC
Ya sabes cómo estructurar un análisis legal. Aplica el mismo marco a tus prompts: Issue (plantea la tarea), Rule (fija los criterios), Application (remite a los hechos), Conclusion (define el formato de salida). Esta estructura — que Anthropic y OpenAI llaman «prompting con marco estructurado» — produce sistemáticamente mejores resultados porque refleja cómo el mecanismo de atención del modelo procesa la información.
Regla 3: selecciona tus pruebas documentales
Investigaciones de Stanford confirman una caída significativa del rendimiento cuando los modelos procesan consultas enterradas en un contexto largo. El modelo presta más atención al principio y al final de tu entrada. En lugar de subir un acuerdo de 200 páginas y decir «cuéntame todo», extrae las secciones y definiciones relevantes. Dale al modelo una entrada seleccionada y enfocada — de la misma forma en que prepararías pruebas documentales para un escrito.
Prueba HAQQ AI gratis
Experimenta la redacción e investigación legal con IA
Regla 4: muestra un ejemplo del entregable
Cuando formas a un nuevo asociado, le enseñas un buen memorando. Los LLM funcionan igual. Aportar 2 o 3 ejemplos de alta calidad del formato de salida que buscas (lo que los investigadores llaman «few-shot prompting») mejora notablemente los resultados. Más allá de 3 ejemplos, el rendimiento disminuye. Los ejemplos deficientes degradan activamente la salida — el modelo presta tanta atención a los malos ejemplos como a los buenos.
Regla 5: nunca aceptes el primer borrador
Investigaciones de NeurIPS muestran que las preguntas de seguimiento específicas mejoran la calidad de la salida en aproximadamente un 20 %. Pero una retroalimentación vaga como «mejóralo» o «inténtalo de nuevo» en realidad degrada la calidad. En su lugar, cuestiona al modelo sobre puntos concretos: «¿Qué ocurre con la excepción de cesión entre afiliadas de la Sección 3.2(b)? ¿Crea eso un vacío en la protección contra cesiones no autorizadas?».
Regla 6: la IA no te dirá que es la pregunta equivocada
Los LLM responderán con confianza y competencia a lo que sea que les preguntes. Nunca te dirán que has hecho la pregunta equivocada. Identificar los problemas sigue siendo terreno exclusivo del abogado. El modelo responde; a ti te corresponde identificar qué necesita respuesta.
Qué pueden hacer los LLM por los equipos legales hoy
- Revisión y redlining de contratos: escanear acuerdos, identificar desviaciones de las plantillas estándar y señalar cláusulas de riesgo
- Investigación jurídica y síntesis: sintetizar grandes volúmenes de jurisprudencia, normativa y material regulatorio en memorandos estructurados
- Due diligence: extraer y condensar información de grandes conjuntos de documentos, identificando patrones en cientos de acuerdos
- Redacción: generar primeros borradores de escritos, alegatos, memorandos, cartas a clientes y solicitudes de discovery
- Verificación de cumplimiento: comparar los términos contractuales con requisitos regulatorios como el RGPD, la prevención de blanqueo de capitales, ESG o DORA
- E-discovery: analizar conjuntos de documentos mediante comprensión semántica en lugar de simple coincidencia de palabras clave
- Generación de términos de búsqueda: convertir descripciones en lenguaje natural en consultas booleanas y refinar estrategias de búsqueda
- Creación de plantillas: generar plantillas específicas por jurisdicción que se adaptan al tipo de contrato y a los datos de las partes
Privacidad, seguridad y consideraciones éticas
Como abogados, se nos confía información sensible, privilegiada y privada. Usar LLM de propósito general como ChatGPT para trabajo con clientes plantea obligaciones deontológicas serias. La mayoría de los modelos públicos conservan los datos de las conversaciones y pueden usarlos para entrenamiento salvo que optes explícitamente por desactivarlo. Esto crea un riesgo potencial de incumplimiento de la confidencialidad con el cliente.
Pasos clave de privacidad
- Desactiva el uso de datos para entrenamiento: en la configuración de ChatGPT, desactiva «Mejorar el modelo para todos»
- Evita compartir enlaces a conversaciones que contengan información privilegiada
- Considera usar plataformas de IA legal de nivel empresarial con protección de datos, anonimización y opciones de alojamiento en local integradas
- Establece políticas de uso de IA a nivel de despacho que cumplan con las directrices deontológicas de tu colegio de abogados
- Nunca subas documentos de clientes sin anonimizar a herramientas de IA públicas sin el consentimiento informado del cliente
Las plataformas de IA legal diseñadas específicamente para ello, como HAQQ, resuelven estas preocupaciones ofreciendo seguridad de nivel empresarial, anonimización de datos y cumplimiento de los estándares profesionales del derecho — sin necesidad de configurar ajustes de privacidad en herramientas de consumo.
Preguntas que hacer a los proveedores de IA
Al evaluar herramientas de IA legal, estas cinco preguntas separan las plataformas serias de las demos vistosas:
- ¿Con qué datos está entrenado el modelo y son específicos de una jurisdicción?
- ¿Dónde está alojado el modelo y cumple con tus requisitos de soberanía de datos?
- ¿Cómo se gestiona la información sensible antes de que llegue al modelo?
- ¿Se almacenan los prompts y las salidas? ¿Se usan alguna vez para mejorar el modelo?
- ¿Se pueden trazar y auditar las salidas para cumplimiento normativo y rendición de cuentas?
Cómo están cambiando los LLM la práctica del derecho
Para los abogados junior, el cambio implica desarrollar nuevas habilidades: refinar las salidas generadas por IA, detectar vacíos en el análisis del modelo, traducir los resúmenes de IA en próximos pasos accionables y gestionar las excepciones que caen fuera de los patrones aprendidos. Para los abogados senior, el reto es estratégico: decidir dónde aportan valor los LLM, fijar estándares de revisión y formar a los equipos para evaluar críticamente la salida de la IA.
Los despachos que se adapten más rápido no serán los que usen más IA — serán los que la usen con más inteligencia. Eso significa entender las capacidades y limitaciones de la tecnología, establecer marcos de gobernanza y elegir plataformas construidas específicamente para el trabajo legal en lugar de reutilizar herramientas de consumo.
La conclusión
Los LLM son el cambio tecnológico más significativo en la práctica del derecho desde el e-discovery. No sustituirán a los abogados — pero los abogados que sepan entenderlos y usarlos con eficacia sustituirán a los que no. La clave es una adopción informada: saber qué pueden hacer los LLM, entender dónde fallan e implementarlos dentro de las salvaguardas profesionales y éticas adecuadas.
HAQQ combina el poder de los modelos de lenguaje de última generación con fine-tuning específico del ámbito legal, seguridad de nivel empresarial y flujos de trabajo diseñados específicamente para ello — dando a los abogados los beneficios de los LLM sin los riesgos de las herramientas de consumo. Ya sea que estés revisando contratos, redactando alegatos o realizando investigación, el motor Justinian de HAQQ ofrece la precisión y la fiabilidad que exige el trabajo legal.



