Una alucinación es una salida generada que contiene información falsa, errónea, incoherente o no respaldada, aunque pueda estar redactada de forma convincente. NIST utiliza el término más preciso confabulación y también incluye respuestas que contradicen la entrada o afirmaciones previas del mismo contexto.
El término no describe una intención de engañar ni un estado mental del modelo. Describe un modo de fallo que debe definirse y medirse según la tarea.
Por qué ocurre
Los modelos de lenguaje estiman secuencias probables a partir de patrones aprendidos y del contexto disponible. Ese mecanismo puede producir texto correcto, pero también completar huecos con contenido plausible cuando la evidencia es insuficiente, ambigua, contradictoria o está fuera de la distribución esperada.
La aplicación puede añadir otros fallos: recuperar una fuente equivocada, truncar una tabla, mezclar versiones, perder una negación o pedir una respuesta cuando el sistema debería abstenerse. Por eso «el modelo alucinó» no es un diagnóstico suficiente.
Conviene distinguir al menos:
- error factual: afirma un dato incorrecto;
- cita o fuente inexistente: inventa una referencia o atribuye contenido que la fuente no contiene;
- respuesta no fundamentada: la afirmación puede ser cierta, pero no está respaldada por la evidencia exigida;
- inconsistencia: contradice otra parte de la respuesta, la entrada o una restricción;
- completado indebido: rellena campos desconocidos en vez de marcarlos como ausentes.
Cuándo se convierte en un riesgo material
La frecuencia de error no basta. Hay que combinar probabilidad, exposición, detectabilidad, reversibilidad e impacto. El mismo porcentaje puede ser asumible al generar ideas y crítico al preparar dosis, condiciones contractuales o instrucciones de seguridad.
El riesgo aumenta cuando la persona no puede comprobar la fuente, la respuesta se integra automáticamente en otro sistema, el volumen impide revisar, la interfaz muestra una confianza engañosa o el error afecta de forma desigual a determinados grupos.
Ejemplo empresarial
Un asistente responde que una factura puede aprobarse porque «la política permite excepciones inferiores a 5.000 euros». La frase es plausible, pero la política recuperada no contiene ese umbral.
El control útil no consiste solo en pedir al modelo que no invente. La interfaz muestra el fragmento exacto, comprueba que la afirmación está respaldada, obliga a abstenerse si no hay evidencia y registra correcciones. Si la aprobación produce un pago, una persona conserva autoridad antes del efecto.
Controles que reducen el riesgo
No existe un control único. Combina medidas según el proceso:
| Control | Qué puede mejorar | Límite |
|---|---|---|
| Fuentes recuperadas | Vigencia y acceso a evidencia específica | También puede recuperar contenido incorrecto o insuficiente |
| Citas verificables | Trazabilidad de afirmaciones | Una cita puede no respaldar la frase |
| Salida estructurada | Formato y campos obligatorios | No convierte un valor inventado en verdadero |
| Abstención y escalado | Evita forzar respuestas sin evidencia | Debe probarse que el sistema detecta cuándo abstenerse |
| Reglas y herramientas | Validan datos deterministas | Solo cubren condiciones programadas |
| Revisión humana | Interpreta excepciones y consecuencias | Falla con sobrecarga, sesgo de automatización o falta de autoridad |
| Evaluación continua | Detecta regresiones y segmentos débiles | Necesita casos representativos y actualización |
Reducir la temperatura puede disminuir variabilidad en algunos modelos y tareas, pero no vuelve verdadera una respuesta. Una salida reproducible puede repetir el mismo error.
Cómo medirla
Define primero qué cuenta como fallo. Para un asistente documental puede medirse la proporción de afirmaciones respaldadas, la validez de citas, la completitud, la corrección por tipo de pregunta y la abstención ante casos irresolubles.
Construye un conjunto con preguntas que tienen respuesta, preguntas ambiguas y preguntas que no pueden resolverse con las fuentes. Incluye documentos contradictorios, datos ausentes y versiones caducadas. Analiza los errores por consecuencia y segmento; una media agregada puede ocultar el caso que importa.
En producción, registra correcciones, quejas, citas inválidas e incidentes, y vuelve a ejecutar las pruebas cuando cambien modelo, prompt, fuente, herramienta o flujo.
Qué no debe confundirse con una alucinación
No toda respuesta poco útil es una alucinación. Puede existir una instrucción ambigua, un cálculo mal planteado, una recuperación deficiente, un dato desactualizado o una herramienta que devolvió un error. La distinción importa porque cada causa requiere un control diferente.
Tampoco todo contenido ficticio es un fallo. En una tarea creativa, inventar puede ser el objetivo. El error aparece cuando la aplicación necesita fidelidad a hechos, fuentes o restricciones y la salida no la conserva.
La decisión útil
No prometas «cero alucinaciones». Define qué afirmaciones necesitan evidencia, qué tasa y tipo de error son inaceptables, cuándo debe abstenerse el sistema y qué acción queda bloqueada hasta una comprobación.
Para diseñar la intervención humana, utiliza la guía de supervisión humana de la IA.
Fuentes y lecturas recomendadas
- NIST AI 600-1, Generative AI Profile, definición de confabulación y acciones de gestión de riesgo, julio de 2024.
- NIST AI Resource Center, documentos y evaluaciones vigentes de IA generativa, consultado el 20 de agosto de 2026.
- INSTINTIA: cómo construir un agente sobre conocimiento empresarial fiable, controles de fuente, permisos, citas y evaluación.
Definición y vigencia revisadas el 20 de agosto de 2026.