Explicador en lenguaje claro
Por qué la IA alucina
¿Por qué los modelos de IA inventan cosas con total seguridad?
Porque están construidos para continuar texto de forma plausible, no para reportar hechos. Un modelo de lenguaje siempre produce las siguientes palabras más probables. Cuando la verdad está en sus datos de entrenamiento, lo probable y lo cierto suelen coincidir. Cuando no, el modelo rellena el hueco con algo que suena bien, en prosa perfecta, porque nada en su interior distingue un hecho recordado de un patrón plausible. La alucinación no es un fallo encima del sistema. Es el sistema, corriendo sin anclaje.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Predice la siguiente palabra →Gratis, sin código, sin registro.
Y después ve más a fondo: Alucinación Bloqueada
¿Qué cuenta como una alucinación de la IA?
Una alucinación es una salida presentada como hecho que es falsa o no está respaldada. La palabra cubre dos fallos distintos, y separarlos importa. El primero es la fabricación: el modelo afirma algo sobre el mundo que simplemente no es cierto, una fecha equivocada, una estadística inventada, un libro que no existe. El segundo es un fallo de fidelidad: le diste un documento o un resultado de búsqueda, y su resumen dice algo que la fuente no dice. El primero es un hueco en lo que el modelo absorbió del entrenamiento. El segundo es una mala lectura de un texto que tiene enfrente.
La subespecie más reconocible es la cita inventada: un caso judicial, un paper o una URL con formato perfecto y existencia nula. Las citas se fabrican con tanta facilidad porque su forma es extremadamente predecible, autor, año, título plausible, mientras que la referencia verdadera concreta no lo es. El modelo siempre puede producir la forma. No siempre puede producir el hecho.
Vale la pena nombrar una forma más: el error servil. Contradice una respuesta correcta y el modelo puede ceder y darte la razón en tu versión equivocada, porque las continuaciones complacientes fueron premiadas durante el entrenamiento. El error parece cortesía, pero es el mismo problema de fondo: el texto que puntúa como más probable no siempre es el texto verdadero.
¿Por qué pasa? La mecánica
Un modelo de lenguaje responde prediciendo el siguiente token, uno tras otro, dado todo lo anterior. No hay consulta a una base de datos, ni lista de hechos verificados, ni un paso donde la frase se compare con la realidad. Los hechos que el modelo vio muchas veces en el entrenamiento quedan codificados con fuerza y salen de forma fiable. Los que vio una vez, o nunca, viven en la misma maquinaria estadística que todo lo demás, y cuando el prompt exige una respuesta, la maquinaria produce la continuación más plausible que puede. Lo plausible y lo verdadero coinciden la mayoría de las veces. La alucinación vive en el hueco.
Los incentivos del entrenamiento lo empeoran. Un paper de investigación de OpenAI de 2025 argumentó que los modelos alucinan en parte por cómo se los entrena y evalúa: la mayoría de los benchmarks califica las respuestas como correctas o incorrectas, sin crédito por decir 'no lo sé'. Con esa puntuación, un modelo que adivina le gana a uno que se abstiene, igual que un estudiante que nunca deja una pregunta en blanco supera a uno que sí. Los modelos quedan, en la práctica, optimizados para ser examinados seguros de sí mismos.
Por eso las alucinaciones salen fluidas. Toda la habilidad del modelo es producir texto probable, y la prosa firme y bien estructurada es la forma probable de una respuesta. La seguridad del texto es una propiedad de la escritura, no evidencia sobre el mundo. La lección interactiva de este sitio te deja ver a un modelo seguir generando con total suavidad más allá del borde de lo que sabe, que es el fenómeno entero en una imagen.
Casos reales: cuando la alucinación tocó el mundo
En 2023, dos abogados de Nueva York presentaron un escrito legal redactado con ayuda de ChatGPT. Citaba seis casos judiciales que no existían, con citas y números de expediente convincentes. La contraparte no podía encontrar los casos porque no había nada que encontrar, y un juez federal multó a los abogados. Desde entonces, tribunales de varios países han sancionado o amonestado a abogados por citas fabricadas por IA, al punto de que muchos ya exigen declarar si hubo asistencia de IA.
En 2024, un tribunal canadiense ordenó a Air Canada honrar un descuento por duelo que el chatbot de su web había inventado. La aerolínea argumentó que el bot era responsable de sus propias palabras. El tribunal no estuvo de acuerdo: la empresa publicó la respuesta, la empresa es dueña de la respuesta. El caso se volvió la advertencia estándar para cualquiera que despliegue un bot de atención sin anclarlo en documentos de política reales.
El patrón de ambas historias es el mismo y es la lección práctica: el texto fue lo bastante fluido para pasar el vistazo de un profesional. Las alucinaciones rara vez parecen errores. Se ven como todo lo demás que escribe el modelo, y por eso la defensa tiene que ser proceso, verificar fuentes, anclar respuestas, y no intuición.
¿Cada cuánto alucinan los modelos?
No hay una tasa única, porque la tasa depende de la tarea. Si le pides resumir un documento que está en el prompt, los modelos de frontera actuales se equivocan poco: los rankings públicos de fidelidad han puesto las tasas de alucinación en resúmenes de los mejores modelos en pocos puntos porcentuales. Ante preguntas abiertas sobre gente poco conocida, productos de nicho o eventos recientes, el error sube con fuerza, porque la cola larga del mundo es justo lo que los datos de entrenamiento cubren más fino.
La tendencia es real pero parcial. Cada generación de modelos ha reducido la alucinación en los benchmarks medidos, y los modos anclados con búsqueda web y citas la reducen más. Dos advertencias honestas sobreviven al progreso. Primera, las mejoras son disparejas: se ha reportado que algunos modelos enfocados en razonamiento fabrican más que sus predecesores en ciertos tests de memoria factual, aun mejorando en matemáticas y código. Segunda, una tasa más baja en un benchmark no es garantía sobre tu pregunta. El riesgo se concentra exactamente donde menos puedes verificar.
¿Qué reduce de verdad las alucinaciones?
Nada las elimina, pero unas pocas prácticas recortan el riesgo de forma drástica. El hilo común es el anclaje: conecta la respuesta del modelo con texto que existe de verdad, y dale permiso de no saber.
- El retrieval (RAG) ayuda porque cambia la tarea de recordar a leer: el modelo responde desde texto recuperado y puede citarlo. Los fallos pasan a ser de calidad de recuperación, que sí puedes medir y arreglar.
- Bajar la temperature no arregla la alucinación. Hace la salida más repetible, pero la continuación más probable puede estar confiadamente equivocada a cualquier temperature.
- Preguntar lo mismo dos veces y comparar es una verificación barata: las fabricaciones tienden a variar entre corridas, los hechos memorizados tienden a quedarse quietos.
| Situación | Qué ayuda |
|---|---|
| Hechos, fechas, números | Usa un modo anclado (búsqueda web o RAG) y pide fuentes que puedas abrir. Después abre una. |
| Citas y referencias | Nunca confíes en una cita sin enlace. Pide links, verifica que resuelvan y comprueba que la cita aparece en la fuente. |
| Resúmenes de tus documentos | Pega o adjunta el documento para que el modelo lo lea en vez de recordarlo, y contrasta afirmaciones contra el original. |
| Matemáticas y conteos | Haz que el modelo use una herramienta (calculadora, código) en vez de predecir dígitos como texto. |
| Decisiones de alto riesgo (legal, médico, financiero) | Trata al modelo como asistente de borrador, no como autoridad. Un humano verifica antes de que algo salga. |
| Cualquier cosa que el modelo quizá no sepa | Di 'si no estás seguro, dilo' en el prompt. Es imperfecto, pero invita a la abstención de forma medible. |
¿Se puede arreglar del todo la alucinación?
No en el paradigma actual, y el encuadre honesto es gestión, no cura. Un predictor del siguiente token no tiene una línea interna entre patrón y hecho, así que cierta tasa de error seguro de sí mismo es estructural. Lo que sí puede cambiar, y ha ido cambiando, es todo lo de alrededor: entrenamiento que premia la incertidumbre calibrada en vez de la adivinanza, evaluaciones que dejan de castigar el 'no lo sé', productos que anclan las respuestas en fuentes recuperadas por defecto, y uso de herramientas que reemplaza la predicción por la consulta donde la consulta es mejor.
Para ti, la conclusión práctica es un hábito de calibración, no miedo. Trata al modelo como a un colega brillante, rápido y a veces equivocado: buenísimo para borradores, explicaciones, lluvia de ideas y transformar texto que tú le das, y nunca la autoridad final sobre un hecho que no verificaste. Cuando una respuesta importa, la pregunta no es '¿suena bien?' sino '¿en qué está anclada?'
Lo que la gente entiende mal
- La alucinación es un bug que van a parchear. Es inherente a predecir la siguiente palabra. Se puede reducir con anclaje y citas, no eliminar.
- El modelo sabe cuándo está inventando. No hay verificador interno. La fluidez y la seguridad son propiedades del texto, no evidencia de verdad.
- Las respuestas erróneas significan datos de entrenamiento malos. Ni los datos perfectos cubren todo, y el modelo rellena cada hueco por diseño.
- Bajar la temperature detiene las alucinaciones. Solo hace la salida más repetible. Un error seguro a temperature 0 sigue siendo un error seguro.
Dónde lo ves en productos reales
- Hay abogados sancionados por presentar escritos con citas de casos inventadas por un chatbot.
- El bot de una aerolínea inventó una política de reembolso, y un tribunal obligó a la empresa a cumplirla.
- El aviso de 'verifica la información importante' bajo las cajas de chat existe exactamente por esto.
- Los modos anclados en búsqueda con citas clicables son la respuesta de producto: convierten el 'confía en mí' en 'aquí está la fuente'.
Preguntas frecuentes
- ¿Por qué los modelos inventan citas y fuentes?
- Porque una cita de aspecto plausible es exactamente el patrón que el texto pide, y nada en el bucle comprueba que exista. La forma de una referencia es fácil de predecir, la referencia verdadera concreta no, y el modelo no tiene manera de distinguirlas.
- ¿El retrieval (RAG) arregla la alucinación?
- La reduce de forma sustancial y no la elimina. Anclar la respuesta en texto recuperado quita la necesidad de inventar, pero el modelo aún puede leer mal un pasaje o rellenar un hueco cuando la búsqueda vuelve vacía. Las citas que puedes abrir son la defensa práctica.
- ¿Puede el modelo decirme cuándo no está seguro?
- Solo a grandes rasgos. Los modelos se entrenan para expresar incertidumbre con palabras, y esa expresión es a su vez texto predicho, no una confianza medida. Toma sus reservas como señal débil y verifica lo que importe.
- ¿Los modelos de razonamiento alucinan menos?
- No automáticamente. Pensar más ayuda cuando el razonamiento puede cazar una inconsistencia, pero se ha reportado que varios modelos de razonamiento fabrican más en tests simples de memoria factual que sus hermanos sin razonamiento. Pensar más no es saber más. Lo que mueve la fiabilidad factual es el anclaje en fuentes.
- ¿Qué tareas tienen más riesgo de alucinación?
- Las preguntas factuales abiertas sobre la cola larga: gente poco conocida, empresas chicas, investigación de nicho, eventos recientes, números precisos. El riesgo es mínimo cuando el modelo transforma texto que tú le diste, un resumen, una reescritura, una traducción, porque la verdad está en el prompt.
- ¿'Alucinación' es siquiera la palabra correcta?
- A muchos investigadores no les gusta, porque el modelo no percibe nada, y 'confabulación', inventar una historia fluida para llenar un hueco, encaja mejor. El término se quedó por lo vívido. Se llame como se llame, el mecanismo es la predicción normal trabajando más allá del borde de su conocimiento.
- ¿Cómo miden las empresas la alucinación?
- Con evals: conjuntos fijos de preguntas con respuesta conocida, calificados de forma automática o por humanos, más verificaciones de fidelidad que comparan un resumen contra su documento fuente. Hay rankings públicos que hacen esto entre modelos, y los equipos serios corren el mismo tipo de eval sobre el tráfico real de su producto.
Explicadores relacionados
Más en Construir encima, y confiar en ello
- ¿Qué son los evals, y cómo saben los equipos que una función de IA funciona?
- ¿Qué es una base de datos vectorial y por qué todo stack de RAG tiene una?
- ¿Cuáles son los límites reales de los modelos de lenguaje?
- ¿Qué es usar un LLM como juez y funciona?
- ¿Uso RAG o fine-tuning?
- ¿Qué es un data flywheel y por qué dicen que es el foso de la IA?
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.