Alucinación
¿Por qué un modelo seguro de sí mismo se inventa cosas?
La idea que hay dentro
Optimiza la plausibilidad, no la verdad; conéctalo con RAG como mitigación.
Después de esta lección
Puedes explicar por qué los modelos alucinan: eligen palabras plausibles, no verdaderas.
Adónde lleva
¿Y cómo lo frenas? Ancla el modelo a fuentes reales antes de que responda.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Optimiza la plausibilidad, no la verdad; conéctalo con RAG como mitigación.
La pregunta con la que abre
¿Por qué un modelo seguro de sí mismo se inventa cosas?
El recorrido, en palabras de la propia lección
- Cambia el interruptor a un dato que no puede saber. Observa cómo se aplanan las probabilidades.
- Empieza con un dato que sí conoce. Observa las probabilidades.
- Ahora cambia a un dato que no puede saber. La misma máquina, otras probabilidades.
- ¿Qué pregunta hace que el modelo se invente algo?
- Eldermoor es inventada: nunca estuvo en los datos.
- ¿Ves lo plana que está? Nunca hubo una respuesta en los datos, así que ninguna palabra gana, y aun así el modelo elige una y la afirma como un hecho.
- Un ganador claro: este dato estaba por todas partes en el entrenamiento. Ahora cambia a la aldea inventada para ver cómo se aplanan las probabilidades.
- Un modelo no tiene un control de confianza: siempre suena fluido, incluso sin nada en lo que apoyarse.
- En cada paso solo devuelve probabilidades para la siguiente palabra (la distribución de 4.1) y elige una; puede decir las palabras «No estoy seguro», pero esa frase es solo otra conjetura, no una lectura de cuán seguro está en realidad.
- Su mejor apuesta es solo del 21 %, apenas por delante del resto, y aun así la afirma como un hecho, porque no tiene forma de decir «solo estoy 21 % seguro».
- La investigación actual encuadra la alucinación como un problema de incentivos ('Why language models hallucinate' de OpenAI, 2025). La mayoría de los benchmarks de IA se califican como aprobado/reprobado: una conjetura segura a veces suma un punto, «No lo sé» nunca suma. Entrena y elige modelos con esos marcadores y crías modelos buenos para exámenes, modelos que aprendieron que adivinar le gana a abstenerse. La solución propuesta es cambiar la calificación para que un «No lo sé» calibrado sí dé puntos.
- El caso sano: una palabra gana de calle y las demás apenas cuentan. Ahora pregúntale algo que no pueda saber y mira cómo se desploma ese pico.
- Un dato ausente es el caso más claro: no se sabe nada, así que cada palabra plausible está mal; pero la misma máquina también puede tergiversar o atribuir mal datos que sí estaban en su entrenamiento. Soluciones: darle fuentes reales (RAG, de 5.2), darle herramientas o entrenarlo para que diga «No lo sé».
- Dos causas más del día a día: una pregunta ambigua invita a una conjetura segura sobre lo que quisiste decir, y en un montaje RAG un retrieval débil puede pasarle al modelo el fragmento equivocado, así que responde con fluidez desde la fuente equivocada (cómo falla el retrieval es justo el tema de la lección E.15).
- A menudo, sí. La mayoría de los datos de entrenamiento están en inglés, así que hay menos terreno para otros idiomas, y los nombres chocan entre regiones: la 'tortilla' es de patata en España pero es de maíz en México, y un 'Dr. García' podría ser cualquiera de miles. Menos datos más ambigüedad significa más adivinación confiada, así que apóyalo con fuentes y desconfía aún más de nombres, fechas y lugares específicos en español.
- Cuando un modelo se inventa algo, sus datos de entrenamiento debían estar mal o desactualizados.
- Optimiza por tokens que suenan plausibles, no por la verdad, así que puede inventar con seguridad incluso con datos perfectos. La solución es anclarlo con retrieval y verificar las afirmaciones concretas, no «corregir sus datos».
- Un modelo cita con total seguridad un caso judicial, con número de expediente, que resulta no existir. ¿Por qué ocurre una respuesta tan fluida, y qué deberías hacer al respecto?
- El modelo no tiene un control de confianza: devuelve las siguientes palabras más plausibles y las afirma como hechos, incluso cuando no había una respuesta real en su entrenamiento. Así que trata cualquier afirmación concreta, nombres, números, citas, como no verificada hasta que la contrastes con una fuente real.
La idea clave
Entiende el modo de fallo de forma mecánica.
Qué puedes hacer después de esta lección
Puedes explicar por qué los modelos alucinan: eligen palabras plausibles, no verdaderas.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Alucinaciones
Adónde lleva: ¿Y cómo lo frenas? Ancla el modelo a fuentes reales antes de que responda.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.