Explicador en lenguaje claro
El prompt injection, explicado
¿Qué es el prompt injection, y por qué las apps de IA son inseguras de formas nuevas?
El prompt injection ocurre cuando contenido no confiable que el modelo lee trae instrucciones que lo secuestran. Un modelo no puede distinguir con fiabilidad tus instrucciones del texto dentro de una página web, un correo o un documento que le pidieron procesar. Un atacante puede esconder 'ignora tu tarea y haz esto otro' en ese contenido. Es peligroso cuando un agent combina tres cosas: acceso a datos privados, exposición a contenido no confiable y una vía para sacar datos. Esa combinación, la trifecta letal, es la receta de la exfiltración de datos.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: El harness: el bucle, hecho realidad →Gratis, sin código, sin registro.
Y después ve más a fondo: La tríada letal Bloqueada
Lo que la gente entiende mal
- Más entrenamiento lo arregla. Los modelos siguen sin separar bien instrucciones de datos; se diseña alrededor del problema.
- Solo importa en los chatbots. Es peor en los agents que pueden leer contenido no confiable y actuar.
- Filtrar la entrada lo resuelve. Ayuda, pero el arreglo duradero es limitar el acceso, las acciones y las salidas.
Dónde lo ves en productos reales
- Un agent que lee correo y puede enviarlo es un objetivo clásico de injection.
- Las herramientas de navegación y de documentos deben tratar el contenido traído como no confiable.
- Los diseños seguros acotan credenciales, ponen aprobación a las acciones arriesgadas y registran todo.
Preguntas frecuentes
- ¿Qué es el prompt injection en una frase?
- Instrucciones escondidas en el contenido que el modelo lee, una página web, un correo, un documento, que el modelo después obedece como si las hubieras escrito tú.
- ¿Por qué el modelo no ignora sin más las instrucciones que vienen en los datos?
- Porque no hay ninguna frontera estructural entre tus instrucciones y el texto que trajo. Todo es un mismo flujo de tokens. El entrenamiento vuelve a los modelos más desconfiados, y una inyección bien formulada igual pasa, así que la defensa real tiene que estar fuera del modelo.
- ¿Cómo se defiende uno de verdad?
- Limitando lo que puede lograr una inyección exitosa: herramientas con el mínimo privilegio, ningún acceso silencioso a secretos, aprobación humana antes de acciones irreversibles o que salgan hacia afuera, y tratar como no confiable todo lo que se trae de fuera. Filtrar solo el texto es una batalla perdida.
Explicadores relacionados
Más en Agents y herramientas
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.