Widget interactivo · gratis · insertable
La tríada letal: rompe la cadena que filtra tus datos
Un agente servicial, tres capacidades, un ataque en marcha. Toca cualquier pata para apagarla y mira cómo se detiene la filtración.
página no confiable → lee tus datos → los envía afuera
✕ secretos exfiltrados a un desconocido
Exfiltrado = enviado en silencio a alguien que no debería tenerlo.
La página ocultó una instrucción, el agent obedeció y tus datos ya van de salida. Toca una pata para romper la cadena.
Qué vas a hacer
- 1Conoce al agente: puede leer tus datos privados, lee contenido no confiable y puede enviar mensajes hacia afuera. Cada capacidad es útil por sí sola.
- 2Enciende las tres. Una página web esconde una instrucción, el agente obedece y tus datos van camino a un desconocido.
- 3Toca cualquier pata para romper la cadena. El peligro necesita las tres a la vez.
Qué muestra
La tríada letal es la combinación que convierte a un agente de IA servicial en una fuga de datos: acceso a datos privados, exposición a contenido no confiable y una vía para enviar información hacia afuera. El término es de Simon Willison, y nombra algo que puedes ver ocurrir en el escenario en unos diez segundos. El agente lee una página, la página contiene una instrucción escondida, el agente la sigue y tus secretos se exfiltran, que solo significa que se envían en silencio a alguien que no debería tenerlos.
El widget hace físicas las tres patas. Cada una es un interruptor. Con las tres encendidas, el ataque corre. Toca una sola pata y el ataque falla: sin datos privados no hay nada que robar, sin entrada no confiable no hay instrucción escondida que obedecer, sin salida no hay adónde mandar los datos. No tienes que quitar las tres. Tienes que quitar una.
La razón por la que el ataque funciona no es un bug que puedas parchar. Un modelo de lenguaje no puede distinguir de forma confiable tus instrucciones de las instrucciones escondidas dentro del texto que le pidieron leer. Todo es un mismo flujo de tokens. Un mejor entrenamiento vuelve al modelo más desconfiado, y una inyección bien planteada igual pasa, así que la defensa duradera está fuera del modelo, en lo que el agente tiene permitido hacer.
Por qué importa
Cada producto con agentes que usas es uno de estos diagramas. Un asistente de correo que lee mensajes entrantes y puede responder tiene las tres patas. Un agente de navegación con tus sesiones iniciadas tiene las tres patas. Las preguntas prácticas son las que hace el escenario: ¿qué pata puedes cortar? Mantén a un humano aprobando las acciones salientes, no dejes que el mismo agente lea contenido no confiable y además envíe, o limita qué datos puede tocar. Quitar una pata reduce el riesgo. No lo elimina, porque la inyección en sí sigue sin resolverse.
La idea clave
Datos privados, entrada no confiable, una salida. Cualquier capacidad sola está bien. Las tres a la vez dejan que un atacante lea tus secretos y los envíe afuera.
Nota honesta: El escenario es un esquema de un ataque. Las inyecciones reales son más sutiles, se esconden en imágenes y documentos además de páginas web, y son uno de los principales riesgos de la lista OWASP para aplicaciones con LLM.
Este widget es una etapa de una lección completa, con la historia alrededor.
Gratis, sin código, sin registro.
Inserta este widget
Pega esto en cualquier página HTML, plataforma de cursos, wiki o herramienta de diapositivas que acepte un iframe. Funciona sin cuenta, no pone cookies propias y enlaza de vuelta aquí.
La atribución ya viene incluida. Si escribes sobre él, un enlace a esta página es todo lo que pedimos.
Preguntas frecuentes
- ¿Qué es exactamente la tríada letal?
- Un agente de IA que tiene las tres cosas: acceso a datos privados, exposición a contenido no confiable como páginas web o correo entrante, y una vía para enviar datos hacia afuera. Con las tres, una instrucción escondida en el contenido no confiable puede hacer que el agente filtre los datos privados. Quita cualquiera y esa vía de exfiltración se cierra.
- ¿Por qué el modelo no puede simplemente ignorar las instrucciones que encuentra en páginas web?
- Porque no hay un límite estructural entre tus instrucciones y el texto que trajo. El entrenamiento vuelve a los modelos más desconfiados, y una inyección bien planteada igual pasa. Por eso la defensa tiene que tratar de capacidades y permisos, no de esperar que el modelo se dé cuenta.
- ¿Puedo insertar esta demo de seguridad en una charla o en un material de capacitación?
- Sí. El fragmento iframe de esta página funciona en cualquier página HTML o herramienta de diapositivas que permita iframes. Funciona sin cuenta y enlaza de vuelta a la lección completa y al explicador sobre prompt injection.
Explicadores relacionados
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.