Por qué no puede mirar hacia adelante
El modelo podría espiar palabras futuras durante el entrenamiento.
La idea que hay dentro
Enmascara el triángulo superior a −∞ antes del softmax.
Después de esta lección
Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.
Adónde lleva
Una cabeza ve un tipo de relación: ¿y las demás?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Enmascara el triángulo superior a −∞ antes del softmax.
La pregunta con la que abre
El modelo podría espiar palabras futuras durante el entrenamiento.
El recorrido, en palabras de la propia lección
- Cuando el modelo escribe, predice una palabra a la vez: así que mientras decide qué viene después de “bebe”, la palabra que vendrá a continuación (“leche”) todavía no se ha escrito. ¿Qué palabras hay que impedir que lea “bebe”?
- Activa y desactiva la máscara. Mira cómo se apagan las celdas del futuro (arriba a la derecha).
- Sin espiar: una palabra solo se ve a sí misma y a lo que vino antes.
- Antes de activarla: “bebe” ahora apoya parte de su atención en “leche”. Oculta “leche”: ¿adónde va esa atención?
- Correcto: softmax siempre reparte de nuevo las porciones para que sumen 100%. Con “leche” en −inf, las que sobreviven se reparten de nuevo el 100% completo, igual que la mezcla de 3.3.
- No del todo. Softmax siempre suma 100% (la mezcla de 3.3). Ocultar “leche” no deja un hueco: su parte se reparte entre las palabras que “bebe” todavía puede ver. Activa el control de abajo y mira las barras.
- La máscara causal está activada. Toca para permitir espiar el futuro.
- Se permite espiar. Toca para activar la máscara causal.
- Cada palabra atiende solo a sí misma y a las palabras anteriores: así que la única forma de acertar la siguiente palabra es predecirla de verdad.
- La solución es brutalmente simple: antes del softmax, pon en menos infinito cada puntuación del “futuro”, para que su peso se vuelva cero.
- Con el futuro oculto, esta es la misma tarea que hace el modelo durante la inferencia, cuando el futuro todavía no existe.
- ¿Recuerdas la pérdida de la palabra siguiente que moviste en 2.3? La máscara es lo que mantiene ese juego honesto: el modelo tiene que adivinar “leche” sin que se le permita espiarla.
- Ves a un chatbot transmitir su respuesta palabra por palabra, de izquierda a derecha, sin volver atrás a corregir. ¿Por qué no escribe la frase entera de golpe y la ordena después?
- El causal mask: cada posición solo se ve a sí misma y a las palabras anteriores, así que el modelo se entrena para predecir la siguiente palabra solo a partir del pasado. Esa generación de izquierda a derecha, un token a la vez, que ves es la máscara haciendo su trabajo.
La idea clave
Nada de espiar el futuro.
Qué puedes hacer después de esta lección
Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.
Ponte a prueba: ¿Qué logra el enmascaramiento causal?
- Una palabra solo puede verse a sí misma y a las palabras anteriores(correcta)
- Acelera el entrenamiento
- Elimina los tokens duplicados
- Añade posiciones
El enmascarado oculta las palabras futuras durante el entrenamiento, así el modelo aprende a predecir solo desde la izquierda, igual que genera una palabra a la vez.
Adónde lleva: Una cabeza ve un tipo de relación: ¿y las demás?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.