Saltar al contenido
← todas las lecciones
Arquitectura3.4Bloqueada

Por qué no puede mirar hacia adelante

El modelo podría espiar palabras futuras durante el entrenamiento.

La idea que hay dentro

Enmascara el triángulo superior a −∞ antes del softmax.

Después de esta lección

Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.

Adónde lleva

Una cabeza ve un tipo de relación: ¿y las demás?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Enmascara el triángulo superior a −∞ antes del softmax.

La pregunta con la que abre

El modelo podría espiar palabras futuras durante el entrenamiento.

El recorrido, en palabras de la propia lección

  • Cuando el modelo escribe, predice una palabra a la vez: así que mientras decide qué viene después de “bebe”, la palabra que vendrá a continuación (“leche”) todavía no se ha escrito. ¿Qué palabras hay que impedir que lea “bebe”?
  • Activa y desactiva la máscara. Mira cómo se apagan las celdas del futuro (arriba a la derecha).
  • Sin espiar: una palabra solo se ve a sí misma y a lo que vino antes.
  • Antes de activarla: “bebe” ahora apoya parte de su atención en “leche”. Oculta “leche”: ¿adónde va esa atención?
  • Correcto: softmax siempre reparte de nuevo las porciones para que sumen 100%. Con “leche” en −inf, las que sobreviven se reparten de nuevo el 100% completo, igual que la mezcla de 3.3.
  • No del todo. Softmax siempre suma 100% (la mezcla de 3.3). Ocultar “leche” no deja un hueco: su parte se reparte entre las palabras que “bebe” todavía puede ver. Activa el control de abajo y mira las barras.
  • La máscara causal está activada. Toca para permitir espiar el futuro.
  • Se permite espiar. Toca para activar la máscara causal.
  • Cada palabra atiende solo a sí misma y a las palabras anteriores: así que la única forma de acertar la siguiente palabra es predecirla de verdad.
  • La solución es brutalmente simple: antes del softmax, pon en menos infinito cada puntuación del “futuro”, para que su peso se vuelva cero.
  • Con el futuro oculto, esta es la misma tarea que hace el modelo durante la inferencia, cuando el futuro todavía no existe.
  • ¿Recuerdas la pérdida de la palabra siguiente que moviste en 2.3? La máscara es lo que mantiene ese juego honesto: el modelo tiene que adivinar “leche” sin que se le permita espiarla.
  • Ves a un chatbot transmitir su respuesta palabra por palabra, de izquierda a derecha, sin volver atrás a corregir. ¿Por qué no escribe la frase entera de golpe y la ordena después?
  • El causal mask: cada posición solo se ve a sí misma y a las palabras anteriores, así que el modelo se entrena para predecir la siguiente palabra solo a partir del pasado. Esa generación de izquierda a derecha, un token a la vez, que ves es la máscara haciendo su trabajo.

La idea clave

Nada de espiar el futuro.

Qué puedes hacer después de esta lección

Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.

Ponte a prueba: ¿Qué logra el enmascaramiento causal?
  • Una palabra solo puede verse a sí misma y a las palabras anteriores(correcta)
  • Acelera el entrenamiento
  • Elimina los tokens duplicados
  • Añade posiciones

El enmascarado oculta las palabras futuras durante el entrenamiento, así el modelo aprende a predecir solo desde la izquierda, igual que genera una palabra a la vez.

Adónde lleva: Una cabeza ve un tipo de relación: ¿y las demás?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.