Saltar al contenido
todas las lecciones
Arquitectura3.4Bloqueada

Por qué no puede mirar hacia adelante

El modelo podría espiar palabras futuras durante el entrenamiento.

La idea que hay dentro

Enmascara el triángulo superior a −∞ antes del softmax.

Después de esta lección

Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.

Adónde lleva

Una cabeza ve un tipo de relación: ¿y las demás?

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Enmascara el triángulo superior a −∞ antes del softmax.

La pregunta con la que abre

El modelo podría espiar palabras futuras durante el entrenamiento.

El recorrido, en palabras de la propia lección

  • Cuando el modelo escribe, predice una palabra a la vez: así que mientras decide qué viene después de “bebe”, la palabra que vendrá a continuación (“leche”) todavía no se ha escrito. ¿Qué palabras hay que impedir que lea “bebe”?
  • Activa y desactiva la máscara. Mira cómo se apagan las celdas del futuro (arriba a la derecha).
  • Sin espiar: una palabra solo se ve a sí misma y a lo que vino antes.
  • Antes de activarla: “bebe” ahora apoya parte de su atención en “leche”. Oculta “leche”: ¿adónde va esa atención?
  • Correcto: softmax siempre reparte de nuevo las porciones para que sumen 100%. Con “leche” en −inf, las que sobreviven se reparten de nuevo el 100% completo, igual que la mezcla de 3.3.
  • No del todo. Softmax siempre suma 100% (la mezcla de 3.3). Ocultar “leche” no deja un hueco: su parte se reparte entre las palabras que “bebe” todavía puede ver. Activa el control de abajo y mira las barras.
  • La máscara causal está activada. Toca para permitir espiar el futuro.
  • Se permite espiar. Toca para activar la máscara causal.
  • Cada palabra atiende solo a sí misma y a las palabras anteriores: así que la única forma de acertar la siguiente palabra es predecirla de verdad.
  • La solución es brutalmente simple: antes del softmax, pon en menos infinito cada puntuación del “futuro”, para que su peso se vuelva cero.
  • Con el futuro oculto, esta es la misma tarea que hace el modelo durante la inferencia, cuando el futuro todavía no existe.
  • ¿Recuerdas la pérdida de la palabra siguiente que moviste en 2.3? La máscara es lo que mantiene ese juego honesto: el modelo tiene que adivinar “leche” sin que se le permita espiarla.
  • Ves a un chatbot transmitir su respuesta palabra por palabra, de izquierda a derecha, sin volver atrás a corregir. ¿Por qué no escribe la frase entera de golpe y la ordena después?
  • El causal mask: cada posición solo se ve a sí misma y a las palabras anteriores, así que el modelo se entrena para predecir la siguiente palabra solo a partir del pasado. Esa generación de izquierda a derecha, un token a la vez, que ves es la máscara haciendo su trabajo.

La idea clave

Nada de espiar el futuro.

Qué puedes hacer después de esta lección

Puedes explicar el enmascaramiento causal: una palabra solo se ve a sí misma y a las palabras anteriores.

Ponte a prueba: ¿Qué logra el enmascaramiento causal?
  • Una palabra solo puede verse a sí misma y a las palabras anteriores(correcta)
  • Acelera el entrenamiento
  • Elimina los tokens duplicados
  • Añade posiciones

El enmascarado oculta las palabras futuras durante el entrenamiento, así el modelo aprende a predecir solo desde la izquierda, igual que genera una palabra a la vez.

Adónde lleva: Una cabeza ve un tipo de relación: ¿y las demás?

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.