El bloque transformer, ensamblado y apilado
¿Cómo encajan las piezas en la máquina completa?
La idea que hay dentro
atención + FFN + residual/norm = un bloque; apila N bloques (nano-GPT).
Después de esta lección
Puedes describir un bloque transformer completo y cómo, al apilarlo, predice la siguiente palabra.
Adónde lleva
Pero la pila devuelve un vector, no una palabra. ¿Cómo se convierte eso en el siguiente token?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
atención + FFN + residual/norm = un bloque; apila N bloques (nano-GPT).
La pregunta con la que abre
¿Cómo encajan las piezas en la máquina completa?
El recorrido, en palabras de la propia lección
- Toca cualquier pieza para inspeccionar qué hace. Cada una ya la conoces.
- El gato bebe ___ entra. Toca la ranura de salida para predecir qué sale.
- Puedes ver cada pieza, y sabes qué hace cada una.
- Ese es todo el motor detrás de ChatGPT y Claude.
- Un último paso convierte ese vector final en la tabla de arriba: una proyección llamada desincrustación le da a cada palabra del vocabulario una puntuación, y softmax convierte las puntuaciones en probabilidades. “leche” simplemente saca la puntuación más alta aquí, pero elegir de esta tabla es la próxima lección.
- Cuatro piezas que ya conocías, en un bloque, apilado de 12 a más de 100 veces. Esa pila es todo el motor, y cada número dentro de ella lo aprendió el entrenamiento (Acto 2), nadie lo escribió a mano.
- Cuando ChatGPT o Claude te responde, ¿qué está haciendo en realidad el modelo por dentro, lo mismo cada vez?
- Pasa tus palabras por este transformer block, apilado decenas de veces, y la pila devuelve un score por cada palabra del vocabulario. Todo lo que sabe hacer, código, poemas, respuestas, sale de este mismo bloque repetido prediciendo la siguiente palabra.
La idea clave
Puedo ver la máquina completa, y conozco cada pieza.
Qué puedes hacer después de esta lección
Puedes describir un bloque transformer completo y cómo, al apilarlo, predice la siguiente palabra.
Ponte a prueba: ¿Qué es un 'bloque' de transformer, y cómo construyes un modelo grande con él?
- Atención más una pequeña red por palabra más residual/norm, apilado muchas veces(correcta)
- Una única tabla de búsqueda gigante
- Un bloque por ejemplo de entrenamiento
- Un bloque de memoria para guardar respuestas
Un bloque es atención más una pequeña red por palabra más trucos estabilizadores (residuals, layer norm). Apila el mismo bloque muchas veces y obtienes el motor detrás de ChatGPT y Claude.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Transformers
Adónde lleva: Pero la pila devuelve un vector, no una palabra. ¿Cómo se convierte eso en el siguiente token?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.