Mantener viva la señal
Las pilas profundas olvidan la señal original o se disparan.
La idea que hay dentro
Residual = guardar una copia y sumar el cambio; LayerNorm = reescalar para mantener la cordura.
Después de esta lección
Puedes explicar las conexiones residuales y LayerNorm: los trucos que hacen entrenables las redes profundas.
Adónde lleva
Ensambla las piezas en un bloque y luego apílalos.
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Residual = guardar una copia y sumar el cambio; LayerNorm = reescalar para mantener la cordura.
La pregunta con la que abre
Las pilas profundas olvidan la señal original o se disparan.
El recorrido, en palabras de la propia lección
- Toca la parte de arriba del carril: ¿qué llega a la salida después de que cada capa lo reescribe?
- Atajo desactivado: la señal tiene que pasar por cada capa. Mira cómo se desvanece.
- Activa el atajo. Ahora cada capa suma sobre una copia del original.
- Sumar hace crecer la señal. LayerNorm la devuelve a un tamaño razonable.
- Cada capa suma a la señal, y luego LayerNorm la mantiene en forma.
- Correcto. Ese es el desvanecimiento que estás viendo: cada transformación entierra más el original, hasta que arriba ya nadie sabe qué entró. Ahora: la solución.
- No exactamente. Sin nada que lo proteja, el original se difumina en ruido: cada transformación lo entierra más, hasta que arriba ya nadie sabe qué entró. Ahora: la solución.
- LayerNorm actúa sobre la copia que lee cada bloque, no sobre el flujo residual después de la suma. Así el flujo en sí queda intacto y solo sigue acumulando, mientras cada bloque ve entradas de un tamaño similar.
- El camino de salto es un atajo que deja que la señal se salte el trabajo de una capa.
- No se salta nada. La capa igual se ejecuta; su cambio se suma encima de una copia intacta de la señal, así que el original nunca se pierde.
- Hace años, las redes dejaban de mejorar pasada cierta profundidad: la precisión empeoraba cuantas más capas añadías. Los modelos de hoy apilan más de 100 capas y siguen mejorando. ¿Qué cambió?
- Los atajos residuales más LayerNorm: cada capa suma sobre una copia intacta de la señal en lugar de sobrescribirla, y LayerNorm mantiene el tamaño razonable. Ese es el truco que hizo entrenables las pilas muy profundas, y está en cada bloque transformer que usas.
- Un carril vertical de señal con tres muestras tocables de resultado arriba: predice qué llega a la salida después de que cada capa reescribe la señal.
- Un carril vertical de señal con el atajo activado y LayerNorm activado: el flujo se mantiene limpio mientras cada bloque lee una copia reescalada de tamaño razonable.
- Un carril vertical de señal con el atajo activado pero LayerNorm desactivado: la copia que lee cada bloque se dispara demasiado.
- Un carril vertical de señal con el atajo desactivado: la señal se desvanece hasta volverse papilla cerca de arriba.
La idea clave
Los atajos mantienen entrenables las redes profundas.
Qué puedes hacer después de esta lección
Puedes explicar las conexiones residuales y LayerNorm: los trucos que hacen entrenables las redes profundas.
Ponte a prueba: ¿Por qué los transformers suman la entrada de un bloque a su salida (un residual)?
- Para que la señal original sobreviva a través de una pila profunda de capas(correcta)
- Para hacer el modelo más pequeño
- Para traducir entre idiomas
- Para elegir la siguiente palabra directamente
Las conexiones residuales suman la entrada de cada bloque a su salida, así que la señal original sobrevive por una pila profunda y el entrenamiento se mantiene estable. Sin ellas, los modelos profundos son difíciles de entrenar.
Adónde lleva: Ensambla las piezas en un bloque y luego apílalos.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.