Saltar al contenido

Explicador en lenguaje claro

El transformer, explicado

¿Qué es un transformer y cómo funciona de verdad la arquitectura?

Un transformer es una pila de bloques idénticos, y cada uno hace dos cosas. Primero, attention: cada token mira a los tokens anteriores y trae lo que necesita, así el significado fluye entre palabras. Segundo, una red feed-forward transforma cada token por su cuenta, y ahí vive la mayor parte del conocimiento aprendido. Una representación de cada token atraviesa la pila, refinada un poco por bloque, hasta que arriba está lo bastante afilada para puntuar cada posible siguiente token.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Cómo la atención mezcla el significado

Gratis, sin código, sin registro.

Y después ve más a fondo: El bloque transformer, ensamblado y apilado Bloqueada

Lo que la gente entiende mal

  • Un transformer es una gran red enredada. Es el mismo bloque pequeño de dos partes, repetido decenas de veces en una pila.
  • Attention es toda la historia. Attention enruta la información, pero la mayoría de los parámetros están en las capas feed-forward que la transforman.
  • La comprensión pasa en una sola lectura. Cada bloque vuelve a mezclar los tokens, así que la representación se afila capa a capa.

Dónde lo ves en productos reales

  • La T de GPT significa transformer.
  • Casi todos los modelos modernos de IA, chat, código, imagen y audio incluidos, se construyen sobre esta arquitectura.
  • Las fichas de los modelos listan capas y tamaños: esos números describen exactamente esta pila.

Preguntas frecuentes

¿De qué partes está hecho un bloque transformer?
De dos. Una capa de attention que deja a los tokens intercambiar información, y una red feed-forward que procesa cada token por separado. Las dos van envueltas en normalización y conexiones residuales que llevan la señal original hacia adelante. Apila ese bloque decenas de veces y tienes el modelo.
¿Qué hacen las capas feed-forward?
Guardan la mayoría de los parámetros, y la mayor parte del conocimiento almacenado. La attention decide qué contexto importa; la red feed-forward es donde el modelo recuerda lo que sabe sobre el resultado. Los trabajos de interpretabilidad siguen encontrando hechos y rasgos concretos viviendo ahí.
¿El transformer se usa solo para lenguaje?
No. Imágenes cortadas en parches, audio cortado en tramos y secuencias de proteínas alimentan la misma arquitectura. Esa generalidad es la razón de que un solo esfuerzo de ingeniería rindiera en muchos campos a la vez, y de que el mismo hardware sirva para todos.

Explicadores relacionados

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.