Explicador en lenguaje claro
La codificación posicional, explicada
¿Cómo sabe un transformer el orden de las palabras, si attention mira todo a la vez?
Attention por sí sola trata una frase como una bolsa de palabras: 'perro muerde hombre' y 'hombre muerde perro' se verían idénticas. Por eso los modelos mezclan una señal de posición en el vector de cada token antes de que corra attention. Cada posición recibe su propio sello matemático, y el sello pasa a ser parte del significado, así que 'primera palabra' y 'séptima palabra' son distintas incluso para la misma palabra. Muchos modelos modernos usan una variante rotatoria, RoPE, que codifica la distancia relativa entre palabras.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Cómo la atención mezcla el significado →Gratis, sin código, sin registro.
Y después ve más a fondo: Cómo el modelo sabe el orden de las palabras Bloqueada
Lo que la gente entiende mal
- Los modelos leen de izquierda a derecha como las personas. Attention ve todos los tokens a la vez. El orden existe solo porque se selló dentro.
- El orden está guardado en las propias palabras. La misma palabra en dos posiciones recibe dos vectores distintos, y solo el sello cambia.
- La posición es un detalle menor de implementación. Estirar los modelos a contextos más largos es difícil en gran parte porque el esquema de posición debe estirarse con ellos.
Dónde lo ves en productos reales
- Los traductores mantienen claro quién hizo qué a quién porque la posición es parte del significado.
- Los asistentes de código siguen el anidado y el orden de los paréntesis con la misma señal.
- Los lanzamientos de modelos de context largo suelen nombrar sus trucos de posición, RoPE scaling entre ellos, en la letra pequeña.
Preguntas frecuentes
- ¿Por qué un transformer necesita información de posición?
- La attention es ciega al orden: ve una bolsa de tokens, no una secuencia. Sin una señal de posición, el perro mordió al hombre y el hombre mordió al perro son la misma entrada. La posición se añade para que el modelo pueda distinguirlas.
- ¿Cómo codifican la posición los modelos actuales?
- Casi todos los modelos grandes usan hoy rotary embeddings, conocidos como RoPE, que rotan los vectores query y key un ángulo que depende de la posición. La distancia relativa sale sola de las matemáticas, y el esquema se estira a entradas más largas mejor que las tablas de senos fijas originales.
- ¿Por eso empeoran más allá de su largo entrenado?
- En buena parte, sí. Más allá de las posiciones vistas en el entrenamiento, la codificación entra en territorio que el modelo nunca aprendió a leer. Casi todas las técnicas para ampliar contexto funcionan reescalando o reentrenando esas señales de posición, no cambiando la attention.
Explicadores relacionados
Más en Dentro del transformer
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.