Cómo el modelo sabe el orden de las palabras
La atención es ciega al orden: 'gato bebe leche' = 'leche bebe gato'.
La idea que hay dentro
Inyecta la posición (intuición sinusoidal / RoPE).
Después de esta lección
Puedes explicar por qué los modelos añaden información posicional para que el orden de las palabras importe.
Adónde lleva
¿Más grande siempre significa mejor?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Inyecta la posición (intuición sinusoidal / RoPE).
La pregunta con la que abre
La atención es ciega al orden: 'gato bebe leche' = 'leche bebe gato'.
El recorrido, en palabras de la propia lección
- Añade la información de posición y mira cómo se fija el significado.
- Adivina: ¿cómo podría el modelo distinguir el orden?
- Orden fijado: ahora cada palabra lleva su lugar, así que las puntuaciones Query·Key de la atención (de 3.3) difieren según la posición, esto solo puede significar
- Como cada perilla gira suavemente, dos lugares cercanos la dejan casi en el mismo punto, así que las posiciones próximas reciben marcas casi idénticas, y en promedio la diferencia crece con la distancia (puede oscilar un poco en lugares lejanos).
- Mismos glifos, nuevos lugares, y ahora cada uno lleva la marca de su lugar, así que el orden de verdad se lee distinto.
- Mismos glifos, nuevos lugares, pero sin marcas, la atención ve la misma sopa ciega al orden. Ahora añade la información de posición.
- Intercambia los dos sustantivos: las mismas fichas cambiarán de lugar. Pruébalo con las marcas desactivadas, luego activadas.
- Las palabras están todas mezcladas, sin orden. ¿Cuál es el arreglo más simple para que el modelo distinga “el gato bebe leche” de “leche bebe gato”?
- Exacto, dale a cada lugar su propia etiqueta, súmala a la palabra, y ahora “gato en primero” y “gato en tercero” son distintos. Barato, y funciona para cualquier frase.
- No del todo, no hay un orden “correcto” al que volver; el orden ES el significado. El modelo necesita el orden incrustado en cada palabra, no deshecho.
- No del todo, memorizar no escala a todas las frases posibles. El truco es mucho más barato: etiquetar cada lugar con su propia marca y sumarla a la palabra.
- La huella de cada token se lee de las perillas de volumen de la regla, ajustadas a distintas velocidades, para que “primero” y “tercero” caigan en puntos distintos. Suma esa huella a la palabra y las puntuaciones Query·Key de la atención ahora dependen de la posición, el orden sobrevive al producto punto.
- Pegas un documento mucho más largo que cualquier cosa con la que entrenó el modelo, y las respuestas sobre secciones tempranas frente a tardías se vuelven inestables. ¿Por qué puede difuminarse “qué vino primero” en longitudes extremas?
- La atención puntúa pares con un producto punto, que por sí solo es ciego al orden, así que cada token se marca con una huella de posición antes de que corra la atención. Estira la entrada mucho más allá de las longitudes con las que entrenó el modelo y esas marcas caen en territorio que nunca practicó, así que la señal de posición se debilita y “qué vino primero” puede difuminarse.
La idea clave
La posición se añade, no se da por supuesta.
Qué puedes hacer después de esta lección
Puedes explicar por qué los modelos añaden información posicional para que el orden de las palabras importe.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Codificación posicional
Adónde lleva: ¿Más grande siempre significa mejor?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.