Explicador en lenguaje claro
Softmax, explicado
¿Qué hace softmax y dónde lo usa un LLM?
Softmax convierte una lista de puntuaciones crudas en porcentajes que suman 100. Exagera las diferencias: una puntuación apenas por delante se vuelve una porción muy por delante, y las bajas se encogen hacia cero sin llegar a tocarlo. Los modelos de lenguaje lo usan en los dos lugares que más importan: en la salida, para convertir puntuaciones de palabras en las probabilidades de la siguiente palabra, y dentro de attention, para decidir cuánto aporta cada palabra anterior a la actual.
Revisado por última vez el
No te quedes en leerlo. Opera tú mismo el mecanismo en una lección interactiva corta.
Míralo funcionar: Cómo la atención mezcla el significado →Gratis, sin código, sin registro.
Lo que la gente entiende mal
- Softmax elige al ganador. Solo convierte puntuaciones en porciones. La elección, muestrear o tomar la primera, viene después.
- Los porcentajes son la confianza del modelo sobre hechos. Describen texto probable, no verdad, y por eso una respuesta errónea puede llevar una porción alta.
- Es un detalle oscuro. El control de temperatura que ves en los productos funciona remodelando puntuaciones justo antes de este paso.
Dónde lo ves en productos reales
- Las APIs que devuelven logprobs te muestran las porciones que produjo softmax.
- El ajuste de temperatura es aritmética aplicada justo antes de softmax.
- Los mapas de calor de attention en las visualizaciones son porciones de softmax pintadas como color.
Preguntas frecuentes
- ¿Por qué no elegir simplemente la puntuación más alta?
- A veces se hace, eso es greedy decoding. Pero el entrenamiento necesita una salida suave de la que aprender, y el muestreo necesita probabilidades reales de las que sacar. El softmax convierte puntuaciones arbitrarias en una distribución que sirve para ambas cosas.
- ¿Qué le hace la temperature al softmax?
- Divide las puntuaciones antes de la exponencial. Una temperature baja exagera las diferencias, así que la opción principal domina y el modelo parece decidido. Una alta las aplana, y las opciones improbables reciben una oportunidad real. Cambia la forma de la distribución, nunca el orden.
- ¿Dónde se usa el softmax dentro de un transformer?
- Dos veces, para trabajos distintos. Dentro de la attention convierte las puntuaciones de relevancia en pesos de mezcla. Al final convierte las puntuaciones sobre todo el vocabulario en probabilidades del siguiente token. La misma función, una mezcla contexto y la otra elige palabra.
Explicadores relacionados
Más en Dentro del transformer
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.