Explicador en lenguaje claro
Las leyes de escalado, explicadas
¿Por qué hacer los modelos más grandes los hacía mejores?
Los investigadores descubrieron que el error de un modelo baja por curvas suaves y predecibles al crecer tres cosas: parámetros, datos de entrenamiento y cómputo. Predecible es la palabra clave: los laboratorios podían pronosticar qué tan bueno saldría un entrenamiento antes de pagarlo, y eso justificó pagar más. El resultado Chinchilla añadió el equilibrio: con un presupuesto fijo de cómputo, un modelo más pequeño entrenado con más datos gana a uno más grande con menos, más o menos veinte tokens de datos por parámetro.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Del internet a tu respuesta →Gratis, sin código, sin registro.
Y después ve más a fondo: Leyes de escalado Bloqueada
Lo que la gente entiende mal
- Las leyes de escalado prometen inteligencia. Predicen el error del siguiente token. Las habilidades útiles vienen encima, pero de forma dispareja y menos predecible.
- Más grande siempre es la respuesta. Chinchilla mostró que varios modelos famosos estaban subentrenados: demasiados parámetros para sus datos.
- El escalado se acabó. Las curvas siguen valiendo, pero los ejes se multiplicaron: la calidad de datos, el post-entrenamiento y el cómputo en inferencia también escalan.
Dónde lo ves en productos reales
- Las familias de modelos vienen en tallas porque costo y calidad se intercambian por estas curvas.
- El 'entrenado con X billones de tokens' de las fichas es el eje de datos de la ley.
- Los titulares de eficiencia, como modelos fuertes entrenados inusualmente barato, son victorias contra estas mismas curvas.
Preguntas frecuentes
- ¿Qué predijeron en realidad las leyes de escalado?
- Que la pérdida baja siguiendo una curva suave y predecible cuando aumentas juntos el tamaño del modelo, los datos y el cómputo. Esa previsibilidad es lo que justificó gastar cientos de millones en una sola corrida de entrenamiento: podías estimar qué ibas a obtener antes de empezar.
- ¿Qué cambió Chinchilla?
- Mostró que los modelos de esa época eran demasiado grandes para la cantidad de datos con la que se entrenaban. Con un presupuesto de cómputo fijo, un modelo más chico entrenado con más tokens salía mejor. Los tamaños de titular dejaron de dispararse y lo que se disparó fue el número de tokens de entrenamiento.
- ¿Dejaron de funcionar las leyes de escalado?
- La curva de cómputo a pérdida sigue vigente. Lo que cambió es dónde están las mejoras más baratas. Hoy los laboratorios también compran calidad con mejores datos, más post-entrenamiento y gastando cómputo en el momento de responder, no solo al entrenar.
Explicadores relacionados
Más en Cómo se entrenan los modelos
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.