Leyes de escalado
¿Echarle más recursos ayuda de forma predecible?
La idea que hay dentro
La pérdida cae según una ley de potencias en parámetros, datos y cómputo (Chinchilla).
Después de esta lección
Puedes explicar las leyes de escalado: la pérdida cae de forma predecible con el cómputo, pero predice la pérdida, no las habilidades.
Adónde lleva
¿Cómo añadir parámetros sin pagar por ellos en cada token?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
La pérdida cae según una ley de potencias en parámetros, datos y cómputo (Chinchilla).
La pregunta con la que abre
¿Echarle más recursos ayuda de forma predecible?
El recorrido, en palabras de la propia lección
- De vuelta al volante. Empuja el esfuerzo hasta el tope.
- Curva inventada con la forma de la tendencia publicada; los puntos de los modelos están colocados sobre ella, no medidos.
- Más esfuerzo, menos equivocado, en una fracción constante.
- Sube el deslizador de esfuerzo y mira cómo baja lo-equivocado.
- La pérdida es la sorpresa del modelo ante la verdad (de 2.3), menos es mejor. El esfuerzo de entrenamiento significa escalar los tres ingredientes a la vez: tamaño del modelo, datos de entrenamiento y cómputo.
- ¿Lo notas? No es un caos ni un muro. Cada 10× de esfuerzo cierra la misma fracción predecible de la distancia restante al piso, una curva suave y repetible.
- Hacia abajo y a la derecha: más esfuerzo, menos equivocado. Modelos reales están marcados como referencia sobre una curva inventada con la forma de la tendencia publicada. Ahora, toma el volante.
- Escalar sube de forma fiable la capacidad media, pero a mayor costo y latency y con rendimientos decrecientes, y un modelo pequeño aún puede ganar en una tarea concreta y fácil.
- Un laboratorio anuncia un modelo nuevo entrenado con muchos más datos y cómputo, y los reseñadores esperan que sea mejor de forma constante. ¿Por qué es una apuesta razonable, y dónde se vuelve dudosa?
- Las scaling laws dicen que la pérdida baja por una curva suave y predecible al escalar datos, parámetros y cómputo a la vez, así que un modelo más grande y mejor alimentado es una apuesta segura para bajar la pérdida. Lo dudoso es qué habilidades concretas aparecen y cuándo, así que da por probables las mejoras amplias pero prueba tú cada habilidad concreta en vez de darla por hecha.
La idea clave
Más grande + más datos reduce la pérdida de forma predecible, pero predice la pérdida, no las capacidades.
Qué puedes hacer después de esta lección
Puedes explicar las leyes de escalado: la pérdida cae de forma predecible con el cómputo, pero predice la pérdida, no las habilidades.
Ponte a prueba: ¿Qué predicen las leyes de escala?
- La pérdida baja de forma predecible con el cómputo (no qué habilidades aparecen)(correcta)
- Exactamente qué capacidades emergen
- La mejor tasa de aprendizaje
- El tamaño ideal del vocabulario
Las leyes de escalado predicen una loss menor con más cómputo y datos, de forma suave. No te dicen qué habilidades concretas aparecerán.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Leyes de escalado
Adónde lleva: ¿Cómo añadir parámetros sin pagar por ellos en cada token?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.