Explicador en lenguaje claro
El descenso de gradiente, explicado
¿Cómo aprende de verdad una red neuronal?
Entrenar es un bucle. El modelo hace una predicción, una función de pérdida mide cuánto se equivocó, y el cálculo le dice a cada peso qué pequeño empujón habría reducido el error. Todos los pesos toman su empujón, y el bucle se repite miles de millones de veces. Eso es el descenso de gradiente: bajar por un paisaje de error que nunca ves completo, un pasito a la vez. Nadie escribe las reglas. Las reglas son los valores de los pesos donde el descenso se asienta.
Revisado por última vez el
Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.
Empieza gratis: Predice la siguiente palabra →Gratis, sin código, sin registro.
Y después ve más a fondo: Descenso de gradiente: rodar cuesta abajo Bloqueada
Lo que la gente entiende mal
- Los ingenieros programan el conocimiento del modelo. Programan el bucle. El conocimiento es el subproducto de correrlo sobre datos.
- El entrenamiento encuentra la respuesta perfecta. Encuentra un valle bajo que funciona, no el mejor garantizado.
- El modelo sigue aprendiendo cuando chateas con él. Tras el entrenamiento los pesos quedan congelados. Tu conversación cambia el context, nunca los pesos.
Dónde lo ves en productos reales
- Los titulares sobre entrenamientos que cuestan millones describen este bucle a escala.
- Las curvas de pérdida en los posts de los laboratorios son el camino cuesta abajo, dibujado en el tiempo.
- Los servicios de fine-tuning corren el mismo bucle, partiendo del modelo terminado y usando tus datos.
Preguntas frecuentes
- ¿Qué es un gradiente, en palabras simples?
- La dirección que empeoraría el error, medida para todos los pesos a la vez. El entrenamiento da el paso en sentido contrario. Responde a la pregunta: si subo un poco este número, ¿el modelo mejora o empeora, y cuánto?
- ¿Qué es el learning rate?
- El tamaño de cada paso. Muy chico y el entrenamiento se arrastra, muy grande y se pasa de largo y se desestabiliza. Los planes de entrenamiento reales suben el ritmo al principio y luego lo bajan, y es una de las pocas perillas que decide de verdad si una corrida sale bien o se derrumba.
- ¿El entrenamiento llega alguna vez al fondo?
- No, y no hace falta. Se detiene cuando el error deja de mejorar de forma útil sobre datos que el modelo no vio. En un espacio de miles de millones de dimensiones hay muchos valles suficientemente buenos, y encontrar uno es todo el objetivo.
Explicadores relacionados
Más en Cómo se entrenan los modelos
- ¿Cuándo conviene hacer fine-tuning y cuándo basta con el prompt?
- ¿Por qué hacer los modelos más grandes los hacía mejores?
- ¿Qué es RLHF y por qué un predictor de texto se comporta como asistente?
- ¿Cómo puede un modelo aprender de ejemplos en el prompt sin reentrenarse?
- ¿Qué es la destilación de modelos y por qué la versión mini es tan buena?
Una idea a la vez, en tu correo
Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.
Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.
Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.