Saltar al contenido
todas las lecciones
Salas electivasE.22Bloqueada

RLVR: cómo la IA se volvió buena en matemáticas y código

Los modelos pasaron de mediocres a expertos en matemáticas y código en apenas un año, sin ninguna arquitectura nueva. ¿Qué cambió?

La idea que hay dentro

Una tercera etapa de entrenamiento: aprendizaje por refuerzo con recompensas que un programa puede verificar, ¿corrió el código?, ¿es correcta la respuesta?, en vez de un pulgar arriba humano. El modelo se convierte en lo que su recompensa pueda medir.

Después de esta lección

Puedes explicar por qué los modelos se volvieron buenos de repente en dominios verificables: las recompensas verificables dejan escalar el entrenamiento donde un programa puede calificar la respuesta, y la adulación deja de dar recompensa.

Adónde lleva

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Una tercera etapa de entrenamiento: aprendizaje por refuerzo con recompensas que un programa puede verificar, ¿corrió el código?, ¿es correcta la respuesta?, en vez de un pulgar arriba humano. El modelo se convierte en lo que su recompensa pueda medir.

La pregunta con la que abre

Los modelos pasaron de mediocres a expertos en matemáticas y código en apenas un año, sin ninguna arquitectura nueva. ¿Qué cambió?

El recorrido, en palabras de la propia lección

  • El mismo cerebro, un año después, experto en matemáticas y código. Predice qué cambió.
  • Tú eres el verificador. Ejecuta cada intento y observa qué razonamiento recibe recompensa.
  • Un verificador solo puede calificar lo que un programa sabe puntuar. ¿Dónde deja eso a la escritura?
  • Recompensa lo que un programa puede comprobar, y el modelo se vuelve bueno en eso.
  • El mismo transformer. Ninguna arquitectura nueva. ¿Entonces qué cambió?
  • ¿Qué hizo que los modelos pasaran de mediocres a expertos en matemáticas y código?
  • Correcto. No un modelo más grande ni con otra forma, sino una etapa de entrenamiento nueva: recompensar al modelo por respuestas que un programa puede comprobar.
  • Fue el entrenamiento, no el modelo. Una etapa nueva recompensa al modelo por respuestas que un programa puede comprobar, no por un pulgar arriba de una persona.
  • Ya viste dos etapas: preentrenamiento (predecir la siguiente palabra, Acto 2) y postentrenamiento con feedback humano (SFT + RLHF, 2.6). RLVR es una tercera etapa. RL es reinforcement learning (aprendizaje por refuerzo) y VR es verifiable rewards (recompensas verificables): en vez de un pulgar arriba de una persona, la recompensa viene de un programa que COMPRUEBA la respuesta, ¿corrió el código?, ¿está bien la matemática? Suelta esa recompensa sobre matemáticas y código, donde la corrección se puede comprobar, y el modelo sube rápido.
  • RLVR mejoró a los modelos en todo, incluida la escritura y las preguntas abiertas.
  • RLVR solo entrena lo que un programa puede calificar: matemáticas, código, tareas formales. No hay verificador para un buen poema ni para un correo con tacto, así que la escritura abierta sigue apoyándose en el ajuste con feedback humano (RLHF, E.1), no en recompensas verificables.
  • Todo el truco es una recompensa que el modelo no puede falsear: un programa determinista compara su respuesta con una que se sabe correcta. Eso solo existe donde la corrección es objetiva. Para un poema o un correo no hay una verdad de referencia contra la cual comprobar, así que RLVR no tiene nada que recompensar, y los laboratorios recurren a evaluadores humanos o a un juez de IA.
  • Un pulgar arriba recompensa la adulación segura de sí. Un verificador de respuestas recompensa intentarlo de nuevo hasta acertar, y de ahí surge el razonamiento largo que se autocorrige.
  • DeepSeek-R1 (principios de 2025) lo demostró a gran escala: entrena un modelo base con RL sobre recompensas verificables de matemáticas y código, con una receta llamada GRPO (group relative policy optimization), y las cadenas largas de razonamiento surgen solas, ningún humano las escribió. El modelo aprende a pausar, revisar y corregirse, porque eso es lo que gana la recompensa. Es el mismo linaje que los modelos de razonamiento de 4.8.
  • Un modelo nuevo es mucho mejor en concursos de programación pero no mejor escribiendo un elogio sentido. Dado cómo se entrenó, ¿por qué esa diferencia?
  • RLVR solo recompensa lo que un programa puede comprobar. Programar tiene un verificador (¿corre?, ¿pasa las pruebas?), así que las recompensas verificables lo entrenaron a fondo ahí. Un elogio no tiene una verdad de referencia contra la cual calificar, así que esa habilidad sigue viniendo del ajuste con feedback humano, que mejora mucho más despacio y no se puede escalar igual.
  • El problema de matemáticas, los intentos y las calificaciones son inventados para mostrar el mecanismo, no registrados de un entrenamiento real.
  • Solo el intento que se detuvo, se revisó y se corrigió recibió recompensa. Haz eso un millón de veces y 'pausar y verificar' se vuelve la reacción por defecto del modelo, de ahí salen las cadenas largas de razonamiento.

La idea clave

Jugaste a ser el verificador: un pulgar arriba premia la adulación segura, un verificador de respuestas premia intentarlo de nuevo hasta acertar, y de ahí sale el razonamiento largo que se corrige solo.

Qué puedes hacer después de esta lección

Puedes explicar por qué los modelos se volvieron buenos de repente en dominios verificables: las recompensas verificables dejan escalar el entrenamiento donde un programa puede calificar la respuesta, y la adulación deja de dar recompensa.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.