Saltar al contenido
todas las lecciones
Salas electivasE.1Bloqueada

RLHF / post-entrenamiento

Un modelo preentrenado en bruto no es útil ni está alineado.

La idea que hay dentro

Preentrenamiento → SFT → RLHF: ordena las salidas para entrenar un modelo de recompensa y desplaza la política.

Después de esta lección

Puedes explicar RLHF: las preferencias humanas entrenan un modelo de recompensa que moldea al asistente.

Adónde lleva

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Preentrenamiento → SFT → RLHF: ordena las salidas para entrenar un modelo de recompensa y desplaza la política.

La pregunta con la que abre

Un modelo preentrenado en bruto no es útil ni está alineado.

El recorrido, en palabras de la propia lección

  • Ambas respuestas son fluidas. Toca la que preferirías recibir.
  • Tú eres quien evalúa. Elige la mejor respuesta de cada par.
  • Tus elecciones entrenaron a un juez. Ahora el juez califica respuestas que nunca viste.
  • Haz clic en «¿Olvidaste tu contraseña?» en la pantalla de inicio de sesión y sigue el enlace de restablecimiento de tu correo.
  • Toca la otra respuesta para comparar ambos resultados fluidos.
  • Ambas son fluidas, pero solo una es útil. Un modelo en bruto no las distingue; ese es el criterio que tenemos que enseñarle.
  • El preentrenamiento (Acto 2) solo le enseñó al modelo a predecir texto fluido, nunca cuál respuesta es mejor. Eso se lo tenemos que enseñar, y el resto de esta lección muestra cómo.
  • El SFT (2.6) ya le enseñó a este modelo a responder con voz de asistente. Ordenar respuestas es la siguiente señal.
  • RLHF. Reinforcement Learning from Human Feedback (aprendizaje por refuerzo a partir de retroalimentación humana): tu puñado de elecciones entrenó a un juez (un modelo de recompensa), y el juez, no tú, convierte en calificaciones millones de respuestas que pasan a ser los instintos del modelo.
  • El RLHF abrió el camino, pero hoy los laboratorios combinan una familia de métodos, todos con la misma idea, preferir mejores respuestas:
  • DPO (optimización directa de preferencias): se salta el juez separado y ajusta el modelo directo con pares de preferencias. Más barato, misma señal.
  • RLAIF: una IA califica las respuestas en vez de personas, así los laboratorios pueden calificar millones de pares.
  • RLVR (recompensas verificables): en matemáticas y código un programa comprueba la respuesta, así que la recompensa es exacta. Entrenados así (con una receta llamada GRPO), los modelos aprenden a escribir largas cadenas de pensamiento. De ahí vienen los modelos de razonamiento (4.8).
  • Un asistente de chat se vuelve notablemente más cálido y cauto tras una actualización, sin que cambien las preguntas que le haces. ¿Qué pasó?
  • RLHF reformó sus instintos: las preferencias de las personas que calificaron entrenaron un reward model, y ese juez calificó millones de respuestas para favorecer ese tono. Así que cuando el estilo o los rechazos de un asistente cambian, lo que cambió fue el post-entrenamiento y las personas detrás de él, no los datos con los que se entrenó.
  • Tus elecciones entrenan a un segundo modelo, el juez, llamado modelo de recompensa (reward model), para predecir qué respuesta preferiría una persona; luego el juez califica respuestas que nunca viste:
  • Aquí 2 pares; los laboratorios reales reúnen cientos de miles de comparaciones.
  • Esa última puntuación alta es la trampa: el juez aprendió 'seguro y amable', no 'verdadero'. Un modelo que persigue esas puntuaciones aprende a adular en vez de ayudar. Ese fallo se llama reward hacking (hackear la recompensa); la variante aduladora es la sycophancy (adulación).
  • Tu puñado de elecciones entrenó a un juez. El juez, no tú, califica millones de respuestas. Cada puntuación es una recompensa, el descenso de gradiente (2.4) ajusta los pesos para hacer más probables las respuestas con puntuación alta.

La idea clave

Mira cómo un puñado de preferencias se convierte en el juez que moldea al asistente.

Qué puedes hacer después de esta lección

Puedes explicar RLHF: las preferencias humanas entrenan un modelo de recompensa que moldea al asistente.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: RLHF

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.