Saltar al contenido

Explicador en lenguaje claro

RLHF, explicado

¿Qué es RLHF y por qué un predictor de texto se comporta como asistente?

El preentrenamiento produce un predictor crudo que continúa texto en cualquier dirección, útil o no. RLHF es la escuela de acabado: humanos comparan pares de respuestas del modelo y eligen la mejor, un modelo de recompensa aprende a imitar esas preferencias, y el LLM se entrena después para puntuar alto en esa recompensa. El resultado responde preguntas, sigue instrucciones y rechaza pedidos dañinos, no porque le dictaran reglas, sino porque las respuestas con esa forma puntuaban mejor.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Del internet a tu respuesta

Gratis, sin código, sin registro.

Y después ve más a fondo: RLHF / post-entrenamiento Bloqueada

Lo que la gente entiende mal

  • RLHF le enseña hechos al modelo. El conocimiento viene del preentrenamiento. RLHF moldea el comportamiento, el tono y los rechazos.
  • El asistente tiene valores desde los que razona. Tiene una política optimizada para producir respuestas que los humanos prefirieron.
  • RLHF hace a los modelos más veraces. Puede premiar lo complaciente sobre lo exacto, y de ahí viene la adulación.

Dónde lo ves en productos reales

  • Los botones de pulgar arriba y abajo recogen exactamente estos datos de preferencia.
  • Los '¿qué respuesta prefieres?' lado a lado en los chats alimentan el modelo de recompensa.
  • La distancia entre un modelo base crudo y el asistente educado que usas es sobre todo este paso.

Preguntas frecuentes

¿Qué cambia realmente el RLHF en un modelo?
No lo que sabe, sino lo que tiende a decir. Un modelo preentrenado continúa texto; el RLHF lo ajusta hacia el tipo de continuación que la gente calificó como útil y segura. El mismo conocimiento, un comportamiento por defecto muy distinto.
¿De dónde salen las valoraciones humanas?
De anotadores pagados que comparan pares de respuestas al mismo prompt siguiendo una guía escrita. Esas comparaciones entrenan un reward model, que después puntúa muchísimas más respuestas de las que podría una persona. Esa guía es, en la práctica, los valores del producto puestos por escrito.
¿El RLHF es la razón de que los modelos se nieguen a responder?
En gran medida sí, junto con las reglas de seguridad que se le suman encima. Las negativas y los rodeos son conductas aprendidas que fueron premiadas, y por eso también se aplican de más a preguntas inofensivas que solo se parecen a las riesgosas.

Explicadores relacionados

Más en Cómo se entrenan los modelos

Una idea a la vez, en tu correo

Lecciones y explicadores nuevos, escritos como están escritas estas páginas. De vez en cuando, no a diario, y nunca una secuencia de venta.

Primero te enviamos un enlace de confirmación. Puedes darte de baja con un clic, cuando quieras. Privacidad.

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.