Saltar al contenido
todas las lecciones
Predicción y aprendizaje2.6Bloqueada

De predictor a asistente

Entrenado solo para predecir la siguiente palabra, un modelo base responde a “Escribe un poema sobre gatos” enumerando más instrucciones, no un poema. Entonces, ¿por qué un chatbot real sí te ayuda?

La idea que hay dentro

Tras el pre-entrenamiento viene el post-entrenamiento: ajusta con respuestas, luego ordena por preferencia humana.

Después de esta lección

Puedes explicar el post-entrenamiento (SFT + ajuste por preferencias) y por qué un predictor de la siguiente palabra se convierte en un asistente útil que sigue instrucciones.

Adónde lleva

Ya conoces la receta completa. Demuestra que puedes ejecutar el bucle de entrenamiento por tu cuenta, y luego abrimos cómo predice mirando toda la frase.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Tras el pre-entrenamiento viene el post-entrenamiento: ajusta con respuestas, luego ordena por preferencia humana.

La pregunta con la que abre

Entrenado solo para predecir la siguiente palabra, un modelo base responde a “Escribe un poema sobre gatos” enumerando más instrucciones, no un poema. Entonces, ¿por qué un chatbot real sí te ayuda?

El recorrido, en palabras de la propia lección

  • Toca la línea que crees que el modelo en bruto escribe a continuación.
  • Mismo prompt, dos modelos. El preentrenado solo continúa; el postentrenado responde.
  • Tú eres quien evalúa. Elige la mejor respuesta, dos veces.
  • Mismos pesos, nuevo comportamiento. Eso es el postentrenamiento.
  • Exacto, tu línea es solo texto que autocompletar, y en internet a las instrucciones les siguen MÁS instrucciones. Así que continúa la lista, no la obedece.
  • No del todo, el modelo en bruto solo autocompleta texto, sin idea de que debe obedecer. En internet a las instrucciones les siguen MÁS instrucciones, así que continúa la lista.
  • Un modelo en bruto, preentrenado (Acto 2), solo ha aprendido un truco: predecir la siguiente palabra de cualquier texto que ve. No tiene la noción de un «usuario» al que obedecer, tu prompt es simplemente texto que continuar. Y en sus datos de entrenamiento, una línea como una instrucción suele ir seguida de otra instrucción, así que la continuación más probable es más texto tipo prompt.
  • Mismos pesos, misma arquitectura. El postentrenamiento no añade casi conocimiento nuevo; sobre todo remodela el comportamiento.
  • Es el MISMO modelo, mismos pesos, misma arquitectura. El postentrenamiento apenas añadió conocimiento nuevo; le enseñó al predictor a preferir responder en vez de autocompletar. El primer paso es el SFT: ajuste fino sobre pares de ejemplo (prompt → buena respuesta) escritos por personas.
  • Tras el SFT, las personas eligen entre dos respuestas, esa preferencia es la siguiente señal.
  • Un puñado de elecciones humanas como las tuyas entrena un modelo de recompensa, un juez que califica respuestas como lo haría la gente. Sus puntuaciones luego ajustan los pesos del predictor hacia respuestas que tú preferirías. Ese ciclo es el RLHF.
  • El RLHF es hoy un miembro de una familia. Los laboratorios a menudo se saltan el juez separado y aprenden directo de pares de preferencias (DPO), usan evaluadores de IA en vez de personas (RLAIF), o premian respuestas que un programa puede verificar, como matemáticas y código (RLVR), que es como los modelos de razonamiento aprenden a pensar. Siempre la misma idea: preferir mejores respuestas.
  • No es un cerebro nuevo, el mismo predictor de la siguiente palabra, postentrenado para ser un asistente.
  • El asistente no es un cerebro nuevo, es el mismo predictor de la siguiente palabra, postentrenado. El SFT le muestra respuestas de ejemplo; el RLHF lo ajusta hacia respuestas que la gente prefiere. De ahí vienen el seguir instrucciones, la utilidad y los rechazos, apenas datos nuevos, sobre todo comportamiento nuevo.
  • Convertir un modelo en bruto en un asistente lo hace más listo o le enseña datos nuevos.
  • El postentrenamiento sobre todo remodela el comportamiento y añade casi nada de conocimiento nuevo. Es el mismo predictor con los mismos pesos, ajustado para responder, seguir instrucciones y rechazar, en vez de autocompletar a ciegas.
  • Un chatbot sigue tus instrucciones, suena amable y rechaza con cortesía los pedidos dañinos. Nada de eso es un dato que haya buscado. ¿De dónde viene ese comportamiento?
  • Del postentrenamiento encima del predictor crudo: SFT con respuestas de ejemplo, y luego ajuste por preferencias (RLHF) hacia respuestas que la gente prefiere. Mismos pesos, comportamiento nuevo, y por eso dos asistentes sobre el mismo modelo base pueden actuar muy distinto.

La idea clave

El asistente no es un cerebro nuevo; es el mismo predictor de la siguiente palabra, post-entrenado para preferir el tipo de respuesta que quieres.

Qué puedes hacer después de esta lección

Puedes explicar el post-entrenamiento (SFT + ajuste por preferencias) y por qué un predictor de la siguiente palabra se convierte en un asistente útil que sigue instrucciones.

Ponte a prueba: ¿Qué convierte a un predictor de la siguiente palabra en un asistente útil?
  • El postentrenamiento moldea el mismo modelo para que prefiera respuestas útiles(correcta)
  • Una segunda IA, aparte, se encarga de responder
  • Reglas escritas a mano para cada pregunta posible
  • Una base de datos mucho mayor de respuestas guardadas

El asistente no es un cerebro nuevo. Es el mismo predictor del siguiente token, postentrenado: afinado con buenas respuestas y luego ordenado por preferencia humana.

Adónde lleva: Ya conoces la receta completa. Demuestra que puedes ejecutar el bucle de entrenamiento por tu cuenta, y luego abrimos cómo predice mirando toda la frase.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.