Del internet a tu respuesta
Se entrena una vez con texto de internet filtrado (adivina, falla, ajusta, repite) y luego se congela; las respuestas en vivo llegan por herramientas que alimentan al modelo congelado.
Una respuesta real, correcta y al minuto, de un modelo que terminó de entrenarse hace meses.
El modelo se construyó hace meses y aun así el clima es correcto. ¿De dónde salió la respuesta?
Pero ¿cómo puede una máquina ordenar palabras por significado? Tiene que convertirlas en números.
1.1 Convertir palabras en númerosSe apoya en0.1¿Cómo piensa una IA?
Preguntas frecuentes
¿De qué trata "Del internet a tu respuesta"?
¿Qué pregunta responde esta lección?
¿Qué sabré hacer después de esta lección?
¿Qué viene después?
Qué muestra esta lección
Se entrena una vez con texto de internet filtrado (adivina, falla, ajusta, repite) y luego se congela; las respuestas en vivo llegan por herramientas que alimentan al modelo congelado.
La pregunta con la que abre
Responde sobre el clima de hoy, pero se construyó hace meses. ¿Cómo se hizo, y cómo sabe lo de AHORA?
El recorrido, en palabras de la propia lección
- Responde sobre el ahora mismo. Toca de dónde crees que salió esa respuesta.
- Primero: cómo se hizo el modelo, del internet en bruto a números congelados.
- Luego: cómo se responde tu pregunta hoy, con el modelo congelado.
- El modelo se construyó hace meses y aun así el clima es correcto. ¿De dónde salió la respuesta?
- Correcto. El modelo en sí está congelado, su entrenamiento terminó hace meses. La app consultó el clima de hoy y lo pegó junto a tu pregunta. Veamos las dos mitades de esa historia.
- No pudo: el entrenamiento terminó meses antes de hoy, así que el clima de hoy nunca estuvo en los datos. La app lo consultó y lo pegó junto a tu pregunta. Veamos las dos mitades de esa historia.
- Sin sensores. El modelo es solo números congelados. La app consultó el clima de hoy con una herramienta y lo pegó junto a tu pregunta. Veamos las dos mitades de esa historia.
- Un solo arco: texto de internet filtrado le enseñó a una máquina de adivinar por prueba y error, los números terminados se congelaron, y las apps le atornillan herramientas a esa máquina congelada para que pueda responder sobre el ahora.
- ChatGPT busca las respuestas en una gran base de datos de hechos, y navega la web cuando quiere.
- Adentro no hay ninguna base de datos de hechos: solo números congelados ajustados durante el entrenamiento. Cuando cita algo actual, la APP ejecutó una herramienta de búsqueda y pegó los resultados en la conversación para que el modelo los lea.
- ¿De dónde salen exactamente los datos de entrenamiento?
- Rastreos de la web, libros digitalizados, repositorios de código, archivos de artículos con licencia y sitios de preguntas y respuestas. La mayor parte de lo recolectado se descarta: duplicados, spam, texto roto y contenido filtrado por calidad o seguridad. Tú mismo vas a manejar ese embudo de limpieza en el laboratorio de curación de datos.
- Esa es una segunda fase más corta llamada post-training: humanos escriben respuestas de ejemplo y clasifican los intentos del modelo, y esas preferencias ajustan los mismos números que luego se congelan. Por eso el adivinador de palabras se comporta como un asistente. El Acto 2 muestra el bucle de entrenamiento de cerca, y la lección de post-training muestra este pulido.
- ChatGPT cita un artículo de noticias publicado esta mañana, pero su entrenamiento terminó hace meses. ¿Cómo es posible?
- Una herramienta de búsqueda. La app notó que la pregunta necesita datos frescos, buscó en la web y pegó el texto del artículo en la conversación. El modelo congelado escribió entonces un resumen de lo que le entregaron. El conocimiento del entrenamiento termina en una fecha de corte; todo lo más nuevo llega por herramientas.
- Una respuesta real, correcta y al minuto, de un modelo que terminó de entrenarse hace meses.
- Empieza como un trozo enorme del internet: páginas, libros, código, foros.
- La mayor parte se descarta: duplicados, spam, basura. Calidad que entra, calidad que sale.
- Luego el juego de la 0.1, al revés: mostrar una frase, ocultar la siguiente palabra, dejar que el modelo adivine y ajustar sus números cuando falla. Repetido billones de veces, durante meses, en miles de GPUs.
- Cuando el entrenamiento termina, los números se congelan. Ese es el modelo que se lanza.
- Congelado. Desde este momento los números no cambian nunca, sin importar qué le preguntes.
- Tu pregunta llega a la app. El modelo solo no puede responder: su conocimiento se detiene en su fecha de corte, hace meses.
- Así que la app (no el modelo) ejecuta una herramienta: una consulta de clima en vivo.
- El resultado se pega en la conversación, justo al lado de tu pregunta.
- Ahora el modelo hace lo único que sabe hacer, predecir la siguiente palabra, pero leyendo datos frescos. Ese bucle escribe tu respuesta.
La idea clave
Todo el proceso en una imagen: datos → entrenamiento → modelo congelado → herramientas → tu respuesta.
Qué puedes hacer después de esta lección
Puedes dibujar el arco completo: de dónde salen los datos de entrenamiento, qué cambia el entrenamiento, por qué el modelo está congelado y cómo las apps responden preguntas en vivo de todas formas.
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Entrenamiento o inferencia
Adónde lleva: Pero ¿cómo puede una máquina ordenar palabras por significado? Tiene que convertirlas en números.
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.