Ajustar la creatividad del modelo
El modelo produce una distribución: ¿cómo elegimos una palabra?
La idea que hay dentro
Voraz vs. muestreo; temperatura, top-k, top-p, penalizaciones.
Después de esta lección
Puedes explicar la temperatura, top-k y top-p, y el equilibrio entre precisión y creatividad.
Adónde lleva
Las conversaciones largas se vuelven lentas y el modelo 'olvida'…
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Voraz vs. muestreo; temperatura, top-k, top-p, penalizaciones.
La pregunta con la que abre
El modelo produce una distribución: ¿cómo elegimos una palabra?
El recorrido, en palabras de la propia lección
- El modelo ordena cada palabra siguiente. Sigue tocando la palabra #1 (la ★) y observa qué escribe.
- Una elección, en cámara lenta. Mira cómo ocurre la decisión en realidad.
- Ahora conduces tú. Mueve el dial, saca unas cuantas palabras y siente el cambio.
- El mismo modelo, estilos muy distintos: todo está en los controles.
- ¿Ves el bucle? El método greedy es determinista: el mismo contexto sigue puntuando la misma palabra como #1, así que se repite a sí mismo (“...descansar y descansar y descansar”) y suena robótico. Para escribir como una persona, el modelo a veces tiene que elegir una segundona.
- La jugada más segura es tomar siempre la palabra #1 (la ★). Pruébalo: toca “descansar”.
- Sigue tocando la misma palabra ★, el modelo haría lo mismo. Observa la frase.
- En lugar de tomar siempre la #1, el modelo lanza un dado cargado: la probabilidad de cada palabra es su porción de las tiradas. Eso es sampling.
- La temperatura aplana o agudiza las probabilidades: baja = segura y repetitiva, alta = creativa pero arriesgada. Estos controles ajustan la personalidad del modelo.
- Top-k conserva solo un número fijo de las palabras más probables; top-p conserva las palabras más probables hasta que sus probabilidades suman p, ambos solo recortan la cola poco probable antes de muestrear, para que no se cuele una palabra mala perdida.
- Subir la temperature hace al modelo más listo o más capaz.
- La temperature solo controla la aleatoriedad con la que se elige el siguiente token. Más alta da más variedad, más baja da más enfoque, pero la capacidad de fondo del modelo no cambia.
- El mismo prompt da una respuesta aburrida e idéntica un día y otra creativa y desbocada al siguiente. ¿Qué perilla cambió y hacia qué lado la girarías para extraer datos de facturas?
- La temperature, la perilla del muestreo. Una temperature alta reparte la probabilidad para dar variedad; una más baja la concentra para dar consistencia. Para extraer datos o cualquier cosa que deba ser exacta y repetible, bájala; para una lluvia de ideas, súbela.
La idea clave
Controlo el equilibrio entre creatividad y determinismo.
Qué puedes hacer después de esta lección
Puedes explicar la temperatura, top-k y top-p, y el equilibrio entre precisión y creatividad.
Ponte a prueba: ¿Qué controla la perilla de temperatura?
- Qué tan predecible o creativa es la salida(correcta)
- El tamaño del modelo
- La longitud del contexto
- El costo del entrenamiento
La temperatura aplana o agudiza las probabilidades: baja conserva la opción más alta (predecible), alta reparte las probabilidades para que arriesgue (creativa).
¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Temperature
Adónde lleva: Las conversaciones largas se vuelven lentas y el modelo 'olvida'…
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.