Jefe: opera dentro del presupuesto
Llegan tres solicitudes, cada una con su propio presupuesto de calidad, coste y velocidad. ¿Puedes ajustar los controles para que todas pasen, sin malgastar dinero en el modelo más grande?
La idea que hay dentro
Operar un modelo es elegir controles según la solicitud: el tier del modelo, el extended thinking y el speculative decoding mueven la calidad, el coste y la latency cada uno a su manera. Deja los tres medidores en verde.
Después de esta lección
Puedes elegir los controles de operación de una solicitud, el tier del modelo, el extended thinking y el speculative decoding, para cumplir un presupuesto de calidad, coste y latency, en vez de recurrir por defecto al modelo más grande.
Adónde lleva
Puedes operar un modelo para encajar en cualquier presupuesto. Pero sigue frozen y no recuerda nada entre llamadas, así que ¿cómo se construye algo con estado a su alrededor?
Dentro de esta lección
Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.
Mira cómo funciona la IA de verdad, de principio a fin.
Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.
Lo que obtienes
- El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
- Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
- Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
- Repaso espaciado que trae cada idea de vuelta antes de que la olvides
- Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
- Una tarjeta de capacidades para compartir cuando termines el camino principal
- Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas
No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.
99 lecciones y retos interactivos. Sin videos, sin código.
Pase de lanzamiento gratis: acceso de por vida, sin tarjeta
¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1
Qué muestra esta lección
Operar un modelo es elegir controles según la solicitud: el tier del modelo, el extended thinking y el speculative decoding mueven la calidad, el coste y la latency cada uno a su manera. Deja los tres medidores en verde.
La pregunta con la que abre
Llegan tres solicitudes, cada una con su propio presupuesto de calidad, coste y velocidad. ¿Puedes ajustar los controles para que todas pasen, sin malgastar dinero en el modelo más grande?
El recorrido, en palabras de la propia lección
- No recurriste al modelo más grande. Ajustaste cada solicitud a su presupuesto.
- Decisión correcta. Ningún ajuste de controles era lo bastante seguro, así que esta la toma un humano. Envía la siguiente solicitud.
- Los tres medidores en verde. Esta configuración cabe en el presupuesto. Envía la siguiente solicitud.
- Ajusta los controles para que calidad, coste y latency cumplan el presupuesto de esta solicitud.
- Medidores de juguete, números inventados que mantienen los trade-offs honestos en la forma, no en la escala.
- Esta solicitud sí cabe en un presupuesto: algún ajuste de controles pone los tres medidores en verde. Escalar es para cuando ningún ajuste es lo bastante seguro. Sigue trabajando los controles.
- Esa es la configuración más fuerte de la mesa y la calidad sigue sin llegar al listón. Cuando ningún control lo supera, la respuesta no es un control.
- La calidad es el bloqueo: la seguridad del paciente pone el listón en 99. Sube los controles al máximo y observa el techo.
- Medidor en rojo = fuera de presupuesto. Ajusta los controles hasta que los tres estén en verde.
- El mismo modelo, cuatro decisiones. El volumen barato fue al tier pequeño, el caso difícil se ganó el modelo frontier más thinking, el tiempo real se apoyó en el speculative decoding para ir rápido, y el triaje médico no tenía ningún control seguro, así que lo escalaste a un humano. Operar un modelo es encajar controles en un presupuesto, y saber cuándo no automatizar.
La idea clave
Operaste un mismo modelo de tres formas, ajustándote al presupuesto de calidad, coste y latency de cada solicitud, en vez de recurrir al modelo más grande cada vez.
Qué puedes hacer después de esta lección
Puedes elegir los controles de operación de una solicitud, el tier del modelo, el extended thinking y el speculative decoding, para cumplir un presupuesto de calidad, coste y latency, en vez de recurrir por defecto al modelo más grande.
Adónde lleva: Puedes operar un modelo para encajar en cualquier presupuesto. Pero sigue frozen y no recuerda nada entre llamadas, así que ¿cómo se construye algo con estado a su alrededor?
Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.