Saltar al contenido
todas las lecciones
Salas electivasE.11Bloqueada

Enrutamiento de modelos: el modelo más barato que pasa

Cada solicitud golpea tu modelo más grande y caro. La factura y la latencia son brutales, y la mayoría de esas solicitudes eran fáciles.

La idea que hay dentro

Enruta cada tarea al nivel de modelo más barato que aún la resuelve; usa una cascada cuando la dificultad es desconocida, y un fallback cuando un nivel falla.

Después de esta lección

Puedes enrutar una carga de trabajo entre niveles de modelo para alcanzar un listón de calidad al menor costo y latencia, usando cascadas y fallbacks.

Adónde lleva

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Enruta cada tarea al nivel de modelo más barato que aún la resuelve; usa una cascada cuando la dificultad es desconocida, y un fallback cuando un nivel falla.

La pregunta con la que abre

Cada solicitud golpea tu modelo más grande y caro. La factura y la latencia son brutales, y la mayoría de esas solicitudes eran fáciles.

El recorrido, en palabras de la propia lección

  • Enruta cada tarea a un nivel. Mantén la calidad en 100% y baja de ambos presupuestos.
  • No puedes saber la dificultad de cada tarea de antemano. Predice cuánto cuesta una cascada.
  • No hay un único mejor modelo. Enrutas por dificultad, dentro de un presupuesto.
  • 100% de calidad, muy por debajo de ambos presupuestos. Cada tarea fue al nivel más barato que aún puede resolverla. Eso es enrutar.
  • Un nivel por debajo de la dificultad de una tarea no puede resolverla, así que la calidad baja. Sube esa tarea un nivel.
  • La calidad es perfecta pero te pasas del presupuesto. Por defecto todo va a Frontier. Baja de nivel las tareas fáciles y de alto volumen.
  • Envía cada tarea al nivel más barato cuya dificultad aún la cubra. Los 6.000 tickets fáciles solo necesitan Small. Las tareas medias necesitan Mid. Solo los 500 análisis difíciles necesitan Frontier. Misma calidad, una fracción del costo.
  • Los costos y latencias aquí son unidades de cómputo ilustrativas, no precios reales, pero el trade-off es real.
  • Una cascada prueba primero el modelo Small y escala a Frontier solo cuando Small no está seguro. En 100 solicitudes variadas, ¿la cascada cuesta MÁS o MENOS que enviar las 100 a Frontier?
  • La mayoría de las solicitudes son fáciles, así que Small las resuelve y nunca llega a Frontier. Pagas el precio de frontier solo por las pocas difíciles que escalan.
  • La misma idea al revés para la fiabilidad: un fallback. Si Frontier se cae o da error, baja a Mid para que la solicitud igual reciba respuesta en vez de fallar.
  • El modelo más grande e inteligente siempre es la decisión correcta.
  • Enrutas por dificultad dentro de un presupuesto: el nivel más barato que aún pasa, con una cascada para lo desconocido y un fallback para los fallos.
  • Un asistente de soporte se siente instantáneo incluso a gran escala, y aun así acierta la rara pregunta difícil. ¿Cuál es el truco más probable por debajo?
  • Enrutar: ~90% de los tickets van a un modelo pequeño y rápido, y solo el ~10% difícil escala a un modelo frontier. Los productos ágiles a gran escala suelen ser enrutamiento inteligente, no un solo modelo gigante respondiendo a todo.
  • Puedes enrutar una carga de trabajo entre niveles de modelo para alcanzar un listón de calidad al menor costo y latencia, en vez de sobrepagar el modelo frontier por trabajo fácil.
  • Total de la cascada ≈ 700 vs todo a Frontier 2.000. Menos, porque la mayoría nunca escala.

La idea clave

Mantuviste la calidad en 100% mientras recortabas costo y latencia, enrutando el trabajo fácil a modelos pequeños y reservando el modelo frontier para los pocos difíciles.

Qué puedes hacer después de esta lección

Puedes enrutar una carga de trabajo entre niveles de modelo para alcanzar un listón de calidad al menor costo y latencia, usando cascadas y fallbacks.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Routing de modelos

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.