Saltar al contenido
todas las lecciones
Operación y escalado4.11Bloqueada

Decodificación especulativa: dos modelos, una respuesta rápida

El modelo escribe un token a la vez, en orden. Eso es lento. ¿podemos hacer trampa con la espera?

La idea que hay dentro

Un modelo pequeño redacta tokens por adelantado; el grande los verifica de una sola vez.

Después de esta lección

Puedes explicar la decodificación especulativa: un modelo pequeño redacta, el grande verifica, para una salida más rápida.

Adónde lleva

Otra forma de ir más rápido y barato: encoger el modelo mismo.

Dentro de esta lección

Ese es el escenario real de la lección, en pausa. Reclama tu pase para operarlo.

Mira cómo funciona la IA de verdad, de principio a fin.

Esta lección es solo una parada del arco completo. Desbloquéalo todo y consérvalo de por vida.

Lo que obtienes

  • El camino principal de 34 lecciones, una ruta que sí se termina, de una palabra a los agentes
  • Rutas por objetivo para usar IA en el trabajo y construir funciones con IA
  • Labs de jefe que te hacen aplicar un acto entero, no solo reconocerlo
  • Repaso espaciado que trae cada idea de vuelta antes de que la olvides
  • Memoria del curso: cada término definido, con enlaces a donde aparece por primera vez
  • Una tarjeta de capacidades para compartir cuando termines el camino principal
  • Acceso de por vida en cualquier dispositivo, con todas las lecciones futuras incluidas

No son videos para mirar. Predices, operas la máquina y luego lo demuestras. Por eso se queda.

99 lecciones y retos interactivos. Sin videos, sin código.

Pase de lanzamiento gratis: acceso de por vida, sin tarjeta

¿Nuevo por aquí? Las primeras lecciones son gratis para probar. Empieza con la lección 0.1

Qué muestra esta lección

Un modelo pequeño redacta tokens por adelantado; el grande los verifica de una sola vez.

La pregunta con la que abre

El modelo escribe un token a la vez, en orden. Eso es lento. ¿podemos hacer trampa con la espera?

El recorrido, en palabras de la propia lección

  • Arrastra la ventana de borrador y la tasa de acierto. Mira cómo bajan los pasos lentos.
  • Predice: arrastra la tasa de acierto hasta donde crees que muere la aceleración.
  • El orden es fijo y, aun así, revisar le gana a escribir. Aquí está el porqué.
  • Borra barato, verifica una vez, quédate con lo que coincide. Misma respuesta, más rápido.
  • Cada fila adivina por delante, el modelo grande verifica una vez, y solo sobrevive el prefijo ✓.
  • Menos ✕ significa menos pasadas lentas: ese es todo el truco.
  • Este truco corre invisible bajo la mayoría de tus chats: es parte de por qué las respuestas llegan más rápido y cuestan menos que hace un año, mismo modelo, mismas palabras.
  • Bájala: ¿qué tan bajo puede caer el borrador antes de que no quede aceleración?
  • Sigue siendo una victoria. Mientras el borrador acierte más de un token en la mayoría de las rondas, te ahorras pasadas lentas; la salida es idéntica en cualquier caso.
  • Un mal borrador ve rechazadas la mayoría de sus adivinanzas, así que casi cada ronda avanza un solo token: de vuelta a una pasada lenta cada una. El trabajo del borrador se desperdicia.
  • La mayoría de las palabras son fáciles. Después de "érase una", hasta un modelo diminuto sabe "vez". El modelo grande solo hace falta de verdad en las bifurcaciones difíciles, por eso la tasa de acierto del borrador es alta.
  • El orden es fijo: el token 7 no se puede escribir antes que el 6.
  • Escribir es lento porque cada token tiene que esperar al anterior: el token 7 no puede empezar hasta que exista el token 6. Pero el borrador ya escribió los tokens adivinados. Así que, en vez de escribir, el modelo grande solo tiene que revisar cada posición, "¿es este el token que yo habría elegido aquí?", y revisar no necesita esperar, porque cada token que revisa ya existe. Eso le permite pasar toda la ventana junta en una sola pasada, mientras que escribir desde cero necesita un paso lento de espera por cada token.
  • Borra barato, verifica una vez, quédate con el prefijo con el que coincides.
  • En el servicio de 2026, el borrador muchas veces no es un modelo aparte: al modelo grande se le añaden unas pequeñas cabezas de borrador extra que adivinan unos tokens por delante para él (EAGLE, Medusa), y luego verifica su propio borrador de la misma manera.
  • Las respuestas de tu chatbot llegan notablemente más rápido que el año pasado, mismo nombre de modelo, misma calidad. ¿Qué cambió probablemente por debajo?
  • Speculative decoding (borrador + verificación) y trucos parecidos: un borrador pequeño corre por delante, el modelo grande revisa en bloque, palabras idénticas, menos pasadas del modelo grande.
  • Cada ficha marcada con V es una pasada lenta del modelo grande: verifica toda la ventana borrada de una vez y conserva el prefijo ✓, descartando cualquier ✕ tras el primer fallo.
  • Incluso una ronda totalmente rechazada avanza un token: la pasada de verificación calcula de todos modos el siguiente token correcto, una corrección gratis.

La idea clave

Un truco de redactar-y-verificar acelera la generación sin perder calidad.

Qué puedes hacer después de esta lección

Puedes explicar la decodificación especulativa: un modelo pequeño redacta, el grande verifica, para una salida más rápida.

Ponte a prueba: ¿Cómo acelera la generación la decodificación especulativa?
  • Un modelo pequeño redacta tokens; el grande los verifica de una pasada(correcta)
  • Se salta los tokens difíciles
  • Baja la precisión del modelo
  • Cachea el system prompt

Un modelo pequeño y rápido redacta varios tokens; el modelo grande los verifica todos en una sola pasada. Verificar es más barato que generar uno por uno.

¿Prefieres leer primero? Esta lección tiene un explicador de compañía: Speculative decoding

Adónde lleva: Otra forma de ir más rápido y barato: encoger el modelo mismo.

Este es el resumen escrito. La lección en sí es interactiva: arriba predices, arrastras y operas el mecanismo, y la revelación te responde.