Saltar al contenido

Explicador en lenguaje claro

Speculative decoding, dos modelos y una respuesta rápida

¿Qué es el speculative decoding y por qué acelera a los modelos?

Un modelo chico y rápido borronea los siguientes tokens, y después el modelo grande los verifica todos en una sola pasada. Verificar varios tokens a la vez cuesta casi lo mismo que generar uno, porque el cuello de botella es leer los pesos desde la memoria, no la aritmética. Cada token del borrador que el modelo grande acepta es velocidad gratis; el primer desacuerdo se corrige y el borrador vuelve a empezar. La salida es idéntica a la que habría producido el modelo grande solo. Lo único que cambia es el reloj.

Revisado por última vez el

Leer es el camino lento. Empieza con una lección gratis que puedes operar ahora mismo.

Empieza gratis: Predice la siguiente palabra

Gratis, sin código, sin registro.

Y después ve más a fondo: Decodificación especulativa: dos modelos, una respuesta rápida Bloqueada

Lo que la gente entiende mal

  • Cambia calidad por velocidad. Los borradores rechazados se descartan, así que el texto final coincide con lo que el modelo grande habría escrito por su cuenta.
  • El modelo chico tiene que ser casi tan bueno. Solo tiene que acertar lo bastante seguido en los tokens fáciles, que son la mayoría en prosa corriente.
  • Siempre ayuda. En texto impredecible el borrador se rechaza todo el tiempo y el trabajo extra puede terminar siendo más lento.

Dónde lo ves en productos reales

  • La razón de que un asistente alojado transmita con fluidez a un precio que el proveedor pueda pagar.
  • Herramientas de inferencia local que combinan un modelo chico y uno grande en la misma máquina.
  • Usos sensibles a la latencia como los asistentes de voz y el autocompletado de código.

Preguntas frecuentes

¿Por qué verificar varios tokens cuesta lo mismo que generar uno?
Porque la generación está limitada por el ancho de banda de memoria. Producir un token implica leer todo el modelo desde la memoria una vez, y el hardware tiene capacidad de cálculo de sobra mientras espera. Comprobar cinco tokens candidatos en esa misma pasada usa capacidad que igual estaba ociosa.
¿De dónde sale el modelo borrador?
Normalmente de un modelo mucho más chico de la misma familia, para que comparta el tokenizer y tenga costumbres parecidas. Algunos sistemas se saltan el segundo modelo y borronean con cabezas extra sobre el modelo principal o con una búsqueda sobre el texto reciente.
¿Cambia la respuesta que recibo?
No, ese es el punto. La verificación solo acepta un token del borrador cuando coincide con el que habría elegido el modelo grande, así que el speculative decoding es una optimización pura de latencia y no un intercambio de calidad.

Explicadores relacionados

Más en Velocidad, costo y control

Parte de See How AI Works, un curso interactivo gratuito, donde aprendes cómo funciona la IA moderna operándola, no viendo videos.