LLMs e Inferencia
Las matemáticas detrás de la aceleración: cómo la decodificación especulativa oculta la latencia sin cambiar las salidas
La decodificación especulativa acelera la generación autorregresiva al proponer tokens candidatos con un mecanismo de draft económico y verificarlos en un solo pase hacia adelante del modelo objetivo, sin cambiar la salida. Este análisis desglosa las matemáticas, los principales métodos (modelos draft, EAGLE-3, DFLASH, Predicción Multi-Token, n-gramas) y lo que realmente significan las tasas de aceptación para la latencia en el mundo real.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-21 · Última actualización: 2026-07-30 · 6 min de lectura

La mayoría de los modelos de lenguaje grandes generan texto un token a la vez. Cada nuevo token se predice a partir de todos los anteriores, lo que implica un pase hacia adelante por token. En las GPU modernas, el cuello de botella rara vez es el cómputo, sino el ancho de banda de la memoria. Cada pase hacia adelante lee los pesos completos del modelo desde la memoria, y para un solo token, esto es mucha lectura para muy poca escritura. La decodificación especulativa cambia la proporción: permite que el modelo adivine varios tokens por adelantado y luego verifica todo el lote en un solo pase. Cuando las adivinanzas son correctas, el rendimiento efectivo aumenta. Cuando son incorrectas, no se pierde nada: el muestreo por rechazo garantiza que la distribución de salida permanezca idéntica a la decodificación estándar.
La técnica fue formalizada en 2022, 2023 por investigadores de Google DeepMind, y desde entonces se ha convertido en una característica estándar en los motores de inferencia local. La compensación clave está entre el costo del draft y la tasa de aceptación. Un drafter barato que adivina mal puede ralentizar las cosas. Un drafter caro que adivina brillantemente aún puede perder en tiempo real si la sobrecarga supera los pases ahorrados.
La garantía del muestreo por rechazo
El paso de verificación es lo que hace que la decodificación especulativa sea matemáticamente sin pérdidas. Después de que un modelo draft produce una secuencia de tokens candidatos, el modelo objetivo evalúa cada uno contra su propia distribución condicional. Sea p(x) la probabilidad que el objetivo asigna al token x y q(x) la probabilidad que asignó el drafter. El token se acepta con probabilidad min(1, p(x) / q(x)). Cuando el objetivo es al menos tan confiado como el drafter, el token siempre pasa. Cuando es menos confiado, la aceptación escala con el acuerdo entre las dos distribuciones. En el primer rechazo, la verificación se detiene. Ese token se vuelve a muestrear de la distribución residual, y cada token draft posterior se descarta porque se condicionó en un prefijo que ya no es válido.
El resultado: la salida es estadísticamente idéntica a lo que habría producido la decodificación autorregresiva estándar. No aproximadamente idéntica, idéntica, traza por traza. La única diferencia es la cantidad de pases necesarios para llegar allí.

Rendimiento esperado y la fórmula de aceleración
Si cada token draft se acepta con probabilidad α y el drafter propone hasta γ tokens por paso, el número esperado de tokens por pase de verificación es (1 − α^(γ+1)) / (1 − α). Para γ = 4 y α = 0.7, esto equivale aproximadamente a 2.8 tokens por pase, un posible aumento de rendimiento de 2.8× sobre la decodificación estándar antes de considerar el costo del draft. Con α = 0.9, el rendimiento esperado se acerca al γ+1 completo.
La aceleración realizada en tiempo real es menor porque el draft no es gratuito. Sea c el costo de un paso de draft en relación con un pase hacia adelante del modelo objetivo. La fórmula se convierte en:
aceleración = (1 − α^(γ+1)) / ((1 − α) × (γc + 1))
Aquí es donde divergen los diferentes métodos de decodificación especulativa. Una búsqueda de n-gramas pura tiene un c casi cero pero una α modesta. Un drafter neuronal como EAGLE-3 tiene un c más alto pero una α más alta. Cuál gana depende de la carga de trabajo, el hardware y la longitud de la secuencia.
Las principales estrategias de draft: cinco enfoques en la práctica
El panorama se divide en dos grandes familias: drafters basados en modelos y métodos basados en patrones. Los drafters basados en modelos utilizan una segunda red neuronal para aproximar las predicciones del modelo objetivo. La forma más simple es un modelo draft independiente, un modelo de lenguaje mucho más pequeño entrenado para imitar la distribución del objetivo. El costo principal es que debe cargarse junto con el modelo objetivo, duplicando los requisitos de memoria solo para el drafter. EAGLE-3 adjunta un módulo de predicción ligero que opera sobre las activaciones ocultas del modelo objetivo, reduciendo significativamente la sobrecarga. DFLASH va más allá al usar un modelo de difusión por bloques que predice un bloque completo de tokens futuros en un solo pase hacia adelante, y luego verifica el bloque como una unidad. La Predicción Multi-Token (MTP) agrega cabezales de predicción auxiliares al propio modelo objetivo durante el entrenamiento, por lo que el draft proviene del mismo pase hacia adelante que la predicción principal, sin modelo separado ni sobrecarga de memoria. Los métodos basados en patrones, como los cachés de n-gramas y las búsquedas de n-gramas, explotan la repetición ya presente en el texto generado. Cuestan casi nada de ejecutar porque simplemente buscan en el contexto existente secuencias coincidentes. En implementaciones como llama.cpp, el decodificador intenta primero el draft basado en patrones y recurre a un drafter neuronal solo cuando no se encuentra una continuación adecuada.
Lo que realmente significan los números de aceptación para los usuarios
Afirmaciones como una mejora del rendimiento del 30 al 70% con MTP, o hasta 6× con DFLASH, dependen en gran medida de las características de la carga de trabajo. Continuaciones predecibles, iteración sobre código, modelos de razonamiento que repiten pensamientos anteriores o resúmenes que reflejan su fuente, producen ejecuciones aceptadas largas y una alta aceleración efectiva. El texto corto, altamente novedoso y de forma libre produce bajas tasas de aceptación donde la sobrecarga del draft puede superar el beneficio. En Gemma 4, las ganancias de MTP pueden alcanzar aproximadamente 3× bajo cargas de trabajo favorables. En Qwen3 27B ejecutándose en dos GPU RTX 5090, MTP pasa de 51 a 117 tokens por segundo, una mejora de aproximadamente 2.3×. DFLASH afirma picos aún más altos, particularmente en Qwen3.6, Gemma 4 y Kimi K2.5, pero la misma dependencia de la estructura del bloque se mantiene: el tamaño del bloque está fijado por el modelo draft entrenado, lo que limita cuán dinámicamente se puede ajustar la longitud del draft en comparación con los métodos token por token.
El verdadero cuello de botella sigue siendo el ancho de banda de la memoria, pero el juego está cambiando
La decodificación especulativa no reduce la cantidad de cómputo que realiza el modelo objetivo. Cambia la proporción de lecturas de pesos a tokens generados. Es por eso que ayuda más en cargas de trabajo limitadas por el ancho de banda de la memoria, que es la mayoría de la inferencia local en la actualidad. A medida que el hardware se vuelve más rápido para mover pesos, o a medida que avanzan las técnicas de compresión del caché KV, el valor relativo de la decodificación especulativa puede cambiar. Pero para la generación actual de GPU de consumo y Apple Silicon, es uno de los pocos beneficios gratuitos en la inferencia de LLM: menor latencia, salida idéntica, costo de calidad cero.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.