decodificación especulativa
4 published articles
LLMs e Inferencia
Las matemáticas detrás de la aceleración: cómo la decodificación especulativa oculta la latencia sin cambiar las salidas
La decodificación especulativa acelera la generación autorregresiva al proponer tokens candidatos con un mecanismo de draft económico y verificarlos en un solo pase hacia adelante del modelo objetivo, sin cambiar la salida. Este análisis desglosa las matemáticas, los principales métodos (modelos draft, EAGLE-3, DFLASH, Predicción Multi-Token, n-gramas) y lo que realmente significan las tasas de aceptación para la latencia en el mundo real.
2026-07-21
Optimización de sistemas
DSpark demuestra por qué la inferencia rápida de IA es un problema de planificación, no un truco de modelo
El artículo de DSpark de DeepSeek revela que la decodificación especulativa ingenua degrada el rendimiento bajo alta concurrencia. Su solución, la verificación programada por confianza, adapta la longitud del bloque por solicitud y desplaza la frontera de Pareto del rendimiento del servicio.
2026-07-12
Decodificación especulativa semi-autorregresiva llega a producción
El DSpark de DeepSeek acaba de solucionar las dos cosas que frenaban una inferencia de IA más rápida
Un nuevo marco de decodificación especulativa de DeepSeek aborda los dos cuellos de botella que han limitado a los generadores paralelos: la decadencia de sufijos y la verificación ineficiente. DSpark logra velocidades de generación entre un 60 y un 85% más rápidas en producción al acoplar una arquitectura semi-autorregresiva con un programador de programación basado en confianza que elimina tokens de bajo valor antes de que el modelo objetivo los verifique.
2026-07-08
Rendimiento
Gemma 4 funciona casi un 90 % más rápido en Ollama 0.31 con predicción de múltiples tokens
Ollama 0.31 introduce la predicción de múltiples tokens para Gemma 4 en Apple Silicon, logrando una generación de tokens casi un 90 % más rápida en evaluaciones de codificación. La aceleración proviene de un modelo borrador ajustado automáticamente y un kernel MLX personalizado que elimina lecturas redundantes de pesos.
2026-06-29