predicción multi-token
2 published articles
LLMs e Inferencia
Las matemáticas detrás de la aceleración: cómo la decodificación especulativa oculta la latencia sin cambiar las salidas
La decodificación especulativa acelera la generación autorregresiva al proponer tokens candidatos con un mecanismo de draft económico y verificarlos en un solo pase hacia adelante del modelo objetivo, sin cambiar la salida. Este análisis desglosa las matemáticas, los principales métodos (modelos draft, EAGLE-3, DFLASH, Predicción Multi-Token, n-gramas) y lo que realmente significan las tasas de aceptación para la latencia en el mundo real.
2026-07-21
Rendimiento
Gemma 4 funciona casi un 90 % más rápido en Ollama 0.31 con predicción de múltiples tokens
Ollama 0.31 introduce la predicción de múltiples tokens para Gemma 4 en Apple Silicon, logrando una generación de tokens casi un 90 % más rápida en evaluaciones de codificación. La aceleración proviene de un modelo borrador ajustado automáticamente y un kernel MLX personalizado que elimina lecturas redundantes de pesos.
2026-06-29