prédiction multi-token
2 published articles
LLMs & Inférence
Les mathématiques derrière l'accélération : comment le décodage spéculatif masque la latence sans modifier les sorties
Le décodage spéculatif accélère la génération autoregressive en proposant des jetons candidats avec un mécanisme d'ébauche peu coûteux et en les vérifiant en une seule passe avant du modèle cible, sans modifier la sortie. Cette analyse détaille les mathématiques, les principales méthodes (modèles d'ébauche, EAGLE-3, DFLASH, prédiction multi-jetons, n-grammes), et ce que les taux d'acceptation signifient réellement pour la latence en conditions réelles.
2026-07-21
Performances
Gemma 4 tourne presque 90 % plus vite dans Ollama 0.31 avec la prédiction multi-tokens
Ollama 0.31 introduit la prédiction multi-tokens pour Gemma 4 sur Apple Silicon, atteignant près de 90 % de génération de tokens plus rapide sur les benchmarks de codage. L'accélération provient d'un modèle de brouillon auto-ajusté et d'un noyau MLX personnalisé qui élimine les lectures redondantes de poids.
2026-06-29