llama.cpp
2 published articles
LLMs & Inférence
Les mathématiques derrière l'accélération : comment le décodage spéculatif masque la latence sans modifier les sorties
Le décodage spéculatif accélère la génération autoregressive en proposant des jetons candidats avec un mécanisme d'ébauche peu coûteux et en les vérifiant en une seule passe avant du modèle cible, sans modifier la sortie. Cette analyse détaille les mathématiques, les principales méthodes (modèles d'ébauche, EAGLE-3, DFLASH, prédiction multi-jetons, n-grammes), et ce que les taux d'acceptation signifient réellement pour la latence en conditions réelles.
2026-07-21
IA locale
Ollama 0.30 apporte une inférence GPU plus rapide et une prise en charge native des modèles GGUF
Ollama 0.30 booste l'inférence NVIDIA jusqu'à 20 %, active la prise en charge GPU Vulkan par défaut pour les appareils AMD et Intel, et étend la compatibilité des modèles GGUF, y compris les modèles affinés de Hugging Face et la prise en charge des appels d'outils avec des agents de codage.
2026-06-05