llama.cpp
2 published articles
LLMs e Inferencia
Las matemáticas detrás de la aceleración: cómo la decodificación especulativa oculta la latencia sin cambiar las salidas
La decodificación especulativa acelera la generación autorregresiva al proponer tokens candidatos con un mecanismo de draft económico y verificarlos en un solo pase hacia adelante del modelo objetivo, sin cambiar la salida. Este análisis desglosa las matemáticas, los principales métodos (modelos draft, EAGLE-3, DFLASH, Predicción Multi-Token, n-gramas) y lo que realmente significan las tasas de aceptación para la latencia en el mundo real.
2026-07-21
IA local
Ollama 0.30 trae inferencia GPU más rápida y soporte nativo de modelos GGUF
Ollama 0.30 aumenta la inferencia en NVIDIA hasta en un 20%, habilita el soporte GPU Vulkan por defecto para dispositivos AMD e Intel, y amplía la compatibilidad con modelos GGUF, incluidos modelos ajustados de Hugging Face y soporte para llamadas a herramientas con agentes de codificación.
2026-06-05