llama.cpp
2 published articles
大语言模型与模型Featured6 min read
大语言模型与推理
加速背后的数学原理:投机解码如何在不改变输出的情况下隐藏延迟
投机解码通过使用廉价的草稿机制提出候选token,并在单个目标模型前向传播中验证它们,从而加速自回归生成,且不改变输出。本文分析了其数学原理、主要方法(草稿模型、EAGLE-3、DFLASH、多token预测、n-gram)以及接受率对实际延迟的真正影响。
2026-07-21
工具与框架Featured3 min read
本地 AI
Ollama 0.30 带来更快的 GPU 推理和原生 GGUF 模型支持
Ollama 0.30 将 NVIDIA 推理速度提升高达 20%,默认启用对 AMD 和 Intel 设备的 Vulkan GPU 支持,并扩展了 GGUF 模型兼容性,包括来自 Hugging Face 的微调模型以及对编码代理工具调用的支持。
2026-06-05