多令牌预测
2 published articles
大语言模型与模型Featured6 min read
大语言模型与推理
加速背后的数学原理:投机解码如何在不改变输出的情况下隐藏延迟
投机解码通过使用廉价的草稿机制提出候选token,并在单个目标模型前向传播中验证它们,从而加速自回归生成,且不改变输出。本文分析了其数学原理、主要方法(草稿模型、EAGLE-3、DFLASH、多token预测、n-gram)以及接受率对实际延迟的真正影响。
2026-07-21
基准与测试Featured3 min read
性能
Gemma 4 在 Ollama 0.31 中通过多令牌预测实现近 90% 的性能提升
Ollama 0.31 为 Apple Silicon 上的 Gemma 4 引入了多令牌预测,在编码基准测试中实现了近 90% 的令牌生成速度提升。加速来自一个自动调优的草稿模型和一个消除冗余权重读取的自定义 MLX 内核。
2026-06-29