推测解码
4 published articles
大语言模型与模型Featured6 min read
大语言模型与推理
加速背后的数学原理:投机解码如何在不改变输出的情况下隐藏延迟
投机解码通过使用廉价的草稿机制提出候选token,并在单个目标模型前向传播中验证它们,从而加速自回归生成,且不改变输出。本文分析了其数学原理、主要方法(草稿模型、EAGLE-3、DFLASH、多token预测、n-gram)以及接受率对实际延迟的真正影响。
2026-07-21
大语言模型与模型4 min read
系统优化
DSpark 揭示:快速 AI 推理是调度问题,而非模型技巧
DeepSeek 的 DSpark 论文揭示,简单的推测解码在高并发下会降低吞吐量。其解决方案, , 置信度调度的验证, , 根据每个请求调整块长度,并改变了服务性能的帕累托前沿。
2026-07-12
DeepSeek-V3Featured6 min read
半自回归推测性解码投入生产
DeepSeek的DSpark修复了制约快速AI推理的两大问题
DeepSeek的新推测性解码框架解决了限制并行草案器的两大瓶颈:后缀衰减和浪费性验证。通过将半自回归架构与置信度调度器相结合,在目标模型验证之前修剪低价值令牌,DSpark在生产环境中实现了60%-85%的生成速度提升。
2026-07-08
基准与测试Featured3 min read
性能
Gemma 4 在 Ollama 0.31 中通过多令牌预测实现近 90% 的性能提升
Ollama 0.31 为 Apple Silicon 上的 Gemma 4 引入了多令牌预测,在编码基准测试中实现了近 90% 的令牌生成速度提升。加速来自一个自动调优的草稿模型和一个消除冗余权重读取的自定义 MLX 内核。
2026-06-29