推理效率
2 published articles
大语言模型与模型3 min read
AI 研究
Penelope 将其推理隐藏在一个解码器层中,以降低推理成本
Penelope 是一个用于仅解码器 Transformer 的潜在推理框架,它将循环计算局部化到一个狭窄的解码器区间内,在不显著影响准确性的情况下降低推理延迟。该论文描述了一个将推理从可见 token 转移到内部 GRU 循环的课程。
2026-08-04
人工智能4 min read
人工智能
为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题
麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。
2026-07-29