SevenTnewS

深度技术

跨层共享路由使稀疏注意力速度提升7倍,且不牺牲质量

CLSA每个序列仅执行一次路由,而非每层一次,在保持标记级选择性的同时大幅削减KV缓存开销。基准测试显示,在128K上下文下吞吐量提升17.1倍。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-26 · 阅读需 5 分钟

跨层共享路由使稀疏注意力速度提升7倍,且不牺牲质量
来源 : CLSA: You Only …

注意力机制仍是瓶颈。Transformer中每增加一个上下文标记,就需要存储和检索更多的键值对,解码长思维链时即便高端硬件也可能卡顿。稀疏注意力试图通过忽略缓存中不相关部分来解决此问题,但代价往往是准确性下降(块稀疏)或速度变慢(标记稀疏, , 每层挑选正确标记本身即成为新瓶颈)。

一篇新论文《CLSA: You Only Index Once》指出,这两个问题有一个共同根源:每层独立执行路由。作者提议在KV缓存共享架构中跨层共享路由索引,使昂贵的top-k选择仅执行一次,结果被复用。实验报告显示,在128K标记下解码速度提升高达7.6倍,整体吞吐量提升17.1倍,且在标准基准测试中准确率与全注意力相当。

这是一个罕见的案例:架构修复同时提升了效率与模型质量,而非在两者之间取舍。

CLSA工作原理

该方法建立在混合注意力架构之上,此类架构(如YOCO系列)跨交叉解码器层共享KV缓存。在这些模型中KV缓存已被复用,但每个交叉解码器层仍对完整缓存独立执行自身top-k路由。CLSA增加了一个共享的索引器层:它一次性计算注意力分数,挑选top-k标记,并将该相同索引传递给所有后续层。

这一单次传递取代了N次路由传递(N为交叉解码器层数)。路由本身变为了固定成本,而非随层数线性增长, , 当模型加深、上下文加长时,这一点至关重要。

关键在于保持标记级稀疏性(即保证高准确性的细粒度选择),同时将通常使其变慢的开销摊销。块稀疏方法为追求速度跳过整个内存页,但会遗漏跳过的块中相关标记。CLSA通过保持每标记粒度且仅支付一次开销来避免此问题。

示意图:CLSA:跨层共享路由
CLSA使用单个索引器层计算共享的top-k路由索引,取代了跨交叉解码器层的N次独立路由传递,实现高达7.6倍的解码加速。

速度来源

论文测量了三个推理阶段:预填充(处理提示)、KV缓存存储(缓存键值对的内存占用)和自回归解码(逐个生成标记)。三者均得到同步改善:

指标相比全注意力的提升
解码速度(128K上下文)7.6倍
整体吞吐量(128K上下文)17.1倍
KV缓存内存与top-k稀疏比例成正比(通常为5%,即全量的20%)

这些数据来自一个具有128K标记上下文窗口的模型。仅解码速度7.6倍的提升意味着:全注意力需要8秒的生成任务,CLSA仅需约1秒即可完成。吞吐量提升更大,因为模型可在减少内存占用下批处理更多请求。

准确性保持稳定

在RULER长上下文基准测试(平均五个提示模板和多种长度)中,CLSA与全注意力差距在0.5分以内。在短上下文任务(MMLU、ARC-Challenge、HellaSwag)中,差距低于0.3分。这基本属于噪声。在GSM8K(数学推理)上差距扩大至约1.2分,作者将其归因于小标记选择可能遗漏算术链中的关键数字。

即便如此,这种权衡仍非比寻常:一种方法在实现7倍速度提升的同时,在任何基准测试上损失不到1.5分,在稀疏注意力提案中极为罕见。块稀疏方法在相同任务、相近速度下通常损失3至5分。

准确性的稳定源于:路由索引仅通过索引器层的注意力分数计算一次,该索引器层与其他所有层看到相同的查询和缓存状态, , 在共享缓存架构中,某一层的top-k集合是所有层top-k集合的有力代理。

代价:兼容性限制

CLSA并非任何Transformer的即插即用替代品。它需要KV缓存共享骨干架构(YOCO,或使用交叉解码器层构建的模型)才能工作。标准的仅解码器Transformer中,各层KV缓存不同,索引将指向过时条目,因此无法从共享路由中受益。

在实践中,采用推测解码进行长上下文推理的研究者可能会发现CLSA具有互补性:草稿模型可使用相同的共享路由提高速度,而目标模型运行全注意力进行验证。论文未探讨此组合,但架构上是兼容的。

另一限制是固定的top-k选择数量。论文从128K缓存中使用k=512个标记(约0.4%密度)。对于需要极密集注意力的任务(例如扫描金融合同的每个标记进行合规检查),这种激进的稀疏性即使路由索引准确,也可能遗漏细节。作者建议索引器层可以动态调整k值,但此方向留作未来工作。

对长上下文推理的意义

论文最有力的论断是:效率与准确性的折衷并非不可避免, , 而是每层独立路由产生的人为产物。单次共享路由传递同时解决了两方面问题:准确性因标记级选择保持高位,速度因路由成本跨层摊销而提升。

在128K上下文中,17倍吞吐量提升意味着单个GPU可同时服务比全注意力多约17倍的并发长上下文请求。对于云端推理提供商而言,这直接削减每令牌成本。对于设备端开放权重模型,它缩小了运行短提示与长提示之间的内存和延迟差距。

仍有待解答的问题:CLSA在128K以上的表现(论文测试至该点)、动态k选择能否将算术推理任务的差距缩小至1.5分以下、以及该方法如何扩展到700亿参数以上模型(此时路由索引本身成为大型数据结构)。但作为针对使长上下文推理昂贵的特定瓶颈的解决方案,它以原则性方式解决了正确的问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。