深度技术
跨层共享路由使稀疏注意力速度提升7倍,且不牺牲质量
CLSA每个序列仅执行一次路由,而非每层一次,在保持标记级选择性的同时大幅削减KV缓存开销。基准测试显示,在128K上下文下吞吐量提升17.1倍。

注意力机制仍是瓶颈。Transformer中每增加一个上下文标记,就需要存储和检索更多的键值对,解码长思维链时即便高端硬件也可能卡顿。稀疏注意力试图通过忽略缓存中不相关部分来解决此问题,但代价往往是准确性下降(块稀疏)或速度变慢(标记稀疏, , 每层挑选正确标记本身即成为新瓶颈)。
一篇新论文《CLSA: You Only Index Once》指出,这两个问题有一个共同根源:每层独立执行路由。作者提议在KV缓存共享架构中跨层共享路由索引,使昂贵的top-k选择仅执行一次,结果被复用。实验报告显示,在128K标记下解码速度提升高达7.6倍,整体吞吐量提升17.1倍,且在标准基准测试中准确率与全注意力相当。
这是一个罕见的案例:架构修复同时提升了效率与模型质量,而非在两者之间取舍。
CLSA工作原理
该方法建立在混合注意力架构之上,此类架构(如YOCO系列)跨交叉解码器层共享KV缓存。在这些模型中KV缓存已被复用,但每个交叉解码器层仍对完整缓存独立执行自身top-k路由。CLSA增加了一个共享的索引器层:它一次性计算注意力分数,挑选top-k标记,并将该相同索引传递给所有后续层。
这一单次传递取代了N次路由传递(N为交叉解码器层数)。路由本身变为了固定成本,而非随层数线性增长, , 当模型加深、上下文加长时,这一点至关重要。
关键在于保持标记级稀疏性(即保证高准确性的细粒度选择),同时将通常使其变慢的开销摊销。块稀疏方法为追求速度跳过整个内存页,但会遗漏跳过的块中相关标记。CLSA通过保持每标记粒度且仅支付一次开销来避免此问题。

速度来源
论文测量了三个推理阶段:预填充(处理提示)、KV缓存存储(缓存键值对的内存占用)和自回归解码(逐个生成标记)。三者均得到同步改善:
| 指标 | 相比全注意力的提升 |
|---|---|
| 解码速度(128K上下文) | 7.6倍 |
| 整体吞吐量(128K上下文) | 17.1倍 |
| KV缓存内存 | 与top-k稀疏比例成正比(通常为5%,即全量的20%) |
这些数据来自一个具有128K标记上下文窗口的模型。仅解码速度7.6倍的提升意味着:全注意力需要8秒的生成任务,CLSA仅需约1秒即可完成。吞吐量提升更大,因为模型可在减少内存占用下批处理更多请求。
准确性保持稳定
在RULER长上下文基准测试(平均五个提示模板和多种长度)中,CLSA与全注意力差距在0.5分以内。在短上下文任务(MMLU、ARC-Challenge、HellaSwag)中,差距低于0.3分。这基本属于噪声。在GSM8K(数学推理)上差距扩大至约1.2分,作者将其归因于小标记选择可能遗漏算术链中的关键数字。
即便如此,这种权衡仍非比寻常:一种方法在实现7倍速度提升的同时,在任何基准测试上损失不到1.5分,在稀疏注意力提案中极为罕见。块稀疏方法在相同任务、相近速度下通常损失3至5分。
准确性的稳定源于:路由索引仅通过索引器层的注意力分数计算一次,该索引器层与其他所有层看到相同的查询和缓存状态, , 在共享缓存架构中,某一层的top-k集合是所有层top-k集合的有力代理。
代价:兼容性限制
CLSA并非任何Transformer的即插即用替代品。它需要KV缓存共享骨干架构(YOCO,或使用交叉解码器层构建的模型)才能工作。标准的仅解码器Transformer中,各层KV缓存不同,索引将指向过时条目,因此无法从共享路由中受益。
在实践中,采用推测解码进行长上下文推理的研究者可能会发现CLSA具有互补性:草稿模型可使用相同的共享路由提高速度,而目标模型运行全注意力进行验证。论文未探讨此组合,但架构上是兼容的。
另一限制是固定的top-k选择数量。论文从128K缓存中使用k=512个标记(约0.4%密度)。对于需要极密集注意力的任务(例如扫描金融合同的每个标记进行合规检查),这种激进的稀疏性即使路由索引准确,也可能遗漏细节。作者建议索引器层可以动态调整k值,但此方向留作未来工作。
对长上下文推理的意义
论文最有力的论断是:效率与准确性的折衷并非不可避免, , 而是每层独立路由产生的人为产物。单次共享路由传递同时解决了两方面问题:准确性因标记级选择保持高位,速度因路由成本跨层摊销而提升。
在128K上下文中,17倍吞吐量提升意味着单个GPU可同时服务比全注意力多约17倍的并发长上下文请求。对于云端推理提供商而言,这直接削减每令牌成本。对于设备端开放权重模型,它缩小了运行短提示与长提示之间的内存和延迟差距。
仍有待解答的问题:CLSA在128K以上的表现(论文测试至该点)、动态k选择能否将算术推理任务的差距缩小至1.5分以下、以及该方法如何扩展到700亿参数以上模型(此时路由索引本身成为大型数据结构)。但作为针对使长上下文推理昂贵的特定瓶颈的解决方案,它以原则性方式解决了正确的问题。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。