AI研究
BMW如何通过重新设计注意力机制,在16 GB GPU上实现16K上下文
宝马研究人员表明,层级全局注意力结合截断反向传播和外部KV存储,能让一块16 GB的GPU训练16K token序列,是密集注意力极限的四倍,且适配器质量没有可测量的损失。

长上下文微调存在一个硬件问题。模型权重装得下,适配器也装得下,但密集注意力状态会随着每个token的增长而膨胀,大约在2K到4K之间的某个点,GPU内存就会耗尽。BMW集团的一个团队, , 你大概不会想到会在这里看到新注意力机制的研究, , 已经在这方面钻研了一段时间。
他们最新发布的预印本(发表于2026年7月)结合了三种技术:层级全局注意力(HGA,此前同一团队提出的论文)、分段反向传播(TBPTT)以及一个分层KV存储系统,该系统将旧的键和值转移到RAM或NVMe中。结果是,这一训练流程在一块16 GB的Quadro RTX 5000上达到了16,384 token,是同一显卡上密集注意力所能处理量的四倍。而且,在密集读取测试下,其质量与密集训练的适配器相差仅0.0022 nats。
这并非一种全新最佳损失意义上的突破。这是一个实用的工程答案,回应了许多人遇到的一个问题:如何在不用购买A100的情况下,对超过几千token的序列进行微调?
HGA的不同之处
标准注意力处理每一对查询和键。这就是瓶颈所在。HGA是注意力模块的一个即插即用替代方案,它使用两级路由层级,仅为每个查询块选择一部分历史token。上下文被分割成64个token的块;每个块的紧凑摘要向量保留在VRAM中。查询对这些摘要进行评分,并选出top-k块,然后在组级别(8个token的组)打开这些块,最后只为实际注意力计算加载所选组的精确token K/V。
路由器不使用任何学习到的权重,它对现有的投影键进行评分,因此梯度会更新与密集情况相同的Q/K/V/O投影。关键洞察在于,摘要向量永远不会充当注意力值或输出token;它们仅用于引导选择。实际的注意力是基于精确token的,这在大幅缩减工作集的同时,保留了完整注意力的表达能力。
BMW将这种方法与分段反向传播结合使用:序列被分割成2,048 token的段,每个段独立运行前向和反向传播,旧KV在下一段开始前被分离到RAM或NVMe。梯度不会跨越段边界,但后面的段仍然可以通过HGA路由关注到前面的精确token。

正如作者用公式总结的那样:GPU内存大致等于模型、适配器和优化器、活动段以及路由工作集的总和,这些全部保持在有界范围内。外部历史记录随总长度线性增长,但存储在RAM或磁盘中,而非VRAM中。
效率交叉点已在2K处出现
论文中的数字清晰地展示了这一点。在1,024 token时,HGA比密集注意力慢约20%(225.54 vs 282.32 token/秒),因为路由开销尚未在更长的序列中摊平,选择过程仍然覆盖了大部分历史。但在2,048 token时,交叉点发生反转:HGA达到217.75 token/秒,而密集注意力为207.02 token/秒。这只有很小的差距,但趋势是明确的。因为HGA每个token的注意力工作量在固定的路由预算下大致保持不变,而密集注意力工作随上下文线性增长,因此差距会随着序列变长而扩大。
论文无法直接测量2K以上的情况, , 密集训练在4K时就会内存溢出, , 但逻辑是合理的,扫描数据也支持这一点。
适配器质量保持稳定
研究人员在Qwen3-8B上使用4位NF4量化训练了两个QLoRA适配器,并使用PG19数据集进行了100次优化器步骤,控制了种子和数据顺序。唯一的变量是微调期间的注意力模块。在共享的2K训练上下文中,HGA训练的适配器在密集读取测试下得分为2.7405 nats;密集训练的适配器得分为2.7383 nats。差异:0.0022 nats。原始模型得分为2.9541。微调本身提供了更大的效果, , 两个适配器都将损失降低了约0.216 nats, , 而训练期间使用HGA还是密集注意力,对最终的权重几乎没有影响。
在4K时,只有HGA训练是可行的,差异仍然很小:密集读取测试下,HGA训练的适配器为15.006 PPL,密集训练的适配器为14.966 PPL。就实际目的而言,这属于噪声水平。
检索:密集基线无退化
BMW还进行了RULER风格的passkey、多键和多值检索测试,在两个适配器上均使用密集注意力进行读取。在4,096和8,192 token时,两个适配器在passkey和多键测试中均达到100%的召回率。在多值测试中,每个适配器在96个植入值中恰好各遗漏了一个,且位于不同的单元格中。这并非弱点的信号。
论文在此处非常谨慎:他们使用密集读取,是为了隔离HGA微调是否改变了学习到的检索行为,而不是将其与路由选择的召回混合在一起。HGA本身也可以进行检索和生成,但生产级服务引擎, , 团队表示正在开发中,很可能目标是集成到vLLM或SGLang, , 仍在开发中。
一个真正的警告:因果泄露
值得指出的局限性是在扩展训练下出现的因果侧信道。因为一个块内的路由决策依赖于多个查询位置的分数,较早的token可能间接获得关于后面token的信息, , 哪些块被选择或拒绝。这个信号最初很弱,但在100到2亿训练token之后,模型开始利用它进行下一个token预测。论文对此直言不讳:该方法在该时间范围内进行微调没有问题,但你不应该用它从头开始预训练。作者提到,一个严格因果的变体正在开发中。
意义何在
BMW团队并非一个高调的AI实验室,这可能就是为什么这篇论文读起来更像一份工程备忘录,而不是一项突破性声明。这没关系。贡献是实用的:一种清晰、可复现的方法,使用2018年的16 GB显卡,将训练上下文远远推过VRAM屏障。对于任何在消费级或工作站硬件上进行微调的人来说,这立即可用。
NVMe支持的分层存储已实现,但未在本预印本中进行基准测试。GitHub上的项目仓库(项目名称为HierarchicalGlobalAttention)包含了代码。如果生产级服务引擎成为现实,并且因果泄露问题得到修补,这种方法可以与LongLoRA等方法竞争,其额外优势在于HGA使用精确token注意力,而非移位的稀疏模式。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。