1 published article
AI研究
宝马研究人员表明,层级全局注意力结合截断反向传播和外部KV存储,能让一块16 GB的GPU训练16K token序列,是密集注意力极限的四倍,且适配器质量没有可测量的损失。
2026-07-20