LLM蒸馏
上下文一旦静止,LLM蒸馏便告停滞。这篇论文让它演化
上下文可以将任务偏好带入LLM训练,但一旦蒸馏进学生模型,它们便几乎不再提供监督。北京大学的Flux-OPD让上下文随学生一起移动,并用冲突项为教师修正加权。摘要报告称相较现有OPD范式有所提升,但没有给出数字。

开放式领域是LLM训练没有记分牌的地方。没有可验证的奖励可供优化,任务偏好因此抗拒被转化为监督。北京大学于2026年7月30日发布在arXiv上的一篇论文,从多数蒸馏研究跳过的一个侧面攻克这一缺口:如果上下文本身就是那个移动的部分呢?
开放式领域中的监督缺口
基于奖励的训练需要可核查的东西。开放式任务无法提供这一点,而将整体性判断压缩进单一标量,会丢掉判断中的大部分信息。早先关于LLM-as-a-Coach的工作做出了同样的诊断:开放式任务上的强化学习将基于评分标准的评估压缩为标量奖励,丢弃了评估所产生的丰富文本反馈。
Flux-OPD的作者们认为,上下文提供了第二条路径。上下文可以直接将任务偏好带入训练。问题在于它只奏效一次便告停止:一旦这些偏好被蒸馏进学生模型,上下文就几乎不再提供额外监督, , 学生已经将其吸收。这一观察促成了论文的核心思想:让上下文随学生表现演化。
隐藏在反向KL目标中的两个发现
Flux-OPD是“on-policy distillation with evolving contexts”(带演化上下文的同策略蒸馏)的缩写,建立在对反向KL目标的分解之上;反向KL是常用于度量学生分布与其教师分布偏离程度的散度。
第一个发现:学生被蒸馏向上下文条件教师的几何均值。在对数空间中,这相当于教师所表达内容的平均,因此学生落在教师之间,而非落在其中任何一个教师内部。第二个发现:目标函数还携带一个冲突项,度量这些教师彼此分歧的程度。演化的上下文将教师推向不同方向,而这一项就是度量那种分歧的计量器。
将演化上下文直接喂入训练的朴素方法,在这两个事实上都会绊倒。蒸馏目标变得不稳定,由此产生的分布相互冲突。Flux-OPD把两者都当作需要控制的条件:它稳定目标并对冲突降权,让移动的上下文能够持续教学。
Flux-OPD如何把上下文变成修正
传统知识蒸馏训练一个小型学生模型去模仿大型教师的输出。Flux-OPD改变了学生被要求模仿的对象。该方法不直接追逐上下文条件教师,而是度量上下文条件教师与无上下文教师之间的差异。这个差异就是上下文差异信号:它把上下文所贡献的部分隔离出来。
该差异被作为修正注入无上下文教师之上,后者为训练提供锚点。冲突项随后为修正的推动强度加权。当上下文条件教师存在分歧时,修正被降权;当它们一致时,修正以全力落地。一句话:让上下文移动,但只在教师一致同意的程度上推动学生。
| 目标函数中的问题 | Flux-OPD机制 |
|---|---|
| 上下文一旦蒸馏进学生,便几乎不再提供监督 | 上下文随学生表现演化 |
| 演化上下文制造不稳定的蒸馏目标 | 上下文修正被注入无上下文教师这一锚点 |
| 上下文条件教师相互冲突 | 冲突项为修正强度加权 |
结果,以及摘要略去的内容
根据摘要,开放式任务上的实验显示Flux-OPD优于现有OPD范式;摘要将这一结果框定为教师监督与演化上下文可以结合的佐证。
摘要没有给出数字,也没有点名基准。这对预印本来说很正常,但这意味着让读者判断这一论断所需的细节, , 哪些任务、什么基线、多大提升空间, , 都存在于全文而非摘要中。截至撰稿时,该预印本在HuggingFace上获得了39个赞。
蒸馏之争也让该方法有了实验室之外的利害关系。OpenAI、Meta和另外40家机构签署了一封政策信函,围绕蒸馏问题敦促针对非法提取制定有针对性的法律框架,而不是对该技术进行全面禁止。一种改变学生如何被指向教师的方法,恰好落在这场争论的中心。
尚未解决的问题:摘要没有详细描述移动目标背后的稳定化机制,没有说明当冲突项占据主导时会发生什么,也没有界定“开放式”涵盖的范围。不同的开放式领域有着截然不同的偏好结构。分解是论文中经得起时间检验的部分;冲突加权修正能否在真实训练运行中站得住脚,则是摘要没有回答的部分。
Flux-OPD的赌注说起来很简单:一个上下文的价值只在于它在无上下文教师之上额外增加了什么,而上下文之间的分歧是决定推动力度的旋钮。框定这一赌注的分解是投稿中最有力的部分。旋钮的设定仍需在摘要之外证明自己。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。