AI 研究
思维链中的泡沫:新基准揭示大语言模型在有效但无用的推理上浪费标记
大语言模型通常生成正确但塞满不必要步骤的推理链。一个新的诊断基准和压缩方法表明,当前评估器完全忽略了这种低效性,而人类编写的推理步骤中可能有半数可被压缩。

思维链提示已成为从大语言模型获取多步推理的标准方法。将问题分解为中间步骤,模型的准确性就会提升。但来自KT公司和浦项科技大学的研究论文认为,该领域一直优化的是错误的信号。
这篇题为《有效≠必要:诊断思维链中的潜在低效》的论文,指出了当前推理评估中的一个盲点:那些检查正确性和逻辑有效性的评估器,往往给事实正确但功能无用的步骤打高分。作者称此为信息泡沫,并认为它占标准思维链轨迹的很大一部分。
研究人员引入了RIV-GSM8K,这是一个从GSM8K数学数据集衍生出的诊断基准。RIV-GSM8K向推理链注入了五种不同类型的低效性:简单重复(重复一个步骤)、改述(改写同一想法)、分解(将一个步骤拆分为多个微步骤)、循环推理(重复陈述而无进展)以及无关内容(数学上有效但与解决方案无关的离题)。
当论文测试包括ReasonEval、ThinkPRM和Qwen2.5-Math-PRM在内的最先进评估器,针对RIV-GSM8K时,结果令人震惊。现有模型保留了70%到97%的注入低效步骤,即未能标记明显冗余或循环的步骤。ReasonEval尽管有明确的冗余评分,仍保留了约70%的简单重复。即使是参数达720亿的Qwen2.5-Math-PRM也保留了83%的此类步骤。
为弥补这一差距,论文提出了CAID(上下文感知信息密度),这是一种无需训练的指标,结合了四种信号:局部相似性(冗余)、全局目标对齐(相关性)、信息密度(冗长)和语义增量(逻辑进展)。CAID总共仅使用1.46亿个参数,即一个GPT-2 Small模型用于密度估计和一个MiniLM编码器用于嵌入,比其超越的监督评估器小多个数量级。
在RIV-GSM8K上,CAID实现了几乎完美地检测重复(保留率0.0%)和改述(保留率1.7%)。它还检测出了循环推理(保留率1.9%)和分解(保留率20%),而这些是基线模型难以处理的。更引人注目的是,CAID标记了原始人类编写的GSM8K步骤中大约一半为可压缩, , 并非可删除,而是可以更紧凑地表达。其中仅1.5%的标记步骤被标为直接删除;其余98.5%被分配了合并操作,表明推理本身是合理的,但语言表达低效。
研究人员通过构建一个名为PACE(剪枝与压缩提高效率)的压缩管道,验证了CAID的诊断能力。PACE应用CAID信号在生成后压缩推理链。在GSM8K、StrategyQA和ARC-Challenge上,PACE将标记消耗减少了31%到53%,同时保持或提高了准确性。在ARC-Challenge上,准确性实际上上升了0.94个百分点,同时标记减少了43.6%。
控制实验将PACE的效果与简单剪枝区分开来。随机从GSM8K链中删除50%的步骤导致准确性从82%骤降至66.7%。即使仅删除最后一步也会损害性能。相比之下,PACE的选择性压缩在保持81.12%的准确性的同时,削减了31%的标记。当研究人员在相同的PACE管道中用强PRM评估器替换CAID时,这些有效性导向的模型能保持准确性,但仅实现了6%到7%的标记压缩,远低于CAID的31%。
论文中一个更令人意外的发现是,被视为最优的人类编写的推理步骤(黄金步骤)可能本身就有缺陷。CAID的合并分配表明,标准数据集包含潜在的低效性:冗长的重述、过度解释的中间计算以及可以更简洁表达的分裂逻辑。研究人员认为,这些可压缩内容并不否定推理的有效性,但确实引发了对训练数据质量以及当前评估实践中内嵌的效率假设的疑问。
作者承认有局限性。PACE在生成后精炼管道中运行,这意味着它不会减少初始推理阶段的延迟。它更适合离线数据集构建或上下文压缩,而非实时加速。合并步骤依赖于一个具有安全约束的LLM改写器;较小的模型可能过度简化复杂推理。而且论文的领域重点在算术、常识和科学推理上,意味着在开放式任务(如创造性写作)中,效率的概念可能有所不同,因为冗长在那里有作用。
尽管如此,该工作有力地证明了推理评估一直在打一场错误的战争。模型可以产生逻辑上有效的链,但其中塞满了事实正确的不必要步骤。当前为正确性优化的评估器会奖励这种填充。CAID和RIV-GSM8K提供了一条路径,引领指标不仅衡量一个步骤是否正确,还衡量它是否必要。
该论文由KT公司的Daeyeop Lee和浦项科技大学的Hwanjo Yu领导,并得到了韩国科技信息通信部IITP基金的资助。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。