人工智能研究
为什么令牌对数概率不是监控AI推理模型的正确信号
Novelis Research表明,令牌对数概率作为量化推理模型的解码器监控器存在缺陷,无法察觉自信循环。他们引入了一种校准的e-CUSUM控制器,结合了不确定性和重复信号,在DeepSeek-R1-Distill-Qwen-1.5B上的GSM8K任务中实现了选择性。

低位量化使小型推理模型的部署成本低廉,但会损害其思维链推理能力。一个自然的想法是监控解码器,并在生成出现问题时进行干预。但Novelis Research的一项新研究认为,最明显的可观测指标, , 令牌对数概率, , 并不适合作为此类监控器的基础。
为什么对数概率会失效
由El Hassane Ettifouri及其同事领导的研究表明,将令牌对数概率中心化于模型自身的采样定律下,可以产生一个有效的鞅。但这个鞅衡量的是采样的自一致性,而非轨迹的健康状况。当模型进入一个自信的重复循环时,令牌概率接近1,对数概率接近0,熵也接近0。就在模型自信地出错时,监控器却保持沉默。
在一项受控的合理性检查中,对数概率鞅对63%的健康流发出了警报,这是一个高误报率,使其无法作为检测器,然而它仅检测到了42%的自信循环。校准后的e-CUSUM检测器则捕获了100%的自信循环和“漂移后崩溃”的模式,且对健康文本没有误报。
校准后的e-CUSUM替代方案
研究人员构建了一个免训练的解码器控制器,由两部分组成。首先,是一个退化感知警报分数,融合了令牌不确定性与明确的逐字重复信号。其次,是一个基于校准e过程的序列检测器,将原始乘积过程转换为以CUSUM为下限的统计量,用于变化检测。
校准起到了决定性作用。一个未校准的基线(μ0=0.15)导致检测器对93-95%的生成内容触发警报,使其变得毫无用处。将μ0设置为健康FP16轨迹的第90百分位数(0.41)后,它变成了一个选择性检测器,精度达到约0.6,φ值约0.3,而坏轨迹的基础率为0.38。
关于GSM8K的实证发现
使用DeepSeek-R1-Distill-Qwen-1.5B对100个GSM8K测试问题进行研究后发现,逐字循环很少见,即使在失败的轨迹上最多也只占令牌的4%。主要的失败模式是未终止:高达49%的错误INT4轨迹耗尽了2048令牌的预算。这与Lotfi等人(2026年)的发现一致,即量化模型在高熵位置过度生成了诸如“wait”和“but”之类的标记。
该控制器减少了逐字退化信号。INT4的平均连续重复率从0.010降至0.003,严重循环从1%降至0%,截断率从22%降至19%。准确率朝着正确方向移动,INT4提高了6个百分点,FP16提高了4个百分点,但差异在统计上并不显著(INT4的McNemar p=0.18,n=100)。令牌成本增加了28%,而挂钟时间增加了30%。
方法论意义
该研究的持久贡献在于方法论:清晰阐述了为何一个有吸引力的可观测指标并不充分,并提供了一个经过校准且诚实评估的替代方案。原始乘积过程在条件零假设下确实具有真正的Ville式时间一致误报保证,但已部署的CUSUM统计量是通过经验操作点报告的,而非作为严格的数学保证。
研究人员发布了所有代码、校准工具和轨迹,以支持更大型的研究,这些研究最终需要解答准确率问题。他们建议未来的工作聚焦于更难、更频繁出现未终止和漂移的基准测试,以及进行消融实验,以分离警报分数中仅熵信号和仅重复信号的贡献。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。