思维链
6 published articles
实验室与研究4 min read
AI 研究
更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复
一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。
2026-08-18
实验室与研究4 min read
自动驾驶研究
XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI
XCoT-VLA用2至6个可执行令牌取代视觉-语言-动作驾驶模型中的描述式思维链,在满足实时规划预算的同时降低轨迹误差。代价是:压缩良好的推理不再像人类解释。
2026-08-18
大语言模型与模型4 min read
AI 研究
思维链中的泡沫:新基准揭示大语言模型在有效但无用的推理上浪费标记
大语言模型通常生成正确但塞满不必要步骤的推理链。一个新的诊断基准和压缩方法表明,当前评估器完全忽略了这种低效性,而人类编写的推理步骤中可能有半数可被压缩。
2026-07-31
视觉与扩散4 min read
AI 研究
VideoCoCo 通过在 Blender 代码中思考,修复 AI 视频错乱的物理
VideoCoCo 将可执行的 Blender 代码视为思维链:编码代理编写场景脚本,模拟器将其演绎出来,视频引擎让结果达到照片级逼真。这种分工针对文生视频的物理问题,并在 PhyGenBench 和 VBench-2.0 上取得了最佳平均分。
2026-07-30
人工智能4 min read
人工智能
为什么你的AI思维链在浪费令牌,以及最优停止如何解决这个问题
麻省理工学院研究人员提出OS-Pruner,这是一个插件,能在后续计算不值得令牌成本时动态停止思维链推理。测试显示,在最小化准确率牺牲的情况下,长度减少20-60%。
2026-07-29
大语言模型与模型4 min read
AI安全研究
AI模型无法停止“边想边说”。这对安全性而言既是好消息,也是噩梦。
Claude Sonnet 4.5 仅有 2.7% 的时间能控制其思维链,而最终输出的可控性却高达 61.9%。这一差距引发了对思维链监控作为安全机制稳健性的开放性疑问,而无人知晓其存在的原因。
2026-03-09