研究摘要
结构化推理瓶颈超越提示魔法:LLM归纳任务中的新突破
一种名为“沙漏推理”(Hourglass reasoning)的新方法在归纳、演绎和实施阶段之间强制进行严格的上下文隔离,仅传递一个压缩的符号规则。在ARC-AGI-2上,它将最佳5次的准确率比迭代优化提高了多达14个百分点;在ChipBench Verilog综合任务中,使用GPT-5.5几乎将准确率翻倍。消融实验证实,拓扑结构本身驱动了改进。

几个月来,越来越多的论文警告说,LLM的自我改进是脆弱的, , 要求模型在单个上下文内批判和修正自身输出可能会降低性能。北京大学一位研究员的一篇新预印本提供了一个结构性修复:用角色隔离的阶段替换单一的上下文窗口,这些阶段仅通过一个压缩的符号状态连接。
该方法被称为“沙漏推理”(Hourglass reasoning),将冻结的LLM视为一个元构造函数,为每个任务构建一个符号编码器-解码器。一个归纳模块将少量示例压缩成一个模式φ和一个瞬态支架z。一个演绎模块推导出一个转换规则T并丢弃z。然后,一个实现者将(φ, T)编译成可执行的工件。如果出现错误,一个改进者会修正(φ, T),而不是输出,并从头开始重新生成。只有(φ, T)跨越阶段边界。
在三个基准测试, , 视觉抽象、硬件合成和文本规则归纳中,相同的领域无关流程产生了一致的提升。在ARC-AGI-2上,使用GPT-5.5时,沙漏推理将pass@5准确率提高了14个百分点(从62.8%到76.8%),使用Gemini 3.1 Pro时提高了近10个百分点(从76.9%到86.7%)。在ChipBench Verilog综合子任务中,它几乎将GPT-5.5的准确率从31%翻倍至58%。
为什么天真自我改进失败
标准的自我改进在一个单一的、密集的上下文中运行:原始示例、当前代码、错误反馈和修复指令都共存且未分区。模型倾向于关注低层感知细节,而不是抽象潜在规则。当执行反馈到达时,它直接修补代码,为示例特定坐标硬编码if-else分支,而不是修正一个显式规则。
论文在ARC-AGI-2上的消融研究隔离了决定因素。当相同的结构化中间结果在单一上下文窗口内生成时(结构化自我改进),准确率崩跌至甚至低于无约束的自我改进基线,在Gemini 3.1 Pro上从76.9%降至59.9%。阶段之间的物理上下文隔离是必要的。
去除所有辅助提示(沙漏-朴素)或移除φ和T的所有格式化约束(沙漏-非结构化)几乎不影响性能。从改进者的输入中移除φ和T(仅代码)仅导致微小下降。只要保留角色隔离的拓扑结构,提升就会持续。
令人惊讶的结果
该方法最具争议性的结果来自BBEH-Linguini,一个语言学奥林匹克基准测试,在该测试中,先前的工作显示显式规则言语化可能会损害性能。自我改进严重降低了两个模型的准确率:GPT-5.5从67.4%降至27.8%,Gemini 3.1 Pro从68.1%降至33.3%。沙漏推理在GPT-5.5上大致恢复原始提示基线(63.1%),在Gemini 3.1 Pro上以pass@5超过了基线近12个百分点(79.9%)。
作者将自我改进的崩溃归因于两个相互交织的机制:有损压缩, , 每次迭代的规则言语化都会加剧信息损失;以及上下文纠缠, , 规则生成、执行和反馈共存于一个上下文,使模型容易受到注意力分散和不一致规则应用的影响。沙漏推理通过强加符号状态(φ, T)是唯一持久的信息通道来缓解两者。
隔离的成本
角色隔离伴随着代币成本溢价。在GPT-5.5上,一次沙漏推理运行平均需要61,911个代币,涉及3.7次API调用,而单一的自我改进基线为19,594个代币,涉及1.4次调用,大约增加了3倍。在Gemini上,差距较小:122,007个代币(4.4次调用)对比61,426个代币(1.7次调用),大约增加2倍。论文指出其主要比较并非计算量匹配,但提升的幅度表明,对于高风险推理任务,这种权衡可能是可接受的。
下一步:元策略
当前的沙漏推理实现是短暂的:一旦任务解决,符号状态就被丢弃,并为下一个任务从头重新推导。论文推测了“元沙漏”(Meta-Hourglass),它可以在任务之间积累可重用的元策略,类似于人类气象学家在面对新颖时间序列时,无论领域如何,都会调用相同的心理常规(寻找周期性、分割成体系、识别异常)。
这些元策略并不规定精确操作,也不保证正确性,但它们系统地提升分析水平,使之超越任意性。
这种元推理是否可以被学习仍有待探索。但论文的核心发现, , 即信息流的拓扑结构而非用于表达它的语言驱动了冻结LLM中的归纳推理, , 指明了一条关于结构设计而非更大模型或更花哨提示的道路。
- 来源 : Hourglass reasoning GitHub repository — 2026-07-06
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。