SevenTnewS

AI研究

四种人格,一个答案:为何异构推理在最难人类测试中击败了最佳AI

PoTRE将推理分解为四个并行工作的代理,然后动态调和它们的答案。它在人类终极考试上达到49.92%,超过了之前的官方最佳成绩。该方法使用的令牌比扩展的基线更少。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-24 · 阅读需 4 分钟

四种人格,一个答案:为何异构推理在最难人类测试中击败了最佳AI

人类终极考试上最准确的AI系统并不像大多数人那样思考。它像四个不同的人那样思考。其中一个寻找其他人产出的一切中的错误。一个在写任何东西之前提前规划。一个以低分辨率探索许多路径。一个只是直接回答。最后一层决定信任哪个视角,或者是否混合它们。

这个框架称为PoTRE(多拓扑推理集成),在2026年7月22日发布在arXiv上的预印本中介绍。它的核心见解是,复杂推理问题受益于认知异质性, , 多种推理模式并行运行, , 而不是将单个模型扩展到更大尺寸或给予它更多推理令牌。

这个头条数字难以忽视:在人类终极考试(HLE)上达到49.92%的准确率,这一基准设计得极其困难,涵盖了物理学、数学、法学、医学和哲学等研究生级别的问题。之前的官方最佳成绩由一个更大的同质模型取得,现在已被超越。论文没有提及先前的记录持有者,但差距足够显著,作者称之为新的最先进水平。

PoTRE还在ARC-AGI-2(一个奖励适应新颖模式的视觉推理基准)和PRBench Finance(测试领域规则下的规划和约束满足)上取得了分数。论文报告称,与大幅扩展的同质基线相比,异构架构在使用相似或更少的总推理令牌的情况下取得了更好的结果, , 这是一个直接反驳行业构建越来越大模型趋势的效率论证。

图示:PoTRE架构:四个代理和一个协调器
PoTRE并行运行四个专门的推理代理,每个产生独立答案,然后通过任务自适应聚合层选择或合成最佳结果,如预印本所述。

PoTRE如何工作:四个代理,一个协调器

该框架将推理解耦为四个专门代理:

  • 对抗性细化代理,生成初始答案,然后主动查找其中的缺陷。这不是简单的复审;该代理被训练为对自己的输出唱反调,产生其他代理可能遗漏的反驳论点和边缘情况。
  • 分层战略规划代理,首先将问题分解为子目标,然后按顺序解决每个子目标。这个代理设计用于需要长期规划的任务,其中直接答案可能跳过关键的中间推理。
  • 频谱搜索代理,以粗分辨率探索多个解决方案路径,以深度换广度。它旨在快速找到有希望的方向,而不是产生一个完善的最终答案。
  • 直接链代理,产生标准的思维链答案,作为其他代理必须超越的基线。它是最简单的代理,也是最快的。

所有四个代理的输出输入到一个任务自适应聚合层,该层有三种模式:最终候选选择(选择一个代理的答案)、语义合成(组合多个答案的最佳部分)或神经符号验证(执行逻辑一致性检查,然后选择或混合)。聚合层按任务系列进行训练,这意味着根据问题是逻辑谜题、数学证明还是财务规划练习,代理的混合会发生变化。

这不是传统意义上代理在一个循环中互相交谈的多代理模式。每个代理产生独立答案;没有跨代理讨论。多样性来自并行、解耦的推理,而不是对话。

为何这超越基准分数更重要

效率声明是论文中最具挑衅性的部分。大多数提高推理准确性的工作将推理视为一种昂贵资源:使用更多令牌、运行更多搜索、采样更多候选。PoTRE表明,推理的结构比花费的令牌数量更重要。如果四个小型、专注的模型可以在更低的令牌成本下超越一个巨型模型,那么过去三年主导AI实验室的扩展正统观念将受到打击。

存在一些注意事项。论文没有披露每个代理背后的确切基础模型,也没有提供足够详细的令牌数量比较来独立重现效率声明。而且49.92%在HLE上虽然是最先进水平,但意味着系统仍然有一半时间失败, , 这并非一个已解决的问题。但前进方向是新的。

PoTRE还提出了一个比基准更深刻的问题:如果异构推理击败了同质扩展,AI架构是否应该停止追求一个通用的推理模式,转而拥抱永久性的认知劳动分工?论文的架构不是事后组合的不同模型集成;它是从头开始设计的异构性。这一设计选择, , 而非基准分数, , 可能最终成为论文的持久贡献。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。