SevenTnewSAI 与科技新闻,深度解读

AI研究:arXiv上的多智能体决策

论文指出:一组AI智能体可能达成一致,却依然是错的

投票、选举规则和LLM裁判都以单一方向将证据映射为标签,因此它们的错误可能相互关联。一篇新论文提出改用反向贝叶斯后验对智能体进行排序,并报告其最大增益出现在智能体意见不一致之处。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-19 · 阅读需 5 分钟

论文指出:一组AI智能体可能达成一致,却依然是错的

向多个大语言模型提出同一个问题,它们未必会给出相同的回答。接下来发生什么,决定了这种多样性是有益还是有害。投票、选举规则或LLM裁判化解了分歧,推理也就到此为止。一篇于2026年9月10日提交至arXiv的论文认为,问题恰恰出在这一步。

该论文题为When Agents Disagree: Bayesian Backward Reasoning as a Label-Free Anchor for Multi-Agent Collective Decision-Making。它的矛头并非指向单个模型,而是指向位于模型池之上的那一层。

为什么投票会继承相同的错误

投票、选举规则和LLM裁判看似是化解分歧的不同机制。但作者仍将它们归为一类。三者都在做前向推理:它们获取证据,并以单一方向将其映射为标签。由这一过程产生的估计共享论文所称的同一种“证据到标签”分解方式,而建立在同一种分解方式之上的估计,其误差可能是相互关联的,而非彼此独立的。

这一区分支撑着整篇论证。如果五个智能体因互不相关的原因而出错,将它们合并可以抵消噪声。如果它们因相同的原因出错,合并后的答案会与错误一致,并且看起来很有把握。论文并未声称前向方法总是同时出错,只是说它们可能如此,而且这种失效模式仅凭输出无法察觉。

把模型反向运行

论文提出的替代方案是从另一个方向构建第二个估计。对每个样本,作者通过基于显式似然的反向贝叶斯推理构建一个反向后验。在他们的框架中,前向后验与反向后验是同一潜在后验的两种不同分解近似, , 这正是二者成对使用才有价值的原因。

推理由此转向概率层面。摘要指出,通过不同分解方式得到的估计“可能较少共享相同的错误”,这是关于误差独立性的一个假设,而非对它的证明。为将其付诸实践,作者使用Jensen-Shannon散度,按跨路径一致性对智能体进行排序, , 该指标衡量某个智能体的前向答案与反向路径的吻合程度。

利用一致性信号的三种方式

该排序支持三种聚合策略,均在DDXPlus数据集上、跨五个LLM骨干模型进行评估。

策略机制报告结果
MinJS硬选择:按一致性得分挑选智能体在全部五个骨干模型上均优于随机选择
FwdJS软重加权:保留所有智能体并调整其影响力总体上优于最强基线
LogLin对排序后的模型池进行对数线性融合在所评估的方法中表现最佳

这些增益的分布比标题数字更重要。LogLin最大的改进出现在智能体意见不一致的那部分案例上。一种只在智能体已经达成一致之处才起作用的方法会削弱自身的前提,因此这正是论文所倚重的结果。

反向锚点弱在哪里

论文报告的一个细节与该方法的简单解读相抵触。单独使用时,反向后验的准确率低于它本欲改进的那些纯前向替代方法。作者并未隐瞒这一点。他们主张,其价值在于作为锚点比纯前向替代方法更有用,因为它贡献了前向模型池自身无法产生的信息。

DDXPlus结果没有说明什么

摘要中没有任何数字。没有准确率数据,没有相对基线的领先幅度,没有置信区间,也没有各骨干模型的分项结果,而且五个LLM骨干模型从未被点名。“在所评估的方法中表现最佳”是全文最强的量化主张,而它是一种排序,而非一项测量。任何将该方法与生产流水线相比较的人,都应把它视为需要查阅全文加以核实的一处空白,而不是一个已有定论的数值。

还有一条值得深挖的线索。该方法被呈现为一种无标签锚点,意即在没有真实答案的情况下对智能体进行排序。但论文补充说,当有标注数据可用时,一个轻量的两阶段校准可以进一步优化反向锚点并改进聚合效果。因此,该技术无需标签即可工作,有标签时效果更好, , 这使得变体的选择取决于团队是否有相应的数据。

论文所指出的空白是结构性的,而非奇特的。聚合方法在合并估计时,并未将独立失效与共同失效区分开来,而一个自信的多数派可以掩盖这种差别。反向贝叶斯推理是追问一个模型池是否在关键意义上具备多样性的一种方式。这一问题能否在DDXPlus之外成立,则有待全文,以及任何尝试复现它的人来回答。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。