人工智能研究
SoftReason弥合了阻止神经网络真正推理的梯度鸿沟
SoftReason是一种用于演绎推理的完全可微的神经-软-符号架构。它消除了感知与推理之间的梯度障碍,实现了在高维感知数据和知识图谱三元组上的端到端训练。在KVQA上测试,展示了软推理如何统一基础推理、证据注入和闭包。

感知与推理之间的差距一直是人工智能中一道难以逾越的障碍。神经网络可以学会识别图像中的物体,但当需要将这些观察结果串联成逻辑结论时,它会遇到一个离散障碍:分类器的输出是一个概率,而符号推理器的输入是一个事实。梯度无法跨越这个边界,因此两个系统分别训练,推理部分永远无法帮助感知部分改进。
arXiv上的一篇新预印本提出了一种打破这一障碍的方法。来自一个研究团队的SoftReason引入了一种完全可微的演绎推理架构,使推理链的每一步都是可学习的。该系统不将离散事实从感知输入到单独的推理器,而是将整个演绎状态表示为一个关于候选常量和谓词的软解释张量。每一步更新、每一次证据聚合、每一个基于查询的头事实提议都保持在可微计算图内。
软推理的工作原理
核心思想是即时推论算子的可微提升,该逻辑引擎从已知事实推导出新事实。在经典演绎数据库中,该算子是确定性的:如果前提A和B为真,则结论C为真。SoftReason通过使用谓词定义嵌入和潜在组合通道来形成体谓词的混合,然后聚合所有可能的证据以提议基于查询的头事实,从而使该操作软化。解释通过一个单调概率OR更新,确保网络收敛到一个不动点而不破坏可微性。
这种设计并非小技巧。它改变了系统分配信用的方式。如果视觉模型错误识别了一个物体,且推理器无法回答问题,梯度可以从查询答案一直流回感知编码器,调整产生错误识别的权重。传统的神经符号流程无法做到这一点,因为它们的离散事实接口在边界处阻断了梯度。

在KVQA上的实例化
作者在知识感知视觉问答上实例化了SoftReason,这是一个需要视觉基础推理和基于知识图谱推理的基准。该架构接收一张图像、一个自然语言问题和一组知识图谱三元组,并必须生成一个答案。感知模块从图像中提出概率基础事实。知识图谱三元组作为高置信度的软证据输入,加权但仍然可微。接着,推理模块执行软演绎闭包,通过谓词空间传播信念,直到达到不动点。
论文中报告的结果显示,SoftReason在KVQA上匹配或超过了离散基线的准确率,同时实现了端到端训练。准确率的差距在需要多步链式推理的问题上最为明显,软演绎模块可以利用梯度信号来优化感知模型的置信分布。
这对神经符号领域意味着什么
目前大多数结合神经感知与符号推理的系统分为两类:要么端到端训练感知并将其冻结,然后将事实输入到单独的符号模块;要么手工编码设计规则,完全绕过学习。SoftReason同时解决了这两个限制。其完全可微的设计意味着训练视觉编码器的同一反向传播算法也可以塑造演绎规则。
这一点在感知输入本质模糊的领域尤为相关。例如,在医学影像中,病灶边界可能不确定,诊断规则链需要对此不确定性进行推理。SoftReason的软解释张量可以表示冲突证据,并在早期流程中避免强制进行离散选择来传播它。同样的逻辑适用于自动驾驶、法律文档分析,或任何需要高维数据支持具有证据不确定性的结构化推理的场景。
待解决的问题
SoftReason是一篇预印本,仍有几个问题未得到解答。论文在KVQA上展示了该架构,这是一个相对受控的环境。将软解释张量扩展到具有数千个谓词和数百万个实体的更大知识库,将考验该方法的计算可行性。单调概率OR更新确保了收敛,但代价随着候选常量与谓词数量的乘积而增长。
另一个未解问题是,无需重新训练演绎算子,该方法跨领域迁移的效果如何。谓词定义嵌入是针对特定知识图谱学习的。推广到新领域或新规则模式可能需要重新训练或微调,这限制了即插即用的吸引力。
尽管如此,概念上的进步是实实在在的。如果这项研究能够规模化,它将为构建能够学会推理并通过推理学习的系统提供一条原则性路径,两者之间不再有离散的障碍。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。