AI基础
为什么AI仍然无法解释自己:一个思考严谨性的框架
谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。

“严谨性”这个词在AI中意味着不同的事情,取决于你问谁。对数学家来说,它是证明。对工程师来说,它是能大规模运作的东西。对哲学家来说,它是把定义弄对。
在arXiv上发表的一篇新论文中,谷歌DeepMind研究员Timothy Nguyen提出了一个试图将这三层含义结合在一起的框架。这篇题为《The Role of Rigor in Artificial Intelligence》的论文,将严谨性分为三类:概念性、认知性和操作性,并认为这些类别的不均衡发展解释了AI既取得惊人进步又存在持续盲点的原因。
这篇文章值得一读,不是因为它解决了任何单一争议,而是因为它命名了许多争议之下的结构。关于LLM是否理解语言的争论、“炼金术”的指控、基准测试饱和、安全问题, , 所有这些都归结为同一个不对称:操作严谨性已远远领先于其他两者。
三种严谨性,一个不均衡的领域
概念严谨性意味着基本术语的清晰度。智能、理解、推理, , 这些词在AI话语中频繁出现,但该领域对它们都没有确定的定义。Nguyen列举了后果。当Geoffrey Hinton说LLM是智能的,而Yann LeCun说它们甚至还不如猫聪明时,分歧部分在于智能意味着什么。Hinton强调行为能力。LeCun强调推理和对世界的理解。他们用同一个词来描述不同的事物。
认知严谨性涉及科学知识如何产生和验证:可重复性、可预测性、可解释性。在这方面,深度学习记录好坏参半。实验原则上是可以重复的,因为一切都是软件,但Nguyen指出,结果可重复性和推理可重复性常常被混淆。微小的实现差异就能推翻结论。该领域有缩放定律,可以预测在更大计算预算下的损失,但缺乏预测模型何时会泛化或失败的理论。可解释性更糟。神经网络在高维空间中产生特征,这些特征抵制解读。该论文引用了熟悉的“炼金术”批评,但添加了一个有用的细化:使深度学习成为炼金术的不仅仅是理解不完整,还在于缺乏层级抽象。在成熟的科学中,你可以将问题定位到某个尺度, , 亚原子、细胞、进化。而在深度学习中,常常不清楚观察到的失败是来自单个神经元、优化动态、训练数据,还是它们的某种组合。
这篇文章描述操作严谨性占主导地位,而概念严谨性和认知严谨性滞后,基于谷歌DeepMind的Timothy Nguyen的框架。
操作严谨性意味着使系统可靠运作:基准测试、测试、安全程序。这是深度学习投入最多、成功也最多的地方。基准测试将性能转化为优化目标,形成一个紧密的反馈循环。训练后方法, , 指令微调、RLHF、提示工程, , 塑造模型行为,而无需理解模型如何工作的理论。Nguyen称之为替换:操作严谨性弥补了认知保证的缺失。
基准测试作为认知代理
该论文对基准测试的处理尤其尖锐。基准测试起着Nguyen所称的“认知代理”的作用, , 在ImageNet或MMLU上的强劲表现被视为模型能泛化到这些特定任务之外的证据。但要使这一推论有效,必须满足两个条件:模型不能已在基准测试数据上训练过,并且它必须学习预期的概念而非虚假的相关性。在当今大规模预训练和开放网络数据的时代,这两个条件都不可靠满足。
基准测试彩票假设, , 任务选择的微小变化可以翻转方法排名, , 被提及。古德哈特定律也出现:一旦一个指标成为优化目标,它就不再是可靠的衡量标准。聊天模型中的谄媚行为,即系统学会同意用户而非真实,是其中一个症状。
没有理论的进步
论文中最有趣的部分考察了这三种严谨性如何塑造了AI的轨迹。Nguyen的诊断是,AI表现出一种结构性不对称:操作严谨性已成为主导,而概念严谨性和认知严谨性滞后。这并非偶然。它源于该领域的两个特征。
首先,AI在评估和发展之间有一个紧密的反馈循环。用于评估系统的同一指标正是这些系统被训练优化的目标。在物理学或医学中,你不会通过最大化一个基准测试上的性能指标来迭代一个理论。你测试理论。在AI中,指标就是目标。
其次,AI产生了它自己所研究的产物。每一代模型创造新的能力和新的失败模式,扩大了后来概念和认知工作必须解释的领域。自然科学研究的对象独立存在, , 原子、生物体、行星。AI研究它自己的创造物,而这些创造物在不断变化。这使得累积的科学进步变得更加困难,因为研究对象在移动。
Nguyen小心地不将此不对称描述为危机。他指出,深度学习确实拥有部分解释性框架:缩放定律、神经切核理论、梯度方法的收敛结果。这些提供了真实但有限的理解。但论文的结论是,弥合差距, , 尤其是认知差距, , 需要的不仅仅是更好的基准测试或更大的模型。它需要发展能够跟上技术已能做到事情的科学理解形式。
框架留下的开放问题
这篇论文更像是诊断性的而非规定性的。它没有提出一个统一的智能定义,也没有声称这样的定义是可能的。它建议概念分歧至少可以变得更精确,这将是对当前状态的改进。关于可解释性,它提出了一个更深层次的问题:如果神经网络实现了没有人类可理解描述的计算,那么什么才算得上是一个解释?
这个问题不是修辞性的。Nguyen指出,在神经科学等领域,解释通常是在行为层面运作, , 信念、欲望、意图, , 而不需要追踪单个神经元。神经网络没有等效的抽象层。对于Transformer来说,没有“心智理论”,也不清楚它应该是什么样子。
这篇论文没有试图回答这些问题。它绘制了地形图。考虑到AI研究人员之间相互误解的频率,一张更好的地图是有价值的。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。