SevenTnewS

生物合理性AI

一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒

Sakana AI的“误差扩散”将类脑、无反向传播学习扩展到CIFAR-10和强化学习。关键在于:哪些设计选择更重要在不同的基准测试间逆转,而戴尔原理的成本随任务难度增加。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-19 · 阅读需 7 分钟

一个修复拯救了CIFAR-10,却对MNIST毫无帮助, , 这应让AI研究者警醒
来源 : Diffusing Blame…

三十年来,一个令人不安的事实一直笼罩着深度学习:训练几乎所有现代神经网络的算法并非大脑的学习方式。反向传播要求反向传播过程精确复用前向权重的转置,即弗朗西斯·克里克在1989年指出的权重传输问题,而目前没有已知的生物机制能以这种方式反向传递权重。一系列替代方案试图弥合这一差距,但几乎所有方案都在MNIST之后停滞不前。

Sakana AI(由Yutaro Yamada、Luca Grillotti、Rujikorn Charakorn、Sebastian Risi、David Ha和Robert Tjarko Lange共同撰写)的一篇新论文将一种名为“误差扩散”的规则推进到前所未有的程度,应用于彩色图像和连续控制机器人领域。最引人注目的结果是它在最严格的生物约束下仍然有效。更有趣的结果体现在消融表中,这对整个领域来说是一个警示。

报告要点

  • 反向传播为何违背生物合理性,以及戴尔原理增加了什么
  • 双流技巧:两个神经元群体、四个权重矩阵、一个全局误差
  • 成绩单:MNIST上96.7%,CIFAR-10上61.7%
  • 暴露单基准测试评价局限性的消融逆转现象
  • 强化学习:戴尔成本何时降低
  • 其代价是什么,以及硬件领域为何应关注

戴尔原理:大多数AI忽略的规则

生物神经元遵循戴尔原理:一个给定的神经元在其所有突触上要么是兴奋性的,要么是抑制性的,不会逐个连接地改变符号。人工网络完全忽略这一点,允许任意权重自由取正或负。这种自由使得反向传播高效,但也正是它让反向传播在生物学上不成立。

实施戴尔原理并非表面功夫。它迫使网络协调独立的兴奋性和抑制性群体,这从根本上改变了网络在学习过程中分配信用的方式。此前的无反向传播方法,如反馈对齐、直接反馈对齐(DFA)、预测编码,都避开了权重传输,但每一种仍然允许任意符号的权重。它们都不符合戴尔原理。

双流架构

图表:消融对MNIST与CIFAR-10准确率的影响
根据Sakana AI的论文,在MNIST上移除误差扩散的每个组件时准确率的变化(百分点)。

误差扩散最初由Kaneko于2000年提出,是一种局部规则:权重更新仅依赖于突触前活动、一个突触后激活导数以及一个全局误差符号。Sakana的团队通过将每一层分为一个正(兴奋性)流和一个负(抑制性)流,每层有四个非负权重矩阵,使其符合戴尔原理。跨流连接被硬编码为减法,因此抑制是结构性的,而每个可学习参数保持非负。

代价是立竿见影的:与相同宽度的无约束网络(约800万参数用于DFA基线)相比,参数大约增长4倍(约3200万)。为了将该规则从其诞生的二元分类扩展到更广范围,作者增加了取模误差路由:每个隐藏单元通过i mod C分配一个固定的输出通道,并接收该通道的误差作为学习信号。没有转置权重,没有随机反馈矩阵,只有一个从隐藏单元到输出的确定性映射。

成绩单

结合三个分类专用技巧, , 每层特定的sigmoid宽度、批量中心化类误差、以及非对称兴奋/抑制初始化, , 完整模型在MNIST上达到96.7% ± 0.1,并在CIFAR-10上建立了61.7% ± 0.7的基线。论文直言不讳:CIFAR-10上约62%的准确率远未达到普通梯度方法的竞争力。但这是误差扩散首次应用于卷积网络。Fujita在2026年的一项先前研究仅在扁平化MLP上实现了约55.2%。

无约束的DFA基线得分更高,达到97.6%和69.1%,但它使用了大约284万个负权重,公然违反了戴尔原理。而差距本身说明了问题:MNIST上差0.9个百分点,在CIFAR-10上扩大到7.4个百分点。生物合理性的成本随着任务难度增加而增长。

重要的逆转现象

以下是超越这一特定架构的发现。当作者依次移除三个分类技巧时,它们的重要性层级不仅在任务之间缩小了,而且颠倒了过来。

移除的组件MNIST(Δ百分点)CIFAR-10(Δ百分点)
每层特定sigmoid宽度−71.4−15.1
批量中心化类误差−0.3−47.9
非对称E/I初始化+0.0−5.5

在MNIST上,移除每层特定的sigmoid宽度是灾难性的,准确率从96.7%骤降至25.3%(接近随机水平),而移除批量中心化误差只造成四舍五入的误差,非对称初始化没有可测量的影响。在CIFAR-10上,排序发生了翻转:批量中心化误差成为承重组件(−47.9 pp,导致五个种子中的四个崩溃),而sigmoid宽度退居次要位置。

原因何在?MNIST特征区分度高,即使误差信号不平衡,网络也能学习,但如果没有宽sigmoid,导数会消失。后续分析显示,从输出到第一个隐藏层存在25倍的梯度衰减。CIFAR-10的类间相似性更高,使得9:1的“一对所有”误差不平衡变得难以承受,因此中心化误差对于防止网络统一抑制所有类别通道至关重要。两个任务,两种完全不同的信用分配瓶颈。仅基于任何一个任务进行评估,都会得出关于哪个设计选择至关重要的相反结论。

强化学习:成本何时降低

相同的双流核心被植入近端策略优化(称为ED-PPO),这次使用ReLU激活函数且没有任何分类技巧,讲述了一个不同的故事。在谷歌的Brax运动任务上,它与基于标准反向传播的PPO具有竞争力,在HalfCheetah上甚至击败了它(5,494对3,520;p < 0.001),同时与DFA-PPO相当。

任务ED-PPO(戴尔原理版)BP-PPODFA-PPO
HalfCheetah5,494 ± 6913,520 ± 4855,581 ± 359
Ant6,891 ± 835~6,740持平
Craftax23.0(20.9 ± 2.9)27.019.8 ± 1.5

在开放性Craftax基准测试上,跨领域模式的差异更加明显。ED-PPO落后于反向传播但优于DFA,后者的随机反馈路径在监督图像上表现良好,却在复杂的探索任务中崩溃。也就是说,DFA在分类上很强,在困难的强化学习上很弱。换句话说,戴尔原理的成本本身也依赖于任务。

自组织的代价

两个副作用暗示了为何受生物约束的网络会表现出这种行为。3:1的兴奋/抑制初始化比例在训练过程中向隐藏层的平衡状态(约1:1)漂移,并伴有与深度相关的抑制梯度,这粗略地呼应了皮层回路向兴奋抑制平衡成熟的机制。此外,非负下限产生了严格的剪枝效果:训练后37.3%的权重触及下限,其中抑制性前馈连接被剪枝得最为激进(高达68.8%)。Sakana将其视为潜在优势:符合戴尔原理的训练可能免费带来模型压缩,因为被固定在零的权重无法恢复。

为何这种约束可能值得保留

这些都不意味着符合戴尔原理的学习如今能与反向传播竞争。论文明确指出:ED-PPO的方差显著更高,分类差距量化了真实成本。追求它的理由在于其下游潜力。具有固定符号路由的非负突触幅度自然适用于模拟、光子学和突触设备神经形态硬件,其中物理元素通常仅编码非负量,而符号存在于群体身份层面。兴奋/抑制的划分还提供了标准网络所不具备的可解释性优势:当模型出错时,你可以询问某个特征是虚假放大了还是抑制不足。

持久的启示是方法论上的,且超越了误差扩散本身。一个拯救了某个基准的组件在另一个基准上可能是无用之物。在单一数据集上评判一个生物合理的学习规则(或者可以说任何架构),不仅低估了其局限性,还可能将研究者引向完全错误的设计杠杆。从消融表中吸取这个教训,比从一个十年走偏的研究中才意识到要便宜得多。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。