SevenTnewS

生物可信学习

用MNIST换CIFAR-10,类脑AI的方法完全反转

Sakana AI首次将无反向传播、符合戴尔原则的架构扩展到MNIST之外。关键在于:哪个技巧最重要在数据集之间完全反转, , 这对如何衡量生物可信AI是一个警告。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-22 · 阅读需 5 分钟

用MNIST换CIFAR-10,类脑AI的方法完全反转
来源 : Diffusing Blame…

多年来,试图以大脑可能实际运作的方式训练神经网络的努力总是撞上同一堵墙:它在MNIST(自20世纪90年代以来该领域的舒适区, , 手写数字数据集)上有效,但在更困难的任务上失效。Sakana AI的一个团队现在将这样一种方法, , 误差扩散(Error Diffusion), , 推向了卷积网络、CIFAR-10图像和连续控制强化学习。但头条数字并非重点。重点在于研究人员改变基准时发生了什么。

为什么服从大脑代价高昂

生物神经元遵循戴尔原则:每个神经元在其所有突触上要么是兴奋性的,要么是抑制性的,绝不会混合。标准人工网络完全忽略了这一点:任何连接都可以是正或负,反向传播通过将前向权重的精确转置副本向回发送来利用这种自由。神经科学家长期以来一直反对这种“权重传输”没有生物学基础。

避免这一点的替代方案, , 反馈对齐、直接反馈对齐(DFA)、预测编码, , 仍然允许任意正负权重。Sakana AI的双流误差扩散更进一步:它将每一层分为一个正群体和一个负群体,保持每层的四个权重矩阵均为非负,并将抑制性符号硬编码到架构中而非学习得来。这种结构上的诚实带来了代价:相同宽度的无约束网络参数约4倍于约束网络(DFA基线约800万,而约束网络约3200万)。

分数,放在背景下

借助一种新的“模数误差路由”技巧(为每个隐藏单元分配固定的输出通道),该方法在MNIST上达到96.7%,并在CIFAR-10上建立了61.7%的基线, , 这是误差扩散首次在卷积网络上成功。然而,与竞争对手相比,结果是权衡的研究,而非胜利凯歌。

图表:MNIST和CIFAR-10上学习方法准确率比较
Sakana AI的双流误差扩散在MNIST上达到96.7%,而DFA为97.6%,基线Seed ED为50.4%。
方法MNISTCIFAR-10符合戴尔原则?
提出的ED(双流)96.7%61.7%
DFA(随机反馈)97.6%69.1%否(约284万个负权重)
Seed ED(无创新)50.4%11.6%

与DFA的差距从MNIST上的0.9个百分点扩大到CIFAR-10上的7.4个百分点。这一差距可以说是论文最清晰的贡献:对强制执行戴尔原则代价的具体估算,以及代价随任务难度增加的证据。

让基准观察者担忧的反转

为了使该架构具有竞争力,团队添加了三个分类特定技巧:层特定Sigmoid宽度(以对抗梯度消失)、批量中心类误差(以对抗一对多目标9:1的不平衡)以及不对称兴奋/抑制初始化。有启发性的结果是消融研究在去除每个技巧时揭示的情况。

去除的组件对MNIST的影响对CIFAR-10的影响
层特定Sigmoid宽度−71.4 pp−15.1 pp
批量中心类误差−0.3 pp−47.9 pp
不对称E/I初始化+0.0 pp−5.5 pp

在MNIST上,去除Sigmoid宽度修正是灾难性的,而批量中心化几乎无影响。在CIFAR-10上,层级关系反转:批量中心化成为学习与崩溃的区别,而Sigmoid修正退居次要。一个在一个数据集上看似关键的组件,在另一个数据集上却显得微不足道。如果研究人员像该领域大多数工作一样止步于MNIST,他们会得出误差信号中心化无关紧要的结论。它极为重要。

这是这项工作的分析核心:信用分配的瓶颈不是该方法的固定属性,而是任务的属性。在单一基准上评估一个生物可信的学习规则,你可能会将错误的设计决策认证为普遍真理。

同样的教训,来自强化学习方面

该团队还将误差扩散应用于近端策略优化(PPO),并在Google的Brax运动任务和开放式Craftax基准上运行。这里角色再次切换。在HalfCheetah上,ED-PPO(平均回报5,494)优于标准反向传播PPO(3,520),并与DFA持平。但在Craftax上,分类冠军DFA是最弱的方法,低于反向传播和误差扩散。足以支持监督学习的随机反馈通路在复杂的探索性强化学习中失败。

镜像是有意的:DFA在ED挣扎的地方强,在ED表现良好的地方弱。两个领域的信息是相同的:没有一个单一的排行榜能告诉你哪种受大脑启发的方法“最好”,因为每种方法的弱点只在特定任务需求下才显现。

自发出现的现象

一项发现暗示了这些受约束网络为何如此行为。3:1的兴奋/抑制初始化通过训练本身漂移至大约1:1的平衡,且更深层逐渐变得更具抑制性。这呼应了皮层回路在成熟过程中如何被认为达到平衡的兴奋和抑制,而且没有使用任何显式的平衡机制。同时,非负下限将37.3%的权重修剪至接近零,对抑制性连接影响最大(高达68.8%),这是一种“免费”的稀疏性,也是模拟、光子或神经形态芯片(其中物理突触自然编码非负量)可能的硬件优势。

诚实的底线

CIFAR-10上的62%远非传统梯度训练网络所能达到的水平,Sakana AI对此直言不讳。ED-PPO的方差也明显高于反向传播,并且在需要精细时间信用分配的任务上表现不佳。这里的价值不在于最先进的模型,而是一张精心标注的地图,展示了生物约束学习在哪里失效以及为何失效。而这张地图上最锐利的线条是方法论上的:如果该领域继续用玩具数据集来给类脑AI评分,它将不断得出自信的结论,而下一个数据集会悄然推翻这些结论。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。