IA biologiquement plausible
Un correctif a sauvé CIFAR-10 et n'a rien fait pour MNIST, et cela devrait inquiéter les chercheurs en IA
L'Error Diffusion de Sakana AI étend l'apprentissage sans rétropropagation, semblable au cerveau, à CIFAR-10 et au RL. Le hic : quels choix de conception sont importants s'inverse entre les benchmarks, et le coût du principe de Dale augmente avec la difficulté de la tâche.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-19 · 7 min de lecture

Depuis trente ans, un fait inconfortable a éclipsé l'apprentissage profond : l'algorithme qui entraîne presque tous les réseaux de neurones modernes n'est pas la façon dont les cerveaux apprennent. La rétropropagation exige que le passage arrière réutilise la transposée exacte des poids avant, le problème de transport de poids que Francis Crick a signalé en 1989, et aucun mécanisme biologique connu ne transporte les poids à l'envers de cette façon. Un flot d'alternatives a tenté de combler l'écart. Presque toutes s'arrêtent avant MNIST.
Un nouvel article de Sakana AI, signé par Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha et Robert Tjarko Lange, pousse une règle appelée Error Diffusion plus loin qu'elle n'est jamais allée, sur des images couleur et la robotique à contrôle continu. Le résultat principal est qu'elle fonctionne sous la contrainte biologique la plus stricte. Le résultat le plus intéressant se trouve dans les tables d'ablation, et c'est un avertissement pour tout le domaine.
Ce que contient ce rapport
- Pourquoi la rétropropagation brise la plausibilité biologique, et ce que le principe de Dale ajoute
- L'astuce du double flux : deux populations de neurones, quatre matrices de poids, une erreur globale
- Le tableau de bord : 96,7% sur MNIST, 61,7% sur CIFAR-10
- L'inversion d'ablation qui expose l'évaluation sur un seul benchmark
- Apprentissage par renforcement : là où la taxe de Dale devient moins chère
- Ce que ça coûte, et pourquoi les spécialistes du matériel devraient s'y intéresser
Le principe de Dale : la règle que la plupart de l'IA ignore
Les neurones biologiques obéissent au principe de Dale : un neurone donné est soit excitateur soit inhibiteur sur toutes ses synapses, il ne change pas de signe connexion par connexion. Les réseaux artificiels ignorent complètement cela, laissant n'importe quel poids devenir positif ou négatif à volonté. Cette liberté rend la rétropropagation efficace, et c'est aussi ce qui la rend biologiquement fictive.
Appliquer le principe de Dale n'est pas cosmétique. Cela force un réseau à coordonner des populations excitatrices et inhibitrices séparées, ce qui change fondamentalement la façon dont un réseau peut attribuer le crédit pendant l'apprentissage. Les méthodes antérieures sans rétropropagation, Feedback Alignment, Direct Feedback Alignment (DFA), codage prédictif, contournent toutes le transport de poids, mais chacune permet encore des poids de signe arbitraire. Aucune n'est Dalean.
L'architecture à double flux

L'Error Diffusion, proposée à l'origine par Kaneko en 2000, est une règle locale : une mise à jour de poids dépend uniquement de l'activité présynaptique, d'une dérivée d'activation postsynaptique et d'un seul signe d'erreur global. L'équipe de Sakana la rend conforme à Dale en divisant chaque couche en un flux positif (excitateur) et un flux négatif (inhibiteur), avec quatre matrices de poids non négatives par couche. Les connexions entre flux sont codées en dur pour soustraire, donc l'inhibition est structurelle tandis que chaque paramètre apprenable reste non négatif.
Le coût est immédiat : environ 4 fois plus de paramètres qu'un réseau non contraint de même largeur (environ 32M contre 8M pour une baseline DFA). Pour aller au-delà de la classification binaire pour laquelle la règle est née, les auteurs ajoutent un routage d'erreur modulo : chaque unité cachée se voit attribuer un canal de sortie fixe par i mod C, et reçoit l'erreur de ce canal comme signal d'apprentissage. Pas de poids transposés, pas de matrices de rétroaction aléatoires, juste une carte déterministe des unités cachées vers les sorties.
Le tableau de bord
Avec trois astuces spécifiques à la classification, des largeurs de sigmoïde spécifiques à la couche, une erreur de classe centrée sur le batch et une initialisation asymétrique excitatrice/inhibitrice, le modèle complet atteint 96,7 % ± 0,1 sur MNIST et établit une baseline de 61,7 % ± 0,7 sur CIFAR-10. L'article est honnête : ~62 % sur CIFAR-10 est loin d'être compétitif avec les méthodes de gradient ordinaires. Mais c'est la première fois que l'Error Diffusion est appliquée à des réseaux convolutionnels. Une étude précédente de Fujita en 2026 n'avait réussi qu'environ 55,2 % avec un MLP aplati.
La baseline DFA non contrainte obtient des scores plus élevés, 97,6 % et 69,1 %, mais elle le fait avec environ 2,84 millions de poids négatifs, violant directement le principe de Dale. Et l'écart raconte sa propre histoire : 0,9 point sur MNIST, s'élargissant à 7,4 points sur CIFAR-10. La taxe sur l'honnêteté biologique augmente avec la difficulté de la tâche.
L'inversion qui compte
Voici la découverte qui dépasse cette seule architecture. Lorsque les auteurs retirent chacune des trois astuces de classification à tour de rôle, la hiérarchie d'importance ne se réduit pas simplement entre les tâches, elle s'inverse.
| Composant retiré | MNIST (Δ pp) | CIFAR-10 (Δ pp) |
|---|---|---|
| Largeurs de sigmoïde spécifiques à la couche | −71,4 | −15,1 |
| Erreur de classe centrée sur le batch | −0,3 | −47,9 |
| Init. E/I asymétrique | +0,0 | −5,5 |
Sur MNIST, retirer les largeurs de sigmoïde spécifiques à la couche est catastrophique, la précision s'effondre de 96,7 % à 25,3 %, proche du hasard, tandis que retirer l'erreur centrée sur le batch coûte une erreur d'arrondi et l'initialisation asymétrique ne fait rien de mesurable. Sur CIFAR-10, le classement s'inverse : l'erreur de classe centrée sur le batch devient le composant porteur (−47,9 pp, effondrant quatre des cinq graines), et la largeur de sigmoïde passe au second plan.
Pourquoi ? Les caractéristiques bien séparées de MNIST permettent au réseau d'apprendre même avec un signal d'erreur déséquilibré, mais sans sigmoïdes larges, les dérivées disparaissent. Une analyse a posteriori montre une décroissance du gradient de 25x de la sortie à la première couche cachée. La plus grande similarité inter-classes de CIFAR-10 rend le déséquilibre d'erreur un-contre-tous de 9:1 écrasant, donc centrer l'erreur devient essentiel pour empêcher le réseau de supprimer uniformément chaque canal de classe. Deux tâches, deux goulots d'étranglement d'attribution de crédit complètement différents. Évaluez sur l'un ou l'autre seul et vous tireriez la conclusion opposée sur quel choix de conception est critique.
Apprentissage par renforcement : là où la taxe devient moins chère
Le même noyau à double flux, intégré dans Proximal Policy Optimization sous le nom d'ED-PPO, cette fois avec des activations ReLU et aucune des astuces de classification, raconte une histoire différente. Sur les tâches de locomotion Brax de Google, il est compétitif avec le PPO standard basé sur la rétropropagation, et sur HalfCheetah, il le bat même (5 494 contre 3 520 ; p < 0,001) tout en égalant le DFA-PPO.
| Tâche | ED-PPO (Dalean) | BP-PPO | DFA-PPO |
|---|---|---|---|
| HalfCheetah | 5 494 ± 691 | 3 520 ± 485 | 5 581 ± 359 |
| Ant | 6 891 ± 835 | ~6 740 | à égalité |
| Craftax | 23,0 (20,9 ± 2,9) | 27,0 | 19,8 ± 1,5 |
Le benchmark ouvert Craftax est là où le schéma inter-domaines se précise. ED-PPO est en retrait par rapport à la rétropropagation mais bat DFA, dont les voies de rétroaction aléatoires, parfaitement adéquates sur les images supervisées, plient sur une tâche d'exploration complexe. DFA est fort sur la classification et faible sur le RL difficile. Le coût du principe de Dale, en d'autres termes, dépend lui-même de la tâche.
L'inconvénient auto-organisateur
Deux effets secondaires laissent entrevoir pourquoi les réseaux biologiquement contraints se comportent comme ils le font. L'initialisation excitatrice/inhibitrice de 3:1 dérive, pendant l'entraînement, vers un quasi-équilibre (~1:1) dans les couches cachées, avec un gradient inhibiteur dépendant de la profondeur, faisant écho librement à la façon dont les circuits corticaux mûrissent vers un équilibre d'excitation et d'inhibition. Et le plancher non négatif taille sévèrement : 37,3 % des poids atteignent le plancher après l'entraînement, avec les connexions inhibitrices feed-forward taillées le plus agressivement (jusqu'à 68,8 %). Sakana présente cela comme un avantage potentiel : l'entraînement conforme à Dale pourrait fournir une compression de modèle gratuite, puisqu'un poids fixé à zéro ne peut pas récupérer.
Pourquoi la contrainte pourrait gagner sa place
Rien de tout cela ne rend l'apprentissage conforme à Dale compétitif avec la rétropropagation aujourd'hui. L'article est explicite : ED-PPO porte une variance substantiellement plus élevée, et l'écart de classification quantifie un coût réel. L'argument pour le poursuivre est en aval. Les magnitudes synaptiques non négatives avec un routage à signe fixe se mappent naturellement sur le matériel neuromorphique analogique, photonique et à dispositifs synaptiques, où les éléments physiques codent souvent uniquement des quantités non négatives et le signe vit au niveau de l'identité de la population. La division excitatrice/inhibitrice offre également un levier d'interprétabilité que les réseaux standard n'ont pas : lorsque le modèle se trompe, vous pouvez demander si une caractéristique a été faussement amplifiée ou insuffisamment supprimée.
La leçon durable est méthodologique, et elle survit à l'Error Diffusion. Un composant qui sauve un benchmark peut être un poids mort sur un autre. Juger une règle d'apprentissage biologiquement plausible, ou sans doute n'importe quelle architecture, sur un seul ensemble de données ne sous-estime pas seulement ses limites ; cela peut orienter les chercheurs exactement vers le mauvais levier de conception. C'est une leçon moins chère à apprendre d'une table d'ablation que d'une décennie de travail mal orienté.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.