SevenTnewS

IA biológicamente plausible

Una solución rescató a CIFAR-10 y no hizo nada por MNIST, y eso debería inquietar a los investigadores de IA

La difusión de errores de Sakana AI escala el aprendizaje sin retropropagación, similar al cerebro, hasta CIFAR-10 y RL. El problema: qué decisiones de diseño importan se invierte entre puntos de referencia, y el costo del principio de Dale crece con la dificultad de la tarea.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-19 · 7 min de lectura

Una solución rescató a CIFAR-10 y no hizo nada por MNIST, y eso debería inquietar a los investigadores de IA
Fuentes : Diffusing Blame…

Durante treinta años, un hecho incómodo ha ensombrecido el aprendizaje profundo: el algoritmo que entrena casi todas las redes neuronales modernas no es la forma en que aprenden los cerebros. La retropropagación exige que el pase hacia atrás reutilice la transpuesta exacta de los pesos hacia adelante, el problema del transporte de pesos que Francis Crick señaló en 1989, y ningún mecanismo biológico conocido transporta pesos hacia atrás de esa manera. Una corriente de alternativas ha intentado cerrar la brecha. Casi todas se estancan más allá de MNIST.

Un nuevo artículo de Sakana AI, escrito por Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha y Robert Tjarko Lange, lleva una regla llamada Difusión de Errores más lejos de lo que se había llegado antes, hasta imágenes en color y robótica de control continuo. El resultado principal es que funciona bajo la restricción biológica más estricta. El resultado más interesante se encuentra en las tablas de ablación, y es una advertencia para todo el campo.

Qué hay en este informe

  • Por qué la retropropagación rompe la plausibilidad biológica y qué añade el principio de Dale
  • El truco del flujo dual: dos poblaciones de neuronas, cuatro matrices de pesos, un error global
  • El cuadro de resultados: 96,7% en MNIST, 61,7% en CIFAR-10
  • La inversión de ablación que expone la evaluación con un solo punto de referencia
  • Aprendizaje por refuerzo: donde el impuesto de Dale se vuelve más barato
  • Lo que cuesta y por qué el hardware debería importarle

El principio de Dale: la regla que la mayoría de la IA ignora

Las neuronas biológicas obedecen el principio de Dale: una neurona dada es excitatoria o inhibitoria en todas sus sinapsis, no cambia de signo conexión por conexión. Las redes artificiales ignoran esto por completo, permitiendo que cualquier peso sea positivo o negativo a voluntad. Esa libertad hace que la retropropagación sea eficiente, y también es lo que la hace biológicamente ficticia.

Imponer el principio de Dale no es cosmético. Obliga a una red a coordinar poblaciones excitatorias e inhibitorias separadas, lo que cambia fundamentalmente cómo una red puede asignar crédito durante el aprendizaje. Los métodos anteriores sin retropropagación, Feedback Alignment, Direct Feedback Alignment (DFA), codificación predictiva, todos evitan el transporte de pesos, pero todos permiten pesos de signo arbitrario. Ninguno es Daleano.

La arquitectura de flujo dual

Gráfico: Impacto de la ablación en la precisión de MNIST vs. CIFAR-10
El cambio en la precisión (puntos porcentuales) cuando se elimina cada componente de la Difusión de Errores en MNIST, según lo informado en el artículo de Sakana AI.

La Difusión de Errores, propuesta originalmente por Kaneko en 2000, es una regla local: una actualización de peso depende solo de la actividad presináptica, una derivada de activación postsináptica y un único signo de error global. El equipo de Sakana la hace compatible con Dale dividiendo cada capa en un flujo positivo (excitatorio) y un flujo negativo (inhibitorio), con cuatro matrices de pesos no negativos por capa. Las conexiones entre flujos están programadas para restar, por lo que la inhibición es estructural mientras que cada parámetro aprendible permanece no negativo.

El costo es inmediato: aproximadamente 4 veces más parámetros que una red sin restricciones del mismo ancho (alrededor de 32M frente a 8M para una línea base DFA). Para ir más allá de la clasificación binaria para la que nació la regla, los autores añaden enrutamiento de error módulo: a cada unidad oculta se le asigna un canal de salida fijo mediante i mod C, y recibe el error de ese canal como su señal de aprendizaje. Sin pesos transpuestos, sin matrices de retroalimentación aleatorias, solo un mapa determinista de unidades ocultas a salidas.

El cuadro de resultados

Con tres trucos específicos de clasificación, anchos de sigmoide específicos de capa, error de clase centrado por lote e inicialización asimétrica excitatoria/inhibitoria, el modelo completo alcanza 96,7% ± 0,1 en MNIST y establece una línea base de 61,7% ± 0,7 en CIFAR-10. El artículo es sincero: ~62% en CIFAR-10 no es competitivo con los métodos de gradiente ordinarios. Pero es la primera vez que se aplica la Difusión de Errores a redes convolucionales. Un estudio previo de 2026 de Fujita logró ~55,2% solo con un MLP aplanado.

La línea base DFA sin restricciones obtiene puntuaciones más altas, 97,6% y 69,1%, pero lo hace con aproximadamente 2,84M de pesos negativos, violando directamente el principio de Dale. Y la brecha cuenta su propia historia: 0,9 puntos en MNIST, que se amplía a 7,4 puntos en CIFAR-10. El impuesto a la honestidad biológica crece con la dificultad de la tarea.

La inversión que importa

Aquí está el hallazgo que trasciende esta arquitectura en particular. Cuando los autores eliminan cada uno de los tres trucos de clasificación por turno, la jerarquía de importancia no solo se reduce entre tareas, sino que se invierte.

Componente eliminadoMNIST (Δ pp)CIFAR-10 (Δ pp)
Anchos de sigmoide específicos de capa−71,4−15,1
Error de clase centrado por lote−0,3−47,9
Inicialización asimétrica E/I+0,0−5,5

En MNIST, eliminar los anchos de sigmoide específicos de capa es catastrófico: la precisión cae de 96,7% a 25,3%, cerca del azar, mientras que eliminar el error centrado por lote cuesta un error de redondeo y la inicialización asimétrica no hace nada medible. En CIFAR-10 la clasificación se invierte: el error centrado por lote se convierte en el componente vital (−47,9 pp, colapsando cuatro de cinco semillas), y el ancho del sigmoide pasa a ser secundario.

¿Por qué? Las características bien separadas de MNIST permiten que la red aprenda incluso con una señal de error desequilibrada, pero sin sigmoides anchos las derivadas se desvanecen. El análisis posterior muestra una caída del gradiente de 25x desde la salida hasta la primera capa oculta. La mayor similitud entre clases de CIFAR-10 hace que el desequilibrio de error uno contra todos de 9:1 sea abrumador, por lo que centrar el error se vuelve esencial para evitar que la red suprima uniformemente cada canal de clase. Dos tareas, dos cuellos de botella de asignación de crédito completamente diferentes. Evalúe solo en una de ellas y sacaría la conclusión opuesta sobre qué decisión de diseño es crítica.

Aprendizaje por refuerzo: donde el impuesto se vuelve más barato

El mismo núcleo de flujo dual, integrado en Proximal Policy Optimization como ED-PPO, esta vez con activaciones ReLU y ninguno de los trucos de clasificación, cuenta una historia diferente. En las tareas de locomoción de Brax de Google es competitivo con PPO estándar basado en retropropagación, y en HalfCheetah en realidad lo supera (5.494 frente a 3.520; p < 0,001) mientras iguala a DFA-PPO.

TareaED-PPO (Daleano)BP-PPODFA-PPO
HalfCheetah5.494 ± 6913.520 ± 4855.581 ± 359
Ant6.891 ± 835~6.740a la par
Craftax23,0 (20,9 ± 2,9)27,019,8 ± 1,5

El punto de referencia de código abierto Craftax es donde el patrón entre dominios se agudiza. ED-PPO va por detrás de la retropropagación pero supera a DFA, cuyas vías de retroalimentación aleatorias, perfectamente adecuadas en imágenes supervisadas, fallan en una tarea de exploración compleja. DFA es fuerte en clasificación y débil en RL difícil. El costo del principio de Dale, en otras palabras, depende en sí mismo de la tarea.

El inconveniente autoorganizativo

Dos efectos secundarios insinúan por qué las redes biológicamente restringidas se comportan como lo hacen. La inicialización 3:1 excitatoria-inhibitoria se desplaza, durante el entrenamiento, hacia un equilibrio cercano (~1:1) en las capas ocultas, con un gradiente inhibitorio dependiente de la profundidad, haciendo eco libremente de cómo los circuitos corticales maduran hacia una excitación e inhibición equilibradas. Y el suelo no negativo poda con fuerza: el 37,3% de los pesos llegan al suelo después del entrenamiento, con las conexiones inhibitorias hacia adelante podadas de manera más agresiva (hasta el 68,8%). Sakana lo presenta como una posible ventaja: el entrenamiento compatible con Dale puede proporcionar compresión del modelo de forma gratuita, ya que un peso fijado en cero no puede recuperarse.

Por qué la restricción podría valer la pena

Nada de esto hace que el aprendizaje compatible con Dale sea competitivo con la retropropagación hoy en día. El artículo es explícito: ED-PPO conlleva una varianza sustancialmente mayor, y la brecha de clasificación cuantifica un costo real. El argumento para perseguirlo es a futuro. Las magnitudes sinápticas no negativas con enrutamiento de signo fijo se asignan naturalmente a hardware neuromórfico analógico, fotónico y de dispositivos sinápticos, donde los elementos físicos a menudo codifican solo cantidades no negativas y el signo vive a nivel de identidad de población. La división excitatoria/inhibitoria también ofrece un asidero de interpretabilidad del que carecen las redes estándar: cuando el modelo se equivoca, se puede preguntar si una característica fue falsamente amplificada o insuficientemente suprimida.

La conclusión duradera es metodológica y sobrevive a la Difusión de Errores. Un componente que rescata un punto de referencia puede ser un lastre en otro. Juzgar una regla de aprendizaje biológicamente plausible, o posiblemente cualquier arquitectura, en un solo conjunto de datos no solo subestima sus límites; puede apuntar a los investigadores exactamente a la palanca de diseño incorrecta. Esa es una lección más barata de aprender de una tabla de ablación que de una década de trabajo mal dirigido.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.