SevenTnewS

Aprendizaje biológicamente plausible

Reemplazar MNIST por CIFAR-10 cambia por completo la receta para una IA similar al cerebro

Sakana AI escaló por primera vez una arquitectura compatible con Dale y sin retropropagación más allá de MNIST. El truco: qué técnica importa más se invierte entre conjuntos de datos, una advertencia sobre cómo se mide la IA biológicamente plausible.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-22 · 5 min de lectura

Reemplazar MNIST por CIFAR-10 cambia por completo la receta para una IA similar al cerebro
Fuentes : Diffusing Blame…

Durante años, la búsqueda de entrenar redes neuronales como los cerebros podrían realmente funcionar se ha topado con el mismo muro: funciona en MNIST, el conjunto de datos de dígitos escritos a mano que ha sido la zona de confort del campo desde la década de 1990, y se desmorona en cualquier cosa más difícil. Un equipo de Sakana AI ha llevado ahora uno de esos métodos, la Difusión de Errores, a redes convolucionales, imágenes CIFAR-10 y aprendizaje por refuerzo de control continuo. Pero el número destacado no es el punto. El punto es lo que sucedió cuando los investigadores cambiaron el punto de referencia.

Por qué obedecer al cerebro es costoso

Las neuronas biológicas siguen el principio de Dale: cada neurona es excitadora o inhibidora en todas sus sinapsis, nunca una mezcla. Las redes artificiales estándar ignoran esto por completo, cualquier conexión puede ser positiva o negativa, y la retropropagación explota esa libertad al enviar copias transpuestas exactas de los pesos hacia adelante hacia atrás. Los neurocientíficos han objetado durante mucho tiempo que este "transporte de peso" no tiene base biológica.

Las alternativas que lo evitan, Alineación de Retroalimentación, Alineación de Retroalimentación Directa (DFA), codificación predictiva, todas todavía permiten pesos positivos y negativos arbitrarios. La Difusión de Errores de doble flujo de Sakana AI va más allá: divide cada capa en una población positiva y una negativa, mantiene las cuatro matrices de pesos por capa no negativas y codifica la señal inhibidora en la arquitectura en lugar de aprenderla. Esa honestidad estructural tiene un costo: aproximadamente 4 veces los parámetros de una red sin restricciones del mismo ancho (alrededor de 32 millones frente a 8 millones para la línea base de DFA).

Las puntuaciones, en contexto

Con un nuevo truco de "enrutamiento de error módulo" que asigna a cada unidad oculta un canal de salida fijo, el método alcanza el 96.7% en MNIST y establece una línea base del 61.7% en CIFAR-10, la primera vez que la Difusión de Errores funciona en redes convolucionales. Sin embargo, en comparación con la competencia, los resultados son un estudio de compensaciones más que una vuelta de la victoria.

Gráfico: Comparación de precisión de métodos de aprendizaje en MNIST y CIFAR-10
La Difusión de Errores de doble flujo de Sakana AI alcanza el 96.7% en MNIST, en comparación con el 97.6% de DFA y el 50.4% de la línea base Seed ED.
MétodoMNISTCIFAR-10¿Cumple con Dale?
ED propuesto (doble flujo)96.7%61.7%
DFA (retroalimentación aleatoria)97.6%69.1%No (~2.84M pesos negativos)
Seed ED (sin innovaciones)50.4%11.6%

La brecha con DFA se amplía de 0.9 puntos en MNIST a 7.4 puntos en CIFAR-10. Esa diferencia es probablemente la contribución más clara del artículo: una etiqueta de precio concreta sobre el costo de imponer el principio de Dale, y evidencia de que el precio crece con la dificultad de la tarea.

La inversión que debería preocupar a los observadores de puntos de referencia

Para hacer competitiva la arquitectura, el equipo añadió tres trucos específicos de clasificación: anchos de sigmoide específicos por capa (para combatir gradientes que desaparecen), error de clase centrado en el lote (para contrarrestar el desequilibrio de 9 a 1 de los objetivos uno contra todos) e inicialización asimétrica excitatoria/inhibidora. El resultado instructivo es lo que reveló un estudio de ablación cuando se eliminó cada uno.

Componente eliminadoImpacto en MNISTImpacto en CIFAR-10
Anchos de sigmoide específicos por capa−71.4 pp−15.1 pp
Error de clase centrado en el lote−0.3 pp−47.9 pp
Inicialización asimétrica E/I+0.0 pp−5.5 pp

En MNIST, eliminar la corrección de ancho sigmoide es catastrófico, mientras que el centrado por lotes apenas se nota. En CIFAR-10 la jerarquía se invierte: el centrado por lotes se convierte en la diferencia entre aprender y colapsar, y la corrección sigmoide pasa a ser secundaria. Un componente que parece esencial en un conjunto de datos parece insignificante en otro. Si los investigadores se hubieran detenido en MNIST, como hace la mayor parte del trabajo en esta área, habrían concluido que el centrado de la señal de error no importa. Importa enormemente.

Este es el núcleo analítico del trabajo: el cuello de botella en la asignación de crédito no es una propiedad fija del método, es una propiedad de la tarea. Evaluar una regla de aprendizaje biológicamente plausible en un único punto de referencia y podrías certificar las decisiones de diseño equivocadas como verdades universales.

La misma lección, desde el lado del aprendizaje por refuerzo

El equipo también acopló Difusión de Errores a la Optimización de Política Proximal y lo ejecutó en las tareas de locomoción Brax de Google y en el punto de referencia abierto Craftax. Aquí los roles cambian de nuevo. En HalfCheetah, ED-PPO (retorno promedio de 5,494) supera al backprop-PPO estándar (3,520) y iguala a DFA. Pero en Craftax, DFA, el campeón de clasificación, es el método más débil, cayendo por debajo tanto de backprop como de Difusión de Errores. Las vías de retroalimentación aleatoria que son suficientes para el aprendizaje supervisado fallan en el aprendizaje por refuerzo complejo y exploratorio.

La imagen especular es deliberada: DFA es fuerte donde ED lucha y débil donde ED se mantiene. El mensaje en ambos dominios es idéntico. No hay una única tabla de clasificación que te diga qué método inspirado en el cerebro es "mejor", porque las debilidades de cada método solo se manifiestan bajo demandas de tareas específicas.

Lo que emerge por sí solo

Un hallazgo insinúa por qué estas redes restringidas se comportan como lo hacen. La inicialización 3:1 excitatoria a inhibidora se desvía, solo a través del entrenamiento, hacia un equilibrio aproximadamente 1:1, con capas más profundas volviéndose progresivamente más inhibidoras. Eso se asemeja a cómo se cree que los circuitos corticales se estabilizan en un equilibrio de excitación e inhibición durante la maduración, y llega sin ningún mecanismo de equilibrio explícito. Mientras tanto, el piso no negativo poda el 37.3% de los pesos a casi cero, afectando más a las conexiones inhibidoras (hasta un 68.8%), una forma de "gratis" de escasez, y una posible ventaja de hardware para chips analógicos, fotónicos o neuromórficos donde las sinapsis físicas codifican naturalmente cantidades no negativas.

El resultado honesto

El 62% en CIFAR-10 está lejos de lo que una red entrenada con gradiente convencional logra, y Sakana AI lo dice claramente. ED-PPO también tiene una varianza marcadamente mayor que backprop y tropieza en tareas que requieren una asignación de crédito temporal detallada. El valor aquí no es un modelo de última generación; es un mapa bien instrumentado de dónde se rompe el aprendizaje biológicamente restringido y por qué. Y la línea más nítida en ese mapa es metodológica: si el campo sigue calificando la IA similar al cerebro en conjuntos de datos de juguete, seguirá sacando conclusiones seguras que el siguiente conjunto de datos silenciosamente revertirá.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.