Investigación en IA
Muon capta la suma modular más rápido y luego sus soluciones colapsan
Los transformadores entrenados con Muon captan la suma modular más rápido que con AdamW y luego pierden la solución en todas las configuraciones probadas. El artículo sitúa el colapso en la interfaz representación-lectura, donde congelar cualquiera de los dos grupos de parámetros lo previene. El análisis de Fourier muestra que el circuito de la tarea sobrevive y simplemente queda en minoría.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-19 · 4 min de lectura

El artículo, publicado en arXiv el 7 de agosto de 2026, trabaja en un escenario deliberadamente pequeño: un transformer que aprende suma modular, uno de los bancos de pruebas estándar en la investigación sobre grokking. El grokking es el efecto de generalización retardada en el que una red memoriza su conjunto de entrenamiento durante un largo tramo y luego salta de repente a una solución generalizadora. En la división que los autores tratan como estándar, Muon toma las matrices ocultas y AdamW toma los embeddings y la cabeza de salida. Muon alcanza el estado generalizador más rápido. Luego lo pierde, en cada una de las nueve configuraciones probadas.
El resultado central: Muon capta más rápido y luego se desmorona
Las nueve configuraciones sobre (a+b) mod 113 captan y luego caen por debajo del umbral de generalización. La inestabilidad no es una casualidad de una única configuración. Persiste a través de dos módulos, dos anchos, dos fracciones de entrenamiento, la variante de resta y diferentes profundidades. La referencia de AdamW seleccionada tampoco es inmune: en cinco semillas cae por debajo del umbral en cuatro de ellas, con un mínimo de 27,59 %.
Algunos números muestran la forma del problema.
| Señal | Valor |
|---|---|
| Configuraciones que captan y luego colapsan | 9 de 9 en (a+b) mod 113 |
| Semillas de referencia de AdamW por debajo del umbral | 4 de 5, con un mínimo de 27,59 % |
| Elasticidad del tamaño de paso | -0,03 (Muon) vs +1,5 (AdamW) |
| Movimiento del grupo de Muon por parámetro | 8,0 veces más rápido |
| Evaluaciones bajo el umbral, brazos no congelados | 137-321 (congelados: ninguna) |
| Pares conjugados efectivos tras retirar la maquinaria de Muon | de 326 a 4 |
| Familia alineada con la tarea sola vs modelo completo | 100 % vs 45,85 % durante el enmascarado |
| Coseno de la distribución de potencia a lo largo del colapso | 0,9899 |
La conclusión principal es que una ejecución de entrenamiento que resuelve el conjunto de entrenamiento y luego generaliza puede igualmente desmoronarse después, sin nuevos datos a la vista. Ese es el enigma que el artículo se propone explicar.
Dónde se localiza el fallo: la interfaz representación-lectura
Los autores atribuyen el colapso a la interfaz entre las representaciones aprendidas y la capa de lectura. Un detalle técnico importa: esa interfaz solo puede identificarse de forma conjunta, salvo por un mapa invertible que la pérdida no selecciona. A la pérdida de entrenamiento simplemente no le importa en qué miembro de esa clase de equivalencia aterriza la red.
Una vez resuelto el conjunto de entrenamiento, el gradiente cae a alrededor de 1e-6. Ahí es donde los dos optimizadores se separan. La elasticidad del tamaño de paso es de -0,03 para Muon frente a +1,5 para AdamW, y el grupo de Muon se mueve 8,0 veces más rápido por parámetro. Un gradiente cercano a cero no es un lugar tranquilo para Muon. Sus actualizaciones todavía tienen margen para causar daño.
Congelar un grupo elimina el fallo
Los experimentos causales son la parte más limpia del artículo. Partiendo de estados iniciales idénticos bit a bit, congelar cualquiera de los dos grupos previene el fallo. Congelar los embeddings y la capa de lectura lo elimina en cinco ejecuciones que abarcan 451 400 pasos posteriores al grokking y cinco semillas emparejadas. Los brazos no congelados registran entre 137 y 321 evaluaciones bajo el umbral. Los brazos congelados no registran ninguna.
Eliminar la normalización y la ortogonalización de Muon no es una solución. Sin ellas, la representación colapsa de 326 pares conjugados efectivos a 4, no muestra colapso recurrente y falla de forma terminal. La inestabilidad está ligada a la propia maquinaria de actualización de Muon, no a algo genérico de la aritmética modular.
Análisis de Fourier: el circuito sobrevive y queda en minoría
El filtrado de Fourier separa dos modos de fallo distintos. A lo largo de 43 checkpoints, cinco semillas y tres regímenes, la familia alineada con la tarea alcanza exactamente el 100 % de precisión cuando se evalúa por sí sola. En el fallo de circuito, esa familia ya no resuelve la tarea. En el enmascarado, se mantiene perfecta mientras el modelo completo se sitúa en el 45,85 %. El circuito alineado mantiene un margen positivo en cada ejemplo, incluidos los errores. Simplemente queda en minoría frente a un resto adversario casi igual. Reescalar la familia restaura el 99,9 %.
Los autores interpretan el grokking como la misma condición resolviéndose en la otra dirección. Los detalles estructurales respaldan esta lectura: la tarea selecciona la familia, intercambiando (k,k) por (k,-k) bajo la resta, y a lo largo de un colapso abrupto el soporte estándar de Fourier no cambia, con el coseno de la distribución de potencia en 0,9899. El cálculo sigue ahí. Lo que cambia es cuánto lo deja contar la capa de lectura.
Qué significa esto para los benchmarks de optimizadores
La conclusión obvia es que la velocidad de grokking es una métrica de éxito débil por sí sola. Una ejecución que alcanza primero el estado generalizador no es claramente mejor si no puede mantener ese estado. Las comparaciones de optimizadores que se detienen en la curva de grokking están midiendo la primera mitad de la historia.
Primero, las advertencias. Esta es una familia de tareas, la aritmética modular, a pequeña escala, y el artículo es un preprint. Nada en el resumen afirma que el efecto se traslade al entrenamiento a gran escala. Lo que sí ofrece es un hábito concreto para el próximo benchmark que ejecutes: comprobar la estabilidad posterior al grokking, no solo el tiempo hasta el grokking.
En estas tareas pequeñas, la diferencia entre los dos optimizadores no es quién aprende primero. Es quién sigue teniendo razón una vez que la pérdida se ha quedado en silencio.
- Fuente : Muon groks modular addition faster, then its solutions collapse — 2026-08-07
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.