SevenTnewS

Investigación en IA

Muon capta la suma modular más rápido y luego sus soluciones colapsan

Los transformadores entrenados con Muon captan la suma modular más rápido que con AdamW y luego pierden la solución en todas las configuraciones probadas. El artículo sitúa el colapso en la interfaz representación-lectura, donde congelar cualquiera de los dos grupos de parámetros lo previene. El análisis de Fourier muestra que el circuito de la tarea sobrevive y simplemente queda en minoría.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-19 · 4 min de lectura

Muon capta la suma modular más rápido y luego sus soluciones colapsan

El artículo, publicado en arXiv el 7 de agosto de 2026, trabaja en un escenario deliberadamente pequeño: un transformer que aprende suma modular, uno de los bancos de pruebas estándar en la investigación sobre grokking. El grokking es el efecto de generalización retardada en el que una red memoriza su conjunto de entrenamiento durante un largo tramo y luego salta de repente a una solución generalizadora. En la división que los autores tratan como estándar, Muon toma las matrices ocultas y AdamW toma los embeddings y la cabeza de salida. Muon alcanza el estado generalizador más rápido. Luego lo pierde, en cada una de las nueve configuraciones probadas.

El resultado central: Muon capta más rápido y luego se desmorona

Las nueve configuraciones sobre (a+b) mod 113 captan y luego caen por debajo del umbral de generalización. La inestabilidad no es una casualidad de una única configuración. Persiste a través de dos módulos, dos anchos, dos fracciones de entrenamiento, la variante de resta y diferentes profundidades. La referencia de AdamW seleccionada tampoco es inmune: en cinco semillas cae por debajo del umbral en cuatro de ellas, con un mínimo de 27,59 %.

Algunos números muestran la forma del problema.

SeñalValor
Configuraciones que captan y luego colapsan9 de 9 en (a+b) mod 113
Semillas de referencia de AdamW por debajo del umbral4 de 5, con un mínimo de 27,59 %
Elasticidad del tamaño de paso-0,03 (Muon) vs +1,5 (AdamW)
Movimiento del grupo de Muon por parámetro8,0 veces más rápido
Evaluaciones bajo el umbral, brazos no congelados137-321 (congelados: ninguna)
Pares conjugados efectivos tras retirar la maquinaria de Muonde 326 a 4
Familia alineada con la tarea sola vs modelo completo100 % vs 45,85 % durante el enmascarado
Coseno de la distribución de potencia a lo largo del colapso0,9899

La conclusión principal es que una ejecución de entrenamiento que resuelve el conjunto de entrenamiento y luego generaliza puede igualmente desmoronarse después, sin nuevos datos a la vista. Ese es el enigma que el artículo se propone explicar.

Dónde se localiza el fallo: la interfaz representación-lectura

Los autores atribuyen el colapso a la interfaz entre las representaciones aprendidas y la capa de lectura. Un detalle técnico importa: esa interfaz solo puede identificarse de forma conjunta, salvo por un mapa invertible que la pérdida no selecciona. A la pérdida de entrenamiento simplemente no le importa en qué miembro de esa clase de equivalencia aterriza la red.

Una vez resuelto el conjunto de entrenamiento, el gradiente cae a alrededor de 1e-6. Ahí es donde los dos optimizadores se separan. La elasticidad del tamaño de paso es de -0,03 para Muon frente a +1,5 para AdamW, y el grupo de Muon se mueve 8,0 veces más rápido por parámetro. Un gradiente cercano a cero no es un lugar tranquilo para Muon. Sus actualizaciones todavía tienen margen para causar daño.

Congelar un grupo elimina el fallo

Los experimentos causales son la parte más limpia del artículo. Partiendo de estados iniciales idénticos bit a bit, congelar cualquiera de los dos grupos previene el fallo. Congelar los embeddings y la capa de lectura lo elimina en cinco ejecuciones que abarcan 451 400 pasos posteriores al grokking y cinco semillas emparejadas. Los brazos no congelados registran entre 137 y 321 evaluaciones bajo el umbral. Los brazos congelados no registran ninguna.

Eliminar la normalización y la ortogonalización de Muon no es una solución. Sin ellas, la representación colapsa de 326 pares conjugados efectivos a 4, no muestra colapso recurrente y falla de forma terminal. La inestabilidad está ligada a la propia maquinaria de actualización de Muon, no a algo genérico de la aritmética modular.

Análisis de Fourier: el circuito sobrevive y queda en minoría

El filtrado de Fourier separa dos modos de fallo distintos. A lo largo de 43 checkpoints, cinco semillas y tres regímenes, la familia alineada con la tarea alcanza exactamente el 100 % de precisión cuando se evalúa por sí sola. En el fallo de circuito, esa familia ya no resuelve la tarea. En el enmascarado, se mantiene perfecta mientras el modelo completo se sitúa en el 45,85 %. El circuito alineado mantiene un margen positivo en cada ejemplo, incluidos los errores. Simplemente queda en minoría frente a un resto adversario casi igual. Reescalar la familia restaura el 99,9 %.

Los autores interpretan el grokking como la misma condición resolviéndose en la otra dirección. Los detalles estructurales respaldan esta lectura: la tarea selecciona la familia, intercambiando (k,k) por (k,-k) bajo la resta, y a lo largo de un colapso abrupto el soporte estándar de Fourier no cambia, con el coseno de la distribución de potencia en 0,9899. El cálculo sigue ahí. Lo que cambia es cuánto lo deja contar la capa de lectura.

Qué significa esto para los benchmarks de optimizadores

La conclusión obvia es que la velocidad de grokking es una métrica de éxito débil por sí sola. Una ejecución que alcanza primero el estado generalizador no es claramente mejor si no puede mantener ese estado. Las comparaciones de optimizadores que se detienen en la curva de grokking están midiendo la primera mitad de la historia.

Primero, las advertencias. Esta es una familia de tareas, la aritmética modular, a pequeña escala, y el artículo es un preprint. Nada en el resumen afirma que el efecto se traslade al entrenamiento a gran escala. Lo que sí ofrece es un hábito concreto para el próximo benchmark que ejecutes: comprobar la estabilidad posterior al grokking, no solo el tiempo hasta el grokking.

En estas tareas pequeñas, la diferencia entre los dos optimizadores no es quién aprende primero. Es quién sigue teniendo razón una vez que la pérdida se ha quedado en silencio.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.