Prépublication arXiv
4 published articles
Recherche en IA
Muon grokke l'addition modulaire plus vite, puis ses solutions s'effondrent
Les transformeurs entraînés par Muon grokkent l'addition modulaire plus vite que AdamW, puis perdent la solution dans toutes les configurations testées. L'article attribue l'effondrement à l'interface représentation-lecture, où geler l'un ou l'autre groupe de paramètres l'empêche. L'analyse de Fourier montre que le circuit de la tâche survit et se trouve simplement mis en minorité.
2026-08-19
Fisher-R1 | Test d'hypothèses
Les agents IA produisent des statistiques sans faille et tirent pourtant de mauvaises conclusions
Les agents qui automatisent les tests d'hypothèses peuvent exécuter des analyses sans faille tout en parvenant à de mauvaises conclusions, car la plupart des benchmarks ne vérifient jamais si la valeur p est valide. Un benchmark de 425 tâches quantifie cet écart, et un modèle open-weight entraîné par RL en comble une partie.
2026-08-19
IA clinique
nMAS automatise l'ingénierie des caractéristiques EHR de l'insuffisance cardiaque, testé uniquement sur 500 patients factices
nMAS, un pipeline multi-agents, a généré 132 caractéristiques structurées et 70 caractéristiques notées par rubrique à partir de 500 dossiers patients factices, faisant passer l'AUROC de phénotypage HFrEF sur l'ensemble de validation de 0,895 à 0,963. La prépublication n'a pas été validée sur des données réelles de patients.
2026-08-13
Recherche en IA
Un petit contrôleur de surveillance améliore de 4,5 points les scores des LLM quantifiés sur MATH-500
Une nouvelle recherche propose un contrôleur de surveillance externe pour les petits modèles de langage quantifiés, qui détecte les chemins de raisonnement répétitifs ou dégénérés et déclenche un retour en arrière et un re-décodage contraint. La précision s'est améliorée de 4,5 points de pourcentage sur un large ensemble d'évaluation, mais les auteurs soulignent que les résultats ne sont pas confirmatoires.
2026-07-30