SevenTnewS

Recherche en IA

Memory Decoder : une mémoire greffée de 6,9B fait battre Pythia-12B par un modèle de 410M

Memory Decoder at Scale sépare la mémoire à long terme du raisonnement dans les LLM. Une mémoire pré-entraînée de 6,9B a fait passer Pythia-410M devant Pythia-12B sur 17 benchmarks avec 39 % de paramètres en moins ; des mémoires de domaine de 1,7B ont ajouté plus de 9 points à Qwen3 Base à toutes les échelles testées.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-31 · Dernière mise à jour : 2026-08-02 · 3 min de lecture

Memory Decoder : une mémoire greffée de 6,9B fait battre Pythia-12B par un modèle de 410M

Le chiffre le plus utile de l'article Memory Decoder at Scale, publié sur arXiv le 30 juillet, n'est pas un score de benchmark. C'est 39, le pourcentage de paramètres totaux dont vous n'avez apparemment plus besoin si vous cessez de dépenser tout votre budget dans un modèle de base plus gros et en consacrez une partie à un module de mémoire pré-entraîné.

Les modèles de langage decoder-only confondent mémoire à long terme et raisonnement dans un même ensemble de paramètres, plaident les auteurs, ce qui rend la capacité mémoire difficile à développer seule. Memory Decoder, un module de mémoire paramétrique à long terme issu de travaux antérieurs, sépare les deux. La version précédente n'avait toutefois été étudiée qu'à petite échelle. Le nouvel article la fait passer à l'échelle : des modules de mémoire allant jusqu'à 6,9B de paramètres, pré-entraînés sur 300B de tokens, sont rattachés à des modèles de base allant de 410M à 14B de paramètres.

Un modèle de 410M avec une mise à niveau mémoire bat un modèle de 12B

Le résultat phare est une paire tueuse de géants. Sur 17 benchmarks, un module de mémoire générale de 6,9B rattaché à Pythia-410M fait passer son score moyen de 29,86 à 37,34. Pythia-12B, le modèle bien plus grand, obtient en moyenne 37,24. Le modèle de 410M équipé de mémoire sort en tête avec environ 7,3B de paramètres totaux contre 12B pour Pythia-12B, une différence que l'article présente comme 39 % de paramètres en moins.

La marge est de 0,10 point, ce qui n'est pas rien sur une moyenne de 17 benchmarks, et l'argument porte sur le coût : la facture totale en paramètres plus légère achète des scores égaux ou supérieurs.

Le schéma se répète sur une autre famille. Pour les modèles Qwen3 Base allant de 0,6B à 14B de paramètres, des mémoires de domaine de 1,7B ont amélioré le score moyen sur les trois domaines de plus de 9 points à chaque échelle testée. Quelle que soit la taille du modèle de base, acheter de la mémoire a mieux rapporté qu'acheter des paramètres.

Le mur de la récupération

Le passage à l'échelle de la mémoire cesse d'être une pure question de paramètres une fois que la phase de pré-entraînement atteint 300B de tokens. Le coût combiné de l'indexation et de la recherche rend un pipeline Faiss standard irréalisable à cette échelle de données, écrivent les auteurs. Leur solution est un pipeline distribué pour l'indexation et la récupération Faiss, combiné à un chargement sparse et par lots des distributions kNN.

Ce détail d'infrastructure mérite d'être explicité car c'est le véritable coût de l'architecture. Un module de mémoire n'améliore un modèle que si la récupération suit le rythme. Toute équipe souhaitant reproduire les résultats ou les prolonger hérite de ce problème d'ingénierie au lieu d'un simple chemin de téléchargement de paramètres supplémentaires.

Les chiffres en un coup d'œil

Voici la comparaison centrale sur laquelle s'appuie l'article :

ConfigurationScore moyen (17 benchmarks)Paramètres totaux
Pythia-410M seul29,860,41B
Pythia-410M + mémoire 6,9B37,34~7,3B
Pythia-12B37,2412B

Le chiffre d'environ 7,3B est le résultat arithmétique des chiffres de l'article : 0,41B de base plus 6,9B de mémoire, ce qui explique exactement pourquoi l'article peut revendiquer 39 % de paramètres en moins par rapport à 12B.

Ce que cela signifie pour les budgets de passage à l'échelle

La thèse plus large est architecturale : la mémoire et le raisonnement ne devraient pas avoir à se disputer les mêmes paramètres. Si une grande mémoire peut être pré-entraînée une fois et réutilisée sur différents modèles de base, alors améliorer un modèle devient une question de mise à niveau de la mémoire plutôt que de reconstruction de toute la pile. Les chiffres Qwen3 appuient cette lecture, puisque des mémoires de domaine de 1,7B ont amélioré chaque modèle de base auquel elles étaient rattachées.

Les questions ouvertes sont plus nombreuses que les réponses. Les modules de mémoire plafonnent à 6,9B de paramètres et la phase de pré-entraînement à 300B de tokens, donc on ne sait pas si le compromis continue de favoriser la mémoire au-delà de ces limites. Les scores sont des moyennes sur 17 benchmarks, ce qui peut masquer les domaines où la mémoire aide et ceux où elle n'aide pas. Et un modèle équipé de mémoire embarque une infrastructure de récupération que les nombres de paramètres ne capturent pas, un coût de déploiement qui ne se manifeste qu'en production.

L'article est apparu sur arXiv le 30 juillet et sa page de projet a recueilli 48 votes positifs sur HuggingFace, un signal communautaire modeste indiquant que le milieu du passage à l'échelle a remarqué. Rien de tout cela ne retire le passage à l'échelle du modèle de base. Cela donne aux laboratoires un second bouton, et les chiffres de l'article suggèrent que ce bouton a été sous-évalué.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.