SevenTnewS

Course des petits modèles

BananaMind 2 Micro : 2,9M de paramètres, 75B de jetons et un pari sur un surentraînement extrême

BananaMind 2 Micro comptera 2,9M de paramètres et sera entraîné sur 75B de jetons, soit environ 25 900 jetons par paramètre. L'entraînement commence le 3 août, la sortie est estimée du 4 au 6 août, et un aperçu public de BananaMind 2 Pro arrive le même jour. Aucun benchmark n'a été partagé.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-06 · 4 min de lecture

BananaMind 2 Micro : 2,9M de paramètres, 75B de jetons et un pari sur un surentraînement extrême

BananaMind a annoncé BananaMind 2 Micro, le plus petit modèle de sa famille BananaMind 2, avec une réserve inhabituelle : le modèle n'existe pas encore. L'entraînement n'a pas commencé, précise le billet d'annonce, et rien n'a été publié. Ce qui existe, c'est une spécification, et c'est elle qui fait l'histoire. BananaMind 2 Micro utilisera 2,9M de paramètres tout en étant surentraîné sur 75B de jetons « pour obtenir l'intelligence maximale par paramètre », selon les propres termes de l'équipe.

Le calendrier est tout aussi précis. L'entraînement commence le 3 août et la date de sortie est estimée du 4 au 6 août. Le jour même où l'entraînement débute, BananaMind indique qu'elle publiera un aperçu public de BananaMind 2 Pro, que le billet ne mentionne que par son nom.

Les chiffres en un coup d'œil :

ModèleParamètresJetons d'entraînementJetons par paramètre
BananaMind 2 Micro2,9M75B~25 900
Gemma 4, plus petite configuration2,3Bn/an/a
Gemma 3, précédent modèle phare27Bn/an/a

25 900 jetons par paramètre, et un déséquilibre délibéré

Les deux chiffres clés méritent d'être lus ensemble. 75B de jetons répartis sur 2,9M de paramètres représentent environ 25 900 jetons pour chaque paramètre du modèle. Pour un modèle aussi petit, le ratio est délibérément déséquilibré. Le mot choisi par l'équipe, « surentraîné », indique que ce déséquilibre est la stratégie plutôt qu'un effet secondaire : nourrir un modèle minuscule avec un volume de données énorme, puis observer combien de capacité survit par paramètre.

Le billet ne fournit aucun score de benchmark, aucun résultat d'évaluation, aucune comparaison. La promesse d'« intelligence maximale par paramètre » n'est, à ce stade, qu'une intention, sans aucun élément public vérifiable pour l'étayer. Savoir si 25 900 jetons par paramètre procurent une capacité réelle est une question à laquelle seule la session d'entraînement d'août pourra répondre.

Muon à la place d'AdamW, plus une porte issue de la TX4

Trois changements techniques accompagnent l'annonce. BananaMind abandonne AdamW au profit de l'optimiseur Muon, qui offre, selon l'équipe, une convergence jusqu'à 2 fois plus rapide et tolère un taux d'apprentissage plus élevé. Le taux d'apprentissage passe à 2.2e-2. Le modèle gagne aussi ce que l'équipe appelle la XSA refresh gate de l'architecture TX4, intégrée dans la conception propre de BananaMind. AdamW a été l'optimiseur par défaut d'une grande partie des récents entraînements à grande échelle du secteur ; un abandon public de cet optimiseur est donc le genre de détail qui signale une équipe qui optimise toutes les variables à la fois.

C'est là toute l'étendue des détails divulgués. Le billet n'explique pas comment le chiffre de convergence de 2x a été mesuré, ce que fait la refresh gate, ni d'où vient l'architecture TX4. Chaque affirmation repose sur la seule description de l'équipe, sans validation externe, et les dates comportent la même réserve : la fenêtre de sortie est une estimation, pas un engagement.

Un pari taillé pour la course aux petits modèles

Le calendrier donne son contexte à l'annonce. Google DeepMind affirme que le plus petit modèle de sa génération Gemma 4, avec 2,3B de paramètres, égale les performances du modèle Gemma 3 de 27B, soit un gain de 10x en efficacité de paramètres en une seule génération, et que Gemma 4 a introduit le mode de réflexion dans les poids ouverts, auparavant réservé aux modèles fermés. BananaMind 2 Micro se situe environ 800 fois en dessous de cette échelle de 2,3B. Ce n'est pas une baisse progressive. C'est une catégorie de poids différente, et l'annonce se lit comme une prise de position délibérée pour cette catégorie.

Les manques sont aussi visibles que l'ambition. Aucun benchmark, aucune démonstration, aucun mot sur le matériel d'entraînement ni les conditions de licence. La fenêtre est courte : si l'entraînement commence le 3 août et que la sortie intervient dans la fourchette estimée du 4 au 6 août, l'équipe sous-entend soit une session de 75B de jetons qui tient en quelques jours, soit un calendrier délibérément flexible. Le billet ne le dit pas. Ce qu'il dit, c'est que BananaMind est prête à parier sur le degré extrême de surentraînement. Si un modèle de 2,9M de paramètres avec autant de données derrière lui fonctionne, l'économie des petits modèles bouge à nouveau. Si ce n'est pas le cas, le secteur apprend où se situe la limite. Dans les deux cas, le 3 août tranchera une partie du débat.

BananaMind 2 Pro n'apparaît dans l'annonce que comme un nom et une date. Son aperçu public arrive le 3 août. Aucun nombre de paramètres, aucune capacité, aucun autre détail.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.