IA open source
Boris-2 nourrit son modèle 125M avec 90B tokens, et son 250M avec seulement 60B
Boris-2 pré-annonce trois petits modèles avec des budgets de tokens déséquilibrés : le 125M reçoit 90B tokens, le 250M seulement 60B. L'entraînement se déroule du 12 août au 10 septembre, sans benchmark partagé, seulement l'ambition déclarée d'atteindre la puissance de SmolLM2-135M.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-16 · 3 min de lecture

Boris-2 n'existe pas encore, et le post d'annonce l'assume. Le projet a présenté des plans pour trois petits modèles, le 75M, le 125M et le 250M, avec des fenêtres d'entraînement allant du 12 août au 10 septembre et des budgets de tokens qui donnent l'impression que quelqu'un a cessé de les trier par taille.
Le chiffre qui saute aux yeux est celui du milieu. Le modèle 125M doit s'entraîner sur 90B tokens, soit moitié plus que les 60B prévus pour le 250M. Le post répond à la question évidente avant même qu'elle ne soit posée. « La réponse directe, c'est le temps », dit-il. Entraîner un modèle plus gros prend plus de temps, et le projet s'attend à ce que le 250M prenne de toute façon l'avantage grâce à sa capacité brute.
Le calcul des tokens derrière le budget de 90B pour un modèle 125M
Convertissez ces budgets en tokens par paramètre et la répartition devient plus intéressante. Le 75M traite environ 347 tokens par paramètre pour un total de 26B, le 125M environ 720, et le 250M seulement 240. Le modèle intermédiaire reçoit le régime le plus copieux, le 250M le plus maigre, avec le 75M entre les deux. C'est délibéré. « Cela fait gagner du temps, tout en permettant au modèle 250M de dépasser le modèle 125M », explique le post.
| Modèle | Paramètres | Tokens d'entraînement | Tokens par paramètre | Début estimé |
|---|---|---|---|---|
| Boris-2-75M | 75M | 26B | ~347 | 12 août |
| Boris-2-125M | 125M | 90B | 720 | 20 août |
| Boris-2-250M | 250M | 60B | 240 | 10 septembre |
| BananaMind 2 Micro (référence) | 2.9M | 75B | ~25 900 | 3 août |
Un autre projet de petits modèles, BananaMind, pousse le ratio bien plus loin dans la même fenêtre. BananaMind 2 Micro embarque 2,9M de paramètres et un budget de 75B tokens, soit environ 25 900 tokens par paramètre, pour, selon les mots de l'équipe, « obtenir l'intelligence maximale par paramètre ». Le ratio le plus élevé de Boris-2, 720, n'approche pas cette intensité, et le projet s'appuie donc sur « l'architecture unique et le schéma de couches » qu'il dit tenter.
Un objectif fixé par l'espoir plutôt que par des benchmarks
Ce que Boris-2 propose comme référence, c'est la classe des modèles ouverts de 135M. Le projet dit espérer se situer près de la puissance de SmolLM2-135M et « dans la même gamme que AxiomicLabs/GPT-X2.5-135M ou BananaMind/BananaMind-2-Pro-Preview ». « Croisons les doigts » est l'expression clé. L'entraînement n'a pas commencé, aucun benchmark n'a été partagé, et l'objectif est présenté comme une aspiration plutôt qu'un résultat.
Les dates sont les seuls engagements fermes sur la table. Le 75M doit commencer son entraînement le 12 août, le 125M le 20 août, le 250M le 10 septembre. Aucune de ces dates n'est une date de sortie, et le post ne dit pas quand les modèles pourraient sortir.
La vague de surentraînement atteint les plus petits modèles
Boris-2 arrive à un moment où les petits modèles ouverts sont volontairement nourris avec des régimes de données surdimensionnés. BananaMind a fait le même type de pari sur son 2 Micro, avec un entraînement prévu pour commencer le 3 août et une sortie estimée du 4 au 6 août, aux côtés d'un aperçu public de BananaMind 2 Pro. Là non plus, aucun benchmark n'a été partagé. Le pari commun est que la densité des données peut remplacer l'échelle, et aucun des deux projets n'a encore de preuve à faire valoir.
Ce qui est vérifiable, c'est l'arithmétique, et l'arithmétique montre deux paris différents. BananaMind pousse les tokens par paramètre à l'extrême. Boris-2 répartit son budget de tokens de manière inégale, en favorisant le modèle intermédiaire, tout en espérant que l'architecture permette aux trois de surpasser leur nombre de paramètres.
Variantes, et la longue attente jusqu'au 12 août
La feuille de route ne s'arrête pas aux trois tailles de base. Boris-2 annonce qu'il enchaînera avec des variantes Pro, Instruct et Pro-Instruct. « Plus d'infos arriveront bientôt », conclut le post, ce qui est le seul calendrier proposé en dehors des dates d'entraînement.
Jusqu'au début du premier entraînement, Boris-2 est une spécification accompagnée de dates. Les chiffres sont publics, le raisonnement est public, et le résultat est entièrement non prouvé. Pour ceux qui suivent les petits modèles, c'est tout l'intérêt : un pari exposé au grand jour avant le moindre entraînement.
- Source : Boris-2 feeds its 125M model 90B tokens, its 250M just 60B — 2026-08-09
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.