SevenTnewSL'actu IA & tech, expliquée

MiniCPM5-2B d'OpenBMB : 2,52 Md de paramètres, des ambitions de 4 Md

Un modèle de 2,52 Md de paramètres devance ses rivaux de 4 Md, sur un benchmark organisé par son propre créateur

Un modèle Apache-2.0 de 2,52 Md de paramètres qui bat des bases ouvertes plus grandes en codage, en utilisation d'outils et en contexte long, avec un tableau de benchmarks dont OpenBMB indique qu'il mêle exécutions internes et exécutions tierces.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-09-22 · 4 min de lecture

Un modèle de 2,52 Md de paramètres devance ses rivaux de 4 Md, sur un benchmark organisé par son propre créateur

Le tableau de benchmarks publié par OpenBMB pour MiniCPM5-2B recense des résultats auxquels un checkpoint de 2,5 milliards de paramètres n'est pas censé être bon. Il obtient 69,1 sur LiveCodeBench v6, 46,4 sur SWE-bench Verified et 66,6 sur BFCL v4, le test d'appel de fonctions. Le modèle compte environ 2,52 milliards de paramètres, dont près de 1,98 milliard ne relèvent pas des embeddings.

Cette empreinte est tout l'intérêt. OpenBMB, la branche open source associée à ModelBest, livre MiniCPM5-2B comme un modèle qu'un téléphone, un ordinateur portable ou une machine en périphérie peuvent héberger, plutôt qu'un modèle servi par un cluster de GPU. Savoir si les écarts publiés résistent au contact de tests indépendants reste la question ouverte, et les documents de publication rendent cette question facile à poser.

Ce qu'OpenBMB a réellement livré

MiniCPM5-2B est un modèle dense et non un mélange d'experts, et il est publié sous Apache-2.0. C'est la deuxième sortie de la gamme MiniCPM5, après MiniCPM5-1B. Le contexte natif atteint 131 072 tokens.

L'architecture est délibérément banale, ce qui compte comme un atout à cette taille. Elle utilise une configuration LlamaForCausalLM standard : 42 couches avec attention à requêtes groupées, 16 têtes de requête et 2 têtes clé/valeur. Comme rien dans le graphe n'est spécifique, les moteurs d'inférence courants peuvent charger les poids sans définition de modèle patchée ni noyau écrit à la main.

La moyenne de 53,9 et qui a fait tourner le test

Sur l'ensemble de comparaison de 34 benchmarks d'OpenBMB, MiniCPM5-2B obtient une moyenne de 53,9. Cela le place devant plusieurs bases ouvertes plus grandes du même tableau, dont Qwen3.5-4B à 51,1 et granite-4.2-3B à 42,7. Des pairs de même taille comme LFM2.5-2.6B et Qwen3.5-2B se situent plus loin derrière.

La provenance est l'élément pour lequel il vaut la peine de ralentir. OpenBMB distingue les lignes issues d'Artificial Analysis de celles qu'il a reproduites en interne, afin que les lecteurs puissent faire la différence entre les deux types de chiffres. Une moyenne mixte ne constitue pas la même affirmation qu'une moyenne entièrement externe, et 53,9 doit se lire au regard de cette séparation, et non au-dessus d'elle.

BenchmarkMiniCPM5-2BQwen3.5-4B
Moyenne sur 34 benchmarks53,951,1
LiveCodeBench v669,156,4
SWE-bench Verified46,433,6
NoLiMa (contexte long)68,143,5
MMLU-Pro70,878,0

Chiffres tels que publiés par OpenBMB, issus de lignes reproduites par le fournisseur et de lignes d'Artificial Analysis.

Là où un modèle 2B bat un 4B, et là où il n'y parvient pas

Les victoires se concentrent sur le travail agentique. LiveCodeBench v6 affiche 69,1 contre 56,4 pour la référence Qwen 4B, SWE-bench Verified 46,4 contre 33,6, et la récupération en contexte long de NoLiMa 68,1 contre 43,5. OpenBMB rapporte aussi 97,1 sur τ²-Bench Telecom et 66,6 sur BFCL v4.

Les lignes à forte composante de connaissances racontent l'autre moitié de l'histoire. MMLU-Pro s'établit à 70,8 pour MiniCPM5-2B contre 78,0 pour le modèle Qwen plus grand, un écart qui joue dans la direction opposée. Le positionnement d'OpenBMB correspond aux données : un agent compact et un compagnon de codage plutôt qu'un géant des connaissances générales.

Les 16 experts derrière le bond

Le post-entraînement passe par un pipeline qu'OpenBMB appelle UltraData tiered management. Il commence par un affinage supervisé de deep thinking sur environ 400 milliards de tokens, suivi de professeurs spécialisés en apprentissage par renforcement pour les mathématiques, le code, les agents et l'écriture, entraînés avec un algorithme fondé sur un critique que le laboratoire appelle JustRL II. La dernière étape est une distillation on-policy qui fusionne 16 experts RL, dont cinq agentiques, dans l'unique élève livré.

OpenBMB attribue à cette étape de RL et de distillation des gains moyens d'environ 10,96 points sur les suites de raisonnement et générales, et de 6,96 points sur les suites agentiques. Plutôt que de demander aux lecteurs d'accepter cette affirmation sur parole, il a publié les checkpoints intermédiaires Base, Midtrain et SFT-only, ce qui permet à quiconque de mesurer chaque contribution isolément.

Sur quoi on peut réellement l'exécuter

La couverture d'exécution s'étend à vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT et aux builds multi-puces FlagOS. Les paquets GGUF, MLX et GPTQ visent les assistants locaux qui ont besoin d'appel d'outils et de contexte long sans GPU de datacenter. Les corpus UltraData utilisés pour l'entraînement, couvrant le web, le code, les mathématiques et les échantillons SFT et RL d'agents, sont également publiés.

Des poids, des données, des checkpoints intermédiaires et des versions quantifiées dans une seule publication réduisent le coût de vérification du travail, ce qui est assez rare pour être dit clairement.

La moyenne de 53,9 sera citée. Le chiffre qui décidera si MiniCPM5-2B compte est plus étroit : quelle part de l'avance en codage et en appel d'outils sur les bases ouvertes de 4 Md subsiste quand quelqu'un d'autre fait tourner le harnais. OpenBMB a fourni ce qu'il faut pour le savoir.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.