SevenTnewSNoticias de IA y tecnología, explicadas

MiniCPM5-2B de OpenBMB: 2,52B de parámetros, ambiciones de 4B

Un modelo de 2,52B supera a rivales de 4B, en un benchmark que ejecutó su propio creador

Un modelo de 2,52B bajo Apache-2.0 que supera a bases abiertas de mayor tamaño en programación, uso de herramientas y contexto largo, con una tabla de benchmarks que, según OpenBMB, mezcla ejecuciones internas y de terceros.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-09-22 · 4 min de lectura

Un modelo de 2,52B supera a rivales de 4B, en un benchmark que ejecutó su propio creador

La propia tabla de benchmarks de OpenBMB para MiniCPM5-2B enumera cosas en las que un checkpoint de 2.500 millones de parámetros no debería destacar. Obtiene 69,1 en LiveCodeBench v6, 46,4 en SWE-bench Verified y 66,6 en BFCL v4, la prueba de llamada a funciones. El modelo en sí tiene unos 2.520 millones de parámetros, de los cuales aproximadamente 1.980 millones no son de embedding.

Ese tamaño es el punto. OpenBMB, el brazo de código abierto asociado a ModelBest, lanza MiniCPM5-2B como algo que un teléfono, un portátil o un equipo de borde puede alojar, en lugar de algo que sirve un clúster de GPU. Si los márgenes publicados sobreviven al contacto con pruebas independientes es la pregunta abierta, y los materiales del lanzamiento hacen que esa pregunta sea fácil de formular.

Qué ha lanzado realmente OpenBMB

MiniCPM5-2B es un modelo denso y no una mezcla de expertos, y llega bajo Apache-2.0. Es la segunda entrega de la línea MiniCPM5, después de MiniCPM5-1B. El contexto nativo llega a 131.072 tokens.

La arquitectura es deliberadamente poco llamativa, lo que a este tamaño cuenta como una ventaja. Usa un diseño estándar de LlamaForCausalLM: 42 capas con atención de consultas agrupadas, 16 cabezas de consulta y 2 cabezas de clave/valor. Como nada en el grafo es personalizado, los motores de inferencia convencionales pueden cargar los pesos sin una definición de modelo parcheada ni un kernel escrito a mano.

El promedio de 53,9 y quién ejecutó la prueba

En el conjunto comparativo de 34 benchmarks de OpenBMB, MiniCPM5-2B promedia 53,9. Eso lo sitúa por delante de varias bases abiertas de mayor tamaño en la misma tabla, incluidas Qwen3.5-4B con 51,1 y granite-4.2-3B con 42,7. Los pares del mismo tamaño, como LFM2.5-2.6B y Qwen3.5-2B, quedan más atrás.

La procedencia es la parte que merece una pausa. OpenBMB separa las filas procedentes de Artificial Analysis de las que reprodujo internamente, para que los lectores puedan distinguir ambos tipos de cifra. Un promedio mixto no es la misma afirmación que uno íntegramente externo, y 53,9 debe leerse en función de esa división, no por encima de ella.

BenchmarkMiniCPM5-2BQwen3.5-4B
Promedio de 34 benchmarks53,951,1
LiveCodeBench v669,156,4
SWE-bench Verified46,433,6
NoLiMa (contexto largo)68,143,5
MMLU-Pro70,878,0

Cifras tal como las publica OpenBMB, tomadas de filas reproducidas por el proveedor y de Artificial Analysis.

Dónde un modelo de 2B supera a uno de 4B, y dónde no

Las victorias se concentran en el trabajo agéntico. LiveCodeBench v6 arroja 69,1 frente a 56,4 de la referencia Qwen de 4B, SWE-bench Verified 46,4 frente a 33,6, y la recuperación de contexto largo de NoLiMa 68,1 frente a 43,5. OpenBMB también reporta τ²-Bench Telecom en 97,1 y BFCL v4 en 66,6.

Las filas de conocimiento intensivo cuentan la otra mitad de la historia. MMLU-Pro se sitúa en 70,8 para MiniCPM5-2B frente a 78,0 del modelo Qwen más grande, una brecha que va en la dirección opuesta. El posicionamiento de OpenBMB coincide con los datos: un compañero compacto para agentes y programación más que un gigante de conocimiento general.

Los 16 expertos detrás del salto

El post-entrenamiento se ejecuta mediante un pipeline que OpenBMB llama gestión por niveles UltraData. Comienza con un ajuste fino supervisado de razonamiento profundo sobre unos 400.000 millones de tokens, seguido de profesores especializados de aprendizaje por refuerzo para matemáticas, código, agentes y escritura, entrenados con un algoritmo basado en crítico que el laboratorio llama JustRL II. El paso final es una destilación on-policy que pliega 16 expertos de RL, cinco de ellos agénticos, en el único estudiante que se lanza.

OpenBMB atribuye a esa etapa de RL y destilación ganancias medias de unos 10,96 puntos en conjuntos de razonamiento y generales, y de 6,96 puntos en conjuntos agénticos. En lugar de pedir a los lectores que acepten la afirmación por fe, publicó los checkpoints intermedios Base, Midtrain y solo SFT, lo que permite a cualquiera medir cada contribución por separado.

En qué puedes ejecutarlo realmente

La cobertura de ejecución abarca vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio, MLX, LiteRT y compilaciones multichip de FlagOS. Los paquetes GGUF, MLX y GPTQ apuntan a asistentes locales que necesitan llamada a herramientas y contexto largo sin una GPU de centro de datos. Los corpus UltraData usados en el entrenamiento, que cubren web, código, matemáticas y muestras SFT y RL de agentes, también se publican.

Pesos, datos, checkpoints intermedios y compilaciones cuantizadas en un único lanzamiento reducen el coste de verificar el trabajo, algo lo bastante raro como para merecer decirse sin rodeos.

El promedio de 53,9 se citará. La cifra que decide si MiniCPM5-2B importa es más estrecha: cuánto de la ventaja en programación y llamada a herramientas sobre bases abiertas de 4B sobrevive cuando otra persona ejecuta el arnés. OpenBMB ha entregado lo necesario para averiguarlo.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.