SevenTnewS

Carrera de modelos pequeños

BananaMind 2 Micro: 2.9M de parámetros, 75B de tokens y una apuesta extrema por el sobreentrenamiento

BananaMind 2 Micro tendrá 2.9M de parámetros y se entrenará con 75B de tokens, aproximadamente 25,900 tokens por parámetro. El entrenamiento comienza el 3 de agosto, el lanzamiento está estimado del 4 al 6 de agosto, y una vista previa pública de BananaMind 2 Pro llega el mismo día. No se han compartido benchmarks.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-06 · 4 min de lectura

BananaMind 2 Micro: 2.9M de parámetros, 75B de tokens y una apuesta extrema por el sobreentrenamiento

BananaMind ha anunciado BananaMind 2 Micro, el modelo más pequeño de su familia BananaMind 2, con una advertencia inusual: el modelo aún no existe. Según la publicación del anuncio, el entrenamiento no ha comenzado y no se ha lanzado nada. Lo que existe es una especificación, y esa especificación es la historia. BananaMind 2 Micro usará 2.9M de parámetros y será sobreentrenado con 75B de tokens "para obtener la máxima inteligencia por parámetro", en palabras del propio equipo.

El cronograma es igualmente específico. El entrenamiento comienza el 3 de agosto y la fecha de lanzamiento está estimada del 4 al 6 de agosto. El mismo día en que comienza el entrenamiento, BananaMind dice que lanzará una vista previa pública de BananaMind 2 Pro, que la publicación menciona solo por nombre.

Los números de un vistazo:

ModeloParámetrosTokens de entrenamientoTokens por parámetro
BananaMind 2 Micro2.9M75B~25,900
Gemma 4, configuración más pequeña2.3Bn/an/a
Gemma 3, modelo insignia anterior27Bn/an/a

25,900 tokens por parámetro y un desequilibrio deliberado

Las dos cifras principales merecen leerse juntas. 75B de tokens distribuidos en 2.9M de parámetros equivalen a aproximadamente 25,900 tokens por cada parámetro del modelo. Para un modelo tan pequeño, la proporción es deliberadamente desigual. La palabra que eligió el equipo, "sobreentrenado", indica que el desequilibrio es la estrategia y no un efecto secundario: alimentar a un modelo diminuto con un volumen enorme de datos y ver cuánta capacidad sobrevive por parámetro.

La publicación no ofrece puntuaciones de benchmarks, ni resultados de evaluación, ni comparaciones. La promesa de "máxima inteligencia por parámetro" es, por ahora, una intención respaldada por nada público que pueda verificarse. Si 25,900 tokens por parámetro compran capacidad real es una pregunta que solo la ejecución de entrenamiento de agosto puede responder.

Muon en lugar de AdamW, más un gate del TX4

Tres cambios técnicos acompañan el anuncio. BananaMind deja AdamW en favor del optimizador Muon, que según afirma ofrece una convergencia hasta 2 veces más rápida y tolera una tasa de aprendizaje más alta. La tasa de aprendizaje pasa a 2.2e-2. El modelo también incorpora lo que el equipo llama el XSA refresh gate de la arquitectura TX4, integrada en el diseño propio de BananaMind. AdamW ha sido el optimizador predeterminado en gran parte del reciente entrenamiento a gran escala del campo, así que un movimiento público para alejarse de él es el tipo de detalle que indica a un equipo optimizando todas las variables a la vez.

Ese es todo el detalle revelado. La publicación no explica cómo se midió la cifra de convergencia 2x, qué hace el refresh gate o de dónde viene la arquitectura TX4. Cada afirmación se apoya en la propia descripción del equipo, sin validación externa adjunta, y las fechas conllevan la misma advertencia: la ventana de lanzamiento es una estimación, no un compromiso.

Una apuesta hecha para la carrera de modelos pequeños

La sincronización le da al anuncio su contexto. Google DeepMind dice que el modelo más pequeño de su generación Gemma 4, con 2.3B de parámetros, iguala el rendimiento del modelo de 27B de Gemma 3, una ganancia de eficiencia de parámetros de 10x en una generación, y Gemma 4 llevó el modo de pensamiento a los pesos abiertos, antes dominio de los modelos cerrados. BananaMind 2 Micro se sitúa aproximadamente 800 veces por debajo incluso de esa escala de 2.3B. Esto no es un paso descendente incremental. Es una categoría de peso diferente, y el anuncio se lee como una declaración de posicionamiento deliberada para ella.

Las brechas son tan visibles como la ambición. Sin benchmarks, sin demostración, sin una palabra sobre el hardware de entrenamiento o los términos de licencia. La ventana es corta: si el entrenamiento comienza el 3 de agosto y el lanzamiento cae en algún punto de la ventana estimada del 4 al 6 de agosto, el equipo está sugiriendo o una ejecución de 75B de tokens que cabe en días o un cronograma deliberadamente flexible. La publicación no dice cuál. Lo que sí dice es que BananaMind se siente cómodo apostando por el extremo del sobreentrenamiento. Si un modelo de 2.9M de parámetros con esa cantidad de datos detrás funciona, la economía de los modelos pequeños se mueve de nuevo. Si no funciona, el campo aprende dónde está el límite. De cualquier manera, el 3 de agosto resuelve parte de la discusión.

BananaMind 2 Pro aparece en el anuncio solo como un nombre y una fecha. Su vista previa pública llega el 3 de agosto. Sin conteo de parámetros, sin capacidades, sin más detalles.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.