SevenTnewS

IA de código abierto

Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B

Boris-2 preanuncia tres modelos pequeños con presupuestos de tokens desequilibrados: el de 125M recibe 90B tokens, el de 250M solo 60B. El entrenamiento va del 12 de agosto al 10 de septiembre, sin benchmarks compartidos, solo la ambición declarada de alcanzar la fuerza de SmolLM2-135M.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-16 · 3 min de lectura

Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B

Boris-2 aún no existe, y el post de anuncio no tiene problema con eso. El proyecto ha trazado planes para tres modelos pequeños, el 75M, el 125M y el 250M, con ventanas de entrenamiento que van del 12 de agosto al 10 de septiembre y presupuestos de tokens que parecen hechos por alguien que dejó de ordenarlos por tamaño.

El número que salta a la vista es el del medio. Se prevé que el modelo de 125M se entrene con 90B tokens, una vez y media más que los 60B previstos para el de 250M. El post responde a la pregunta obvia antes de que se formule. "La respuesta directa es el tiempo," dice. Entrenar un modelo más grande consume más tiempo de cómputo, y el proyecto espera que el de 250M se adelante de todos modos por capacidad bruta.

La aritmética de tokens detrás del presupuesto de 90B para un modelo de 125M

Convierte esos presupuestos en tokens por parámetro y la asignación se vuelve más interesante. El 75M procesa alrededor de 347 tokens por parámetro con 26B en total, el 125M aproximadamente 720, y el 250M solo 240. El modelo intermedio recibe la dieta más abundante, el 250M la más ligera, y el 75M queda en medio. Eso es deliberado. "Ahorra tiempo, a la vez que permite que el modelo de 250M supere al modelo de 125M," explica el post.

ModeloParámetrosTokens de entrenamientoTokens por parámetroInicio estimado
Boris-2-75M75M26B~34712 ago
Boris-2-125M125M90B72020 ago
Boris-2-250M250M60B24010 sep
BananaMind 2 Micro (referencia)2,9M75B~25.9003 ago

Otro proyecto de modelos pequeños, BananaMind, está llevando la proporción mucho más lejos en la misma ventana. BananaMind 2 Micro empaqueta 2,9M de parámetros y un presupuesto de 75B de tokens, aproximadamente 25.900 tokens por parámetro, en palabras del equipo, "para obtener la máxima inteligencia por parámetro." La proporción más alta de Boris-2, 720, no se acerca a esa intensidad, por lo que la propuesta del proyecto se apoya en la "arquitectura única y esquema de capas" que dice estar intentando.

Un objetivo fijado por la esperanza, no por benchmarks

Lo que Boris-2 ofrece como referencia es la clase de modelos abiertos de 135M. El proyecto dice que espera situarse cerca de la fuerza de SmolLM2-135M y "en el entorno de AxiomicLabs/GPT-X2.5-135M o BananaMind/BananaMind-2-Pro-Preview." "Cruzando los dedos" es la frase operativa. El entrenamiento no ha comenzado, no se han compartido benchmarks, y el objetivo se plantea como una aspiración más que como un resultado.

Las fechas son los únicos compromisos firmes sobre la mesa. Se estima que el 75M comience a entrenarse el 12 de agosto, el 125M el 20 de agosto, el 250M el 10 de septiembre. Ninguna de estas son fechas de lanzamiento, y el post no dice cuándo podrían publicarse los modelos.

La ola de sobreentrenamiento llega a los modelos más pequeños

Boris-2 llega en un momento en que los modelos abiertos pequeños están siendo alimentados con dietas de datos desproporcionadas a propósito. BananaMind hizo la misma apuesta con su 2 Micro, con entrenamiento previsto para comenzar el 3 de agosto y un lanzamiento estimado entre el 4 y el 6 de agosto, junto con una vista previa pública de BananaMind 2 Pro. Allí tampoco se han compartido benchmarks. La apuesta compartida es que la densidad de datos puede sustituir a la escala, y ninguno de los dos proyectos tiene aún evidencia para cobrarla.

Lo que es comprobable es la aritmética, y la aritmética muestra dos apuestas diferentes. BananaMind está llevando los tokens por parámetro a un extremo. Boris-2 gasta su presupuesto de tokens de manera desigual, favoreciendo al modelo intermedio, mientras espera que la arquitectura permita a los tres superar su número de parámetros.

Variantes, y la larga espera hasta el 12 de agosto

La hoja de ruta no termina en los tres tamaños base. Boris-2 dice que seguirá con variantes Pro, Instruct y Pro-Instruct. "Más información llegará pronto," cierra el post, que es el único cronograma ofrecido aparte de las fechas de entrenamiento.

Hasta que comience la primera ejecución, Boris-2 es una especificación con fechas adjuntas. Los números son públicos, el razonamiento es público, y el resultado está completamente sin probar. Para los observadores de modelos pequeños, ese es el punto: una apuesta planteada abiertamente antes de una sola ejecución de entrenamiento.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.