modelos de lenguaje pequeños
4 published articles
Código abierto
Los modelos de menos de 200M están en auge mientras la frontera gasta miles de millones
Hugging Face publicó un agradecimiento a los tinkerers detrás de una explosión de finetuning y pretraining de modelos de menos de 200M de parámetros. Sin benchmarks, sin lanzamientos, solo una señal de que el centro de gravedad de la IA de código abierto se está desplazando.
2026-08-18
IA de código abierto
Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B
Boris-2 preanuncia tres modelos pequeños con presupuestos de tokens desequilibrados: el de 125M recibe 90B tokens, el de 250M solo 60B. El entrenamiento va del 12 de agosto al 10 de septiembre, sin benchmarks compartidos, solo la ambición declarada de alcanzar la fuerza de SmolLM2-135M.
2026-08-16
Carrera de modelos pequeños
BananaMind 2 Micro: 2.9M de parámetros, 75B de tokens y una apuesta extrema por el sobreentrenamiento
BananaMind 2 Micro tendrá 2.9M de parámetros y se entrenará con 75B de tokens, aproximadamente 25,900 tokens por parámetro. El entrenamiento comienza el 3 de agosto, el lanzamiento está estimado del 4 al 6 de agosto, y una vista previa pública de BananaMind 2 Pro llega el mismo día. No se han compartido benchmarks.
2026-08-06
LLMs y Modelos
La receta de cascada de Mistral reduce los LLM sin eliminar el razonamiento
La destilación en cascada de Mistral reduce modelos grandes a pequeños conservando el razonamiento y la visión. La variante de 3B tiene capacidades que antes requerían diez veces los parámetros, y todo es Apache 2.0.
2026-07-17