SevenTnewS

modelos de lenguaje pequeños

4 published articles

Código Abierto5 min read

Código abierto

Los modelos de menos de 200M están en auge mientras la frontera gasta miles de millones

Hugging Face publicó un agradecimiento a los tinkerers detrás de una explosión de finetuning y pretraining de modelos de menos de 200M de parámetros. Sin benchmarks, sin lanzamientos, solo una señal de que el centro de gravedad de la IA de código abierto se está desplazando.

2026-08-18

LLMs y Modelos3 min read

IA de código abierto

Boris-2 alimenta su modelo de 125M con 90B tokens, y su 250M con solo 60B

Boris-2 preanuncia tres modelos pequeños con presupuestos de tokens desequilibrados: el de 125M recibe 90B tokens, el de 250M solo 60B. El entrenamiento va del 12 de agosto al 10 de septiembre, sin benchmarks compartidos, solo la ambición declarada de alcanzar la fuerza de SmolLM2-135M.

2026-08-16

LLMs y Modelos4 min read

Carrera de modelos pequeños

BananaMind 2 Micro: 2.9M de parámetros, 75B de tokens y una apuesta extrema por el sobreentrenamiento

BananaMind 2 Micro tendrá 2.9M de parámetros y se entrenará con 75B de tokens, aproximadamente 25,900 tokens por parámetro. El entrenamiento comienza el 3 de agosto, el lanzamiento está estimado del 4 al 6 de agosto, y una vista previa pública de BananaMind 2 Pro llega el mismo día. No se han compartido benchmarks.

2026-08-06

LLMs y ModelosFeatured5 min read

LLMs y Modelos

La receta de cascada de Mistral reduce los LLM sin eliminar el razonamiento

La destilación en cascada de Mistral reduce modelos grandes a pequeños conservando el razonamiento y la visión. La variante de 3B tiene capacidades que antes requerían diez veces los parámetros, y todo es Apache 2.0.

2026-07-17