SevenTnewS

Código abierto

Los modelos de menos de 200M están en auge mientras la frontera gasta miles de millones

Hugging Face publicó un agradecimiento a los tinkerers detrás de una explosión de finetuning y pretraining de modelos de menos de 200M de parámetros. Sin benchmarks, sin lanzamientos, solo una señal de que el centro de gravedad de la IA de código abierto se está desplazando.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-18 · 5 min de lectura

Los modelos de menos de 200M están en auge mientras la frontera gasta miles de millones

En algún punto entre los lanzamientos de modelos, las rondas de financiación y los alardes de benchmarks, apareció en Hugging Face una publicación que no contiene noticias en absoluto. Sin lanzamientos. Sin puntuaciones. Solo una nota de agradecimiento: "No sé si fuimos nosotros, uno de ustedes o tal vez todos a la vez, pero últimamente hemos visto una explosión de finetuning/pretraining de modelos por debajo de 200M de parámetros, y no podríamos estar más contentos al respecto." Termina con un llamamiento a quienes hacen el trabajo: "sigan viniendo, tinkerers, ¡todo esto es posible gracias a ustedes!"

La publicación no menciona cifras ni cita proyectos. No le hace falta. Hugging Face es lo más parecido que tiene este rincón de la IA a una oficina del censo; cuando su equipo dice que los modelos pequeños están por todas partes, eso es un dato. Lo interesante es en qué consiste la explosión y qué dice sobre una industria que ha pasado dos años mirando fijamente la parte superior de la tabla de tamaños de modelos.

Modelos pequeños, entrenamientos sobredimensionados

La apuesta más clara en este rincón es BananaMind 2 Micro: 2,9M de parámetros entrenados con 75B tokens, una proporción de aproximadamente 25.900 tokens por parámetro. Para un modelo tan pequeño, la proporción está deliberadamente desequilibrada. La propia palabra del proyecto es "sobreentrenado" (overtrained), lo cual es útil porque es honesto: el desequilibrio es la estrategia, no un accidente. Alimenta a un modelo diminuto con un volumen enorme de datos y observa cuánta capacidad sobrevive por parámetro.

Lo que el proyecto no ha publicado es el rendimiento. Sin puntuaciones de benchmarks, sin resultados de evaluación, sin comparaciones. La promesa es "máxima inteligencia por parámetro", y por ahora eso es una intención, no un resultado. Si 25.900 tokens por parámetro compran capacidad real es una pregunta que el proyecto ha señalado hacia una ejecución de entrenamiento en agosto.

El sobreentrenamiento no es la única palanca que mueve las puntuaciones de los modelos pequeños. Un experimento documentado añadió 4,5 puntos en MATH-500 a un modelo cuantizado mediante un controlador de monitoreo externo. Los cambios de optimizador, Muon en lugar de AdamW, están en la misma caja de herramientas. El patrón en todo ello: a esta escala, las ganancias provienen de las decisiones de entrenamiento, no de añadir hardware.

La avalancha no se limita a los modelos de lenguaje. La misma plataforma alberga un zoo de modelos de segmentación semántica entrenados con el Varied Drone Dataset, con variantes CABiNet y YOLO26 de Nano a XLarge y una ejecución superior al 78,83% de mIoU. Pequeños, especializados y baratos de ejecutar: esa es la forma de lo que Hugging Face está celebrando.

Un mismo techo, dos carreras

El contraste con la frontera no es una metáfora. Morgan Stanley ha estimado la flota de Meta AI en más de 600.000 GPU NVIDIA H100, la más grande de la Tierra, repartida en superclústeres personalizados y con unos 1.200 investigadores. Una sola ejecución de entrenamiento a esa escala consume megavatios y semanas. La escena sub-200M funciona con una fracción de eso: una GPU, un modelo base, un dataset y un volcado público de pesos cuando las cosas funcionan.

Ninguna de las dos carreras es un error. Meta también publica pesos abiertos, y su laboratorio se mide en adopción más que en ingresos. La diferencia está en lo que persigue cada lado: los laboratorios quieren capacidad bruta, la escena de modelos pequeños quiere capacidad por parámetro, y ambos tienen economías muy diferentes. Las cifras de ambos bandos no se parecen en nada:

Proyecto o métricaNúmeroQué muestra
BananaMind 2 Micro2,9M de parámetros, 75B tokens25.900 tokens por parámetro
Evaluaciones de BananaMind 2 Micronada publicadopromesa, no resultado
Modelo cuantizado + controlador de monitoreo+4,5 puntos en MATH-500las palancas de entrenamiento mueven las puntuaciones de los modelos pequeños
YOLO26x-sem (zoo VDD)78,83% mIoUmejor ejecución en el dataset de drones
CABiNet-Large (zoo VDD)77,76% mIoU a 54,8 GFLOPscompensación de eficiencia
Flota de Meta AImás de 600.000 H100, 1.200 investigadoresla escala de la frontera

La economía importa porque los modelos pequeños se ejecutan donde están los usuarios. Un modelo de 2,9M de parámetros no necesita un superclúster para servir; puede ejecutarse en un teléfono, un portátil o una caja de inferencia barata. Si las apuestas por el sobreentrenamiento dan resultado, una parte significativa de las cargas de trabajo de nicho deja de necesitar por completo la infraestructura de la frontera. Esa es la pregunta abierta bajo la celebración.

La brecha de credibilidad

La celebración tendría mejor recepción si una mayor parte del auge publicara sus resultados. El zoo de drones es lo que parece un lanzamiento cuando hace el trabajo: model cards, IoU por clase, matrices de confusión, configuraciones de entrenamiento, todo público. BananaMind 2 Micro es lo que parece un lanzamiento cuando todavía es una apuesta. Esa brecha es la distancia que aún tiene que recorrer el movimiento.

La publicación de Hugging Face no pretende lo contrario. Agradece a los tinkerers por lanzar; no afirma que los resultados estén ahí. Leída con benevolencia, marca un hito temprano, no el destino. El número que zanjará la discusión es una tabla de evaluaciones, de la ejecución de BananaMind en agosto o de la próxima docena de proyectos en la misma línea.

La frontera gasta miles de millones y muestra su trabajo en comunicados de prensa. Los tinkerers gastan casi nada, y algunos aún no han publicado lo que compraron los tokens gastados. La publicación es un recordatorio de que la economía del código abierto se basa en parte en la confianza, y de que los proyectos que publican son de los que el resto de nosotros podemos aprender. La explosión es real; los recibos aún no están todos sobre la mesa.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.