SevenTnewS

IA de código abierto

Muse Glimmer: el agente de 30B de Meta cabe en menos de 20GB, la nube es opcional

Meta ha publicado como código abierto Muse Glimmer, un modelo agéntico de 30B que se ejecuta sin conexión en una sola GPU de consumo. La cuantización lo mantiene por debajo de 20 GB, un drafter DFlash ofrece una decodificación hasta 3,1x más rápida en una RTX 5090, y los pesos están en Hugging Face bajo Apache 2.0.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-10 · 4 min de lectura

Muse Glimmer: el agente de 30B de Meta cabe en menos de 20GB, la nube es opcional
Fuentes : Introducing Mus…·Muse Code: Meta…·Liquid AI: Depl…

¿Cuánta IA útil cabe en una máquina que sea tuya? La respuesta de Meta es Muse Glimmer, un modelo agéntico de 30 mil millones de parámetros lanzado bajo Apache 2.0. La cuantización de aproximadamente 4 bits reduce los pesos a menos de 20 GB, dejando espacio dentro de una GPU de consumo de 24 GB o 32 GB para el modelo, su memoria de trabajo, el codificador de percepción y un pequeño drafter que acelera la decodificación. Meta Superintelligence Labs lo posiciona para agentes locales siempre activos, llamadas a funciones, codificación local y evaluación con LLM como juez, con o sin conexión a internet.

La velocidad siempre ha sido el problema de los modelos locales. Un modelo de 30B que genera un token a la vez convierte las cadenas largas de razonamiento y las llamadas a herramientas de varios pasos en un juego de espera, así que Meta emparejó Glimmer con DFlash, una pequeña red complementaria que propone bloques enteros de tokens para que el modelo principal los verifique en paralelo. Meta midió una decodificación 3,1x más rápida en una RTX 5090, 1,8x en una M5 Max y 1,5x en una M4 Max, con una calidad de salida sin cambios.

Qué cabe en un presupuesto de 24 GB

A plena precisión, solo el modelo de lenguaje necesita más de 55 GB, muy por encima de cualquier GPU de consumo. Los pesos cuantizados se quedan por debajo de 20 GB, y Meta dice que el margen restante cubre la memoria de trabajo del modelo, el codificador de percepción para imágenes y el drafter al mismo tiempo. La compañía afirma que la compresión cuesta una degradación mínima o nula en tareas agénticas. Este es el panorama de tamaño y velocidad que publica Meta.

ConfiguraciónLo que reporta Meta
Plena precisiónmás de 55 GB, muy por encima de las GPU de consumo
K-Quant-Dynamic y K-Quant-17GBmodelo de lenguaje por debajo de 20 GB; la caché KV, el codificador de percepción y el drafter caben en un presupuesto de 24 o 32 GB
Aceleración de decodificación con el drafter DFlash, RTX 50903,1x
Aceleración de decodificación, M5 Max1,8x
Aceleración de decodificación, M4 Max1,5x

Diseñado para agentes que fallan y reintentan

El entrenamiento agéntico se manifiesta en capacidades concretas: llamadas a herramientas esquematizadas, razonamiento de varios pasos en horizontes largos y recuperación ante fallos, donde el modelo diagnostica una llamada a herramienta fallida y reintenta en lugar de detenerse. Un codificador de percepción dedicado acepta texto e imágenes intercalados, de modo que un agente puede trabajar con capturas de pantalla, gráficos o documentos en mitad de una conversación. Diferentes niveles de razonamiento permiten a los desarrolladores intercambiar calidad por velocidad, y los datos de entrenamiento abarcan más de 100 idiomas.

En benchmarks agénticos de extremo a extremo como DeepSearch QA, MCP-Atlas, tau-Bench y SWE-Bench, que miden completar una tarea de principio a fin dentro de un andamiaje, Meta dice que Muse Glimmer registra tasas de éxito sólidas para su clase de tamaño. Funciona con frameworks de orquestación abiertos, incluido OpenClaw.

La familia Muse se vuelve local

Glimmer no partió de cero. Meta dice que destiló el modelo a partir de las salidas de Muse Spark mediante destilación de logits, mantuvo una mezcla de datos similar a la de su maestro, y luego ejecutó entrenamiento intermedio con datos más largos y centrados en agentes y post-entrenamiento con ajuste fino supervisado, destilación on-policy y aprendizaje por refuerzo. El lanzamiento pasó por el Advanced AI Scaling Framework de Meta antes de que se publicaran los pesos.

Eso conecta a Glimmer con una familia que Meta ha estado reuniendo rápidamente. Muse Spark 1.2 es el modelo detrás de Muse Code, el agente de codificación en terminal que Meta lanzó en beta para macOS y Linux, con un registro de eventos con reproducción exacta y subagentes en segundo plano persistentes que siguen trabajando sin un humano frente al teclado. Glimmer toma ese razonamiento y lo dimensiona para un portátil que podría estar sin conexión. El soporte para llama.cpp, MLX y ExecuTorch llegará en los próximos días; Ollama, LM Studio y Unsloth se alinean para ofrecer instalaciones locales fáciles. vLLM y SGLang cubren el servicio a escala, las opciones alojadas llegan a través de Together AI, Fireworks AI y OpenRouter, y los desarrolladores pueden personalizar aún más los pesos con TorchTitan de PyTorch. Meta lista a AMD, Arm, Dell, Intel y NVIDIA como socios de hardware. Los pesos ya están en Hugging Face.

Pesos abiertos, hardware propio

La apuesta estratégica está en la licencia. Apache 2.0 significa que cualquiera puede hacer un fork de Muse Glimmer, reentrenarlo o incluirlo en un producto sin pagar a Meta, el mismo manual que la compañía ha seguido durante años en investigación, ahora orientado a agentes. Es una jugada conocida para el laboratorio que gasta miles de millones en la apuesta de que los pesos abiertos ganan. Meta compara el modelo con Gemma4-31B y Qwen3.6-27B y dice que ofrece un rendimiento sólido para su clase de tamaño en varios benchmarks muy utilizados, aunque la publicación de lanzamiento no incluye puntuaciones propias y remite a un informe aparte para los detalles.

Meta no está solo en la carrera por los agentes en el dispositivo. Liquid AI hizo una propuesta similar en agosto con LFM2.5-2.6B, una línea de 2,6 mil millones de parámetros construida para ejecutarse en casi cualquier lugar, incluido el navegador. Glimmer apunta a una clase de trabajo agéntico más exigente que los modelos pequeños de Liquid, en el mismo tipo de hardware que la gente ya tiene, y se distribuye con documentación y guías de configuración en el AI Developer Center de Meta (dev.meta.ai). El impulso de los pesos abiertos también llega al otro extremo de la escala de tamaño, ya que Alibaba está a punto de publicar Qwen3.8-Max.

La cuestión abierta es la verificación. Los benchmarks de Meta provienen de Meta, y las ejecuciones independientes en GPU domésticas determinarán cuán cerca queda la experiencia de las cifras publicadas. La dirección es clara de cualquier manera: agentes dimensionados para el hardware que la gente ya tiene, pesos que cualquiera puede bifurcar e inferencia tratada como un problema de ubicación en lugar de la nube como opción por defecto.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.