Inteligencia artificial de código abierto
El Muse Glimmer de 30B de Meta llega primero a Apple Silicon; el soporte para NVIDIA sigue después
Meta lanzó Muse Glimmer, un modelo multimodal de pesos abiertos de 30B diseñado para cargas de trabajo de agentes, y Ollama lo publicó para Apple Silicon el mismo día. DFlash lo hace de 1.5x a 1.8x más rápido en hardware Mac. El soporte para NVIDIA y AMD llegará en los próximos días.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-13 · 3 min de lectura

Los pesos abiertos son la mitad de un lanzamiento. La otra mitad es un runtime, y Meta y Ollama entregaron ambas el mismo día. Meta Superintelligence Labs abrió los pesos de Muse Glimmer, su primer lanzamiento, y Ollama lo hizo disponible a través de su motor MLX en Apple Silicon de inmediato.
El orden de lanzamiento merece una pausa. El soporte inicial de Ollama cubre solo Apple Silicon, con NVIDIA, AMD y otras plataformas prometidas en los próximos días. Un modelo abierto cuyo primer runtime oficial es Apple Silicon en lugar de NVIDIA es lo opuesto al orden habitual, y cambia lo que los dueños de Mac pueden hacer hoy: ejecutar un modelo de agente de 30B localmente, sin necesidad de cuenta en la nube.
Un modelo multimodal de 30B bajo Apache 2.0
La ficha técnica de Muse Glimmer está dirigida directamente a cargas de trabajo de agentes. Es un modelo multimodal de 30B con una longitud de contexto de 128K+, publicado bajo la licencia Apache 2.0. La fuerza de razonamiento se puede ajustar entre low, medium, high y xhigh; Ollama sugiere high o xhigh para tareas complejas de codificación y agénticas, y configuraciones más bajas cuando la velocidad importa más.
La comprensión nativa de imágenes proviene de un codificador de percepción dedicado de 1.8B parámetros. Ollama señala tres tipos de tareas donde esto importa: crear sitios web o aplicaciones a partir de un dibujo o maqueta, aplicaciones de uso de computadora impulsadas por capturas de pantalla, y lectura de documentos, recibos y gráficos. Para agentes de codificación, eso significa llamadas a herramientas consecutivas de baja latencia en trabajos con muchas imágenes.
| Especificación | Muse Glimmer |
|---|---|
| Parámetros | 30B denso |
| Longitud de contexto | 128K+ |
| Licencia | Apache 2.0 |
| Fuerza de razonamiento | low, medium, high, xhigh |
| Codificador de percepción | 1.8B parámetros, comprensión nativa de imágenes |
| Aceleración DFlash en Apple Silicon | 1.5x a 1.8x |
Claude Code, Codex y el grupo de agentes locales
El modelo se integra en el ecosistema de agentes en lugar de quedarse en un notebook. Ollama lista a Claude Code, Codex y Pi entre los agentes de codificación que Muse Glimmer puede impulsar, además de OpenClaw y Hermes para asistentes personales de larga duración. El comando ollama launch también cubre OpenCode y GitHub Copilot.
La configuración es un solo comando: ollama run muse-glimmer:30b-mlx. Para ejecutarlo con Claude Code, es ollama launch claude, model muse-glimmer:30b-mlx. El patrón útil detrás de la sintaxis es el que Ollama ha estado impulsando: agentes que permanecen residentes en la máquina en lugar de llamar a la nube.
Apple Silicon recibe DFlash antes de que NVIDIA reciba algo
El motor MLX de Ollama ahora admite DFlash, desarrollando su soporte existente de predicción de múltiples tokens, y la compañía dice que Muse Glimmer corre de 1.5x a 1.8x más rápido en Apple Silicon gracias a ello. Ese es el rendimiento que hace plausibles las llamadas consecutivas a herramientas en una laptop.
La entrega con Apple primero es el giro de la historia, pero no significa que el modelo esté atado a Mac. Como informamos cuando se publicaron los pesos, un drafter DFlash ha logrado decodificación hasta 3.1x más rápida en una RTX 5090, y la cuantización mantiene el modelo por debajo de 20GB. Las versiones para NVIDIA y AMD del runtime de Ollama simplemente aún no han salido.
Nada de esto surgió de la nada. El trabajo reciente en el motor MLX añadió cuantización NVFP4 para modelos de 4 bits de mayor calidad, una aceleración de inferencia del 20% mediante kernels de Metal fusionados, y caché de instantáneas que evita que las cargas de trabajo multiagente y ramificadas reprocesen el contexto compartido. Esas son exactamente las cargas de trabajo a las que apunta Glimmer: agentes de codificación residentes, asistentes personales de larga duración y uso de computadora impulsado por capturas de pantalla.
La apuesta de código abierto de Meta, un modelo a la vez
Zuckerberg presentó el lanzamiento en X con una descripción que coincide con la ficha técnica: un "gran modelo denso de 30B de parámetros que puede ejecutarse localmente". También dijo que Meta abrirá los pesos de Muse Spark 1.2, su modelo fundacional más reciente, en breve. "Meta es un fuerte partidario del código abierto y estoy orgulloso de estos lanzamientos", escribió.
El lanzamiento llega mientras Ollama amplía lo que ejecutará localmente. Un modelo de codificación ajustado de 35B obtuvo recientemente soporte en Mac con chip serie M, y la compañía dijo que estaba trabajando activamente para soportar futuros modelos; Muse Glimmer es el primer beneficio visible de ese trabajo. Alibaba, mientras tanto, se prepara para publicar los pesos de su modelo más grande, por lo que el carril de pesos abiertos se está llenando.
Un solo lanzamiento no es una estrategia. Sin embargo, el patrón aquí es consistente: pesos abiertos, un runtime local el mismo día, Apple Silicon primero, y un próximo modelo ya insinuado. Así es como una apuesta de código abierto se convierte en hábito.
- Fuente : Meta's 30B Muse Glimmer hits Apple Silicon first, NVIDIA support follows — 2026-08-10
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.