SevenTnewS

IA open source

Le Muse Glimmer 30B de Meta arrive en premier sur Apple Silicon, le support NVIDIA suivra

Meta a publié Muse Glimmer, un modèle multimodal à poids ouverts de 30B conçu pour les charges de travail d'agents, et Ollama l'a diffusé pour Apple Silicon le même jour. DFlash le rend 1,5 à 1,8 fois plus rapide sur les Mac. Les supports NVIDIA et AMD suivront dans les prochains jours.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-13 · 3 min de lecture

Le Muse Glimmer 30B de Meta arrive en premier sur Apple Silicon, le support NVIDIA suivra

Les poids ouverts ne représentent que la moitié d'une sortie. L'autre moitié est un runtime, et Meta et Ollama ont livré les deux le même jour. Meta Superintelligence Labs a ouvert les poids de Muse Glimmer, sa première publication, et Ollama l'a rendu disponible via son moteur MLX sur Apple Silicon immédiatement.

L'ordre de lancement mérite qu'on s'y attarde. Le support initial d'Ollama ne couvre qu'Apple Silicon, avec NVIDIA, AMD et d'autres plateformes promis pour les prochains jours. Un modèle ouvert dont le premier runtime officiel est Apple Silicon plutôt que NVIDIA est l'inverse de l'ordre habituel, et cela change ce que les propriétaires de Mac peuvent faire dès aujourd'hui : exécuter localement un modèle d'agent de 30B, sans compte cloud.

Un modèle multimodal de 30B sous Apache 2.0

La fiche technique de Muse Glimmer vise directement les charges de travail d'agents. C'est un modèle multimodal de 30B avec une longueur de contexte de 128K+, publié sous licence Apache 2.0. L'intensité de raisonnement est réglable entre low, medium, high et xhigh ; Ollama suggère high ou xhigh pour les tâches complexes de codage et d'agents, et des réglages plus bas quand la vitesse prime.

La compréhension native des images provient d'un encodeur de perception dédié de 1,8B de paramètres. Ollama cite trois types de tâches où cela compte : créer des sites web ou des applications à partir d'un dessin ou d'une maquette, les applications d'utilisation informatique pilotées par captures d'écran, et la lecture de documents, reçus et graphiques. Pour les agents de codage, cela signifie des appels d'outils successifs à faible latence sur des tâches riches en images.

SpécificationMuse Glimmer
Paramètres30B dense
Longueur de contexte128K+
LicenceApache 2.0
Niveau de raisonnementlow, medium, high, xhigh
Encodeur de perception1,8B de paramètres, compréhension d'image native
Accélération DFlash sur Apple Silicon1.5x to 1.8x

Claude Code, Codex et le monde des agents locaux

Le modèle s'intègre à l'écosystème des agents plutôt que de rester dans un notebook. Ollama cite Claude Code, Codex et Pi parmi les agents de codage que Muse Glimmer peut alimenter, plus OpenClaw et Hermes pour les assistants personnels de longue durée. La commande ollama launch couvre également OpenCode et GitHub Copilot.

L'installation passe par une seule commande : ollama run muse-glimmer:30b-mlx. Pour l'exécuter avec Claude Code, c'est ollama launch claude, model muse-glimmer:30b-mlx. Le schéma utile derrière cette syntaxe est celui qu'Ollama ne cesse de promouvoir : des agents qui restent résidents sur la machine au lieu d'appeler le cloud.

Apple Silicon reçoit DFlash avant que NVIDIA n'ait quoi que ce soit

Le moteur MLX d'Ollama prend désormais en charge DFlash, en s'appuyant sur son support existant de prédiction multi-tokens, et l'entreprise affirme que Muse Glimmer s'exécute 1,5 à 1,8 fois plus vite sur Apple Silicon grâce à cela. C'est cette performance qui rend plausibles les appels d'outils successifs sur un ordinateur portable.

La livraison Apple d'abord est le twist de l'histoire, mais cela ne signifie pas que le modèle est réservé aux Mac. Comme nous l'avons rapporté à l'arrivée des poids, un drafter DFlash a permis un décodage jusqu'à 3,1 fois plus rapide sur une RTX 5090, et la quantification maintient le modèle sous 20 Go. Les versions NVIDIA et AMD du runtime Ollama ne sont simplement pas encore disponibles.

Rien de tout cela n'est sorti de nulle part. Les travaux récents sur le moteur MLX ont ajouté la quantification NVFP4 pour des modèles 4 bits de meilleure qualité, une accélération de 20 % de l'inférence grâce aux kernels Metal fusionnés, et un cache de snapshots qui évite aux charges de travail multi-agents et ramifiées de retraiter le contexte partagé. Ce sont exactement les charges de travail auxquelles Glimmer est destiné : agents de codage résidents, assistants personnels de longue durée, utilisation informatique pilotée par captures d'écran.

Le pari open source de Meta, un modèle à la fois

Zuckerberg a présenté la publication sur X avec une description conforme à la fiche technique : un « excellent modèle dense de 30B de paramètres pouvant s'exécuter localement ». Il a également déclaré que Meta ouvrirait prochainement les poids de Muse Spark 1.2, son dernier modèle de fondation. « Meta est un fervent partisan de l'open source et je suis fier de ces publications », a-t-il écrit.

La publication arrive alors qu'Ollama élargit ce qu'il peut exécuter en local. Un modèle de 35B ajusté pour le codage a récemment obtenu un support sur les Mac M-series, l'entreprise affirmant qu'elle travaillait activement à prendre en charge de futurs modèles ; Muse Glimmer est le premier résultat visible de ce travail. Alibaba, de son côté, s'apprête à publier les poids de son plus grand modèle, la voie des poids ouverts se remplit donc.

Une seule publication n'est pas une stratégie. Le schéma est cependant cohérent : poids ouverts, runtime local le jour même, Apple Silicon en premier, et un modèle suivant déjà annoncé. C'est ainsi qu'un pari open source devient une habitude.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.