Open Source
Muse Glimmer 30B de Meta arrive sur Apple Silicon aujourd'hui via le moteur MLX d'Ollama
Meta a ouvert les poids de Muse Glimmer, un modèle dense de 30B, et Ollama le propose le jour même sur Apple Silicon. Les agents de codage locaux gagnent un backend natif, avec Muse Spark 1.2 annoncé pour plus tard.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-10 · 3 min de lecture

Meta a ouvert les poids de Muse Glimmer, un modèle dense de 30 milliards de paramètres, et Ollama l'a rendu exécutable le jour même. Cette association est tout le sujet. Une publication de poids sans runtime local, c'est des devoirs à faire ; ici, c'est un simple téléchargement.
Le post d'Ollama est direct : Muse Glimmer est disponible aujourd'hui via son moteur MLX, avec des performances que le projet qualifie d'état de l'art sur Apple Silicon, et il peut alimenter nativement Claude Code, Codex et d'autres flux de travail d'agents locaux toujours actifs. Mark Zuckerberg, annonçant la sortie sur X, a décrit Glimmer comme un « excellent modèle dense de 30 milliards de paramètres qui peut tourner localement » et a déclaré que Meta ouvrirait bientôt les poids de Muse Spark 1.2, son dernier modèle fondamental. « Meta est un fervent partisan de l'open source et je suis fier de ces publications », a-t-il écrit.
Le moteur MLX obtient enfin un deuxième modèle
Le timing compte en raison de l'endroit où Ollama place le modèle. Son moteur MLX, la voie Apple Silicon au cœur d'une réécriture du backend Mac, a été lancé en aperçu limité à un seul modèle : Qwen3.5-35B-A3B, un MoE de 35 milliards de paramètres qui active 3B par token, optimisé pour les tâches de codage et exécutable sur les Mac de la série M avec plus de 32 Go de mémoire unifiée. Cette version indiquait qu'Ollama « travaillait activement à prendre en charge de futurs modèles ». Muse Glimmer est le premier signe concret que cette expansion est en cours.
Le moteur a été amélioré en cours de route. La mise à jour MLX a apporté la quantification NVFP4 pour des modèles 4 bits de meilleure qualité, une accélération de l'inférence de 20 % grâce aux kernels Metal fusionnés, et la mise en cache d'instantanés qui évite aux charges de travail multi-agents, aux modèles de réflexion et aux workflows ramifiés de retraiter un contexte partagé. C'est à ces charges de travail que Glimmer est destiné : des agents de codage qui restent résidents au lieu d'appeler le cloud.
L'accroche pour les agents est le point clé. Les travaux récents d'Ollama ont poussé l'appel d'outils via une seule commande de lancement, de sorte que les agents de codage comme Claude Code peuvent piloter directement un modèle local. Glimmer s'insère dans ce pipeline : des poids ouverts en entrée, un agent local toujours actif en sortie. Pour un utilisateur de Mac avec suffisamment de mémoire, le chemin est le flux standard ollama run plutôt qu'un tableau de bord cloud.
Ce que les deux publications omettent
Les lacunes sont aussi notables que le timing. L'affirmation d'un état de l'art sur Apple Silicon n'est accompagnée d'aucun chiffre de benchmark, et aucune des deux publications ne précise le matériel requis par Glimmer, la taille de sa fenêtre de contexte, ni la date exacte d'arrivée de Spark 1.2. Le post d'Ollama s'achève sur « Additional support and... » avant que le fil ne soit coupé, de sorte que la prise en charge au-delà de MLX n'est, pour l'instant, qu'une ellipse.
Ce que les deux publications établissent, côte à côte :
| Modèle | Statut | Spécificités connues |
|---|---|---|
| Muse Glimmer | Poids ouverts aujourd'hui | Modèle dense de 30 milliards de paramètres ; fonctionne sur Apple Silicon via le moteur MLX d'Ollama |
| Muse Spark 1.2 | Poids bientôt disponibles | Dernier modèle fondamental de Meta ; aucun autre détail fourni |
Pourquoi la prise en charge le jour même est la vraie annonce
La prise en charge le jour même a du poids pour les deux parties. Meta place une version à poids ouverts devant les développeurs là où ils exécutent déjà des modèles locaux, avec l'outillage en place. Ollama reçoit un nouveau modèle ouvert phare comme preuve que son moteur Apple a dépassé l'aperçu à modèle unique. Les deux misent sur le même fait : le modèle fonctionne aujourd'hui, et non à une date future annoncée.
La question de savoir si un modèle dense de 30 milliards de paramètres suffit pour les cas d'usage d'agents toujours actifs qu'Ollama présente reste ouverte. C'est une architecture différente du MoE sparse du modèle d'aperçu précédent, et la question de savoir si ses 30B de poids denses tiennent la route pour les charges de travail d'agents est exactement ce que les prochaines semaines de tests communautaires détermineront. Ce que la sortie tranche est plus étroit mais vaut d'être dit : un modèle de 30B d'un grand laboratoire, tournant nativement sur un Mac le jour où ses poids ont été rendus publics. Tout ce qui sera publié ensuite sera mesuré à cette aune.
- Source : Ollama on X
- Source : Mark Zuckerberg on X
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.