IA open source
Muse Glimmer : l'agent 30B de Meta tient sous 20 Go, cloud en option
Meta a open-sourcé Muse Glimmer, un modèle agentique de 30B qui fonctionne hors ligne sur un seul GPU grand public. La quantification le maintient sous 20 Go, un drafter DFlash offre un décodage jusqu'à 3,1x plus rapide sur un RTX 5090, et les poids sont sur Hugging Face sous licence Apache 2.0.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-10 · 4 min de lecture

Combien d'IA utile peut-on faire tenir sur une machine qui vous appartient ? La réponse de Meta est Muse Glimmer, un modèle agentique de 30 milliards de paramètres publié sous Apache 2.0. Une quantification d'environ 4 bits fait passer les poids sous 20 Go, laissant de la place dans un GPU grand public de 24 Go ou 32 Go pour le modèle, sa mémoire de travail, l'encodeur de perception et un petit drafter qui accélère le décodage. Meta Superintelligence Labs le positionne pour des agents locaux toujours actifs, l'appel de fonctions, le codage local et l'évaluation LLM-as-a-judge, avec ou sans connexion Internet.
La vitesse a toujours été le point faible des modèles locaux. Un modèle 30B qui génère un jeton à la fois transforme les longues chaînes de raisonnement et les appels d'outils en plusieurs étapes en un jeu d'attente. Meta a donc associé Glimmer à DFlash, un petit réseau compagnon qui propose des blocs entiers de jetons que le modèle principal vérifie en parallèle. Meta a mesuré un décodage 3,1x plus rapide sur un RTX 5090, 1,8x sur un M5 Max et 1,5x sur un M4 Max, avec une qualité de sortie inchangée.
Ce qui tient dans une enveloppe de 24 Go
En pleine précision, le modèle de langage seul a besoin de plus de 55 Go, bien au-delà de n'importe quel GPU grand public. Les poids quantifiés passent sous 20 Go, et Meta affirme que la marge restante couvre à la fois la mémoire de travail du modèle, l'encodeur de perception pour les images et le drafter. L'entreprise affirme que la compression entraîne une dégradation minime, voire nulle, sur les tâches agentiques. Voici le tableau de la taille et de la vitesse que Meta publie.
| Configuration | Ce que rapporte Meta |
|---|---|
| Pleine précision | plus de 55 Go, bien au-delà des GPU grand public |
| K-Quant-Dynamic et K-Quant-17GB | modèle de langage sous 20 Go ; cache KV, encodeur de perception et drafter tiennent dans une enveloppe de 24 ou 32 Go |
| Accélération du décodage avec le drafter DFlash, RTX 5090 | 3,1x |
| Accélération du décodage, M5 Max | 1,8x |
| Accélération du décodage, M4 Max | 1,5x |
Conçu pour des agents qui échouent et réessaient
L'entraînement agentique se traduit par des capacités concrètes : appels d'outils schématisés, raisonnement en plusieurs étapes sur de longs horizons et récupération après échec, où le modèle diagnostique un appel d'outil ayant échoué et réessaie au lieu de s'arrêter. Un encodeur de perception dédié accepte du texte et des images entrelacés, permettant à un agent de travailler à partir de captures d'écran, de graphiques ou de documents en cours de conversation. Différentes forces de raisonnement permettent aux développeurs de faire un compromis entre qualité et vitesse, et les données d'entraînement couvrent plus de 100 langues.
Sur des benchmarks agentiques de bout en bout tels que DeepSearch QA, MCP-Atlas, tau-Bench et SWE-Bench, qui mesurent l'accomplissement d'une tâche du début à la fin dans un scaffold, Meta affirme que Muse Glimmer obtient de forts taux de réussite pour sa catégorie de taille. Il fonctionne avec des frameworks d'orchestration ouverts, dont OpenClaw.
La famille Muse passe au local
Glimmer n'est pas parti de zéro. Meta indique avoir distillé le modèle à partir des sorties de Muse Spark en utilisant la distillation de logits, avoir conservé un mélange de données similaire à celui de son enseignant, puis avoir effectué un mid-training sur des données plus longues et riches en agents, ainsi qu'un post-training avec un fine-tuning supervisé, une distillation on-policy et un apprentissage par renforcement. Cette sortie est passée par l'Advanced AI Scaling Framework de Meta avant la publication des poids.
Cela relie Glimmer à une famille que Meta assemble rapidement. Muse Spark 1.2 est le modèle derrière Muse Code, l'agent de codage en terminal que Meta a proposé en version bêta pour macOS et Linux, avec un journal d'événements rejouable à l'identique et des sous-agents d'arrière-plan persistants qui continuent de travailler sans humain au clavier. Glimmer reprend ce raisonnement et l'adapte à un ordinateur portable qui pourrait être hors ligne. La prise en charge de llama.cpp, MLX et ExecuTorch arrive dans les prochains jours ; Ollama, LM Studio et Unsloth se préparent pour des installations locales faciles. vLLM et SGLang couvrent l'inférence à grande échelle, les options hébergées viennent via Together AI, Fireworks AI et OpenRouter, et les développeurs peuvent personnaliser davantage les poids avec TorchTitan de PyTorch. Meta liste AMD, Arm, Dell, Intel et NVIDIA comme partenaires matériels. Les poids sont disponibles dès maintenant sur Hugging Face.
Poids ouverts, matériel personnel
Le pari stratégique tient dans la licence. Apache 2.0 signifie que n'importe qui peut forker Muse Glimmer, le réentraîner ou l'intégrer dans un produit sans payer Meta, le même playbook que l'entreprise utilise depuis des années dans la recherche, désormais orienté vers les agents. C'est un pari classique pour le laboratoire qui dépense des milliards en pariant que les poids ouverts gagnent. Meta compare le modèle à Gemma4-31B et Qwen3.6-27B et affirme qu'il obtient de solides résultats pour sa catégorie de taille sur plusieurs benchmarks largement utilisés, bien que le billet de lancement ne comporte aucun score propre et renvoie à un rapport séparé pour les détails.
Meta n'est pas seul dans la course aux agents sur appareil. Liquid AI a fait une proposition similaire en août avec LFM2.5-2.6B, une gamme de 2,6 milliards de paramètres conçue pour fonctionner presque partout, navigateur inclus. Glimmer cible des tâches agentiques plus lourdes que les petits modèles de Liquid, sur le même type de matériel que celui que les gens possèdent déjà, et il est livré avec une documentation et des guides de configuration sur l'AI Developer Center de Meta (dev.meta.ai). La poussée en faveur des poids ouverts atteint aussi l'autre extrémité de l'échelle des tailles, puisque Alibaba s'apprête à publier Qwen3.8-Max.
La question ouverte est la vérification. Les benchmarks de Meta viennent de Meta, et des exécutions indépendantes sur des GPU domestiques détermineront à quel point l'expérience se rapproche des chiffres. La direction est claire de toute façon : des agents dimensionnés pour du matériel que les gens possèdent déjà, des poids que n'importe qui peut forker, et l'inférence traitée comme un problème de localisation plutôt que comme un réflexe cloud.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.