SevenTnewS

Modèles d'IA

La conception à quatre spécialistes de 748B du Macaron-V1-Venti bat GPT-5.5 et Opus 4.8

Macaron-V1-Venti de MindLab Research mène les benchmarks en intelligence personnelle, codage, utilisation du terminal et UI générative, utilisant une nouvelle architecture Mixture of LoRA qui maintient le modèle compact tout en étant spécialisé.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-27 · 3 min de lecture

La conception à quatre spécialistes de 748B du Macaron-V1-Venti bat GPT-5.5 et Opus 4.8
Sources : Macaron-V1-Vent…

MindLab Research a publié Macaron-V1-Venti, un modèle de 748 milliards de paramètres qui revendique la première place sur une série de benchmarks couvrant l'intelligence personnelle, le codage, les workflows terminaux et l'interface utilisateur générative. Le modèle, publié sous licence MIT, est le premier à être post-entraîné sur GLM-5.2 et utilise une architecture Mixture of LoRA (MoL) qui répartit l'expertise sur quatre modules spécialisés plutôt que de reposer sur un seul réseau dense, faisant écho à une approche multi-spécialiste similaire.

Quatre spécialistes au lieu d'un

La conception MoL associe un modèle de base GLM-5.2 de 744B paramètres à quatre adaptateurs LoRA de 1B paramètres, chacun responsable d'un domaine : chat, agent, codage et GenUI. Un routeur sélectionne le spécialiste approprié pour chaque requête entrante. Cela maintient un nombre de paramètres actifs compact tout en accédant à des connaissances spécialisées approfondies. L'approche diffère des conceptions typiques de mixture-of-experts en utilisant des adaptateurs LoRA, moins coûteux à entraîner et à échanger, et souligne le vrai coût du routage de modèles.

Macaron-V1-Venti succède au précédent Macaron-V1-Preview et étend l'entraînement sur les tâches d'agent personnel et l'interface utilisateur générative. Le pipeline de post-entraînement utilise les systèmes MinT et MindForge de MindLab, conçus pour aligner le modèle sur le harnais de production utilisé pour les workflows agentiques. Le modèle prend en charge une longueur de contexte d'un million de jetons, permise par une infrastructure d'entraînement à long contexte appelée LongStraw qui gère des exécutions d'apprentissage par renforcement de plusieurs millions de jetons.

Leader des benchmarks sur tous les tableaux

Les résultats rapportés montrent Macaron-V1-Venti en tête ou à égalité sur sept des dix benchmarks comparés à GLM 5.2, GPT 5.5, Claude Opus 4.8, Gemini 3.1 Pro, Qwen 3.7 Max et Minimax M3. Sur ChatBench, il obtient 58,3 contre 55,5 pour GPT 5.5 et 52,8 pour Claude Opus 4.8. Sur LivingBench, qui mesure les tâches agentiques du monde réel, il atteint 64,0, devant Claude Opus 4.8 à 63,8 et GPT 5.5 à 61,9. Le modèle performe fortement sur les benchmarks de codage : il obtient 85,6 sur SWE Verified, deuxième seulement derrière Claude Opus 4.8 à 88,6, et mène TerminalBench 2.1 à 87,6, bien devant GPT 5.5 à 83,4 et Claude à 78,9, avec le positionnement de Claude Opus 5 sur les benchmarks offrant un contraste.

Le plus grand écart apparaît sur UI4ABench, où Macaron-V1-Venti obtient 87,8, bien au-dessus de GPT 5.5 à 72,1 et Claude Opus 4.8 à 75,9. Ce benchmark teste l'interface utilisateur générative, la capacité du modèle à générer des interfaces utilisateur à partir d'instructions en langage naturel. Le module spécialisé GenUI semble lui donner un avantage clair ici. Sur PinchBench, qui mesure les capacités d'utilisation d'outils, Macaron-V1-Venti obtient 94,0, devant Qwen 3.7 Max à 93,4 et Claude Opus 4.8 à 91,8.

Sur ClawGym, qui mesure la performance générale des agents, Macaron obtient 77,7, derrière GPT 5.5 à 82,5 et Claude Opus 4.8 à 80,5. Et sur DeepSWE, un benchmark de génie logiciel plus difficile, il obtient 58,4, derrière GPT 5.5 à 70,0, suggérant que si son spécialiste en codage excelle dans les tâches standard, les correctifs multi-étapes complexes restent une faiblesse, un schéma également observé dans les agents heurtant des limites créatives.

Ce que les chiffres disent de l'approche

La force de l'architecture MoL se manifeste le plus clairement sur les benchmarks spécialisés. Le spécialiste en codage pousse Macaron devant GPT 5.5 sur SWE Verified et TerminalBench, et le spécialiste GenUI crée un grand écart sur UI4ABench. Mais sur des benchmarks plus généraux comme ClawGym, qui peuvent nécessiter une commutation dynamique ou un raisonnement multi-domaine, le modèle est en retard. Le routeur L0 décide en amont, et lorsqu'une requête nécessite des connaissances de plusieurs spécialistes, la conception actuelle ne les fusionne pas lors d'une seule interaction.

MindLab reconnaît implicitement cette limitation : la fiche du modèle note que le raisonnement en cours et les interactions avec les outils restent dans le LoRA sélectionné, tandis que le travail achevé peut être partagé entre spécialistes via des résumés concis. Cela suggère qu'une collaboration est possible, mais pas en temps réel pour un seul tour.

Open source et disponibilité

Le modèle est publié sous licence MIT, une décision alignée avec l'argument en faveur des poids ouverts, bien que la fiche du modèle avertisse les utilisateurs de respecter toutes les exigences héritées de GLM-5.2 et de ses dépendances. Macaron-V1-Venti est disponible sur Hugging Face et peut être consulté via une API hébergée à mintcn.macaron.xin, qui prend en charge les complétions de chat compatibles OpenAI. Pour un déploiement auto-hébergé, MindLab fournit un harnais de service Mixture of LoRA qui maintient le point de terminaison compatible OpenAI tout en ajoutant le routeur et les métadonnées LoRA côté serveur.

Un outil compagnon appelé Macaron Artifacts permet aux utilisateurs de visualiser les interfaces utilisateur et les sessions générées, et peut être installé comme plugin dans Claude Code, Codex et Kimi Code.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.