SevenTnewS

Les poids ouverts de Qwen3.8-Max arrivent la semaine prochaine

Le modèle le plus puissant jamais conçu par Alibaba passe en open source

Qwen3.8-Max, le premier modèle open-weight de classe Max d'Alibaba à 2,4 billions de paramètres, débarque sur Hugging Face et ModelScope la semaine prochaine. Ce lancement reformule la question de l'open source : que se passe-t-il quand les poids les plus importants de la frontière sont libres à télécharger et à tester ?

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-06 · 4 min de lecture

Le modèle le plus puissant jamais conçu par Alibaba passe en open source

La gamme de modèles la plus performante d'Alibaba était autrefois celle qu'on ne pouvait pas avoir. La série Qwen-Max était conçue pour les clients payants du cloud et est restée fermée, même si des modèles Qwen open-weight plus petits se sont largement répandus. Ce mur vient de tomber. Alibaba a publié Qwen3.8-Max, que l'entreprise présente comme le modèle le plus performant de sa famille à ce jour, dans un article publié sur son blog cloud. Fort de 2,4 billions de paramètres et bâti sur l'architecture de Qwen 3.5, il est le premier modèle phare de classe Max à être publié en open source : les poids arrivent la semaine prochaine sur Hugging Face et ModelScope.

L'article de lancement s'appuie sur trois longues exécutions autonomes, chacune avec une trace publique, au cours desquelles le modèle a amélioré son propre travail pendant des jours, sans aide humaine.

Des poids ouverts au sommet de la gamme

Ouvrir les sources d'un modèle phare est une décision que peu de laboratoires prennent, car garder les meilleurs poids derrière une API payante est la façon dont les entreprises d'IA de pointe protègent leur marge. Alibaba accompagne cette publication d'une poussée produit : l'entreprise a ouvert la bêta de QwenWork, une plateforme d'agents pour le travail qui unifie desktop, cloud et la suite de collaboration DingTalk, laquelle sert plus de 20 millions d'entreprises et d'organisations, dans un abonnement unique. Qwen3.8-Max est une option de modèle mise en avant sur QwenWork à partir du 3 août, et les quatre niveaux de modèles de la plateforme vont d'Economy à Flagship.

Pour les développeurs, le nouveau modèle parle les dialectes API de ses rivaux. QwenCloud propose des points de terminaison chat completions et responses compatibles OpenAI, ainsi qu'une interface compatible Anthropic, de sorte que Qwen3.8-Max peut fonctionner dans Claude Code ou Codex avec quelques variables d'environnement. Un paramètre reasoning_effort, avec les niveaux xhigh, medium et low, contrôle la quantité de réflexion effectuée par le modèle avant qu'il ne réponde, et preserve_thinking est activé par défaut.

Quatre itérations qui battent l'article

La preuve la plus détaillée est l'exécution de reproduction de la recherche. Après avoir reçu un article intitulé « Unified Data Selection for LLM Reasoning » et aucun code de départ, Qwen3.8-Max a passé environ 37 heures à reconstruire le pipeline de zéro, écrit environ 7 600 lignes de code, lancé 33 cycles d'entraînement GPU et reproduit les six principales conclusions de l'article. Il a ensuite utilisé 88 heures supplémentaires pour tenter de faire mieux, générant 18 idées en quatre itérations. L'idée gagnante, qui compte ce que le modèle appelle les points de décision difficiles dans les exemples d'entraînement, a surpassé la méthode de l'article de 2,7 points sur le benchmark de mathématiques AIME24.

ItérationMeilleure idéeAIME24Gain vs. référence
RéférenceMéthode de l'article, reproduite49.58%n/a
1Diviser les données par difficulté50.42%+0.84
2Pondérer les exemples selon l'écart entropie-score51.67%+2.09
3Ajuster la largeur de sélection51.25%+1.67
4Compter les points de décision difficiles (« nhighgate »)52.29%+2.71

Les deux autres exécutions suivent le même schéma. Engagé dans le WWW2025 Multimodal Dialogue Intent Recognition Challenge sur la plateforme Tianchi d'Alibaba, le modèle a affiné plusieurs modèles de langage, les a fusionnés dans un système de vote pondéré, et est passé de 0,60 à 0,853 de précision en 45 soumissions, terminant devant 458 des 526 équipes humaines. Dans un exercice de conception de puces, il a fait passer un accélérateur GCD/RSA de 8 298 portes à 678 portes en environ 500 itérations, et le layout physique est passé de 106×106 µm² à 46×46 µm². Une exécution autonome de 16 jours sur le projet oh-my-cli a accumulé 265 commits, 127 PR et 151 issues, tous visibles dans le dépôt GitHub public.

La maison qui marque son propre jeu

Rien de tout cela n'est accompagné d'un auditeur indépendant. Les résultats sont ceux d'Alibaba, et les plus frappants reposent sur des benchmarks conçus par Alibaba. Sur E-Commerce Bench, une simulation commerciale de 365 jours construite sur des données de transactions désensibilisées de Taobao et Tmall, Qwen3.8-Max a transformé 100 000 ¥ de capital de départ en un solde de 416 252 ¥, soit un rendement de 4,16x que l'entreprise dit supérieur de 38 % à celui de GLM 5.2, deuxième du classement. Les comparaisons sur banc d'essai contre Claude Code et Codex proviennent du même blog. Rien de tout cela ne rend les résultats faux. Cela signifie que la charge de la vérification retombe sur tous les autres.

Les poids ouverts résolvent une partie de ce problème. Une fois qu'ils arriveront la semaine prochaine, toute personne disposant d'assez de GPU pourra relancer les benchmarks contestés et vérifier si le modèle tient la route en dehors de l'échafaudage d'Alibaba. Les laboratoires de pointe gardent leurs plus gros poids derrière des API payantes ; Alibaba vient d'offrir son meilleur modèle. Le verdict sur Qwen3.8-Max viendra de la communauté open source, pas d'un article de lancement.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.