SevenTnewS

IA open source

Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement

Alibaba met en open source Qwen 3.8-Max, son modèle le plus performant jamais conçu : un MoE de 2.4 billions de paramètres qui bat GPT-5.6 Sol sur SWE-bench Pro, PaperBench et IFBench. Nous décortiquons les réserves sur les benchmarks et ce qu'un modèle vedette ouvert à 95B actifs signifie pour les développeurs.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-08-16 · 5 min de lecture

Qwen 3.8-Max : le modèle le plus puissant d'Alibaba est désormais téléchargeable gratuitement
Sources : Qwen3.8-Max: A …·seventnews arch…

Le niveau Max était la partie de Qwen que personne ne pouvait télécharger. Les modèles vedettes d'Alibaba restaient confinés derrière des API tandis que les déclinaisons Qwen plus petites étaient publiées en poids ouverts. Qwen 3.8-Max met fin à cela. L'annonce de la sortie le présente comme le modèle le plus performant de la famille Qwen à ce jour et la première déclinaison de classe Qwen-Max à poids ouverts, publiée via Hugging Face et ModelScope. Le modèle atteint 2.4 billions de paramètres au total, en activant 95 milliards par jeton, sur l'architecture introduite par Qwen 3.5.

Il possède déjà un bilan datant de l'ère fermée. Notre couverture précédente a suivi une période de 24 heures durant laquelle Qwen 3.8-Max a battu 458 équipes humaines travaillant seules, puis une exécution autonome de 16 jours ayant produit un framework d'agents, avec une deuxième place dans Vision Arena. Ces capacités vont être reproductibles partout où le modèle peut être servi.

Le niveau Max fermé d'Alibaba vient de passer en open source

Il s'agit d'une rupture stratégique, pas d'un geste de bonne volonté. Alibaba a consolidé ses travaux sur l'IA au sein d'une unité unique dont la mission déclarée est de « créer, livrer et appliquer des jetons », appuyée par une poussée d'investissement de 53 milliards de dollars, comme l'a noté notre couverture précédente. L'entreprise déploie une flotte de modèles plutôt qu'un champion unique, et le compromis de cette sortie est lisible : les poids sont gratuits, tandis que Qwen Cloud et les outils de service associés constituent le canal payant. Un détail particulier compte pour quiconque envisage d'exécuter le modèle vedette : la déclinaison ouverte de 2.4T, Qwen3.8-2.4T-A95B, est exclusivement textuelle et exige le mode de réflexion pour chaque interaction. Les entrées multimodales ne sont pas prises en charge et la réflexion ne peut pas être désactivée, même si la fondation Qwen 3.5 qui la sous-tend a été entraînée comme un modèle unifié vision-langage.

Là où Qwen 3.8-Max bat GPT-5.6 Sol et là où il perd

Selon les chiffres de l'annonce, Qwen 3.8-Max surpasse son prédécesseur sur presque toutes les lignes, et face aux rivaux fermés, les victoires sont réelles mais inégales. Il affiche le meilleur score sur PaperBench (93.0, devant les 90.5 de GPT-5.6 Sol), sur le suivi d'instructions (IFBench 82.8 contre 72.7) et sur l'utilisation d'ordinateur (OSWorld-Verified 86.1). Il bat GPT-5.6 Sol sur SWE-bench Pro, 67.7 à 64.6. Mais Fable 5 reste nettement en tête sur ce même benchmark avec 80.0, GPT-5.6 Sol domine Terminal Bench 2.1 avec 88.8 contre 86.6, et sur GPQA Diamond, l'avance revient à GPT-5.6 Sol avec 94.1.

BenchmarkQwen 3.8-MaxQwen 3.7-MaxGPT-5.6 SolFable 5Opus 4.8
Terminal Bench 2.186.674.588.884.684.6
SWE-bench Pro67.760.664.680.069.2
DeepSWE 1.156.621.673.070.059.0
PaperBench93.064.890.588.880.3
GPQA Diamond92.692.494.192.692.0
IFBench82.879.172.763.562.2

Scores tels que publiés par l'équipe Qwen. Selon les notes de bas de page de l'annonce, les résultats de Fable 5 peuvent impliquer des solutions de repli.

Le schéma : Qwen 3.8-Max est en tête sur le suivi d'instructions, la reproduction d'articles et l'utilisation d'ordinateur, tandis que l'ingénierie logicielle à l'échelle d'un dépôt et le raisonnement difficile favorisent encore les modèles fermés. Notons que sa référence SWE-bench Pro est la version corrigée par l'équipe elle-même, avec des tâches problématiques réparées et chaque concurrent réévalué sur le benchmark affiné, un détail qui compte lorsque l'écart avec GPT-5.6 Sol n'est que de 3.1 points.

Un modèle de 2.4T qui active 95B paramètres par jeton

Le suffixe A95B est le chiffre qui compte pour quiconque héberge le modèle. La conception à mélange d'experts active 95 milliards des 2.4 billions de paramètres par jeton, et c'est ce nombre de paramètres actifs que suit le coût de service. C'est ce qui rend un modèle de cette taille praticable hors d'un laboratoire ; la plupart des paramètres restent dormants. La lignée Qwen 3.5 apporte les Gated Delta Networks aux côtés du MoE épars, ce que l'équipe crédite d'une inférence à haut débit avec un surcoût de latence minimal. La longueur de contexte atteint 1 million de jetons, avec des budgets de sortie recommandés de 262 144 jetons de raisonnement et 131 072 jetons finaux. La même sortie inclut un modèle frère de 27 milliards de paramètres, Qwen3.8-27B, environ 90 fois plus petit.

La pression en matière d'efficacité pèse sur les moteurs de service. L'équipe désigne SGLang, vLLM ou TokenSpeed pour les charges de travail en production, et c'est exactement le territoire visé par les travaux récents d'Aleph Alpha : sa bibliothèque megakernel a rapporté des gains de vitesse d'inférence allant jusqu'à 200 % pour les modèles MoE FP8 exécutés dans vLLM et SGLang. Avec des poids ouverts d'une telle ampleur, c'est l'efficacité d'inférence, et non le nombre de paramètres, qui décide qui peut réellement utiliser le modèle.

La réserve sur le harnais derrière les gains agentiques

Les bonds des capacités agentiques sont l'information principale. DeepSWE 1.1 passe de 21.6 à 56.6 face à Qwen 3.7-Max, OSWorld-Verified de 73.3 à 86.1, et le taux de réussite à l'Agents' Last Exam de 11.8 à 27.0. Les notes de bas de page méritent autant d'attention que les scores. Les exécutions de Qwen sur de nombreuses lignes utilisent le harnais Claude Code, les concurrents disposent de leurs harnais officiels (GPT-5.6 Sol avec Codex, les modèles Claude avec les scores Terminus 2 de Artificial Analysis), et plusieurs benchmarks sont internes : QwenSWEBench, QwenQoderBench, CoWorkBench, et d'autres. Pour SkillsBench, l'équipe déclare sans détour que tous les résultats proviennent de ses propres tests. Les chiffres de Fable 5 « peuvent impliquer des solutions de repli ».

Cette divulgation est inhabituellement franche, mais il s'agit tout de même d'une évaluation menée par le fournisseur face à des rivaux fermés, sur des benchmarks que le fournisseur contrôle en partie. Nous avons déjà vu l'écart entre le codage sur benchmark et la production : les meilleurs modèles dépassent 96 % sur SWE-bench Verified mais atteignent à peine 23 % sur du code d'entreprise privé, comme l'a montré notre couverture des variantes Pro. Une recherche que nous avons couverte sur l'évolution des harnais, testée sur Terminal-Bench 2.1 avec GPT-5.4 et Claude Opus 4.6, se demande si les améliorations découvertes par itération du harnais survivent sur des tâches exclues. La même question pèse sur l'avance étroite de Qwen sur SWE-bench Pro.

Ce que les développeurs peuvent réellement exécuter avec des poids ouverts

Deux identifiants de modèles sont publiés : Qwen/Qwen3.8-2.4T-A95B et Qwen3.8-27B, avec des téléchargements depuis Hugging Face ou ModelScope. Les utilisateurs bloqués depuis Hugging Face peuvent basculer via des variables d'environnement telles que SGLANG_USE_MODELSCOPE ou VLLM_USE_MODELSCOPE. La couche de déploiement a rattrapé son retard : Hugging Face a repensé ses Inference Endpoints autour de vLLM, SGLang, llama.cpp et de conteneurs personnalisés avec mise à l'échelle automatique, ce qui offre à un MoE à 95B actifs un chemin d'hébergement standard sans pile sur mesure.

Cette sortie prolonge la stratégie de catalogue de Qwen. Sa présence sur Hugging Face couvre sept domaines de capacités, du langage à la parole, l'image, le raisonnement d'agent et l'alignement sécurité, et l'équipe publie habituellement les données d'entraînement, les harnais d'évaluation et les modèles de récompense aux côtés des poids. Passer le modèle vedette en open source change la valeur de cette habitude : un modèle avec les meilleurs scores sur PaperBench, IFBench et OSWorld-Verified est désormais livré avec ses poids, ce que ses rivaux fermés n'ont pas fait.

La question ouverte est de savoir si ces victoires survivent à une vérification par un tiers. Les notes de bas de page montrent une vraie franchise sur les harnais et les tests internes. Mais les lignes où Qwen 3.8-Max bat GPT-5.6 Sol ont été mesurées par l'équipe qui a entraîné le modèle, et la vérification indépendante antérieure la plus solide, Artificial Analysis sur Qwen 3.7-Max, date de la génération précédente. Tant que des exécutions indépendantes n'arrivent pas, la plus grande sortie à poids ouverts jamais publiée par Alibaba repose sur des chiffres qu'elle a en grande partie enregistrés elle-même.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.