IA open source
Qwen3.8-Max a battu 458 équipes humaines en 24 heures, en travaillant seul
Qwen3.8-Max a battu 458 des 526 équipes humaines lors d'un concours de 24 heures en travaillant seul, et Alibaba mettra ses poids en open source la semaine prochaine. Chaque chiffre est pour l'instant auto-déclaré, ce qui explique précisément pourquoi les affirmations d'autonomie méritent d'être examinées de près.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-03 · 5 min de lecture

L'équipe Qwen d'Alibaba a publié Qwen3.8-Max le 2 août, un modèle de 2,4 billions de paramètres qu'elle présente comme le plus performant de la famille. Les poids ouverts, une première pour un modèle de classe Max, sont attendus la semaine prochaine. Mais l'information clé de cette annonce est un ensemble d'affirmations sur ce que le modèle a fait sans qu'aucun humain ne le supervise : maintenir un projet logiciel en fonctionnement pendant plus de dix jours, reproduire un article de recherche à partir de zéro puis le surpasser, et devancer la plupart des 526 équipes humaines en compétition.
Ces affirmations pèsent plus lourd qu'un tableau de benchmarks ordinaire, car elles décrivent un travail autonome soutenu, le type de travail qui détermine si les modèles actuels sont réellement utiles en dehors d'une démo. Elles sont aussi, pour l'instant, entièrement auto-déclarées. L'entreprise ne cache pas qu'il s'agit de ses propres tests ; la vérification indépendante n'a pas encore pu suivre. Gardez cette tension à l'esprit pour la suite.
Trois sessions sans aucun regard humain
Qwen a soumis le modèle à trois défis, chacun durant plusieurs jours et chacun impliquant l'utilisation d'outils, l'auto-correction et la replanification. Les règles étaient similaires dans les trois cas : le modèle partait sans code et sans guidage humain, et chaque résultat devait être obtenu en écrivant et en exécutant des logiciels.
| Tâche | Durée de l'exécution | Résultat, tel que rapporté par Qwen |
|---|---|---|
| Construire le projet oh-my-cli et un harnais auto-évolutif | Session de plus de 10 jours | 265 commits, 127 PRs, 151 issues après environ 16 jours autonomes |
| Reproduire un article de recherche, puis l'améliorer | Environ 125 heures | 7 600 lignes de code, 33 sessions d'entraînement GPU, +2,7 points par rapport à la méthode de l'article sur AIME24 |
| Participer à un concours en direct contre 526 équipes humaines | 24 heures | 458 équipes battues (87 %), précision de 0,60 à 0,853 |
Le cas du concours est celui qu'il faut lire deux fois. Le modèle a lu les règles de la compétition, choisi des modèles à affiner (BERT, MacBERT et RoBERTa pour le texte, Qwen2.5-VL-7B pour les captures d'écran), et les a fusionnés dans un système de vote pondéré. Chacune de ses 45 soumissions a orienté la session d'entraînement suivante, portant la précision de 0,60 à 0,853 et lui permettant de dépasser 458 des 526 équipes humaines, soit 87 % du lot. Ce que l'entreprise vend, ce n'est pas une seule exécution astucieuse. C'est une boucle qui s'améliore en continu.
Les poids ouverts changent la donne
Jusqu'à présent, le niveau Max était la partie fermée de la gamme Qwen. Qwen3.8-Max change la donne : l'équipe annonce que les poids seront publiés sur Hugging Face et ModelScope la semaine prochaine, ce qui constituera la première version à poids ouverts de la classe Qwen-Max. Avec 95 milliards de paramètres actifs sur 2,4 billions, le label open source s'étend désormais à un modèle conçu pour des sessions d'agents sur plusieurs jours, et non pas uniquement pour la conversation.
Cette décision s'inscrit dans la stratégie plus large d'Alibaba. L'entreprise a regroupé ses activités liées à l'IA dans une seule unité commerciale avec pour mission, selon ses propres termes, de « créer, livrer et appliquer des jetons », soutenue par un effort d'investissement de 53 milliards de dollars, et elle a déployé une flotte de modèles plutôt qu'un champion unique. Qwen3.7-Max, publié en mai, était le précédent fleuron ; une évaluation indépendante d'Artificial Analysis a montré qu'il surpassait les principaux concurrents chinois et égalait les meilleurs systèmes mondiaux. Qwen3.8-Max est l'étape suivante sur cette voie, avec les poids ouverts comme élément différenciateur.
Le problème de l'auto-déclaration
La mise en garde honnête : presque tous les chiffres de cette publication proviennent de l'équipe qui a construit le modèle. Certaines lignes du benchmark pour les modèles concurrents sont vides lorsqu'aucun score publié n'existe, et les bancs d'essai utilisés ne sont pas toujours identiques d'une ligne à l'autre. Sur le tableau mis en avant par la publication, les résultats les plus solides de Qwen3.8-Max face aux rivaux de pointe nommés sont PaperBench à 93,0, au-dessus du score de 90,5 de GPT-5.6 Sol, et 92,9 sur la variante à 8 aiguilles de MRCR v2 avec un contexte de 256K. Ce sont des chiffres du fournisseur, mais ce sont des chiffres précis du fournisseur.
Les exécutions les plus longues sont les plus difficiles à vérifier et les plus frappantes. À partir d'un espace de travail factice et d'un script d'évaluation, le modèle a réarchitecturé un accélérateur cryptographique en environ 500 étapes, réduisant le nombre de portes synthétisées de 8 298 à 678 et la puce placée de 106 par 106 micromètres à 46 par 46, soit une réduction de surface de 81 %, tout en respectant un timing de 500 MHz. Les jalons publiés ressemblent à un journal de bord d'ingénieur : remplacer le diviseur modulo, réduire les largeurs de bits, élaguer la machine à états, fusionner les modules, compresser les portes. Dans un benchmark de commerce électronique simulé sur 365 jours, reposant sur les données de transactions Taobao et Tmall, il a terminé avec un solde de 416 252 ¥, soit 38 % devant le deuxième.
Une exécution indépendante d'une session autonome de dix jours, avec la trace complète publiée, permettrait de trancher ce type d'affirmation. L'équipe Qwen a, dans un cas, fait ce qui s'en rapproche le plus : l'historique complet du projet de construction de oh-my-cli est public sur GitHub, de sorte que chaque commit, chaque pull request et chaque issue est vérifiable.
Ce qui est livré avec
Côté API, Qwen3.8-Max prend en charge un paramètre reasoning_effort avec trois niveaux (xhigh, medium, low) et conserve par défaut la sortie de réflexion. Il s'intègre à Claude Code, Codex, Qoder, Qwen Code et OpenClaw via des points de terminaison compatibles OpenAI et compatibles Anthropic. Une nouvelle bibliothèque, Qwen-MM-Plugins, ajoute le traitement d'images et de vidéos aux frameworks d'agents existants, et l'équipe a présenté RecreationBench, un benchmark pour reconstruire des applications réelles observées uniquement comme des boîtes noires sur cinq plateformes.
La question pour le mois à venir est de savoir si l'autonomie tient en dehors des bacs à sable de Qwen. Ce sont les laboratoires indépendants qui y répondront. En attendant, la publication est significative pour une raison plus simple : Alibaba parie que ce sont les poids ouverts, et pas seulement l'accès à l'API, qui permettront de mettre des agents autonomes multi-jours à la portée du monde entier.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.