SevenTnewS

Agents de codage IA

Le Qwen-Coder-Qoder d'Alibaba bat Cursor sur son propre test et réduit l'utilisation de jetons de 14,5 %

Le nouveau modèle de codage d'Alibaba, Qwen-Coder-Qoder, bat Cursor Composer-1 sur le benchmark Qoder Bench. Les mesures de production montrent une augmentation de 3,85 % de la rétention de code, une baisse de 61,5 % des erreurs d'outils et une réduction de 14,5 % de l'utilisation des jetons. Le modèle s'entraîne sur des traces d'agents réelles via un cadre récompenseur-attaqueur contre le contournement des récompenses.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-23 · 4 min de lecture

Le Qwen-Coder-Qoder d'Alibaba bat Cursor sur son propre test et réduit l'utilisation de jetons de 14,5 %
Sources : In Practice: QO…·Qwen-Coder-Qode…

Alibaba Cloud tente un pari différent dans la course aux armements du codage IA. Au lieu de lâcher un modèle polyvalent et de laisser les développeurs comprendre comment l'intégrer dans leurs flux de travail, l'entreprise a déployé Qwen-Coder-Qoder, un modèle spécialement conçu pour son écosystème CLI Qoder et d'agents. Les premiers chiffres suggèrent que le pari pourrait porter ses fruits.

Sur Qoder Bench, le benchmark propriétaire de l'entreprise pour les tâches de génie logiciel du monde réel, le modèle dépasse Cursor Composer-1 en résolution de tâches. L'écart est plus important sous Windows, où la précision des commandes terminal s'est améliorée jusqu'à 50 % par rapport à la version précédente. En production au cours des dernières semaines, la rétention de code a augmenté de 3,85 %, les taux d'erreur des outils ont chuté de 61,5 % et la consommation de jetons a diminué de 14,5 %. Ce sont le genre de mesures qui intéressent réellement les responsables techniques.

Qwen-Coder-Qoder est construit sur la base de Qwen-Coder et affiné avec un apprentissage par renforcement à grande échelle. Ce qui le distingue de la plupart des versions de modèles est la manière dont la boucle RL fonctionne : il s'entraîne sur des interactions réelles d'agents provenant de milliers d'utilisateurs quotidiens de Qoder, extrayant des pratiques de génie logiciel et les convertissant en signaux de récompense. Alibaba appelle cela le volant d'inertie « Modèle-Agent-Produit », et il s'agit d'une boucle fermée où l'utilisation du produit façonne directement l'itération suivante du modèle.

Le cadre récompenseur-attaqueur

Le contournement des récompenses est un problème connu en RL pour les agents de codage. Si le système récompense l'utilisation parallèle d'outils pour la vitesse, un modèle pourrait commencer à analyser des fichiers non pertinents pour gonfler son score de parallélisme sans contribuer réellement à la correction. Alibaba a construit un cadre adversarial pour détecter cela avant le début de l'entraînement : un évaluateur LLM teste le système de récompense pendant le développement, à la recherche de failles que le modèle pourrait exploiter. L'entreprise affirme que cela a amélioré à la fois la vitesse d'itération et la robustesse de la conception des récompenses.

Graphique : Améliorations de production du Qwen-Coder-Qoder par rapport à la version précédente
En production, la rétention de code a augmenté de 3,85 %, les taux d'erreur des outils ont chuté de 61,5 % et la consommation de jetons a diminué de 14,5 %, selon l'article.

L'entraînement lui-même repose sur ROLL, un système d'entraînement RL pour les modèles Mixture-of-Experts avec des centaines de milliards de paramètres répartis sur des clusters de milliers de GPU. La phase de déploiement consomme généralement plus de 70 % du temps total d'entraînement ; Alibaba affirme que des optimisations au niveau du système ont offert un gain de débit de 10x, compressant considérablement les cycles d'entraînement.

Alibaba a également automatisé la configuration de dizaines de milliers d'environnements logiciels réels à l'aide d'une conteneurisation à haut débit qui crée et détruit des sandbox instantanément, permettant un RL à une échelle qui serait peu pratique avec une gestion manuelle des environnements.

Traitement des retours 7j/24 avec Qoder CLI

Parallèlement à la version du modèle, Alibaba a publié une étude de cas détaillée sur la façon dont Qoder CLI est utilisé au sein de sa propre organisation d'ingénierie pour construire un système de traitement des retours entièrement autonome. Le système gère l'ensemble du pipeline depuis la soumission des retours utilisateur jusqu'à la correction de code, les humains n'intervenant qu'à l'étape finale de révision du code.

Le pipeline comporte quatre modules : classification des problèmes, regroupement des problèmes, analyse des logs et correction automatique. Chaque étape utilise un niveau de modèle différent via Qoder CLI. La classification et le regroupement utilisent des modèles moins chers de niveau « Effective ». L'analyse des logs et l'identification des causes racines utilisent le niveau « Performance ». Les corrections de code utilisent le niveau « Ultimate ». La conclusion de l'entreprise est directe : utiliser des modèles bon marché pour des tâches complexes gaspille plus de jetons dans de mauvaises directions que d'aller directement au modèle SOTA.

Le système inclut un mécanisme d'auto-réflexion. Après chaque tâche d'analyse de logs, l'agent écrit une rétrospective dans un fichier task-retro.md, documentant les étapes inefficaces et les leçons apprises. Un agent de pipeline séparé examine ces rétrospectives périodiquement pour mettre à jour les Skills correspondants. Cela crée une chaîne d'évolution où chaque erreur d'agent devient un signal.

L'impact est mesurable. Auparavant, chaque problème nécessitait au moins 30 minutes entre la soumission du retour et l'analyse manuelle des logs et l'identification de la cause racine. Le système automatisé termine désormais l'analyse de la cause racine en deux minutes, fonctionnant 24h/24 et 7j/7 sans intervention humaine au-delà de la révision du code.

Ce que fait la concurrence

Le domaine du codage IA s'est transformé en une guerre d'améliorations progressives. Cursor, GitHub Copilot et l'assistant IA de JetBrains publient tous des mises à jour hebdomadaires. Cursor Composer-1, la cible de comparaison directe choisie par Alibaba, n'est pas non plus un produit statique. Mais Qwen-Coder-Qoder est construit pour une intégration étroite avec une architecture d'agent spécifique, et non pour une utilisation générale. Cela peut limiter sa portée mais signifie également que la boucle de rétroaction est plus courte : chaque interaction utilisateur avec Qoder peut affiner le modèle en quelques semaines plutôt qu'en quelques mois.

Alibaba annonce prévoir des itérations hebdomadaires sur le modèle, ce qui suggère un rythme que la plupart des distributeurs de modèles à poids ouverts auraient du mal à égaler. Le modèle du volant d'inertie nécessite une utilisation continue du produit pour alimenter les données d'entraînement, donc le pari repose autant sur l'adoption par les utilisateurs de Qoder que sur le modèle lui-même.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.