benchmarks de code
2 published articles
Agents de codage IA
Le Qwen-Coder-Qoder d'Alibaba bat Cursor sur son propre test et réduit l'utilisation de jetons de 14,5 %
Le nouveau modèle de codage d'Alibaba, Qwen-Coder-Qoder, bat Cursor Composer-1 sur le benchmark Qoder Bench. Les mesures de production montrent une augmentation de 3,85 % de la rétention de code, une baisse de 61,5 % des erreurs d'outils et une réduction de 14,5 % de l'utilisation des jetons. Le modèle s'entraîne sur des traces d'agents réelles via un cadre récompenseur-attaqueur contre le contournement des récompenses.
2026-07-23
Agents IA
Les agents IA ne peuvent pas terminer une migration Java sans que le serveur de build ne leur dise de s'arrêter
IBM Research introduit ScarfBench, un benchmark ouvert pour évaluer les agents IA sur la migration d'un framework Java d'entreprise. Les premiers tests révèlent que les agents de pointe sont systématiquement trop confiants quant à leurs propres résultats, que les couches de configuration dominent l'effort et que les problèmes d'environnement comme les caches Docker perturbent régulièrement les migrations, même lorsque les transformations de code réussissent.
2026-07-06