SWE-bench
3 published articles
Analyse de benchmark
Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %
SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.
2026-08-02
Analyse de benchmark
HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail
Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.
2026-07-30
Modèles d'IA
Le Laguna XS 2.1 de Poolside gagne 5 points sur les benchmarks de codage avec le même matériel
Le Laguna XS 2.1 de Poolside améliore le SWE-bench Multilingue de 5,4 points pour atteindre 63,1 % tout en conservant la même architecture MoE de 33B totaux et 3B activés. La version inclut des points de contrôle quantifiés, des modèles d'ébauche pour le décodage spéculatif et une licence OpenMDW-1.1, rendant le codage IA local plus pratique.
2026-07-21