SevenTnewS

SWE-bench

3 published articles

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

2026-08-02

Tests & BenchmarksFeatured2 min read

Analyse de benchmark

HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail

Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.

2026-07-30

IAFeatured4 min read

Modèles d'IA

Le Laguna XS 2.1 de Poolside gagne 5 points sur les benchmarks de codage avec le même matériel

Le Laguna XS 2.1 de Poolside améliore le SWE-bench Multilingue de 5,4 points pour atteindre 63,1 % tout en conservant la même architecture MoE de 33B totaux et 3B activés. La version inclut des points de contrôle quantifiés, des modèles d'ébauche pour le décodage spéculatif et une licence OpenMDW-1.1, rendant le codage IA local plus pratique.

2026-07-21