SevenTnewSL'actu IA & tech, expliquée

Analyse de benchmark

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %

SWE-bench Verified donne l'impression que les modèles de pointe sont proches de résoudre le génie logiciel réel, avec des scores supérieurs à 95 %. SWE-bench Pro, exécuté sur des dépôts d'entreprise privés, fait chuter ces mêmes modèles à 23 % ou moins, révélant à quel point le score Verified dépendait de l'exposition aux données publiques.

Emmanuel Fabrice Omgbwa Yasse

2026-08-02 · Dernière mise à jour : 2026-08-03 · 2 min de lecture

Sur SWE-bench Verified, les meilleurs modèles atteignent 96 %. Sur du code d'entreprise privé, ils dépassent à peine 23 %
Sources : Évaluation et B…·SWE-bench — off…·SWE-bench: Can …

SWE-bench évalue un modèle en lui fournissant un véritable rapport de bug ou une demande de fonctionnalité tirée d'un dépôt GitHub réel, puis en vérifiant si le correctif qu'il écrit fait passer la suite de tests existante du dépôt. Pas de stubs de fonctions synthétiques, pas de docstrings écrites pour être faciles. Juste un issue, une base de code, et une porte passe/échoue définie par des tests qui étaient déjà là avant l'arrivée du modèle.

Sur SWE-bench Verified, un sous-ensemble organisé et vérifié par des humains d'issues publics, les résultats semblent désormais presque résolus. GPT-5.6 Sol atteint 96,2 %. Claude Mythos 5 obtient 95,5 %. Claude Fable 5 atteint 95,0 %, GPT-5.6 Luna 93,0 %, et même les modèles de milieu de tableau comme Claude Opus 4.8 et Kimi K3 se situent autour de 88 % à 89 %. Lu isolément, ces chiffres indiquent que les modèles de pointe ont essentiellement maîtrisé la correction de bugs réels.

Puis vient SWE-bench Pro

SWE-bench Pro existe pour tester exactement l'hypothèse que ce chiffre invite : est-ce que cela généralise, ou les modèles sont-ils simplement devenus très bons sur cet ensemble de données public spécifique et maintes fois parcouru ? Pro remplace les issues par des issues provenant de dépôts d'entreprise privés et récemment créés, des bases de code n'ayant aucune chance d'avoir fuité dans les données de pré-entraînement comme les issues GitHub publics vieux de plusieurs années auraient pu le faire.

Les résultats ne sont pas proches des chiffres Verified. GPT-5 et Claude Opus 4.1, des modèles qui dominaient les classements sur SWE-bench public, chutent à entre 23,1 % et 23,3 % sur SWE-bench Pro. Restreignez encore le test à un sous-ensemble strictement confidentiel, des dépôts qu'aucun fournisseur de modèle n'aurait pu vraisemblablement voir sous quelque forme que ce soit, et la performance chute à nouveau, jusqu'à une fourchette de 14,9 % à 17,8 %.

Ce que mesure réellement un écart de 70 points

Ce n'est pas une petite différence de calibration. C'est une capacité différente. Un modèle qui résout 96 % des issues GitHub publics, bien documentés et déjà discutés, et 15 % des issues d'entreprise privés n'échoue pas en codage dans un sens abstrait, cela révèle à quel point ses compétences apparentes ont été façonnées par une exposition préalable aux schémas, discussions, et même correctifs antérieurs spécifiques attachés aux dépôts publics. Retirez cette familiarité, et ce qui reste est une mesure beaucoup plus brute de la capacité du modèle à raisonner réellement sur une base de code inconnue.

C'est l'illustration la plus nette dans l'état actuel des benchmarks d'un schéma qui apparaît partout dès qu'on le cherche : la maîtrise apparente sur un test public bien connu ne survit souvent pas au contact avec des conditions véritablement nouvelles et privées. Pour les responsables techniques qui décident de faire confiance à un agent avec une base de code de production réelle, le chiffre SWE-bench Pro, pas celui Verified, est celui qui compte. C'est aussi le chiffre le plus difficile pour un laboratoire à mettre sur une diapositive.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.