Codage agentique
Comment Grok 4.5 a pris la tête du SWE Marathon, et ce que cela signifie pour les agents de codage
Grok 4.5 mène désormais le classement du SWE Marathon, battant Claude 4 Opus et GPT-5. Le benchmark teste de véritables compétences en génie logiciel : corrections de bugs, ajouts de fonctionnalités et compréhension du code dans des dépôts réels. Ce résultat redessine le paysage concurrentiel des agents de codage IA.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-20 · 3 min de lecture

Les benchmarks d'ingénierie logicielle ont connu une porte tournante de leaders au cours de l'année écoulée. Claude 4 Opus détenait la couronne. GPT-5 l'a prise pour un cycle. Désormais, Grok 4.5 est en tête du SWE Marathon, un benchmark qui teste les agents IA sur des tâches tirées de dépôts GitHub réels : correction de bugs, implémentation de fonctionnalités et gestion de pull requests sur des bases de code qu'ils n'ont pas vues lors de l'entraînement.
Le SWE Marathon diffère de la plupart des benchmarks de LLM. Il ne mesure pas le rappel des connaissances ni le raisonnement mathématique. Il mesure si un agent peut naviguer dans une base de code étrangère, comprendre une description de problème et produire un correctif approprié. Les tâches sont suffisamment difficiles pour que les ingénieurs humains aient souvent besoin d'heures pour les résoudre. Le benchmark publie les taux de réussite et les intervalles de confiance, et il suit chaque soumission jusqu'à un modèle et une configuration spécifiques.
Grok 4.5 a atteint un taux de réussite de 43,8 % sur l'ensemble du SWE Marathon. C'est une avance claire sur Claude 4 Opus (40,5 %) et GPT-5 (38,2 %). La marge est plus faible sur le sous-ensemble « Verified », où Grok 4.5 obtient 46,1 % contre 44,0 % pour Claude 4 Opus, mais le tableau général est le même : une nouvelle première place.

Ce qui a favorisé l'avance
Les données de performance du classement SWE Marathon montrent que Grok 4.5 excelle dans deux catégories spécifiques de tâches : les corrections de bugs complexes nécessitant des modifications sur plusieurs fichiers, et les implémentations de fonctionnalités qui exigent à la fois la compréhension du code existant et d'une nouvelle spécification. Le modèle obtient également des scores plus élevés sur les tâches impliquant des écosystèmes de langages moins familiers. Python et JavaScript dominent le benchmark, mais Grok 4.5 obtient de meilleurs résultats sur les tâches en Rust et Go que les leaders précédents.
Claude 4 Opus reste plus fort sur les tâches nécessitant un raisonnement prudent sur les implications de sécurité ou les contraintes de performance, où il surpasse encore Grok 4.5 et GPT-5 avec de petites marges. GPT-5 est le plus rapide des trois en moyenne, accomplissant les tâches en moins de tours d'agent, mais la qualité de ses solutions est inférieure sur le quartile le plus difficile des problèmes.
| Modèle | Taux de réussite SWE Marathon | Sous-ensemble Verified | Type de tâche le plus fort |
|---|---|---|---|
| Grok 4.5 | 43,8 % | 46,1 % | Corrections de bugs multi-fichiers |
| Claude 4 Opus | 40,5 % | 44,0 % | Corrections axées sur la sécurité |
| GPT-5 | 38,2 % | 41,7 % | Ajouts de fichiers uniques |
Ce que cela signifie
L'avance de Grok 4.5 n'est pas un hasard. Le SWE Marathon est actif depuis plus d'un an, et chaque nouveau leader bat le précédent de quelques points de pourcentage. La tendance va dans une direction : les agents de codage deviennent meilleurs pour naviguer dans des bases de code inconnues, et l'écart entre les modèles sur cette capacité spécifique se réduit, même si le plafond global augmente.
La conclusion pratique pour les développeurs qui évaluent les agents de codage : si vous travaillez avec plusieurs langages ou maintenez une base de code dans une pile moins courante, Grok 4.5 mérite d'être testé. Si les contraintes de sécurité ou les régressions de performance sont votre principale préoccupation, Claude 4 Opus conserve un avantage. Et si la latence importe plus que la correction brute, GPT-5 est toujours le plus rapide pour obtenir un correctif fonctionnel.
Aucun d'entre eux ne résout encore les problèmes les plus difficiles du génie logiciel, les décisions architecturales, les compromis entre exactitude et maintenabilité, ou savoir quand ne pas modifier le code. Mais les chiffres du SWE Marathon suggèrent que l'écart entre ce que les agents peuvent faire et ce qu'ils doivent faire se réduit plus rapidement que la plupart des développeurs ne le pensent.
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.