Tests & BenchmarksFeatured3 min read
Codage agentique
Comment Grok 4.5 a pris la tête du SWE Marathon, et ce que cela signifie pour les agents de codage
Grok 4.5 mène désormais le classement du SWE Marathon, battant Claude 4 Opus et GPT-5. Le benchmark teste de véritables compétences en génie logiciel : corrections de bugs, ajouts de fonctionnalités et compréhension du code dans des dépôts réels. Ce résultat redessine le paysage concurrentiel des agents de codage IA.
2026-07-20