Tests & BenchmarksFeatured2 min read
Analyse de benchmark
HumanEval a mesuré si l'IA savait coder. Il ne s'est jamais demandé si le code était un vrai travail
Les 164 problèmes de complétion de fonctions de HumanEval sont devenus le test standard des capacités de codage de l'IA, mais la mémorisation et son champ d'action étroit ont laissé un large fossé entre la réussite du benchmark et la gestion d'une base de code réelle, un fossé que SWE-bench a été conçu pour exposer.
2026-07-30