Pruebas y BenchmarksFeatured2 min read
Análisis de Benchmark
HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real
Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.
2026-07-30