SWE-bench
3 published articles
Análisis de benchmarks
En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%
SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.
2026-08-02
Análisis de Benchmark
HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real
Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.
2026-07-30
Modelos de IA
Poolside Laguna XS 2.1 gana 5 puntos en pruebas de codificación con el mismo hardware
El Laguna XS 2.1 de Poolside mejora SWE-bench Multilingual en 5.4 puntos hasta el 63.1% manteniendo la misma arquitectura MoE de 33B totales y 3B activados. El lanzamiento incluye puntos de control cuantizados, modelos de borrador para decodificación especulativa y una licencia OpenMDW-1.1, haciendo más práctica la codificación local con IA.
2026-07-21