SevenTnewS

Análisis de benchmarks

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%

SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.

Emmanuel Fabrice Omgbwa Yasse

2026-08-02 · Última actualización: 2026-08-03 · 2 min de lectura

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%
Fuentes : Évaluation et B…·SWE-bench — off…·SWE-bench: Can …

SWE-bench evalúa un modelo entregándole un informe de error real o una solicitud de característica extraída de un repositorio real de GitHub, y luego verifica si el parche que escribe hace que el conjunto de pruebas existente del repositorio pase. Sin stubs de funciones sintéticas, sin docstrings escritas para ser fáciles. Simplemente un issue, un código base y una puerta de aprobado/reprobado definida por pruebas que ya estaban allí antes de que el modelo apareciera.

En SWE-bench Verified, un subconjunto curado y verificado por humanos de issues públicos, los resultados ahora parecen casi resueltos. GPT-5.6 Sol supera el 96.2%. Claude Mythos 5 alcanza el 95.5%. Claude Fable 5 llega al 95.0%, GPT-5.6 Luna al 93.0%, e incluso modelos intermedios como Claude Opus 4.8 y Kimi K3 se sitúan entre el 88% y el 89%. Leídos de forma aislada, esos números indican que los modelos fronterizos han dominado esencialmente la corrección de errores del mundo real.

Entonces llega SWE-bench Pro

SWE-bench Pro existe para probar exactamente la suposición que ese número invita: ¿esto se generaliza, o los modelos simplemente se volvieron muy buenos en este conjunto de datos público específico y muy transitado? Pro intercambia issues de repositorios empresariales privados y creados recientemente, bases de código sin posibilidad de haberse filtrado en los datos de preentrenamiento como podrían haberlo hecho issues públicos de GitHub de años de antigüedad.

Los resultados no se acercan a los números de Verified. GPT-5 y Claude Opus 4.1, modelos que estaban en la cima de las tablas en SWE-bench público, caen a entre el 23.1% y el 23.3% en SWE-bench Pro. Restringiendo aún más la prueba a un subconjunto estrictamente confidencial, repositorios que ningún proveedor de modelos podría haber visto plausiblemente en ninguna forma, el rendimiento vuelve a caer, hasta un rango de 14.9% a 17.8%.

Qué mide realmente una brecha de 70 puntos

Esa no es una pequeña diferencia de calibración. Es una capacidad diferente. Un modelo que resuelve el 96% de los issues públicos de GitHub bien documentados y previamente discutidos, y el 15% de los privados de empresas, no está fallando en la codificación en un sentido abstracto; está revelando cuánto de su aparente habilidad fue moldeada por la exposición previa a los patrones específicos, discusiones e incluso correcciones previas adjuntas a los repositorios públicos. Si se elimina esa familiaridad, lo que queda es una medida mucho más cruda de si el modelo puede realmente razonar a través de un código base desconocido.

Esta es la ilustración más nítida en la evaluación comparativa actual de un patrón que aparece en todas partes una vez que lo buscas: el dominio aparente en una prueba pública y conocida con frecuencia no sobrevive al contacto con condiciones genuinamente novedosas y privadas. Para los líderes de ingeniería que deciden si confiar un agente con una base de código de producción real, el número de SWE-bench Pro, no el de Verified, es el que importa. También es el número más difícil para que un laboratorio lo ponga en una diapositiva.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.