SevenTnewS

SWE-bench

3 published articles

Pruebas y BenchmarksFeatured2 min read

Análisis de benchmarks

En SWE-bench Verified, los mejores modelos alcanzan el 96%. En código privado de empresas, apenas superan el 23%

SWE-bench Verified hace que los modelos fronterizos parezcan estar cerca de resolver la ingeniería de software del mundo real, con puntuaciones superiores al 95%. SWE-bench Pro, ejecutado en repositorios privados de empresas, reduce esos mismos modelos al 23% o menos, exponiendo cuánto dependía la puntuación de Verified de la exposición a datos públicos.

2026-08-02

Pruebas y BenchmarksFeatured2 min read

Análisis de Benchmark

HumanEval Medía si la IA Podía Programar. Nunca Preguntó si el Código Era Trabajo Real

Los 164 problemas de finalización de funciones de HumanEval se convirtieron en la prueba estándar para la capacidad de codificación de la IA, pero la memorización y su alcance limitado dejaron una amplia brecha entre aprobar el benchmark y manejar una base de código real, una brecha que SWE-bench fue construido para exponer.

2026-07-30

IAFeatured4 min read

Modelos de IA

Poolside Laguna XS 2.1 gana 5 puntos en pruebas de codificación con el mismo hardware

El Laguna XS 2.1 de Poolside mejora SWE-bench Multilingual en 5.4 puntos hasta el 63.1% manteniendo la misma arquitectura MoE de 33B totales y 3B activados. El lanzamiento incluye puntos de control cuantizados, modelos de borrador para decodificación especulativa y una licencia OpenMDW-1.1, haciendo más práctica la codificación local con IA.

2026-07-21