Codificación agéntica
Cómo Grok 4.5 se adelantó en el SWE Marathon, y qué significa para los agentes de codificación
Grok 4.5 ahora lidera la tabla de clasificación de SWE Marathon, superando a Claude 4 Opus y GPT-5. El referente evalúa habilidades reales de ingeniería de software: corrección de errores, adición de funciones y comprensión de código en repositorios reales. El resultado redefine el panorama competitivo de los agentes de codificación de IA.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-20 · 3 min de lectura

Los referentes de ingeniería de software han tenido una puerta giratoria de líderes durante el último año. Claude 4 Opus ostentaba la corona. GPT-5 la tomó durante un ciclo. Ahora Grok 4.5 se sitúa en la cima del SWE Marathon, un referente que evalúa a los agentes de IA en tareas extraídas de repositorios reales de GitHub: corregir errores, implementar funciones y gestionar solicitudes de extracción en bases de código que no han visto durante el entrenamiento.
El SWE Marathon es diferente de la mayoría de los referentes de LLM. No mide la recuperación de conocimiento ni el razonamiento matemático. Mide si un agente puede navegar por una base de código desconocida, comprender la descripción de un problema y producir un parche correcto. Las tareas son lo suficientemente difíciles como para que los ingenieros humanos a menudo necesiten horas para resolverlas. El referente publica tasas de aprobación e intervalos de confianza, y rastrea cada envío hasta un modelo y configuración específicos.
Grok 4.5 logró una tasa de aprobación del 43.8% en el conjunto completo de SWE Marathon. Esto supone una clara ventaja sobre Claude 4 Opus (40.5%) y GPT-5 (38.2%). El margen es menor en el subconjunto "Verificado", donde Grok 4.5 obtiene un 46.1% frente al 44.0% de Claude 4 Opus, pero la imagen general es la misma: un nuevo primer puesto.

Qué impulsó el liderazgo
Los datos de rendimiento de la tabla de clasificación de SWE Marathon muestran que Grok 4.5 sobresale en dos categorías específicas de tareas: correcciones de errores complejas que requieren ediciones en varios archivos, e implementaciones de funciones que exigen comprender tanto el código existente como una nueva especificación. El modelo también obtiene puntuaciones más altas en tareas que involucran ecosistemas de lenguajes desconocidos; Python y JavaScript dominan el referente, pero Grok 4.5 se desempeña mejor en tareas de Rust y Go que los líderes anteriores.
Claude 4 Opus sigue siendo más fuerte en tareas que requieren un razonamiento cuidadoso sobre implicaciones de seguridad o limitaciones de rendimiento, donde aún supera tanto a Grok 4.5 como a GPT-5 por márgenes pequeños. GPT-5 es el más rápido de los tres en promedio, completando tareas en menos turnos de agente, pero la calidad de su solución se queda corta en el cuartil más difícil de los problemas.
| Modelo | Tasa de aprobación en SWE Marathon | Subconjunto verificado | Tipo de tarea más fuerte |
|---|---|---|---|
| Grok 4.5 | 43.8% | 46.1% | Correcciones de errores en varios archivos |
| Claude 4 Opus | 40.5% | 44.0% | Parches con conciencia de seguridad |
| GPT-5 | 38.2% | 41.7% | Adiciones de archivo único |
Qué significa
El liderazgo de Grok 4.5 no es una casualidad. El SWE Marathon ha estado activo durante más de un año, y cada nuevo líder supera al anterior por unos pocos puntos porcentuales. La línea de tendencia apunta en una dirección: los agentes de codificación están mejorando en la navegación de bases de código desconocidas, y la brecha entre modelos en esta capacidad específica se está estrechando incluso cuando el techo general aumenta.
La conclusión práctica para los desarrolladores que evalúan agentes de codificación: si trabajas en varios lenguajes o mantienes una base de código en una pila menos común, vale la pena probar Grok 4.5. Si las restricciones de seguridad o las regresiones de rendimiento son tu principal preocupación, Claude 4 Opus aún conserva una ventaja. Y si la latencia importa más que la corrección bruta, GPT-5 sigue siendo el más rápido en llegar a un parche funcional.
Ninguno de ellos resuelve aún los problemas más difíciles de la ingeniería de software: decisiones arquitectónicas, compensaciones entre corrección y mantenibilidad, o saber cuándo no cambiar el código. Pero los números de SWE Marathon sugieren que la brecha entre lo que los agentes pueden hacer y lo que necesitan hacer se está reduciendo más rápido de lo que la mayoría de los desarrolladores esperan.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.