pruebas de codificación
2 published articles
Agentes de codificación con IA
El Qwen-Coder-Qoder de Alibaba supera a Cursor en su propia prueba y reduce el uso de tokens en un 14.5%
El nuevo modelo de codificación de Alibaba, Qwen-Coder-Qoder, supera a Cursor Composer-1 en el benchmark Qoder Bench. Las métricas de producción muestran un aumento del 3.85% en la retención de código, una caída del 61.5% en errores de herramientas y una reducción del 14.5% en el uso de tokens. El modelo se entrena con trazas reales de agentes a través de un marco de recompensa-atacante contra el hackeo de recompensas.
2026-07-23
Agentes de IA
Los agentes de IA no pueden completar una migración de Java sin que el servidor de compilación los detenga
IBM Research presenta ScarfBench, un benchmark abierto para evaluar agentes de IA en la migración de frameworks empresariales Java. Las primeras pruebas revelan que los agentes fronterizos son sistemáticamente demasiado confiados sobre sus propios resultados, que las capas de configuración dominan el esfuerzo y que problemas del entorno como las cachés de Docker desvían regularmente las migraciones incluso cuando las transformaciones de código tienen éxito.
2026-07-06