SevenTnewS

Agentes de codificación con IA

El Qwen-Coder-Qoder de Alibaba supera a Cursor en su propia prueba y reduce el uso de tokens en un 14.5%

El nuevo modelo de codificación de Alibaba, Qwen-Coder-Qoder, supera a Cursor Composer-1 en el benchmark Qoder Bench. Las métricas de producción muestran un aumento del 3.85% en la retención de código, una caída del 61.5% en errores de herramientas y una reducción del 14.5% en el uso de tokens. El modelo se entrena con trazas reales de agentes a través de un marco de recompensa-atacante contra el hackeo de recompensas.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-23 · 4 min de lectura

El Qwen-Coder-Qoder de Alibaba supera a Cursor en su propia prueba y reduce el uso de tokens en un 14.5%
Fuentes : In Practice: QO…·Qwen-Coder-Qode…

Alibaba Cloud está apostando por una estrategia diferente en la carrera armamentista de la codificación con IA. En lugar de lanzar un modelo de propósito general y dejar que los desarrolladores descubran cómo integrarlo en sus flujos de trabajo, la empresa ha presentado Qwen-Coder-Qoder, un modelo diseñado específicamente para su ecosistema Qoder CLI y de agentes. Los primeros números sugieren que la apuesta podría dar resultado.

En Qoder Bench, el benchmark propio de la empresa para tareas de ingeniería de software del mundo real, el modelo supera a Cursor Composer-1 en la resolución de tareas. La brecha es más amplia en Windows, donde la precisión de los comandos de terminal mejoró hasta en un 50% en comparación con la versión anterior. En producción durante las últimas semanas, la retención de código aumentó un 3.85%, las tasas de error de herramientas cayeron un 61.5% y el consumo de tokens se redujo un 14.5%. Esas son las métricas que realmente importan a los líderes de ingeniería.

Qwen-Coder-Qoder está construido sobre la base de Qwen-Coder y refinado con aprendizaje por refuerzo a gran escala. Lo que lo diferencia de la mayoría de los lanzamientos de modelos es cómo funciona el bucle de RL: se entrena con interacciones reales de agentes de miles de usuarios diarios de Qoder, extrayendo prácticas de ingeniería de software y convirtiéndolas en señales de recompensa. Alibaba llama a esto el volante "Modelo-Agente-Producto", y es un bucle cerrado donde el uso del producto moldea directamente la siguiente iteración del modelo.

El marco de recompensa-atacante

El hackeo de recompensas es un dolor de cabeza conocido en RL para agentes de código. Si el sistema recompensa el uso paralelo de herramientas por velocidad, un modelo podría comenzar a escanear archivos irrelevantes para inflar su puntuación de paralelismo sin contribuir realmente a la solución. Alibaba construyó un marco adversarial para detectar esto antes de que comience el entrenamiento: un revisor LLM pone a prueba el sistema de recompensas durante el desarrollo, buscando lagunas que el modelo podría explotar. La empresa dice que esto ha mejorado tanto la velocidad de iteración como la robustez del diseño de recompensas.

Gráfico: Mejoras de Producción de Qwen-Coder-Qoder sobre la Versión Anterior
En producción, la retención de código aumentó un 3.85%, las tasas de error de herramientas cayeron un 61.5% y el consumo de tokens se redujo un 14.5%, según el artículo.

El entrenamiento en sí mismo se basa en ROLL, un sistema para el entrenamiento RL de modelos Mixture-of-Experts con cientos de miles de millones de parámetros en clústeres de miles de GPUs. La fase de rollout típicamente consume más del 70% del tiempo total de entrenamiento; Alibaba dice que las optimizaciones a nivel de sistema proporcionaron un aumento de rendimiento de 10x, comprimiendo significativamente los ciclos de entrenamiento.

Alibaba también automatizó la configuración de decenas de miles de entornos de software del mundo real utilizando contenedorización de alta velocidad que crea y destruye entornos aislados instantáneamente, permitiendo RL a una escala que sería impracticable con la gestión manual de entornos.

Procesamiento de retroalimentación 7x24 con Qoder CLI

Junto con el lanzamiento del modelo, Alibaba publicó un estudio de caso detallado de cómo se utiliza Qoder CLI dentro de su propia organización de ingeniería para construir un sistema de procesamiento de retroalimentación totalmente autónomo. El sistema maneja todo el pipeline desde el envío de retroalimentación del usuario hasta la corrección de código, con humanos involucrados solo en la etapa final de revisión de código.

El pipeline tiene cuatro módulos: clasificación de incidencias, agrupación de incidencias, análisis de registros y corrección automática. Cada etapa utiliza un nivel de modelo diferente a través de Qoder CLI. La clasificación y agrupación usan modelos más económicos del nivel "Efectivo". El análisis de registros y la identificación de causas raíz usan el nivel "Rendimiento". Las correcciones de código usan el nivel "Definitivo". La conclusión de la empresa es directa: usar modelos baratos para tareas complejas desperdicia más tokens en direcciones equivocadas que simplemente ir directamente al modelo de última generación.

El sistema incluye un mecanismo de autorreflexión. Después de cada tarea de análisis de registros, el agente escribe una retrospectiva en un archivo task-retro.md, documentando pasos ineficaces y lecciones aprendidas. Un agente de pipeline separado revisa estas retrospectivas periódicamente para actualizar las Habilidades correspondientes. Esto crea una cadena de evolución donde cada error del agente se convierte en una señal.

El impacto es medible. Anteriormente, cada incidencia requería al menos 30 minutos desde el envío de retroalimentación hasta el análisis manual de registros y la identificación de la causa raíz. El sistema automatizado ahora completa el análisis de causa raíz en dos minutos, funcionando 24/7 sin intervención humana más allá de la revisión de código.

Lo que está haciendo la competencia

El espacio de la codificación con IA se ha convertido en una guerra de mejoras incrementales. Cursor, GitHub Copilot y el asistente de IA de JetBrains lanzan actualizaciones semanales. Cursor Composer-1, el objetivo de comparación directa que Alibaba eligió, no es un producto estático tampoco. Pero Qwen-Coder-Qoder está construido para una integración estrecha con una arquitectura de agente específica, no para uso general. Eso puede limitar su alcance pero también significa que el bucle de retroalimentación es más corto: cada interacción del usuario con Qoder puede refinar el modelo en semanas en lugar de meses.

Alibaba dice que planea iteraciones semanales en el modelo, lo que sugiere un ritmo que la mayoría de los distribuidores de modelos de peso abierto tendrían dificultades para igualar. El modelo de volante de inercia exige un uso continuo del producto para alimentar los datos de entrenamiento, por lo que la apuesta es tanto por la adopción de usuarios de Qoder como por el modelo en sí.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.