Programación con IA
La IA generó el 90% del código. Los ciclos de entrega apenas se movieron
El equipo de AMAP de Alibaba elevó su tasa de generación de código con IA hasta el 90% y no ganó nada en los tiempos de entrega. El diagnóstico: la métrica mide actividad, no rendimiento, y el vibe coding debe dar paso a un desarrollo gobernado.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-21 · 4 min de lectura
Un número cuenta la mayor parte de esta historia, y no es el del que el equipo está más orgulloso. En la Conferencia Yunqi del pasado septiembre, Wang Shuxin de la Plataforma de Aplicaciones de Grandes Modelos AMAP de Alibaba reportó una tasa de generación de código con IA del 53% en las fases de diseño técnico y desarrollo. Medio año después, el mismo equipo alcanza del 80 al 90% e incluso más. El número casi se duplicó. Los ciclos de entrega no se acortaron de manera notable. Las cargas de trabajo de los desarrolladores no disminuyeron. "Descubrimos un hecho desconcertante: las ganancias de eficiencia no eran evidentes", dijo Wang en una charla publicada en el blog de la comunidad de Alibaba Cloud.
La brecha entre esos dos hechos es donde reside la lección. La IA escribió más código y el software se lanzó al mismo ritmo. El diagnóstico al que llegó el equipo de Wang funciona también como un argumento contra la métrica que la mayor parte de la industria de la programación con IA reporta como progreso.
Por qué una métrica duplicada no aportó nada
La primera razón es aritmética que la industria del software conoce desde El mito del hombre-mes. El desarrollo es una etapa en una larga cadena: propuesta de producto, revisión de producto e ingeniería, diseño de la solución, desarrollo, revisión de código, pruebas, integración, lanzamiento. Cada etapa conlleva costos de comunicación, tiempo de espera y la posibilidad de error. Si se optimiza la codificación en un 50%, y la codificación es el 30% de la cadena, la ganancia total es del 15%.
La segunda razón es el costo oculto. El código generado por IA conlleva más tiempo de revisión de código, más depuración, más retrabajo. El caso concreto del equipo: la IA cambió el orden de los parámetros de una interfaz central, todas las pruebas unitarias pasaron y, tras el lanzamiento, rompió tres servicios posteriores. Rastrearlo llevó un día entero.
La tercera es el contexto. Las tareas grandes no caben de una vez en la cabeza de un modelo. Un trabajo de refactorización que toca una docena de módulos de front-end y back-end no sobrevive a una sola conversación; la atención de la IA se dispersa y las restricciones establecidas al principio desaparecen. La conclusión de Wang es contundente: en aplicaciones heredadas, la programación con IA tiene que pasar de las 'vibraciones' a las 'convenciones', con criterios de aceptación claros.
La solución: la especificación como fuente de verdad
Wang define el vibe coding como "programar por vibraciones": lanzar casualmente unos pocos prompts a la IA y dejar que genere miles de líneas de código en segundos. Está bien para proyectos nuevos y scripts pequeños, argumenta. Las aplicaciones heredadas son donde se rompe: cargan con lastre histórico, dependencias implícitas y conocimiento de negocio incrustado en el código, y una solución de IA de apariencia plausible puede ser incompatible con todo ello.
La respuesta de AMAP, construida sobre su herramienta Qoder, es el Desarrollo Guiado por Especificaciones (Specification-Driven Development). La especificación deja de ser una guía en prosa que queda desactualizada. Se convierte en "código de intención" estructurado que los agentes ejecutan con precisión, y en la única fuente de verdad que el código debe cumplir. El modo Quest Spec de Qoder guía a los desarrolladores a través de los detalles, y los criterios de aceptación son donde esto se vuelve comprobable. "El usuario es redirigido a la página de inicio tras iniciar sesión correctamente" es vago, dice Wang. "Tras iniciar sesión correctamente, el usuario es redirigido a la página de inicio en 3 segundos, y la página de inicio muestra el apodo del usuario" es algo que una prueba puede verificar de verdad. El flujo de trabajo consta de cuatro etapas:
| Etapa | Qué produce |
|---|---|
| Especificar | Una especificación estructurada: historias de usuario, criterios de aceptación, restricciones del sistema |
| Planificar | Un plan técnico y un desglose de tareas, compilados a partir de la especificación |
| Implementar | Los agentes ejecutan las tareas una por una y generan código |
| Validar | Las pruebas generadas a partir de la especificación confirman que el código coincide con ella |
Además del SDD, AMAP aplica lo que denomina Harness Engineering (ingeniería de arneses). La imagen es la de un caballo salvaje: el modelo tiene un poder enorme y, sin un arnés, no puedes montarlo. El arnés tiene cuatro pilares: ingeniería de contexto que mantiene una única fuente de verdad; restricciones arquitectónicas que bloquean las violaciones antes de la entrega, de modo que al código de la capa de UI se le prohíbe tocar directamente la capa de base de datos; bucles de retroalimentación donde se ejecutan las pruebas, el agente lee los registros de errores y se autocorrige, y las correcciones humanas de errores se convierten en reglas; y supervisión humana para lo que Wang llama el 5% de lógica ambigua que la IA no puede juzgar. El despliegue cierra el ciclo a través de las herramientas MCP proporcionadas por Aone, la plataforma interna de CI/CD de Alibaba.
El problema de la métrica que nadie está solucionando
Nada de esto significa que la programación con IA haya fracasado. Significa que la tasa de generación de código nunca fue el panel correcto. Un equipo que casi duplicó su tasa y no ganó nada es la prueba de que el número mide actividad, no rendimiento. Lo que AMAP rastrea ahora es toda la cadena, del requisito al lanzamiento, con la IA como infraestructura en lugar de un autocompletado glorificado.
Las preguntas abiertas de Wang son honestas sobre la distancia que queda: la generación de especificaciones todavía necesita intervención humana y debería ser más conversacional; los equipos de agentes necesitan una colaboración más rica, incluida la iteración en múltiples rondas y la asignación dinámica de roles; la gestión del conocimiento necesita una extracción y reutilización más inteligentes. Hasta que eso mejore, la brecha entre lo que prometen las tasas de generación y lo que entregan los ciclos de entrega seguirá apareciendo en los datos de la PMO.
Nadie lanza una tasa de generación de código.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.