SevenTnewS

Investigación en IA

Qwen-music pone la melodía en el centro del escenario, y los resultados hablan por sí solos

Qwen-Music marca un nuevo hito al planificar explícitamente las melodías antes de generar canciones completas, una técnica que el equipo denomina Melody-CoT. El modelo logra resultados de vanguardia en 13 de 16 métricas objetivas y, en pruebas ciegas, vence a Suno V5 y MiniMax Music 2.6.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-20 · Última actualización: 2026-08-03 · 4 min de lectura

Qwen-music pone la melodía en el centro del escenario, y los resultados hablan por sí solos
Fuentes : Qwen-Music Tech…

El equipo Qwen de Alibaba publicó el informe técnico de Qwen-Music, y vale la pena leerlo por cómo maneja la melodía por sí sola. La idea central: no pedirle al modelo de lenguaje que descubra composición y arreglo al mismo tiempo. En su lugar, que planifique primero la melodía vocal y luego complete todo lo demás a su alrededor.

El equipo llama a esto Melody-CoT, abreviatura de cadena de pensamiento. Antes de generar la secuencia completa de tokens musicales, el modelo produce un conjunto intermedio de tokens de melodía que describen un contorno vocal aproximado. No se trata de un trazado de tono detallado; es una representación de baja velocidad de fotogramas a 6,25 Hz que preserva la forma de la melodía mientras descarta vibrato, adornos y otros detalles a nivel de interpretación. Luego, el modelo genera el resto de la canción condicionada a ese plan.

Melody-CoT cumple una doble función como interfaz para la generación de versiones de canciones. Para las versiones, los tokens de melodía de referencia se extraen de un archivo de audio fuente y se insertan en el prefijo del prompt junto con etiquetas de estilo objetivo y la letra. Luego, el modelo genera nuevos tokens que siguen el contorno de referencia mientras permite que cambien el timbre, el arreglo y el género.

Gráfico: Tasas de victoria de Qwen-Music frente a competidores en pruebas A/B ciegas
Tasas de victoria reportadas en el artículo para Qwen-Music frente a sistemas competidores en pruebas A/B ciegas de preferencia con evaluadores humanos profesionales.

Separar la composición de la representación atraviesa toda la arquitectura. El sistema utiliza tres componentes principales: un tokenizador que comprime el audio en tokens semánticos de 25 Hz, un modelo de lenguaje de 3 mil millones de parámetros (inicializado desde Qwen3.5-Omni) que genera esos tokens, y un renderizador que convierte la secuencia discreta de tokens nuevamente en formas de onda estéreo de 48 kHz mediante difusión y refinamiento espectral. Este diseño significa que el modelo de lenguaje nunca tiene que preocuparse por la coherencia de fase o los detalles de alta frecuencia. Trabaja en un espacio semántico comprimido, y el renderizador se encarga de la fidelidad acústica.

Los datos de entrenamiento ayudan a explicar los resultados. Qwen-Music-LLM se entrena con más de 5 millones de horas de datos musicales multilingües que abarcan cientos de idiomas. Es mucha música, y el equipo no la introduce toda de una vez. Entrenan un modelo de recompensa basado en MOS por separado para estimar la calidad del audio, luego clasifican cada muestra dentro de su género en siete categorías. Q1 es la mejor, Q7 se descarta. Luego, el entrenamiento progresa a través de un plan de estudios de tres etapas: primero con datos Q3 y Q6 para una cobertura amplia, luego con datos Q2 para la consolidación de calidad, y finalmente con datos Q1 para el refinamiento de alta calidad.

El proceso posterior al entrenamiento sigue una escalera similar. El ajuste fino supervisado con datos seleccionados de alta calidad establece una base de generación limpia. Luego, los ciclos iterativos de DPO refinan la alineación con las preferencias musicales humanas y el seguimiento de instrucciones. Finalmente, la optimización GSPO sobre la política actual impulsa aún más la musicalidad. El equipo informa que esta segmentación es deliberada: cada fase se basa en una base estable de la anterior, en lugar de intentar corregir problemas de alineación después de la exploración.

¿Qué tan bien funciona? Los resultados de la evaluación son competitivos. Con 600 prompts en chino e inglés, Qwen-Music logra el mejor resultado en 13 de 16 métricas objetivas en tres puntos de referencia: SongBench, SongEval y AudioBox-Aesthetic. En pruebas A/B ciegas de preferencia con evaluadores humanos profesionales, Qwen-Music vence a MiniMax Music 2.5+ (59,1 %), MiniMax Music 2.6 (66,7 %), Mureka V8 (58,3 %) y Suno V5 (55,4 %). Contra Suno V5.5, la tasa de victoria es del 50,3 %, esencialmente un empate. El sistema también apareció en el ranking Artificial Analysis Music with Vocals Leaderboard bajo el nombre JazzCat, ocupando el tercer lugar entre los sistemas de generación de música vocal en inglés.

La generación de versiones de canciones se prueba contra Suno V5.5, Suno V5 y MiniMax Cover. En el conjunto de referencia generado por IA, Qwen-Music preserva las melodías de referencia con mayor precisión que los tres. En referencias de canciones populares del mundo real, supera a MiniMax Cover en la mayoría de las métricas. Eso cubre los casos donde hay audio de referencia disponible.

Un detalle que vale la pena señalar sobre el tokenizador de melodías. El equipo también experimentó con representaciones basadas en cromagramas para el condicionamiento de melodías, similar a lo que usan otros sistemas. Descubrieron que los cromagramas a menudo retienen demasiada información sobre el arreglo de fondo, lo que hace que la señal de condicionamiento sea demasiado fuerte y reduce la capacidad del modelo para seguir las etiquetas de estilo global. Así que optaron por un enfoque más limpio basado en el contorno de tono que elimina todo excepto la forma de la melodía. Ese tipo de elección de diseño es la diferencia entre un modelo que copia obedientemente una referencia y uno que realmente la reinterpreta.

Qwen-Music aún no está disponible para uso público, y el informe no menciona un cronograma de lanzamiento. Por ahora, representa un hito técnico con una narrativa arquitectónica clara: mantener la composición y la representación separadas, planificar las melodías explícitamente y entrenar con datos clasificados por calidad en lugar de curación uniforme.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.