MÚSICA CON IA
El truco de priorizar la melodía que permite a Qwen-Music vencer a Suno en 13 métricas
Qwen-Music separa la planificación de la melodía de la generación completa de canciones mediante Melody-CoT. El modelo de 3 mil millones de parámetros, entrenado con más de 5 millones de horas de datos multilingües, logra resultados de última generación frente a Suno V5 y MiniMax Music 2.6 tanto en métricas objetivas como en preferencia humana.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-31 · 3 min de lectura

La mayoría de los modelos de texto a música intentan componer la melodía y el arreglo al mismo tiempo. El resultado a menudo suena abarrotado, la línea vocal lucha con los instrumentos, la estructura divaga y nada termina de funcionar. Qwen-Music, el nuevo modelo del equipo Qwen de Alibaba, toma un camino diferente: planifica la melodía primero y luego completa la banda a su alrededor.
Generación priorizando la melodía
La idea central se llama Melody-CoT, abreviatura de cadena de pensamiento. Antes de generar la secuencia completa de tokens musicales, el modelo produce un conjunto intermedio de tokens de melodía que describen un contorno vocal grueso, aproximadamente 6.25 Hz, suficiente para preservar la forma de la melodía mientras descarta vibratos, ornamentos y otros detalles de interpretación. Este plan grueso actúa como un andamio estructural. Una vez establecida la melodía, el modelo genera el flujo completo de tokens semánticos de 25 Hz que incluye instrumentos y arreglo. Según el informe técnico, el resultado es una mejor creatividad, musicalidad y coherencia estructural.
Arquitectura de tres partes
Qwen-Music está compuesto por tres componentes. Qwen-Music-Tokenizer comprime el audio en un flujo de un solo libro de códigos de tokens semánticos musicales a 25 Hz, preservando suficiente información para que el modelo de lenguaje pueda trabajar. Qwen-Music-LLM, un modelo de 3 mil millones de parámetros inicializado desde Qwen3.5-Omni, genera esos tokens de forma autorregresiva con el mecanismo Melody-CoT integrado en el bucle de predicción. Finalmente, Qwen-Music-Render convierte la secuencia discreta de tokens nuevamente en formas de onda estéreo de 48 kHz mediante un proceso de difusión que enriquece el detalle acústico. Separar la composición de la renderización significa que el modelo de lenguaje nunca tiene que preocuparse por la fidelidad del audio; solo debe acertar con la estructura musical.
Plan de entrenamiento con conciencia de calidad
Los datos de entrenamiento son inusualmente grandes: más de 5 millones de horas de música multilingüe que cubren cientos de idiomas. El equipo no introduce todo de una vez. Entrenan un modelo de recompensa basado en MOS para estimar la calidad del audio, luego clasifican cada muestra dentro de su género en siete niveles de calidad. Q1 es el mejor, Q7 se descarta. El entrenamiento avanza a través de un plan de tres etapas: primero con datos de Q3 a Q6 para una cobertura amplia, luego datos Q2 para consolidación de calidad, y finalmente datos Q1 para refinamiento de alta calidad. El flujo posterior al entrenamiento sigue una escalera similar, comenzando con ajuste fino supervisado en datos curados, luego ciclos iterativos de DPO, y finalmente GSPO en línea para refinar la alineación con las preferencias musicales humanas.
Resultados y evaluaciones comparativas
Probado en 600 indicaciones divididas entre chino e inglés, Qwen-Music logra resultados de última generación en 13 de 16 métricas objetivas de musicalidad y calidad de audio. En pruebas ciegas de preferencia A/B con evaluadores humanos profesionales, vence a Suno V5 y MiniMax Music 2.6. El modelo también maneja la generación de versiones de canciones, preservando una melodía de referencia con mayor precisión que los sistemas propietarios líderes, permitiendo cambios en timbre, arreglo y género. El equipo extrae tokens de melodía del audio fuente y los inserta en el prefijo de la indicación junto con etiquetas de estilo objetivo y letras, y el modelo regenera el resto a su alrededor.
La reacción de la comunidad en Hugging Face, donde se publicó el artículo, ha sido entusiasta: los usuarios preguntan cuándo se lanzarán los pesos abiertos. El informe no se compromete con un cronograma, pero la historia de código abierto de la familia Qwen sugiere que es probable un lanzamiento.
Por qué es importante
El enfoque Melody-CoT aborda una limitación fundamental de los modelos de generación musical de extremo a extremo que intentan aprender composición y arreglo como un solo problema indiferenciado. Al descomponer la tarea en una planificación explícita de la melodía seguida del arreglo, Qwen-Music produce canciones con una estructura más clara y una lógica musical más humana. También facilita la transferencia de melodías para versiones de canciones, ya que el contorno grueso de la melodía puede extraerse de cualquier audio y volverse a renderizar en un nuevo estilo.
- Fuente : The melody-first trick that lets Qwen-Music beat Suno on 13 metrics — 2026-07-20
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.