Generación de música con IA
Music 3.0 cambia el prompt de una sola etiqueta por una línea de tiempo que mantiene las canciones de IA en el camino
Las pistas de IA tienden a desviarse del prompt mientras se desarrollan: los instrumentos desaparecen, la emoción se aplana, el estilo vocal va y viene. Music 3.0 cambia la descripción de una sola etiqueta por un Subtítulo Estructurado secuencial en el tiempo, respaldado por un Hybrid-LM de 8B/0.6B que separa la estructura del detalle.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-21 · 4 min de lectura

Una canción generada por IA puede sonar terminada y aun así traicionar el encargo. Un instrumento especificado se desvanece para el segundo verso, el ánimo predefinido decae cerca del puente, el estilo vocal nunca regresa. La pista suena como una canción completa, solo que no la que alguien pidió.
Ese modo de fallo es el objetivo de Music 3.0, el nuevo modelo de la línea de generación musical de Qwen. En lugar de una única etiqueta global que cubra toda la pista, utiliza un Subtítulo Estructurado: una descripción secuencial en el tiempo que indica, momento a momento, qué sucede y cuándo.
Una etiqueta, luego la deriva
La mayoría de los sistemas de texto a música comprimen una solicitud en una única descripción global de la pista, y esto se sostiene hasta que la música se despliega: los instrumentos desaparecen del arreglo, el tono emocional se aplana y la entrega vocal sobrevive solo donde el prompt alcanzó a describirla. Music 3.0 reemplaza esa única etiqueta con un subtítulo estructurado y secuencial en el tiempo. Todavía cubre género, BPM, compás, tonalidad, uso previsto y textura de producción. También rastrea cómo sube y baja la emoción, cuándo entran o salen los instrumentos principales y de acompañamiento, cómo se desarrollan el groove y el bajo, y cómo cambian el estilo de canto, la armonía y los efectos vocales de sección en sección. Las etiquetas de sección en las letras, como [intro], [verso], [pre-coro], [coro], [puente] y [outro], proporcionan la macroestructura; el subtítulo detalla qué cambia dentro de cada una.
La misma queja moldeó al modelo anterior de la línea. Nuestra cobertura de Qwen-Music señaló que los sistemas de extremo a extremo que componen melodía y arreglo como una sola tarea terminan saturados y errantes. Qwen-Music planificaba la melodía primero. Music 3.0 extiende esa lógica a toda la capa de descripción.
Dentro del Hybrid-LM: estructura a 8B, detalle a 0.6B
En el lado del modelo, Music 3.0 divide el trabajo entre dos redes. Un LLM Global de 8B predice, cuadro por cuadro, los tokens que portan el contenido semántico y estructural central, manteniendo el contexto de toda la pista en mente. Un LLM Local de 0.6B trabaja dentro de cada cuadro, prediciendo tokens acústicos a lo largo del eje de profundidad para añadir detalle sonoro local.
| Modelo | Alcance | Qué predice |
|---|---|---|
| LLM Global de 8B | A lo largo de toda la pista | Tokens que portan semántica y estructura centrales, cuadro por cuadro |
| LLM Local de 0.6B | Dentro de cada cuadro | Tokens acústicos a lo largo del eje de profundidad, añadiendo detalle local |
Esa división mantiene estable el tiempo para canciones de hasta cinco minutos mientras preserva la variación dentro de las secciones. Extiende el diseño documentado en el informe técnico de Qwen-Music, donde un tokenizador comprimía el audio en un flujo de 25 Hz de tokens semánticos y una cadena de pensamiento de melodía esbozaba un contorno vocal grueso antes de la generación completa. Mismo principio: separar el plan de la textura.
Las demos se leen como una prueba de concepto
El explicador incluye más de una docena de canciones de demostración, cada una con el nuevo formato de subtítulo. Una cálida balada pop en mandarín se describe como 74 BPM en la bemol mayor, nostalgia tierna que se abre a un coro celebratorio, un barítono-tenor masculino maduro, guzheng delicado, cuerdas suaves y un sonido natural de sala en vivo. El arco, los instrumentos, las cualidades vocales: declarados de antemano, no dejados a la inferencia.
El patrón se mantiene en todos los géneros. "Cloud copy of me", una pieza de EDM melódico sobre subir la memoria a una corriente de datos, está subtitulada como versos reflexivos que construyen hacia un coro edificante impulsado por el gancho, con texturas glitch y una mezcla pulida de festival. La balada Mandopop en dúo de padres va más lejos, especificando cantantes de alrededor de 50 a 70 años, un fuerte acento taiwanés, una madre que lidera, un padre que armoniza, y un arreglo que se construye desde piano y cuerdas hasta batería y guitarra eléctrica antes de desvanecerse en un cierre acústico. Nada de esto prueba que el modelo siga tales subtítulos fielmente; muestra qué está diseñado para capturar el formato.
Qué cambia el control a nivel de sección para los productores
Para las personas que usan prompts en modelos de música, esto desplaza el punto de control. Corregir una deriva generalmente significa regenerar toda la canción o reescribir el prompt global y esperar. Un subtítulo que nombra qué cambia y dónde, anclado por etiquetas de sección, convierte "qué sucede en el puente" en una condición a la que se puede exigir al modelo. El explicador es directo sobre el objetivo: hacer que el lugar donde cambian las cosas sea una condición explícita de generación.
Los competidores giran alrededor del mismo problema. MiniMax enmarcó el lanzamiento de Music 2.6 en torno a cuatro historias de creadores en lugar de una lista de avances del modelo. Stability AI ha asegurado licencias con UMG y WMG y ahora tiene que cumplirlas. Music 3.0 apunta directamente al problema de producción: generar la canción que fue descrita, durante cinco minutos completos.
Lo que el explicador no dice
No hay datos de evaluación que muestren con qué fidelidad Music 3.0 sigue un subtítulo temporal denso; las demos ilustran la intención, no la adherencia. El informe de Qwen-Music afirmó resultados de vanguardia contra Suno V5 y MiniMax Music 2.6 en métricas objetivas y preferencia humana, pero seguir un subtítulo es algo distinto de puntuar. Si el modelo honra de manera confiable secuencias largas de instrucciones temporales, y cómo interactúa la intención del subtítulo con el sentimiento de la letra, sigue abierto.
Los pesos abiertos también. El informe de Qwen-Music no se comprometió con un cronograma de lanzamiento, aunque nuestra cobertura señaló que la historia de código abierto de la familia Qwen hace probable un lanzamiento. El material de Music 3.0 no dice nada en ningún sentido. Dónde aterriza, y con qué firmeza mantiene un encargo de cinco minutos, nadie lo ha demostrado todavía.
- Fuente : Music 3.0 swaps the one-tag prompt for a timeline that keeps AI songs on track — 2026-08-13
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.