MUSIQUE IA
L'astuce de la mélodie en premier qui permet à Qwen-Music de battre Suno sur 13 indicateurs
Qwen-Music sépare la planification de la mélodie de la génération complète de chansons via Melody-CoT. Le modèle de 3 milliards de paramètres, entraîné sur plus de 5 millions d'heures de données multilingues, obtient des résultats de pointe contre Suno V5 et MiniMax Music 2.6, tant sur les indicateurs objectifs que sur la préférence humaine.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-07-31 · 3 min de lecture

La plupart des modèles texte-vers-musique tentent de composer la mélodie et l'arrangement simultanément. Le résultat sonne souvent confus, la ligne vocale lutte contre les instruments, la structure vagabonde, et rien n'aboutit vraiment. Qwen-Music, le nouveau modèle de l'équipe Qwen d'Alibaba, emprunte une voie différente : il planifie d'abord la mélodie, puis ajoute l'orchestre autour.
Génération mélodie d'abord
L'idée centrale s'appelle Melody-CoT, abréviation de chaîne de pensée. Avant de générer la séquence complète de jetons musicaux, le modèle produit un ensemble intermédiaire de jetons de mélodie qui décrivent un contour vocal grossier, d'environ 6,25 Hz, suffisant pour préserver la forme de la mélodie tout en éliminant le vibrato, les ornements et autres détails d'exécution. Ce plan grossier sert d'échafaudage structurel. Une fois la mélodie établie, le modèle génère le flux complet de jetons sémantiques à 25 Hz qui inclut les instruments et l'arrangement. Le résultat, selon le rapport technique, est une meilleure créativité, musicalité et cohérence structurelle.
Architecture en trois parties
Qwen-Music est construit à partir de trois composants. Qwen-Music-Tokenizer compresse l'audio en un flux à un seul codebook de jetons sémantiques musicaux à 25 Hz, préservant suffisamment d'informations pour que le modèle de langage puisse travailler. Qwen-Music-LLM, un modèle de 3 milliards de paramètres initialisé à partir de Qwen3.5-Omni, génère ces jetons de manière autorégressive avec le mécanisme Melody-CoT intégré dans la boucle de prédiction. Enfin, Qwen-Music-Render convertit la séquence discrète de jetons en formes d'onde stéréo à 48 kHz via un processus de diffusion qui enrichit les détails acoustiques. Séparer la composition du rendu signifie que le modèle de langage n'a jamais à se soucier de la fidélité audio ; il n'a qu'à obtenir la structure musicale correcte.
Programme d'entraînement conscient de la qualité
Les données d'entraînement sont exceptionnellement vastes : plus de 5 millions d'heures de musique multilingue couvrant des centaines de langues. L'équipe ne se contente pas de tout introduire en une fois. Ils entraînent un modèle de récompense distinct basé sur MOS pour estimer la qualité audio, puis classent chaque échantillon dans son genre en sept catégories de qualité. Q1 est le meilleur, Q7 est écarté. L'entraînement progresse à travers un programme en trois étapes : d'abord sur les données Q3-Q6 pour une large couverture, puis les données Q2 pour la consolidation de la qualité, et enfin les données Q1 pour le raffinement de haute qualité. Le pipeline post-entraînement suit une progression similaire, commençant par un réglage fin supervisé sur des données organisées, puis des cycles DPO itératifs, et enfin GSPO en ligne pour affiner l'alignement avec les préférences musicales humaines.
Résultats et références
Testé sur 600 invites réparties entre le chinois et l'anglais, Qwen-Music obtient des résultats de pointe sur 13 des 16 indicateurs objectifs de musicalité et de qualité audio. Lors de tests de préférence A/B en aveugle avec des évaluateurs humains professionnels, il bat Suno V5 et MiniMax Music 2.6. Le modèle gère également la génération de reprises, préservant une mélodie de référence plus précisément que les systèmes propriétaires leaders tout en permettant de changer le timbre, l'arrangement et le genre. L'équipe extrait les jetons de mélodie de l'audio source et les insère dans le préfixe d'invite à côté des étiquettes de style et des paroles cibles, et le modèle régénère le reste autour d'eux.
La réaction de la communauté sur Hugging Face, où l'article a été publié, a été enthousiaste, les utilisateurs demandent quand les poids ouverts seront publiés. Le rapport ne s'engage pas sur un calendrier, mais l'historique open source de la famille Qwen suggère qu'une publication est probable.
Pourquoi c'est important
L'approche Melody-CoT répond à une limitation fondamentale des modèles de génération musicale de bout en bout qui tentent d'apprendre la composition et l'arrangement comme un seul problème indifférencié. En décomposant la tâche en une planification explicite de la mélodie suivie de l'arrangement, Qwen-Music produit des chansons avec une structure plus claire et une logique musicale plus humaine. Cela rend également le transfert de mélodie pour les reprises simple, puisque le contour grossier de la mélodie peut être extrait de n'importe quel audio et rendu dans un nouveau style.
- Source : The melody-first trick that lets Qwen-Music beat Suno on 13 metrics — 2026-07-20
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.