بحث في الذكاء الاصطناعي
Qwen-music يضع اللحن في المقدمة، والنتائج تتحدث عن نفسها
يحقق Qwen-Music تقدماً جديداً من خلال التخطيط الصريح للألحان قبل توليد الأغاني الكاملة، وهي تقنية يسميها الفريق Melody-CoT. يحقق النموذج نتائج متطورة في 13 من أصل 16 مقياساً موضوعياً، وفي الاختبارات العمياء، يفوز ضد Suno V5 وMiniMax Music 2.6.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-20 · آخر تحديث: 2026-08-03 · قراءة 4 دقائق

أصدر فريق Qwen التابع لشركة علي بابا التقرير الفني لـ Qwen-Music، ومن الجدير قراءته لكيفية تعامله مع اللحن وحده. الفكرة الأساسية: لا تطلب من نموذج اللغة أن يكتشف التأليف والترتيب في نفس الوقت. بدلاً من ذلك، اجعله يخطط لللحن الصوتي أولاً، ثم يملأ كل شيء آخر حوله.
يطلق الفريق على هذا اسم Melody-CoT، اختصاراً لسلسلة الأفكار. قبل توليد تسلسل الرموز الموسيقية الكامل، ينتج النموذج مجموعة وسيطة من رموز اللحن تصف محيطاً صوتياً إجمالياً. هذا ليس تتبعاً دقيقاً للنغمات؛ إنه تمثيل منخفض التردد عند 6.25 هرتز يحافظ على شكل اللحن مع التخلص من الاهتزاز الصوتي والزخارف وغيرها من التفاصيل على مستوى الأداء. ثم يولد النموذج بقية الأغنية مشروطة بذلك المخطط.
يؤدي Melody-CoT وظيفة مزدوجة كواجهة لتوليد الأغاني المغطاة. بالنسبة للتغطيات، يتم استخراج رموز اللحن المرجعية من ملف صوتي مصدر وإدراجها في بادئة الدعوة جنباً إلى جنب مع علامات النمط المستهدف وكلمات الأغاني. ثم يولد النموذج رموزاً جديدة تتبع المحيط المرجعي مع السماح بتغيير الطابع الصوتي والترتيب والنوع الموسيقي.

يمتد فصل التأليف عن المعالجة عبر البنية بأكملها. يستخدم النظام ثلاثة مكونات رئيسية: محلل رموز يضغط الصوت إلى رموز دلالية بتردد 25 هرتز، ونموذج لغة بثلاثة مليارات معلمة (مبتدأ من Qwen3.5-Omni) يولد تلك الرموز، ومعالج يحول تسلسل الرموز المنفصلة إلى أشكال موجية استريو بتردد 48 كيلو هرتز من خلال الانتشار والتحسين الطيفي. يعني هذا التصميم أن نموذج اللغة لا يضطر أبداً إلى القلق بشأن تماسك الطور أو التفاصيل عالية التردد. إنه يعمل في فضاء دلالي مضغوط، ويتولى المعالج الدقة الصوتية.
تساعد بيانات التدريب في تفسير النتائج. يتدرب Qwen-Music-LLM على أكثر من 5 ملايين ساعة من البيانات الموسيقية متعددة اللغات تغطي مئات اللغات. هذه كمية كبيرة من الموسيقى، والفريق لا يضعها كلها دفعة واحدة. يقومون بتدريب نموذج مكافأة منفصل قائم على MOS لتقدير جودة الصوت، ثم يصنفون كل عينة ضمن نوعها الموسيقي إلى سبع فئات. Q1 هي الأفضل، وQ7 يتم التخلص منها. ثم يتقدم التدريب عبر منهج من ثلاث مراحل: أولاً على بيانات Q3 وQ6 لتغطية واسعة، ثم بيانات Q2 لتوحيد الجودة، وأخيراً بيانات Q1 للتحسين عالي الجودة.
يتبع خط أنابيب ما بعد التدريب خطوة مماثلة. يحدد الضبط الدقيق الخاضع للإشراف على بيانات عالية الجودة ومختارة أولية نظيفة للتوليد. ثم تعمل دورات DPO التكرارية على تحسين التوافق مع التفضيلات الموسيقية البشرية واتباع التعليمات. أخيراً، يدفع تحسين GSPO على السياسة الحالية الموسيقية إلى أبعد من ذلك. يذكر الفريق أن هذه المراحل متعمدة: كل مرحلة تبني على أساس ثابت من المرحلة السابقة، بدلاً من محاولة إصلاح مشكلات التوافق بعد الاستكشاف.
ما مدى جودة عمله؟ نتائج التقييم تنافسية. على 600 دعوة بالصينية والإنجليزية، يحقق Qwen-Music أفضل نتيجة في 13 من أصل 16 مقياساً موضوعياً عبر ثلاثة معايير: SongBench وSongEval وAudioBox-Aesthetic. في اختبارات التفضيل العمياء A/B مع مقيمين بشريين محترفين، يفوز Qwen-Music ضد MiniMax Music 2.5+ (59.1%) وMiniMax Music 2.6 (66.7%) وMureka V8 (58.3%) وSuno V5 (55.4%). ضد Suno V5.5، يبلغ معدل الفوز 50.3%، وهو تعادل أساسي. كما ظهر النظام على لوحة متصدرة تحليل الموسيقى الاصطناعية مع الأغاني الصوتية تحت اسم JazzCat، محتلاً المرتبة الثالثة بين أنظمة توليد الموسيقى الصوتية الإنجليزية.
يتم اختبار توليد الأغاني المغطاة ضد Suno V5.5 وSuno V5 وMiniMax Cover. على مجموعة مرجعية مولدة بالذكاء الاصطناعي، يحافظ Qwen-Music على الألحان المرجعية بدقة أكبر من الثلاثة جميعها. على مراجع الأغاني الشعبية الواقعية، يتفوق على MiniMax Cover في معظم المقاييس. هذا يغطي الحالات التي يتوفر فيها صوت مرجعي.
تفصيل واحد يستحق الذكر حول محلل رموز اللحن. جرب الفريق أيضاً تمثيلات قائمة على الكروما لتكييف اللحن، مشابهة لما تستخدمه أنظمة أخرى. وجدوا أن الكروما غالباً ما تحتفظ بمعلومات كثيرة جداً حول الترتيب الخلفي، مما يجعل إشارة التكييف قوية جداً ويقلل من قدرة النموذج على اتباع علامات النمط العالمي. لذا استقروا على نهج أنظف قائم على محيط النغمة يجرد كل شيء باستثناء شكل اللحن. هذا النوع من خيارات التصميم هو الفرق بين نموذج ينسخ مرجعاً بطاعة وآخر يعيد تفسيره بالفعل.
Qwen-Music ليس متاحاً بعد للاستخدام العام، ولا يذكر التقرير جدولاً زمنياً للإصدار. في الوقت الحالي، يمثل علامة فارقة تقنية بسرد معماري واضح: حافظ على فصل التأليف عن المعالجة، وخطط للألحان بشكل صريح، وتدرب ببيانات مصنفة الجودة بدلاً من التنظيم الموحد.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.