موسيقى الذكاء الاصطناعي

خدعة الأولوية للحن التي تمكن Qwen-Music من التفوق على Suno في 13 مقياسًا

يفصل Qwen-Music تخطيط اللحن عن توليد الأغنية الكاملة عبر Melody-CoT. النموذج الذي يبلغ 3 مليارات معلمة، والمُدرَّب على أكثر من 5 ملايين ساعة من البيانات متعددة اللغات، يحقق نتائج متطورة ضد Suno V5 وMiniMax Music 2.6 في كل من المقاييس الموضوعية والتفضيل البشري.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-31 · قراءة 3 دقائق

خدعة الأولوية للحن التي تمكن Qwen-Music من التفوق على Suno في 13 مقياسًا

تحاول معظم نماذج تحويل النص إلى موسيقى تأليف اللحن والتوزيع في نفس الوقت. غالبًا ما تبدو النتيجة مزدحمة، ويتعارض الخط الصوتي مع الآلات، وتتشتت البنية، ولا ينجح شيء تمامًا. نموذج Qwen-Music الجديد من فريق Qwen في Alibaba يسلك طريقًا مختلفًا: فهو يخطط اللحن أولاً، ثم يملأ الفرقة حوله.

توليد يعتمد على اللحن أولاً

الفكرة الأساسية تسمى Melody-CoT، اختصارًا لسلسلة الأفكار. قبل توليد تسلسل الرموز الموسيقية الكاملة، ينتج النموذج مجموعة وسيطة من رموز اللحن تصف محيطًا صوتيًا خشنًا، بتردد حوالي 6.25 هرتز، كافية للحفاظ على شكل اللحن مع تجاهل الاهتزاز والزخارف وتفاصيل الأداء الأخرى. تعمل هذه الخطة الخشنة كسقالة هيكلية. بمجرد تحديد اللحن، يولد النموذج تيار الرموز الدلالي الكامل بتردد 25 هرتز الذي يشمل الآلات والتوزيع. وفقًا للتقرير الفني، تكون النتيجة إبداعًا وموسيقية وتماسكًا هيكليًا أفضل.

هندسة ثلاثية الأجزاء

تم بناء Qwen-Music من ثلاثة مكونات. Qwen-Music-Tokenizer يضغط الصوت إلى تيار أحادي القاموس من الرموز الموسيقية الدلالية بتردد 25 هرتز، محافظًا على معلومات كافية ليعمل معها نموذج اللغة. Qwen-Music-LLM، نموذج يبلغ 3 مليارات معلمة والمُهيأ من Qwen3.5-Omni، يولد تلك الرموز بشكل تلقائي باستخدام آلية Melody-CoT المدمجة في حلقة التنبؤ. أخيرًا، Qwen-Music-Render يحول تسلسل الرموز المنفصلة مرة أخرى إلى أشكال موجية استريو بتردد 48 كيلوهرتز عبر عملية انتشار تثري التفاصيل الصوتية. فصل التأليف عن التقديم يعني أن نموذج اللغة لا يضطر أبدًا للقلق بشأن دقة الصوت؛ فقط عليه الحصول على البنية الموسيقية بشكل صحيح.

منهج تدريبي يراعي الجودة

بيانات التدريب كبيرة بشكل غير عادي: أكثر من 5 ملايين ساعة من الموسيقى متعددة اللغات تغطي مئات اللغات. لا يقوم الفريق بإدخال كل شيء دفعة واحدة. يقومون بتدريب نموذج مكافأة منفصل يعتمد على MOS لتقدير جودة الصوت، ثم ترتيب كل عينة ضمن نوعها الموسيقي في سبع فئات جودة. Q1 هي الأفضل، ويتم تجاهل Q7. يتقدم التدريب عبر منهج من ثلاث مراحل: أولاً على بيانات Q3-Q6 لتغطية واسعة، ثم بيانات Q2 لتوحيد الجودة، وأخيرًا بيانات Q1 للتحسين عالي الجودة. تتبع خط أنابيب ما بعد التدريب خطوات مماثلة، بدءًا من الضبط الدقيق الخاضع للإشراف على بيانات منسقة، ثم دورات DPO التكرارية، وأخيرًا GSPO عبر الإنترنت لتحسين التوافق مع التفضيلات الموسيقية البشرية.

النتائج والمقاييس

بعد اختباره على 600 مطالبة مقسمة بين الصينية والإنجليزية، يحقق Qwen-Music نتائج متطورة في 13 من 16 مقياسًا موضوعيًا للموسيقية وجودة الصوت. في اختبارات التفضيل العمياء A/B مع مقيمين بشريين محترفين، يتفوق على Suno V5 وMiniMax Music 2.6. يتعامل النموذج أيضًا مع توليد الأغاني المقلدة (cover)، محافظًا على لحن مرجعي بدقة أكبر من الأنظمة المملوكة الرائدة مع السماح بتغيير الجرس والتوزيع والنوع الموسيقي. يستخرج الفريق رموز اللحن من الصوت المصدر ويدرجها في بادئة المطالبة بجانب علامات النمط الهدف وكلمات الأغاني، ويعيد النموذج توليد الباقي حولها.

كان رد فعل المجتمع على Hugging Face، حيث نُشرت الورقة، حماسيًا، يسأل المستخدمون متى سيتم إصدار الأوزان المفتوحة. لا يلتزم التقرير بجدول زمني، لكن تاريخ المصدر المفتوح لعائلة Qwen يشير إلى أن الإصدار محتمل.

لماذا هذا مهم

يعالج نهج Melody-CoT قيدًا أساسيًا لنماذج توليد الموسيقى من البداية إلى النهاية التي تحاول تعلم التأليف والتوزيع كمشكلة واحدة غير متمايزة. من خلال تفكيك المهمة إلى تخطيط واضح للحن متبوع بالتوزيع، ينتج Qwen-Music أغاني بهيكل أوضح ومنطق موسيقي أكثر شبهاً بالبشر. كما يجعل نقل اللحن للأغاني المقلدة (cover) أمرًا مباشرًا، حيث يمكن استخراج المحيط اللحني الخشن من أي صوت وإعادة تقديمه بأسلوب جديد.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.