توليد الموسيقى بالذكاء الاصطناعي

Music 3.0 تستبدل الوصف أحادي الوسم بخط زمني يُبقي أغاني الذكاء الاصطناعي على مسارها

تميل مسارات الذكاء الاصطناعي إلى الانحراف عن الموجز أثناء تطورها: الآلات الموسيقية تتساقط، والعاطفة تتسطح، وأسلوب الغناء يأتي ويذهب. تستبدل Music 3.0 الوصف أحادي الوسم بوصف منظم زمني تسلسلي (Structured Caption)، مدعومًا بنموذج هجين 8B/0.6B Hybrid-LM يفصل البنية عن التفاصيل.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-21 · قراءة 4 دقائق

Music 3.0 تستبدل الوصف أحادي الوسم بخط زمني يُبقي أغاني الذكاء الاصطناعي على مسارها

يمكن أن تبدو الأغنية المولّدة بالذكاء الاصطناعي مكتملة وتخون الموجز في الوقت نفسه. آلة موسيقية محددة تتلاشى بحلول المقطع الثاني، والمزاج المضبوط مسبقًا يتراجع قرب الجسر، وأسلوب الغناء لا يعود أبدًا. يعمل المسار مثل أغنية مكتملة، لكن ليس تلك التي طلبها أحد.

نمط الفشل هذا هو هدف Music 3.0، النموذج الجديد في خط توليد الموسيقى من Qwen. فبدلاً من وسم عالمي واحد يغطي المسار بأكمله، يستخدم وصفًا منظمًا (Structured Caption): وصف زمني تسلسلي يذكر، لحظة بلحظة، ما يحدث ومتى.

وسم واحد، ثم الانحراف

تضغط معظم أنظمة تحويل النص إلى موسيقى الطلب في وصف عالمي واحد للمسار، ويظل هذا الوصف صامدًا حتى تبدأ الموسيقى في التكشف: الآلات الموسيقية تسقط من التوزيع، والنبرة العاطفية تتسطح، ويبقى الأداء الصوتي فقط حيث صادف أن وصفه الموجز. تستبدل Music 3.0 هذا الوسم المفرد بوصف منظم زمني تسلسلي. ما زال يغطي النوع، وإيقاع BPM، وتوقيع الوقت، والمفتاح الموسيقي، والاستخدام المقصود، والملمس الإنتاجي. كما يتتبع كيف ترتفع العاطفة وتنخفض، ومتى تدخل الآلات الرئيسية والداعمة أو تخرج، وكيف يتطور الأخدود (groove) والخط الجهير، وكيف يتغير أسلوب الغناء والتناغم والمؤثرات الصوتية من قسم إلى آخر. توفر تسميات الأقسام في كلمات الأغنية، مثل [intro] و[verse] و[pre-chorus] و[chorus] و[bridge] و[outro]، البنية الكلية؛ ويملأ الوصف المنظم ما يتغير داخل كل منها.

الشكوى نفسها شكّلت النموذج السابق في الخط. أشارت تغطيتنا لـ Qwen-Music إلى أن الأنظمة الشاملة من البداية إلى النهاية التي تؤلف اللحن والتوزيع كمهمة واحدة تنتهي مزدحمة ومشتتة. خططت Qwen-Music للحن أولاً. توسع Music 3.0 هذا المنطق ليشمل طبقة الوصف بأكملها.

داخل Hybrid-LM: البنية عند 8B، والتفاصيل عند 0.6B

على جانب النموذج، تقسم Music 3.0 العمل بين شبكتين. يتنبأ نموذج لغوي كبير عالمي 8B (8B Global LLM)، إطارًا بإطار، بالرموز التي تحمل المحتوى الدلالي والبنائي الأساسي، مع إبقاء سياق المسار كاملاً في الاعتبار. ويعمل نموذج لغوي كبير محلي 0.6B (0.6B Local LLM) داخل كل إطار، متنبئًا بالرموز الصوتية على طول محور العمق لإضافة تفاصيل صوتية محلية.

النموذجالنطاقما يتنبأ به
8B Global LLMعبر المسار بأكملهرموز تحمل الدلالات والبنية الأساسية، إطارًا بإطار
0.6B Local LLMداخل كل إطاررموز صوتية على طول محور العمق، مضيفًا تفاصيل محلية

يحافظ هذا التقسيم على استقرار الزمن للأغاني حتى خمس دقائق مع الحفاظ على التنوع داخل الأقسام. وهو يوسع التصميم الذي وثّقه التقرير الفني لـ Qwen-Music، حيث ضغطت أداة الترميز الصوت إلى تدفق 25 هرتز من الرموز الدلالية، ورسمت سلسلة أفكار اللحن (melody chain-of-thought) محيطًا صوتيًا تقريبيًا قبل التوليد الكامل. المبدأ نفسه: افصل الخطة عن الملمس.

العروض التجريبية تقرأ كإثبات للمفهوم

يأتي الشرح المصاحب مع أكثر من اثنتي عشرة أغنية تجريبية، تحمل كل منها تنسيق الوصف الجديد. تُمثل أغنية بالاد ماندفارينية دافئة بأنها 74 BPM في سلم لا بيمول الكبير، حنين رقيق ينفتح على لازمة احتفالية، بصوت ذكر بالغ باريتون-تينور، وعزف غوتشنغ رقيق، وأوتار ناعمة، وصوت غرفة طبيعي حي. القوس الدرامي والآلات الموسيقية والصفات الصوتية: مذكورة مسبقًا، لا تُترك للاستدلال.

النمط مستمر عبر الأنواع. "Cloud copy of me"، مقطوعة EDM لحنية عن رفع الذاكرة إلى تدفق بيانات، موصوفة بمقاطع تأملية تبني نحو لازمة راقية تعتمد على الخطاف، مع أنسجة تشويشية ومكساج مهرجانات مصقول. بالاد الماندوبوب الثنائي للوالدين يذهب أبعد، حيث يحدد مغنيين في الخمسين إلى السبعين من العمر، ولهجة تايوانية قوية، وأم تقود، وأب ينسجم، وتوزيع يبني من البيانو والأوتار إلى الطبول والغيتار الكهربائي قبل أن يتلاشى إلى ختام صوتي. لا يثبت أي من هذا أن النموذج يتبع هذه الأوصاف بأمانة؛ بل يُظهر ما صُمم التنسيق لالتقاطه.

ماذا تغيّر السيطرة على مستوى الأقسام للمنتجين

بالنسبة للأشخاص الذين يوجّهون نماذج الموسيقى، يحوّل هذا نقطة السيطرة. تصحيح الانحراف يعني عادة إعادة توليد الأغنية كاملة أو إعادة كتابة الموجز العالمي والأمل. الوصف الذي يسمي ما يتغير وأين، المرتكز على تسميات الأقسام، يحوّل "ما يحدث في الجسر" إلى شرط يمكن إلزام النموذج به. الشرح المصاحب صريح بشأن الهدف: جعل مكان حدوث التغييرات شرطًا صريحًا للتوليد.

المنافسون يدورون حول المشكلة نفسها. أطرت MiniMax إطلاق Music 2.6 حول أربع قصص لمبدعين بدلاً من قائمة مكاسب النموذج. أبرمت Stability AI صفقات ترخيص مع UMG وWMG وعليها الآن أن تفي بالتزاماتها. تستهدف Music 3.0 مشكلة الإنتاج مباشرة: توليد الأغنية التي تم وصفها، لخمس دقائق متواصلة.

ما لا يقوله الشرح المصاحب

لا توجد بيانات تقييم تُظهر مدى أمانة اتباع Music 3.0 لوصف زمني كثيف؛ توضح العروض التجريبية النية، لا الالتزام. ادعى تقرير Qwen-Music نتائج متطورة ضد Suno V5 وMiniMax Music 2.6 في المقاييس الموضوعية والتفضيل البشري، لكن اتباع الوصف أمر مختلف يصعب تسجيله. يبقى السؤال مفتوحًا حول ما إذا كان النموذج يلتزم بشكل موثوق بتسلسلات طويلة من التعليمات الزمنية، وكيف يتفاعل قصد الوصف مع المشاعر في الكلمات.

الأوزان المفتوحة أيضًا. لم يلتزم تقرير Qwen-Music بأي جدول زمني للإصدار، رغم أن تغطيتنا أشارت إلى أن تاريخ عائلة Qwen مفتوح المصدر يجعل الإصدار مرجحًا. لا تقول مواد Music 3.0 شيئًا في الاتجاهين. أين ستستقر، ومدى قدرتها على الالتزام بموجز مدته خمس دقائق، لم يثبت أحد ذلك بعد.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.