مراجعة نموذج

Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط

غوص عميق في النموذج مفتوح المصدر الذي يعالج النصوص والصور والصوت والفيديو في وقت واحد مع توليد كلام متدفق، متفوقًا على GPT-4o-mini وGemini في اختبارات معيارية متعددة، مع إمكانية تشغيله على بطاقة رسومية استهلاكية واحدة مع التكميم.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-03 · قراءة 4 دقائق

Qwen2.5-Omni: النموذج مفتوح المصدر الذي يفعل أخيرًا ما يعد به المنافسون فقط

أصدر فريق Qwen من Alibaba نموذج Qwen2.5-Omni، وهو نموذج متعدد الوسائط يحتوي على 7 مليارات معلمة ويعالج النصوص والصور والصوت والفيديو في وقت واحد، ويمكنه توليد كلام متدفق كمخرجات. في الاختبارات المعيارية، يتفوق على منافسيه مفتوحي المصدر والمنافسين التجاريين، كل ذلك أثناء تشغيله على بطاقة رسومية واحدة.

يستخدم النموذج بنية Thinker-Talker التي تفصل الإدراك عن التوليد. يتولى Thinker الترميز متعدد الوسائط. يقوم Talker بتوليف الكلام المتدفق أو النص. يعمل تضمين موضعي مخصص يُدعى TMRoPE على مزامنة الطوابع الزمنية للفيديو مع الصوت، مما يسمح للنموذج بالفهم عبر الوسائط في الوقت الفعلي.

ما يميز Qwen2.5-Omni عن المنافسين هو اتساع نطاق أدائه. على اختبار OmniBench، وهو اختبار معياري لقياس الفهم عبر الكلام والأحداث الصوتية والموسيقى، يسجل إصدار 7B نسبة 56.13%، بفارق 13 نقطة عن Gemini 1.5 Pro (42.91%). في التفكير الصوتي (MMAU)، يحقق 65.6% بشكل عام، متغلبًا على Gemini-Pro-V1.5 (54.9%) وQwen2-Audio (49.2%). جودة توليد الكلام قوية أيضًا: في مجموعة اختبار SEED test-hard، فإن المتغير المُحسَّن باستخدام RL لديه معدل خطأ في الكلمات يبلغ 6.54%، وهو مشابه لنماذج TTS المتخصصة مثل Seed-TTS_RL (6.42%).

ربما يكون فهم الصور من جانب النموذج أكثر لفتًا للانتباه. على الرغم من كونه نموذجًا شاملاً، إلا أن Qwen2.5-Omni-7B يضاهي نموذج الرؤية المخصص Qwen2.5-VL-7B في اختبار MMMU (59.2 مقابل 58.6)، ويتفوق عليه في MMStar (64.0 مقابل 63.9)، ويتعادل في MathVision (25.0 مقابل 25.1). في اختبار التعرف الضوئي على الحروف DocVQA، يسجل 95.2% مقابل 95.7% من Qwen2.5-VL-7B، وهو فارق ضئيل. يتخلف GPT-4o-mini في معظم اختبارات الرؤية: MMMU 60.0 مقابل 59.2، MathVista 52.5 مقابل 67.9، MMStar 54.8 مقابل 64.0.

فهم الفيديو يتبع نفس القصة. في اختبار Video-MME مع الترجمة، يصل Qwen2.5-Omni-7B إلى 72.4%، متغلبًا على Qwen2.5-VL-7B (71.6%) وGPT-4o-mini (64.8%). في MVBench يسجل 70.3 مقابل 69.6 للنظير المخصص للرؤية فقط.

الهندسة والتدريب

بنية Thinker-Talker هي أكثر من مجرد اسم ذكي. Thinker هو محول يعتمد على وحدة فك الترميز باستخدام Qwen2.5 كهيكل أساسي له، مع إضافة مشفرات الصوت والفيديو. يستخدم الانتباه السببي عبر جميع الوسائط، حيث يقوم النموذج بمعالجة المدخلات بالتسلسل وفي السياق، دون وحدات دمج منفصلة. Talker هو وحدة فك ترميز خفيفة الوزن، تأخذ الحالة المخفية الأخيرة من Thinker وتولد إما رموز نصية أو رموز كلام عبر برنامج ترميز. تشارك الوحدتان المعلمات من خلال التدريب المتناوب: يتم تحديث Thinker في كل خطوة، ولكن Talker فقط أثناء توليد الكلام.

تم التدريب على ثلاث مراحل: محاذاة الوسائط باستخدام 1.2 تريليون رمز من بيانات متنوعة، والضبط الدقيق الخاضع للإشراف متعدد المهام على 1.3 مليون عينة من النص والصورة والفيديو و170,000 ساعة من الصوت، والتعلم المعزز من التغذية الراجعة البشرية لجودة الصوت. والنتيجة هي نموذج يمكنه الاستماع إلى سؤال، ومشاهدة فيديو، والتفكير في كليهما، والرد بكلام طبيعي، كل ذلك في تمريرة واحدة للأمام.

النشر العملي

على عكس النماذج الشاملة من Google أو OpenAI التي تتطلب واجهات برمجة تطبيقات سحابية، يمكن تشغيل Qwen2.5-Omni على أجهزة استهلاكية. يحتاج إصدار 7B إلى 31 جيجابايت من ذاكرة GPU بتنسيق BF16 مع FlashAttention-2، وهو ما يناسب بطاقة RTX 4090. الإصدارات المكمّمة (GPTQ-Int4, AWQ) تقلل الذاكرة إلى أقل من 12 جيجابايت، لتناسب بطاقة RTX 3080 أو 4080. يوجد متغير بحجم 3B للأجهزة الطرفية، مع دعم MNN للمعالجات المحمولة: على معالج Snapdragon 8 Elite، يفك Thinker الترميز بمعدل 11.52 رمزًا/ثانية ويولد الكلام بمعدل 27.36 رمزًا/ثانية.

النشر مباشر. النموذج مدمج في أحدث إصدارات Hugging Face Transformers (v4.52.3) وvLLM. صور Docker متاحة. تظهر مقتطفات التعليمات البرمجية في المستودع الاستدلال في أقل من 20 سطرًا من Python.

ما يحتاج إلى تحسين

أداء النص فقط يتخلف عن نماذج اللغة البحتة ذات الحجم المماثل. في MMLU-Pro، يسجل Qwen2.5-Omni-7B 47.0، مقابل 56.3 لـ Qwen2.5-7B. تشير الفجوة إلى أن التدريب متعدد الوسائط يفرض مفاضلة على التفكير اللغوي فقط. يتطلب النموذج أيضًا موجه نظام محدد لتوليد الكلام، وهو قيد هش للمطورين الذين يرغبون في تخصيص السلوك. وبينما أداء OmniBench مثير للإعجاب، إلا أنه لم يتم تكراره بشكل مستقل من قبل أطراف ثالثة بعد.

يدعم إخراج الصوت حاليًا صوتين افتراضيين فقط (Chelsie وEthan)، على الرغم من أن خدمة API في Alibaba Cloud تقدم أربعة أصوات. لم يتم توثيق الضبط الدقيق المحلي للأصوات المخصصة.

الحكم

Qwen2.5-Omni هو إنجاز نادر: نموذج مفتوح المصدر يضع معيارًا جديدًا في مجاله مع العمل على أجهزة يمتلكها المطورون بالفعل. إنه لا يضاهي المنافسين التجاريين فقط في المهام الشاملة، بل يتفوق عليهم في معظم الاختبارات المعيارية. المفاضلة في النص فقط حقيقية لكنها مقبولة لنموذج مصمم لتوحيد الوسائط. لأي شخص يبني وكلاء صوت في الوقت الفعلي، أو خطوط أنابيب فهم الفيديو، أو مساعدين متعددي الوسائط، فهذا هو النموذج مفتوح المصدر الذي يجب البدء منه.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.