Qwen / Alibaba Cloud
Qwen2.5-Omni يتفوق على Gemini-1.5-Pro في OmniBench ويعمل بأقل من 12GB
تفوّق نموذج Qwen2.5-Omni مفتوح المصدر من Alibaba على Gemini-1.5-Pro في OmniBench وتصدّر لوحة صدارة MMAU للاستدلال الصوتي. وتخفض النسخ المكمّمة ذاكرة VRAM إلى أقل من 12GB، بينما يوفّر دعم MNN دردشة صوتية فورية على الهواتف.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-07 · قراءة 4 دقائق

أطلق فريق Qwen في Alibaba Cloud نموذج Qwen2.5-Omni في 26 مارس 2025، والأرقام في مستودعه تختصر الحديث. النموذج متعدد الوسائط من البداية إلى النهاية: يستقبل النصوص والصور والصوت والفيديو كمدخلات، ويرد بنصوص متدفقة وكلام طبيعي. تصدّرت نسخة 7B قائمة الأكثر رواجًا على Hugging Face في 2 أبريل، تلتها نسخة 3B في 30 أبريل، ونشر الفريق تقريرًا تقنيًا (arXiv 2503.20215) بالتزامن مع الإصدار.
النتيجة الرئيسية هي الفارق في المعايير. على OmniBench، الذي يختبر مهام تُجبر النموذج على استخدام عدة وسائط في آنٍ واحد، حقّق Qwen2.5-Omni-7B متوسط 56.13% وسجّل إصدار 3B نسبة 52.19%. أما Gemini-1.5-Pro فسجّل 42.91%. هذه أرقام نشرها الفريق نفسه، وهي السبب في أن هذا الإصدار يستحق أكثر من نظرة عابرة.
يحكي الاستدلال الصوتي قصة مماثلة. على MMAU، حقّق إصدار 7B متوسط 65.60%، متقدمًا على نسبة 54.90% التي سجّلتها Gemini-Pro-V1.5 في الجدول نفسه. يدّعي تحديث الفريق الصادر في 9 يونيو احتلال المركز الأول في لوحة صدارة MMAU والأول بين النماذج مفتوحة المصدر على MMAR. وبعد ثلاثة أيام، أعلن تحقيق المركز الأول بين النماذج مفتوحة المصدر على MMSU، وهو معيار لفهم اللغة المنطوقة والاستدلال.
| المعيار (المتوسط) | Qwen2.5-Omni-7B | Qwen2.5-Omni-3B | Gemini-1.5-Pro |
|---|---|---|---|
| OmniBench | 56.13% | 52.19% | 42.91% |
| MMAU (فهم الصوت) | 65.60% | 63.30% | 54.90% |
الأرقام كما نُشرت في مستودع Qwen2.5-Omni. يسمّي جدول MMAU نتيجة Gemini باسم Gemini-Pro-V1.5؛ بينما يستخدم جدول OmniBench اسم Gemini-1.5-Pro.
وتستمر هذه الفوارق في اختبارات الوسائط المفردة أيضًا. على LibriSpeech test-other، بلغ معدل خطأ الكلمات لإصدار 7B نسبة 3.4، وهو أفضل قليلًا من نسبة Whisper-large-v3 البالغة 3.6. وعلى Common Voice 15 يتفوق على Whisper-large-v3 في جميع الأقسام اللغوية الأربعة المدرجة، بما في ذلك فارق 5.2 مقابل 12.8 على اللغة الصينية.
Thinker-Talker والكلام الفوري
البنية المعمارية هي الجزء الذي تخفيه معظم الإصدارات خلف واجهة برمجية. ينقسم Qwen2.5-Omni إلى Thinker، الذي يستدل عبر النصوص والصور والصوت والفيديو، وTalker، الذي يولّد الكلام. وتعمل آلية ترميز موضعي تُسمى TMRoPE على مواءمة الطوابع الزمنية للفيديو مع الصوت، بحيث يستطيع النموذج سماع ما يحدث على الشاشة أثناء مشاهدته. وبدأت الدردشة الفورية بالصوت والفيديو على Qwen Chat في اليوم نفسه الذي صدر فيه النموذج.
يقترب إخراج الكلام من أنظمة تحويل النص إلى كلام المخصصة. على المجموعة الصعبة من معيار SEED، يسجّل إصدار 7B المضبوط بتعلّم التعزيز معدل خطأ كلمات قدره 6.54 لاتساق المحتوى، مقابل 1.94 لـ Seed-TTS_RL و6.83 لـ CosyVoice 2. ويبلغ تشابه المتحدث 0.752، أي أقل بقليل من 0.782 لـ Seed-TTS_RL. بالنسبة لنموذج يقرأ ويشاهد ويستدل أيضًا، فهذا أداء محترم.
نسخة 11.64GB لوحدات معالجة الرسوميات الاستهلاكية
الإصدار المهم لمن لا يملكون مجموعة وحدات معالجة رسومية صدر في 16 مايو. وفّر الفريق نسختين بتكميم 4-bit بصيغتي GPTQ-Int4 وAWQ من إصدار 7B. فمدخل فيديو مدته 15 ثانية يحتاج 31.11GB من ذاكرة VRAM بصيغة BF16 ينخفض إلى 11.64GB مع GPTQ-Int4 وإلى 11.77GB مع AWQ. ويذكر ملف README بطاقات RTX 3080 و4080 و5070 كأهداف مستهدفة. وقبل أيام، كان دعم MNN قد وضع النموذج على الهواتف، حيث بلغت ذروة استخدام إصدار 7B 5.8GB من الذاكرة على Snapdragon 8 Gen 1 و8 Elite، و3.6GB لإصدار 3B. أما إصدار 3B الأخف، الذي صدر في 30 أبريل، فيوجد لكي تتمكن منصات أكثر من تشغيل النموذج أصلًا.
المقايضات ظاهرة في الجداول ذاتها. يكلف التكميم بعض الدقة وقليلًا من السرعة: ينخفض MMLU-Pro من 47.0 إلى 43.76 على نسخة GPTQ، بينما يبقى VideoMME عند 72.0 على AWQ مقابل 72.4 في النسخة الأصلية. ويشير الفريق إلى أن أرقام VRAM هي حدّ أدنى نظري، وأن الاستخدام الفعلي يبلغ نحو 1.2 ضعف هذه القيم. ورقم 11.64GB يغطي أيضًا 15 ثانية فقط من الفيديو؛ فعند 60 ثانية يرتفع إلى 29.51GB. أما قصة «أقل من 12GB» فلا تدوم طويلًا.
أين تترنح الأرقام المُبلَّغ عنها ذاتيًا
للنشر محاذيره. يدعم vLLM serve، وهو مسار الخدمة القياسي المتوافق مع OpenAI، إصدار Thinker فقط، ما يعني إخراج النصوص حصرًا؛ ويتطلب توليد الصوت البرنامج النصي end2end. ونموذج DashScope API المسمى qwen-omni-turbo يعمل بالبث فقط. ويعتمد إخراج الصوت على مطالبة نظام محددة، وهي "You are Qwen, a virtual human..."، وإلا فقد لا يُولَّد الكلام إطلاقًا.
كل رقم في ما سبق يأتي من الفريق الذي بنى النموذج. التحقق المستقل من النماذج متعددة الوسائط أندر منه بالنسبة لنماذج اللغة النصية فقط، لأن بيئات التقييم أحدث. وما يصمد عند التدقيق هو الاتجاه: نموذج 7B مفتوح المصدر تفوق على نموذج مغلق رائد في مهام متعددة الوسائط متكاملة، ونسخة 4-bit تجعل التفاعل الصوتي الفوري في متناول وحدة معالجة رسومية بسعة 12GB. وما إذا كانت الاختبارات المستقلة ستؤكد هذه الفوارق هو السؤال الذي ينبغي للجولة القادمة من المعايير أن تجيب عنه.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.