SevenTnewS

الذكاء الاصطناعي متعدد الوسائط

Qwen2.5-Omni من علي بابا: نموذج يريد أن يسمع ويرى ويتحدث دفعة واحدة

يعالج Qwen2.5-Omni من سحابة علي بابا النصوص والصور والصوت والفيديو من طرف إلى طرف، ويولد نصًا وكلامًا طبيعيًا في الوقت الفعلي. تظهر المعايير أنه غالبًا ما يتطابق أو يتفوق على النماذج المتخصصة أحادية الوسائط، مما يشير إلى تحول نحو البنى الموحدة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-20 · قراءة 5 دقائق

Qwen2.5-Omni من علي بابا: نموذج يريد أن يسمع ويرى ويتحدث دفعة واحدة

لطالما تم تنظيم مشهد نماذج الذكاء الاصطناعي حسب الحاسة: نماذج الرؤية للصور، والنماذج الصوتية للصوت، والنماذج النصية للغة. لكن هذا التصنيف منطقي فقط داخل مختبر الأبحاث. في العالم الحقيقي، تتضمن المحادثة تعابير الوجه ونبرة الصوت والكلمات نفسها، كل ذلك دفعة واحدة. يراهن فريق Qwen في سحابة علي بابا على أن الحدود التالية هي ببساطة كل شيء دفعة واحدة.

مع إصدار Qwen2.5-Omni، تطلق الشركة نموذجًا متعدد الوسائط من طرف إلى طرف يستهلك النصوص والصور والصوت والفيديو، ويخرج كلا من النص والكلام الطبيعي بطريقة التدفق. النموذج مفتوح المصدر (نسخ 7 مليار و3 مليار معلمة متاحة بموجب تراخيص متساهلة)، وقد نشر الفريق تقريرًا فنيًا مفصلاً. لكن الأرقام وحدها تروي قصة تستحق الاهتمام.

منافس لكل من Gemini وعائلة Qwen نفسها

واحدة من أبرز النتائج في ورقة Qwen2.5-Omni هي جدول OmniBench: في معيار فهم اللغة المنطوقة والاستدلال MMSU، سجل النموذج ذو 7 مليار معلمة 61.32، متخلفًا فقط عن Baichuan-Omni-1.5 الذي سجل 57.25 بين أقرانه مفتوحي المصدر، ولكن بشكل حاسم قبل كل بديل مفتوح آخر. في مجموعة اختبارات OmniBench الأوسع، التي تختبر الكلام والأحداث الصوتية والموسيقى، حقق Qwen2.5-Omni-7B 56.13%، متغلبًا بسهولة على Gemini-1.5-Pro بنسبة 42.91% و MiniCPM-o بنسبة 40.50%. في الاستدلال الصوتي فقط عبر MMAU، سجل 65.60، متفوقًا بشكل كبير على Qwen2-Audio (49.20) وحتى Gemini-Pro-V1.5 (54.90).

لكن الأمر المثير للدهشة حقًا هو كيفية مقارنة النموذج بأشقائه المتخصصين. درجات Qwen2.5-Omni-7B في تحويل الصورة إلى نص على MMMU (59.2) و MathVista (67.9) و TextVQA (84.4) و DocVQA (95.2) قريبة جدا من أرقام Qwen2.5-VL-7B البالغة 58.6 و 68.2 و 84.9 و 95.7 على التوالي. معايير الفيديو ضيقة بالمثل: على MVBench، يتقدم النموذج متعدد الوسائط على النموذج المرئي فقط 70.3 مقابل 69.6. المغزى هو أن إضافة فهم الصوت والكلام لم يضعف أداء الرؤية، وهو إنجاز معماري غير بسيط.

على الجانب الصوتي، معدل خطأ الكلمات في التعرف التلقائي على الكلام (ASR) لـ Qwen2.5-Omni-7B على LibriSpeech test-other هو 3.4، مماثل لـ Whisper-large-v3 ومتفوق على Llama-3-8B (3.4 مقابل 3.5 المبلغ عنها). على Common Voice الإنجليزية، يصل إلى 7.6، مرة أخرى منافس لـ Whisper-large-v3 البالغ 9.3. للترجمة من الكلام إلى النص على CoVoST2 (en-de)، يسجل 30.2، متقدمًا على Qwen2-Audio (29.9) و MiniCPM-o (الذي لم يبلغ عن الإنجليزية إلى الألمانية). مقاييس توليد الكلام، WER على معيار Seed-TTS الصعب، هي 6.54 لنموذج التعلم المعزز (RL)، منافس لـ CosyVoice 2-S البالغ 8.08 و Seed-TTS_RL البالغ 6.42.

الهندسة: المفكر والمتكلم

تحت الغطاء، يستخدم Qwen2.5-Omni بنية من كتلتين تسمى Thinker-Talker. المفكر (Thinker) هو محول متعدد الوسائط يقوم بتداخل رموز النص والصورة والصوت والفيديو باستخدام تضمين موضعي مخصص يسمى TMRoPE (التضمين الموضعي المداري متعدد الوسائط المتزامن زمنيًا)، والذي يقوم بمزامنة إطارات الفيديو مع مساراتها الصوتية على مستوى الطابع الزمني. المتكلم (Talker) هو مفكك صوتي مخصص يأخذ الحالات الخفية للمفكر وينتج مخرجات صوتية متدفقة. يسمح هذا الفصل للنظام، على سبيل المثال، بنسخ استعلام المستخدم المنطوق مع توليد رد منطوق دون انتظار انتهاء الإدخال بالكامل.

يدعم النموذج أيضًا إدخال الصوت المجزأ للتفاعل في الوقت الفعلي، وهي ميزة أظهرها الفريق عبر واجهة الدردشة الصوتية والفيديو Qwen Chat، وهي متاحة الآن للمطورين من خلال واجهة برمجة تطبيقات متوافقة مع OpenAI في DashScope.

لكن الإنجاز الأروع قد يكون تشغيله على هاتف

ربما يكون الإنجاز العملي الأكبر هنا ليس نتيجة معيارية بل جدول استهلاك الذاكرة. يتطلب Qwen2.5-Omni-7B في BF16 31.11 جيجابايت لإدخال فيديو مدته 15 ثانية، وهو ما يتجاوز بكثير ما يمكن لوحدة معالجة رسومات استهلاكية التعامل معه. لكن الفريق أصدر إصدارات مكممة بحجم 4 بت (GPTQ-Int4 و AWQ) تقلل هذا المطلب إلى 11.64 جيجابايت و 11.77 جيجابايت على التوالي، مما يتيح الاستدلال على RTX 3080 أو 4080. والأكثر إثارة للإعجاب، أن النموذج يعمل الآن على الأجهزة الطرفية عبر MNN: يستخدم متغير 7 مليار معلمة على هاتف Snapdragon 8 Gen 1 ذاكرة وصول عشوائي قصوى تبلغ 5.8 جيجابايت ويفك تشفير 11.52 رمزًا في الثانية، بطيء ولكن قابل للاستخدام لدردشة صوتية أساسية. نموذج 3 مليار معلمة على Snapdragon 8 Elite يدفع فك التشفير إلى 23.31 رمزًا في الثانية.

تعبئة نموذج يفهم الأسئلة المنطوقة حول بث كاميرا مباشر مع التحدث مرة أخرى ليس مجرد عرض توضيحي؛ إنه يفتح حالات استخدام في الخدمة الميدانية وإمكانية الوصول والترجمة الفورية التي كانت ستتطلب عدة نماذج منفصلة ملتصقة ببعضها البعض.

الآثار على المؤسسات: Qwen المعزول هوائيًا

يصل Qwen2.5-Omni أيضًا جنبًا إلى جنب مع لاعب بنية تحتية: صندوق رمل الذكاء الاصطناعي Hermetic، وهو بنية مرجعية من قبل نجم سحابة علي بابا (MVP) أرسلان أودين شاه فيق لنشر نماذج Qwen في شبكات VPC معزولة هوائيًا بالكامل دون اتصال بالإنترنت. يستخدم الإعداد مجموعات الموارد المخصصة لـ PAI-EAS من سحابة علي بابا، ونقاط نهاية VPC لتخزين OSS، و DNS PrivateZone لتوجيه تحميل أوزان النموذج دون لمس الإنترنت العام مطلقًا. يضبط "enable_internet_access": false بشكل صريح ويستبدل سلاسل أدوات RAG الخارجية بوكلاء داخليين يسحبون من Jira أو Confluence أو قواعد البيانات المحلية.

هذا مهم لأن الامتثال في الخدمات المصرفية والرعاية الصحية والدفاع غالبًا ما يمنع نشر الذكاء الاصطناعي التوليدي تمامًا. إظهار مسار لنشر نفس النموذج المتطور دون أي استدعاء API يغادر VPC يمكن أن يفتح دورات شراء كانت متوقفة.

المعضلة: لا يوجد مستوى من تلميع Siri على المعصم حتى الآن

هذا لا يعني أن Qwen2.5-Omni جاهز لاستبدال المساعدين الصوتيين المتخصصين. للمقارنة، يسلط معاينة watchOS 27 التجريبية من The Verge الضوء على كيف يستفيد ذكاء Siri من Apple من التكامل المحكم والإجابات المتسقة عبر الهاتف والساعة والسياق المشترك وعقد من تحسين واجهة المستخدم. النموذج متعدد الوسائط للأغراض العامة لا يمتلك هذه الميزة بعد. يعمل الدردشة الصوتية لـ Qwen2.5-Omni على الهاتف، لكن زمن الوصول وهشاشة المطالبة (يجب تعيين المطالبة النظامية حرفيًا ليعمل الإخراج الصوتي)، وعدم وجود تجربة كلمة تنبيه مصقولة يبقيانه في صندوق رمل المطورين في الوقت الحالي.

مع ذلك، الاتجاه التقني واضح. حيث كان عام 2024 هو عام نموذج الدردشة، يبدو عام 2025 بشكل متزايد عام الذكاء الاصطناعي الذي يمشي ويتحدث ويرى. يظهر Qwen2.5-Omni أن البنى الموحدة يمكن أن تضاهي البنى المتخصصة دون تنازل، وأن المصدر المفتوح يمكنه دفع هذا الحدود بنفس سرعة أكبر المختبرات. السؤال الآن ليس حول ما إذا كانت النماذج متعددة الوسائط ستصل، بل حول من سيجعلها تبدو طبيعية أولاً.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.

مقالات ذات صلة

مقالات مُستشهد بها