SevenTnewS

الذكاء الاصطناعي

نموذج 7B يتفوق على النماذج الأكبر ويعمل على الهاتف ويغير معادلة تكلفة الذكاء الاصطناعي

نموذج Qwen2.5-Omni من Alibaba Cloud هو نموذج 7B يتعامل مع النصوص والصور والصوت والفيديو، ويولد الكلام والنص في الوقت الفعلي. تعمل هندسة Thinker-Talker وعناصر التموضع TMRoPE على تمكين التفاعل المتدفق، ويعمل المتغير 3B على شرائح SoC المحمولة مثل Snapdragon 8 Gen 1 بسرعات قابلة للاستخدام.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-23 · قراءة 4 دقائق

نموذج 7B يتفوق على النماذج الأكبر ويعمل على الهاتف ويغير معادلة تكلفة الذكاء الاصطناعي
المصادر : QwenLM/Qwen2.5-…·Alibaba Cloud A…

معظم النماذج متعددة الوسائط تدمج مشفرات منفصلة لكل وسيط وتكتفي بذلك. ولكن Qwen2.5-Omni يفعل شيئًا مختلفًا. فهو يعامل النصوص والصور والصوت والفيديو كمواطنين من الدرجة الأولى داخل هيكل واحد متكامل من البداية إلى النهاية ويولد كلاً من النص والكلام الطبيعي بطريقة متدفقة. النموذج، الذي أصدره فريق Qwen في Alibaba Cloud في أواخر مارس 2025، تصدر صفحة Hugging Face الرائجة مرتين منذ ذلك الحين ووصل إلى بيئات التشغيل المحمولة عبر MNN. هذا جزء من دفع أوسع من علي بابا لإيصال الذكاء الاصطناعي خارج المختبر، كما رأينا في مراهنتها على البنية التحتية بقيمة 53 مليار دولار.

هناك خياران معماريان يميزان Qwen2.5-Omni. أولاً، فصل Thinker-Talker: وحدة Thinker تتعامل مع الإدراك والاستدلال متعدد الوسائط، بينما تتعامل وحدة Talker مع توليد الكلام. هذا يتيح للنموذج فك شفرة النص والصوت بالتوازي بدلاً من التسلسل، ولهذا السبب يمكنه بث إجابة منطوقة أثناء إنهاء جمله. ثانيًا، TMRoPE (عناصر تموضع متعددة الوسائط متوافقة زمنيًا) يعمل على محاذاة عناصر التموضع لإطارات الفيديو مع الطوابع الزمنية الصوتية المقابلة لها، بحيث يفهم النموذج أن حدثًا بصريًا وصوتًا ينتميان إلى نفس اللحظة. مشكلة مزامنة الإشارات متعددة الوسائط هي تحدٍ معروف تعالجها بنيات أخرى أيضًا، كما تم استكشافه في الذكاء الاصطناعي الذي يصحح مخرجاته عبر الوسائط.

رسم بياني: مقارنة دقة OmniBench
Qwen2.5-Omni-7B يتفوق على Gemini 1.5 Pro و MiniCPM-o في OmniBench، كما ورد في المقال.

الإصدار 7B يقدم نتائج تنافسية أو أفضل عبر معظم المعايير مقارنة بالنماذج ذات الحجم المشابه. في OmniBench، الذي يختبر الاستدلال من الكلام إلى النص عبر الأصوات والموسيقى والكلام، حقق Qwen2.5-Omni-7B دقة 56.13%، متقدمًا بفارق كبير على Gemini 1.5 Pro بنسبة 42.91% و MiniCPM-o بنسبة 40.50%. في MMAU، معيار فهم الصوت والاستدلال، سجل 65.60% بشكل عام، متغلبًا على Qwen2-Audio بأكثر من 16 نقطة. في فهم الفيديو بدون ترجمة (Video-MME)، وصل إلى 64.3%، بالقرب من Qwen2.5-VL-7B و GPT-4o-mini. المتغير 3B، الذي صدر بعد شهر، يظل تنافسيًا: 52.19% في OmniBench و 63.30% في MMAU. تسلط هذه المعايير الضوء على اتجاه أوسع للنماذج الأصغر التي تتحدى النماذج الأكبر، وهو نمط مرئي في نموذج Laguna XS الذي تفوق على نماذج 137B.

الأرقام المهمة للتطوير هي على جانب الموارد. النموذج 3B يتطلب حوالي 3.6 جيجابايت من الذاكرة القصوى على شريحة SoC محمولة ويقوم بتشغيل Thinker decode بمعدل 15.84 رمز/ثانية على Snapdragon 8 Gen 1، أو 23.31 رمز/ثانية على 8 Elite. وحدات Talker و Code2Wav تضيف تأخيرًا، لكن الإنتاجية الإجمالية من البداية إلى النهاية تظل في نطاق 8 إلى 20 رمز/ثانية لفك التشفير، حسب الأجهزة. هذا يضع مساعدًا متعدد الوسائط في الوقت الفعلي في حدود الحرارة الحرارية للهاتف، وليس مجرد عرض توضيحي. القدرة على تشغيل مثل هذه النماذج على الجهاز لها آثار على الوكلاء المستقلين الذين يحتاجون إلى استجابات منخفضة التأخير، كما نوقش في هياكل الوكلاء المتوازية.

المتغير 7B في BF16 يحتاج حوالي 31 جيجابايت لإدخال فيديو مدته 15 ثانية، مما يستبعد الأجهزة المحمولة ولكنه يظل مريحًا على A100 واحد أو RTX 6000 Ada. الإصدارات الكمية 4-bit (GPTQ-Int4, AWQ) تقلل الذاكرة بأكثر من 50% مع انخفاض طفيف في الدقة: 3.71 WER على LibriSpeech test-other مقابل 3.4 للنموذج الكامل، 43.76 على MMLU-Pro مقابل 47.0. هذه الاختلافات تقع ضمن حدود الضوضاء للاستخدام الإنتاجي.

قصة النشر على الأجهزة المحمولة هي الجزء الذي يستحق المتابعة. تكامل MNN يعني أن Qwen2.5-Omni يقوم بالاستدلال على الجهاز عبر Snapdragon 8 Gen 1، 8 Elite، وربما أخرى الآن. مساحة الذاكرة، 5.8 جيجابايت للذروة للنموذج 7B على الهاتف، 3.6 جيجابايت للنموذج 3B، عالية ولكنها ليست مانعة للأجهزة الرائدة. سيكون لدى نماذج Apple المستندة إلى Neural Engine وشرائح Google Tensor إجاباتها الخاصة، لكن حقيقة أن نموذجًا مفتوح الأوزان 7B متعدد الوسائط يتسع لذاكرة الهاتف على الإطلاق هو شيء لم يكن أحد ليراهن عليه قبل عامين. هذا التحول في القدرة على الجهاز يعيد تشكيل كيفية نشر وكلاء الذكاء الاصطناعي، موضوع تم تغطيته في افتراض 314 مليار دولار الذي انكسر للتو.

الورقة صادقة بشأن القيود. بنية Thinker-Talker لا يمكنها التعامل مع إعدادات الموجه غير المقيدة لإخراج الصوت، يجب ضبط الموجه النظام على سلسلة هوية محددة حتى يعمل توليد الكلام. وحدة Talker تضيف حوالي 2 جيجابايت من ذاكرة GPU، وتعطيلها يوفر ذلك على حساب إخراج النص فقط. دعم عنوان URL للفيديو يعتمد على النظام الخلفي (torchvision >= 0.19.0 يعالج HTTP و HTTPS؛ decord يعالج HTTP فقط). وتقديم vLLM، اعتبارًا من مايو 2025، يدعم فقط Thinker، إخراج الصوت يتطلب fork مخصص من vLLM. هذه فجوات هندسية قابلة للحل، وليست عيوبًا أساسية.

ما يظهره Qwen2.5-Omni هو أن النماذج متعددة الوسائط لم تعد مجرد فضول بحثي. نموذج يتفوق على متعرفات الكلام المخصصة، ومستدلات الصور، ومعايير الفيديو، ويعمل على الهاتف، يغير معادلة التكلفة للمساعدين الصوتيين في الوقت الفعلي، وأدوات الوصول، وتحليل الفيديو المباشر. السؤال التالي هو ما إذا كانت Alibaba Cloud ستحوله إلى منتج بالسرعة الكافية لتكون ذات أهمية، أو ستترك ذلك لمن يبني على الأوزان المفتوحة أولاً. استراتيجية الشركة الأوسع تشير إلى أنها تفكر بالفعل أبعد من النماذج، كما رأينا في نهجها القائم على المنصة أولاً.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.