ذكاء اصطناعي مفتوح المصدر: علي بابا تفتح فئة Max
Qwen 3.8-Max: نموذج علي بابا الأقوى أصبح الآن متاحًا للتحميل مجانًا
تفتح علي بابا المصدر لنموذجها الأقوى على الإطلاق Qwen 3.8-Max: نموذج MoE بمعاملات 2.4T يتفوق على GPT-5.6 Sol في SWE-bench Pro وPaperBench وIFBench. نحلل تحفظات هذه المعايير وما يعنيه نموذج رائد مفتوح بنشاط 95B للمطورين.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-16 · قراءة 5 دقائق

كانت فئة Max هي الجزء الوحيد من Qwen الذي لم يتمكن أحد من تحميله. بقيت النماذج الرائدة لدى علي بابا خلف واجهات برمجية (APIs) بينما صدرت الإصدارات الأصغر بأوزان مفتوحة. ينهي Qwen 3.8-Max هذا الوضع. يصفه إعلان الإصدار بأنه النموذج الأكثر قدرة في عائلة Qwen حتى الآن، وأول إصدار من فئة Qwen-Max بأوزان مفتوحة، نُشر عبر Hugging Face وModelScope، وهي خطوة أشرنا إليها قبل الإصدار. يصل إجمالي معاملاته إلى 2.4 تريليون معامل، ينشّط منها 95 مليارًا لكل توكن، بالاعتماد على البنية التي قدمتها Qwen 3.5.
يملك النموذج سجلًا حافلًا من الحقبة المغلقة. ففي غضون 24 ساعة، تغلّب Qwen 3.8-Max على 458 فريقًا بشريًا عملوا منفردين، كما ورد في تقرير مسابقة الـ24 ساعة. ثم جاءت جولة تشغيل ذاتية استمرت 16 يومًا أنتجت إطارًا للوكلاء وحلّت في المركز الثاني في Vision Arena، وهو ما توثقه تغطية جولة الـ16 يومًا. هذه القدرات على وشك أن تصبح قابلة للتكرار في أي مكان يمكن فيه تشغيل النموذج.
فئة Max المغلقة لدى علي بابا أصبحت مفتوحة المصدر للتو
هذه قطيعة استراتيجية، وليست لفتة حسن نية. وحّدت علي بابا أعمالها في الذكاء الاصطناعي ضمن وحدة واحدة مهمتها المعلنة "إنشاء التوكنات وتسليمها وتطبيقها"، بدعم من استثمارات بقيمة 53 مليار دولار، وفق تحليلنا لهذا الإنفاق. تشحن الشركة أسطولًا من النماذج بدلًا من الاعتماد على بطل واحد، وهي استراتيجية منصات أوضحناها في التحليل الاستراتيجي السابق؛ والصفقة هنا واضحة: الأوزان مجانية، بينما تمثل Qwen Cloud وأدوات التشغيل المحيطة بها القناة المدفوعة. وتجمع تلك القناة المدفوعة الآن نماذج النصوص والرؤية والكلام والصور ضمن اشتراك واحد، وفق تغطية خطط Qwen Cloud. وهناك تفصيلة واحدة تهم أي شخص يخطط لتشغيل النموذج الرائد: النسخة المفتوحة ذات الـ2.4 تريليون معامل، Qwen3.8-2.4T-A95B، نصية فقط وتتطلب وضع التفكير في كل تفاعل. المدخلات متعددة الوسائط غير مدعومة ولا يمكن تعطيل التفكير، حتى وإن كانت البنية الأساسية Qwen 3.5 التي يقوم عليها قد دُرّبت كنموذج موحد للرؤية واللغة.
أين يتفوق Qwen 3.8-Max على GPT-5.6 Sol وأين يخسر
استنادًا إلى أرقام الإعلان، يتفوق Qwen 3.8-Max على سلفه في كل صف تقريبًا. أما أمام المنافسين المغلقين فالانتصارات حقيقية لكنها متفاوتة. يحقق أعلى الدرجات في PaperBench (93.0، متقدمًا على 90.5 لـGPT-5.6 Sol)، واتباع التعليمات (IFBench 82.8 مقابل 72.7)، واستخدام الكمبيوتر (OSWorld-Verified 86.1)، ويتفوق بفارق ضئيل على GPT-5.6 Sol في SWE-bench Pro بواقع 67.7 مقابل 64.6. وفي مواضع أخرى تنقلب الطاولة. يبقى Fable 5 متقدمًا بفارق كبير على المعيار نفسه بواقع 80.0، ويتصدر GPT-5.6 Sol معيار Terminal Bench 2.1 بـ88.8 مقابل 86.6، وفي GPQA Diamond فإن أفضل نتيجة هي 94.1 لـGPT-5.6 Sol.
| المعيار | Qwen 3.8-Max | Qwen 3.7-Max | GPT-5.6 Sol | Fable 5 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 74.5 | 88.8 | 84.6 | 84.6 |
| SWE-bench Pro | 67.7 | 60.6 | 64.6 | 80.0 | 69.2 |
| DeepSWE 1.1 | 56.6 | 21.6 | 73.0 | 70.0 | 59.0 |
| PaperBench | 93.0 | 64.8 | 90.5 | 88.8 | 80.3 |
| GPQA Diamond | 92.6 | 92.4 | 94.1 | 92.6 | 92.0 |
| IFBench | 82.8 | 79.1 | 72.7 | 63.5 | 62.2 |
النتائج كما نشرها فريق Qwen. وفقًا لحواشي الإعلان، قد تنطوي نتائج Fable 5 على آليات احتياطية.
اقرأ الصفوف وسيظهر لك النمط: يتصدر Qwen في اتباع التعليمات، وإعادة إنتاج الأوراق البحثية، واستخدام الكمبيوتر، بينما تظل هندسة البرمجيات على نطاق المستودعات والاستدلال الصعب في صالح النماذج المغلقة. كما أن خط الأساس في SWE-bench Pro هو نسخة الفريق المصححة نفسها، مع إصلاح المهام الإشكالية وإعادة تقييم كل المنافسين على المعيار المنقح. هذه التفصيلة مهمة عندما تكون الفجوة مع GPT-5.6 Sol 3.1 نقاط فقط.
نموذج بـ2.4 تريليون معامل ينشّط 95 مليار معامل لكل توكن
اللاحقة A95B هي الرقم المهم لأي شخص يستضيف النموذج. ينشّط تصميم خليط الخبراء 95 مليارًا من أصل 2.4 تريليون معامل لكل توكن، وهذا العدد النشط هو ما تحسب على أساسه تكلفة التشغيل. وهو أيضًا ما يجعل نموذجًا بهذا الحجم عمليًا خارج المختبر؛ فمعظم المعاملات تبقى خاملة. تضيف سلالة Qwen 3.5 شبكات Gated Delta Networks إلى جانب خليط الخبراء المتناثر (sparse MoE)، وهو ما ينسب إليه الفريق تحقيق استدلال عالي الإنتاجية مع حمل زمني ضئيل. يصل طول السياق إلى مليون توكن، مع ميزانيات إخراج موصى بها تبلغ 262,144 توكنًا للتفكير و131,072 توكنًا نهائيًا. ويتضمن الإصدار نفسه نموذجًا شقيقًا بـ27 مليار معامل، Qwen3.8-27B، أصغر بنحو 90 مرة.
يقع ضغط الكفاءة على محركات التشغيل. يشير الفريق إلى SGLang وvLLM أو TokenSpeed لأعباء العمل الإنتاجية، وهي المجال نفسه الذي يستهدفه عمل Aleph Alpha الأخير: فقد أبلغت مكتبة megakernel الخاصة بها عن مكاسب تصل إلى 200% في سرعة الاستدلال لنماذج MoE بصيغة FP8 تعمل عبر vLLM وSGLang. ومع فتح أوزان بهذا الحجم، فإن كفاءة الاستدلال, لا عدد المعاملات, هي التي تحدد من يمكنه استخدام النموذج فعليًا.
تحفظ بيئة التقييم خلف مكاسب الوكلاء
القفزات في أداء الوكلاء هي العنوان الأبرز: يرتفع DeepSWE 1.1 من 21.6 إلى 56.6 مقارنة بـQwen 3.7-Max، وOSWorld-Verified من 73.3 إلى 86.1، ومعدل النجاح في Agents' Last Exam من 11.8 إلى 27.0. تستحق الحواشي من الاهتمام ما تستحقه النتائج. تستخدم عمليات تشغيل Qwen في صفوف عدة بيئة Claude Code، بينما يحصل المنافسون على بيئاتهم الرسمية (GPT-5.6 Sol مع Codex، ونماذج Claude بدرجات Terminus 2 من Artificial Analysis)، وعدة معايير مطورة داخليًا: QwenSWEBench وQwenQoderBench وCoWorkBench وغيرها. وفي SkillsBench، يصرح الفريق صراحةً أن جميع النتائج من اختباراته الخاصة. أما أرقام Fable 5 فقد "تنطوي على آليات احتياطية".
هذا الإفصاح صريح بشكل غير معتاد، لكنه يظل تقييمًا يجريه البائع نفسه ضد منافسين مغلقين، على معايير يسيطر البائع عليها جزئيًا. الفجوة بين الترميز في المعايير والإنتاج الفعلي ليست جديدة: النماذج المتصدرة تتجاوز 96% في SWE-bench Verified لكنها بالكاد تصل إلى 23% على أكواد مؤسسية خاصة، كما أظهرت تغطيتنا لنسخ Pro. والأبحاث التي غطيناها حول تطور بيئات التقييم، والتي اختُبرت على Terminal-Bench 2.1 مع GPT-5.4 وClaude Opus 4.6، تطرح سؤالًا عما إذا كانت التحسينات المكتشفة عبر تكرار بيئات التقييم تصمد على مهام محجوزة. السؤال نفسه يخيم على تقدم Qwen الضئيل في SWE-bench Pro.
ما الذي يمكن للمطورين تشغيله فعليًا بأوزان مفتوحة
تم نشر معرّفي نموذج: Qwen/Qwen3.8-2.4T-A95B وQwen3.8-27B، مع إمكانية التنزيل من Hugging Face أو ModelScope. يمكن للمستخدمين المحجوبين عن Hugging Face التبديل عبر متغيرات بيئة مثل SGLANG_USE_MODELSCOPE أو VLLM_USE_MODELSCOPE. وكانت طبقة النشر تلحق بالركب: أعادت Hugging Face هندسة Inference Endpoints حول vLLM وSGLang وllama.cpp وحاويات مخصصة مع توسع تلقائي، ما يمنح نموذج MoE ذا 95 مليار معامل نشط مسار استضافة قياسيًا دون حاجة إلى حزمة تقنية مخصصة.
يوسع هذا الإصدار استراتيجية كتالوج Qwen. يمتد حضوره على Hugging Face عبر سبعة مجالات قدرة، من اللغة إلى الكلام والصورة واستدلال الوكلاء ومواءمة السلامة، وتستمر العائلة في النمو عبر إصدارات هادئة خارج المسرح الرئيسي. يعتاد الفريق على نشر بيانات التدريب وبيئات التقييم ونماذج المكافآت إلى جانب الأوزان. وفتح مصدر النموذج الرائد يغيّر قيمة هذه العادة: نموذج يحقق درجات متصدرة في PaperBench وIFBench وOSWorld-Verified يأتي الآن بأوزان مرفقة، وهو ما لم يفعله منافسوه المغلقون.
السؤال المفتوح هو ما إذا كانت هذه الانتصارات تصمد أمام تحقق طرف ثالث. تُظهر الحواشي صراحة حقيقية بشأن بيئات التقييم والاختبارات الداخلية. لكن الصفوف التي يتفوق فيها Qwen 3.8-Max على GPT-5.6 Sol قاسها الفريق الذي درّب النموذج نفسه، وأقوى فحص مستقل سابق, تحليل Artificial Analysis لـQwen 3.7-Max, يعود إلى الجيل السابق. وحتى تظهر عمليات تشغيل مستقلة، فإن أكبر إصدار بأوزان مفتوحة أطلقته علي بابا على الإطلاق يعتمد على أرقام سجلتها هي بنفسها في معظمها.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.