الذكاء الاصطناعي مفتوح المصدر
Qwen3.8-Max يتفوق على 458 فريقًا بشريًا في 24 ساعة، وهو يعمل بمفرده
تفوق Qwen3.8-Max على 458 من أصل 526 فريقًا بشريًا في مسابقة استمرت 24 ساعة بينما كان يعمل بمفرده، وستفتح Alibaba مصدر أوزانه الأسبوع المقبل. كل رقم حتى الآن ورد من الشركة نفسها، وهذا تحديدًا هو السبب الذي يجعل ادعاءات الاستقلالية تستحق التدقيق.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-03 · قراءة 5 دقائق

أصدر فريق Qwen التابع لشركة Alibaba نموذج Qwen3.8-Max في 2 أغسطس، وهو نموذج يضم 2.4 تريليون معامل وتصفه الشركة بأنه الأقدر ضمن عائلة النماذج. ومن المقرر نشر الأوزان مفتوحة المصدر، وهي الأولى لنموذج من فئة Max، الأسبوع المقبل. لكن الخبر الحقيقي في هذا الإصدار هو مجموعة ادعاءات حول ما أنجزه النموذج دون أي مراقب بشري: إبقاء مشروع برمجي قيد التشغيل لأكثر من عشرة أيام، وإعادة إنتاج ورقة بحثية من الصفر ثم التفوق عليها، والإنهاء قبل معظم المنافسين في سباق ضم 526 فريقًا بشريًا.
تحمل هذه الادعاءات وزنًا أكبر من جدول المعايير المعتاد، لأنها تصف عملًا مستقلا متواصلًا، وهو النوع الذي يحدد ما إذا كانت نماذج اليوم مفيدة فعليًا خارج نطاق العروض التجريبية. وهي أيضًا، حتى الآن، مبنية بالكامل على إعلان الشركة عن نفسها. لا تخفي الشركة أن هذه اختباراتها الخاصة؛ فالتحقق المستقل لم يواكبها بعد. ضع هذا التوتر في الاعتبار فيما يلي.
ثلاث عمليات تشغيل دون أي مراقب
وضع فريق Qwen ثلاثة تحديات أمام النموذج، استمر كل منها أيامًا، وتضمن كل واحد استخدام الأدوات وتصحيح الذات وإعادة التخطيط. وكانت القواعد متشابهة في التحديات الثلاثة: بدأ النموذج دون أي كود برمجي ودون توجيه بشري، وكان على كل نتيجة أن تُكتسب بكتابة البرمجيات وتشغيلها.
| المهمة | مدة التشغيل | النتيجة كما أعلنها Qwen |
|---|---|---|
| بناء مشروع oh-my-cli ومنصة اختبار ذاتية التطور | تشغيل لأكثر من 10 أيام | 265 commit و127 طلب سحب و151 issue بعد حوالي 16 يومًا من التشغيل المستقل |
| إعادة إنتاج ورقة بحثية ثم تحسينها | حوالي 125 ساعة | 7,600 سطر من الكود، و33 جولة تدريب على وحدات GPU، و+2.7 نقطة مقارنة بمنهج الورقة في AIME24 |
| المنافسة في مسابقة مباشرة ضد 526 فريقًا بشريًا | 24 ساعة | التفوق على 458 فريقًا (87%)، ودقة من 0.60 إلى 0.853 |
حالة المسابقة هي ما يستحق القراءة مرتين. قرأ النموذج قواعد المسابقة، واختار نماذج لضبطها (BERT وMacBERT وRoBERTa للنصوص، وQwen2.5-VL-7B للقطات الشاشة)، ودمجها في نظام تصويت مرجح. ووجه كل واحد من مشاركاته البالغ عددها 45 جولة التدريب التالية، رافعًا الدقة من 0.60 إلى 0.853 ومتفوقًا على 458 من أصل 526 فريقًا بشريًا، أي 87 بالمئة من المشاركين. النمط الذي تروّجه الشركة ليس مجرد تشغيلة واحدة ذكية، بل حلقة مستمرة تحسّن نفسها بنفسها.
الأوزان مفتوحة المصدر تغيّر الرهان
حتى الآن، كانت فئة Max هي الجزء المغلق من تشكيلة Qwen. يكسر Qwen3.8-Max هذه القاعدة: يقول الفريق إن الأوزان ستُنشر على Hugging Face وModelScope الأسبوع المقبل، في أول إصدار مفتوح الأوزان من فئة Qwen-Max. ومع 95 مليار معامل نشط من أصل 2.4 تريليون، تمتد تسمية المصدر المفتوح الآن إلى نموذج مصمم لتشغيل وكلاء لأيام متعددة، وليس للمحادثة فحسب.
تتناسب هذه الخطوة مع استراتيجية Alibaba الأوسع. دمجت الشركة أعمالها في الذكاء الاصطناعي في وحدة أعمال واحدة بمهمة، على حد تعبيرها، «إنشاء الرموز وتسليمها وتطبيقها»، بدعم من دفعة استثمارية بقيمة 53 مليار دولار، وهي تشحن أسطولًا من النماذج بدلًا من بطل واحد. وكان Qwen3.7-Max، الذي صدر في مايو، هو النموذج الرئيسي السابق؛ وأظهرت معايير مستقلة من Artificial Analysis أنه يتفوق على المنافسين الصينيين الرائدين ويضاهي أفضل الأنظمة العالمية. Qwen3.8-Max هو الخطوة التالية على هذا الطريق، مع إضافة الأوزان مفتوحة المصدر كعامل تمييز.
التحفظ الصادق: تقريبًا كل رقم في هذا الإصدار يأتي من الفريق الذي بنى النموذج. بعض صفوف المعايير الخاصة بالنماذج المنافسة فارغة حيث لا توجد نتيجة منشورة، والأدوات المستخدمة ليست دائمًا متطابقة من صف إلى آخر. في الجدول المميز في الإصدار نفسه، أقوى نتائج Qwen3.8-Max في مواجهة النماذج الحدودية المذكورة هي 93.0 في PaperBench، متفوقًا على نتيجة GPT-5.6 Sol البالغة 90.5، و92.9 في نسخة الإبر الثماني من MRCR v2 بسياق 256K. هذه أرقام من جهة البائع، لكنها أرقام دقيقة من جهة البائع.
أطول عمليات التشغيل هي الأصعب في التحقق والأكثر لفتًا للانتباه. بعد تزويده بمساحة عمل أولية وبرنامج تقييم، أعاد النموذج تصميم مسرّع تشفير عبر حوالي 500 خطوة، خافضًا عدد البوابات المركّبة من 8,298 إلى 678 والرقاقة الموضوعة من 106 في 106 ميكرومتر إلى 46 في 46، أي انخفاض بنسبة 81 بالمئة في المساحة، مع تحقيق التوقيت عند 500 ميجاهرتز. المعالم المنشورة تُقرأ كسجل مهندس: استبدال مقسم المعامل، تقليم عرض البتات، تقليص آلة الحالة، دمج الوحدات، ضغط البوابات. وفي معيار تجارة إلكترونية محاكى على مدى 365 يومًا مبنيًا على بيانات معاملات Taobao وTmall، أنهى السباق برصيد ¥416,252، متقدمًا بنسبة 38 بالمئة على صاحب المركز الثاني.
تشغيل مستقل من طرف ثالث لجلسة استمرت عشرة أيام، مع نشر السجل الكامل للتتبع، هو ما من شأنه أن يحسم هذا النوع من الادعاءات. وقام فريق Qwen بأقرب بديل في حالة واحدة: السجل الكامل لمشروع بناء oh-my-cli متاح للعموم على GitHub، لذا يمكن التحقق من كل commit وكل طلب سحب وكل issue.
ما الذي يأتي معه
على جانب واجهة البرمجة، يدعم Qwen3.8-Max معامل reasoning_effort بثلاثة مستويات (xhigh وmedium وlow) ويبقي إخراج التفكير محفوظًا افتراضيًا. ويتصل بـClaude Code وCodex وQoder وQwen Code وOpenClaw عبر نقاط نهاية متوافقة مع OpenAI وAnthropic. وتضيف مكتبة جديدة باسم Qwen-MM-Plugins معالجة الصور والفيديو إلى أطر عمل الوكلاء الحالية، وقدّم الفريق RecreationBench، وهو معيار لإعادة بناء تطبيقات حقيقية لا تُلاحظ إلا كصناديق سوداء عبر خمس منصات.
السؤال للشهر المقبل هو ما إذا كانت الاستقلالية تصمد خارج بيئات Qwen التجريبية الخاصة. المختبرات المستقلة هي التي ستجيب على هذا السؤال. وفي غضون ذلك، يُعد هذا الإصدار مهمًا لسبب أبسط: تراهن Alibaba على أن الأوزان مفتوحة المصدر، وليس مجرد الوصول عبر واجهة برمجة التطبيقات، هي ما يلزم لوضع وكلاء مستقلين يعملون لأيام متعددة أمام العالم.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.