ذكاء اصطناعي مفتوح المصدر
Muse Glimmer: وكيل Meta بـ30 مليار معامل بحجم أقل من 20 جيجابايت، والسحابة اختيارية
أصدرت ميتا نموذج Muse Glimmer مفتوح المصدر، وهو نموذج وكيل بـ 30 مليار معلمة يعمل دون اتصال على وحدة معالجة رسوم استهلاكية واحدة. التكميم يبقيه تحت 20 جيجابايت، وتوفر مسودة DFlash تسريعًا في فك التشفير يصل إلى 3.1x على RTX 5090، والأوزان متاحة على Hugging Face بموجب Apache 2.0.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-10 · قراءة 4 دقائق

ما مقدار الذكاء الاصطناعي المفيد الذي يمكنك تشغيله على جهاز تملكه؟ إجابة Meta هي Muse Glimmer، وهو نموذج وكيل بـ30 مليار معامل صدر بموجب ترخيص Apache 2.0. يعمل التكميم بدقة تقارب 4 بت على تقليص الأوزان إلى أقل من 20 جيجابايت، تاركًا مساحةً داخل وحدة معالجة رسوميات استهلاكية بسعة 24 أو 32 جيجابايت للنموذج وذاكرة التشغيل الخاصة به ومشفّر الإدراك (perception encoder) ونموذج مساعد صغير يسرّع فك الترميز. وتوجّهه Meta Superintelligence Labs لاستخدامات تشمل الوكلاء المحليين الدائمين، واستدعاء الدوال، والبرمجة المحلية، وتقييم LLM-as-a-judge، مع اتصال بالإنترنت أو بدونه.
كانت السرعة دائمًا العائق أمام النماذج المحلية. فالنموذج بـ30 مليار معامل الذي ينتج توكنًا واحدًا في كل مرة يحوّل سلاسل الاستدلال الطويلة واستدعاءات الأدوات متعددة الخطوات إلى لعبة انتظار، لذا قرنت Meta نموذج Glimmer بـDFlash، وهي شبكة مصاحبة صغيرة تقترح كتلًا كاملة من التوكنات ليتحقق منها النموذج الرئيسي بالتوازي. وقاست Meta تسريعًا لفك الترميز بمقدار 3.1x على RTX 5090، و1.8x على M5 Max، و1.5x على M4 Max، مع بقاء جودة المخرجات دون تغيير.
ما الذي يتسع في حيز 24 جيجابايت
بالدقة الكاملة، يحتاج نموذج اللغة وحده إلى أكثر من 55 جيجابايت، وهو ما يتجاوز بكثير قدرات أي وحدة معالجة رسوميات استهلاكية. وتأتي الأوزان المكمّمة بحجم أقل من 20 جيجابايت، وتقول Meta إن المساحة المتبقية تكفي لذاكرة التشغيل الخاصة بالنموذج ومشفّر الإدراك للصور والنموذج المساعد في الوقت نفسه. وتقول الشركة إن الضغط لا يؤدي إلا إلى تدهور طفيف أو معدوم في المهام الوكيلية. وفي ما يلي صورة الحجم والسرعة التي تنشرها Meta.
| الإعداد | ما تذكره Meta |
|---|---|
| الدقة الكاملة | أكثر من 55 جيجابايت، بما يتجاوز بكثير وحدات معالجة الرسوميات الاستهلاكية |
| K-Quant-Dynamic وK-Quant-17GB | نموذج اللغة أقل من 20 جيجابايت؛ وتتسع ذاكرة التخزين المؤقت KV ومشفّر الإدراك والنموذج المساعد ضمن حيز 24 أو 32 جيجابايت |
| تسريع فك الترميز مع النموذج المساعد DFlash على RTX 5090 | 3.1x |
| تسريع فك الترميز على M5 Max | 1.8x |
| تسريع فك الترميز على M4 Max | 1.5x |
مبني لوكلاء يفشلون ويعيدون المحاولة
ينعكس التدريب الوكيلي في قدرات ملموسة: استدعاءات أدوات وفق مخططات محددة، واستدلال متعدد الخطوات عبر مديات طويلة، والتعافي من الفشل، إذ يشخّص النموذج استدعاء الأداة الفاشل ويعيد المحاولة بدلًا من التوقف. ويتعامل مشفّر إدراك مخصص مع النصوص والصور المتداخلة، ما يتيح للوكيل العمل انطلاقًا من لقطات الشاشة أو الرسوم البيانية أو المستندات في منتصف المحادثة. وتتيح مستويات الاستدلال المختلفة للمطورين المفاضلة بين الجودة والسرعة، وتغطي بيانات التدريب أكثر من 100 لغة.
وعلى معايير وكيلية شاملة (end-to-end) مثل DeepSearch QA وMCP-Atlas وtau-Bench وSWE-Bench، التي تقيس إنجاز مهمة من بدايتها إلى نهايتها داخل سقالة برمجية (scaffold)، تقول Meta إن Muse Glimmer يحقق معدلات نجاح قوية لفئته من حيث الحجم. ويعمل مع أطر التنسيق مفتوحة المصدر، بما في ذلك OpenClaw.
عائلة Muse تنتقل إلى التشغيل المحلي
لم يبدأ Glimmer من الصفر. تقول Meta إنها قطّرت النموذج من مخرجات Muse Spark باستخدام تقطير اللوجيت (logit distillation)، وحافظت على مزيج بيانات مشابه لما استخدمه النموذج المعلّم، ثم أجرت تدريبًا وسيطًا على بيانات أطول وغنية بالوكلاء، وتدريبًا لاحقًا باستخدام الضبط الدقيق الخاضع للإشراف، والتقطير حسب السياسة (on-policy distillation)، والتعلم المعزز. وخضع الإصدار لإطار Meta المتقدم لتوسيع نطاق الذكاء الاصطناعي (Advanced AI Scaling Framework) قبل نشر الأوزان.
يربط ذلك Glimmer بعائلة كانت Meta تجمعها بسرعة. وMuse Spark 1.2 هو النموذج الكامن خلف Muse Code، وكيل البرمجة الذي يعمل داخل الطرفية، والذي أصدرته Meta في نسخة تجريبية (beta) لنظامي macOS وLinux، مع سجل أحداث يعيد إنتاج الأحداث بدقة ووكلاء فرعيين دائمين في الخلفية يواصلون العمل دون وجود إنسان أمام لوحة المفاتيح. يأخذ Glimmer هذا الاستدلال ويصغّره ليتناسب مع جهاز محمول قد يكون دون اتصال. وسيصل دعم llama.cpp وMLX وExecuTorch في الأيام المقبلة؛ ويستعد كل من Ollama وLM Studio وUnsloth لتيسير التثبيت المحلي. ويغطي vLLM وSGLang تقديم الخدمة على نطاق واسع، وتتوفر الخيارات المستضافة عبر Together AI وFireworks AI وOpenRouter، ويمكن للمطورين تخصيص الأوزان بشكل أكبر باستخدام TorchTitan من PyTorch. وتدرج Meta كلاً من AMD وArm وDell وIntel وNVIDIA كشركاء في العتاد. والأوزان متاحة الآن على Hugging Face.
أوزان مفتوحة، عتاد تملكه
الرهان الاستراتيجي يكمن في الترخيص. فترخيص Apache 2.0 يعني أن باستطاعة أي شخص إنشاء تفرع (fork) من Muse Glimmer أو إعادة تدريبه أو شحنه داخل منتج دون دفع أي شيء لـMeta، وهو النهج نفسه الذي تتبعه الشركة منذ سنوات في الأبحاث، ويُوجَّه الآن نحو الوكلاء. إنها مناورة مألوفة بالنسبة إلى المختبر الذي ينفق المليارات على رهان أن الأوزان المفتوحة ستنتصر. تقارن Meta النموذج بـGemma4-31B وQwen3.6-27B وتقول إنه يحقق أداءً قويًا مقارنة بنماذج من حجمه على عدة معايير مستخدمة على نطاق واسع، غير أن منشور الإطلاق لا يتضمن أي نتائج خاصة به ويحيل إلى تقرير منفصل للتفاصيل.
ليست Meta وحدها في ملاحقة الوكلاء المحليين. فقد قدمت Liquid AI طرحًا مماثلًا في أغسطس مع LFM2.5-2.6B، وهي سلسلة من 2.6 مليار معامل صُممت لتعمل في أي مكان تقريبًا، بما في ذلك المتصفح. ويستهدف Glimmer فئة أثقل من العمل الوكيلي مقارنة بالنماذج الصغيرة من Liquid، على النوع نفسه من العتاد الذي يملكه الناس بالفعل، ويأتي مع توثيق وإرشادات إعداد على مركز Meta لمطوري الذكاء الاصطناعي (dev.meta.ai). ويمتد التوجه نحو الأوزان المفتوحة أيضًا إلى الطرف الآخر من طيف الحجم، إذ تستعد Alibaba لنشر Qwen3.8-Max.
السؤال المفتوح هو التحقق. معايير Meta جاءت من Meta نفسها، وستحسم عمليات التشغيل المستقلة على وحدات معالجة الرسوميات المنزلية مدى قرب التجربة الفعلية من الأرقام المعلنة. والاتجاه واضح على أي حال: وكلاء بحجم يناسب العتاد الذي يملكه الناس بالفعل، وأوزان يمكن لأي شخص تفريعها، ومعاملة الاستدلال بوصفه مشكلة موقع بدلًا من أن يكون خيارًا افتراضيًا في السحابة.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.