الذكاء الاصطناعي

نموذج مايكروسوفت للصور بـ4 مليارات معامل يعمل على شريحة A100 واحدة ويتحدى أنظمة 30 مليار معامل

Mage-Flow من مايكروسوفت هو نموذج مدمج لتوليد وتحرير الصور بـ4 مليارات معامل ينافس أنظمة مفتوحة أكبر مثل Qwen-Image وFLUX.2 بينما يعمل على شريحة A100 واحدة بسرعات تفاعلية. ابتكاره الرئيسي هو أداة ترميز خفيفة الوزن تقلل تكاليف الترميز بـ12 مرة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-26 · قراءة 4 دقائق

نموذج مايكروسوفت للصور بـ4 مليارات معامل يعمل على شريحة A100 واحدة ويتحدى أنظمة 30 مليار معامل
المصادر : Mage-Flow: An E…·Hugging Face co…

أصبحت نماذج توليد الصور أثقل عامًا بعد عام، حيث تقترب الأنظمة المتطورة من 30 أو 40 مليار معامل. لكن ورقة بحثية جديدة من أبحاث مايكروسوفت تشير إلى أن الأكبر ليس دائمًا الأفضل.

Mage-Flow، وهي حزمة مكونة من 4 مليارات معامل لتوليد الصور من النص وتحرير الصور القائم على التعليمات، تنافس أو تتفوق على أنظمة مفتوحة أكبر بكثير بما في ذلك Qwen-Image (20 مليار معامل)، وZ-Image (6 مليار معامل)، وFLUX.2 (32 مليار معامل)، وFireRed-Image-Edit (20 مليار معامل)، وفقًا للورقة المنشورة على arXiv. يعمل النموذج على شريحة NVIDIA A100 واحدة بسرعات تفاعلية: 0.59 ثانية لكل صورة بدقة 1024×1024 للنسخة Turbo، أو 1.02 ثانية لعملية تحرير.

هذا النوع من الكفاءة ممكن لأن الفريق في أبحاث مايكروسوفت آسيا والمتعاونين معه أعادوا تصميم أداة الترميز، وليس فقط الهيكل الأساسي. والنتيجة هي نموذج لا يتطلب شرائح متعددة أو إعدادات استدلال باهظة الثمن لإنتاج صور عالية الدقة.

أداة الترميز التي تغير عنق الزجاجة

معظم مولدات الانتشار تستخدم التشفير التلقائي المتغير (VAE) لضغط الصور إلى مساحة كامنة، ثم فك تشفير تلك المسافات الكامنة إلى بكسلات. غالبًا ما يكون VAE هو عنق الزجاجة عند الدقة العالية، فهو يتطلب عمليات حسابية كثيرة لكل بكسل، ويستهلك التشفير وفك التشفير وقت الاستدلال والذاكرة.

رسم بياني : أحجام معلمات النموذج (بالمليارات)
نموذج Mage-Flow ذو 4 مليارات معلمة يُقارَن بأنظمة مفتوحة أكبر بكثير منها: Qwen-Image (20B) وZ-Image (6B) وFLUX.2 (32B) وFireRed-Image-Edit (20B) وفقًا للورقة.

Mage-VAE، أداة الترميز المخصصة في الورقة، تستخدم تشفيرًا وفك تشفير على نمط الانتشار بخطوة واحدة مع تقنية تسمى تنظيم المرساة الكامنة. يذكر المؤلفون أنها تضاهي دقة إعادة البناء لـ FLUX.2-VAE بينما تستخدم حوالي 12 مرة أقل من عمليات الضرب والتراكم (MACs) للتشفير و22 مرة أقل لفك التشفير. هذا يزيل فعليًا VAE كعامل مقيد عند توليد صور عالية الدقة.

هذا يعني أن نقطة تفتيش واحدة لـ Mage-Flow يمكنها التعامل مع درجات دقة من 512 إلى 2048 بكسل على أي نسبة عرض، بما في ذلك التنسيقات المتطرفة مثل 512×2048 أو 2048×512، دون الحاجة إلى نماذج منفصلة لدرجات دقة مختلفة.

التصميم المشترك على مستوى النظام

تجمع الحزمة بين Mage-VAE ومحول انتشار متعدد الوسائط بدقة أصلية (NR-MMDiT) بـ4 مليارات معامل مدرب بمطابقة التدفق المصححة. يقول المؤلفون إن التصميم المشترك على مستوى النظام، التعبئة بدقة أصلية مع FlashAttention، والتضمينات الموضعية ذات المحورين المستندة إلى RoPE لكل عينة، ونواة CUDA المدمجة، يحقق إنتاجية تدريب أسرع بحوالي 2.5 مرة مقارنة بالتطبيقات القياسية. التوجيه الخالي من المصنف يدير كلا الفرعين المشروط وغير المشروط في تمرير أمامي معبأ واحد.

تأتي العائلة بثلاثة متغيرات لكل مهمة: Base، وRL-aligned (الذي يستخدم تقنية Diffusion-NFT لتحسين اتباع المطالبات وعرض النص)، ونماذج Turbo ذات 4 خطوات مقطرة بالتوجيه الإدراكي العدائي للاستدلال منخفض الكمون. الذروة في الذاكرة حوالي 18، 20 جيجابايت، وهي الأدنى بين الأنظمة المماثلة المذكورة في الورقة.

الأداء والمعايير

على المعايير القياسية، تصل متغيرات Base وRL من Mage-Flow إلى نتائج تنافسية مقابل نماذج أكبر بكثير. الورقة لا تدعي التفوق المطلق على كل مقياس، والمعايير التي تقدمها هي أكاديمية قياسية (FID، CLIP score، إلخ) بدلاً من مجموعة خاصة. سيكون الاختبار المستقل ضروريًا للتحقق من الادعاءات، لكن الأرقام التي يقدمها المؤلفون تضع النموذج بـ4 مليارات معامل في نفس مستوى الأنظمة الأكبر منه بـ5 إلى 8 مرات.

المتغير الخاص بالتحرير، Mage-Flow-Edit، يدعم تحريرات المحتوى الدلالية، وتحولات المظهر، واستعادة الصور، والمخرجات الواعية بالهيكل ضمن بنية موحدة واحدة مكيفة بالصورة والنص.

أصدرت مايكروسوفت النماذج على Hugging Face، بما في ذلك متغيرات Turbo. الورقة متاحة على arXiv، على الرغم من أن المؤلفين لا يذكرون ترخيص مفتوح المصدر للكود أو الأوزان خارج صفحة توزيع Hugging Face.

المقايضات والأسئلة المفتوحة

للكفاءة ثمن، والورقة لا تزال تطرح أسئلة. نماذج Turbo تستبدل الخطوات بالكمون، مما قد يقلل الجودة في الحالات الحدودية، يلاحظ المؤلفون أن التوجيه الإدراكي يساعد لكنه لا يسد الفجوة تمامًا مع متغير Base متعدد الخطوات في كل معيار. مرحلة المحاذاة RL تستخدم نموذج مكافأة مدرب خصيصًا لهذه المهمة، والورقة لا تفصل كيف يعمم نموذج المكافأة هذا على المطالبات خارج التوزيع.

مع ذلك، الاتجاه مفيد. إذا صمد تصميم أداة الترميز تحت التحقق المستقل، فإنه يفتح طريقًا لتوليد صور عالية الدقة على الأجهزة الاستهلاكية أو المتوسطة. هذا أكثر أهمية من عدد المعاملات.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.