الذكاء الاصطناعي الفيزيائي

نموذج إيدج من Nvidia بـ4 مليارات معلمة يفعل شيئًا لا تفعله معظم نماذج الرؤية واللغة الصغيرة

يحتوي Cosmos 3 Edge من Nvidia على نمذجة عالمية في 4 مليارات معلمة، ويحتل المرتبة الأولى على VANTAGE-Bench ضمن فئة حجمه. يدمج تصميمه المزدوج بين التفكير والتنبؤ بالإجراءات في الوقت الفعلي للروبوتات، ويمكن نشره على أجهزة Jetson وRTX.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-07-28 · قراءة 5 دقائق

نموذج إيدج من Nvidia بـ4 مليارات معلمة يفعل شيئًا لا تفعله معظم نماذج الرؤية واللغة الصغيرة
المصادر : Nvidia Cosmos 3…

أصدرت Nvidia اليوم نموذج Cosmos 3 Edge على Hugging Face، وهو نموذج عالمي مفتوح بـ4 مليارات معلمة مبني للأجهزة الطرفية مثل وحدات Jetson T2000 وT3000 المعلن عنها حديثًا. يهدف النموذج إلى تحقيق للروبوتات الصغيرة على الأجهزة ما تفعله إصدارات Cosmos الأكبر للذكاء الاصطناعي الفيزيائي السحابي: مساعدة الآلات على فهم ما تراه، والتنبؤ بما سيحدث بعد ذلك، والأهم من ذلك، توليد إجراءات في الوقت الفعلي.

الرقم البارز هو عدد المعلمات. عند 4 مليارات، يتنافس Cosmos 3 Edge في جزء غير مشهور نسبيًا من طيف حجم النموذج، صغير بما يكفي ليتناسب مع بطاقة RTX واحدة أو وحدة Jetson، ومع ذلك يدعي أعلى إنتاجية ودقة بين نظرائه من نفس الحجم. وتقول Nvidia إنه يحتل المرتبة الأولى على VANTAGE-Bench لتحليلات الرؤية ويضع معيارًا جديدًا لتعلم سياسات الروبوتات. هذه ليست ادعاءات غامضة: VANTAGE-Bench هو معيار عام لتحليلات الرؤية، وادعاء سياسة الروبوتات يشير إلى مهام التحكم حيث ينتج النموذج 32 إجراء لكل استدلال بتردد 15 هرتز على Jetson Thor.

محولان، عقل واحد مشترك

التصميم هو القصة. يكدس Cosmos 3 Edge برجين من المحولات، أحدهما تلقائي الانحدار والآخر انتشار، يشتركان في مجموعة مشتركة من طبقات الانتباه متعددة الوسائط لكنهما يحتفظان بطبقات تطبيع و MLP منفصلة. يعالج برج الانحدار التلقائي رموز الرؤية والنص للفهم والتفكير. يتعامل برج الانتشار مع رموز الرؤية والصوت والإجراءات للتنبؤ والتوليد. تتدفق الرموز بشكل مختلف حسب الوضع: تستخدم اللغة الانتباه السببي (كل رمز يرى فقط الرموز السابقة)، بينما تتفاعل رموز الانتشار بشكل أوسع مع السياق المتاح.

Graphique : مقارنة حجم النموذج لنماذج VLM المدمجة
Cosmos 3 Edge، بـ4 مليارات معلمة، أصغر من نماذج VLM المفتوحة المنافسة Qwen2.5-VL (7B) وLlama 3.2 Vision (11B) وفقًا للمقال.

تلك الإعدادات المزدوجة مهمة لأنها تعني أن النموذج يمكنه أولاً التفكير في مشهد، ثم توليد مخرجات، سواء كان هذا المخرجات تعليقًا نصيًا أو إطار فيديو متوقعًا أو زاوية مفصل روبوت. معظم نماذج VLM الصغيرة تقتصر على التعليق أو الأسئلة والأجوبة. لا تنتج تسلسلات إجراءات. Cosmos 3 Edge يفعل ذلك، ويفعل ذلك عن طريق رسم خرائط تجسيدات مختلفة، موضع نهاية ذراع الروبوت، الحركة الذاتية للمركبة، حالة قبضة الماسك، في تمثيل إجراءات مشترك من متجهات الترجمة والدوران وحالة التلاعب.

وضع السياسة: التنبؤ والعمل معًا

يأتي النموذج مع متغير مدرب بعد الإطلاق يسمى Cosmos 3 Edge Policy (DROID)، مُحسَّن على مجموعة بيانات DROID لمهام الالتقاط والوضع. في وضع السياسة، يتنبأ بإجراء مع نتيجته البصرية المتوقعة. تقول Nvidia إن المطورين يمكنهم استخدام مجموعة صغيرة من وحدات H100 أو DGX Station لضبط النموذج بـ4 مليارات معلمة لمهامهم الخاصة، ثم نشره على الأجهزة الطرفية.

الميزة في الأوزان المفتوحة هي أنك تمتلك النشر. العيب هو أنك مسؤول عن الحصول على زمن استجابة فوري من محول بـ4 مليارات معلمة على وحدة Jetson، وهو أمر صعب، لكن Nvidia تعرف أجهزتها جيدًا بما يكفي لإصدار إرشادات مع النموذج. كما أصدرت الشركة نقاط فحص التقطير Cosmos 3 Super 4-Step، التي تقلل خطوات الانتشار من 35، 50 إلى 4، مما يوفر استدلالًا أسرع بمقدار 25 مرة لمهام النص إلى صورة والصورة إلى فيديو. وصفة التقطير هذه هي نموذج منفصل بـ64 مليار معلمة، وليس متغير Edge بـ4 مليارات، لكنها تشير إلى نمط: تبني Nvidia مجموعة من أدوات ما بعد التدريب، وليس مجرد إسقاط نقاط فحص.

كيف يقارن

Cosmos 3 Edge ليس منافسًا مباشرًا للنماذج المغلقة الحدودية مثل GPT-4o أو Gemini، لأنه لا يحتاج إلى التعميم عبر الإنترنت بأكمله. إنه مبني لشريحة أضيق: أرضيات المصانع، المستودعات، ممرات المستشفيات، أي مكان تتعايش فيه كاميرا وذراع روبوت. المنافسة المثيرة للاهتمام هي ضد نماذج VLM المفتوحة المدمجة الأخرى التي تدعي قدرات الروبوتات، ولا سيما Qwen2.5-VL (7B، لكن يمكن تقليصه) ومختلف الضبط الدقيق لـLlama 3.2 (11B رؤية). ميزة Nvidia معمارية: التصميم المزدوج مع الانتباه متعدد الوسائط المشترك وإخراج الإجراءات الأصلي ليس شيئًا تحصل عليه من VLM عادي. معظم سياسات الروبوتات المبنية فوق VLM تربط رأس إجراء منفصل في الأعلى. Cosmos 3 Edge يدمج الإجراء في التمثيل من البداية.

المقايضة هي أنك تحتاج إلى أجهزة Nvidia لتشغيله بشكل جيد. تم تصميم النموذج صراحة لـ RTX وJetson وDGX. هذا مناسب إذا كانت مجموعتك تعمل بالفعل على Nvidia، وأقل إذا كنت تحسن لشريحة طرفية مختلفة.

ماذا يعني هذا لمجال الروبوتات

طلب باحثو الروبوتات منذ فترة طويلة نماذج عالمية مفتوحة ومدمجة يمكن تشغيلها على الأجهزة وتنتج إجراءات، وليس مجرد أوصاف. يجيب Cosmos 3 Edge على ذلك، لكنه أيضًا يحمل تكلفة عمل على المستخدم: النموذج هو أساس، وليس حلاً جاهزًا. لا تزال بحاجة إلى بيانات خاصة بالمجال، وحساب ضبط دقيق، وأجهزة روبوتية لإغلاق الحلقة. نصوص التدريب المفتوحة التي أصدرتها Nvidia بجانب النموذج تهدف إلى خفض هذا الحاجز، لكنها لا تزيله.

تبقى بعض الأسئلة المفتوحة. لم تنشر Nvidia أرقام زمن الاستجابة لوحدات Jetson T2000 أو T3000، يقول الإعلان إن النموذج يحقق تحكمًا في الوقت الفعلي بتردد 15 هرتز على Jetson Thor، لكن معظم عمليات النشر الطرفية ستعمل على الوحدات الأصغر. ترتيب VANTAGE-Bench مُبلغ ذاتيًا في الإصدار. وبينما التصميم المزدوج أنيق على الورق، ستخبر المعايير المستقلة ما إذا كانت طبقات الانتباه المشتركة ستشكل عنق زجاجة لأحد البرجين عندما يكون كلاهما نشطًا. ستحدد هذه التفاصيل ما إذا كان Cosmos 3 Edge سيصبح النموذج العالمي الطرفي الافتراضي أو يظل تصميمًا مرجعيًا واعدًا لا تنشره سوى فرق قليلة بالكامل.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.