نماذج الذكاء الاصطناعي | NVIDIA Nemotron 3.5 Lightning
لماذا تراهن Nemotron 3.5 Lightning على أن معظم خطوات الوكلاء لا تحتاج إلى نموذج كبير
نموذج Nvidia المفتوح الجديد يعمل محليًا بثلاثة مليارات معامل نشط وسياق يصل إلى مليون توكن، وهو مصمم للوكلاء الذين يظلون قيد التشغيل. تدّعي Nvidia إنتاجية أعلى حتى 4 أضعاف وإكمال المهام أسرع بنسبة 30% مقارنة بالنماذج المفتوحة المماثلة.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-14 · قراءة 4 دقائق

طرح Nvidia لنموذج Nemotron 3.5 Lightning يتلخص في جملة واحدة: معظم العمل الذي يؤديه الوكيل لا يحتاج إلى نموذج كبير. قراءة ملف، استدعاء أداة، فرز نتيجة، إعادة محاولة خطوة فشلت. هذه هي الخطوات التي تملأ يوم الوكيل، وتعتقد Nvidia أن نموذجًا مضغوطًا يمكنه تحملها على أجهزة تمتلكها بالفعل بدلًا من محاسبتك عن كل توكن في مركز بيانات.
وصل النموذج إلى Ollama في 11 أغسطس. يضم 30 مليار معامل إجمالًا ويُفعّل 3 مليارات فقط لكل توكن، وهو تصميم هجين يعتمد على خليط الخبراء (Mixture-of-Experts) تقول الشركة إنه صُمم للوكلاء الذين يظلون قيد التشغيل: جمع السياق، استدعاء الأدوات، العمل عبر مهام متعددة الخطوات. شغّله محليًا وستبقى بياناتك على جهازك.
ثلاثة مليارات معامل نشط، ومليون توكن من الذاكرة
الرقم الذي يستحق التوقف عنده ليس الإجمالي 30 مليارًا. بل الـ3 مليارات النشطة لكل توكن مقترنة بنافذة سياق تصل إلى مليون توكن. النموذج رخيص التشغيل، وهو ما تريده للخطوات عالية الحجم، والسياق الطويل يترك مساحة لسجلات الأدوات التي تتراكم عبر الجلسات متعددة الأدوار.
تدرج Nvidia الأجهزة المستهدفة: أجهزة الكمبيوتر RTX، ومحطات العمل RTX PRO، وDGX Spark وDGX Station، بالإضافة إلى مراكز البيانات والسحابة. يحصل مستخدمو Apple silicon على إصدار مخصص بتقنية MLX: nemotron-3.5-lightning:30b-mlx. الإعداد أمر واحد: ollama run nemotron-3.5-lightning. طُوّر النموذج بالتعاون مع تحالف Nemotron Coalition ودُرّب على الأدوات التي يستخدمها المطورون بالفعل، عبر البرمجة واستدعاء الأدوات واتباع التعليمات والعمل متعدد الأدوار.
أين تبرر الطبقة المحلية وجودها
أحمال العمل المقترحة تبدو ككتالوج لأكثر الوظائف تكرارًا في عمليات الذكاء الاصطناعي. مساعدون شخصيون طويلو التشغيل يديرون البريد الإلكتروني والتقويم والحجوزات. وكلاء فرعيون للبرمجة يشغّلون الاختبارات ويبحثون في قاعدة الشيفرة ويطبّقون إعادة الهيكلة داخل الأطر التي تستخدمها الفرق بالفعل. عمليات الأمن: إثراء التنبيهات، تصنيف الحوادث، الاستعلام عن السجلات، ربط المؤشرات، وإعداد النتائج المنظمة للمحللين.
الاقتراح الأكثر إثارة للاهتمام هو النشر الهجين. يتولى Nemotron 3.5 Lightning الخطوات عالية الحجم محليًا، بينما يلتقط نموذج مستضاف أكبر الخطوات القليلة التي تحتاج إليه فعلًا. تأتي تكاملات Claude Code وOpenClaw وHermes Agent وOpenCode إلى جانب النموذج، ويعمل النمط نفسه مع النماذج التي تعمل في سحابة Ollama، بحيث يمكن للوكيل إعادة توجيه خطوة واحدة إلى نموذج أكبر دون تغيير أي شيء آخر. تكتمل الصورة بالأوزان المفتوحة ومجموعات البيانات المفتوحة: يمكن للفرق إعادة تدريب النموذج لمهمة واحدة ضيقة وتشغيل النتيجة في أي مكان من الحافة إلى مركز البيانات.
الإنتاجية هي المقياس الذي تبيعه Nvidia
في المعايير، تدّعي الشركة إنتاجية أعلى بمقدار 4 أضعاف وإكمال مهام أسرع بنسبة 30% مقارنة بالنماذج المفتوحة المماثلة، مع دقة رائدة في مهام الوكلاء والبرمجة والاستدلال. هذه أرقام Nvidia الخاصة من إعدادات اختبارها الخاصة؛ النتائج الكاملة موجودة في مدونة الإطلاق، والتحقق المستقل سيستغرق وقتًا.
المنطق وراء الأرقام أسهل في الدفاع عنه. بالنسبة لوكيل يظل قيد التشغيل، الإنتاجية هي الرقم الأهم: خطوات أكثر في الدقيقة تعني اكتمال المهام الطويلة. تحقق Nvidia ذلك عبر فك الترميز التخميني (speculative decoding) باستخدام التنبؤ متعدد التوكنات، بالإضافة إلى تقنيتي DFlash وDSpark.
حجة مألوفة، مدفوعة إلى الحافة
ليست هذه أول محاولة من Nvidia لمعالجة مشكلة تكلفة الوكلاء. يحرق الوكلاء توكنات أكثر لكل مهمة مما يحرقه سؤال وجواب بسيط، مما يرفع فواتير السحابة، وكانت إجابة Nvidia عبر الأجيال الأخيرة هي تقديم الجزء الأكبر من تلك التوكنات على أجهزة أرخص. دفع Nemotron 3 Ultra هذا المنطق من جانب السحابة: سياق مليون توكن، ووصفة ضبط دقيق مبنية للتنسيق، وحلقات تغذية راجعة بتعلم التعزيز واسترجاع السياق الطويل، ورسوم بيانية للمعايير تضعه في الربع العلوي الأيمن من دقة مقابل إنتاجية، متقدمًا على البدائل المفتوحة الموجودة في إنتاجية الوكلاء وتوليد الشيفرة واتباع التعليمات. نشرت Nvidia أيضًا مواد تجادل بأن البيانات الاصطناعية أهم من أوزان النماذج، وأن الضبط الدقيق, لا التدريب المسبق, هو الخندق التنافسي.
يحمل Nemotron 3.5 Lightning هذا النمط إلى الطبقة المحلية. تقسيم 30B/3B هو بيان حول اقتصاديات الوكلاء: معظم الخطوات التي يستهلكها الوكيل رخيصة الإنتاج، ومعظمها يمكن أن يعمل على أجهزة تمتلكها بالفعل.
لا شيء من هذا يحسم ما إذا كان الرهان سيجني ثماره. معايير البائعين نقطة بداية، وليست دليلًا. ما يوضحه الإصدار هو الاتجاه: تعامل Nvidia الطبقة المحلية كجزء من الدرجة الأولى في حزمة الوكلاء، ونموذج بثلاثة مليارات معامل نشط وذاكرة مليون توكن هو ادعاء محدد وقابل للتحقق حول كيفية عمل تلك الطبقة.
- المصدر : Why Nemotron 3.5 Lightning bets most agent steps don't need a big model — 2026-08-11
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.