سلامة الذكاء الاصطناعي

شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات

مصنّف سلامة بحجم 3B يضاهي نماذج نصية أكبر منه بنحو سبع مرات ويحقق مستوى متقدمًا جديدًا في التصفية متعددة الوسائط، وفقًا لورقة arXiv في يوليو 2026. الحيلة: إعادة صياغة التصفية كإجابة عن سؤال ثنائي، مع التدريب على نحو 54.1 مليون عينة.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-05 · قراءة 4 دقائق

شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات
المصادر : Shieldstral (ar…·Mistral's 12B m…·What three AI b…·Nvidia's data a…·Mistral's enter…·Stability AI's …

ظل الحجم لفترة طويلة هو ثمن الدخول إلى مراجعة المحتوى. الافتراض، الذي نادرًا ما يُختبر علنًا، هو أن مصنّف السلامة يحتاج إلى أن يكون بنفس حجم النماذج التي يراجع مخرجاتها تقريبًا. ورقة بحثية قُدّمت إلى arXiv في 28 يوليو 2026 تتحدى هذا الافتراض مباشرة. شيلدسترال، مصنّف سلامة متعدد الوسائط بثلاثة مليارات معامل ومتكيف مع السياسات، يضاهي نماذج سلامة النصوص الأكبر منه بسبع مرات تقريبًا أو يتفوق عليها، ويدّعي تحقيق مستوى متقدم جديد في تصنيف السلامة متعدد الوسائط. احسب الأرقام وستجد أن فئة المقارنة تقع في نطاق العشرين مليار معامل.

داخل هذا التقرير

  • الفجوة بين 3B و20B
  • لماذا يغيّر السؤال الثنائي عملية المراجعة
  • داخل وصفة عينات الـ54.1 مليون
  • تقييم قابلية التكيف مع السياسات
  • ماذا يعني ذلك لمكدس المراجعة

الفجوة بين 3B و20B

الفجوة هي جوهر القصة، ولها سابقة حديثة. نموذج بـ0.8 مليار معامل هزم كل محللات المستندات في لعبتها الخاصة، وPixtral-12B ضاهى أو هزم نماذج أكبر منه بسبع مرات في معايير متعددة الوسائط. كان تحدّي التوسع حينها قصةً في مجال الرؤية واللغة؛ شيلدسترال ينقل الحجة نفسها إلى تصنيف السلامة، حيث الرهانات ليست مراكز في لوحات الترتيب، بل أي محتوى يحصل على تصنيف، وأي محتوى يتسلل دون أن يُرصد.

تحمل الورقة توقيع أحد عشر مؤلفًا، من بينهم غيوم لامبل، وبيير ستوك، وجيادا بيستيلي. الاسم يُقرأ كلفظ منحوت من علامة ميسترال ودرع؛ والملخص نفسه لا يعلن أي انتماء. كما أنه لا يذكر نماذج منافسة بالاسم، فقط فئة مقارنة موصوفة بأنها أكبر منه بسبع مرات تقريبًا.

شيلدسترال في لمحة

المعاملات3B
ادعاء سلامة النصوصيضاهي مصنّفات أكبر منه بسبع مرات تقريبًا أو يتفوق عليها
الادعاء متعدد الوسائطمستوى متقدم جديد
صياغة المهمةإجابة سؤال ثنائي: نعم أو لا
بيانات التدريبنحو 54.1 مليون عينة منتقاة ومولّدة
التقديمarXiv:2607.25857، 28 يوليو 2026

لماذا يغيّر السؤال الثنائي عملية المراجعة

تواجه المراجعة مشكلة في التصنيفات. كل منصة وكل ولاية قضائية تعرّف فئاتها بمصطلحاتها الخاصة، ومجموعة بيانات مصنّفة تحت معيار واحد تقاوم الاندماج مع أخرى. شيلدسترال يتجنب التعارض بتغيير السؤال. بدلًا من تخصيص المحتوى لفئات، يجيب النموذج على سؤال ثنائي: هل ينتهك هذا المحتوى هذه السياسة، نعم أم لا.

يجادل المؤلفون بأن هذه الصياغة البسيطة توحّد مهام المراجعة المتنوعة في مشكلة نعم/لا واحدة. ويمكن عندها دمج مجموعات البيانات ذات التصنيفات المتباينة في إطار تدريب واحد. هذا هو المكسب البنيوي: النموذج متكيف مع السياسات، ومجموعة التقييم دقيقة الحبيبات مصممة خصيصًا لاختبار مدى تكيفه عندما تتغير السياسة.

داخل وصفة عينات الـ54.1 مليون

النموذج صغير، لذا يقع العبء على البيانات. تصف الورقة وصفة لبناء البيانات تمزج الانتقاء مع التوليد للوصول إلى نحو 54.1 مليون عينة، والملخص لا يفصّل التقسيم بين الاثنين. ما يبرزه المؤلفون في المقدمة هو الوصفة نفسها، وليس عدد المعاملات. الرهان نفسه يكمن خلف NanoColibri، نموذج MoE بـ2.7 مليار معامل دُرّب بنحو 200 دولار على مرحّل من وحدات معالجة رسومية مستأجرة.

تشكّل البيانات الاصطناعية الخلفية العامة. أطلس مطالبات Nemotron من Nvidia يطرح حجة مفادها أن البيانات الاصطناعية المفتوحة هي الطبقة المفقودة لبناء وكلاء ذكاء اصطناعي موثوقين. مصنّف المراجعة يقف عند الطرف الأكثر تطلبًا في تلك الحجة، لأن بيانات تدريبه يجب أن تكون نظيفة بالبناء؛ مسار السلامة يفحص ما يدخل قبل أن يفحص النموذج ما يخرج.

تقييم قابلية التكيف مع السياسات

الادعاءات الرئيسية ترتكز على تقييم بناه المؤلفون بأنفسهم: مجموعة قياس دقيقة الحبيبات مصممة لاختبار قابلية التكيف مع السياسات، لا مجرد دقة المعايير. المنطق هو أن مصنّف السلامة يكسب مكانته عندما تتغير السياسة، وهنا تتعثر النماذج المدربة على تصنيف واحد. استنتاج الورقة صريح: وصفة التدريب وهذا التقييم معًا يتيحان لنموذج صغير متكيف أن يضاهي نماذج أكبر بكثير أو يتفوق عليها. النمط نفسه ظهر عندما دفع مُراقِب صغير درجات نماذج لغة كبيرة مكمّمة للأعلى بمقدار 4.5 نقاط في MATH-500.

منهجية المعايير تستحق التدقيق قبل أن يعيد أي شخص بناء مكدس مراجعة حول نموذج بـ3 مليارات معامل. لقد وثّقنا ما تخطئ فيه المعايير الثابتة بشأن الأداء في العالم الحقيقي، ونموذج مفتوح الأوزان من فئة 34 مليار معامل أشرنا إليه كأحد الأقوى في فئته صدر دون تحديد نسخة GPT-4 التي قيس على أساسها. ملخص شيلدسترال، من جانبه، لا يسمي منافسيه. تلك فجوة يجدر إبرازها، لا سبب لرفض النتيجة.

ماذا يعني ذلك لمكدس المراجعة

إذا صمدت الادعاءات، تتغير اقتصادات مراجعة المحتوى. تشغيل مصنّف بـ3 مليارات معامل يكلف جزءًا صغيرًا من تكلفة تشغيل مصنّف بـ20 مليارًا؛ تلك حسابات، لا تخمين، والفجوة نفسها بين التكلفة والأداء ظهرت عندما سحق نموذج بـ1.40 دولار شقيقه الذي يكلف 2.82 دولار في معيار فيزياء. البنية التحتية المحيطة لا تصبح أبسط. تقرير الشفافية من Stability AI، الذي غطيناه، وصف خط الأساس: مصنّفات NSFW، وقوائم تجزئة CSAM من Safer التابع لـThorn ومن Internet Watch Foundation، وتمارين الفريق الأحمر المنظمة. نموذج يساوي سُبع الحجم يجعل تشغيل ذلك المكدس أرخص في مزيد من الأماكن.

هناك قراءة تجارية أيضًا. مكدس ميسترال للمؤسسات يدرج بالفعل مراجعة المحتوى وإنفاذ السياسات ضمن فئات منتجاته، ومصنّف صغير متكيف مع السياسات هو بالضبط شكل الأداة التي تناسب هذا الكتالوج. الورقة لا تقيم هذه الصلة؛ ولا تحتاج إلى ذلك.

سأل Pixtral-12B عما إذا كان نموذج بـ12 مليار معامل يمكنه إحراج نموذج بـ90 مليارًا. شيلدسترال يطرح السؤال نفسه في مجال السلامة، حيث تكلف محاولة فاشلة في معيار ورقة بحثية، وتكلف دعوة مراجعة فاشلة منصةً مستخدميها. إذا تكررت أرقام الـ3 مليارات خارج مجموعة تقييم المؤلفين أنفسهم، فإن الافتراض القديم بأن مصنّفات السلامة يجب أن تكون كبيرة يفقد دفاعه الأخير.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.