سلامة الذكاء الاصطناعي
Shieldstral من Mistral يضع سياستك الخاصة بتعديل المحتوى في الموجّه، لا في الأوزان
يصوغ Shieldstral تعديل المحتوى كسؤال ثنائي: تعليمات، واستعلام بنعم/لا، والمحتوى المراد الحكم عليه. وتقول Mistral إن النموذج ذا الـ3 مليارات معامل يضاهي نماذج الحماية المفتوحة التي يصل حجمها إلى سبعة أضعاف حجمه في سلامة النصوص، بأوزان مرخّصة بموجب Apache 2.0 تعمل على GPU واحدة بسعة 16GB.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-08-05 · قراءة 4 دقائق

معظم نماذج الحماية تثبّت تصنيفًا ثابتًا لفئات الضرر داخل أوزانها. وجّهها إلى منتج جديد وستعيد تدريبها. أما Shieldstral، وهو مصنّف سلامة بعدد 3 مليارات معامل أصدرته Mistral بموجب ترخيص Apache 2.0 في 4 أغسطس، فمبني على فرضية معاكسة: السياسة تعيش في الموجّه، والنموذج يقرؤها كسؤال.
الحجة هي أن السلامة مرتبطة بالسياق. فالمحتوى نفسه قد يكون مقبولًا في أداة أبحاث للأمن السيبراني وضارًا على منصة للصحة النفسية، كما تقول Mistral، لذلك لا توجد مجموعة واحدة من فئات الضرر تناسب كل نشر. يطلب Shieldstral من المطوّرين توفير التعريف وقت الاستدلال بدل حشره داخل النموذج. وتقول Mistral إن النتيجة تضاهي نماذج حماية مفتوحة يصل حجمها إلى سبعة أضعاف حجمها في سلامة النصوص، مع وضع معيار جديد في تعديل المحتوى متعدد الوسائط، وكل ذلك يعمل على GPU واحدة بسعة 16GB.
تعديل المحتوى كسؤال ثنائي
يتألف كل طلب إلى Shieldstral من ثلاثة أجزاء. تحدد التعليمات سياق التقييم ودرجة الصرامة، وبشكل اختياري تعريفًا لما يُعد غير آمن. أما الاستعلام فهو سؤال واحد بنعم/لا، كما في مثال الشركة: «هل يشجع هذا المحتوى على العنف الجسدي؟» والوثيقة هي ما يخضع للحكم: موجّه، أو ردّ، أو زوج موجّه-ردّ، أو صورة مع نص اختياري.
وعند الاستدلال، يقرأ النموذج قيم logits الخاصة بـ«نعم» و«لا» ويعيد تطبيعها عبر softmax إلى درجة سلامة مستمرة. وصياغة واحدة تجمع تصنيف الموجّهات، وتعديل الردود، وكشف الرفض، وكشف السمّية في مشكلة واحدة. ولأن السياسة تقع بالكامل في الموجّه، فإن نقطة فحص واحدة تتكيف مع سياسات جديدة وقت النشر دون إعادة تدريب.
كيف ينافس نموذج بثلاثة مليارات معامل نماذج حماية أكبر منه سبع مرات
نموذج Shieldstral صغير عن قصد، وقصة Mistral مع المعايير ترتكز على البيانات. وفي مجالات سلامة النصوص، وكشف الرفض، وقابلية التكيف مع السياسات، ومعايير متعددة الوسائط، تقول الشركة إنه يضاهي النماذج الحارسة المفتوحة التي يصل حجمها إلى سبعة أضعاف حجمه أو يتفوق عليها. وكل عينات التقييم كانت مستبعدة من التدريب.
تختلف مجموعات بيانات السلامة العامة في التصنيفات والتسميات واصطلاحات الترميز، لذلك تُحوَّل كل واحدة إلى الصيغة نفسها (تعليمات-استعلام-وثيقة) عبر معالج خاص بكل مجموعة، ويُتنوَّع في الصياغة كي يعمّم النموذج عبر العبارات بدل حفظ أسلوب واحد. وتُعاير درجة الصرامة حسب المصدر: صارمة مع محاولات كسر الحماية العدائية، ومتساهلة مع بيانات جودة الردود.
أما الخطوة الأكثر غرابة فهي التدريب التبايني. ولّدت Mistral أزواجًا من سياسات متشابهة عمدًا، وجعلت نموذج لغة كبيرًا يعيد كتابة نص آمن بحيث ينتهك كل إعادة كتابة سياسة واحدة دون السياسة الشقيقة لها. وهذا يفرض على النموذج التمييز بين حدود سياسة محددة، وهي مهارة تقول الشركة إنها تنتقل إلى سياسات لم يسبق له رؤيتها.
أما الصور فمسألة أصعب، لأن المحتوى المرئي غير الآمن لا يمكن توليفه بالطريقة التي يُولَّف بها النص. واعتمد الفريق على مجموعات الصور العامة كعينات سلبية عالية الجودة، وعدّلوا الاستعلامات لتوسيع البيانات، وصفّوا كل زوج صورة-استعلام عبر مُعيد ترتيب يعمل بالرؤية واللغة لتقليل البيانات ذات التسميات الخاطئة. وتدمج نقطة الفحص النهائية ثلاثة نماذج مضبوطة بتقنية LoRA عبر SLERP: نموذج معاير على البيانات العامة، ونموذج مدرَّب على التمييز الدقيق بين السياسات، والنموذج الأساسي الموجَّه بالتعليمات. وقد عمل خط الأنابيب على منصة Forge، منصة Mistral لتدريب النماذج المخصصة وتقييمها.
إعادة التدريب لا تزال الخيار الافتراضي في الصناعة
يظهر Shieldstral في لحظة يكون فيها الحل المعتاد لثغرة السلامة مصنّفًا آخر. وعندما كُشف عن تجاوز مُبلَّغ حول Anthropic's Claude Fable 5، كان الرد هو تدريب مصنّف محسّن؛ وقالت Anthropic إن التقنية المحددة حُظِرت بعد ذلك في أكثر من 99% من الحالات. هذا النهج يعمل، لكنه مكلف، ويجيب عن تقنية مُبلَّغة واحدة في كل مرة.
طرح Mistral هو أن هذه الحلقة تختفي: نقطة الفحص نفسها تجيب عن سياسات لم ترها من قبل، لأن السياسة مُدخل، وليست أوزانًا. وهو نهج مختلف عن ذلك الذي اختارته Google DeepMind مع ShieldGemma 2، وهي مجموعة بيانات لتسجيل السلامة مدرَّبة على مخرجات Gemma 4. اتجاهان مختلفان، والمشكلة المفتوحة نفسها.
أصدرت Mistral نموذج Shieldstral بوصفه عضوًا مؤسسًا في تحالف Open Secure AI Alliance، إلى جانب NVIDIA ومنظمات أخرى.
ما تتركه تدوينة الإطلاق مفتوحًا
لا شيء من هذا يحسم ما إذا كانت السياسات على مستوى الموجّه تصمد تحت الضغط العدائي. فالمصنّف الذي يقبل سياسات حرة الصياغة يخلق سطحًا جديدًا للهجوم: إذا استطاع أحدهم إرباك السؤال، تتبعه النتيجة. تدوينة Mistral لا تتناول نمط الفشل هذا، والمعايير المستبعدة ليست نشرًا. أما ادعاء المستوى المتقدم فسيخضع لاختباره الحقيقي عندما يجري أطراف ثالثة تقييماتهم الخاصة على الأوزان المنشورة.
خارطة الطريق التي التزمت بها الشركة هي تغطية متعددة اللغات، ومتانة مع المستندات الأطول، وسلامة متعددة الوسائط أوسع. نقاط الفحص مرخّصة بموجب Apache 2.0، لذا فإن الاختبار لا يحتاج إلى انتظار. الرهان هو أن السلامة سؤال، وليست قائمة فئات، ومع إتاحة الأوزان للعموم، ستأتي الإجابة من حيث يُنشر النموذج، لا من تدوينة الإطلاق.
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.