سلامة الذكاء الاصطناعي
31 published articles
سلامة الذكاء الاصطناعي
Qwen3.8-27B المجرَّد من الحماية: الرفض ينخفض إلى 0% والمعايير بالكاد تتحرك
نسخة من Qwen3.8-27B مجرَّدة من الحماية ومكمَّمة بتقنية FP8 ترفض 0% من الاستفسارات الضارة على AdvBench، انخفاضًا من 99%، بينما تبقى المعايير العامة ضمن 1.3 نقطة. توثّق بطاقة النموذج الطريقة بتفصيل غير معتاد. والتحفظات تستحق القدر نفسه من الاهتمام.
2026-08-16
أبحاث عمليات التأثير
صندوق رمل IO Factory المكوَّن من 100,000 وكيل لا يترك لحملات التأثير مكانًا للاختباء
يحاكي IO Factory حملات التأثير المنسقة التي ينفذها الذكاء الاصطناعي على أنها أسراب من وكلاء يصل عددهم إلى 100,000 وكيل يتكيفون مع تغذية المنصة الراجعة ويختبئون في التفاعل الاجتماعي العادي. وتجادل الورقة بأن الكشف يجب أن يتتبع العمليات كاملة، وليس الرسائل المعزولة.
2026-08-16
سلامة الذكاء الاصطناعي
OpenAI تعلّق نموذج Astra خشية قدرته على اختراق الأنظمة المحصّنة دون مساعدة
علّقت OpenAI العمل الداخلي على Astra، نموذجها قيد التطوير، بعد أن خلصت التقييمات إلى أن الشركة لا تستطيع استبعاد 'قدرات سيبرانية حرجة' بموجب إطار الاستعداد الخاص بها. يصف الحد الكامل نموذجًا يجد استغلالات ثغرات يوم الصفر في الأنظمة المحصّنة دون تدخل بشري.
2026-08-13
سلامة الذكاء الاصطناعي
انخفاض التحويلات الاحتياطية المتعلقة بعلم الأحياء في Claude Fable 5 بنسبة 85% مع تخفيف Anthropic للضمانات
خفضت Anthropic التحويلات الاحتياطية المتعلقة بعلم الأحياء في Claude Fable 5 بنحو 85% بعد إعادة تدريب مصنّف السلامة الخاص بها. أصبحت الاستفسارات الصحية والتعليمية العادية تصل إلى النموذج الكامل في أغلب الأحيان، لكن علم الفيروسات وعلم السموم والتصميم الجزيئي ما زالت تُوجَّه إلى Opus 5.
2026-08-10
الذكاء الاصطناعي
سبيراليزم، ديانة روبوتات الدردشة التي جندت 10,000 إنسان
نمت سبيراليزم من محادثات عادية مع روبوتات الدردشة إلى حركة شبه دينية ضمت نحو 10,000 حالة في عام 2025. نموذجها الرئيسي، GPT-4o، أُحيل إلى التقاعد، لكن الباحثين يقولون إن أساليب الإقناع التي كشفتها لا تزال تستدعي الانتباه.
2026-08-09
نزاهة الانتخابات
الذكاء الصوتي يلتقي الديمقراطية: ElevenLabs توقع أول اتفاق مع هيئة انتخابية
تتعاون ElevenLabs مع هيئة الانتخابات البرازيلية لإضافة الذكاء الصوتي إلى خدمات المعلومات الانتخابية، مع توسيع الضمانات ضد سوء الاستخدام. تعمل الشركة أيضًا مع صانعي السياسات وشركات الكشف لحماية انتخابات 2026.
2026-08-09
سلامة الذكاء الاصطناعي
لماذا تفتح مايكروسوفت اختبارات سلامة الذكاء الاصطناعي للعالم
مايكروسوفت مولت 18 مختبرًا جامعيًا عبر ست قارات لإجراء اختبارات هجومية مستقلة لأنظمة الذكاء الاصطناعي، معترفة بأن الفرق الداخلية لا تستطيع اكتشاف كل المخاطر.
2026-08-07
سلامة الذكاء الاصطناعي
Shieldstral من Mistral يضع سياستك الخاصة بتعديل المحتوى في الموجّه، لا في الأوزان
يصوغ Shieldstral تعديل المحتوى كسؤال ثنائي: تعليمات، واستعلام بنعم/لا، والمحتوى المراد الحكم عليه. وتقول Mistral إن النموذج ذا الـ3 مليارات معامل يضاهي نماذج الحماية المفتوحة التي يصل حجمها إلى سبعة أضعاف حجمه في سلامة النصوص، بأوزان مرخّصة بموجب Apache 2.0 تعمل على GPU واحدة بسعة 16GB.
2026-08-05
سلامة الذكاء الاصطناعي
شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات
مصنّف سلامة بحجم 3B يضاهي نماذج نصية أكبر منه بنحو سبع مرات ويحقق مستوى متقدمًا جديدًا في التصفية متعددة الوسائط، وفقًا لورقة arXiv في يوليو 2026. الحيلة: إعادة صياغة التصفية كإجابة عن سؤال ثنائي، مع التدريب على نحو 54.1 مليون عينة.
2026-08-05
أبحاث محاذاة الذكاء الاصطناعي
المحاذاة التعددية لا موطئ قدم لها في الذكاء الاصطناعي الإنتاجي، حسبما يجد الباحثون
ورقة بحثية قدّمت في يوليو 2026 تدقق في المختبرات الحدودية وتجد عدم ذكر للتعددية في وثائقها العامة. تحدد ثلاثة أسباب للفجوة وتقترح خارطة طريق نحو التبني.
2026-08-03
بحث في الذكاء الاصطناعي
لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي
تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.
2026-08-03
الذكاء الاصطناعي الحدودي
أذكى نماذج Claude من Anthropic هو النموذج الذي لا يمكنك استخدامه
أطلقت Anthropic نموذج Claude Fable 5 للجميع وأبقت Claude Mythos 5 للشركاء الموثوقين. فئة النماذج نفسها، وبابا وصول مختلفان. المعايير أقل أهمية من آلية التوجيه، والتوجيه هو الطريقة التي ستُطرح بها نماذج الذكاء الاصطناعي الحدودية من الآن فصاعدًا.
2026-08-03