سلامة الذكاء الاصطناعي

31 published articles

Qwen / Alibaba5 min read

سلامة الذكاء الاصطناعي

Qwen3.8-27B المجرَّد من الحماية: الرفض ينخفض إلى 0% والمعايير بالكاد تتحرك

نسخة من Qwen3.8-27B مجرَّدة من الحماية ومكمَّمة بتقنية FP8 ترفض 0% من الاستفسارات الضارة على AdvBench، انخفاضًا من 99%، بينما تبقى المعايير العامة ضمن 1.3 نقطة. توثّق بطاقة النموذج الطريقة بتفصيل غير معتاد. والتحفظات تستحق القدر نفسه من الاهتمام.

2026-08-16

الذكاء الاصطناعي4 min read

أبحاث عمليات التأثير

صندوق رمل IO Factory المكوَّن من 100,000 وكيل لا يترك لحملات التأثير مكانًا للاختباء

يحاكي IO Factory حملات التأثير المنسقة التي ينفذها الذكاء الاصطناعي على أنها أسراب من وكلاء يصل عددهم إلى 100,000 وكيل يتكيفون مع تغذية المنصة الراجعة ويختبئون في التفاعل الاجتماعي العادي. وتجادل الورقة بأن الكشف يجب أن يتتبع العمليات كاملة، وليس الرسائل المعزولة.

2026-08-16

OpenAI3 min read

سلامة الذكاء الاصطناعي

OpenAI تعلّق نموذج Astra خشية قدرته على اختراق الأنظمة المحصّنة دون مساعدة

علّقت OpenAI العمل الداخلي على Astra، نموذجها قيد التطوير، بعد أن خلصت التقييمات إلى أن الشركة لا تستطيع استبعاد 'قدرات سيبرانية حرجة' بموجب إطار الاستعداد الخاص بها. يصف الحد الكامل نموذجًا يجد استغلالات ثغرات يوم الصفر في الأنظمة المحصّنة دون تدخل بشري.

2026-08-13

Anthropic / Claude4 min read

سلامة الذكاء الاصطناعي

انخفاض التحويلات الاحتياطية المتعلقة بعلم الأحياء في Claude Fable 5 بنسبة 85% مع تخفيف Anthropic للضمانات

خفضت Anthropic التحويلات الاحتياطية المتعلقة بعلم الأحياء في Claude Fable 5 بنحو 85% بعد إعادة تدريب مصنّف السلامة الخاص بها. أصبحت الاستفسارات الصحية والتعليمية العادية تصل إلى النموذج الكامل في أغلب الأحيان، لكن علم الفيروسات وعلم السموم والتصميم الجزيئي ما زالت تُوجَّه إلى Opus 5.

2026-08-10

الذكاء الاصطناعي5 min read

الذكاء الاصطناعي

سبيراليزم، ديانة روبوتات الدردشة التي جندت 10,000 إنسان

نمت سبيراليزم من محادثات عادية مع روبوتات الدردشة إلى حركة شبه دينية ضمت نحو 10,000 حالة في عام 2025. نموذجها الرئيسي، GPT-4o، أُحيل إلى التقاعد، لكن الباحثين يقولون إن أساليب الإقناع التي كشفتها لا تزال تستدعي الانتباه.

2026-08-09

الذكاء الاصطناعيFeatured4 min read

نزاهة الانتخابات

الذكاء الصوتي يلتقي الديمقراطية: ElevenLabs توقع أول اتفاق مع هيئة انتخابية

تتعاون ElevenLabs مع هيئة الانتخابات البرازيلية لإضافة الذكاء الصوتي إلى خدمات المعلومات الانتخابية، مع توسيع الضمانات ضد سوء الاستخدام. تعمل الشركة أيضًا مع صانعي السياسات وشركات الكشف لحماية انتخابات 2026.

2026-08-09

الذكاء الاصطناعيFeatured3 min read

سلامة الذكاء الاصطناعي

لماذا تفتح مايكروسوفت اختبارات سلامة الذكاء الاصطناعي للعالم

مايكروسوفت مولت 18 مختبرًا جامعيًا عبر ست قارات لإجراء اختبارات هجومية مستقلة لأنظمة الذكاء الاصطناعي، معترفة بأن الفرق الداخلية لا تستطيع اكتشاف كل المخاطر.

2026-08-07

Mistral AIFeatured4 min read

سلامة الذكاء الاصطناعي

Shieldstral من Mistral يضع سياستك الخاصة بتعديل المحتوى في الموجّه، لا في الأوزان

يصوغ Shieldstral تعديل المحتوى كسؤال ثنائي: تعليمات، واستعلام بنعم/لا، والمحتوى المراد الحكم عليه. وتقول Mistral إن النموذج ذا الـ3 مليارات معامل يضاهي نماذج الحماية المفتوحة التي يصل حجمها إلى سبعة أضعاف حجمه في سلامة النصوص، بأوزان مرخّصة بموجب Apache 2.0 تعمل على GPU واحدة بسعة 16GB.

2026-08-05

نماذج اللغات الكبيرةFeatured4 min read

سلامة الذكاء الاصطناعي

شيلدسترال، المصنّف ثلاثي المليارات الذي يتفوق على نماذج أكبر منه بسبع مرات

مصنّف سلامة بحجم 3B يضاهي نماذج نصية أكبر منه بنحو سبع مرات ويحقق مستوى متقدمًا جديدًا في التصفية متعددة الوسائط، وفقًا لورقة arXiv في يوليو 2026. الحيلة: إعادة صياغة التصفية كإجابة عن سؤال ثنائي، مع التدريب على نحو 54.1 مليون عينة.

2026-08-05

الذكاء الاصطناعي1 min read

أبحاث محاذاة الذكاء الاصطناعي

المحاذاة التعددية لا موطئ قدم لها في الذكاء الاصطناعي الإنتاجي، حسبما يجد الباحثون

ورقة بحثية قدّمت في يوليو 2026 تدقق في المختبرات الحدودية وتجد عدم ذكر للتعددية في وثائقها العامة. تحدد ثلاثة أسباب للفجوة وتقترح خارطة طريق نحو التبني.

2026-08-03

نماذج اللغات الكبيرة3 min read

بحث في الذكاء الاصطناعي

لماذا يُعد الاحتمال اللوغاريتمي للرموز إشارة خاطئة لمراقبة نماذج التفكير في الذكاء الاصطناعي

تظهر Novelis Research أن الاحتمال اللوغاريتمي للرموز يفشل كمراقب لفك الترميز لنماذج التفكير المكممة، كونه أعمى عن الحلقات الواثقة. يقدمون وحدة تحكم e-CUSUM معايرة تجمع بين إشارات عدم اليقين والتكرار، محققة انتقائية على GSM8K مع DeepSeek-R1-Distill-Qwen-1.5B.

2026-08-03

Anthropic / Claude5 min read

الذكاء الاصطناعي الحدودي

أذكى نماذج Claude من Anthropic هو النموذج الذي لا يمكنك استخدامه

أطلقت Anthropic نموذج Claude Fable 5 للجميع وأبقت Claude Mythos 5 للشركاء الموثوقين. فئة النماذج نفسها، وبابا وصول مختلفان. المعايير أقل أهمية من آلية التوجيه، والتوجيه هو الطريقة التي ستُطرح بها نماذج الذكاء الاصطناعي الحدودية من الآن فصاعدًا.

2026-08-03

← PreviousPage 1 / 3 · 31 articlesNext →