أبحاث التوافق
2 published articles
Qwen / Alibaba5 min read
سلامة الذكاء الاصطناعي
Qwen3.8-27B المجرَّد من الحماية: الرفض ينخفض إلى 0% والمعايير بالكاد تتحرك
نسخة من Qwen3.8-27B مجرَّدة من الحماية ومكمَّمة بتقنية FP8 ترفض 0% من الاستفسارات الضارة على AdvBench، انخفاضًا من 99%، بينما تبقى المعايير العامة ضمن 1.3 نقطة. توثّق بطاقة النموذج الطريقة بتفصيل غير معتاد. والتحفظات تستحق القدر نفسه من الاهتمام.
2026-08-16
نماذج اللغات الكبيرة4 min read
أبحاث سلامة الذكاء الاصطناعي
نماذج الذكاء الاصطناعي لا تستطيع التوقف عن التفكير بصوت عالٍ. هذه أخبار جيدة وكابوس للسلامة في آن واحد.
كلود سونيت 4.5 يمكنه التحكم في سلسلة تفكيره بنسبة 2.7% فقط من الوقت، مقابل 61.9% للمخرجات النهائية. تثير الفجوة أسئلة مفتوحة حول متانة مراقبة سلسلة التفكير كآلية سلامة، ولا أحد يعرف لماذا توجد.
2026-03-09