معايير أداء
22 published articles
الدفاع الإلكتروني
نموذج Fugu-Cyber من Sakana AI يحقق 86.9% في معايير الأمن لكنه يرى أن النماذج الخام ليست الحل
أصدرت Sakana AI نموذج Fugu-Cyber، وهو نموذج تنسيق متعدّد الوكلاء يطابق النماذج الإلكترونية الحدودية على المعايير. وتجادل الشركة بأن الوصول إلى النموذج الخام وحده لا يمكنه إصلاح أمن المؤسسات دون خبرة بشرية وسير عمل تحقق.
2026-07-21
أسس الذكاء الاصطناعي
لماذا لا تستطيع الذكاء الاصطناعي تفسير نفسها بعد؟ إطار للتفكير في الصرامة العلمية
تقدم ورقة بحثية من جوجل ديب مايند إطارًا ثلاثي الأجزاء للتفكير في الصرامة في الذكاء الاصطناعي: المفاهيمية، والمعرفية، والتشغيلية. وتجادل بأن التقدم السريع للتعلم العميق جاء من إعطاء الأولوية للتكرار القائم على الأداء على الفهم العلمي، وأن سد الفجوات سيتطلب أكثر من مجرد معايير أفضل.
2026-07-20
الذكاء الاصطناعي المحلي
مفارقة النموذج غير الخاضع للرقابة: رفض أقل، سلامة أقل، ولماذا لا تزال الذكاء الاصطناعي المحلي مهمًا
اختبار خمسة نماذج لغوية كبيرة غير خاضعة للرقابة تُدار محليًا يُظهر أن عملية 'الإبادة' تقلل الرفض المفرط من 44% إلى الصفر تقريبًا دون التأثير على الاستدلال، لكن نفس التعديل ينهار رفض السلامة من 41.5% إلى 9.5%، لأن كلاهما يعتمد على نفس الاتجاه الداخلي. السبب الحقيقي لتشغيل نموذج غير خاضع للرقابة قد لا يكون ما تعتقده.
2026-07-19
تحليل
أين تتفوق Kimi K3 على النماذج الرائدة: نظرة معيارية على النموذج المفتوح ذي 2.8 تريليون معامل
نموذج Kimi K3 المفتوح ذو 2.8 تريليون معامل من Moonshot AI يتخلف عن النماذج الملكية الرائدة في معظم المعايير الواسعة، لكنه يتصدر في SWE Marathon وTerminal-Bench 2.1 وBrowseComp وغيرها. يكشف الجدول التفصيلي أين تؤتي ثمار رهاناته المعمارية على KDA وStable LatentMoE.
2026-07-17
الذكاء الاصطناعي
ما يكشفه إنكلينج عن خط التقسيم الجديد في سوق النماذج مفتوحة المصدر
إنكلينج هو أول نموذج مفتوح متاح يقترب من تريليون معامل مع دعم أصلي للصوت والصورة والنص إلى جانب نافذة سياق بطاقة مليون رمز ومتغير كمي NVFP4. نتائج المعايير الأولية قوية، لكن القصة الأكثر دلالة هي كيف تحول النظام البيئي مفتوح المصدر من وكيل ملاحق إلى منافسة نشطة على الحدود، وأين يتناسب إنكلينج مع هذه الخريطة الجديدة.
2026-07-15
الذكاء الاصطناعي
سونيت 4.6 جعلت أوبس تبدو باهظة الثمن. هذا يغير كل شيء.
نموذج كلود سونيت 4.6 من أنثروبيك يضاهي أو يتفوق على أداء فئة أوبس في المعايير الرئيسية مع الحفاظ على نفس تسعير سونيت 4.5. تشير بيانات تفضيل المطورين المبكرة وشهادات العملاء إلى أن النموذج يحل بالفعل محل البدائل الأكثر تكلفة لمهام الوكيل والبرمجة في العالم الحقيقي.
2026-07-14
الذكاء الاصطناعي التوليدي
CO2Jump من Google تزاوج بين توليد النص والصورة في مسار واحد يصحح نفسه أثناء التنفيذ
تقدم Google CO2Jump، وهو مُجمّع بدون تدريب للتوليد المشترك للنص والصورة. يستخدم عملية قفز ماركوف ذاتية التصحيح حيث توجه نتائج الثقة لكل وسيط تحديثات الآخر في الوقت الفعلي، لإنتاج مخرجات متعددة الوسائط متماسكة في مسار واحد. تأتي الطريقة أيضًا مع ثلاث مجموعات بيانات معيارية جديدة لتقييم التوليد المشترك.
2026-07-14
إطلاق نموذج ذكاء اصطناعي
أنثروبيك تطلق كلاود سونيت 5: نموذج أكثر فاعلية بسعر تنافسي
تصدر أنثروبيك كلاود سونيت 5، نموذج يقلص الفجوة مع نماذج أوبوس في المهام الفاعلة مثل البرمجة واستخدام الأدوات والاستدلال. بسعر تنافسي، يُطلق اليوم عبر جميع الخطط وواجهة كلاود API.
2026-07-10
الذكاء الاصطناعي
Kimi K2.7 Code أسرع وأرخص. لكن البرمجة مفتوحة المصدر اصطدمت بحائط يسمى GPT-5.5.
يحقق Kimi K2.7 Code من Moonshot AI مكاسب كبيرة في مهام البرمجة طويلة المدى مع تقليل هدر التوكنات بنسبة 30%. ومع ذلك، لا يزال كل من GPT-5.5 وClaude Opus 4.8 في الصدارة على المقاييس الرئيسية، مما يسلط الضوء على المقايضات الواقعية لقرارات المصدر المفتوح.
2026-07-09
تحليل مخطوطة حديثة
ما تخبرنا به الورقة البحثية 2606.23050 (عمرها 5 أيام) عن مستقبل الذكاء الاصطناعي
مخطوطة من 33 صفحة، الورقة 2606.23050، صدرت قبل خمسة أيام فقط، وتُشكل إسهامًا جادًا في أبحاث الذكاء الاصطناعي. تشرح هذه المقالة منهجيتها، والنتائج الرئيسية، وما تشير إليه لمسار التعلم الآلي ومعالجة اللغة الطبيعية.
2026-07-07