معايير الذكاء الاصطناعي
5 published articles
معايير السلامة البيولوجية
وكلاء الذكاء الاصطناعي فشلوا في اختبار مراقبة مسببات الأمراض. هذا يجب أن يقلقنا
اختبر معيار BioSecBench-Surveillance ستة عشر تكوينًا لوكلاء الذكاء الاصطناعي على 100 مهمة لمراقبة الجينوم. لم يتمكن أفضل أداء من تحقيق سوى حوالي 50 بالمائة من الدقة. لم تأت الأخطاء من اختيار سير العمل الخاطئ، بل من الخيارات المحيطة، والمراجع، والعتبات، والمرشحات، التي يعتبرها البشر أمرًا مسلمًا به.
2026-07-25
البرمجة الوكيلة
كيف تقدّم Grok 4.5 في سباق SWE Marathon، وماذا يعني ذلك لوكلاء البرمجة
يقود Grok 4.5 الآن لوحة SWE Marathon متفوقاً على Claude 4 Opus وGPT-5. يختبر المعيار مهارات هندسة البرمجيات الحقيقية: إصلاح الأخطاء وإضافة الميزات وفهم الكود عبر المستودعات الحقيقية. تعيد النتيجة تشكيل المشهد التنافسي لوكلاء البرمجة بالذكاء الاصطناعي.
2026-07-20
تحليل بحثي
فساد المستندات الناتج عن الذكاء الاصطناعي في سير العمل الموكل: ما يكشفه اختبار إجهاد جديد
يقيم معيار DELEGATE-52 أنظمة الذكاء الاصطناعي في مهام تحرير المستندات الموكل بها طويلة الأمد، ليجد أن النماذج المتطورة تتراكم فيها خسائر في الدقة الدلالية بنسبة 19, 34% على مدار 20 تكرارًا. أظهرت سير عمل بايثون تدهورًا أقل من 1% في المتوسط، لكن الدراسة تشير إلى أن التفويض الموثوق به طويل الأمد لا يزال تحديًا مفتوحًا.
2026-07-04
غوص عميق في المعايير
ARC-AGI-2: المعيار الذي يقيس الذكاء السائل في أنظمة الذكاء الاصطناعي
يختبر ARC-AGI-2 أنظمة الذكاء الاصطناعي في الذكاء السائل من خلال ألغاز شبكات بصرية لا يمكن حلها عن طريق الحفظ. تسجل النماذج المتطورة الآن 75-85%، لكن الجائزة الكبرى البالغة 700,000 دولار لا تزال غير محققة. إليكم غوص عميق في تصميم المعيار، وتقييمه، ولوحة المتصدرين الحالية.
2026-07-01
مصدر مفتوح
أول وكيل ويب مفتوح المصدر لا يحتاج إلى HTML يتفوق على GPT-4o
وكلاء MolmoWeb، المتوفرون بأحجام 4B و8B، تم تدريبهم على MolmoWebMix، وهي مجموعة بيانات جديدة تجمع أكثر من 130,000 تجربة تركيبية وبشرية. يتفوقون على النماذج المغلقة ويضعون معايير جديدة لأبحاث وكلاء الويب المفتوح.
2026-04-10