العوامل المستقلة
5 published articles
الذكاء الاصطناعي مفتوح المصدر
Qwen3.8-Max يتفوق على 458 فريقًا بشريًا في 24 ساعة، وهو يعمل بمفرده
تفوق Qwen3.8-Max على 458 من أصل 526 فريقًا بشريًا في مسابقة استمرت 24 ساعة بينما كان يعمل بمفرده، وستفتح Alibaba مصدر أوزانه الأسبوع المقبل. كل رقم حتى الآن ورد من الشركة نفسها، وهذا تحديدًا هو السبب الذي يجعل ادعاءات الاستقلالية تستحق التدقيق.
2026-08-03
مقاييس الإنتاجية
المقياس الوحيد الذي لا تستطيع وكلاء البرمجة الذكية تزييفه: الساعات البشرية
قامت مختبرات Cognition ببناء أول نظام آلي لتقدير عدد ساعات العمل الهندسية البشرية التي يوفرها كل جلسة عمل لـ Devin. يصل النموذج إلى R² 0.70 ولكنه يقلل التقدير عمدًا. التحدي الأعمق: تحويل مسارات الجلسات إلى أرقام عائد استثمار قابلة للدفاع عنها لا يزال دون حل.
2026-07-15
تقرير خاص
التحول الأكثر هدوءًا في الذكاء الاصطناعي للمؤسسات هذا العام هو رهان على أن الوكلاء يعملون بشكل أفضل في مجموعات
تطلق OpenAI وكلاء مساحة العمل: عمال ذكاء اصطناعي دائمون وسحابيون يعملون عبر ChatGPT وSlack، ويتعاملون مع سير العمل متعدد الخطوات، ويشاركون السياق عبر الفرق. مجاني حتى 6 مايو 2026، ثم قائم على الاعتمادات. تحول هيكلي من GPTs إلى الذكاء الاصطناعي التنظيمي.
2026-07-11
أبحاث الذكاء الاصطناعي
لماذا يهيمن GPT-5.5 على معيار يختبر كيف يحسن الوكلاء أنفسهم
يعزل EvoPolicyGym قدرة حرجة ولكنها غير مدروسة بشكل كافٍ: قدرة الوكيل على تحسين سياسة قابلة للتنفيذ من خلال تعديلات متكررة مقيدة بردود الفعل. يكشف المعيار أن GPT-5.5 هو أقوى أداء عبر 16 بيئة، ويوفر تشخيصات على مستوى المسار تكشف كيف تخصص الوكلاء المختلفون الميزانية ويحولون ردود الفعل إلى معلمات مضبوطة.
2026-07-11
نماذج الذكاء الاصطناعي
Anthropic تطلق Claude Fable 5: نموذج من الجيل الخامس للعمل المستقل الممتد
تقدم Anthropic نموذج Claude Fable 5، وهو نموذج من الجيل الخامس يمكنه تشغيل وكلاء لأيام، ومعالجة مشاريع برمجية طموحة، وإدارة سير عمل مؤسسي معقد بأقل إشراف. يبدأ السعر من 10 دولارات لكل مليون رمز إدخال.
2026-07-01