وكلاء الذكاء الاصطناعي
50 published articles
كوربوس ميسييه
957,253 سجلًا لا تخفي الفجوة: وكلاء الذكاء الاصطناعي يتفوقون في البرمجة لكنهم يتعثرون حيث تحتاجهم المؤسسات
كوربوس ميسييه، الذي يضم 957,253 سجلًا عبر 30 اختبارًا معياريًا، يكشف عن تقدم غير متساوٍ لوكلاء الذكاء الاصطناعي: استدعاء الدوال مشبع، البرمجة تتحسن بأسرع وتيرة، وسير العمل المؤسسي متخلف. ويظهر أيضًا أن التجميع الصارم بالنجاح الكامل يمكن أن يحجب المكاسب ويقلب ترتيب لوحات الصدارة.
2026-08-02
لعبة النظام البيئي
أخبار Grok 4.5 الأكبر قد تكون في كيفية بنائه
Grok 4.5 من xAI متاح الآن على grok.com وX وiOS وAndroid وداخل Microsoft 365 وGoogle Workspace وGitHub Copilot وCursor. النموذج، المبني ببيانات تدريب أنشأها وكلاء، يتصدر معيار SWE Marathon ويقدم ترقية للصوت.
2026-08-01
مصدر مفتوح
OpenForgeRL يدرب وكلاء الذكاء الاصطناعي دون لمس أدوات الاستدلال الخاصة بهم
OpenForgeRL يستخدم خادمًا وكيلاً وKubernetes لتدريب وكلاء الذكاء الاصطناعي دون تعديل أدوات الاستدلال الخاصة بهم. في الاختبارات، تفوق OpenForgeGUI على نماذج أكبر بعدة مرات في معايير تصفح الويب وسطح المكتب.
2026-08-01
ذكاء اصطناعي للبحث العميق
عامل البحث الجديد من BAAI لا يبحث لفترة أطول فحسب، بل يراجع واجباته بنفسه
تستخدم عوامل AREX من BAAI حلقة تحسين ذاتي متكررة تضغط سجلات البحث الطويلة، مما يتيح تحسينًا فعالًا قائمًا على التحقق. تم تدريبها باستخدام وصفة تعلم تعزيزي جديد طويل الأمد، وتتفوق على خطوط الأساس المماثلة في BrowseComp وDeepSearchQA وHLE.
2026-07-31
الاستدلال ثلاثي الأبعاد
SceneActBench: لماذا تفشل حتى أفضل نماذج VLM في الحركة ثلاثية الأبعاد
يختبر SceneActBench أحد عشر تكوينًا لـ VLM على خمس مهام ثلاثية الأبعاد في حلقة وكيل موحدة. تتراوح النتائج الإجمالية من 38.6 إلى 50.2، دون أداء ثابت لأي نموذج. يكشف المعيار عن بقعة عمياء في وكلاء الرؤية واللغة: التصرف في المشاهد الكاملة، وليس مجرد وصفها.
2026-07-31
وكلاء الواجهات الرسومية
وكيل Qwen-UI-Agent من علي بابا يسجّل نتائج أعلى على الهواتف الحقيقية مقارنة ببيئات الاختبار المعزولة
يدّعي Qwen-UI-Agent من مختبر علي بابا تونغي تحقيق نتائج رائدة في الهواتف المحمولة (97.5% على AndroidDaily) ونتائج تنافسية في استخدام الكمبيوتر مقابل Opus 4.8 وGemini 3.1 Pro وGPT-5.6 Sol. وتسجّل نتائجه على معيار الأجهزة الحقيقية أعلى من نتائجه في بيئة الاختبار المعزولة، في حين يمثّل التقدّم الجزئي البالغ 40% على OSWorld-v2 الحدّ الصادق.
2026-07-31
البحث في الأدبيات العلمية
الكيميائيون يبحثون في الأوراق العلمية؛ AskChem يجيب بـ 2.4 مليون ادعاء
يفهرس AskChem 2.4 مليون ادعاء كيميائي من 147,000 ورقة علمية، كل ادعاء مدعوم بمصدر DOI واقتباس حرفي، ويُقدَّم للعلماء ووكلاء الذكاء الاصطناعي عبر تطبيق ويب وREST وSDK وMCP. وفي AskChem-Bench، ارتفعت قابلية حل روابط DOI لقارئ GPT-5.5 من 88.3% إلى 100%.
2026-07-31
أمن الذكاء الاصطناعي للمؤسسات
مجموعة بيانات اصطناعية خفضت انتهاكات صلاحيات وكلاء الذكاء الاصطناعي بنسبة 93%
تقدم ورقة بحثية جديدة على arXiv بنية صلاحيات ديناميكية لوكلاء الذكاء الاصطناعي في المؤسسات، مدعومة بمجموعة بيانات اصطناعية تم التحقق من صحتها. أدى النهج إلى تقليل انتهاكات سقف الصلاحيات بنسبة 93% في الاختبارات، مما يوفر دفاعًا استباقيًا ضد الوكلاء المفرطي الصلاحيات.
2026-07-30
مساحة عمل Buzz مفتوحة المصدر تدمج وكيل Hermes
Buzz وHermes يتيحان لوكلاء الذكاء الاصطناعي مشاركة قناة مع زملائك في العمل
Buzz، مساحة العمل المفتوحة المصدر المبنية على Nostr، تدعم الآن ثلاث طرق لدمج Hermes، الوكيل المستقل من Nous Research. من إعداد سطح المكتب بنقرة واحدة إلى بوابة كاملة تحافظ على ذاكرة ومهارات Hermes، يوفر التكامل مرونة لاحتياجات النشر المختلفة.
2026-07-30
أبحاث الذكاء الاصطناعي
وكلاء الذكاء الاصطناعي أبقوا الذاكرة خارج النموذج. ميتيس يضعها في الداخل
ميتيس من MemTensor هو أول نموذج أولي لنماذج الذاكرة الأساسية: تاريخ مضغوط في العمود الفقري، يُقرأ عبر انتباه الذاكرة، ويُحدَّث في تمرير أمامي واحد. إنه يتحدى عصر مخازن المتجهات في ذاكرة الوكلاء. القيود معترف بها لكنها لم تُحدَّد كميًا بعد.
2026-07-30
هندسة الذكاء الاصطناعي
دليل كلود كود أصبح الآن ويكي مجتمعي، 83 نصيحة وما زاد
مستودع على جيثب يديره المجتمع يضم 83 نصيحة لكلود كود، موثقًا التحول من برمجة الـ vibe coding إلى الهندسة الوكيلية. يغطي المورد الوكلاء والأوامر والمهارات وسير العمل والتنسيق بين النماذج المختلفة.
2026-07-29
الذكاء الاصطناعي
جوجل تريد من جيميني أن يدير مشروعك الجانبي. المشكلة هي أنك لا تزال مضطرًا للقيام بالعمل
نشرت جوجل دليلًا من خمس خطوات لاستخدام جيميني لإطلاق مشروع جانبي مربح: تخطيط الأعمال، أبحاث السوق، العلامات التجارية، أتمتة اللوجستيات، والتسعير. النصيحة سليمة، لكنها تتجاوز أصعب أجزاء كسب المال، وهي أن الذكاء الاصطناعي يمكنه صياغة خطة، لكنه لا يستطيع الرد على رسائل البريد الإلكتروني للعملاء في الساعة 2 صباحًا.
2026-07-23