تقييم الوكلاء
وكيل الذكاء الاصطناعي الخاص بك يفشل باستمرار؟ قد يكون العائق في الإطار، لا في الدماغ
PawBench، معيار مفتوح المصدر من فريق AgentScope، يقيم بشكل منهجي النماذج وإطارات الوكلاء معًا. تُظهر النتائج أن تصميم الإطار يمكن أن يُحدث فرقًا في الدرجات بأكثر من 11 نقطة للنماذج الصغيرة، مما يكشف عن نقطة عمياء في طريقة تقييم وكلاء الذكاء الاصطناعي حاليًا.
Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي
2026-07-22 · قراءة 4 دقائق

عندما يفشل وكيل ذكاء اصطناعي في إكمال مهمة متعددة الخطوات، فإن الغريزة الطبيعية هي إلقاء اللوم على النموذج. لكن معيارًا جديدًا من فريق AgentScope يشير إلى أن المشكلة الحقيقية قد تكمن في السقالة المحيطة به. the-1115-problem-when-ai-writing-challenges-become-a-test-of-editorial-integrity
PawBench، الذي تم إطلاقه اليوم كجزء من نظام OpenJudge البيئي، يقيس كيفية عمل نماذج اللغة الكبيرة والإطارات التي تنسقها معًا كوحدة واحدة. يقوم بتشغيل 9 نماذج عبر 3 إطارات على 150 مهمة منسقة، منتجًا 4,050 خلية اختبار تهدف إلى فك تشابك أين تبدأ حالات فشل الوكلاء في الواقع.
النموذج مقابل الإطار
تقوم معظم المعايير بتقييم النماذج بمعزل عن غيرها، من خلال تغذيتها بالمطالبات وتسجيل المخرجات. لكن هذه ليست الطريقة التي يتم بها نشر الوكلاء في العالم الحقيقي. في الممارسة العملية، يحدد النموذج الحد الأعلى لما يمكن للوكيل فعله، بينما يقرر الإطار ما إذا كانت هذه القدرة تترجم بشكل موثوق إلى تنفيذ ناجح للمهمة. أداة IBM مفتوحة المصدر CUGA تتجاوز التعقيدات وتذهب…
يقوم PawBench بصياغة هذا كدالة: أداء الوكيل يساوي f (النموذج، الإطار). يتضمن الإصدار v1.0 مهامًا مأخوذة من ستة معايير عالية الجودة للوكلاء: claweval، qwenclawbench، pinchbench، qwenpawbench، skillsbench، و wildclawbench. يتم وضع علامات على كل مهمة عبر خمسة أبعاد: سيناريو التطبيق، القدرة الذرية، التعقيد، طريقة الإدخال، وبيئة التشغيل.
يتم تنفيذ جميع المهام داخل صناديق رمل Docker مع إمكانية تتبع كاملة، مما يجعل من الممكن ربط درجات المعيار بسلوك التنفيذ الفعلي. تجمع النتيجة النهائية بين المقيمين الآليين، وفحوصات القواعد، والتأكيدات الفرعية، مع استخدام LLM كقاضٍ للمخرجات الأكثر دلالة. IFBench: المعيار الجديد لاختبار اتباع الذكاء الاصطناعي…
فجوات الإطار حقيقية وقابلة للقياس
النتيجة الرئيسية عبر 4,050 خلية هي أن تصميم الإطار يمكن أن يُحدث تباينًا كبيرًا في الأداء. يوضح طرفان النقيضان هذه النقطة. يُظهر Claude Opus 4.6 انتشارًا قدره 2.3 نقطة فقط عبر إطارات مختلفة. يتحول نموذج Qwen3.6-35B-A3B بمقدار 11.5 نقطة كاملة اعتمادًا فقط على الإطار.
يشير تحليل التتبع إلى ثلاثة مصادر شائعة للفشل: فقدان النموذج تتبع دليل العمل الحالي، أو سوء تقدير ما إذا كان الملف قد تم كتابته بالفعل، أو اختيار الأداة الأولى الخاطئة عندما تصبح قائمة الأدوات كبيرة جدًا. تظهر النماذج الأكبر قدرة أفضل على التعويض عن نقص السياق؛ فهي تستنتج المسارات، وتصفية قوائم الأدوات الكبيرة، وتتحقق مما إذا كانت القطع الأثرية قد تم إنتاجها بالفعل. النماذج الأصغر حجمًا أكثر هشاشة.
المغزى ليس أن النماذج الصغيرة ضعيفة. بل إنها تعتمد بشكل أكبر على هيكل الإطار. يمكن للإطار المصمم جيدًا أن يقلص الفجوة بشكل كبير.
المهارات والبحث على الويب يكشفان عن أنماط فشل جديدة
يتضمن PawBench فئتين من المهام تكشفان عن ديناميكيات فشل متميزة. الأولى هي المهام المتعلقة بالمهارات، والتي تحاكي المطورين الذين يخزنون مهارات خاصة بالمشروع مباشرة داخل مساحة العمل الخاصة بهم. عبر جميع الإطارات الثلاثة، كانت مهام المهارات باستمرار أكثر صعوبة من استخدام الأداة أو التخطيط أو الاستدلال. مينيماكس تطلق نموذج M2.7 بمهارات قوية في هندسة…
تبرز مسألتان: يجب أن يعرض الإطار المهارات بوضوح، الاسم، النطاق، والاستخدام، ويجب على النموذج أن يقرر بشكل موثوق استدعاءها. إذا انهار أي من الجانبين، فإن النموذج يتجاوز المهارة ويحاول حل المهمة باستخدام الاستدلال العام، وغالبًا ما يفشل.
تختبر مهام البحث على الويب قدرة النموذج على البحث في الويب، وجلب المحتوى، وإجراء بحث أعمق. يعيد PawBench إنشاء تجربة المطور الافتراضية، من خلال استنساخ إصدار ثابت، وإضافة مفتاح LLM، وتشغيله، دون افتراض أن كل مفتاح API للبحث قد تم تكوينه مسبقًا. أظهرت النتائج أن بعض النماذج تجاهلت ببساطة مخرجات الأدوات المعطلة، بينما وقعت نماذج أخرى في حلقات تحاول إعادة تشغيل الأدوات الفاشلة. يمكن للنماذج القوية الالتفاف حول الأدوات المفقودة؛ بينما تعتمد النماذج الأضعف على الإطار في الحفاظ على مسار البحث مستقرًا وواضحًا.
أربعة مبادئ لتصميم إطار أفضل
بناءً على نتائج المعيار، يقترح فريق AgentScope أربعة مبادئ للإطارات الفعالة. أولاً، كن صريحًا: لا يمكن للنماذج التصرف بناءً على معلومات لا تملكها. أخبر النموذج أين هو، وما هي الموارد الموجودة، وما هي المخرجات المتوقعة. لا تفترض أبدًا أن النموذج سيستنتج هذه التفاصيل.
ثانيًا، اجعل الأدوات كافية وفعالة. وفر الأدوات المهمة، وتأكد من أن الأدوات الحيوية قابلة للاستخدام بشكل افتراضي، ولكن تجنب إغراق النموذج بخيارات غير ضرورية.
ثالثًا، تحقق، ولا تثق. لا تعتمد فقط على ما يقوله النموذج. تحقق من القطع الأثرية والملفات والمخرجات ونتائج التنفيذ بدلاً من الاعتماد فقط على الإبلاغ الذاتي للوكيل.
رابعًا، ابنِ قابلية الاسترداد. العديد من حالات الفشل قابلة للاسترداد إذا وفر الإطار ملاحظات مفيدة وفرصًا لإعادة المحاولة. قدم معلومات حيوية مثل الحالة الحالية، والمتطلبات المفقودة، والقطع الأثرية الموجودة، وامنح النموذج فرصة منظمة للاسترداد. منصة مايكروسوفت الجديدة تمنح العلماء مصنعًا خاضعًا…
أهم نتيجة من PawBench ليست أي نموذج يحتل المرتبة الأولى. بل هي أن أداء الوكيل ليس خاصية للنموذج وحده. PawBench v1.0 هو مفتوح المصدر بالكامل، ويرحب الفريق بإطارات ونماذج ومهام ومساهمات جديدة من المجتمع.
- المصدر : Your ai agent's failure might not be the model's fault — 2025-10-31
أهم أخبار التقنية في 3 دقائق كل صباح
بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.