وكلاء LLM
8 published articles
الذكاء الاصطناعي
توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent
يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.
2026-08-02
الذكاء الاصطناعي الصناعي
AgentRCA: تحليل السبب الجذري بدون تدريب مسبق يشرح منطقه الخاص
إطار عمل موكل بدون تدريب مسبق يُسمى AgentRCA يستخدم توأمًا رقميًا ونموذج لغوي كبير لتشخيص أعطال المصنع دون بيانات موسومة، محققًا دقة على مستوى الأنظمة الخاضعة للإشراف مع شفافية كاملة.
2026-08-01
بحث
ست كلمات قد تعيد تشكيل كيفية استكشاف وكلاء الذكاء الاصطناعي والبقاء آمنين: تعطيل، تحقق، وسيط
تقترح بنية فريق وكيل غير متجانسة جديدة فصل الاستكشاف التباعدي، وفحص السلامة في وقت التشغيل، واسترجاع المعرفة عبر المجالات إلى أدوار متخصصة. يولد المُعطل مقترحات عالية الإنتروبيا، ويطبق المُتحقق فحوصات صلبة لاستدعاءات الأدوات، ويستورد الوسيط تشبيهات خارج المجال عبر استرجاع التباين الجديد. تُجمع إخفاقات التنفيذ في رقع قيود موقعة تُسمى الندوب، مخزنة مؤقتاً للأجيال القادمة. في التقييمات، حقق الفريق اكتشاف هدف ناءٍ بنسبة 95%، وصفر انتهاكات منفذة، وتوفير بنسبة 15.1% في الرموز من الندوب، مع تخفيض التكلفة بنسبة 55.9% تحت قيود الموارد عبر تخصيص عرض النطاق الترددي القائم على الائتمان.
2026-07-30
أبحاث الذكاء الاصطناعي
يبدو تطور الحزام مثيرًا للإعجاب حتى تختبره على مهام غير مطروقة
من المفترض أن يجعل التطور التلقائي للحزام وكلاء LLM أفضل، لكن ورقة بحثية جديدة تجادل بأن العديد من المكاسب المبلغ عنها قد تكون من الإفراط في التجهيز على مجموعة الاختبار العامة. في التجارب، طابقت طرق توسيع نطاق وقت الاختبار البسيطة التطور أو تفوقت عليه، وأظهرت الأحزمة المتطورة تعميمًا محدودًا للمهام غير المطروقة.
2026-07-27
بحث
فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي
SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.
2026-07-25
الاستدلال طويل الأفق
إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق
PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.
2026-07-24
أبحاث الذكاء الاصطناعي
الحيلة المزعجة التي تمنع انهيار وكلاء LLM في الإنتاج
وكلاء LLM الحاليون ينهارون تحت عشوائية العالم الحقيقي. يعرضهم NoisyAgent لضوضاء محكومة أثناء التدريب، مما يحسن المتانة والأداء العام في المعايير. تشير الورقة إلى أن المجال كان يعاني من الإفراط في التكيف مع الظروف المثالية.
2026-07-17
أبحاث الذكاء الاصطناعي
عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.
SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.
2026-07-06