وكلاء LLM
13 published articles
فيشر-R1 | اختبار الفرضيات
وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة
يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.
2026-08-19
وكلاء الذكاء الاصطناعي
منحت PsychoAgent وكلاء الذكاء الاصطناعي ذاكرة عاطفية. لم يجد المقيّمون أي تفوّق
يمنح PsychoAgent وكلاء نماذج اللغات الكبيرة (LLM) ذاكرة عاطفية منفصلة بحيث يمكن للآثار البارزة عاطفيًا والمحملة بالصراعات أن تتفوق على الآثار الموضوعية البحتة. في ثلاثة سيناريوهات صراعية، استرجع ذكريات حرجة للصراع أكثر من خطي الأساس معًا (0.933 مقابل 0.500 و0.667)، ومع ذلك لم يجد خمسة مقيّمين مُعَمّين أي تفوّق نوعي ذي دلالة.
2026-08-19
أبحاث الذكاء الاصطناعي
توقف عن نسخ المهارات ولصقها: حل SkillZip الخالي من التقييم للوكلاء المتضخمين
تضيف الوكلاء ذاتية التطوّر إصلاحات حتى تظهر القاعدة نفسها في فروع متعددة. يضغط SkillZip مهاراتها دون عمليات محاكاة تقييمية، عبر إيجاد أقصر تفسير بنيوي وفيّ. وضعا One-shot وZip-on-Write، وما يتركه الملخص دون إثبات.
2026-08-15
عوامل الذكاء الاصطناعي
معاملة إجراءات التشغيل القياسية كرمز برمجي: بيئة تشغيل جديدة مكدسة الصفحات تفصل بين العوامل القوية والضعيفة
تظهر أبحاث جديدة من هونغ كونغ والصين القارية أن تجميع إجراءات التشغيل القياسية في كود زائف قابل للتنفيذ وتشغيلها على آلة افتراضية مكدسة الصفحات يفصل بوضوح بين العوامل القادرة والعوامل الهشة. ينتج عن العمل قاعدة نشر دقيقة: قم بالتجميع أولاً، ثم قم بالترقيم فقط بعد التحقق من الانضباط على مستوى النموذج.
2026-08-04
وكلاء LLM
ضريبة الانحدار: لماذا قد يؤدي تحميل وكلاء LLM بالمهارات إلى نتائج عكسية
دراسة جديدة تُظهر أن إضافة المهارات الإجرائية لوكلاء LLM لا تساعد دائمًا، بل قد تؤدي إلى انحدارات، حيث تفشل المهام التي كانت تُحل بدون مهارات بعد إضافة المهارات. يحدد البحث ثلاثة أسباب ويجادل بأن الموثوقية تعتمد على التأصيل والتحقق أكثر من اعتمادها على المهارة نفسها.
2026-08-03
الذكاء الاصطناعي
توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent
يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.
2026-08-02
الذكاء الاصطناعي الصناعي
AgentRCA: تحليل السبب الجذري بدون تدريب مسبق يشرح منطقه الخاص
إطار عمل موكل بدون تدريب مسبق يُسمى AgentRCA يستخدم توأمًا رقميًا ونموذج لغوي كبير لتشخيص أعطال المصنع دون بيانات موسومة، محققًا دقة على مستوى الأنظمة الخاضعة للإشراف مع شفافية كاملة.
2026-08-01
بحث
ست كلمات قد تعيد تشكيل كيفية استكشاف وكلاء الذكاء الاصطناعي والبقاء آمنين: تعطيل، تحقق، وسيط
تقترح بنية فريق وكيل غير متجانسة جديدة فصل الاستكشاف التباعدي، وفحص السلامة في وقت التشغيل، واسترجاع المعرفة عبر المجالات إلى أدوار متخصصة. يولد المُعطل مقترحات عالية الإنتروبيا، ويطبق المُتحقق فحوصات صلبة لاستدعاءات الأدوات، ويستورد الوسيط تشبيهات خارج المجال عبر استرجاع التباين الجديد. تُجمع إخفاقات التنفيذ في رقع قيود موقعة تُسمى الندوب، مخزنة مؤقتاً للأجيال القادمة. في التقييمات، حقق الفريق اكتشاف هدف ناءٍ بنسبة 95%، وصفر انتهاكات منفذة، وتوفير بنسبة 15.1% في الرموز من الندوب، مع تخفيض التكلفة بنسبة 55.9% تحت قيود الموارد عبر تخصيص عرض النطاق الترددي القائم على الائتمان.
2026-07-30
أبحاث الذكاء الاصطناعي
يبدو تطور الحزام مثيرًا للإعجاب حتى تختبره على مهام غير مطروقة
من المفترض أن يجعل التطور التلقائي للحزام وكلاء LLM أفضل، لكن ورقة بحثية جديدة تجادل بأن العديد من المكاسب المبلغ عنها قد تكون من الإفراط في التجهيز على مجموعة الاختبار العامة. في التجارب، طابقت طرق توسيع نطاق وقت الاختبار البسيطة التطور أو تفوقت عليه، وأظهرت الأحزمة المتطورة تعميمًا محدودًا للمهام غير المطروقة.
2026-07-27
بحث
فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي
SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.
2026-07-25
الاستدلال طويل الأفق
إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق
PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.
2026-07-24
أبحاث الذكاء الاصطناعي
الحيلة المزعجة التي تمنع انهيار وكلاء LLM في الإنتاج
وكلاء LLM الحاليون ينهارون تحت عشوائية العالم الحقيقي. يعرضهم NoisyAgent لضوضاء محكومة أثناء التدريب، مما يحسن المتانة والأداء العام في المعايير. تشير الورقة إلى أن المجال كان يعاني من الإفراط في التكيف مع الظروف المثالية.
2026-07-17