وكلاء LLM

8 published articles

نماذج اللغات الكبيرة3 min read

الذكاء الاصطناعي

توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent

يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.

2026-08-02

وكلاء الذكاء الاصطناعي3 min read

الذكاء الاصطناعي الصناعي

AgentRCA: تحليل السبب الجذري بدون تدريب مسبق يشرح منطقه الخاص

إطار عمل موكل بدون تدريب مسبق يُسمى AgentRCA يستخدم توأمًا رقميًا ونموذج لغوي كبير لتشخيص أعطال المصنع دون بيانات موسومة، محققًا دقة على مستوى الأنظمة الخاضعة للإشراف مع شفافية كاملة.

2026-08-01

الذكاء الاصطناعي5 min read

بحث

ست كلمات قد تعيد تشكيل كيفية استكشاف وكلاء الذكاء الاصطناعي والبقاء آمنين: تعطيل، تحقق، وسيط

تقترح بنية فريق وكيل غير متجانسة جديدة فصل الاستكشاف التباعدي، وفحص السلامة في وقت التشغيل، واسترجاع المعرفة عبر المجالات إلى أدوار متخصصة. يولد المُعطل مقترحات عالية الإنتروبيا، ويطبق المُتحقق فحوصات صلبة لاستدعاءات الأدوات، ويستورد الوسيط تشبيهات خارج المجال عبر استرجاع التباين الجديد. تُجمع إخفاقات التنفيذ في رقع قيود موقعة تُسمى الندوب، مخزنة مؤقتاً للأجيال القادمة. في التقييمات، حقق الفريق اكتشاف هدف ناءٍ بنسبة 95%، وصفر انتهاكات منفذة، وتوفير بنسبة 15.1% في الرموز من الندوب، مع تخفيض التكلفة بنسبة 55.9% تحت قيود الموارد عبر تخصيص عرض النطاق الترددي القائم على الائتمان.

2026-07-30

الأدوات والأطر3 min read

أبحاث الذكاء الاصطناعي

يبدو تطور الحزام مثيرًا للإعجاب حتى تختبره على مهام غير مطروقة

من المفترض أن يجعل التطور التلقائي للحزام وكلاء LLM أفضل، لكن ورقة بحثية جديدة تجادل بأن العديد من المكاسب المبلغ عنها قد تكون من الإفراط في التجهيز على مجموعة الاختبار العامة. في التجارب، طابقت طرق توسيع نطاق وقت الاختبار البسيطة التطور أو تفوقت عليه، وأظهرت الأحزمة المتطورة تعميمًا محدودًا للمهام غير المطروقة.

2026-07-27

نماذج اللغات الكبيرةFeatured5 min read

بحث

فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي

SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.

2026-07-25

الذكاء الاصطناعي4 min read

الاستدلال طويل الأفق

إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق

PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.

2026-07-24

الذكاء الاصطناعيFeatured3 min read

أبحاث الذكاء الاصطناعي

الحيلة المزعجة التي تمنع انهيار وكلاء LLM في الإنتاج

وكلاء LLM الحاليون ينهارون تحت عشوائية العالم الحقيقي. يعرضهم NoisyAgent لضوضاء محكومة أثناء التدريب، مما يحسن المتانة والأداء العام في المعايير. تشير الورقة إلى أن المجال كان يعاني من الإفراط في التكيف مع الظروف المثالية.

2026-07-17

نماذج اللغات الكبيرةFeatured3 min read

أبحاث الذكاء الاصطناعي

عامل الذكاء الاصطناعي الخاص بك اجتاز الاختبار بالصدفة. الآن هناك معيار لتقييم ذلك.

SkillCoach هو إطار معايير (rubric) ذاتي التطور يُقيّم ويُحسّن استخدام المهارات الوكيلية من خلال تحليل عمليات اختيار المهارات، واتباعها، وتركيبها، والتفكير فيها، مما يوفر إشرافًا أفضل من المقاييس القائمة على النتائج فقط.

2026-07-06