وكلاء LLM

13 published articles

المختبرات والأبحاث3 min read

فيشر-R1 | اختبار الفرضيات

وكلاء الذكاء الاصطناعي ينفذون الإحصاءات بدقة تامة ومع ذلك يصلون إلى استنتاجات خاطئة

يمكن للوكلاء الذين يؤتمتون اختبار الفرضيات تنفيذ التحليلات بدقة تامة ومع ذلك الوصول إلى استنتاجات خاطئة، لأن معظم المعايير لا تتحقق أبدًا مما إذا كانت القيمة الاحتمالية (p-value) صالحة. معيار من 425 مهمة يحدد حجم الفجوة، ونموذج مفتوح الأوزان مدرب بتعلّم التعزيز يقلص جزءًا منها.

2026-08-19

وكلاء الذكاء الاصطناعي4 min read

وكلاء الذكاء الاصطناعي

منحت PsychoAgent وكلاء الذكاء الاصطناعي ذاكرة عاطفية. لم يجد المقيّمون أي تفوّق

يمنح PsychoAgent وكلاء نماذج اللغات الكبيرة (LLM) ذاكرة عاطفية منفصلة بحيث يمكن للآثار البارزة عاطفيًا والمحملة بالصراعات أن تتفوق على الآثار الموضوعية البحتة. في ثلاثة سيناريوهات صراعية، استرجع ذكريات حرجة للصراع أكثر من خطي الأساس معًا (0.933 مقابل 0.500 و0.667)، ومع ذلك لم يجد خمسة مقيّمين مُعَمّين أي تفوّق نوعي ذي دلالة.

2026-08-19

وكلاء الذكاء الاصطناعي4 min read

أبحاث الذكاء الاصطناعي

توقف عن نسخ المهارات ولصقها: حل SkillZip الخالي من التقييم للوكلاء المتضخمين

تضيف الوكلاء ذاتية التطوّر إصلاحات حتى تظهر القاعدة نفسها في فروع متعددة. يضغط SkillZip مهاراتها دون عمليات محاكاة تقييمية، عبر إيجاد أقصر تفسير بنيوي وفيّ. وضعا One-shot وZip-on-Write، وما يتركه الملخص دون إثبات.

2026-08-15

الذكاء الاصطناعي5 min read

عوامل الذكاء الاصطناعي

معاملة إجراءات التشغيل القياسية كرمز برمجي: بيئة تشغيل جديدة مكدسة الصفحات تفصل بين العوامل القوية والضعيفة

تظهر أبحاث جديدة من هونغ كونغ والصين القارية أن تجميع إجراءات التشغيل القياسية في كود زائف قابل للتنفيذ وتشغيلها على آلة افتراضية مكدسة الصفحات يفصل بوضوح بين العوامل القادرة والعوامل الهشة. ينتج عن العمل قاعدة نشر دقيقة: قم بالتجميع أولاً، ثم قم بالترقيم فقط بعد التحقق من الانضباط على مستوى النموذج.

2026-08-04

وكلاء الذكاء الاصطناعي4 min read

وكلاء LLM

ضريبة الانحدار: لماذا قد يؤدي تحميل وكلاء LLM بالمهارات إلى نتائج عكسية

دراسة جديدة تُظهر أن إضافة المهارات الإجرائية لوكلاء LLM لا تساعد دائمًا، بل قد تؤدي إلى انحدارات، حيث تفشل المهام التي كانت تُحل بدون مهارات بعد إضافة المهارات. يحدد البحث ثلاثة أسباب ويجادل بأن الموثوقية تعتمد على التأصيل والتحقق أكثر من اعتمادها على المهارة نفسها.

2026-08-03

نماذج اللغات الكبيرة3 min read

الذكاء الاصطناعي

توليد أفكار البحث يصبح أفضل بـ 3.89 مرة باستخدام IDEAgent

يستخدم IDEAgent الأنساب والتغذية الراجعة متعددة الأهداف والذاكرة المتسلسلة لموازنة الجودة والتنوع في أفكار البحث المولدة بواسطة نماذج اللغة الكبيرة. تم اختباره عبر 32 موضوعًا في 8 مجالات من علوم الكمبيوتر، ويحقق 3.89 أضعاف العائد (أفكار متنوعة فوق عتبة الجودة) مقارنة بالطرق السابقة.

2026-08-02

وكلاء الذكاء الاصطناعي3 min read

الذكاء الاصطناعي الصناعي

AgentRCA: تحليل السبب الجذري بدون تدريب مسبق يشرح منطقه الخاص

إطار عمل موكل بدون تدريب مسبق يُسمى AgentRCA يستخدم توأمًا رقميًا ونموذج لغوي كبير لتشخيص أعطال المصنع دون بيانات موسومة، محققًا دقة على مستوى الأنظمة الخاضعة للإشراف مع شفافية كاملة.

2026-08-01

الذكاء الاصطناعي5 min read

بحث

ست كلمات قد تعيد تشكيل كيفية استكشاف وكلاء الذكاء الاصطناعي والبقاء آمنين: تعطيل، تحقق، وسيط

تقترح بنية فريق وكيل غير متجانسة جديدة فصل الاستكشاف التباعدي، وفحص السلامة في وقت التشغيل، واسترجاع المعرفة عبر المجالات إلى أدوار متخصصة. يولد المُعطل مقترحات عالية الإنتروبيا، ويطبق المُتحقق فحوصات صلبة لاستدعاءات الأدوات، ويستورد الوسيط تشبيهات خارج المجال عبر استرجاع التباين الجديد. تُجمع إخفاقات التنفيذ في رقع قيود موقعة تُسمى الندوب، مخزنة مؤقتاً للأجيال القادمة. في التقييمات، حقق الفريق اكتشاف هدف ناءٍ بنسبة 95%، وصفر انتهاكات منفذة، وتوفير بنسبة 15.1% في الرموز من الندوب، مع تخفيض التكلفة بنسبة 55.9% تحت قيود الموارد عبر تخصيص عرض النطاق الترددي القائم على الائتمان.

2026-07-30

الأدوات والأطر3 min read

أبحاث الذكاء الاصطناعي

يبدو تطور الحزام مثيرًا للإعجاب حتى تختبره على مهام غير مطروقة

من المفترض أن يجعل التطور التلقائي للحزام وكلاء LLM أفضل، لكن ورقة بحثية جديدة تجادل بأن العديد من المكاسب المبلغ عنها قد تكون من الإفراط في التجهيز على مجموعة الاختبار العامة. في التجارب، طابقت طرق توسيع نطاق وقت الاختبار البسيطة التطور أو تفوقت عليه، وأظهرت الأحزمة المتطورة تعميمًا محدودًا للمهام غير المطروقة.

2026-07-27

نماذج اللغات الكبيرةFeatured4 min read

بحث

فجوة الإشراف في التعلم المعزز للوكلاء تحصل على حل من منظور الماضي

SEED (التقطير الذاتي التطور داخل السياسة) يسمح لنموذج لغوي كبير بتحليل مساراته السابقة، واستخراج مهارات قابلة لإعادة الاستخدام بلغة طبيعية من منظور الماضي، ثم تقطير تلك الدروس مرة أخرى في سياسته أثناء التعلم المعزز. النتيجة: إشراف أكثر كثافة ومتوافق مع السياسة يحسن كفاءة العينة ويعمم على مهام غير مرئية.

2026-07-25

الذكاء الاصطناعي4 min read

الاستدلال طويل الأفق

إطار عمل جديد يساعد وكلاء الذكاء الاصطناعي على تذكر ما فعلوه قبل خمس دقائق

PRO-LONG هو إطار عمل بسيط يساعد وكلاء نماذج اللغات الكبيرة على الاحتفاظ بالمعلومات واسترجاعها عبر تسلسلات طويلة من الإجراءات. على معيار ARC-AGI-3، حسّن متوسط معدلات النجاح بمقدار 18 نقطة مئوية عبر النماذج الرائدة مع استخدام أقل بمقدار 4.2 إلى 5.8 مرات من الرموز المميزة مقارنة بالأدوات الحالية. مع نموذج Fable 5، حقق 97.4% best@2 بتكلفة استدلال إجمالية قدرها 1,750 دولارًا.

2026-07-24

الذكاء الاصطناعيFeatured3 min read

أبحاث الذكاء الاصطناعي

الحيلة المزعجة التي تمنع انهيار وكلاء LLM في الإنتاج

وكلاء LLM الحاليون ينهارون تحت عشوائية العالم الحقيقي. يعرضهم NoisyAgent لضوضاء محكومة أثناء التدريب، مما يحسن المتانة والأداء العام في المعايير. تشير الورقة إلى أن المجال كان يعاني من الإفراط في التكيف مع الظروف المثالية.

2026-07-17

← PreviousPage 1 / 2 · 13 articlesNext →