أبحاث الذكاء الاصطناعي

نموذج LLM يتفوق على كل الصيغ الثابتة لتخصيص المستودعات في JD.com

نموذج لغة كبير تم تدريبه عبر التعلم المعزز الموجه بالمحلل يختار أفضل صيغة MIP لكل حالة تخصيص مخزون في JD.com. قفزت نسبة Hit Ratio@1 من 21% إلى 50%، وتجاوزت دقة التخصيص المحققة كل صيغة ثابتة بمقدار 12.57 نقطة مئوية.

Emmanuel Fabrice Omgbwa Yasse بمساعدة الذكاء الاصطناعي

2026-08-03 · قراءة 3 دقائق

نموذج LLM يتفوق على كل الصيغ الثابتة لتخصيص المستودعات في JD.com

تخصيص المخزون في المستودعات المتعددة هو نوع من مشكلات التحسين التي تبدو مباشرة على الورق لكنها تتحول إلى صداع في الممارسة. النهج القياسي هو نمذجتها كمشكلة برمجة صحيحة مختلطة (MIP). المشكلة هي أنه لا توجد صيغة MIP واحدة تعمل بشكل أفضل عبر جميع الحالات. ارتفاع الطلب في مستودع، اختلال التوازن في المخزون في آخر، دورات التزويد، قيود مستوى الخدمة، الضوضاء في التوقعات. كل حالة تدفع الصيغة المثلى في اتجاه مختلف.

نشر باحثون من JD.com والمؤسسات الشريكة ورقة بحثية على خادم arXiv للمطبوعات الأولية في أواخر يوليو 2026 تُظهر أن نموذج لغة كبير يمكنه تعلم اختيار الصيغة الصحيحة لكل حالة على حدة. النتيجة هي نسبة Hit Ratio@1 بلغت 50.42% لاختيار أفضل صيغة مرشحة من مكتبة خبراء بحوث العمليات، بارتفاع من 21.45% مع نموذج أساسي. مكاسب دقة التخصيص الناتجة: 12.57 نقطة مئوية عن خط الأساس الحالي، وتنخفض الفجوة مع oracle البعدي (الصيغة التي كانت ستكون الأفضل لو عُرفت مسبقًا) إلى 4.85 نقطة مئوية.

مشكلة اختيار الصيغة

يعرّف الباحثون المشكلة على أنها اختيار صيغة بحوث العمليات لكل حالة. يتم تعيين صيغة قابلة للتنفيذ بواسطة المحلل لكل حالة تخصيص مخزون من مكتبة مرشحة. كل صيغة تشفر أولوية تخصيص مميزة، على سبيل المثال، تقليل التكلفة مقابل الحفاظ على مستويات الخدمة في مستودعات معينة. وظيفة المختار هي مطابقة كل حالة مع الصيغة التي سيجد المحلل لها أفضل حل.

خط أنابيب التدريب له ثلاث مراحل. أولاً، تسجيلات الضبط الدقيق الخاضع للإشراف المتوازن المشروط بالخبير تعلم النموذج المخطط الأساسي: بالنسبة لحالة معينة، أي صيغة كانت الأفضل. ثانيًا، يطبق الفريق تحسين التفضيل المتطابق الموزون بالهامش باستخدام تقييمات المحلل على الحالات التاريخية. هذه المرحلة تحول فجوات جودة التخصيص بين الصيغ إلى أزواج تفضيل يتعلم منها النموذج. ثالثًا، تحسين السياسة النسبي الجماعي (GRPO) يستخدم درجات الخبراء لكل حالة كبحث عن المكافأة. تأتي المكافأة مباشرة من تقييم محلل MIP لمدى نجاح كل صيغة تم أخذ عينة منها في حل الحالة. لا يقوم النموذج بحل MIP بنفسه، بل يختار أي صيغة MIP مكتوبة مسبقًا لتسليمها إلى محلل تقليدي.

النتائج على بيانات JD.com

أُجريت التجارب على حالات حقيقية لتخصيص المخزون في مستودعات متعددة من JD.com، إحدى أكبر شركات التجزئة الإلكترونية في الصين. حقق المختار الأساسي SFT+IPO نسبة Hit Ratio@1 بلغت 21.45% وHit Ratio@2 بلغت 70.47%. إضافة GRPO دفعت كلا الرقمين بشكل حاد إلى الأعلى: Hit Ratio@1 إلى 50.42% وHit Ratio@2 إلى 82.31%. الأهم من ذلك، جودة التخصيص المحققة، المقاسة بالتكلفة الفعلية ونتائج مستوى الخدمة بعد تشغيل المحلل على الصيغة المختارة، تفوقت على أفضل صيغة ثابتة وتفوقت أيضًا على مختار SFT+IPO. كان التحسن مقارنة بأفضل خبير بحوث عمليات ثابت 12.57 نقطة مئوية، والفجوة المتبقية إلى oracle الافتراضي كانت 4.85 نقطة مئوية فقط.

تقدم الورقة هذه الأرقام ولكنها لا تفصل الأداء حسب تقلب الطلب أو كثافة المستودعات، لذا ليس من الواضح بعد كيف يصمد النهج في السيناريوهات القصوى. يقتصر العمل على حالات JD.com الخاصة ولم يتم اختباره على تجار تجزئة أو سلاسل توريد أخرى.

لماذا هذا مهم

النتيجة هي جزء من اتجاه أوسع تُستخدم فيه نماذج LLM ليس كمحللين مباشرين ولكن كمنسقين لأدوات التحسين التقليدية. لا يحتاج النموذج إلى فهم رياضيات التفرع والحد أو simplex. يحتاج فقط إلى التعرف على أنماط في بيانات الحالة التي ترتبط بالصيغة التي سيعالجها المحلل بشكل أفضل. هذه مشكلة تصنيف، وتظهر الورقة أن التعلم المعزز الموجه بالمحلل يمكن أن يجعله يعمل بشكل جيد في سياق إنتاجي حقيقي.

بالنسبة لعمليات سلسلة التوريد، حيث تتتالي قرارات تخصيص المخزون في المشتريات والنقل والتلبية، فإن تحسن الدقة بمقدار 12 نقطة مئوية يترجم إلى وفورات حقيقية. لا يعطي الباحثون أرقامًا بالدولار، لكن حجم عمليات JD.com يشير إلى أن التأثير كبير. يشير النهج أيضًا إلى وصفة عامة: مكتبة من الحلول المرشحة، ومحلل يمكنه تقييمها بتكلفة منخفضة، ونموذج LLM مدرب على تلك التقييمات لاختيار الصيغة المناسبة لكل حالة واردة.

أهم أخبار التقنية في 3 دقائق كل صباح

بريد إلكتروني واحد، كل يوم عمل، بما يهم فعلاً في الذكاء الاصطناعي والتقنية.