Recherche en IA
Le LLM qui a surpassé toutes les formules fixes pour l'allocation d'entrepôts chez JD.com
Un LLM entraîné par apprentissage par renforcement guidé par solveur choisit la meilleure formulation MIP pour chaque instance d'allocation de stocks chez JD.com. Le Hit Ratio@1 est passé de 21 % à 50 %, et la précision d'allocation réalisée a surpassé chaque formulation fixe de 12,57 points de pourcentage.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-03 · 3 min de lecture

L'allocation des stocks dans plusieurs entrepôts est le genre de problème d'optimisation qui semble simple sur le papier mais qui devient un casse-tête en pratique. L'approche standard consiste à le modéliser comme un problème de programmation linéaire en nombres entiers (MIP). Le problème est qu'aucune formulation MIP unique ne fonctionne le mieux pour toutes les instances. Les pics de demande dans un entrepôt, les déséquilibres de stocks dans un autre, les cycles de réapprovisionnement, les contraintes de niveau de service, le bruit des prévisions. Chaque instance pousse la formulation optimale dans une direction différente.
Des chercheurs de JD.com et d'institutions partenaires ont publié un article sur le serveur de prépublication arXiv fin juillet 2026, montrant qu'un grand modèle de langage peut apprendre à choisir la bonne formulation instance par instance. Le résultat est un Hit Ratio@1 de 50,42 % pour la sélection de la meilleure formulation candidate parmi une bibliothèque d'experts en recherche opérationnelle, contre 21,45 % avec un modèle de référence. Les gains de précision d'allocation qui en résultent : 12,57 points de pourcentage par rapport à la référence existante, et l'écart par rapport à l'oracle ex-post (la formulation qui aurait été la meilleure si elle avait été connue à l'avance) tombe à 4,85 points de pourcentage.
Le problème de sélection de formulation
Les chercheurs définissent le problème comme une sélection de formulation de recherche opérationnelle par instance. Chaque instance d'allocation de stocks se voit attribuer une formulation exécutable par solveur provenant d'une bibliothèque candidate. Chaque formulation code une priorité d'allocation distincte, par exemple, minimiser les coûts par rapport au maintien des niveaux de service dans certains entrepôts. Le travail du sélecteur est d'associer chaque instance à la formulation avec laquelle le solveur trouvera la meilleure solution.
Le pipeline d'entraînement comporte trois étapes. Premièrement, l'enregistrement d'un réglage fin supervisé équilibré conditionné par expert enseigne au LLM le schéma de base : pour une instance donnée, quelle formulation était la meilleure. Deuxièmement, l'équipe applique une optimisation de préférence d'identité pondérée par marge en utilisant les évaluations du solveur sur les instances historiques. Cette étape convertit les écarts de qualité d'allocation entre les formulations en paires de préférences que le modèle apprend. Troisièmement, l'optimisation relative de politique de groupe (GRPO) utilise les scores d'expert par instance comme une recherche de récompense. La récompense provient directement de l'évaluation par le solveur MIP de la qualité avec laquelle chaque formulation échantillonnée a résolu l'instance. Le LLM ne résout pas le MIP lui-même, il sélectionne quelle formulation MIP pré-écrite transmettre à un solveur traditionnel.
Résultats sur les données de JD.com
Les expériences ont porté sur des instances réelles d'allocation de stocks multi-entrepôts de JD.com, l'un des plus grands détaillants en ligne de Chine. Le sélecteur de référence SFT+IPO a obtenu un Hit Ratio@1 de 21,45 % et un Hit Ratio@2 de 70,47 %. L'ajout de GRPO a fortement augmenté les deux chiffres : Hit Ratio@1 à 50,42 % et Hit Ratio@2 à 82,31 %. Plus important encore, la qualité d'allocation réalisée, mesurée par les résultats réels de coût et de niveau de service après l'exécution du solveur sur la formulation sélectionnée, a surpassé la meilleure formulation fixe et également le sélecteur SFT+IPO. L'amélioration par rapport au meilleur expert OR fixe était de 12,57 points de pourcentage, et l'écart restant par rapport à l'oracle hypothétique n'était que de 4,85 points de pourcentage.
L'article rapporte ces chiffres mais ne détaille pas les performances par volatilité de la demande ou densité d'entrepôt, il n'est donc pas encore clair comment l'approche se comporte dans des scénarios extrêmes. Les travaux sont limités aux propres instances de JD.com et n'ont pas été testés sur d'autres détaillants ou chaînes d'approvisionnement.
Pourquoi cela importe
Ce résultat s'inscrit dans une tendance plus large où les LLM sont utilisés non pas comme solveurs directs mais comme orchestrateurs d'outils d'optimisation traditionnels. Le LLM n'a pas besoin de comprendre les mathématiques du branch and bound ou du simplexe. Il a seulement besoin de reconnaître des modèles dans les données d'instance qui sont en corrélation avec la formulation qu'un solveur traitera le mieux. C'est un problème de classification, et l'article montre que l'apprentissage par renforcement guidé par solveur peut le faire fonctionner efficacement dans un contexte de production réel.
Pour les opérations de la chaîne d'approvisionnement, où les décisions d'allocation des stocks se répercutent sur les achats, le transport et l'exécution, un gain de précision de 12 points de pourcentage se traduit par des économies réelles. Les chercheurs ne donnent pas de chiffres en dollars, mais l'ampleur des opérations de JD.com suggère que l'impact est substantiel. L'approche pointe également vers une recette générale : une bibliothèque de solutions candidates, un solveur capable de les évaluer à moindre coût, et un LLM entraîné sur ces évaluations pour choisir la bonne pour chaque instance entrante.
- Source : The LLM that outsmarted every fixed formula for JD.com warehouse allocation — 2026-07-28
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.