SevenTnewS

AI研究

在京东仓库分配中超越所有固定公式的大语言模型

通过求解器引导的强化学习训练的大语言模型为京东的每个库存分配实例选择最佳的MIP公式。命中率@1从21%跃升至50%,实际分配精度比每个固定公式高出12.57个百分点。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-03 · 阅读需 3 分钟

在京东仓库分配中超越所有固定公式的大语言模型

多仓库库存分配是一种在纸面上看似简单但实践中令人头疼的优化问题。标准方法是将其建模为混合整数规划(MIP)问题。问题在于,没有单一的MIP公式能在所有实例中表现最佳。一个仓库的需求激增,另一个仓库的库存失衡,补货周期,服务水平约束,预测噪声, , 每个实例都将最优公式推向不同的方向。

来自京东与合作机构的研究人员于2026年7月下旬在arXiv预印本服务器上发表了一篇论文,表明大语言模型可以逐实例学习选择正确的公式。结果显示,从OR专家库中选择最佳候选公式的命中率@1达到50.42%,而基线模型仅为21.45%。由此带来的分配精度提升:比现有基线高出12.57个百分点,与事后最优(如果事先知道会是最佳的公式)的差距降至4.85个百分点。

公式选择问题

研究人员将问题定义为逐实例的OR公式选择。每个库存分配实例从候选库中获得一个可被求解器执行的公式。每个公式编码了不同的分配优先级,例如最小化成本与维持某些仓库的服务水平。选择器的工作是将每个实例与求解器能找到最佳方案的公式匹配起来。

训练流程包含三个阶段。首先,平衡的专家条件监督微调记录教会LLM基本模式:对于给定实例,哪个公式是最好的。其次,团队使用求解器对历史实例的评估,应用边际加权身份偏好优化。这一阶段将公式之间的分配质量差距转化为模型学习的偏好对。第三,群体相对策略优化(GRPO)使用每个实例的专家得分作为奖励查找。奖励直接来自MIP求解器对每个采样公式解决实例效果的评价。LLM本身并不求解MIP,而是选择哪个预编写的MIP公式交给传统求解器。

京东数据上的结果

实验在京东(中国最大的电商之一)的真实多仓库库存分配实例上进行。基线SFT+IPO选择器的命中率@1为21.45%,命中率@2为70.47%。加入GRPO后,这两个数字大幅提升:命中率@1达到50.42%,命中率@2达到82.31%。更重要的是,实际分配质量(通过求解器对所选公式运行后的实际成本和服务水平结果衡量)超过了最佳固定公式,也超过了SFT+IPO选择器。相比最佳固定OR专家,改进幅度为12.57个百分点,与假设最优的差距仅为4.85个百分点。

论文报告了这些数字,但没有按需求波动性或仓库密度细分性能,因此尚不清楚该方法在极端场景下的表现。该工作仅限于京东自身的实例,尚未在其他零售商或供应链上进行测试。

为何重要

这一结果属于更广泛趋势的一部分,即LLM被用作传统优化工具的编排者而非直接求解器。LLM无需理解分支定界或单纯形法的数学原理。它只需要识别实例数据中与求解器最佳处理哪个公式相关的模式。这是一个分类问题,论文表明求解器驱动的强化学习可以在实际生产环境中使其良好工作。

对于供应链运营而言,库存分配决策会级联影响采购、运输和履行,12个百分点的精度提升转化为实际节省。研究人员未给出具体金额,但京东的运营规模表明影响巨大。该方法还指向一个通用配方:一个候选解决方案库,一个能廉价评估它们的求解器,以及一个基于这些评估训练以选择每个传入实例正确方案的LLM。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。