Investigación en IA
El LLM que superó todas las fórmulas fijas para la asignación de almacenes de JD.com
Un LLM entrenado mediante aprendizaje por refuerzo guiado por solucionador elige la mejor formulación MIP para cada instancia de asignación de inventario en JD.com. El Hit Ratio@1 saltó del 21% al 50%, y la precisión de asignación realizada superó a cada formulación fija en 12.57 puntos porcentuales.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-03 · 3 min de lectura

La asignación de inventario en múltiples almacenes es el tipo de problema de optimización que parece sencillo en papel pero se convierte en un dolor de cabeza en la práctica. El enfoque estándar es modelarlo como un problema de programación mixta entera (MIP). El problema es que ninguna formulación MIP única funciona mejor en todas las instancias. Picos de demanda en un almacén, desequilibrios de inventario en otro, ciclos de reposición, restricciones de nivel de servicio, ruido en las previsiones. Cada instancia empuja la formulación óptima en una dirección diferente.
Investigadores de JD.com e instituciones asociadas publicaron un artículo en el servidor de preimpresión arXiv a finales de julio de 2026 que muestra que un modelo de lenguaje grande puede aprender a elegir la formulación correcta instancia por instancia. El resultado es un Hit Ratio@1 del 50.42% para seleccionar la mejor formulación candidata de una biblioteca de expertos en IO, frente al 21.45% con un modelo base. Las ganancias de precisión de asignación resultantes: 12.57 puntos porcentuales sobre la línea base incumbente, y la brecha con el oráculo ex-post (la formulación que habría sido mejor si se conociera de antemano) cae a 4.85 puntos porcentuales.
El problema de la selección de formulación
Los investigadores definen el problema como la selección de formulación de IO por instancia. Cada instancia de asignación de inventario recibe una formulación ejecutable por el solucionador de una biblioteca candidata. Cada formulación codifica una prioridad de asignación distinta, por ejemplo, minimizar costos versus mantener niveles de servicio en ciertos almacenes. La tarea del selector es emparejar cada instancia con la formulación con la que el solucionador encontrará la mejor solución.
El pipeline de entrenamiento tiene tres etapas. Primero, registros de ajuste fino supervisado equilibrado condicionado por experto enseñan al LLM el esquema básico: para una instancia dada, qué formulación fue la mejor. Segundo, el equipo aplica optimización de preferencias de identidad ponderada por margen utilizando evaluaciones del solucionador en instancias históricas. Esta etapa convierte las brechas de calidad de asignación entre formulaciones en pares de preferencia que el modelo aprende. Tercero, la optimización de política relativa grupal (GRPO) utiliza puntuaciones de experto por instancia como una búsqueda de recompensa. La recompensa proviene directamente de la evaluación del solucionador MIP de qué tan bien cada formulación muestreada resolvió la instancia. El LLM no está resolviendo el MIP en sí, está seleccionando qué formulación MIP preescrita pasar a un solucionador tradicional.
Resultados en datos de JD.com
Los experimentos se realizaron en instancias reales de asignación de inventario en múltiples almacenes de JD.com, uno de los minoristas electrónicos más grandes de China. El selector SFT+IPO de línea base logró un Hit Ratio@1 del 21.45% y un Hit Ratio@2 del 70.47%. Agregar GRPO elevó ambos números considerablemente: Hit Ratio@1 al 50.42% y Hit Ratio@2 al 82.31%. Más importante aún, la calidad de asignación realizada, medida por los resultados reales de costos y niveles de servicio después de que el solucionador se ejecutara en la formulación seleccionada, superó a la mejor formulación fija y también superó al selector SFT+IPO. La mejora sobre el mejor experto fijo en IO fue de 12.57 puntos porcentuales, y la brecha restante con el oráculo hipotético fue solo de 4.85 puntos porcentuales.
El artículo informa estas cifras pero no desglosa el rendimiento por volatilidad de la demanda o densidad de almacenes, por lo que aún no está claro cómo se comporta el enfoque bajo escenarios extremos. El trabajo se limita a las propias instancias de JD.com y no se ha probado en otros minoristas o cadenas de suministro.
Por qué esto es importante
El resultado es parte de una tendencia más amplia en la que los LLM se utilizan no como solucionadores directos sino como orquestadores de herramientas de optimización tradicionales. El LLM no necesita entender las matemáticas de branch and bound o simplex. Solo necesita reconocer patrones en los datos de instancia que se correlacionan con qué formulación manejará mejor un solucionador. Eso es un problema de clasificación, y el artículo muestra que el aprendizaje por refuerzo impulsado por solucionador puede hacer que funcione bien en un contexto de producción real.
Para las operaciones de la cadena de suministro, donde las decisiones de asignación de inventario se extienden a la adquisición, el transporte y el cumplimiento, una ganancia de precisión de 12 puntos porcentuales se traduce en ahorros reales. Los investigadores no dan cifras en dólares, pero la escala de las operaciones de JD.com sugiere que el impacto es sustancial. El enfoque también apunta a una receta general: una biblioteca de soluciones candidatas, un solucionador que pueda evaluarlas económicamente y un LLM entrenado en esas evaluaciones para elegir la correcta para cada instancia entrante.
- Fuente : The LLM that outsmarted every fixed formula for JD.com warehouse allocation — 2026-07-28
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.