InvEvolve: Evolving White-Box Inventory Policies via Large Language Models with Performance Guarantees
Chenyu Huang, Jianghao Lin, Zhengyang Tang, Bo Jiang, Ruoqing Jiang, Benyou Wang, Lai Wei
LLM과 진화적 탐색을 결합하여, 통계적 안전 보증이 있는 박스형 재고 정책을 생성하는 프레임워크.
최근 LLM 기반 진화적 탐색(예: AlphaEvolve)은 정적이고 구조화된 문제에서 강력한 성능을 보이지만, 온라인 업데이트가 필요한 동적 재고 설정에는 직접 적용하기 어렵다. 또한, 생성된 정책의 안전성과 성능을 이론적으로 보장하는 것이 과제이다.
강화학습으로 훈련된 LLM을 기반으로 수요 데이터와 추가 특성을 처리하여 박스형 재고 정책을 생성한다. 신뢰구간 기반 인증을 도입하여 통계적 안전성을 보장하고, 학습·추론·배포를 통합하는 이론적 보증이 있는 프레임워크를 구축한다. 이를 통해 안전하고 개선된 정책이 생성될 확률의 하한과 오라클-안전 벤치마크 대비 다중 기간 성능 격차를 유도한다.
합성 데이터와 실제 소매 데이터에서 테스트한 결과, InvEvolve는 고전적 재고 정책과 딥러닝 기반 방법들을 능가한다. 정형적인 재고 설정에서 기존 벤치마크를 초과하는 새로운 정책을 생성하며, 동적 환경에서 LLM을 활용한 정책 생성의 이론적·실용적 토대를 마련한다.