国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:张晓楠,张建雄
单位:天津大学
关键词:路径问题; 随机需求; 马尔可夫决策; 强化学习; 价值逼近算法
基金:国家自然科学基金项目(71802120, 71971152), 陕西省创新能力支撑计划(2020KRM024), 陕西省教育厅专项科研计划项目(19JK0125)资助.
随着高效实时物流的发展, 不确定车辆路径问题面临着兼顾决策精度和实时响应能力的新挑战. 本文以应用最为广泛的随机需求车辆路径问题为例, 研究提出一种有效的在线决策方法. 首先, 考虑多车辆同时在线, 以总旅行成本最小化为目标, 建立马尔科夫决策模型, 并引入可信度约束和邻域半径减少策略缩小行动空间, 提高求解效率. 其次, 设计强化学习中的价值逼近算法求解模型, 其中, 采用基函数估计期望未来成本, 并将求解过程分离为离线训练和在线决策两个环节, 基函数的权重被离线训练并用于在线决策以减少在线决策时间, 同时, 在算法中嵌入了邻域半径的动态更新机制. 最后, 测试多组算例验证了本文方法的有效性.
来源:2022年第2期
《控制理论与应用》期刊编辑部