控制理论与应用

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:44-1240/TP

国际刊号:1000-8152

控制理论与应用杂志2024年第6期:深度强化学习算法求解动态流水车间实时调度问题

发布日期:

作者:杨媛媛,胡 蓉,钱 斌,张长胜,金怀平

单位:昆明理工大学 信息工程与自动化学院,昆明理工大学 信息工程与自动化学院,昆明理工大学 信息工程与自动化学院,昆明理工大学 信息工程与自动化学院,昆明理工大学 信息工程与自动化学院

关键词:流水车间调度; 新工件到达; 深度强化学习; 动态实时调度; 智能调度

基金:国家自然科学基金项目(62173169, 61963022), 云南省基础研究重点项目(202201AS070030)资助.

本文针对动态流水车间调度问题(DFSP), 以最小化最大完工时间为优化目标, 提出一种自适应深度强化学习算法(ADRLA)进行求解. 首先, 将DFSP的新工件动态到达过程模拟为泊松过程, 进而采用马尔科夫决策过程(MDP)对DFSP的求解过程进行描述, 将DFSP转化为可由强化学习求解的序贯决策问题. 然后, 根据DFSP的排序模型特点, 设计具有较好状态特征区分度和泛化性的状态特征向量, 并依此提出5种特定动作(即调度规则)来选择当前需加工的工件, 同时构造基于问题特性的奖励函数以获取动作执行效果的评价值(即奖励值), 从而确定ADRLA的3类基本要素. 进而, 以深度双Q网络(DDQN) 作为ADRLA中的智能体, 用于进行调度决策. 该智能体采用由少量小规模DFSP确定的数据集(即3类基本要素在不同问题上的数据)训练后, 可较准确刻画不同规模DFSP的状态特征向量与Q值向量(由各动作的Q值组成)间的非线性关系, 从而能对各种规模DFSP进行自适应实时调度. 最后, 通过在不同测试问题上的仿真实验和与算法比较, 验证了所提ADRLA求解DFSP的有效性和实时性.

来源:2024年第6期

《控制理论与应用》期刊编辑部

查看控制理论与应用杂志2024年第6期

联系我们

  • 地址:广州市天河区五山路381号 华南理工大学3号楼516室
  • 电话:020-87111464
  • E-mail:aukzllyy@scut.edu.cn

咨询工作人员