国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:杨晓宇,韩玉艳,王玉亭,李寰,张彪
单位:聊城大学计算机学院,聊城大学计算机学院,聊城大学计算机学院,聊城大学计算机学院,聊城大学计算机学院
关键词:柔性制造系统;流体松弛模型;深度强化学习;多策略决斗双深度Q网络;多重性
基金:国家自然科学基金项目(61973203,61803192,62106073, 61966012), 山东省自然科学基金项目(ZR2023MF022,ZR2024MF112), 聊城大学光岳青 年创新团队项目(LCUGYTD2022–03)资助.
鉴于生产过程中订单的随机到达可能导致调度方案无法实现最优,实时动态订单到达成为关键问题.针对动态多重柔性作业车间调度问题(DMFJSP),提出了多策略决斗双深度Q网络(MPD3QN)求解方法.该问题考虑了工件订单和多类型工件的动态到达,首先,为了降低DMFJSP的复杂性,提出了一个简化的流体松弛模型,并基于流体模型设计了多指标选择策略,用于辅助生产调度决策.其次,进一步构建了马尔可夫决策过程(MDP)模型,提取了与工件和机器相关的19个状态特征,设计了20种复合规则作为动作空间.然后,结合优先经验回放、软更新机制和自适应动作选择策略,提出了MPD3QN算法.最后,通过81个测试算例,将所提算法与3种现有的深度强化学习调度方法进行比较,仿真结果验证了其优越性.
来源:2025年第11期
《控制理论与应用》期刊编辑部