国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:苏章圣,蒋胜龙,彭功状,梁越永
单位:重庆大学材料科学与工程学院,重庆大学自动化学院,北京航空航天大学 国际前沿交叉科学研究院,上海宝信软件股份有限公司
关键词:天车调度;分层强化学习;任务指派;路径规划;动作禁忌
基金:国家自然科学基金项目(92367106,62273032,61873042)资助.
天车是车间、仓库、港口等工业园区中关键的重型物料运载装置,其调度对运输效率及生产目标达成影响显著.针对带时间窗约束的天车调度问题(CSP-TW),建立了一种基于时空离散化的混合整数线性规划模型.基于模型特征,设计了一种分层强化学习(HRL)决策框架:上层决策网络将运输任务指派至适合天车;下层决策网络规划各天车运行路径执行具体运输.在学习过程中,引入了动作禁忌规则规避无效动作,引导上下层决策网络向优势策略空间探索.随后,采用了外部经验池和D3QN策略训练决策网络.基于某公司钢厂物流仿真平台进行测试:消融实验表明所引入的动作禁忌规则可提高HRL学习效率;训练比较表明HRL的收敛性优于端到端框架;对比实验表明HRL的求解效果优于多规则组合法、元启发式算法、端到端和DQN等多类方法,并符合秒级响应的应用需求.
来源:2025年第11期
《控制理论与应用》期刊编辑部