国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:初阳,燕雪峰,张玄烨,徐云雯,李德伟
单位:南京航空航天大学计算机科学与技术学院,南京航空航天大学计算机科学与技术学院,上海交通大学自动化系,上海交通大学自动化系,上海交通大学自动化系
关键词:三维装箱问题;深度强化学习;多智能体强化学习;组合优化
针对半在线场景下的多箱体三维装箱问题(3D-BPP),为了提高装箱决策效率和装箱空间利用率,本文提出一种多智能体分层强化学习算法.该算法采用多智能体马尔可夫决策过程(MAMDP)对问题进行建模,通过3个完全合作的智能体分别负责货物选择、箱子选择和摆放位置规划,并引入值分布学习方法以增强算法的稳定性和收敛性. 实验结果表明,该算法在不同环境配置下均表现出良好的性能,空间利用率和装入货物数量显著提升,且在多箱体和多货物选择场景下展现出较强的泛化能力.与传统的启发式算法相比,该算法在动态决策和适应性方面具有明显优势,尤其在处理未知分布的货物尺寸时表现出较强的鲁棒性.该算法首次将多智能体分层强化学习框架应用于3D-BPP,实现装箱决策的端到端优化,为复杂装箱场景提供了一种新颖的解决方案.
来源:2025年第12期
《控制理论与应用》期刊编辑部