国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:李心怡,李衍杰
单位:哈尔滨工业大学(深圳) 机电工程与自动化学院 广东省智能变形机构与自适应机器人重点实验室,哈尔滨工业大学(深圳) 机电工程与自动化学院 广东省智能变形机构与自适应机器人重点实验室
关键词:重规划; 优先级; 动作检测; 内部奖励机制; 路径规划
基金:深圳市基础研究计划项目(JCYJ20180507183837726, JCYJ20220818102415033, JSGG20201103093802006)资助.
多智能体强化学习(MARL)因其出色的泛化能力和快速的计算速度, 已成为解决实时性要求高任务的有效工具, 并在多智能体路径规划(MAPF)问题中得到了广泛的研究和应用. 尽管如此, 当智能体密度极高时, 基于强化学习的MAPF求解器仍面临为智能体规划无碰撞路径的难题. 现有的多数学习型MAPF求解器在预测到潜在碰撞时, 倾向于将智能体的移动暂停作为替代动作, 而在智能体之间缺乏有效的协同机制, 这可能引发死锁. 为应对这一挑战, 本研究提出了一种结合了强化学习和带注意力机制的通信网络的方法, 旨在优化MAPF问题的求解. 此外,为降低高密度智能体环境中死锁的发生率, 本研究设计了一套动作检测与重规划策略. 研究中还引入了一种内部奖励机制, 旨在激励智能体探索环境并加速其达到目标位置的过程. 经过实验验证, 所提出的方法在准确率方面显著优于现有先进的学习型MAPF方法, 并在多个环境中的表现与接近最优解的求解器相媲美.
来源:2026年第4期
《控制理论与应用》期刊编辑部