控制理论与应用

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:44-1240/TP

国际刊号:1000-8152

控制理论与应用杂志2025年第10期:基于深度强化学习的水下无人航行器高速目标捕获路径规划

发布日期:

作者:庞舟岐,郝程鹏,林晓波,潘光帅

单位:中国科学院声学研究所,中国科学院声学研究所,中国科学院声学研究所,中国科学院声学研究所

关键词:深度强化学习;确定性策略梯度;高速目标捕获;水下无人航行器;马尔可夫决策过程

基金:国家自然科学基金项目(61971412),中国科学院某实验室基金项目(CXJJ–22S025)资助.

高速水下目标捕获问题存在诸多挑战,一方面,受水下多变的环境影响,声呐探测数据有较大的时延性和不确定性;另一方面,由于目标速度快,拦截器无法以追击姿态进行捕获,使得可拦截轨迹的数量大大减少.基于此,本文提出了一种改进的双延时深度确定性策略梯度(ITD3)算法来提高拦截器的捕获效率和精度.首先,基于拦截器动力学本文构建“规划器–控制器”级联仿真方式,相较于纯运动学仿真更精确,相较于制导控制一体模型更符合实际情况;其次,为了解决动作空间较大以及水下传感器存在时延的问题,本文提出了动作掩膜机制并引入了基于时延的探索噪声;再次,为使奖励函数契合高速目标捕获任务特点,本文设计了新的奖励函数对不利于捕获的状态进行惩罚;最后,为提高算法的收敛速度和稳定性,本文在TD3算法的基础上融合优先级经验回放以及softmax操作符.仿真实验和半实物仿真表明,和传统捕获算法相比,本文提出的ITD3算法捕获目标的时间更短、脱靶率更低,并有着较强的可行性.

来源:2025年第10期

《控制理论与应用》期刊编辑部

查看控制理论与应用杂志2025年第10期

联系我们

  • 地址:广州市天河区五山路381号 华南理工大学3号楼516室
  • 电话:020-87111464
  • E-mail:aukzllyy@scut.edu.cn

咨询工作人员