国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:肖友刚,金升成,毛晓,伍国华,陆志沣
单位:中南大学 交通运输工程学院,中南大学 交通运输工程学院,中南大学 交通运输工程学院,中南大学 交通运输工程学院,上海机电工程研究所
关键词:防空反导; 导弹目标分配; 武器目标分配; 深度强化学习
针对对抗环境下的海上舰船防空反导导弹目标分配问题, 本文提出了一种融合注意力机制的深度强化学习算法. 首先, 构建了舰船多类型导弹目标分配模型, 并结合目标多波次拦截特点将问题建模为马尔可夫决策过程.接着, 基于编码器–解码器框架搭建强化学习策略网络, 融合多头注意力机制对目标进行编码, 并在解码中结合整体目标和单个目标编码信息实现舰船可靠的导弹目标分配. 最后, 对导弹目标分配收益、分配时效以及策略网络训练过程进行了仿真实验. 实验结果表明, 本文方法能生成高收益的导弹目标分配方案, 相较于对比算法的大规模决策计算速度提高10%~94%, 同时其策略网络能够快速稳定收敛.
来源:2024年第6期
《控制理论与应用》期刊编辑部