国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:王昱,任田君,范子琳,孟光磊
单位:沈阳航空航天大学 自动化学院,沈阳航空航天大学 自动化学院,沈阳航空航天大学 自动化学院,沈阳航空航天大学 自动化学院
关键词:追击决策; 强化学习; 分布式DDPG算法; 角度特征
基金:国家自然科学基金项目(61906125, 62373261), 辽宁省属本科高校基本科研业务费专项基金项目(LJ232410143020, LJ212410143047)资助.
无人机执行追击任务过程中态势变化迅速, 不灵活的网络更新机制和固化的奖励函数使得现有决策模型难以持续输出正确且高效的策略. 针对此问题, 提出了一种基于角度特征的分布式深度确定性策略梯度(DDPG)算法. 首先, 为避免梯度消失或爆炸以稳定模型训练过程, 提出先利用梯度上升计算目标值, 再使用MSE损失函数训练的Actor网络更新机制; 然后, 依据双方角度特征划分策略引导区域, 通过设置不同的奖励函数权重, 构建基于5个DDPG网络的分布式决策模型, 利用在不同态势下对奖励函数权重的动态选择和无缝切换提升算法的决策能力. 仿真实验表明, 相比于DDPG和双延迟深度确定性策略梯度(TD3)算法, 所提算法无论追击直线逃逸目标或智能逃逸目标, 均具有更高的成功率和决策效率.
来源:2025年第7期
《控制理论与应用》期刊编辑部