国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:孔维仁,周德云,赵艺阳,杨婉莎
单位:西北工业大学,西北工业大学,西北工业大学,悉尼大学
关键词:空战决策; 多无人机协同; 强化学习; 虚拟自我对局
基金:国家自然科学基金项目(61603299, 61612385), 中央高校基本科研业务费专项资金项目(3102019ZX016)资助
为解决多无人机近距空战机动决策问题, 提出一种基于参数共享Q网络与虚拟自我对局的多无人机近距空战机动策略生成算法. 首先, 设计一种适用于不同无人机编队规模的混合马尔可夫博弈模型与多无人机机动决策策略生成强化学习框架—参数共享Q网络, 并通过自编码器对状态空间进行压缩以提高策略学习效率. 然后, 使用虚拟自我对局方法使机动策略收敛至纳什均衡策略. 最后对自编码器的参数选择、策略生成算法的训练过程与机动策略的合理性与迁移性进行了仿真实验. 通过仿真结果表明, 引入自编码器可以有效地提高策略学习效率, 并且使用该算法生成的多无人机近距空战机动策略具有合理性与良好的迁移性.
来源:2022年第2期
《控制理论与应用》期刊编辑部