控制理论与应用

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:44-1240/TP

国际刊号:1000-8152

控制理论与应用杂志2025年第2期:基于对手池的两人格斗游戏深度强化学习

发布日期:

作者:梁荣钦,朱圆恒,赵冬斌

单位:中国科学院自动化研究所,中国科学院自动化研究所,中国科学院自动化研究所

关键词:实时格斗游戏; 深度强化学习; 两人零和博弈; 对手策略池

基金:科技创新2030“新一代人工智能”重大项目(2018AAA0102404), 中国科学院战略性先导研究项目(XDA27030400),国家自然科学基金项目 (62293541, 62136008), 中国科学院青年创新促进会项目(2021132)资助.

双人游戏在游戏人工智能领域是一个基本且重要的问题, 其中一对一零和格斗游戏是最为典型的双人游戏之一. 本文基于深度强化学习对格斗游戏博弈对抗策略进行研究. 首先建模格斗游戏环境, 设计可用于格斗游戏决策的状态、动作以及奖赏函数, 并将阶段策略梯度算法应用于对抗策略的学习. 为了尽可能学到纳什均衡策略实现战胜任意对手的目标, 本文设计了基于历年参赛的智能体构造对手池用于智能体训练, 并探索对手选择机制对于训练过程的影响. 最后在固定对手池的基础上, 设计了自增长对手池算法, 以提升对手策略的完备性和训练智能体的鲁棒性. 为了提高环境采样速度, 本文从传统并行框架出发, 设计了可用于双人游戏的多服务器分布式并行采样框架. 通过实验对比发现, 基于自增长对手池方法所学的智能体能以96.6%的胜率击败固定对手池中的智能体, 并且在与3个仅用于测试的智能体对战时, 也表现出了72.2%的胜率.

来源:2025年第2期

《控制理论与应用》期刊编辑部

查看控制理论与应用杂志2025年第2期

联系我们

  • 地址:广州市天河区五山路381号 华南理工大学3号楼516室
  • 电话:020-87111464
  • E-mail:aukzllyy@scut.edu.cn

咨询工作人员