国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:王成意,朱进,赵云波
单位:中国科学技术大学,中国科学技术大学,中国科学技术大学
关键词:两人零和马尔科夫博弈; 非完全信息; 极大极小Q学习; 纳什均衡; 多智能体强化学习
基金:国家重点研发计划项目(2018AAA0100802), 安徽省自然科学基金项目(2008085MF198)资助.
本文研究一类典型的非完全信息博弈问题—–对手类型未知的两人零和马尔科夫博弈, 其中对手类型多样且每次博弈开始前无法得知对手类型. 文中提出了一种基于模型的多智能体强化学习算法—–对手辨识的极大极小Q学习(DOMQ). 该算法首先建立对手相关环境的经验模型, 再使用经验模型学习纳什均衡策略, 己方智能体在实际博弈中根据经验模型判断对手类型, 从而使用相应的纳什均衡策略, 以保证收益下限. 本文所提的DOMQ算法只需要在采样阶段的每轮博弈结束后得知对手的类型, 除此之外无需知道任何环境的信息. 仿真实验验证了所提算法的有效性.
来源:2024年第11期
《控制理论与应用》期刊编辑部