声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:吴培良,袁旭东,毛秉毅,陈雯柏,高国伟
单位:燕山大学,燕山大学,燕山大学,北京信息科技大学,北京信息科技大学
关键词:多智能体系统; 强化学习; 注意力机制; 自适应熵; 执行–评价
基金:国家重点研发计划项目(2018YFB1308300), 国家自然科学基金项目(62276028, U20A20167), 北京市自然科学基金项目(4202026), 河北省自然 科学基金项目(F202103079), 河北省创新能力提升计划项目(22567626H)资助.
在执行–评价算法和最大熵强化学习算法中分别存在价值函数过高估计和温度参数脆弱性的问题, 从而导致策略网络陷入局部最优. 针对此问题, 本文提出了一种基于双集中注意力机制与自适应温度参数的多智能体强化学习算法. 首先, 要构建出两个初始参数不同的具有注意力机制的评价网络, 通过这两个评价网络对策略网络做出更加准确的评价, 从而避免出现过高估计问题而导致策略网络陷入局部最优. 其次, 本文提出了自适应温度参数的最大熵强化学习算法, 计算出每个智能体的策略熵和基线熵, 从而动态调整温度参数以实现自适应调整智能体的探索. 最后, 在受限的合作导航环境和受限的宝藏收集环境中验证了本文算法的有效性, 本文算法的平均总成本与平均总惩罚优于其他算法.
来源:2024年第10期
《控制理论与应用》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。