国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:刘健,赵恒一
单位:中国矿业大学,中国矿业大学
关键词:深度强化学习; 探索; 专家样本; 确定性策略
基金:国家自然科学基金项目(61906198), 江苏省自然科学基金项目(BK20190622)资助.
为进一步提高深度强化学习算法在连续动作环境中的探索能力, 以获得更高水平的奖励值, 本文提出了基于自生成专家样本的探索增强算法. 首先, 为满足自生成专家样本机制以及在连续动作环境中的学习, 在双延迟深度确定性策略梯度算法的基础上, 设置了两个经验回放池结构, 搭建了确定性策略算法的总体框架. 同时提出复合策略更新方法, 在情节的内部循环中加入一种类同策略学习过程, 智能体在这个过程中完成对于参数空间的启发式探索. 然后, 提出基于自生成专家样本的演示机制, 由智能体自身筛选产生专家样本, 并根据参数的更新不断调整,进而形成动态的筛选标准, 之后智能体将模仿这些专家样本进行学习. 在OpenAI Gym的8组虚拟环境中的仿真实验表明, 本文提出的算法能够有效提升深度强化学习的探索能力.
来源:2023年第3期
《控制理论与应用》期刊编辑部