国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:吴培良,张彦,毛秉毅,陈雯柏,高国伟
单位:燕山大学,燕山大学,燕山大学,北京信息科技大学,北京信息科技大学
关键词:机器人操作技能学习; 强化学习; 稀疏奖励; 最大熵方法; 自适应温度参数; 元学习
基金:国家重点研发计划项目(2018YFB1308300), 国家自然科学基金区域联合基金项目(U20A20167), 北京市自然科学基金项目(4202026), 河北省自 然科学基金项目(F202103079)资助.
基于深度强化学习的机器人操作技能学习成为研究热点, 但由于任务的稀疏奖励性质, 学习效率较低. 本文提出了基于元学习的双经验池自适应软更新事后经验回放方法, 并将其应用于稀疏奖励的机器人操作技能学习问题求解. 首先, 在软更新事后经验回放算法的基础上推导出可以提高算法效率的精简值函数, 并加入温度自适应调整策略, 动态调整温度参数以适应不同的任务环境; 其次, 结合元学习思想对经验回放进行分割, 训练时动态调整选取真实采样数据和构建虚拟数的比例, 提出了DAS-HER方法; 然后, 将DAS-HER算法应用到机器人操作技能学习中, 构建了一个稀疏奖励环境下具有通用性的机器人操作技能学习框架; 最后, 在Mujoco下的Fetch和Hand环境中, 进行了8项任务的对比实验, 实验结果表明, 无论是在训练效率还是在成功率方面, 本文算法表现均优于其他算法.
来源:2024年第1期
《控制理论与应用》期刊编辑部