控制理论与应用

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:44-1240/TP

国际刊号:1000-8152

控制理论与应用杂志2024年第1期:融合元学习和PPO算法的四足机器人运动技能学习方法

发布日期:

作者:朱晓庆,刘鑫源,阮晓钢,张思远,李春阳,李鹏

单位:北京工业大学,北京工业大学,北京工业大学,北京工业大学,北京工业大学,北京工业大学

关键词:四足机器人; 步态学习; 强化学习; 元学习

基金:国家自然科学基金项目(62103009), 北京市自然科学基金项目(4202005)资助.

具备学习能力是高等动物智能的典型表现特征, 为探明四足动物运动技能学习机理, 本文对四足机器人步态学习任务进行研究, 复现了四足动物的节律步态学习过程. 近年来, 近端策略优化(PPO)算法作为深度强化学习的典型代表, 普遍被用于四足机器人步态学习任务, 实验效果较好且仅需较少的超参数. 然而, 在多维输入输出场景下, 其容易收敛到局部最优点, 表现为四足机器人学习到步态节律信号杂乱且重心震荡严重. 为解决上述问题,在元学习启发下, 基于元学习具有刻画学习过程高维抽象表征优势, 本文提出了一种融合元学习和PPO思想的元近端策略优化(MPPO)算法, 该算法可以让四足机器人进化学习到更优步态. 在PyBullet仿真平台上的仿真实验结果表明, 本文提出的算法可以使四足机器人学会行走运动技能, 且与柔性行动者评价器(SAC)和PPO算法的对比实验显示, 本文提出的MPPO算法具有步态节律信号更规律、行走速度更快等优势.

来源:2024年第1期

《控制理论与应用》期刊编辑部

查看控制理论与应用杂志2024年第1期

联系我们

  • 地址:广州市天河区五山路381号 华南理工大学3号楼516室
  • 电话:020-87111464
  • E-mail:aukzllyy@scut.edu.cn

咨询工作人员