国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:左国玉,何流远,吴启飞,于双悦,李建更
单位:北京工业大学信息科学技术学院,北京工业大学信息科学技术学院,北京工业大学信息科学技术学院,北京工业大学信息科学技术学院,北京工业大学信息科学技术学院
关键词:机器人学习; 离线模仿学习; 潜在空间; 行为克隆; 条件变分自编码器
基金:国家自然科学基金项目(62373016), 多模态人工智能国家重点实验室开放项目(MAIS–2023–22)资助.
高维环境下的任务是复杂任务中常见的一种. 该类任务的特点就是任务环境的信息数据和机器人的控制数据中包含很多种类, 具有很高的特征维度. 现有的模仿学习方法因专家示教数据分布复杂, 难以快速学习到较好的策略. 本文针对由高维环境空间和复杂数据分布导致模仿学习算法训练时间过长和应用受限的问题, 设计了一种条件变分自编码器生成潜在空间特征的模仿学习算法. 通过主动降低环境空间维度, 减少神经网络复杂程度以加快训练速度; 利用动作损失预测网络和扰动层, 从输出中获得反馈以提升训练准确率. 本文通过D4RL基准测试、微软MoCapAct人形机器人的连续控制任务和人形五指手机器人复杂操作任务的仿真测试, 以验证所提算法的有效性, 结果表明, 本文所提方法表现出训练速度更快、准确率更高以及策略更稳定.
来源:2026年第5期
《控制理论与应用》期刊编辑部