国内刊号:44-1240/TP
国际刊号:1000-8152
发布日期:
作者:张昌昕,张兴龙,徐昕,陆阳
单位:国防科技大学,国防科技大学,国防科技大学,国防科技大学
关键词:机器人; 安全强化学习; 约束马尔可夫决策过程; 鲁棒性
基金:国家自然科学基金项目(62003361, U21A20518)资助.
强化学习是一类通过与环境交互实现序贯优化决策的机器学习方法, 已经在游戏、推荐系统及自然语言处理等任务中得到了应用. 然而, 强化学习算法应用于真实世界中的机器人系统时, 如何保证安全性仍然面临挑战. 近年来, 针对机器人系统的安全强化学习方法研究已经成为热点方向, 获得了机器人和强化学习领域的广泛关注. 本文结合现有的工作, 综述了安全强化学习理论和方法的重要成果和发展趋势, 并重点关注了现有方法在机器人领域的适用性. 本文首先给出了安全强化学习的一般问题描述. 其次, 从方法和性能的角度重点介绍了该领域的最新重要进展, 包括约束策略优化、控制障碍函数、安全过滤器和对抗性博弈训练等方法, 以及安全强化学习方法在地面移动机器人系统、无人飞行器和其他机器人系统中的应用情况. 最后, 对该领域的未来研究方向进行了展望和探讨.
来源:2023年第12期
《控制理论与应用》期刊编辑部