▸ 上海期智研究院研发RL-100学习框架
出处据外媒报道,上海期智研究院(Shanghai Qi Zhi Institute)的研究人员近日开发出一种名为RL-100的新型人工智能(AI)学习方法,可帮助机器人更快掌握新技能,并在不断变化的环境中稳定完成任务。
▸ 提升机器人抗环境扰动能力未对上原文
▸ 实现100%任务成功率未对上原文
▸ 机器人应用场景包括家庭、公共场所、办公室、工厂和医疗保健
出处盖世汽车讯 机器人正逐渐进入家庭、公共场所、办公室、工厂以及医疗保健等各类场景。
▸ 研究人员开发RL-100融合模仿学习和强化学习
出处RL-100融合了两种AI训练方法——模仿学习(imitation learning)和强化学习(reinforcement learning)。
▸ 论文发表于《Science Robotics》期刊
出处该团队在发表于期刊《Science Robotics》的一篇论文中介绍了这一框架。
▸ 第一作者Kun Lei指出机器人需在真实环境中稳定可靠
出处论文第一作者Kun Lei在接受Tech Xplore采访时表示:“这一项目源于我们反复观察到的一个差距:机器人能够成功演示某项任务,并不意味着它能够在真实世界中稳定可靠地完成这项任务。
▸ 模仿学习提供良好起点,但无法覆盖所有失败情况
出处Kun Lei称:“模仿学习通过让机器人学习人类示范,为其提供了良好的起点,但有限的示范数据无法覆盖所有失败情况、外部扰动或意外场景。
▸ 强化学习作为机器人策略的后训练阶段,优化决策能力
出处Kun Lei表示:“我们思考,强化学习是否可以像基础模型(foundation models)的后训练(post-training)一样,作为机器人策略的后训练阶段。
▸ RL-100学习框架包括三个阶段
出处研究团队提出的RL-100学习框架主要包括三个阶段。
▸ 目标是弥合示范到可靠执行之间的差距
出处我们的核心目标,是弥合从示范到可靠执行之间的‘最后一公里’差距,不仅提升任务成功率,还提高执行速度、鲁棒性以及从错误中恢复的能力。