上海交大研发RL-100框架:机器人像孩子一样边看边练,自主学会榨汁、折毛巾、打保龄球

打印派   2026-07-23 09:06:19

上海交通大学研究团队近日提出了一种名为RL-100的机器人学习框架,结合模仿学习与强化学习,使机器人能够自主掌握保龄球、折毛巾、拧瓶盖、倒饮料及鲜榨橙汁等复杂操作任务。在商场连续7小时的实际部署中,该机器人未出现任何失误。这一方法为机器人在非结构化环境下的技能习得与精进提供了新的技术路径。

由上海交通大学研究人员主导开发的RL-100框架,其核心理念在于将模仿学习与强化学习有机结合。研究团队从婴幼儿的学习过程中获得灵感:婴儿最初依赖父母的指导,随后通过独立练习逐步精进能力。RL-100遵循相同的哲学,构建了三阶段学习流程。

第一阶段采用模仿学习,机器人通过观察人类专家的遥操作示范,训练基于扩散策略的视觉运动模型,学习视觉输入与操作动作之间的映射关系。这一阶段为机器人提供了稳定的行为基础。第二阶段引入迭代式离线强化学习,机器人通过反复执行任务、存储经验数据,并利用示范数据与自身成功经验进行再训练,基于统一PPO目标函数精炼策略。第三阶段在物理机器人本体上进行少量在线强化学习,针对性修正偶发失误,将任务成功率从约90%提升至接近完美。

研究团队还解决了扩散策略在实际部署中的计算延迟问题,通过一致性模型蒸馏技术将推理延迟从约100毫秒压缩至约10毫秒,实现了更快的响应速度和更流畅的控制。该框架具备任务、机器人与表示形式的通用性,支持单臂/双臂机器人、单动作/动作块控制及多种视觉输入形式。

在八项涵盖刚性物体、可变形材料、液体及精密装配的测试任务中,机器人实现了100%的成功率,任务完成速度达到或超过人类遥操作专家水平,并能适应未见过的物体和环境变化。在商场连续7小时的橙汁制作部署中,机器人未出现任何失误,展示了该框架在实际场景中长期可靠运行的潜力。


0

23 0

发表评论

登陆后参与评论