Back to News

RL-100 framework combines imitation and reinforcement learning for robust robot manipulation

#reinforcement-learning#imitation-learning#robotics#diffusion-models

Researchers introduced RL-100, a framework published in Science Robotics on July 22, 2026, that unifies imitation learning and reinforcement learning to optimize diffusion-based robot control policies. It uses human demonstrations for a stable base, offline RL for policy improvement, and minimal online interaction for adjustment, achieving 100% success across eight real-world tasks and 1000 evaluation trials. The framework also employs consistency distillation to compress multi-step diffusion into a one-step controller for high-frequency control, matching or exceeding human teleoperation efficiency.

Coverage timeline

  1. 机器之心ScienceAI

    编辑丨\O/ 对于机器人而言,完成一个动作并不意味着真正掌握了一项技能。在实验室环境中,机器人已经能够完成越来越多复杂操作:抓取物体、整理物品、折叠衣物,甚至完成连续操作任务。 但当机器人进入真实环境时,问题会变得更加复杂。高成功率,高稳定性,高执行效率,三者缺一不可。 为支持机器人在现实任务中的强化学习,2026 年 7 月 22 日,发表于《 Science Robotics 》的研究「 Performant robotic manipulation with real-world reinforcement learning 」提出了 RL-100 框架,通过结合模仿学习(IL)与强化学习(RL),进一步优化了基于扩散模型的机器人控制策略。 论文链接: https://www.science.org/doi/10.1126/scirobotics.aed6267 优化机器人能力 近年来,机器人学习的重要路线之一,是让机器人通过观察人类示范获得技能。 这种方法称为模仿学习。研究人员通过遥操作设备控制机器人,让机器人记录关于移动、抓握等相关测试信息。随后,模型学习这些示范数据,并生成类似的人类操作策略。 理论上,强化学习可以通过不断试错,让机器人寻找更优策略。但在真实机器人环境中,直接使用强化学习并不容易。 RL-100 针对这一问题提出了一套统一优化框架。 研究团队没有直接替换原有策略,而是在已有模仿学习策略基础上进行强化学习微调:首先利用人类示范建立稳定的行为基础,随后通过离线强化学习利用已有数据优化策略;最后通过少量真实环境交互完成在线调整。 图 1:真实机器人快照展示了任务套件的多样性。 RL-100 将仿制和强化学习统一在一个截断的近端策略优化代理目标下,应用于去噪过程,从而在离线和在线阶段实现保守且稳定的改进。为了满足部署延迟,轻量级一致性蒸馏将多步扩散压缩为一步控制器,实现高频控制。 真实世界实验显示,RL-100 在所有八项任务中均实现了 100% 的成功率,并保持了长期稳定。根据团队预估的方案,RL-100 在 1000 次评估试验中也同样实现了 100% 的成功率。在效率方面,RL-100 完成时间接近人类远程操作水平,并在多项任务中与熟练操作员匹敌甚至超越。 八项实操评估 为了验证这一框架是否能够提升机器人实际操作能力,研究团队将 RL-10