Astribot unveils SmoothRL for online RL during asynchronous robot execution
Astribot's foundation model team released SmoothRL, an online reinforcement learning framework designed for asynchronous execution, where robots continue acting while models compute the next action chunk. It addresses the mismatch between planned and executed actions in online RL and was validated on real high-dynamic throwing tasks, showing online learning can adapt to continuous acceleration and precise release without pauses.
Coverage timeline
机器之心新闻资讯
真实机器人没有“暂停键”。 现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列,也就是 action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。 所以真实部署里更常见的方式是 异步推理 :机器人继续执行手头的动作,模型同时在后台计算下一段。简单说, 手上做 A,模型已经在算 B。 但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。 近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution) 。解决的是 大模型异步推理成为真实部署常态后,与之适配的online RL 到底该从哪些动作里学。 图注:技术报告+无剪辑视频: www.astribot.com/en/research/SmoothRL SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。 图注: SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。 异步执行之后,RL 为什么会“对错账”? 传统在线 RL 往往默认一种更规整的节奏:模型先算出动作,机器人执行,再根据结果更新策略。模型生成什么,机器人就执行什么。 异步执行打破了这个对应关系。等一段新的 action chunk 算出来,机器人已经沿着上一轮指令往前做了一截;而这一段新动作还没全部执行完,下一轮推理结果又可能到来,把后半段直接替换。于是,一整段 action chunk 里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生。 如果强化学习仍然把整段动作一起拿来优化,就会出现一个很直接的问题: 机器人来不及改或没做过的动作,也可能因为这次任务成功
