机器人不能停下来等模型:星尘发布SmoothRL,让在线强化学习跟上大模型的异步推理|华兴的朋友们

真实机器人没有“暂停键”。

现在的VLA、World-Action Model往往一次生成未来一段时间的动作序列,也就是action chunk。模型越来越大,推理时间也越来越长,但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里,一次停顿就可能让已经积累起来的速度掉下去,导致整个任务失败。

所以真实部署里更常见的方式是异步推理:机器人继续执行手头的动作,模型同时在后台计算下一段。简单说,手上做A,模型已经在算B。

但这给在线强化学习带来了一个新的问题:模型一次生成了一段动作序列(action chunk),进入物理世界的真正会用的,却往往只有其中一部分。模型“计划过”的动作,和机器人“真正做过”的动作,不再完全相同。

近日,星尘智能(Astribot)基座模型团队发布能异步执行的在线强化学习框架SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL到底该从哪些动作里学

是继本周前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能之后的又一重大消息。

SmoothRL首次将这类异步online RL放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。

图注:SmoothRL整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线RL会根据真实执行结果更新动作策略。

异步执行之后,RL为什么会“对错账”?

传统在线RL往往默认一种更规整的节奏:模型先算出动作,机器人执行,再根据结果更新策略。模型生成什么,机器人就执行什么。

异步执行打破了这个对应关系。等一段新的action chunk算出来,机器人已经沿着上一轮指令往前做了一截;而这一段新动作还没全部执行完,下一轮推理结果又可能到来,把后半段直接替换。于是,一整段action chunk里,有些动作已经来不及改,有些真正执行了,还有一些根本没有发生。

如果强化学习仍然把整段动作一起拿来优化,就会出现一个很直接的问题:机器人来不及改或没做过的动作,也可能因为这次任务成功而被“记功”,或者因为失败而“背锅”。

SmoothRL先把这笔账拆清楚。它将action chunk按执行状态分成三个区域:

  • 已提交区域(committed region):这些动作已经被上一轮推理“提交”了,不能再改变,确定会执行。

  • 执行区域(execution region):当前这轮新生成、机器人实际上会执行的动作。

  • 丢弃区域(discarded region):这些动作虽然模型生成过,但机器人根本不会执行,因为下一轮推理会把它们替换掉了。

训练的时候,不能把这三部分一视同仁。SmoothRL的核心思想就是:机器人真正执行了什么,就只对什么进行强化学习。也就是说,只让梯度穿过execution region(执行区域)。

这样训练出来的模型,优化目标才和机器人真实运行时经历的过程一致。第二步,是让训练和部署遵守同一套时间节奏。SmoothRL在训练rollout中就直接运行异步推理:模型计算和机器人执行并行发生,replay buffer记录的也是这种真实时间关系下产生的轨迹。团队将这一原则概括为Reinforce in Deployment(在部署强化学习)——不是先在一个理想的同步世界里训练,再换成异步方式部署,而是从训练开始就面对机器人真正会遇到的执行动态。

在论文的具体实现中,团队采用针对各任务微调后的π0.5作为基础策略,并沿用RLT的基本骨架,用轻量TD3-style actor-critic在原始动作空间预测residual correction。S1以30Hz执行动作,推理请求频率为5Hz,即每200ms得到一个新的action chunk。基础策略每次预测32帧动作;在固定延迟预算下,Committed与Execution共占12帧,其中6帧属于本轮真正执行的Execution Region,其余20帧在执行前会被后续chunk覆盖。

图注:SmoothRL将异步action chunk划分为Committed/Execution/Discarded三个区域,并只让价值梯度通过真正执行的Execution Region。

从高速投掷到毫米级插入,测试两类真实部署难题

团队在绳驱本体星尘智能S1上测试了三项真机任务,覆盖两类常见且互补场景:高速动态操作与高精度双臂操作

特别是高动态任务:机器人动作变化很快,如果每一步都等模型算完再执行,就会卡顿,所以必须采用异步推理。

动态投掷:39%→94%。机器人需要从随机位置抓取物体,再投进不同位置的目标箱。这个任务不是到达一个目标位姿就结束,而是要求手臂在摆动过程中持续积累速度,并在准确时刻释放。论文特别指出,一旦在action chunk边界发生停顿,手臂可能几乎降到静止,剩余摆动很难重新恢复所需释放速度。因此,它对异步执行尤其敏感。在累计250个rollout episodes的评估节点,成功率从基础策略的39%提升至94%。

给笔戴帽:8%→83%。双臂需要把笔和笔帽精确对齐,允许的相对位姿误差约为5mm。基础策略通常已经能到达目标附近,但对不同笔帽位置的微小变化适应不足。最终成功率从8%提升至83%。

快递开箱:30%→90%。机器人需要用约1mm宽的刀片插入仅2—3mm宽的箱盖接缝,再沿接缝切开胶带。基础策略存在稳定左偏。值得注意的是,它的学习曲线并非一路上升:150个rollout episodes时成功率一度从30%降到20%,随后回升至40%,最终达到90%。真实在线探索并不一定单调变好。

图注:三项真机任务随累计rollout episodes增加的成功率变化。

比成功率更值得看的是,机器人的“错法”变了。

RL之前,三项任务都有明显的系统性偏差:投掷时不能根据目标距离正确调节释放速度;开箱时刀片持续向左偏;给笔戴帽时,对不同笔帽位置产生过于相似的动作。在线RL做的,就是利用真实执行结果,一点点把这些固定偏差修回来。

到最终checkpoint,失败已经明显向成功位置收缩。开箱任务的失败样本中,刀片相对接缝的左右偏差约为1—2mm;给笔戴帽的失败样本也主要变成了正确位置附近的小幅错位。

所以这里的RL,并不是从零重新教机器人“什么叫开箱”,而是在做一件更接近部署的问题:把一个已经基本会做的策略,继续练到足够准确。

而且,更准的同时还要兼顾动作平滑性。通过在策略中加入平滑性约束,在一次真实自主投掷rollout中,经过在线RL后,右侧末端执行器的加速度均方根下降了 52%,急动度(Jerk)下降了47%。也就是说,机器人不仅成功率更高,突然加速、减速和方向变化也更少,整个投掷过程更平稳、更连续。

图注:动态投掷中的Velocity/Acceleration/Jerk对比

机器人开始工作以后,训练还没有结束

过去几年,机器人基础模型主要解决的是“会不会”:用更多数据、更强模型,把能力做宽。但机器人真正进入真实环境以后,新的问题往往不是完全不会,而是差几毫米、差半拍,或者换一个物体位置就不够稳定。

SmoothRL关注的是这之后的一层:一个已经具备基础能力的pretrained policy,进入真实世界以后,能不能继续根据真实执行结果修正自己。

论文当前使用的是稀疏的任务成功/失败奖励,训练过程中操作员也可以在必要时介入,介入动作属于raw action space中,并可直接用于后续的模型训练。因此,这还不是完全无人参与的“自主进化”,而是一套面向真实部署的更高效的在线后训练机制。

它也有明确边界。当前实现要求每次chunk-level inference都在预设latency budget内完成;轻量residual policy的表达能力也受到冻结基础策略限制。如果基础策略本身离目标行为太远,局部residual correction并不能凭空把它救回来。

下一步,团队计划进一步探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

SmoothRL指向的是一个正在变得越来越具体的问题:预训练让机器人学会怎么做,真实世界里的后训练,再把这些能力练得更准、更稳、更可靠。

SmoothRL背后,延续了星尘在机器人模型上一条独特的长期判断:动作不是视觉或语言模型最后附带生成的结果,而应该成为机器人智能里的“第一公民模态”。因为机器人最终不只是为了看懂世界,更要在物理世界正确行动。所以Lumo系列基座模型始终关注“为什么要这样动”,从Lumo-1的显式推理、到Lumo-2预测世界因动作带来的变化,都在沿此思路发展。

在这条主线下,星尘也形成了从前端Agent、中间基座模型、到RL后训练的完整模型布局:Agent负责交互、记忆、理解任务与调用能力,基座模型逐步形成开放场景里可泛化的通用操作能力,RL再从真实执行中的成功、失败和反馈中修正策略、持续进化。

在模型全面发展时,星尘“AI模型-具身OS-绳驱本体”的全栈系统也在持续迭代,推动Physical AI的应用与规模化部署。

SmoothRL由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。

免责声明:本文由星尘能授权转发,谨供读者作参考用途,不应被视为在任何地区针对任何证券的研究报告,不构成买卖、认购证券或其它金融工具及产品的邀请或保证。读者不应仅依靠本文、而应按照自己的判断作出投资决定,并在作出任何投资行动前咨询专业意见。华兴资本不就本文内容作出任何陈述或保证,亦不承担因对本文的使用、不当使用、依赖、分发或占有而产生的任何责任。

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论