首页
学习
活动
专区
圈层
工具
发布

机器人进入真实世界,强化学习也该换种玩法

作者|毛心如

如果一个机器人已经知道锤子怎么拿、钉子往哪敲,它就能钉好钉子吗?

答案未必。

真挥锤时,机械臂要在极短时间内完成加速、对准、击打,再迅速卸掉反冲力。慢一点,力道不够;偏一点,钉子歪斜;中间若因等待模型推理而停顿,前面积累的速度瞬间归零。

正确动作不是某个静态终点坐标,而是一整段连续过程,速度、加速度、衔接节奏,每一步都关乎成败。

这是机器人从 Demo 走向真实场景后,绕不开的坎。

过去两年,具身智能的核心命题是会不会。VLA、世界模型、基础策略不断堆规模,想让同一个模型应对更多任务。

可当模型把机器人推到基本会做的门槛上,另一类问题浮出水面。

知道杯子在哪,倒水总差几毫米;知道拆箱步骤,刀片切入总偏一点;知道投掷动作,却无法根据目标距离调整释放速度。

Demo 里,这些都是差一点;真实部署中,差一点就是失败。

这说明,具身智能正经历一次重要转向:过去关心能不能学会,现在关心学会之后,能不能长期稳定地做成事。

于是新问题来了,既然机器人已经进入真实世界,训练,是否也该进入真实世界?

星尘智能发布的SmoothRL,恰好回应其中一个具体又绕不开的问题:当机器人一边执行动作、一边等待大模型下一轮推理时,在线强化学习究竟该从哪些动作里学?

技术报告来源:https://www.astribot.com/en/research/SmoothRL

基础模型教会机器人以后,

真正的难题才开始

过去两年,行业大量资源投入 VLA、世界动作模型研发,通过海量示教数据预训练,目标是让单一基座模型掌握尽可能多的操作技能。

这是通用机器人必经的上半场。

但大量真机落地实践证明,模型泛化能力和物理环境下的任务可靠性,是两套完全不同的能力。

基座模型从海量数据中学到的是具有一定泛化能力的行为模式,面对现实世界里物体摆放偏移、摩擦力变化、光照扰动、本体微小磨损,很容易产生毫米级、毫秒级的系统性偏差。

这些长尾场景,很难全部塞进预训练数据集。

因此,基座模型训练完成,也不代表机器人产品能力就走到了终点。

同时一条全新的技术进化链路正在浮现:预训练部署上岗获取真实环境反馈后训练微调重新部署。

基座模型负责打通广泛任务的通用泛化,而后训练则扎根真实作业现场,专门攻克特定任务的可靠性短板。

这也是 Online RL(在线强化学习)重新受到关注的原因:机器人真正工作之后,真实环境会不断产生预训练阶段难以覆盖的数据,而RL 提供了一种利用这些反馈继续优化策略的方式。

但现实世界还有一个约束:机器人没有暂停键,不能停下来等大模型完成推理。

随着 VLA 基座模型规模越来越大,单次推理耗时随之变长。

如果采用传统同步推理模式:机器人原地等待模型算完整段动作,算完再动;遇到投掷、敲击这类高动态任务,等待停顿会直接丢失运动动能,任务直接失败。

于是,异步推理(Asynchronous Inference)成为解决这一矛盾的一种重要方式。

机器人继续执行上一轮已经下发的动作,后台模型并行计算新的动作块(Action Chunk);新动作计算完成后再切换执行,尽可能把模型推理时间隐藏在机器人运动过程中。

但这也带来了一个新的问题:模型生成的动作,和机器人真正执行的动作,不再完全一致。

而对于强化学习来说,这恰恰是一个必须解决的问题。

机器人不能停下来等模型,

SmoothRL 要解决的其实是一笔账

以常见配置为例,模型一次性生成一段 32 帧的动作块。

由于推理耗时覆盖了 6 个控制周期,当新动作块计算完毕时,机器人已经执行完了前 6 帧;而动作块末尾的 20 帧还没来得及运行,就被下一轮新生成的动作直接覆盖丢弃。

于是出现了核心矛盾:模型规划的完整 32 帧,不等于机器人真正执行的 6 帧。

传统在线强化学习算法几乎都默认同步执行假设,会把完整动作块全部当做成绩单来计算梯度更新策略。

这就会出现严重的信用分配问题:任务成功时,那些从未被执行过的动作也跟着记功;任务失败时,那些从未发生的动作也跟着背锅。

学习信号被大量无效动作污染,训练与真实部署之间出现了巨大的错位。

SmoothRL 要解决的就是这个问题,它的设计包含两个核心层面。

第一,对动作块做三段式划分,并采用不对称梯度更新:

已提交区域(Committed Region):这部分动作已经被提交执行,本轮策略无法修改。

执行区域(Execution Region):这是整套动作块中机器人实实在在运行、并产生真实物理反馈的片段,也是唯一应该被用来学习的片段。

丢弃区域(Discarded Region):还没来得及执行就被下一轮动作块覆盖,排除在策略更新之外。

在算法实现上,价值网络(Critic)需要看到已提交区域+执行区域的全部信息。

因为机器人运动是连续过程,加速、转向等物理状态承接自上一段运动,Critic 需要看到完整的前序动作才能准确理解当前状态。

但策略网络(Actor)在反向传播梯度更新时,梯度只允许穿过执行区域。

简单来说,Critic 要看到完整的上下文来评估状态,但不能让已经发生且无法改变的动作,来影响当前策略的优化方向,Actor 只对真正执行过的动作负责。

第二,贯彻训练即部署的工程原则。

很多方案在训练阶段使用理想的同步环境,到产品部署时才切换异步模式。

SmoothRL 则选择在训练轨迹生成(rollout)阶段就完整运行异步推理环路,让训练经历的推理延迟、动作切换和执行节奏与真实部署保持一致。

也就是说,它追求的不只是场景对齐,还要对齐机器人真正执行动作的时间节奏。

此外,为了防止强化学习为了追求成功率而学出抖动、突兀或有安全风险的激进动作,SmoothRL 还加入了平滑性约束,同时关注速度、加速度和加加速度。

这也是「Smooth」命名的由来,成功不是部署的唯一指标,动作还必须连贯、稳定、可执行。

从差一点到稳定做成,

机器人开始在工作中修正自己

星尘智能的自研绳驱机器人本体 S1 为 SmoothRL 提供了验证平台。

S1 采用绳驱传动设计,能模仿人的核心运动指标,在末端最高速度、最大加速度、重复定位精度上具有天然优势,这种高动态硬件能力,为投掷这类对机器人较难高动态任务提供了硬件基础。

值得一提的是,目前同类算法研究大多停留在静态高精度任务,高动态真机在线 RL 的公开验证案例相当稀缺。

星尘智能在 S1 上完成三项覆盖高动态与高精度的典型任务真机验证,都获得了显著提升。

动态物体投掷,机器人抓取物体投掷至目标容器,成功率由 39%提升至 94%。

这项任务要求手臂在摆动过程中持续加速、在准确时刻释放,全程不能中断控制。

一旦在动作块边界发生停顿,已积累的动能可能归零,这是异步推理必须解决的典型场景,也是 SmoothRL 差异化能力的集中体现。

笔帽装配,双臂完成笔与笔帽的对位,允许误差仅 5 毫米,成功率由 8%提升至 83%。

纸箱开箱,约 1 毫米宽的刀片对准仅 2-3 毫米的纸箱缝隙切割胶带,成功率由 30%提升至 90%。

三个任务放在一起看,刚好覆盖了两类机器人能力:投掷考验高速、连续的动态控制,笔帽装配和开箱则考验精细操作中的空间精度。

比成功率数字更值得关注的是错误模式的本质变化。

预训练基座模型往往表现出方向性极强的系统性偏差:投掷时不能根据目标远近调整释放速度,开箱时刀片固定向左偏移,笔帽装配面对不同位置输出动作几乎一成不变。

经过 SmoothRL 在线迭代后,这些系统性偏差得到修正,机器人不需要重新学习整项技能,而是在原有策略基础上不断校准。

这也是 Online RL 对机器人产业化最直接的价值:它未必需要重新教机器人一项技能,而是把基本能做继续推向稳定可做。

从商业落地视角看,成功率差距会被作业频次成倍放大。

如果一项动作每天重复 1000 次,99% 成功率代表一天 10 次故障;95% 成功率则是 50 次故障。

机器人产品的商业竞争力,也在从能不能做出来 Demo,转向失败率是否低到足以投入业务使用。

当然,SmoothRL 的边界也需要客观看待。当前方案仍依赖任务成功/失败奖励,支持人工介入,并主要在冻结的基础策略附近做残差修正。

它还不能与完全自主进化画等号,真正的自我进化依赖于机器人稳定性、易用性以及对海量长尾情况的处理。

更准确的定位是,它实现了部署真实数据反馈模型更新的闭环校准。

把 SmoothRL 放回星尘智能的完整技术体系,闭环逻辑会更加清晰。这也构成了这家公司的两层核心护城河:

第一层,完整的软硬件全栈闭环。

AI 模型、具身操作系统与绳驱机器人本体形成完整链路:本体执行任务产生真实物理数据SmoothRL 进行在线优化生成新策略下发部署机器人再次执行产生更多数据。

在这个循环里,本体既是执行终端,也是数据源头;RL 则成为把真实执行反馈重新转化为策略能力的中间环节。

机器人部署出去之后,价值并没有停留在交付这一刻,每一次真实执行,都可能成为下一轮优化的输入。

第二层,模型技术路线的持续演进:

Agent(Philia):理解人类意图与长期任务

基座模型(Lumo 系列):提供通用操作能力与泛化性,Lumo-1 理解为什么这样动,Lumo-2 进一步预测这样动之后世界会怎么变

机器人本体 S1、T1:在物理世界执行,并持续产生真机数据

SmoothRL:根据真实世界反馈,精准修正动作

真实数据再反哺模型,进入下一轮迭代

五层环环相扣,从理解到执行到反馈到再学习,构成一条完整的进化链条。

长久以来,行业习惯了训练部署结束的线性思维:实验室里把模型训练完毕,交付后能力就此固定。

而机器人规模化落地的未来,需要切换成循环思维:训练部署上岗实际作业产生反馈后训练再部署。

这意味着未来机器人公司的竞争壁垒,不再只是谁的参数量更大、Demo 更惊艳、数据集更多,而是谁能让真实上岗作业这件事,成为模型持续进化的来源。

基座大模型教会机器人应该怎么做;而真实物理世界中一次次成功与失败,继续告诉它怎样才能做得更稳、更准。

SmoothRL 解决的只是异步在线强化学习这一个具体的技术难题。

但它指向的命题更大:当机器人真正投入工作之后,工作本身,能否成为它下一轮进化的训练素材?

未来的机器人,出厂时不是能力的终点。日复一日上岗作业的过程,就是它持续打磨动作精度的过程。

真正的 Physical AI,不只是服务器上表现优异的模型,更是一台可以在不停机、充满扰动的现实世界中,边运行、边学习、边成长的机器。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OxEhYcS-xVlOdWgQOXGSjXhw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券