研究项目
ECCV 2026

一次演示足以实现真实世界机器人强化学习

研究亮点

AutoSERL 用一条真实机器人演示轨迹自动生成训练期间的引导、恢复和退出逻辑,从而替代持续的人类遥操作干预。它在两个机器人平台上的六项接触密集型任务中,以一次演示超过使用 20 次演示初始化的 SERL、行为克隆和单次模仿学习基线,并达到接近 HIL-SERL 人工干预训练的表现。

项目概述

强化学习允许机器人通过真实交互不断改进策略,但物理世界中的探索远比仿真昂贵。稀疏奖励使机器人很容易陷入局部最优或卡死状态;无约束探索还可能造成碰撞、硬件损坏和环境破坏。

已有样本高效方法通常使用多条专家演示初始化训练,或者让人类操作员在训练过程中持续监控并接管机器人。前者的数据采集成本高,后者把系统扩展能力绑定在人的时间和注意力上。

AutoSERL 提出一个更激进的问题:能否只采集一次演示,然后从这条轨迹中自动构造原本由人类提供的干预?其答案由三个相互配合的机制组成:滑动窗口干预、安全恢复和干预终止。

AutoSERL 的自动干预、安全恢复与训练框架

1. 一条演示如何成为自动监督信号

训练开始前,研究者只需采集一条完整的任务演示轨迹。系统在轨迹上额外定义两个恢复点:recover_point0 是机器人可以安全返回的位置,recover_point1 是机器人已经与目标物体形成稳定接触的位置。

这条轨迹并不被当作必须逐帧模仿的最优答案,而是作为空间引导和失败恢复的参考。训练中的自主交互数据进入回放缓冲区,演示数据和自动干预产生的数据则进入演示缓冲区,共同用于离策略强化学习。

2. 滑动窗口干预:只向前引导,不把机器人拉回去

如果简单地把机器人拉向整条演示轨迹上的最近点,最近点可能位于已经走过的轨迹段,导致机器人向后退。AutoSERL 因此只在一个沿演示轨迹向前移动的窗口内寻找候选干预点。

系统比较演示轨迹前进方向与“当前位姿指向候选点”的向量夹角。当夹角不超过 90 度时,说明引导方向仍然向前,系统才执行干预;否则放弃该点并继续自主探索。

这个机制有两个作用:一是帮助机器人绕过局部最优和 Q 值估计误差,二是把探索限制在演示轨迹附近的相对安全区域,同时保留从演示路径进一步优化的空间。

3. 安全恢复:卡住时重放关键轨迹片段

在插入、悬挂和铰链操作中,机器人可能在接触物体后进入几乎无法靠随机探索脱离的状态。AutoSERL 使用末端执行器在一段时间内的位移判断是否停滞。

一旦检测到卡死,机器人先被引导回安全恢复点 recover_point0,随后重放演示中从 recover_point0recover_point1 的动作片段,重新建立稳定接触,再把控制权交还给学习策略。

这种方法不需要额外训练恢复策略,但也决定了它的适用边界:恢复能力只覆盖单条演示轨迹所包含的失败邻域。

4. 干预终止:从受控学习切换到自主优化

单条演示不一定是最优轨迹。如果自动干预一直存在,策略会过度依赖外部纠正,并被限制在演示行为附近。AutoSERL 因此监测每个成功回合中的干预次数;当策略能够以低于阈值的干预次数独立完成任务后,系统关闭后续自动干预。

这一设计把训练分成两个阶段:早期通过演示缩小探索空间并避免危险,后期恢复完整强化学习探索,让策略有机会超过演示者。

5. 六项真实机器人任务

实验覆盖两个机器人平台和三类接触密集型操作:

  • 插入任务:插头插入和 USB 插入。
  • 悬挂任务:衣架、修正带和勺子悬挂。
  • 铰链任务:使用钩具拉开抽屉。

这些任务要求精确位姿对齐、稳定接触控制和对扰动的鲁棒性,轻微偏差就可能造成卡死。评估阶段会关闭所有自动干预,每个任务运行 50 次,以检验最终策略能否真正独立完成任务。

AutoSERL 的六项真实机器人操作任务

6. 样本效率与成功率

在相同训练时间下,AutoSERL 在六项任务上全部达到 50/50 成功。SERL 在 USB 插入上仅为 20/50,在修正带悬挂上为 6/50,其余四项为 0/50

相同训练时间下 SERL 与 AutoSERL 的成功率

与需要持续人工接管的 HIL-SERL 相比,AutoSERL 在六项任务中的五项达到 100% 成功率所需时间更短或相同。例如,衣架悬挂分别需要 33 分钟与 48 分钟,修正带悬挂为 25 分钟与 60 分钟,勺子悬挂为 35 分钟与 70 分钟。USB 插入是唯一由 HIL-SERL 更快完成的任务,分别为 8 分钟与 6 分钟。

AutoSERL 也在全部任务上超过行为克隆和 MILES。值得注意的是,不同基线使用的演示数量并不完全相同:行为克隆在插入任务中使用 20 条演示、悬挂任务使用 10 条,而 AutoSERL 始终只使用一条。

7. 鲁棒性、消融与超越模仿

在插头插入任务的五个随机种子中,AutoSERL 均达到 100% 或接近 100% 的成功率。在初始位置加入平面内正负 3 厘米随机变化后,它仍比 SERL 收敛更快、更稳定。

消融实验显示,移除滑动窗口会延迟达到满成功率;保留滑动窗口但移除恢复机制时,机器人更容易被引导到近失败状态并无法脱离;取消干预终止后,性能会在达到峰值后下降,说明持续纠正会削弱自主学习。

论文还比较了一条长度为 99 的非最优演示轨迹和训练后策略。第一个达到 50/50 成功率的策略只需 54 步,说明方法并非复制演示,而是通过强化学习进行了轨迹级优化。

8. 局限与适用范围

AutoSERL 当前面向手持物体与单一目标物体交互的任务,并依赖人工在演示轨迹上指定恢复点。面对多样且远离演示分布的失败模式,单条轨迹提供的信息不足,恢复可靠性会下降。

此外,当前动作空间是六维末端执行器增量位姿。如何扩展到灵巧手、双臂协作等更高维控制问题,以及如何学习而不是手工指定恢复策略,是后续工作的重点。

总结

AutoSERL 的关键贡献不是证明一次演示可以直接教会机器人,而是证明一次演示可以被结构化为一套自动训练基础设施。滑动窗口负责安全引导,恢复机制处理卡死,终止准则及时归还探索自由;三者共同把持续人工干预压缩成一次前置演示,并让真实机器人强化学习在样本效率、安全性与自主优化之间取得更好的平衡。