它不需要进行训练, 也不需要微调。这个被称为冻结了的GPT-6 Astra的系统, 只需要观看几段示范内容。随后, 它就可以操控双臂机器人了。这就是RoboICL的做法。
它将推理过程中的学习能力推进到了一个非常大的规模状态。这种规模体现在它能够处理30项任务上。同时, 它还涉及929条可以被回放记录的指令数据。
01冻结模型加少量示范
RoboICL的核心思路是把GPT-6 Astra的参数冻结住, 不去训练那些专门针对某个任务的VLA, 仅仅在推理的时候注入少量的、跟当前任务一样的示范数据, 以及机器人自己之前执行的动作历史, 这么一来, 模型就能直接把双臂动作输出出来了。
现在这个普通的视觉语言模型已经可以认出东西, 也能听懂人话去照做, 但是想让机器人动手干活, 还得想办法把脑子里想做的事变成一连串不停的运动动作, 而且在抓不住东西或者跑偏了的时候, 还得能自己调整回来, 这件事目前还是很难做到, 所以才需要拿出RoboICL这个办法来解决。
02四类任务与官方控制器对比
这次评测的内容覆盖了四大类任务, 这四类具体是Open、Memory、Precision和Long-Horizon任务, 总共计30项。
当把它和零样本RoboProbe进行比较时, 发现RoboICL的表现有所提升, 它在上述四类任务当中, 分别提高了大约20到27个progress-score points。
Open 任务没有专家示范。RoboICL 仅靠任务描述、当前视觉状态以及本 episode 交互记忆, 拿到了 54.75 分。这说明, 在线经验的组织方式本身, 就可能显著改变冻结模型的控制能力。
03执行回执与具身上下文
每次进行动作执行以后, 系统会将执行回执返回给模型。这个回执里包含了实际执行的步数。它还指出了哪些后缀是被截断掉的。它说明控制器是不是发生了中断。它还给出了执行之后产生的新观测情况。这些内容的作用是让模型去把各个动作和它们对应的后果进行一一匹配。
示范方面提供任务过程和动作先验, 当前观察与交互记忆则在处理本次布局中的物体偏移和插入误差, 三者共同构成模型可读取的具身上下文。
04锚点记忆与预算分配
RoboICL采用的是有界锚定内存这种机制。它会固定保留最初那次交互的信息。然后在时间轴上设置若干个点作为锚点。与此同时, 它也会保留最近一次完成的那次交互的内容。单示范的总预算设定为24, 也就是J+B等于24的情况。其中J代表的就是示范块的数量, B则代表交互记忆槽位的数量。
GPT-6 Astra, 会通过受约束的Act接口进行输出, 它输出的H×14动作矩阵, 是用来描述双臂笛卡尔增量与夹爪目标的, 请求前缀由任务指令、示范和相机标定构成, 并且就只有最新交互附近是在持续发生的变化的。
05真实机器人与跨场景验证
在《Build Tower》这个任务里面, 五布局面板的数据显示出这么一个结果, 那就是RoboICL的表现, 从使用零样本时得到的十六分, 一直提升到了使用一个示范时达到的一百分;当把任务的难度扩大为五十个布局的时候, 使用一个示范所能得到的平均分是八十点六零, 这个情况充分说明了相关的提升效果并不是仅仅局限在某一个单独的示例上面的。
公开的那个叫layout零点轨迹的东西, 展示了模型是怎么利用最新出现的腕部视角,去修正覆盖位置和抓取高度的这个过程的, 真实机器人的实验, 又进一步验证了跨embodiment的示范适应能力。
06完整证据链与方法定位
在项目页面里, 你可以拿到包含三十个任务在内的完整结果展示。这里还有个针对十个任务的对照面板, 方便大家对比查看。另外, 项目中包含了真实机器人实验的相关过程记录, 还有九百二十九条能够根据布局进行逐条核查的三视角执行记录。
这些数据都公开在网络上, 大家拿着这些数据和GPT-as-Policy这个公开结果的对应数据放在一起进行比较和验证。
RoboICL它并不是说是一个全新的预训练模型, 它实际上是一种方法, 这个方法就是让那些通用的模型在最终部署的时候也能够继续进行学习, 至于为什么能这样做, 是因为我们把演示的内容以及执行的历史信息, 全部都统一组织成了同一种语言格式, 这种格式就是所谓的观察接动作再接回执最后再回到观察的这个循环结构, 正因为这样, 机器人在运行过程中就不需要去白白等待参数更新这样一个漫长的过程, 它就可以直接对自身的行为了进行调整。
你心里头有没有想过这种叫做法则“冻结模型再加上在线演示”的那种路子, 到底会不会在最后把那个专门给某一个任务用的VLA训练方式给替换掉呢? 快来下面留言咱们一起聊聊, 要是觉得这东西挺有用的话, 就请点个赞把它分享给你那些特别关心机器人这一块的朋友。


