阅读,与值得关注的内容Readance

具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

编辑|山辉

两年前,一段机器人炒虾的视频在网上爆火。


已关注
关注
重播 分享 赞
观看更多
    机器之心

    0/0

    00:00/01:17
    进度条,百分之0
    00:00
    /
    01:17
    01:17
    全屏

    倍速播放中
    您的浏览器不支持 video 标签

    继续观看

    具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

    转载
    ,
    具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
    机器之心
    已同步到看一看写下你的评论


    视频中的机械臂一手端锅、一手拿铲,把虾翻炒后倒进碗里,看起来已经很像一个熟练的厨房帮手。


    但机器人学会这套动作并不轻松。研究人员需要先亲自操控机器人完成任务,反复采集真机示范,再通过模仿学习让机器人逐渐学会独立执行。对于一个固定任务,大约要采集 50 次这样的示范。


    如今,灵初智能在相似的任务中,展示了机器人学习的另一种可能。在这组演示里,人只需要示范一遍,无需重新训练或微调模型,机器人就能把这段操作作为类似 Prompt 的上下文,尝试完成新任务。


    已关注
    关注
    重播 分享 赞
    观看更多
      机器之心

      0/0

      00:00/00:43
      进度条,百分之0
      00:00
      /
      00:43
      00:43
      全屏

      倍速播放中
      您的浏览器不支持 video 标签

      继续观看

      具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

      转载
      ,
      具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
      机器之心
      已同步到看一看写下你的评论

      人类示范「准备配菜 — 青椒下锅 — 龙虾下锅」三步流程后,Psi-R2.5 通过 In-Context Learning 按顺序复现任务,无需重新训练模型。


      同样是炒菜,两年前关注的是机器人「会不会」,现在灵初更关注机器人「怎么学」。


      对人来说,拿起锅铲,翻动食材,几乎都是下意识完成的。那能不能跳过一遍遍的采集真机数据,直接把人类的操作经验拿来训练机器人?


      灵初此前已经在沿着这条路前进。


      四月发布的 Psi-R2 和 Psi-W0 将十万小时规模的人类数据用于预训练,并通过 Psi-W0 和强化学习,把人手轨迹进一步优化成机器人能够执行的轨迹。但这意味着,Policy 与 World Model 需要反复 rollout,轨迹还要继续用强化学习微调,整个转换链路依然繁琐。


      现在,灵初智能正式发布新一代具身基础模型 Psi-R2.5。


      这一次,团队没有继续把重点停留在「十万小时人类数据」上,而是开始处理数据规模起来之后的两个新问题:哪些数据真正有价值,以及怎样让这些人类数据更顺畅地进入机器人的训练过程。


      • 项目演示与完整技术博客: Scaling Pair Data for Embodied Intelligence

        https://www.psibot.ai/scaling-pair-data-for-embodied-intelligence-zh/


      在数据转换方面有一个关键变化,既然从人类数据到机器人数据的转换很麻烦,能不能反过来,先从本来就能执行的真实机器人数据出发?


      答案落在了 Pair Data 上。


      Scaling Pair Data:

      让人类数据真正进入机器人训练


      为什么不能直接把人类视频拿来训练机器人?核心还是 Embodiment Gap。


      一方面,人手和机械手在视觉上存在差异,相机参数、环境变化等也会带来 Visual Embodiment Gap;另一方面,人类 action 与真实机器人数据之间还存在手部姿态估计、关节结构带来的运动学误差,以及摩擦力等物理参数误差,也就是 Dynamic Embodiment Gap。


      前面提到,上一代 Psi-W0 已经能够将人手轨迹优化成可执行的机器人轨迹,但每条数据仍需要经过 World Model rollout 和强化学习微调。


      Psi-R2.5 改变了 Pair Data 的构建方式。


      灵初把只按照相同任务语义收集的数据称为「弱 Pair Data」;如果图像上除本体外基本一致、时序上逐帧对应,同时 action 可以直接在机器人上 replay,则称为「强 Pair Data」。


      已关注
      关注
      重播 分享 赞
      观看更多
        机器之心

        0/0

        00:00/00:06
        进度条,百分之0
        00:00
        /
        00:06
        00:06
        全屏

        倍速播放中
        您的浏览器不支持 video 标签

        继续观看

        具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

        转载
        ,
        具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
        机器之心
        已同步到看一看写下你的评论

        强 Pair Data


        已关注
        关注
        重播 分享 赞
        观看更多
          机器之心

          0/0

          00:00/00:13
          进度条,百分之0
          00:00
          /
          00:13
          00:13
          全屏

          倍速播放中
          您的浏览器不支持 video 标签

          继续观看

          具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

          转载
          ,
          具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
          机器之心
          已同步到看一看写下你的评论

          弱 Pair Data


          团队从真实机器人数据出发,逆向生成对应的人手数据。


          这一步很有意思:最终明明是要把人类数据转成机器人数据,为什么先反过来生成一遍人手数据?


          关键在于,真实机器人数据本身已经包含可以直接使用的图像和 action。团队从这些机器人数据出发,生成与之一一对应的人手数据,就先得到了一批成对的人类 — 机器人数据。


          有了这批强 Pair Data,团队进一步训练了带 action 的端到端人类数据到机器人数据转换模型,让新的人类操作数据可以直接与机器人数据对齐。


          已关注
          关注
          重播 分享 赞
          观看更多
            机器之心

            0/0

            00:00/00:06
            进度条,百分之0
            00:00
            /
            00:06
            00:06
            全屏

            倍速播放中
            您的浏览器不支持 video 标签

            继续观看

            具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

            转载
            ,
            具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
            机器之心
            已同步到看一看写下你的评论


            那要怎么验证转换有没有用?一是可以把转换后的机器人数据直接放到真机上 replay;二是拿这些数据继续训练模型。


            最终,人只需要用普通手机或相机拍下一段操作视频,就可以通过这套 pipeline 将其转换成不同机器人的数据。


            已关注
            关注
            重播 分享 赞
            观看更多
              机器之心

              0/0

              00:00/00:17
              进度条,百分之0
              00:00
              /
              00:17
              00:17
              全屏

              倍速播放中
              您的浏览器不支持 video 标签

              继续观看

              具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

              转载
              ,
              具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
              机器之心
              已同步到看一看写下你的评论


              相比上一代,这一次真正缩短了「拿到一段人类数据」和「得到机器人真正能用的数据」之间的距离。


              从人类示范到真实任务,

              只要 1—2 个工作日


              但把人类数据转换成机器人能够使用的数据,只解决了「怎么学」的问题。


              面对具体场景,机器人还需要处理任务步骤和现场环境等一系列的变化。


              因此,Psi-R2.5 在模型结构上也做了调整。


              相比上一代 Psi-R2 和 Psi-W0 两个模型分别承担不同功能,R2.5 采用了双层架构:上层负责长程任务拆解,把一段长 instruction 分解成对应的 subtask;下层再结合当前观测,输出机器人具体的操作轨迹。其中,上层模型以 QwenVL3.5-4B 为骨干,下层则使用 Wan2.2-IT2V-5B,两者通过同一批预训练数据进行训练。



              不过,基础模型到了真实客户现场,仍然很难做到不经过额外训练,就直接应对所有任务。不同场景里的 SKU、步骤和作业节拍往往高度定制,所以后训练在相当长一段时间内仍然是必要环节。


              为此,灵初开发了一套基于灵巧手的 HIL(Human-in-the-Loop)+ RL 后训练框架:只需要少量数据,就可以在基础模型上继续微调;部署过程中出现的失败案例,也会实时回流,用于后续迭代。


              来看一个直观例子:手机盒装配。


              这是一个步骤很多、同时对精细操作要求很高的任务。如果直接从零开始用模仿学习训练,成功率很低;而在 HIL 和后训练 RL 的基础上,经过几轮迭代后,成功率可以提升到 99%,整个过程只需要 1—2 个工作日。


              已关注
              关注
              重播 分享 赞
              观看更多
                机器之心

                0/0

                00:00/02:38
                进度条,百分之0
                00:00
                /
                02:38
                02:38
                全屏

                倍速播放中
                您的浏览器不支持 video 标签

                继续观看

                具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

                转载
                ,
                具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
                机器之心
                已同步到看一看写下你的评论


                Scaling Pair Data 解决了怎样让人类示范成为机器人真正能用的训练数据,而 HIL 和 RL 则是让模型在进入具体现场之后,能更稳定地完成任务。


                对于临时出现的新任务,Psi-R2.5 还探索了另一种更轻量的方式:In-Context Learning。人先示范一遍,再把这段轨迹作为类似 Prompt 的上下文输入,让机器人根据示范完成之前不会的任务。


                机器人的 context 和语言模型还有一点不同,它不是单纯的一段文字,而可以是一段人类示教视频。


                借助前面的强 Pair Data 转换能力,人类示范可以先被转换成对应的机器人数据,再作为 Prompt 输入模型。ICL 可以让机器人在不更新模型参数的情况下,根据文本提示或物理提示,对新任务进行零样本泛化。


                已关注
                关注
                重播 分享 赞
                观看更多
                  机器之心

                  0/0

                  00:00/00:39
                  进度条,百分之0
                  00:00
                  /
                  00:39
                  00:39
                  全屏

                  倍速播放中
                  您的浏览器不支持 video 标签

                  继续观看

                  具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

                  转载
                  ,
                  具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
                  机器之心
                  已同步到看一看写下你的评论


                  从实际使用上看,这两种方式可以对应不同的任务需求:需要长期稳定执行的任务,可以继续通过后训练和现场数据迭代;面对新的任务,则可以通过示范和上下文学习,更轻量地完成适配。


                  十万小时之后,

                  数据 Scaling 开始比拼「信息量」


                  假设有 10000 小时数据,覆盖 100 个任务,每个任务重复 100 小时;另一批数据只有 100 小时,同样覆盖 100 个任务,每个任务只有 1 小时。


                  两者时长相差 100 倍,但真正包含的任务信息量,可能并没有那么大差别。


                  因此,在人类数据达到十万小时量级之后,Psi-R2.5 开始主动压缩重复数据:减少单个任务的数据量,在相同数据规模下尽可能覆盖更多任务;同时通过 Autolabeling 数据管线,把拆分后的原子任务标得更细,再进行审核。


                  Scaling 的重点,也开始从单纯增加时长,转向提高同等数据规模里的信息量。


                  这种变化也延伸到了评测。


                  Psi-R2.5 在训练过程中引入仿真评测,并设置了一个包含 50 个复杂任务的多任务真机评测集。测试时还会持续随机化任务初始状态,用来观察模型在组合泛化上的表现。


                  已关注
                  关注
                  重播 分享 赞
                  观看更多
                    机器之心

                    0/0

                    00:00/00:37
                    进度条,百分之0
                    00:00
                    /
                    00:37
                    00:37
                    全屏

                    倍速播放中
                    您的浏览器不支持 video 标签

                    继续观看

                    具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路

                    转载
                    ,
                    具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
                    机器之心
                    已同步到看一看写下你的评论

                    Psi-R2.5 多任务真机评测,覆盖 50 个复杂任务,并随机化任务初始状态。


                    那么到底应该怎样判断一段人类数据够不够好?


                    其实标准很简单,真正高质量的人类数据,应该能够直接训练出完成对应任务的模型。


                    前面用于验证数据转换效果的两种测试,在这里也成为衡量数据质量的标准:转换后的数据既要能够在机器人上 replay,也要能够真正用于后训练,并让模型泛化到相关任务。


                    这也解释了为什么 Pair Data 会成为 Psi-R2.5 这一轮数据升级的重要一环。


                    如果一段人类数据只能在语义层面告诉模型「人在做什么」,它对机器人操作的帮助仍然有限;而当它经过转换后,能够直接 replay、能够拿来训练模型,它才真正提供了机器人最需要的操作信息。


                    从 Psi-R2 到 Psi-R2.5,从灵初的数据路线可以看到一个明显变化:先把人类数据规模做到十万小时,然后再开始重新计算,这十万小时里到底有多少有价值的信息。


                    写在最后


                    具身智能走向规模化,数据成本始终是一道绕不开的门槛。


                    机器人每进入一个新场景、学习一个新任务,如果都要重新采集大量真机数据,再完成一轮训练和适配,能力扩张的速度很快就会被数据生产拖住。


                    人类数据提供了另一种可能。它足够丰富,也更容易持续获得,但规模优势只有真正转化成机器人能够执行、能够训练、能够泛化的操作数据,才有意义。


                    从 Psi-R2 到 Psi-R2.5,灵初一直在往这个方向推进。强 Pair Data 提高人类数据与机器人数据的对齐质量,HIL+RL 压缩具体任务的适配成本,ICL 则进一步尝试让机器人面对新任务时少一次重新训练。


                    未来,人类数据还能在多大程度上降低机器人的训练与部署成本,值得期待。


                    © THE END

                    转载请联系本公众号获得授权

                    投稿或寻求报道:[email protected]

                    前往微信阅读全文

                    内容来自公众号,可前往微信查看原文。

                    查看作者的更多文章 →