AI资讯
李飞飞与Yilun Du合作论文提出新接口,机器人可直接利用视频生成模型
李飞飞和Yilun Du合作的论文提出了一种新的接口,使得机器人可以直接利用现有的视频生成模型,而不需要专门训练的大模型。
AI云图智寻编辑部2026-08-07 08:09
阅读时间:约 2 分钟访问0
李飞飞和Yilun Du等多位顶尖学者合作发表的论文《Masked Visual Actions for Unified World Modeling》提出了一种新的方法,使机器人可以直接利用现有的视频生成模型,而不需要专门训练的大模型。这一成果可能改变当前机器人大脑基模的研发方向。
过去视频模型懂物理但不懂动作的原因
这篇论文指出,过去的视频模型虽然能够理解物理现象,但无法将这些理解转化为具体的动作指令。主要原因是缺乏一个有效的“翻译接口”。视频模型能够通过大量视频数据学习到物理直觉,例如预测水壶倾斜后水会倒进杯子里。然而,当需要控制机械臂执行具体任务时,视频模型却无从下手,因为它不知道如何将动作指令转换为电机信号。这种“翻译”问题导致了视频模型和机器人之间的壁垒。
MVA方法的关键步骤
MVA方法通过三个关键步骤解决了上述问题。首先,使用Segment Anything Model (SAM)工具将视频中的机器人和物体分割出来,并记录它们的运动轨迹。其次,通过遮住一部分轨迹并让AI推演缺失部分,实现正向模拟和逆向推理。最后,通过微调阿里开源的Wan2.2视频生成模型,使其能够理解这些运动轨迹。这种方法仅用15小时的数据微调,就能让机器人在未见过的双臂上实现操作泛化。
论文结果及产业界的影响
实验结果显示,MVA方法在同款机器人上的表现显著优于其他方法。使用LPIPS指标评估,MVA的成绩为0.0945,而排名第二的方法Ctrl-World为0.362。此外,MVA还展示了在完全不同的机械臂上的零样本泛化能力。产业界人士认为,该方法的核心在于增强了泛化性,解决了异构机械手识别和迁移的问题。MVA通过引入URDF文件和逆运动学计算,实现了对不同机械臂的有效适配。