(来源:PaperWeekly)
约 15 小时机器人视频,就让一个 14B 视频模型开始预测动作后果,并参与候选轨迹筛选。
只把杯子接下来要怎么移动留在画面里,模型便能补出机械臂伸手、调整夹爪、完成抓取,再把杯子送到指定位置的连续过程。
反过来,把输入条件换成机械臂轨迹,它又会补全杯子、抽屉及周围场景的响应。
李飞飞所在的斯坦福团队联合马里兰大学、哈佛大学研究者,提出了掩码视觉动作(Masked Visual Actions)。这项方法将机器人动作表示为视频中的像素级运动条件,并用真实与仿真数据适配预训练视频模型。
训练阶段仅提供机器人运动条件,推理时换成物体轨迹,模型仍能零样本补全机器人行为。

〓掩码视觉动作统一世界预测与机器人行为生成
在训练中未出现的夹爪和双臂机器人上,这套视觉接口的跨具身泛化表现也更加稳定。

〓根据人类示范中的物体轨迹生成机器人行为

论文地址:
https://arxiv.org/abs/2607.19343
GitHub地址:
https://github.com/HadiZayer/masked-visual-actions
项目主页:
https://masked-visual-actions.github.io/

把机器人动作交给视频
传统机器人世界模型通常接收关节角、末端位姿或控制向量。这些信号与具体机械结构绑定,即使将骨架和末端执行器位姿可视化到图像中,仍难保留完整外形、接触关系和遮挡信息。
掩码视觉动作保留实体在整段视频中的时空像素区域,其余区域统一置为灰色背景。它并非单帧轮廓,而是随时间逐帧变化的时空掩码,外形、位置、尺度和接触过程都直接可见。

〓不同动作表示在像素对齐和具身依赖上的差异
训练数据来自 DROID 和 RoboCasa,同时纳入成功与失败轨迹,用于学习不同动作可能带来的结果。
数据规模约为 1000 条 DROID 演示和 4000 个 RoboCasa 样本,总时长约 15 小时。机器人区域可从真实视频中分割,也可依据状态、URDF 和相机参数渲染。

〓掩码视觉动作的分割与渲染两种构建方式
底座模型为 Wan-Fun-Control 2.2 14B,采用秩为 256 的 LoRA 适配。训练约 10000 步,使用 8 张 H200,耗时约 4 天。15 小时对应的是机器人视频总时长。
在这种表示下,保留哪类实体轨迹,就决定了模型以什么为条件、补全什么。

同一模型的两种用法
在同一种掩码表示下,模型始终在补全未显示的实体轨迹。
机器人轨迹作为输入时,它预测物体和环境的变化。输入换成目标物体轨迹,它便补全相应的机器人行为。前向预测和逆向生成由同一个模型完成。

〓同一模型如何用于世界预测、策略评估、基于模型的规划与动作提取
模型没有接受专门的物体轨迹条件训练,却能根据杯子的目标运动补出机械臂行为。论文主页还展示了一种输入来源,从人类示范中提取物体的掩码视觉动作,再生成与之匹配的机器人运动。
以往,预测动作结果和根据目标生成机器人行为通常需要分别建模。在这里,两者都被转化为条件视频补全。
生成结果仍是视频,真正执行时还要经过逆动力学模型,转成低层控制指令。

换种具身仍能泛化
单臂、双臂和不同夹爪的关节数量与动作维度各不相同,低维控制信号难以直接复用。
掩码视觉动作统一的是世界模型接收动作的视觉表示,并不要求不同机器人共享同一动作空间或低层控制接口。
在 DROID 训练分布内,掩码视觉动作、机器人骨架和末端执行器位姿条件表现相近。
换到训练中未出现的真实夹爪或 BEHAVIOR 双臂机器人上,使用稀疏条件时,生成结果更容易改变机器人形态,甚至凭空增加机械臂。

〓三种动作条件在未见具身上的动态对比
在 DROID 上,三种条件的 PSNR 基本接近。换到训练中未出现的真实夹爪后,掩码视觉动作以 22.79 领先骨架条件的 21.02 和末端执行器位姿条件的 20.32。
在 BEHAVIOR 双臂机器人上,其 PSNR 达到 22.90,明显高于另外两种条件的 19.58 和 19.23。

从模拟未来到真实动作
规划时,Diffusion Policy 采样多条候选动作,世界模型为每条动作生成对应的未来视频,再由 Gemini 3.1 Pro Preview 按任务完成度、接触真实性和物理合理性评分并选出最佳方案。
六项 RoboCasa 任务均获提升,增幅为 7 至 26 个百分点。

〓候选数量增加时,Best-of-N 规划表现总体提升
世界模型还可用于低成本策略评估。RoboCasa 中,视频预测与真实成功率的相关系数达到 0.982,说明生成视频能够帮助比较不同策略的相对表现。

〓视频评估与真实执行成功率高度相关
真实机器人实验覆盖橙子入袋、积木堆叠、毛巾入碗和关闭抽屉,每项包含 20 条演示。生成视频中的任务进度分布与实际执行接近,但视频评估结果整体偏高。

〓真实执行与生成视频中的任务进度分布
在 CoffeeServeMug 任务中,视频模型没有见过该任务的视频样本。
生成结果经逆动力学模型转成动作后,20 次测试成功率达到 90%,高于 Diffusion Policy 的 50%、ACT 的 80% 和 SmolVLA 的 85%。
逆动力学模型和 Diffusion Policy、ACT、SmolVLA 三项策略基线各使用 100 条任务示范训练。

〓逆向建模生成动作的任务成功率
目前,模型在精细接触上仍可能失真,生成结果中也会出现虚假接触、物体瞬移,或夹爪离开后物体继续运动。
论文主页的失败案例还显示,参考帧中完全不可见的区域可能出现伪影。多候选生成的成本也较高。基于 URDF 渲染动作条件时,还需要机器人模型和相机标定。

连接视频与机器人的接口
连接视频与机器人的接口这项工作为机器人动作提供了一种像素空间接口。用实体在视频中的时空轨迹表达动作,再利用预训练视频模型已有的运动与交互知识。
不同具身无需共享关节维度或低层动作空间,也能接入同一种视觉表示。多种机器人任务由此可以围绕同一种视觉接口展开。
少量机器人数据即可让预训练视频模型适应新的动作条件,也说明其在视频中积累的运动与交互知识具备迁移到机器人任务的潜力。
它证明,不同机器人可以通过共同的像素级动作条件接入视频模型,无需为每一种形态重新定义世界模型的输入接口。
随着视频生成质量、推理速度和逆动力学模型继续提升,这套技术路线有望覆盖更多机器人形态与更复杂的操作任务,让视频世界模型更直接地参与机器人决策与执行。
🔍
现在,在「知乎」也能找到我们了
进入知乎首页搜索「PaperWeekly」
