枢纽
上真机
物理感知
实时
输入模态vision

DexImit:把网上的人类操作视频,变成机器人的灵巧操作训练数据

Juncheng Mu, Sizhe Yang 等(上海 AI Lab + 清华 + 港中文 + NVIDIA)。arXiv:2602.10105, 2026。 项目页 · dexterous manipulationlearning from video 线索 T07data generation

🧠 一句话心智模型:双臂灵巧手的数据太贵——遥操作一小时只够采几段演示。但 YouTube 和视频生成模型里有海量人类操作视频。DexImit 做的事:给一段任意视角的人类操作视频,自动产出可训练的双臂机器人轨迹——不需要深度、不需要相机参数、不需要遥操作。

🎯 为什么重要:灵巧操作的数据瓶颈

双臂 + 灵巧手(每只手 16+ 个自由度)的机器人是「终极操作平台」——能切苹果、叠杯子、做饭。但收集训练数据是噩梦:

遥操作的成本墙
  • 硬件贵:两只 XHand 灵巧手 + 双臂 UR5e + Azure Kinect 深度相机(论文真机配置),单套成本高(具体数字待核);
  • 采集慢:精细任务(叠杯子、倒水)单次遥操作可能要 1-2 分钟,专家一天也就采出 100-200 段(估算);
  • 技能覆盖窄:一个实验室只能采自己想得到的那几十种任务。
作为对比,YouTube 和视频生成模型(Veo3, Wan2.2)能提供几乎无限、覆盖万物的人类操作视频——但要把它们变成机器人数据,难如登天。

DexImit 的回答是一个四阶段全自动 pipeline,把「看视频学动作」拆解成「重建 → 调度 → 生成 → 增强」四个可独立解决的子问题。

💡 核心思想:四阶段 pipeline + 一个关键 trick(人手作尺度锚)

① 重建 单目视频 → 4D 手-物轨迹 关键 trick: 人手尺寸方差小 → 用它估 metric scale 深度: SpatialTracker v2 手: Wilor (MANO mesh) 物: SAM3D + FoundationPose → 相机系下 near-metric 轨迹 ② 调度 长程任务拆子任务 VLM (Qwen3-VL) 理解 "切苹果" → 抓刀/切/放 Action-Centric Scheduling 算法: 优先队列分配 子任务到左右手 支持任意并发度 → 冲突-free 调度 ③ 生成 轨迹 → 机器人动作 力闭合 grasp 合成 候选 → 排序 → 选稳 关键帧运动规划 物体相对变换 → 末端目标位姿 CuRobo 无碰撞轨迹 → 物理可行机器人轨迹 ④ 增强 轨迹 → 大规模数据 物体位姿随机 物体尺度 [0.8, 1.2] (保留原 grasp) 相机位姿随机 点云噪声 / 抽样 → DP3 策略训练 → 零样本真机部署 输入: 单目 RGB 视频 (YouTube / Veo3 生成 / 自拍 / 人工修正) 输出: 双臂灵巧手可训练数据集 (覆盖长程任务、精细操作、工具使用)
图 1:DexImit 四阶段 pipeline。每阶段解决一个具体子问题;关键 trick 在阶段 ①——用「人手尺寸作为内在尺度锚」从单目视频恢复 near-metric 尺度,免去对深度/相机参数的依赖。

🛠️ 四个让 pipeline 真的跑通的设计

设计心智为什么必要
① 人手作 metric scale 锚从首帧人手点云 PCA 求「主轴长度」,与统计人手尺寸比对得到 scale,乘到深度上单目视频本质歧义:相机远近无法分辨。前人要么用 AR 码 / 已知物体作锚,要么需要绝对深度。DexImit 利用人手尺寸方差小这一先验,免去所有额外信息
② Action-Centric Scheduling 算法子任务按起始时间排序,进优先队列;每帧检查每个 embodiment 当前是否空闲,有空闲就把下一个子任务分配给它双臂任务有任意并发度:可能单手、双手协作、双手独立。硬编码调度规则无法覆盖所有情形;这个通用算法一行代码处理所有 case
③ Grasp 候选生成 + 排序选稳对物体凸包采样接触点 → 优化力闭合目标 Eq.(4) → 按与人手的距离排序 → 按序找第一个满足稳定性直接复刻人手的 grasp 几何上不可行(手形态差太多)。力闭合约束保证物理可行;按「与人手姿势相似度」排序保证语义一致(比如人从上方抓,机器人也从上方)
④ Scale 增强 = 保留 grasp 只调手指物体尺度缩 [0.8, 1.2] 时,不重新生成 grasp,而是保留原轨迹只调整手指关节角反直觉:为每个 scale 重新生成 grasp 会让性能暴跌(消融 §IV-D)。原因是不同 scale 的 grasp 不一致 → 监督信号冲突 → 模仿学习学不稳。保留同一轨迹 + 调手指 = 一致的语义 + 物理可行
🔮 关键反直觉:「不要为每个增强重新生成 grasp」
正常思维:物体变大 20%,自然要重新算 grasp。但论文消融实验(§IV-D Fig.6)显示,重新生成会让真机成功率「drastically」下跌,甚至低于完全不做 scale 增强的版本(具体百分比见 Fig.6,PDF 未列文字数字)。原因是:不同尺度下的「最优 grasp」可能选了完全不同的接触点(比如抓杯子的杯口 vs 杯身),这种「语义不一致」让策略学到冲突信号。保留 grasp + 调手指 = 牺牲一点单次 grasp 最优性,换取整个数据集的语义一致性——这是数据增强在 imitation learning 下的核心 trade-off。

📊 结果:6 任务 4 项 100% 成功

任务DexImitRigVid (单臂 baseline)DexMan (RL baseline)
Put Cup(单手放杯)100%96%94%
Grapefruit(双手抬柚)100%—(不支持双臂)98%
Fruits(左右手各拿一果)100%100%
Pour(一手瓶一手碗倒水)100%50%
Pot(放苹果进锅,再双手抬锅)78%
Stack Cups(6 杯叠金字塔)52%
维度数字
4D 轨迹重建成功率ST2 + FPose 组合 82%(最佳);VGGT + PCR 仅 32%
真机零样本部署4 个元任务(单手 / 双手独立 / 双手抓 / 双手协作),无任何真机数据
数据可扩展性支持 sentence-level 视频(Wan2.2, Veo3)/ 网络视频 / 自拍 / 人工修正 四级数据质量
关键洞察:DexImit 不是某个新算法,而是把已有的感知 / 规划 / VLM / grasp 合成 / 运动规划 工具组装成一个端到端 pipeline。它的核心贡献是证明这条 pipeline 可行——以前大家觉得「从视频学操作」是科研问题,DexImit 把它降为「工程问题」。这是数据飞轮启动的关键一步。

🌐 在领域中的位置

DexVIP / Robotic Telekinesis(人手直接 pretrain) DexMV / Arctic(关键点 + RL) RigVid(单臂 grasp synthesis) DexMan(RL 跟踪视频轨迹) DexImit(双臂 + 全 pipeline + 零样本)⭐

DexImit 是「视频驱动机器人数据生成」的工程化里程碑。它第一次:① 全自动处理双臂任意并发;② 不依赖绝对深度等额外信息;③ 覆盖长程 + 工具 + 精细全谱任务;④ 真机零样本部署。后续工作(如 iGen、VividEx)都在其 pipeline 基础上扩展。关联线索:T11 视频到机器人数据谱系

❓ 常见误区

DexImit 是「从视频学习策略」吗?

不是——它是「从视频生成数据」。论文训练的策略(DP3)是完全在仿真里用生成的轨迹训的,真机上零样本部署。视频本身不直接喂给策略,而是通过四阶段 pipeline 转化为机器人物理可行的轨迹,这些轨迹作为模仿学习的演示。这个区别很重要:前者是端到端学习(受 embodiment gap 限制),后者是「视频 → 数据 → 标准策略训练」的解耦。

「人手作尺度锚」真的可靠吗?人手大小差异挺大的吧?

论文利用的是统计意义上人手尺寸方差小这一性质(成年人手掌长度大致在 16-20cm 之间,相对物体尺度的方差算小)。这个 trick 给出的是 near-metric(不是精确 metric)——足够 grasp 合成和运动规划用。这也是为什么阶段 ④ 的 scale 增强 [0.8, 1.2] 如此关键:它把 near-metric 的不确定性训练时分摊掉,让策略对尺度误差鲁棒。 52% 的 Stack Cups 算成功吗?看起来不高啊。

这是 6 杯叠金字塔的任务——即使是人类不熟悉的用户也会失败。关键对比是:所有其他 baseline 在这个任务上全是 "—"(完全失败)。DexImit 是当前唯一能在这个难度上拿出非零成绩的方法。论文也指出当前主要失败模式是子模块误差累积不能处理 in-hand manipulation,这是未来工作方向。