DexImit:把网上的人类操作视频,变成机器人的灵巧操作训练数据
🎯 为什么重要:灵巧操作的数据瓶颈
双臂 + 灵巧手(每只手 16+ 个自由度)的机器人是「终极操作平台」——能切苹果、叠杯子、做饭。但收集训练数据是噩梦:
- 硬件贵:两只 XHand 灵巧手 + 双臂 UR5e + Azure Kinect 深度相机(论文真机配置),单套成本高(具体数字待核);
- 采集慢:精细任务(叠杯子、倒水)单次遥操作可能要 1-2 分钟,专家一天也就采出 100-200 段(估算);
- 技能覆盖窄:一个实验室只能采自己想得到的那几十种任务。
DexImit 的回答是一个四阶段全自动 pipeline,把「看视频学动作」拆解成「重建 → 调度 → 生成 → 增强」四个可独立解决的子问题。
💡 核心思想:四阶段 pipeline + 一个关键 trick(人手作尺度锚)
🛠️ 四个让 pipeline 真的跑通的设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 人手作 metric scale 锚 | 从首帧人手点云 PCA 求「主轴长度」,与统计人手尺寸比对得到 scale,乘到深度上 | 单目视频本质歧义:相机远近无法分辨。前人要么用 AR 码 / 已知物体作锚,要么需要绝对深度。DexImit 利用人手尺寸方差小这一先验,免去所有额外信息 |
| ② Action-Centric Scheduling 算法 | 子任务按起始时间排序,进优先队列;每帧检查每个 embodiment 当前是否空闲,有空闲就把下一个子任务分配给它 | 双臂任务有任意并发度:可能单手、双手协作、双手独立。硬编码调度规则无法覆盖所有情形;这个通用算法一行代码处理所有 case |
| ③ Grasp 候选生成 + 排序选稳 | 对物体凸包采样接触点 → 优化力闭合目标 Eq.(4) → 按与人手的距离排序 → 按序找第一个满足稳定性 | 直接复刻人手的 grasp 几何上不可行(手形态差太多)。力闭合约束保证物理可行;按「与人手姿势相似度」排序保证语义一致(比如人从上方抓,机器人也从上方) |
| ④ Scale 增强 = 保留 grasp 只调手指 | 物体尺度缩 [0.8, 1.2] 时,不重新生成 grasp,而是保留原轨迹只调整手指关节角 | 反直觉:为每个 scale 重新生成 grasp 会让性能暴跌(消融 §IV-D)。原因是不同 scale 的 grasp 不一致 → 监督信号冲突 → 模仿学习学不稳。保留同一轨迹 + 调手指 = 一致的语义 + 物理可行 |
正常思维:物体变大 20%,自然要重新算 grasp。但论文消融实验(§IV-D Fig.6)显示,重新生成会让真机成功率「drastically」下跌,甚至低于完全不做 scale 增强的版本(具体百分比见 Fig.6,PDF 未列文字数字)。原因是:不同尺度下的「最优 grasp」可能选了完全不同的接触点(比如抓杯子的杯口 vs 杯身),这种「语义不一致」让策略学到冲突信号。保留 grasp + 调手指 = 牺牲一点单次 grasp 最优性,换取整个数据集的语义一致性——这是数据增强在 imitation learning 下的核心 trade-off。
📊 结果:6 任务 4 项 100% 成功
| 任务 | DexImit | RigVid (单臂 baseline) | DexMan (RL baseline) |
|---|---|---|---|
| Put Cup(单手放杯) | 100% | 96% | 94% |
| Grapefruit(双手抬柚) | 100% | —(不支持双臂) | 98% |
| Fruits(左右手各拿一果) | 100% | 100% | — |
| Pour(一手瓶一手碗倒水) | 100% | 50% | — |
| Pot(放苹果进锅,再双手抬锅) | 78% | — | — |
| Stack Cups(6 杯叠金字塔) | 52% | — | — |
| 维度 | 数字 |
|---|---|
| 4D 轨迹重建成功率 | ST2 + FPose 组合 82%(最佳);VGGT + PCR 仅 32% |
| 真机零样本部署 | 4 个元任务(单手 / 双手独立 / 双手抓 / 双手协作),无任何真机数据 |
| 数据可扩展性 | 支持 sentence-level 视频(Wan2.2, Veo3)/ 网络视频 / 自拍 / 人工修正 四级数据质量 |
🌐 在领域中的位置
DexImit 是「视频驱动机器人数据生成」的工程化里程碑。它第一次:① 全自动处理双臂任意并发;② 不依赖绝对深度等额外信息;③ 覆盖长程 + 工具 + 精细全谱任务;④ 真机零样本部署。后续工作(如 iGen、VividEx)都在其 pipeline 基础上扩展。关联线索:T11 视频到机器人数据谱系。
❓ 常见误区
DexImit 是「从视频学习策略」吗?
不是——它是「从视频生成数据」。论文训练的策略(DP3)是完全在仿真里用生成的轨迹训的,真机上零样本部署。视频本身不直接喂给策略,而是通过四阶段 pipeline 转化为机器人物理可行的轨迹,这些轨迹作为模仿学习的演示。这个区别很重要:前者是端到端学习(受 embodiment gap 限制),后者是「视频 → 数据 → 标准策略训练」的解耦。
「人手作尺度锚」真的可靠吗?人手大小差异挺大的吧?
论文利用的是统计意义上人手尺寸方差小这一性质(成年人手掌长度大致在 16-20cm 之间,相对物体尺度的方差算小)。这个 trick 给出的是 near-metric(不是精确 metric)——足够 grasp 合成和运动规划用。这也是为什么阶段 ④ 的 scale 增强 [0.8, 1.2] 如此关键:它把 near-metric 的不确定性训练时分摊掉,让策略对尺度误差鲁棒。
52% 的 Stack Cups 算成功吗?看起来不高啊。
这是 6 杯叠金字塔的任务——即使是人类不熟悉的用户也会失败。关键对比是:所有其他 baseline 在这个任务上全是 "—"(完全失败)。DexImit 是当前唯一能在这个难度上拿出非零成绩的方法。论文也指出当前主要失败模式是子模块误差累积和不能处理 in-hand manipulation,这是未来工作方向。