iDP3:用人头视角的 3D 点云教人形机器人操作
🎯 为什么重要:人形操作的「场景泛化」之痛
人形机器人自主操作一直被两大问题卡死:
- 学习方法泛化差:现有 DP/Diffusion Policy 在训练场景里表现很好,换个场景/物体就崩(图像 overfit 到背景纹理)
- 数据采集太贵:人形机器人数据采集成本远高于桌面机械臂,要在 20 个场景采数成本极高(如 Robot Utility Model 需要 20 个场景)
- 系统硬伤:之前的遥操系统没有腰、不能移动、视野固定,根本采不到多样化的数据
论文 Table I 列得很直白:HumanPlus、OmniH2O、OpenTeleVision 等「最近的」人形操作系统,都只在自己训练过的场景里工作,从来没有展示过场景泛化能力。iDP3 是第一个声称「用 1 个场景数据训,在多个未知场景部署」的人形操作系统。
💡 核心思想:相机坐标系 + 大点云 + 卷积编码
iDP3 是 DP3(3D Diffusion Policy)的改进版,针对人形机器人的特殊需求做了三处关键修改:
🛠️ 工程关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① Egocentric 3D 表征 | 点云用相机坐标系,不用世界系 | 机器人相机不固定 → 没法做外参标定;相机系天然随机器人移动 |
| ② 把点数从 1024 扩到 4096 | 不再用 FPS 稀疏采样,而是 voxel + uniform 联合采样 | 不分割背景就需要让网络「自己学会忽略」——更多点 = 更丰富的上下文 |
| ③ 卷积 + 金字塔视觉编码器 | MLP 换成多层卷积,融合不同分辨率的特征 | 从人动数据(含抖动)学动作,卷积比 MLP 平滑得多 |
| ④ Prediction horizon = 16 | 预测未来 16 步动作(DP3 只 4 步) | 人遥操数据天然有抖动,长 horizon 给扩散更多「平滑」空间 |
| ⑤ DDIM 50 train / 10 inference | 训练 50 步去噪,推理加速到 10 步 | 推理 15Hz 实时;只靠 onboard 算力 |
| ⑥ AVP 全上身遥操 | Apple Vision Pro 同时驱动头 + 腰 + 双臂 + 双手 | 扩大机器人工作空间(不同高度的桌子),采集像人一样的动作 |
| ⑦ 高度可调推车 | 机器人固定在可升降推车上 | 替代不成熟的双腿行走;让机器人对不同桌高(厨房/会议桌)对齐 |
图像方法在新场景崩,是因为像素和场景纹理耦合:换个厨房,柜子颜色变了,CNN 看到的「杯子周围」完全不同。
3D 点云不一样:杯子还是杯子,无论它站在木桌、不锈钢台面还是会议桌上——几何没变。再加相机系让原点跟着相机走,机器人看到「前方 30cm 处有个圆柱体」这种描述就和场景无关。这是 3D 表征的本质优势。
📊 结果:2000+ 次真机试验,3D 全面碾压图像
| 方法(Pick&Place 4 种设置汇总) | 总成功/尝试 |
|---|---|
| DP(原版 Diffusion Policy) | 24/106(22.6%) |
| DP3(原版 3D Diffusion Policy) | 0/0(完全失败,无法学) |
| DP + frozen R3M | 62/138(44.9%) |
| DP + finetuned R3M | 99/147(67.3%) |
| iDP3 (DP3 encoder) | 58/127(45.7%) |
| iDP3(完整版) | 75/139(54.0%) |
| 泛化能力(训练场景 vs 新场景,每类 10 次) | DP | iDP3 |
|---|---|---|
| 训练场景(Pick&Place) | 9/10 | 9/10 |
| 新物体 | 3/10 | 9/10 |
| 新视角(大角度变化) | 2/10 | 9/10 |
| 新场景(厨房等) | 2/10 | 9/10 |
| 其他数字 | 值 |
|---|---|
| 真机评测总 episode 数 | > 2000(人形操作领域最多) |
| 推理速度 | 15Hz(只 onboard 算力) |
| 训练时间 | 30 min(DP 要 80 min) |
| 硬件 | Fourier GR1(25 DoF 上身) + L515 LiDAR + AVP |
| 消融:去 4 个改动任一 | 性能下降或直接学不会(Table III) |
🌐 在领域中的位置
iDP3 是3D 扩散策略「人形化」的关键一步。它把 DP3 从桌面机械臂搬到全尺寸人形,证明 egocentric 3D 表征是「场景泛化」的钥匙。后续工作(如 RDT-1B、π0-3D)继续在这条路上走。属于 T-扩散策略 与 T-人形操作 线索的交叉点。
❓ 常见误区
为什么不让机器人走路,要靠推车?
作者诚实地说:「当前双腿维持平衡还很难」。把双腿关掉、固定在推车上,是为了把研究焦点放在「上身操作 + 学习泛化」上。作者强调这是工程权衡,等 WBC(如 HOVER、H2O、BFM)更成熟后,iDP3 可以无缝接到带腿的人形上。
为什么 horizon 从 4 改到 16 这么关键?
Table III 消融:horizon=4 时 iDP3 完全学不会(0/0);horizon=8 时部分任务能学;horizon=16 才稳定。原因:人遥操的动作天然抖动,短 horizon 让扩散过分拟合抖动;长 horizon 给扩散「平滑」的空间。这是从「专家动捕数据」到「人遥操数据」的范式差异。
它和 DP3 的关系?为什么 DP3 在人形上完全失败?
DP3 假设「相机固定 + 物体可分割」。人形机器人相机在头上、头会转、人会移动 → 标定完全失效;不分割背景的话,DP3 的 1024 稀疏采样会把背景和目标混在一起。iDP3 的相机系 + 大点云 + 卷积编码组合才能解决。
为什么用 L515 LiDAR 而不是普通深度相机?
论文专门试了 RealSense D435(结构光)和 Livox Mid-360,都不行——点云太噪。L515 是固态 LiDAR,精度高得多。作者承认 L515 也不完美(点云仍有噪声),期待更好的深度传感器能进一步提升 iDP3 性能。
teleoperation 延迟 0.5 秒,数据采集可行吗?
刚好可行但很累。论文 §V 局限明确说:「AVP 遥操容易设置但对操作员很累,让模仿数据难以在研究室内规模化」。这是当前方案的主要瓶颈——比 Aloha 那种被动的主从臂采集要累得多。