里程碑
机器人人形(Fourier GR1)
数据集Fourier GR1 自采
上真机
实时
输入模态Apple Vision Pro 采集 → 3D 点云 Diffusion Policy

iDP3:用人头视角的 3D 点云教人形机器人操作

Yanjie Ze, Zixuan Chen, Wenhao Wang 等(Stanford + SFU + UPenn + UIUC + CMU)。arXiv:2410.10803(2024 年 10 月,v3 2025 年 9 月)。 项目页 · imitation3D diffusion policy

🧠 一句话心智模型:教人形机器人做抓取、倒水、擦桌子这种操作,传统做法是用第三人称相机 + 精确标定 + 把背景抠掉——很脆。iDP3 改用装在机器人头上的 LiDAR 相机,直接吃下整片 3D 点云(不抠背景、不标定),让扩散策略在「相机坐标系」里学会动作。结果:只在一个场景训过,能零样本迁移到厨房、会议室、办公室

🎯 为什么重要:人形操作的「场景泛化」之痛

人形机器人自主操作一直被两大问题卡死:

核心痛点
  • 学习方法泛化差:现有 DP/Diffusion Policy 在训练场景里表现很好,换个场景/物体就崩(图像 overfit 到背景纹理)
  • 数据采集太贵:人形机器人数据采集成本远高于桌面机械臂,要在 20 个场景采数成本极高(如 Robot Utility Model 需要 20 个场景)
  • 系统硬伤:之前的遥操系统没有腰、不能移动、视野固定,根本采不到多样化的数据

论文 Table I 列得很直白:HumanPlus、OmniH2O、OpenTeleVision 等「最近的」人形操作系统,都只在自己训练过的场景里工作,从来没有展示过场景泛化能力。iDP3 是第一个声称「用 1 个场景数据训,在多个未知场景部署」的人形操作系统。

训练:单一实验桌 机器人头戴 LiDAR 杯子在桌上 每任务约 10 段示教 不标定、不抠背景 iDP3 训练 iDP3 策略 3D 点云(相机系) → 扩散去噪 → 关节目标 15Hz 实时推理 零样本部署 厨房(不同桌高、光照) 会议室 办公室 对比:之前工作的瓶颈 • DP3 (原始):需要相机标定 + 点云分割 → 没法移动 • 图像 DP:训练场景好 9/10,新场景掉到 2/10(Table IV) • Robot Utility Model:要 20 个场景数据 • HATO / OpenTeleVision:无腰、无移动、视野固定
图 1:iDP3 的核心承诺——一个训练场景训出能泛化到任意场景的人形操作策略。背后是 3D 表征 + egocentric(第一人称)视角。

💡 核心思想:相机坐标系 + 大点云 + 卷积编码

iDP3 是 DP3(3D Diffusion Policy)的改进版,针对人形机器人的特殊需求做了三处关键修改:

DP3(之前)→ iDP3(本文) DP3(2024,Ze et al.) • 点云在 世界坐标系 • 需要 相机标定(机器人 ↔ 相机外参) • 需要 点云分割(只保留目标物体) • 1024 点 + MLP 编码器 + horizon=4 iDP3(本文) • 点云在 相机坐标系(egocentric) 免标定(相机随机贴在头上) 免分割(整片点云都喂进去) 4096 点 + 卷积+金字塔 + horizon=16 世界系 固定原点 机器人移动后失效 相机系 原点跟着机器人走 移动/转头都自然适应 系统 Fourier GR1 25 DoF 全上身 AVP 遥操采数 L515 LiDAR 高度可调推车
图 2:iDP3 的核心改动——从「世界系」到「相机系」。原点跟着机器人头走,无论它移动、转头、弯腰,点云的描述都是一致的。这给了策略视角不变性

🛠️ 工程关键设计

设计心智为什么必要
① Egocentric 3D 表征点云用相机坐标系,不用世界系机器人相机不固定 → 没法做外参标定;相机系天然随机器人移动
② 把点数从 1024 扩到 4096不再用 FPS 稀疏采样,而是 voxel + uniform 联合采样不分割背景就需要让网络「自己学会忽略」——更多点 = 更丰富的上下文
③ 卷积 + 金字塔视觉编码器MLP 换成多层卷积,融合不同分辨率的特征从人动数据(含抖动)学动作,卷积比 MLP 平滑得多
④ Prediction horizon = 16预测未来 16 步动作(DP3 只 4 步)人遥操数据天然有抖动,长 horizon 给扩散更多「平滑」空间
⑤ DDIM 50 train / 10 inference训练 50 步去噪,推理加速到 10 步推理 15Hz 实时;只靠 onboard 算力
⑥ AVP 全上身遥操Apple Vision Pro 同时驱动头 + 腰 + 双臂 + 双手扩大机器人工作空间(不同高度的桌子),采集像人一样的动作
⑦ 高度可调推车机器人固定在可升降推车上替代不成熟的双腿行走;让机器人对不同桌高(厨房/会议桌)对齐
🔮 直觉:「相机系 + 大点云」为什么能让策略泛化?
图像方法在新场景崩,是因为像素和场景纹理耦合:换个厨房,柜子颜色变了,CNN 看到的「杯子周围」完全不同。
3D 点云不一样:杯子还是杯子,无论它站在木桌、不锈钢台面还是会议桌上——几何没变。再加相机系让原点跟着相机走,机器人看到「前方 30cm 处有个圆柱体」这种描述就和场景无关。这是 3D 表征的本质优势。

📊 结果:2000+ 次真机试验,3D 全面碾压图像

方法(Pick&Place 4 种设置汇总)总成功/尝试
DP(原版 Diffusion Policy)24/106(22.6%)
DP3(原版 3D Diffusion Policy)0/0(完全失败,无法学)
DP + frozen R3M62/138(44.9%)
DP + finetuned R3M99/147(67.3%)
iDP3 (DP3 encoder)58/127(45.7%)
iDP3(完整版)75/139(54.0%)
泛化能力(训练场景 vs 新场景,每类 10 次)DPiDP3
训练场景(Pick&Place)9/109/10
新物体3/109/10
新视角(大角度变化)2/109/10
新场景(厨房等)2/109/10
其他数字
真机评测总 episode 数> 2000(人形操作领域最多)
推理速度15Hz(只 onboard 算力)
训练时间30 min(DP 要 80 min)
硬件Fourier GR1(25 DoF 上身) + L515 LiDAR + AVP
消融:去 4 个改动任一性能下降或直接学不会(Table III)
关键洞察:iDP3 在训练场景和 DP 打平(都 9/10),但在新场景/新物体/新视角上 9:2 碾压 DP。3D 表征的泛化优势在「分布外」时才真正显现。论文还诚实指出:DP+finetuned R3M 在训练场景反而略强(预训练视觉模型的好处),但无法泛化——印证了「3D 才是人形操作的关键」。

🌐 在领域中的位置

Diffusion Policy(图像 + 桌面机械臂) DP3(3D 点云 + 第三人称相机) iDP3(egocentric 3D + 人形)⭐ VLA 大模型 + 3D 表征(π0、RDT 等)

iDP3 是3D 扩散策略「人形化」的关键一步。它把 DP3 从桌面机械臂搬到全尺寸人形,证明 egocentric 3D 表征是「场景泛化」的钥匙。后续工作(如 RDT-1B、π0-3D)继续在这条路上走。属于 T-扩散策略T-人形操作 线索的交叉点。

❓ 常见误区

为什么不让机器人走路,要靠推车?

作者诚实地说:「当前双腿维持平衡还很难」。把双腿关掉、固定在推车上,是为了把研究焦点放在「上身操作 + 学习泛化」上。作者强调这是工程权衡,等 WBC(如 HOVER、H2O、BFM)更成熟后,iDP3 可以无缝接到带腿的人形上。

为什么 horizon 从 4 改到 16 这么关键?

Table III 消融:horizon=4 时 iDP3 完全学不会(0/0);horizon=8 时部分任务能学;horizon=16 才稳定。原因:人遥操的动作天然抖动,短 horizon 让扩散过分拟合抖动;长 horizon 给扩散「平滑」的空间。这是从「专家动捕数据」到「人遥操数据」的范式差异。

它和 DP3 的关系?为什么 DP3 在人形上完全失败?

DP3 假设「相机固定 + 物体可分割」。人形机器人相机在头上、头会转、人会移动 → 标定完全失效;不分割背景的话,DP3 的 1024 稀疏采样会把背景和目标混在一起。iDP3 的相机系 + 大点云 + 卷积编码组合才能解决。

为什么用 L515 LiDAR 而不是普通深度相机?

论文专门试了 RealSense D435(结构光)和 Livox Mid-360,都不行——点云太噪。L515 是固态 LiDAR,精度高得多。作者承认 L515 也不完美(点云仍有噪声),期待更好的深度传感器能进一步提升 iDP3 性能。

teleoperation 延迟 0.5 秒,数据采集可行吗?

刚好可行但很累。论文 §V 局限明确说:「AVP 遥操容易设置但对操作员很累,让模仿数据难以在研究室内规模化」。这是当前方案的主要瓶颈——比 Aloha 那种被动的主从臂采集要累得多。