⏱ ~21 min
里程碑
⭐ 为何重要

首次在真机上对训练时未见过的复杂几何物体做 in-hand 重定向,是 in-hand manipulation 跨物体泛化的里程碑(Science Robotics)。它打开了『泛化到训练分布外物体』的方向,启发了后续 generalizable in-hand rotation 工作。

建立在
  • A System for General In-Hand Object Re-Orientation
催生
机器人Allegro Hand
上真机
实时
输入模态vision,proprioception

P-VisualDexterity-2023:跨物体泛化的 in-hand 重定向(单深度相机 + teacher-student

作者 / 机构:Tao Chen, Megha Tippur, Siyang Wu, Vikash Kumar, Edward Adelson, Pulkit Agrawal(通讯)/ MIT Improbable AI Lab + CSAIL + IAIFI;Tsinghua IIIS;Meta AI
发表:Science Robotics 2023(arXiv 投稿 2022-11,v3: 2023-11)
arxiv:2211.11744 · 代码:https://github.com/Improbable-AI/dexenv · 硬件:开源 3 指 D'Claw + 修订版 4 指手,整机 < 5,000 美元(全开源组件)· 项目页:https://taochenshh.github.io/projects/visual-dexterity
在线索中的位置:属于 T11(灵巧操作)转折 4(in-hand 重定向 RL 突破),是把 in-hand 操作从「单一刚体」推向「跨形状泛化」的标志性工作。
一句话定位:用单台商用 Intel RealSense 深度相机 + 关节编码器,让一个单一控制器对训练时未见过的新物体(含鸭子这类复杂非凸形状)做任意 SO(3) 重定向,且覆盖最难的下视手(downward-facing)+ 抗重力 in-air 场景;硬件成本 < 5k 美元,全开源。

动机

在 Visual Dexterity 之前,in-hand 重定向几乎每篇都至少踩中以下限制之一:只能转简单凸形(多边形/圆柱)、转角范围有限、准静态(慢)、仅仿真结果、依赖昂贵专用传感(mocap / 多相机阵列)、或 hand 朝上(upward-facing,物体被托住、不抗重力)。OpenAI Dactyl(见 P-OpenAIHand-2018.md)虽然 sim-to-real 成功,但每个物体要单独训一个策略、依赖 PhaseSpace mocap。真正能用的 reorientation 系统——mobile manipulator 拿起一把螺丝刀后把它转到能用——需要同时满足四件事:(1) 任意 SO(3) 朝向,(2) 泛化到新形状,(3) 实时(单一商用传感器),(4) 能抗重力(下视手)。Visual Dexterity 把这四条一次解决。

方法核心:teacher-student + 点云策略 + 两阶段加速训练 + 选择性 DR

1. 硬件与任务设定

硬件是开源 3 指 D'Claw 及其改版 4 指手(9/12 DoF),装在 80/20 铝型材架上。手朝下(downward-facing),物体被手指从上方抓住——失败即掉落、不可逆,比朝上手难得多。观测是单台 Intel RealSense 的深度图(转成机器人 base link 下的点云)+ 关节编码器读数;目标以「物体在目标朝向下的点云」形式给出(不写成 pose/quaternion,规避跨物体无统一坐标系的问题)。控制频率 12 Hz。任务在 SO(3) 全空间,并在「有桌面支撑(extrinsic dexterity)」和「空中无支撑(in-air)」两种设定下都评估。

2. Teacher-Student 两阶段(核心 trick 之一)

RL 直接从高维点云学既难又慢(同时要学特征 + 动作),论文用 teacher-student / privileged learning

  • Teacher 策略 $\pi^E$:在仿真用 PPO + 特权低维状态(关节位置/速度、物体位姿/速度、目标朝向)训练。单个 teacher 跨 150 个物体一起训。POMDP 被简化为 MDP:$a_t = \pi^E(o_t; a_{t-1})$,额外喂上一动作 $a_{t-1}$ 鼓励平滑控制。
  • 动作平滑:策略原始输出 $a_t \in \mathbb{R}^3$(G 为手指数),用指数移动平均 $\bar{a}_t = \alpha a_t + (1-\alpha)\bar{a}_{t-1}$($\alpha=0.8$),目标关节角 $q_{t+1} = q_t + \bar{a}_t$。
  • Student 策略 $\pi^S$:用模仿学习学一个从点云直接到动作的端到端网络,目标就是匹配 teacher 的动作。输入点云 $P_t = P_t^s \cup P^g$(场景点云 $P_t^s$ = 相机点云 ∪ 采样在手指表面的合成点云,让网络感知「手指-物体」空间关系;$P^g$ = 目标朝向下的物体点云)。网络用 Minkowski Engine 稀疏 3D CNN(带 GRU)以满足 12 Hz 实时。

直接渲染点云训练 student 慢得离谱(单物体 > 1 周 V100),于是引入两阶段 student(另一个关键 trick):

  • Stage 1(student1):用合成点云(不渲染,直接从 mesh 采样)训练,极快;
  • Stage 2(student2):用渲染点云对 student1 finetune,缩小 sim-to-real 的感知 gap。

整体训练加速 ,这是让「跨物体视觉策略」实验上可行的关键。

3. Reward 设计:从桌面到空中

桌面重定向的 reward $r_t^1$ 由五项组成($c_1, c_2 > 0$;$c_3, c_4, c_5 < 0$):

$$r_t^1 = c_1 \mathbb{1}[\text{成功}] + \frac{c_2}{|\Delta\theta_t| + \epsilon_\theta} + c_3 \sum_{i=1}^{G}\|p_t^{f_i} - p_t^o\|_2^2 + c_4 |\dot{q}_t|^T|\tau_t| + c_5 \mathbb{1}[\|p_t^o\|_2^2 > \bar{p}]$$

分别为:稀疏成功奖励、稠密朝向奖励(缩小当前-目标朝向误差 $\Delta\theta_t$)、指尖贴近物体(否则训练时手指根本不碰物体)、能耗惩罚、把物体推离手的惩罚。要学到空中 reorientation,追加两项($c_6, c_7 < 0$):

$$r_t^2 = r_t^1 + c_6 \mathbb{1}[\text{物体碰桌面}] + c_7 \sum_{i=1}^{N}\mathbb{1}[p_{t,z}^{f_i} > \bar{z}]$$

第一项惩罚依赖桌面(逼策略把物体拎起来),第二项惩罚用「倒数第二关节」而非指尖转物体(让动作更自然)。关键发现:配合 4 指手(3 指不够),空中 reorientation 会从这套 reward 涌现出来,不需要专门的 gravity curriculum(这是它相对前作 [Chen 2022] 的进步)。

4. sim-to-real:选择性 DR + 系统辨识 + 软指尖

in-hand 重定向的 sim-to-real 极难——手和物体都动得快、downward-facing 下失败不可逆、接触模型对非凸物体是粗糙近似。论文的策略是减少对 DR 的依赖、只在必要处用

  • 感知 gap:只用深度(RGB 仿真-真机统计差异大),并给仿真点云加噪声。
  • 动力学 gap:机器人本体可辨识——用 Isaac Gym 的大规模并行仿真做黑盒系统辨识,spawn 很多不同动力学参数的仿真实例,选与真机运动最接近的那个(让 $\lambda_i \in \Lambda$ 对应的仿真 $C^{\lambda_i}$ 与真机 $C^{real}$ 的轨迹匹配评分最高);机器人本体只用小范围 DR 覆盖未建模误差。物体动力学(材质/质量分布)无法逐个辨识,于是用大范围 DR。
  • 抗扰:训练中对物体施加随机扰动力(大小随机 + SO(3) 随机方向),压力策略学会「边转边抗扰」。
  • 硬件巧思:用软指尖compliant + 高摩擦),让控制误差被材料形变吸收,真机上 less aggressive、overshot 更小。

这套「系统辨识 + 选择性 DR + 软指尖 + 扰动力」是 sim-to-real 能在非凸物体上 work 的实操关键。

为什么重要

  1. 跨形状泛化的第一次实证:单一控制器在训练时没见过的 OOD 物体(含鸭子这种复杂非凸形)上做任意 SO(3) 重定向。这是把 in-hand 操作从 Dactyl「一物一策略」推进到「跨物体」的标志。
  2. 点云目标 + 稀疏 CNN = 跨物体泛化的关键 trick:目标用「物体在目标朝向的点云」而非 pose,绕开了「跨物体无统一坐标系/关键点」的死结——直接从点云预测动作,天然泛化到新形状。这是方法层面最可复用的 insight。
  3. democratize 灵巧研究:硬件 < 5k 美元、全开源,是学术 lab 能批量复现的平台(vs Shadow Hand 10 万美元+)。
  4. 下视手 + 抗重力 + 实时:把之前所有「朝上手 / 多相机 / mocap」的妥协一次性去掉,靠近真实 tool-use 场景。

局限

  1. 绝对精度仍有限:最难的鸭子 OOD 物体掉落率 56%;不掉时 75% 能转到 0.4 rad(23°)以内。论文坦承「ample scope for improving absolute performance」。
  2. sim-to-real gap 仍在:真机误差高于仿真。
  3. teacher 看不到物体形状(POMDP 简化为 MDP 的代价):把 shape 信息注入 teacher 是 open direction。
  4. 未上触觉:与 RotateIt [Qi 2023] 互补——后者明确把触觉纳入 in-hand 旋转。

复现要点

代码与硬件均开源。关键工程点:(1) Isaac Gym 并行仿真做系统辨识 + 训练;(2) Minkowski Engine 稀疏 3D CNN(标准点云网络如 PointNet++ 太慢跑不到 12 Hz);(3) 两阶段 student:先合成点云、再渲染点云 finetune;(4) 软指尖显著改善 sim-to-real(论文实证:overshoot 更小、动作更平滑)。

相关

  • 建立在:A System for General In-Hand Object Re-Orientation [Chen 2022, CoRL](同组前作,确立 teacher-student + gravity curriculum 范式;本作把 curriculum 替换为 reward-driven 涌现)、Dactyl / OpenAI Hand [Andrychowicz 2018](DR + LSTM 灵巧手 sim-to-real 开山,见 P-OpenAIHand-2018.md)、Tobin et al. 2017(domain randomization)。
  • 引出:RotateIt / General In-Hand Object Rotation with Vision and Touch [Qi 2023, CoRL](视觉 + 触觉融合,补上触觉这条线);后续触觉 + in-hand 工作(Tac2Motion 等)。
  • 本仓库笔记交叉引用:T11-dexterous-manipulation.md(转折 4)、P-OpenAIHand-2018.md(DR 开山,本作的方法祖先)、C-sim2real-methods.md(teacher-student / privileged learning 范式)、C-rl-algorithms.md(PPO)。