HumanVLA:第一个用「语言 + 第一视角」指挥物理人形干活的模型
🎯 为什么重要:HSI 之前只能「坐椅子」「搬指定盒子」
Human-Scene Interaction (HSI) 这个方向已经很热,但论文里点出两个老大难:
HumanVLA 一次解两个问题:
| 维度 | 之前(InterPhys/UniHSI 等) | HumanVLA |
|---|---|---|
| 物体种类 | 1 ~ 2 种(box、ball) | 34 种可移动物体(笔记本、椅子、锅、花瓶…)+ 50 种静态 |
| 任务定义 | 目标坐标(privileged state) | 自然语言指令("move the chair in front of the desk") |
| 感知输入 | 全局真值 | egocentric 第一视角图像(像真人一样) |
| 任务类型 | 单步(走到位置) | 走过去 + 接触 + 搬到目标(loco-manipulation) |
简言之,这是物理人形第一次「像人一样」地接任务——看、听、走、搬,全栈用神经网络做掉。
💡 核心思想:先训「会干的老师」,再蒸「会看的学生」
为什么不上来就端到端 RL 训 VLA?因为高维动作 + 复合状态空间 + 慢渲染 + 视觉噪声,RL 根本训不动。HumanVLA 用 teacher-student:
这套 teacher-student 看起来朴素,但每一步都有「让 RL 真的训得动」的工程改进。下面逐个拆。
🛠️ 让老师真能干活的四个工程改进
| 改进 | 心智 | 为什么必要 |
|---|---|---|
| ① 几何编码 | 用 Basis Point Features 给物体一个几何描述 | 不同形状/姿态的盒子、椅子、锅子统一编码,才能泛化到 34 种物体(而非死记一种) |
| ② Carry Curriculum | 先学「搬箱子」(最简单),再扩到其他物体 | 直接学 34 种物体会崩;课程学习让 RL 先建立「搬运」基本模式 |
| ③ Style Clipping | 把 style reward 限制在某个阈值之下,避免它压过 task reward | AMP 风格奖励学得「太起劲」会变成只追求好看,反而完不成任务 |
| ④ Path Planning | 给老师一个 A* 路径作为 hint | 纯 RL 在复杂房间会卡死(绕不过家具);去掉它成功率掉 18.5% |
人形机器人脖子上挂的相机视角是不受控的——动作一激烈画面就乱晃,学生网络学不动。HumanVLA 提出 active rendering:渲染时主动调整虚拟相机的朝向,让画面始终聚焦在任务相关物体上。这相当于给学生的「眼睛」装了一个「注意力」。去掉它成功率掉 6.9%。
论文有个惊人的对照:用offline BC(10 条老师轨迹/task)训学生,成功率只有 15.3%——因为严重的 covariate shift(学生一旦偏离老师轨迹就不知道怎么办)。DAgger 让老师持续看学生的状态并给纠正,把成功率顶到 74.8%。这是 teacher-student 的关键纪律。
📊 结果:HITR 数据集上的全面胜出
| 方法 | 设置 | 成功率 ↑ | 精度 (cm) ↓ |
|---|---|---|---|
| HumanVLA-Teacher | oracle state,train split | 85.9% | 14.4 |
| w/o geometry encoding | oracle state | 64.5% | 43.4 |
| w/o carry curriculum | oracle state | 66.3% | 73.4 |
| w/o path planning | oracle state | 67.8% | 37.2 |
| HumanVLA | VLA,train split | 74.8% | 42.6 |
| w/o active rendering | VLA | 67.9% | 55.6 |
| w/o online learning (offline BC) | VLA | 15.3% | 145.0 |
| 维度 | 数字 |
|---|---|
| 未见任务(test split) | Teacher 79.3% / HumanVLA 60.2% / InterPhys 59.5% / Offline GC-BC 10.2% |
| Box 子集(vs InterPhys) | 精度 4.2 cm(InterPhys 官方 8.3、复现 12.6) |
| 机器人 | 15 刚体、28 关节、PD 控制;仿真 60Hz、策略 30Hz |
| 训练成本 | Teacher:8×V100 × 2 天;Student:2 GPU × 1 天 |
| 负载能力 | 能搬 20kg 物体(传统轮式/gripper 机器人做不到) |
🌐 在领域中的位置
HumanVLA 是「物理人形 × VLA」的奠基工作。它把 HSI 从「单物体 + oracle 状态」推进到「多物体 + 视觉语言」,并把 teacher-student 这套范式确立为人形 VLA 训练的事实标准。关联线索:T06 VLA 谱系 + T08 人形动作谱系。
❓ 常见误区
HumanVLA 能直接部署到真人形机器人吗?
还不能。它在 IsaacGym 仿真里训、仿真里测,sim2real 还没做。不过所有观察(egocentric camera、语言)都是真实世界可获得的,没有用 oracle 真值——这是它能往真实迁移的关键前提。
为什么要先训老师再蒸馏,不直接 RL 训 VLA?
两个原因:(1)高维动作 + 视觉输入 + 慢渲染,端到端 RL 根本不收敛;(2)老师用 oracle 状态能把「怎么动」先学扎实,学生只要学「把视觉映射到动作」一个映射,任务被分解成了两个可解的子问题。
34 种物体算「通用」吗?
相对之前 1-2 种已经是数量级提升,但和真实世界物体多样性比还差很远。论文也承认:把物体种类继续扩、把任务扩到长时序多物体交互是 future work。
它的「active rendering」是真硬件能动相机吗?
不是。这是仿真里的渲染技巧——在渲染学生看到的图像时主动调整虚拟相机的朝向,相当于给学生「挑选」好的训练数据。真硬件上对应的可能是「主动控制颈部关节让相机看向任务物体」,但论文没做这个映射。