枢纽
机器人physical humanoid
数据集自采仿真
上真机
实时
输入模态vision,language

HumanVLA:第一个用「语言 + 第一视角」指挥物理人形干活的模型

Xinyu Xu, Yizheng Zhang, Yong-Lu Li, Lei Han, Cewu Lu(上海交大 + 腾讯 Robotics X)。NeurIPS 2024。 代码 · humanoid VLAHSI 线索

🧠 一句话心智模型:让人形机器人在房间里「把桌子推到床边」「把笔记本搬到桌上」——这种任务以前只能用状态-oracle(你告诉它物体的精确坐标)做出来。HumanVLA 把它升级成「看第一视角相机 + 听一句话」就能搬,是物理人形机器人的第一个 VLA。做法是经典的 teacher-student:先用 RL 训一个会干的老师,再用 BC 把视觉语言蒸馏给学生。

🎯 为什么重要:HSI 之前只能「坐椅子」「搬指定盒子」

Human-Scene Interaction (HSI) 这个方向已经很热,但论文里点出两个老大难:

核心矛盾:之前的工作要么只能处理静态物体(坐椅子、躺床),要么只能搬特定物体(一个盒子、一个球)——而且绝大多数要目标物体的精确状态(pose + 几何)作为输入。可现实里你不可能给机器人装一个外部的真值定位器。结果就是:在仿真里能跑、一进真实世界就抓瞎。

HumanVLA 一次解两个问题:

维度之前(InterPhys/UniHSI 等)HumanVLA
物体种类1 ~ 2 种(box、ball)34 种可移动物体(笔记本、椅子、锅、花瓶…)+ 50 种静态
任务定义目标坐标(privileged state)自然语言指令("move the chair in front of the desk")
感知输入全局真值egocentric 第一视角图像(像真人一样)
任务类型单步(走到位置)走过去 + 接触 + 搬到目标(loco-manipulation)

简言之,这是物理人形第一次「像人一样」地接任务——看、听、走、搬,全栈用神经网络做掉。

💡 核心思想:先训「会干的老师」,再蒸「会看的学生」

为什么不上来就端到端 RL 训 VLA?因为高维动作 + 复合状态空间 + 慢渲染 + 视觉噪声,RL 根本训不动。HumanVLA 用 teacher-student

Phase 1: Teacher(带 oracle) goal-conditioned RL + AMP 风格 task reward 走到/接触/搬到目标 style reward 对抗判别器:像不像真人 四个工程关键 几何编码 + 搬运课程 + 风格裁剪 + 路径规划 behavior cloning Phase 2: Student (HumanVLA) DAgger 行为克隆老师 输入:第一视角图像 + 语言 输出:人形动作 关键:Active Rendering 改善视角 📦 HITR (Human-in-the-Room) 数据集:4 种房间布局 · 50 静态物体 · 34 可移动物体
图 1:HumanVLA 的两阶段管线。Teacher 拿 oracle 状态学动作,Student 通过 BC 蒸馏成「看图+听话」的端到端 VLA。

这套 teacher-student 看起来朴素,但每一步都有「让 RL 真的训得动」的工程改进。下面逐个拆。

🛠️ 让老师真能干活的四个工程改进

改进心智为什么必要
① 几何编码用 Basis Point Features 给物体一个几何描述不同形状/姿态的盒子、椅子、锅子统一编码,才能泛化到 34 种物体(而非死记一种)
② Carry Curriculum先学「搬箱子」(最简单),再扩到其他物体直接学 34 种物体会崩;课程学习让 RL 先建立「搬运」基本模式
③ Style Clipping把 style reward 限制在某个阈值之下,避免它压过 task rewardAMP 风格奖励学得「太起劲」会变成只追求好看,反而完不成任务
④ Path Planning给老师一个 A* 路径作为 hint纯 RL 在复杂房间会卡死(绕不过家具);去掉它成功率掉 18.5%
🔮 学生端的独门技:Active Rendering(主动渲染)
人形机器人脖子上挂的相机视角是不受控的——动作一激烈画面就乱晃,学生网络学不动。HumanVLA 提出 active rendering:渲染时主动调整虚拟相机的朝向,让画面始终聚焦在任务相关物体上。这相当于给学生的「眼睛」装了一个「注意力」。去掉它成功率掉 6.9%
🔮 一定要用 online BC(DAgger),不能 offline
论文有个惊人的对照:用offline BC(10 条老师轨迹/task)训学生,成功率只有 15.3%——因为严重的 covariate shift(学生一旦偏离老师轨迹就不知道怎么办)。DAgger 让老师持续看学生的状态并给纠正,把成功率顶到 74.8%。这是 teacher-student 的关键纪律。

📊 结果:HITR 数据集上的全面胜出

方法设置成功率 ↑精度 (cm) ↓
HumanVLA-Teacheroracle state,train split85.9%14.4
w/o geometry encodingoracle state64.5%43.4
w/o carry curriculumoracle state66.3%73.4
w/o path planningoracle state67.8%37.2
HumanVLAVLA,train split74.8%42.6
w/o active renderingVLA67.9%55.6
w/o online learning (offline BC)VLA15.3%145.0
维度数字
未见任务(test split)Teacher 79.3% / HumanVLA 60.2% / InterPhys 59.5% / Offline GC-BC 10.2%
Box 子集(vs InterPhys)精度 4.2 cm(InterPhys 官方 8.3、复现 12.6)
机器人15 刚体、28 关节、PD 控制;仿真 60Hz、策略 30Hz
训练成本Teacher:8×V100 × 2 天;Student:2 GPU × 1 天
负载能力能搬 20kg 物体(传统轮式/gripper 机器人做不到)
关键洞察:HumanVLA 的真正贡献不是「刷了几个点」,而是第一次把 humanoid VLA 这件事跑通——证明了用第一视角 + 语言指挥物理人形做通用搬动是可行的。从 oracle 85.9% 到 VLA 74.8% 的 11 个点差距,正是「perception gap」,是后续工作要继续啃的硬骨头。

🌐 在领域中的位置

AMP(风格化物理控制) InterPhys / UniHSI(特定物体 HSI,oracle) HumanVLA(人形 VLA:第一视角+语言)⭐ gr00t / HOMIE / 全身人形 VLA

HumanVLA 是「物理人形 × VLA」的奠基工作。它把 HSI 从「单物体 + oracle 状态」推进到「多物体 + 视觉语言」,并把 teacher-student 这套范式确立为人形 VLA 训练的事实标准。关联线索:T06 VLA 谱系 + T08 人形动作谱系

❓ 常见误区

HumanVLA 能直接部署到真人形机器人吗?

还不能。它在 IsaacGym 仿真里训、仿真里测,sim2real 还没做。不过所有观察(egocentric camera、语言)都是真实世界可获得的,没有用 oracle 真值——这是它能往真实迁移的关键前提。

为什么要先训老师再蒸馏,不直接 RL 训 VLA?

两个原因:(1)高维动作 + 视觉输入 + 慢渲染,端到端 RL 根本不收敛;(2)老师用 oracle 状态能把「怎么动」先学扎实,学生只要学「把视觉映射到动作」一个映射,任务被分解成了两个可解的子问题。

34 种物体算「通用」吗?

相对之前 1-2 种已经是数量级提升,但和真实世界物体多样性比还差很远。论文也承认:把物体种类继续扩、把任务扩到长时序多物体交互是 future work。

它的「active rendering」是真硬件能动相机吗?

不是。这是仿真里的渲染技巧——在渲染学生看到的图像时主动调整虚拟相机的朝向,相当于给学生「挑选」好的训练数据。真硬件上对应的可能是「主动控制颈部关节让相机看向任务物体」,但论文没做这个映射。