T10 - VLA 与 WBC 的分层整合(VLA + WBC Hierarchical Integration)
状态:🔴 当前最热方向(2026 上半年 GR00T N2 / Helix 02 / WholeBodyVLA / SONIC 集中爆发)
交叉线索:T04(motion prior / SONIC)、T08(动作生成的 universal token 落点)、T07(teleop 采数)
🎯 你将学到什么
1. 看懂当前人形控制最热的开放问题——如何把语义丰富但慢(7-9 Hz)的 VLA 与语义贫乏但快(100 Hz+)的 WBC 缝合,让人形既能「听懂长程任务」又能「高频稳定执行」
2. 掌握三种 System-2 → System-1 接口方案(语言子指令 / 关节角 / 潜向量)的机制差异,及带宽 / 可微性 / 跨本体 / 可解释性四维权衡
3. 能解释 GR00T N1 的 latent 接口两层嵌套(VLM 第 12 层 embedding + LAPA latent action),以及 SONIC universal token 为何是「跨本体 motor token 协议」的早期形态
4. 理解 2026 三派之争(分层派 / 端到端派 / 折中派 GR00T N2、Helix 02)及「阵营 C 会赢」的判断依据
5. 学会判断何时该用哪种接口:上层人 ↔ System-2 用语言子指令、中层 System-2 ↔ System-1 用 latent、底层 System-1 ↔ actuator 由 SONIC 式 tracker 提供 universal token
本页内容
基础解释
一句话直觉
让懂语义的大脑和快出动作的小脑分工合作。
大脑聪明但慢,小脑快但只懂动作。
中间必须有一个翻译层把意图接上。
VLA 之于 WBC,就像总裁之于车间师傅。
总裁懂战略,下指令慢。
师傅手快,但只看得懂零件图。
中间靠一张"工单"把意图翻译成动作。
从基础理解
要解决的问题
让人形既能听懂长程任务,又能高频稳定执行 📎。
语义大脑能听懂话、会规划,但出招慢。
运动小脑出招快,但听不懂话。
两块大脑必须缝合。
两端的张力
语义大脑能上网、懂自然语言、会规划。
但单步推理要几百毫秒。
运动小脑由强化学习训出来,能跑一百赫兹以上。
它只懂关节目标,对任务语义一无所知。
一快一慢,必须靠翻译层接上。
演进脉络(三种通货)
分层中间传的"通货"现存三类并存方案 📎。
- 一类是语言子指令。"先去厨房,再开冰箱。"可解释、可组合,但"左挪两厘米"说不清。
- 一类是关节角目标。直接给每个关节的角度。带宽够,但换机器人就要重训。
- 一类是潜向量。把意图压成一个向量传过去。带宽高、可端到端训练,但不可解释。代表是 Helix 用单一向量驱动上半身。GR00T N1 则用大模型中层特征当通货 📎。
方法核心(大白话)
不让大模型直接控电机。
大模型只产"意图"——往哪走、抓什么、停还是继续。
高频小脑把意图落成关节动作。
关键是意图层对几百毫秒延迟不敏感。
所以慢大脑和快手才能配合。
最新尝试是小脑主动给上层提供一个"通用动作令牌" 📎。
大模型只需学会在什么场景吐什么令牌。
一句话类比
VLA 加 WBC 分层,就像公司里总裁定战略、车间师傅出活。
中间靠工单传话。
工单可以是文字、图纸、或一串密码,三种通货各有取舍。
这条线索在解决什么问题
这是当前人形机器人控制中最热的开放问题:如何把语义丰富但慢的 VLA 与语义贫乏但快的 WBC 缝合在一起,让人形既能"听懂长程任务"又能"高频稳定执行"。
根本张力来自两端频率与表征的不匹配:
- VLA 一侧:7B 级 VLM 单步推理数百 ms(Hz 级),但能接入互联网语义、处理自然语言、做长程推理;
- WBC 一侧:RL 训练的全身控制器可跑 100Hz+,但只懂 kinematic 目标(关节角/根姿态),对任务语义一无所知。
中间必须有一个"翻译层",让 VLA 的语义输出能被 WBC 当作跟踪目标消费。这个翻译层的接口设计就是当前最尖锐的开放问题。2026 上半年 Figure Helix 02 引入 System 0(1 kHz 全身底层),把分层从「2 层」推到「3 层(S2 语义 → S1 motor → S0 全身物理)」,进一步凸显接口选择的重要性。
三种接口方案
按 System-2(慢)→ System-1(快)之间传递的"通货"类型,现有方案分三类:
1. 语言子指令(language sub-instructions)。 代表:Hi Robot(π0.5 配套的高层 VLM,把多轮/纠错自然语言压成清晰子指令再喂 policy)、RT-H 的 "language motions" 中间层。优点:可解释、跨本体/跨任务可组合、与人类指令同型。缺点:离散化损失——"把杯子向左挪 2cm"很难用离散 token 表达,子指令粒度难调。
2. 关节角 / 末端目标(joint angle targets)。 代表:GR00T N1 [Bjorck 2025, arxiv:2503.14734]。System-2 Eagle-2 VLM(SmolLM2 + SigLIP-2 finetune 而成的单流 VLM,~1.34B)@ ~10 Hz(L40 GPU)解析场景+语言、输出第 12 层 hidden state 作 latent,System-1 DiT action expert(alternating cross-attn + self-attn,~0.86B)@ ~120Hz 用 flow matching(4 步 Euler,action chunk H=16)直接出关节级动作。优点:与 WBC 的自然输入同型、无需额外解码。缺点:本体敏感(embodiment-brittle)——换机器人就要重训(N1 已用 LAPA latent action 预训练 + embodiment-specific MLP encoder/decoder 部分缓解,N1.5+ 进一步引入 MoE),关节空间本身也不利于语义泛化。严格说 GR00T N1 把 System-1/2 都装在同一个 VLA 内、外部看不到独立 WBC,但概念上仍是这套分层。详细架构见 P-GR00T-N1-2025.md。
勘误(2026-07-18):本线索旧版称 "GR00T N1 System-2 VLM @ ~1Hz" 是错的。arXiv 2503.14734 PDF 正文未给 System-2 显式 Hz(只给 System-1 @ 120 Hz、action chunk 抽样 63.9 ms on L40 bf16);按 NVIDIA 后续白皮书/博客与 L40 推理时延估计约 100 ms,即 ~10 Hz 是社区通行操作估计。"1 Hz" 是把 System-2 / System-1 频率比后误传的说法。10 Hz 是经验阈值:低于 10 Hz 时高频 manipulation 任务(接抛、急停)跟不上,10 Hz 以上操作员/任务看不出差别。
3. 潜向量(latent communication)。 代表:Helix [Figure AI 2025-02]。System-2 是 7B VLM @ 7-9Hz,System-1 是 80M visuomotor @ 200Hz,两者通过一个学习的 latent 任务向量通信——VLM 把"场景+语言"压成 latent,visuomotor 把 latent 当条件连续生成上半身动作。注意:Helix 的接口常被误归为"关节角",实际是 latent——这是分析时最容易踩的坑。优点:带宽高、可微、无离散化损失,且 latent 可在训练时端到端优化。缺点:不可解释、跨本体迁移需重新对齐 latent 空间。
此外 HumanVLA [2406.19972, NeurIPS 2024] 是首个部署到物理人形上的 VLA,按第一人称视觉+语言完成重排;WholebodyVLA、Humanoid-VLA、EgoVLA 等随后跟进。
接口机制的精确细节(从 PDF 读)
GR00T N1 的 latent 接口精确机制(P-GR00T-N1)
GR00T N1 把 System-1/System-2 装进同一个 VLA,但内部仍有清晰的「latent 通货」流转。从论文 Sec 2.1 复盘机制:
System-2(VLM backbone):用 NVIDIA Eagle-2 VLM(由 SmolLM2 LLM + SigLIP-2 image encoder finetune 而来),图像 224×224 输入、pixel shuffle 后每帧 64 个 image token,与文本一起过 LLM。GR00T-N1-2B 总 2.2B 参数,其中 VLM 占 1.34B。关键设计选择:policy 训练时抽取 LLM 第 12 层(中层)embedding 作为传给 System-1 的 latent,而不是最后一层。论文明确写道:「中层 embedding 比最终层 embedding 推理更快、下游 policy 成功率更高」——这是个反直觉但实测成立的发现,原因猜测是最终层 embedding 被 VL 任务 loss 拉得过于「语义化」、损失了对 motor 有用的几何/空间信息,而中层保留了这些。
💡 核心洞察:GR00T N1 取 LLM 第 12 层(中层)而非最后一层 embedding 喂给 System-1——这一反直觉选择揭示:VLM 最终层被 VL loss 拉得过于「语义化」、损失 motor 必需的几何/空间信息,中层反而保留了它们,是「语义↔几何」在 transformer 深度上的真实分界。
System-1(DiT action expert):一个带 adaptive layer-norm 的 Diffusion Transformer $V_\theta$,结构上交替 cross-attention(让 noised action token 看 VLM latent $\varphi_t$)和 self-attention(action token 互相看 + 看 robot state embedding $q_t$)。action flow matching 损失:取 ground-truth action chunk $A_t$(chunk 长度 H=16)、flow timestep $\tau\in[0,1]$、噪声 $\epsilon\sim\mathcal N(0,I)$,noised action $A_t^\tau = \tau A_t + (1-\tau)\epsilon$,目标是预测去噪速度场 $\epsilon - A_t$,loss 见论文 Eq. 1。$\tau$ 调度用 Beta 分布 $p(\tau) = \text{Beta}(\frac{s-\tau}{s}; 1.5, 1)$, $s=0.999$。推理:随机采 $A_t^0$,用 K 步 forward Euler 积分生成 action chunk,实测 K=4 步即够。一次 16-action chunk 推理在 L40 bf16 上 63.9 ms,对应 ~120 Hz 高频控制。
跨本体统一机制:用 embodiment-specific 的 MLP encoder/decoder 把不同机器人 URDF 的 state/action 维度投影到共享 embedding 维度,让 DiT 主体跨本体共享。再加 LAPA latent action 预训练:用 VQ-VAE 从视频中抽 latent action label,把无 action 标签的人类 egocentric 视频当「LAPA embodiment」一起训,让所有本体(机械臂/双手/人形/人)共享同一个 latent action space——这是 N1 跨本体泛化的关键。论文 Fig. 4 展示:同一个 latent action 在 8 种本体(含人)上都对应「右臂向左/向右」,说明 latent action 空间跨本体语义一致。
所以 GR00T N1 的「latent 接口」其实是两层嵌套:(a) VLM 第 12 层 embedding 作为 System-2→System-1 通货;(b) LAPA latent action 作为跨本体统一 action representation。这是「关节角接口」和「latent 接口」的混合体——名义上输出关节角,实质上是通过 latent action space 抽象过的。
SONIC 的 universal token space 怎么和 VLA 对接(P-SONIC)
SONIC([Luo & Yuan 2025, arXiv:2511.07820],NVIDIA GEAR)从 WBC 端给 VLA 提供了一个全新的 action space 选择:让 VLA 直接预测 universal motion token,而不是关节角或 SMPL。机制(论文 Sec 2.5 & Fig. 7):
三个专用 encoder + 一个共享量化器:robot motion encoder $\mathcal{E}_r$、human motion encoder $\mathcal{E}_h$、hybrid motion encoder $\mathcal{E}_m$(upper-body keypoint + lower-body robot motion 组合)分别处理不同模态的 motion 命令,输出经 Finite Scalar Quantization(FSQ)(论文明确选 FSQ 而非 VQ-VAE,以避免 codebook collapse、且兼容 PPO straight-through gradient)压成 universal token;这同一个 token 喂给同一个 universal control policy $\pi$,输出 PD joint target。VLA 侧看到的是 64 维 universal token + 14 维 hand joint = 78 维 action。量化保证 token 离散、可被 VLA 当 categorical/连续预测。
VLA 实验配置:把 GR00T N1.5 VLA 接到 universal token 接口,让它预测 78 维 action = 64 维 universal token + 14 维 hand joint。在 5 个 loco-manipulation 任务(apple-to-plate、carrot pickup、scrub pickup、open trash can by stepping on pedal、soda can to trash can、drill+box relocation)上,平均成功率 75%(10-20 trials/task)。最复杂的 soda-can-to-trash-can(5 个串联子技能:走到桌-抓罐-走到垃圾桶-单脚踩踏板开盖同时单腿平衡-扔进罐)60% 成功率,这种同时要手部 manipulation + 脚部 manipulation + 动态平衡的任务,是关节角接口「上半身和下半身解耦」的方案根本做不出来的。
为什么 universal token 优于直接 SMPL:SONIC 论文明确比较——让 VLA 直接预测 SMPL 参数,结果是jerk 严重、方向控制差;预测 universal token 则平滑安全。原因是 token 已经被 motor foundation(42M 参数、100M 帧训练好的 tracker)「物理化」过,落在可行流形上;而 SMPL 参数空间是开放的高维空间,VLA 没法保证输出落在物理可行子流形里。
这给 VLA+WBC 分层的根本启示:SONIC 把「latent 接口」从「System-2 VLM 内部 latent」推到了「System-1 WBC 提供的 external latent」——WBC 主动给上层提供一个语义+物理兼具的 token,VLA 只需要学「在什么场景下输出什么 token」。这绕过了「让 VLM latent 同时承载语义+motor」的难题,是跨本体 motor token 协议的早期形态。
💡 核心洞察:SONIC 把 latent 接口从「System-2 内部」推到「System-1 主动提供」——WBC 不再被动接收上层指令、而是主动给上层提供一个「语义+物理兼具」的 universal token,这从根本上绕过了「让 VLM latent 同时承载语义+motor」的难题,是跨本体 motor token 协议的早期形态。
三种接口方案的深度对比
按 4 个维度的精确分析(含基于 PDF 的实测数据):
| 维度 | (1) 语言子指令 | (2) 关节角 / 末端目标 | (3) 潜向量 latent |
|---|---|---|---|
| 带宽 | 低(离散 token,~10 token/s) | 高(G1 humanoid ~23-37 DoF × 120 Hz = 数千 dim/s) | 中-高(Helix latent 单向量;SONIC 64 维 token) |
| 可微性 | 否(argmax / 采样不可微) | 是(关节角可微,但通常 detach gradient) | 是(端到端梯度回传,Helix/GR00T N1 都联合训) |
| 训练难度 | 低(VLM 压指令即可) | 中(每本体要重训 + 数据采集贵) | 高(需要 latent space 对齐 + 跨本体一致) |
| 跨本体 | 强(语言通用) | 弱(URDF 敏感,GR00T N1 用 LAPA 缓解) | 中(SONIC universal token 跨本体语义一致,但仍需重训 encoder) |
| 延迟容忍 | 高(意图层) | 低(关节角失配即失稳) | 中(latent 是「意图 + 几何」的混合) |
| 可解释 | 强 | 强 | 弱 |
| 代表 | Hi Robot, RT-H | 早期 GR00T N1 | Helix, SONIC, GR00T N1(VLM 第 12 层) |
核心权衡:可解释性 ↔ 带宽 ↔ 训练成本,三者难以同时取得。语言子指令在可解释和低成本上胜但带宽不够;关节角带宽够但跨本体差;latent 是带宽和跨本体的 sweet spot 但训练最复杂、可解释最弱。SONIC 的 universal token 是目前最接近「全部都要」的尝试——通过量化离散化拿到一点可解释性,通过 motor foundation 预训练压低下游 VLA 训练难度。
💡 核心洞察:三种接口的本质权衡是「可解释 ↔ 带宽 ↔ 跨本体」三角不可能——语言可解释但带宽不够、关节角带宽够但跨本体差、latent 是 sweet spot 但训练最复杂;SONIC 的 universal token 通过量化离散化 + motor foundation 预训练第一次让三角同时部分成立。
状态对齐与延迟同步
分层架构的工程难点不在"分层"本身,而在两层之间的状态对齐与延迟同步:System-2 慢,所以它的决策基于几百 ms 前的观测;System-1 快,但它不能等 System-2。当前主流解法是 System-2 周期性产出"任务条件"(latent 或子指令),System-1 在自己的高频环里持续消费这个条件直到下次更新。这要求条件本身对短暂延迟不敏感——这正是 latent 与语言子指令优于原始关节角序列的原因(关节角序列一旦延迟就会失配,而 latent/子指令是"意图"层、对几百 ms 容忍度高)。
GR00T N1 的工程解:action chunk H=16 + flow matching 4 步推理,让 System-1 在 63.9 ms 内吐出未来 16 步动作,给 System-2 留出 ~10 Hz 更新窗口的余量。SONIC 的解:kinematic planner 每 100 ms replan(命令变更即触发),planner 自己吐 0.8-2.4 秒 motion 段,tracker 在高频环里跟踪——把延迟容忍塞进 planner 输出长度里。Helix 02 的解:在 S1 和 actuator 之间再插一层 System 0(S0)@ 1 kHz,专门处理平衡/接触/协调,让高频物理稳定不再依赖 S1 的反馈延迟。
与 SayCan 范式的类比
这套分层本质是 SayCan [Ahn 2022, arxiv:2204.01691] 范式在人形全身上的复刻:SayCan 当年是 LLM(语义概率)× affordance 函数(物理可行性)选技能;今天是 System-2 VLM(语义+视觉)× System-1 motor skill(物理可行性),只是技能库被替换成了可微的 action/visuomotor expert。Code as Policies、VoxPoser、Eureka/DrEureka 同属这一"LLM 思考 + 机器人执行"谱系,只是把"执行端"从硬技能库换成了可训练的连续策略。SONIC 把 SayCan 的「affordance 函数」做实——tracker 本身就是物理可行性的可微化身。
当前最热争论:端到端全身 VLA vs VLA+WBC 分层
2026 上半年社区分裂成两个阵营,争论「该不该分层」:
阵营 A:分层派(GR00T N1 / Helix / SONIC)。主张 VLA 负责语义、WBC/motor foundation 负责物理,各司其职。理由:(1) 工程上已跑通——GR00T N1 开源 2.2B、Helix 02 已在 Figure 03 上完成「最长自主任务」(unload 整个洗碗机);(2) 频率匹配天然——S2 10 Hz + S1 100-200 Hz + S0 1 kHz 各司其职;(3) 数据效率高——SONIC 只用 200-3900 轨迹就训出单任务策略;(4) 可解释、可 debug。代表论调:「分层是人类大脑本身的架构(Kahneman 的 System-1/System-2),没必要强行端到端」。
阵营 B:端到端全身 VLA 派(WholeBodyVLA / SENTINEL / Being-H0.7)。主张一个网络吃下一切,不分层。代表工作:
- WholeBodyVLA([Jiang et al., OpenDriveLab, arXiv:2512.11047, 2025-12];"ICLR 2026" 标识待核——papers.jsonl 中该 arxiv 条目记为 "arXiv preprint 2025",ICLR 2026 收录的是同名 OpenDriveLab 项目但 arxiv 留空)——在 AgiBot X2 上首次实现端到端大空间 loco-manipulation,从 action-free 数据学统一 latent action。核心论点:分层接口是人工瓶颈,端到端才能让语义和 motor 联合优化。
- SENTINEL([Wang et al., CVPR 2026])——end-to-end language-action model for humanoid whole-body control,用大规模构造数据集训练。(待核:本仓库 papers.jsonl 暂无此条目,引文出处需进一步核实。)
- Being-H0.7([BeingBeyond, arXiv:2605.00078, 2026-05];ICML 2026 标识待核——papers.jsonl 中该 arxiv 条目记为 "arXiv preprint",未见 ICML 收录证据)——latent world-action model(WAM),从 20 万小时 egocentric 视频 + 1.5 万小时机器人演示预训练,把「未来感知推理」塞进 VLA-style policy,不生成未来帧而是在 latent 空间做世界模型。这是端到端派里把 world model 也合并进去的激进尝试。
- Ψ₀(Psi-Zero)([S. Wei et al., arXiv:2603.12263, RSS 2026])——开放 foundation model,覆盖 260 个任务 7 大类,声称比 NVIDIA 最新开放模型高 >40%。
阵营 C:折中派(GR00T N2 / Helix 02)。主张「端到端训练,但运行时分层」。GR00T N2(GTC 2026 发布)基于 DreamZero 研究,采用新的 world action model 架构,速度比 N1 快 2 倍;Helix 02 用单一 unified neural network 控制 locomotion / balance / manipulation,但运行时仍表现为 S0/S1/S2 三层——训练端联合、推理端分层。这其实是说「分层派和端到端派的争论是伪命题——只要训练可微、架构允许,运行时分层只是部署优化」。
我的判断:阵营 C 会赢。理由:(1) 端到端训练的好处(联合优化、无接口瓶颈)和运行时分层的好处(频率匹配、可解释)并不冲突——只要网络架构支持高低频解耦(GR00T N1 的 VLM + DiT 双模块已经是雏形);(2) 阵营 B 的 WholeBodyVLA 在 frequency 和稳定性上仍未跑通剧烈动作(与 BeyondMimic / SONIC 的 cartwheel、sprint 比差一个数量级),而阵营 A 的分层已经部署在 Figure 03 上做家务;(3) 关键的未解问题是「unified latent action space 是否存在」——如果存在(SONIC universal token 是早期证据),阵营 C 就是它的自然结果;如果不存在,阵营 A 的硬分层会长期保留。
💡 核心洞察:阵营 C(「端到端训练 + 运行时分层」)会赢的本质原因是——「联合优化」和「频率匹配」根本不在同一轴上,端到端训练的好处(无接口瓶颈)和运行时分层的好处(高频稳定)完全可叠加,两派争论是伪命题;唯一真正未解的是「unified latent action space 是否存在」,SONIC 已给出早期肯定证据。
我的判断:哪种接口会赢
核心论断:潜向量接口会在 System-2 → System-1 这一紧耦合层胜出,而语言子指令会作为更上层的"人 / System-3 → System-2"接口长期共存,关节角接口是过渡方案。
理由:
- 潜向量胜出的原因:(a) 它是唯一带宽足够承载精细 visuomotor 耦合的接口——"把杯子向左挪 2cm"这类连续微调根本无法用离散语言 token 表达;(b) 它可微,端到端训练时梯度可以从 System-1 流回 System-2,整条链路联合优化;(c) Helix 已用单一权重 + 200Hz 控制整个上半身证明了工程可行性;(d) SONIC 的 universal token 进一步证明 latent 可以「跨本体 + 物理 feasible」,补齐了 latent 接口最后的短板。带宽、可微、已验证、跨本体四点同时成立。
- 语言子指令不会被取代的原因:跨任务、跨本体、跨场景的组合性是语言独有优势,且它是人类与系统交互的天然层。它不适合做精细控制,但适合做"先去厨房、再开冰箱"这类粗粒度规划。
- 关节角接口是过渡的原因:它直接绑定具体机器人 URDF,跨本体迁移要重训,与"基础模型"的跨本体诉求矛盾。它今天的流行只是因为 GR00T N1 把 System-1/2 都装进同一个 VLA、外部看不到 latent。一旦 VLA 与 WBC 显式分层、且跨本体成为硬需求,关节角就会被 latent 取代。
所以最可能的终局是两层接口共存:上层用语言子指令(人 ↔ System-2),下层用 latent(System-2 ↔ System-1),最底层(System-1 ↔ actuator)由 SONIC 式 tracker 提供 universal token。关节角只在 System-1 内部、对具体机器人私有存在。
必须澄清的三个区分
为避免与相邻线索混淆:
- 实时 teleop vs 采集型 teleop:前者重延迟与带宽、操作员在线闭环;后者重轨迹多样性与覆盖度、操作员离线批量采(见 T07)。
- 全身 teleop vs 半自主 teleop(HOMIE):前者操作员控全身、认知负荷高;后者上半身 teleop + 下半身 RL locomotion(HOMIE),是降负荷的工程妥协。
- VLA+WBC 分层 vs end-to-end 全身 VLA:前者(GR00T N1、Helix、SONIC)把语义与 motor 拆成两层/三层;后者(WholebodyVLA、SENTINEL、Being-H0.7)试图一个网络吃下一切。当前部署 SOTA 全部是分层(Figure 03 / Helix 02 已做家务、GR00T N1 部署 GR-1),端到端全身 VLA 在频率与剧烈动作稳定性上都还未跑通,但代表长期方向,且 GR00T N2 / Helix 02 正在模糊两派边界。
2026 最新进展
承接「阵营 A/B/C 三派」争论,2026 上半年 VLA+WBC 分层沿「全身最优控制 + VLA / 跨硬件 WBC / 端到端 latent VLA / 身体-手 prior 协调 / 感知 BFM」五条轴线深化——分层 vs 端到端边界正在快速模糊:
- POT-VLA:把对象状态同时用于行动与验收(× T06/T09):POT-VLA [Ren et al., arXiv:2607.18016] 维护跨移动、遮挡与接触的 RGB-D 3D object record,并把它同时喂给 whole-body action expert 与几何 predicate check。它针对的不是「再把动作预测得更好」,而是长时程 humanoid VLA 的 object-state divergence:驱动动作的状态与判断任务是否完成的状态必须是同一个。论文报告在 Unitree G1 的八类真机任务中 71/80 成功,对比 matched direct GR00T-N1.7 的 39/80;这是作者报告的预印本结果。它为 T10 增加了 object-centric closed-loop execution 这条分支。
- WOLF-VLA:把全身最优控制注入 VLA 训练数据:WOLF-VLA [Boukheddimi et al., arxiv:2606.25591](DFKI + Northeastern)把全身最优控制(OC)运动合成与大规模多模态数据集结合训练 VLA,使其能生成动态可行、安全、最优的人形全身运动。把 VLA 的应用边界从桌面操作扩到全身接触丰富的 humanoid locomotion;同时解决「动态一致演示数据稀缺」+「难以在 learning 管线中编码 optimality/safety」两个根本障碍——给「阵营 A 分层派」提供了「如何用 OC 给 VLA 制造高质量全身数据」的工业化方案,是 VLA × humanoid 标志性工作。
- Ψ₀ 与 OpenHLM:开源 humanoid loco-manip 基础模型登场:Ψ₀ (Psi-Zero) [Wei et al., arxiv:2603.12263, RSS 2026](Stanford Marco Pavone 等)是开放 VLA 基础模型,两阶段训练——先在大量数据上自回归预训练 VLM backbone 学任务语义与视觉表征,再 fine-tune 做灵巧 loco-manipulation;benchmarks 上据称超过 NVIDIA GR00T N1.6。OpenHLM [arxiv:2606.22174] 则给出「Whole-body Humanoid Loco-Manipulation」的实证 recipe——是 2026 上半年的「开放人形 foundation 模型」工业化代表作。两者共同把「开放人形 VLA」从 GR00T N1 一家推到多家竞争。
- XHugWBC + EAGLE:跨硬件 unified WBC 落地:XHugWBC [Xue et al., arxiv:2602.05791](ICML 2026,SJTU + Shanghai AI Lab)通过 physics-consistent 形态学处理让单一 WBC 对未见过的 humanoid 形态实现 zero-shot 泛化,是 HugWBC(ICML 2025)的扩展。EAGLE [Peng et al., arxiv:2602.02960](SJTU + Shanghai AI Lab)走另一条路:迭代式 generalist-specialist distillation + embodiment-aware 项,把针对异构 humanoid 的多个 specialist 逐步蒸馏成单一 unified policy。两者是「阵营 A 的 WBC 侧」在 2026 的关键收口——Unitree H1/G1、Booster、傅利叶等多平台并存的现实不再要求每个硬件重训,是分层架构最终能跨本体部署的关键。
- WholeBodyVLA:端到端 latent VLA 在 AgiBot X2 落地(× T06 阵营 B):WholeBodyVLA [Jiang et al., arxiv:2512.11047](OpenDriveLab,2025-12 预印本;ICLR 2026 收录待核)统一 latent VLA 框架,把语言-视觉-动作与大空间 loco-manipulation 结合;内含 locomotion-oriented RL policy 实现扰动下精确稳定的全身协调,在 AgiBot X2 上做端到端验证。把 WBC 从纯 RL 推向「latent VLA + RL policy」,定义了 2026 上半年「whole-body foundation model」的形态——是「阵营 B 端到端派」当前最强的实证。
- CoorDex:身体-手 prior 显式协调(连续 loco-manip):CoorDex [Li et al., arxiv:2606.23680](Berkeley + Tsinghua + Shanghai Qi Zhi,Ding 组)协调身体 prior 与手部 prior 实现连续的人形灵巧 loco-manipulation:把躯干 locomotion prior 与灵巧手 manipulation prior 显式协调,使人在「边走边抓」等连续任务上不再需要分段切换。解决「走一步停一步再抓」的痛点——连续 loco-manipulation 是 2026 年人形操作的关键能力跃迁;其「body-hand prior 协调」思路与 WholeBodyVLA/OpenHLM 的端到端统一路线互补,是另一条技术路径。
📌 关键要点
1. VLA+WBC 分层的根本张力是频率与表征不对齐:7B VLM 单步数百 ms、WBC 跑 100 Hz+,中间必须有翻译层,接口设计是当前最尖锐的开放问题
2. 三种接口中 latent 是带宽 / 可微 / 跨本体的 sweet spot——Helix 用 latent 通信用单一权重 + 200 Hz 控整个上半身证明可行,SONIC universal token 补齐了 latent「跨本体 + 物理可行」的最后短板
3. GR00T N1 的「中层 embedding 优于最终层」是反直觉但成立的发现——最终层被 VL 任务 loss 拉得过于语义化、损失 motor 几何信息,而中层保留这些
4. SONIC 的 universal token 把 latent 从「System-2 内部」推到「System-1 提供的 external」——WBC 主动给上层提供语义 + 物理兼具的 token,绕过「让 VLM latent 同时承载语义 + motor」的难题
5. 阵营 C(GR00T N2 / Helix 02「端到端训练 + 运行时分层」)会赢——阵营 A 已部署 Figure 03 做家务、阵营 B 在剧烈动作稳定性上仍差一个数量级,关键是「统一 latent action space 是否存在」,SONIC 是早期证据
开放问题
- 接口标准未定:本文判断 latent 会赢,但社区尚无统一 latent 空间协议,跨论文/跨本体不可比。SONIC universal token 是早期候选,但是否会被 GR00T N2、Helix 02 采纳仍是开放问题。
- 触觉反馈缺失:灵巧手精细操作仍开环,分层架构也救不了缺失的触觉信号。
- 长程全身任务认知负荷:分层降低了对 VLA 频率的要求,但长时序任务规划仍是开放问题;Being-H0.7 的 latent world-action model 是值得跟踪的方向。
- 评估方法:真机评测昂贵不可复现;world model(1X WM、Cosmos、Cosmos 3)能否可靠做评估器仍存疑,是值得重点跟踪的方向。
- 三层架构的接口膨胀:Helix 02 的 S0/S1/S2 三层引入两个接口(S2↔S1、S1↔S0),每个都要定通货类型——分层越多,接口设计问题越尖锐,不是越少。
关联论文笔记
本线索涉及的核心论文在本仓库已有深度笔记:
- P-SONIC-2025.md [Luo & Yuan et al., arXiv:2511.07820]——motor foundation 化的 WBC。1.2M→42M / 4M→100M 帧 / 2K→21K GPU 小时 scaling curve、universal token space(64 维 quantized,robot/human/hybrid 三 encoder)、GR00T N1.5 VLA 预测 78 维 action(64 token + 14 hand)、5 个 loco-manipulation 任务 75% 平均成功率、直接预测 SMPL 会 jerk 而预测 token 平滑——架构细节见该笔记。SONIC 是 T04/T08/T10 三条线的工程汇聚点。
papers/P-Helix-2025.md(待补全)——Figure 闭源,7B+80M 双系统 + latent 通信;2026 的 Helix 02 加入 System 0 @ 1 kHz。papers/P-HumanVLA-2024.md(待补全)——首个部署到物理人形的 VLA。papers/P-SayCan-2022.md(待补全)——分层范式的语义先驱。- 2026 待补笔记:WholeBodyVLA(arXiv:2512.11047)、SENTINEL(CVPR 2026)、Being-H0.7(arXiv:2605.00078)、Ψ₀(arXiv:2603.12263)、GR00T N2(GTC 2026)、Helix 02(Figure 2026)。
可选复盘:常见误区
澄清:"大模型直接输出关节角就够了,不用分层" —— 短期做不到。大模型单步推理数百毫秒,稳定控制要一百赫兹以上,频率差两个数量级。分层是把频率不匹配摊给两层各做各的 。
"大模型直接输出关节角就够了,不用分层" —— 短期做不到。大模型单步推理数百毫秒,稳定控制要一百赫兹以上,频率差两个数量级。分层是把频率不匹配摊给两层各做各的 [引用]。
分层是频率适配的工程必需,不是架构偏好。
澄清:"Helix 的接口就是关节角" —— 常见误传。Helix 两层之间传的是学习的潜向量,不是关节角 。把潜向量误读成关节角,会错过它"可端到端优化"的核心优点。
"Helix 的接口就是关节角" —— 常见误传。Helix 两层之间传的是学习的潜向量,不是关节角 🌐。把潜向量误读成关节角,会错过它"可端到端优化"的核心优点。
Helix 是 latent 通货,不是关节角通货。
澄清:"端到端全身 VLA 已经赢了分层" —— 还没有。当前能部署做家务的真机都是分层。端到端全身派在剧烈动作和频率稳定性上仍未跑通 。
"端到端全身 VLA 已经赢了分层" —— 还没有。当前能部署做家务的真机都是分层。端到端全身派在剧烈动作和频率稳定性上仍未跑通 📎。
部署 SOTA 当前全是分层,端到端是长期方向。
可选复盘:检查点
人形同时要"听懂话"和"站稳"。为什么一个大模型两端通吃做不到?讲清频率这关。
查看参考答案
- 核心矛盾:语义大模型单步推理要几百毫秒(几赫兹级),而稳定控制要一百赫兹以上更新,两端频率差两个数量级。
- 一个网络同时满足两头做不到:要语义就得大、大就慢;要高频就得小、小就听不懂复杂任务。
- 结论:必须分层,把'慢但聪明'和'快但笨'分给两层各做各的,中间靠翻译层接上。
分层中间的三种"通货"各是什么?哪一个带宽最高、哪一个最可解释?
查看参考答案
- 三种通货:语言子指令、关节角目标、潜向量。
- 带宽最高:潜向量(连续向量,承载精细微调);关节角也高但绑定本体。语言子指令带宽最低(离散 token,'左挪两厘米'说不清)。
- 最可解释:语言子指令(人能直接读懂);关节角也可解释(每个关节的度数);潜向量最不可解释(一串数字,人读不出意图)。
用"总裁与车间师傅"或你自己的类比,向没学过机器人的人解释:慢大脑和快手为什么能合作?类比必须体现"中间有一张工单"这层。
查看参考答案
- 角色映射:总裁=语义大脑(懂战略、下指令慢),车间师傅=运动小脑(手快、只懂零件图)。
- 工单=翻译层/通货:总裁不直接开车床,师傅也不参加董事会;中间靠工单把战略意图翻译成师傅能执行的图纸/指令。
- 为什么能合作:意图层(工单)对几百毫秒延迟不敏感——总裁慢想一张工单,师傅在两次工单之间高频地出活,所以慢和快不冲突。
如果换一台关节完全不同的机器人,三种通货里哪一种最不友好?为什么?
查看参考答案
- 最不友好:关节角目标。它直接绑定具体机器人的每个关节度数,换一台关节不同的机器人就要重训。
- 对照:语言子指令跨本体最强(语言通用);潜向量居中(需重新对齐 latent 空间但仍可迁移)。
- 根因:关节角是 embodiment-brittle(本体敏感),与'基础模型跨本体'的诉求矛盾,所以被视作过渡方案。
潜向量接口牺牲了什么、换来了什么?请各列一条。
查看参考答案
- 牺牲:可解释性——一串数字人读不出意图,debug 难、与人类交互不直观。
- 换来:带宽高(承载连续微调)+ 可端到端训练(梯度可从下层流回上层,整条链路联合优化)。
- 对照点:这正是它比语言子指令(可解释但带宽低)和关节角(绑定本体)更被看好的原因。