🔬 本页是一张「今日水位图」:一眼看到机器人 RL 运动控制每条主线当前的 SOTA、2026 上半年最新进展、待解问题。每条主线挑 1 篇代表作 + 2-3 篇 2026 新进展 + 2-3 条开放问题。底部 5 条横切问题跨方向回看。要深入某条线,进对应线索的 线索入口。
怎么读这一页
- 当前 SOTA:每条主线当下最强 / 最高水位的 1 篇代表作(按定位挑,如「制高点 / 合流点 / 最远端」)。
- 2026 新进展:2026 上半年(截至 2026-07-21)的新工作,反映该方向的活跃曲线。
- 开放问题:从各线索「开放问题 / 局限」节挑 2-3 条最尖锐的。
- 标题后括号给出该线索的核心谱系(如 AMP→BFM→SONIC),便于横向比对。
- 📎 图标 = 本文已有专门教学页,点击进深读;bare arXiv id = 仅有线索文档覆盖。
- 个别线索(T02 数据 / T03 reward)2026 上半年未公开里程碑新工作,标「(暂无)」如实反映曲线斜率,不强行凑条目。
T01 · Sim-to-Real 与在线适应(四足 / 人形 Locomotion)
谱系:DR → SysID → RMA → ASAP(第四次转向)
- 当前 SOTA:ASAP: Aligning Simulation and Real-World Physics [He et al., RSS 2025, arXiv:2502.01143] 📎 — 用 residual delta dynamics「让仿真器学 gap 而非让策略扛 gap」,是剧烈动作迁移当前最好的答案。
- 2026 新进展:
- Simulator Adaptation via PDM [Dao & Fern, arXiv:2604.11090] — 把硬件/仿真 rollout 当关节观测+动作的分布比较,<5 分钟硬件数据即可辨识。
- Now You See That [Sun et al., arXiv:2602.06382] — 高保真立体深度仿真 + vision-aware distillation + multi-critic/multi-discriminator AMP,人形端到端 vision-based locomotion 代表作。
- MPC-Injection Xing et al., arXiv:2606.26392 — 把 MPC 转移直接注入 RL replay buffer,不改正 reward、不写 curriculum 即可塑造可部署步态。
- 开放问题:
- 剧烈动作(跳、翻滚、踢打)的 sim-real gap 仍难——接触瞬间短、运动学放大系数高,ASAP 的确定性 delta 对随机性接触(沙地、碎石)仍失效。
- 可变形/流体地形的物理建模瓶颈——连续介质力学塞不进刚体仿真器,是结构性的物理建模限制。
- 跨机器人形态迁移(H1 训的能给 G1 用吗)仍停留在「换 URDF 重训」层面,缺 morphology-invariant 表示。
T02 · 数据集与仿真基础设施的演化
谱系:AMASS → OpenX → DROID → Isaac Lab / GR00T
- 当前 SOTA:Open X-Embodiment / RT-X [OpenX Collaboration, arXiv:2310.08864] 📎 — 机器人学的「ImageNet 时刻」:22 本体 RLDS 统一 + RT-2-X emergent skill 提升 3 倍,首次定量证明跨本体正向迁移。基础设施层最新的里程碑是 GR00T N1 [Bjorck 2025, arXiv:2503.14734] 📎。
- 2026 新进展:(暂无)线索 2026 上半年未公开新里程碑论文,最新止于 2025 GR00T Mimic/Dreams/Cosmos 系列——如实反映「基础设施层 2026 处于消化期」。
- 开放问题:
- 数据规模差 4-5 个数量级(OpenX 1M 轨迹 vs LLM 几十 T token),合成数据补「量」未必补「质」,world model 可能「幻觉」出不合法轨迹。
- 数据质量 vs 数量(DROID 小而精 vs OpenX 大而杂)是否互相稀释仍无定论,机器人版「数据配比 / 课程」没人系统研究。
- Sim-to-real 评测能走多远——SimplerEnv 只在低动力学 manipulation 上证明「排序相关」,The Colosseum 在 14 轴扰动下 SOTA 成功率仍掉 30-50%。
T03 · Reward 设计的演化(手工 → motion prior → LLM 自动)
谱系:手工工程 → AMP(数据替代)→ Eureka / DrEureka(LLM 自动写)
- 当前 SOTA:DrEureka: Language Model Guided Sim-To-Real Transfer [Ma et al., ICLR 2025, arXiv:2406.01967] 📎 — 第一次让 LLM 生成的 reward 支撑真机部署(四足、两足倒立行走、瑜伽球平衡),核心贡献是 RAPP(Reward-Aware Physics Prior)三阶段闭环。
- 2026 新进展:(暂无)线索 2026 上半年未公开新里程碑论文,最新止于 DrEureka 2024;同期的 Selective AMP / ADP(动力学判别器)属 T04 谱系,从那里读。
- 开放问题:
- LLM 写 reward 的物理直觉弱——对接触、摩擦、形变这类需物理理解的 reward,容易写出「看起来对但实际不 work」的代码。
- 剧烈动作(跳跃、翻滚)的 reward 极敏感,DrEureka 也不保证 work。
- Reward hacking 无根本解法——无论手工、数据、LLM,策略都可能找漏洞(AMP mode collapse、Eureka「假成功」)。
T04 · Motion Prior:从 AMP 到 BFM
谱系:DeepMimic → AMP → ASE/CALM → PHC/UHC → BFM → SONIC
- 当前 SOTA:SONIC [Luo & Yuan, NVIDIA GEAR, arXiv:2511.07820] 📎 — 当前制高点:universal token motor foundation,参数从 BFM 的 ~1.2M 扩到 42M、数据扩到 100M+ 帧 / 700h 动捕,首次验证人形 motor control 也吃 scaling law;与 VLA(GR00T N1)整合做全身 loco-manipulation。ICLR 2026 录用、全开源。
- 2026 新进展:
- Scaling BFM Zeng et al., arXiv:2607.15163 — 人形 BFM 首份系统性 scaling-law 研究;MPKPE 上比已有 controller local 模式降 10%、global 模式降 82%,给出「on-policy rollout 数 × 参考动作多样性 × Humanoid Transformer 架构」三项协同结论。
- ADP Lee et al., arXiv:2607.03454 — 把 AMP 判别器目标从运动学特征换成动力学特征(CoM、centroidal momentum、接触力),将 AMP 从 kinematic prior 升级为 dynamics prior,扰动后方向平均恢复时间降 47.9%。
- ABot-C0 Zhao et al., arXiv:2607.07370 — 四足 BFM 登场(ABot Robotics / 小米),Flow-Matching 通用策略 + 多源数据金字塔(16014 条动作),首次在四足上证明 motion tracking 性能随训练规模单调提升。
- 开放问题:
- BFM 工程复现门槛——BFM 论文已 accepted ICRA 2026 但官方代码未开源,proxy agent 训练细节、mask schedule 超参、CVAE latent 维度均需反推(SONIC 已开源,但其 scaling law 是否覆盖 BFM 全部下游 mask 模式仍待社区验证)。
- 跨形态 retarget 损耗——SMPL → 真机人形(H1/G1/GR1)在自由度、连杆长度、质量分布上不一致,剧烈动作下丢失动量/接触信息,是 sim-to-real 的隐性瓶颈。
- AMP 的 mode collapse 是否被 BFM 真正解决——BFM CVAE 理论上更抗 mode collapse,但论文未直接对比,社区仍缺统一 benchmark。
T05 · 模仿学习的动作分布建模(Diffusion Policy 谱系)
谱系:朴素 BC → DAgger → Diffusion Policy → ACT → π0(VLA 合流点)
- 当前 SOTA:π0 [Black et al., Physical Intelligence, arXiv:2410.24164] 📎 — 本线索的合流点:PaliGemma 3B VLM + 独立 action expert(~300M)+ flow matching 生成 H=50 连续 action chunk;10 步 Euler ODE、prefix K/V 跨步缓存;「VLM backbone + flow action head + action expert」成为后续 RDT-1B / CogACT / GR00T N1 的事实骨架。
- 2026 新进展:
- Reflex Guo & Liu, arXiv:2607.14695 — 发现 perception encoders 在不同去噪步上函数近似不变(「时间步不变性」),据此为 flow-matching VLA 启用 streaming inference + KV-cache,把实时性还给 flow-matching 系 VLA。
- Ambient Diffusion Policy Wei et al., arXiv:2606.12365 — MIT Tedrake 组;用 noise-dependent data usage 让次优数据只在高/低 diffusion time 起作用;OpenX 混合数据上比 co-training 提升 33%,首次把扩散模型理论与机器人数据光谱特性结合。
- A2A Flow Matching Jia et al., arXiv:2602.07322 — 以历史 proprioceptive action 序列编码为高维 latent 作为 flow matching 起点(替代随机高斯噪声),单步推理即可生成高质量动作,挑战「必须从噪声开始」的前提。
- 开放问题:
- 推理延迟 vs 灵巧控制频率的矛盾——diffusion 50 步、flow 10 步都还是太慢,灵巧手 30 Hz+ 闭环吃力;1 步学生有性能损失,「真正实时、零损失的 diffusion action head 仍未出现」。
- 协变量偏移真的被解决了吗——action chunking 只是「缩短有效 horizon、推迟」协变量偏移而非消除,chunk 滚动累积误差一旦把策略推出训练分布仍会崩。
- 长程任务的单 chunk 局限——DP chunk N=16、π0 H=50 都远不够家居级几十分钟任务;分层 VLA 的高层/底层接口(语言 / latent / 关节)怎么设计仍是开放问题。
T06 · VLA 五段演进(动作 token 化 → 双系统人形)
谱系:RT-1 → RT-2 → OpenVLA → π0 → GR00T N1 / Helix
- 当前 SOTA:GR00T N1 [Bjorck et al., NVIDIA, arXiv:2503.14734] 📎 — 2025 人形 VLA 的「事实标准」:System-2 VLM(Eagle-2 = SmolLM2 + SigLIP-2,~1B,~10Hz on L40)输出第 12 层 hidden state 作 latent plan;System-1 为 Diffusion Transformer(120Hz)用 flow matching 去噪出 motor command;配套 Cosmos / Isaac Lab / GR00T Mimic 合成数据 pipeline。
- 2026 新进展:
- LAP-3B Zha et al., Princeton, arXiv:2602.10556 — 直接用自然语言文本表示低层动作让监督信号与 VLM 输入-输出分布对齐;首个完全无本体专属微调就能对新机器人实现实质 zero-shot 迁移的 VLA,平均成功率 >50%(较此前最强 VLA 翻倍)。
- ZR-0 Li et al., RUC + Kuaishou + ByteDance, arXiv:2606.30552 — 2.6B;用密集 Embodied Chain-of-Thought(ECoT)监督对齐 VLM 跨本体表征,推理时可跳过 ECoT 生成无性能损失。
- E-TTS Ye et al., CAS / Haier, arXiv:2606.27268 — 首个模块化即插即用的 Embodied Test-Time Scaling 框架,跨 4 benchmark / 6 环境 / 3 本体 / 4 基础 VLA 仿真 +33.14%、真机 +26.62%。
- 开放问题:
- 推理延迟 vs 灵巧控制频率(最尖锐)——7B VLA 单步几百 ms,灵巧要 30Hz+、人形要 100Hz+;双系统的 latent 接口如何训练(System-2 的 latent 怎么对齐 System-1 的输入)仍是开放问题。
- 跨本体泛化的上限——OpenX 1M 远不够(数据少 4-5 个数量级),跨本体 + 跨任务 + 新本体 zero-shot 仍弱于专门微调;合成数据 + AutoRT 式自主采集是补齐方向。
- VLA + locomotion WBC 接口标准——语言 / 关节角 / latent 三种接口都有人用没有共识,状态对齐与延迟同步是 2025-2026 最重要的开放问题之一。
T07 · 人形遥操技术栈(Humanoid Teleop Stack)
谱系:VR 手柄 → Apple Vision Pro → VR + 动捕服 → Handroid(统一本体)
- 当前 SOTA:Handroid Li et al., arXiv:2607.16187 — 27-DoF 桌面级双形态机器人,首次用单一本体统一灵巧手与人形两种典型形态,整机开源——打破「输入设备 / 映射目标 / 跟踪后端」三段式中硬件本体隔离的传统约束。工业侧的极化表达是 Figure Helix-02「No cloud. No teleoperation.」(2026.02,无 arXiv id)。
- 2026 新进展:
- AnyDexRT Wang et al., arXiv:2607.08341 — calibration-free 灵巧手 kinematic retargeting,少量人类引导即可跨手迁移,避免对手工目标函数 / 精确标定 / 全局形状匹配的依赖。
- DEX-Mouse [Koh et al., arXiv:2604.15013] — 手持式、免标定、operator-agnostic 灵巧手遥操接口,集成动觉力反馈,COTS 元件、成本低于 150 USD。
- (同期)Bilateral Teleop Framework [arXiv:2606.15434]、HUSKY [arXiv:2602.03205](RSS 2026)、RealDexUMI [arXiv:2606.06033]、HumanoidExo [arXiv:2510.03022] 均属 2026。
- 开放问题:
- 触觉反馈仍粗糙——Bunny-VisionPro 的 $1.2 ERM 只能反馈「接触有/无」,无法传力方向与大小;力反馈手套成本与延迟仍高于 ERM 振动方案。
- 认知负荷——长时全身任务对操作员极不友好,HOMIE 半自主是部分解,工业路线(Helix-02「no teleop」)直接绕过但要求 VLA + WBC 已足够成熟。
- 数据多样性——单实验室单操作员数据泛化差,跨操作员 / 跨硬件的 motion 分布偏移仍未系统量化。
T08 · 动作生成的 physics-aware 转向
谱系:纯 kinematic 生成 → PhysDiff / ReinDiffuse → BeyondMimic → SONIC(motor foundation 收编)
- 当前 SOTA:SONIC [Luo & Yuan, NVIDIA GEAR, arXiv:2511.07820] 📎 — motor foundation 化趋势的代表:把 motion tracking 扩到 foundation 规模(1.2M → 42M 参数、4M → 100M 帧、2K → 21K GPU 小时,success rate 随 scaling 单调上升无饱和),并用 universal token space(64 维 quantized)让「生成 → 真机」中间不再需要显式 retarget。
- 2026 新进展:
- A2A Flow Matching Jia et al., arXiv:2602.07322 — 历史 proprioceptive action 序列编码为高维 latent 作 flow matching 起点(替代随机高斯噪声),单步推理生成动作;挑战 diffusion/flow policy 必须从随机噪声开始的前提。
- ReActor Müller et al., Disney Research, arXiv:2605.06593 — 基于 RL 的 physics-aware retargeting,直接在物理仿真器中训 retarget policy,端到端打通「retarget 质量决定后续 tracking 上限」的结构性痛点,超越 GMR 与 OmniRetarget。
- SafePBDS [Wu et al., Stanford C. Karen Liu 组, arXiv:2605.21811] — Safe Pullback Bundle Dynamical Systems,从异构任务流形上的目标与安全约束计算可证明安全的最优配置流形加速度,弥补学习方法缺乏安全证明的痛点。
- 开放问题:
- 物理一致性仍「贴上去」——post-hoc / reward shaping / guidance 都不是原生物理生成,把 physics deep-bake 进 generative model 仍是开放问题;SONIC 合流方案回避了这问题,但代价是生成器与物理执行强耦合在一个 foundation 里。
- 实时性——diffusion 采样慢(数十步),BeyondMimic 的 kinematic planner 做到 5ms 级,但仍难支撑 30Hz 真机闭环对剧烈动作的即时响应。
- Motor foundation 与独立生成器的关系未定——SONIC 主张「收编」,但生成界(MotionHiFlow、FrankenMotion)仍在独立迭代,最终是「一个 foundation 吃掉一切」还是「生成器 + foundation 协作」尚未收敛。
T09 · World Model 作为 Simulator
谱系:DreamerV3(latent WM) ∥ Genie / Cosmos / 1X WM(像素 WM) → 2024-25 合流 → 2026「World Action Models」命名
- 当前 SOTA:OSCAR Wu & Gao, Alberta / NVIDIA, arXiv:2606.04463 — 用 2D kinematic skeleton 渲染作跨本体统一条件表示,在单张 GH200 上微调 Cosmos-Predict2.5-2B 构建 action-conditioned video WM,部署到 RoboArena 评估——首次展示虚拟世界策略评估与真机评估强相关,直接回应「WM 作评估器可靠性」开放问题。(主线 A latent WM 当前制高点仍是 DreamerV3 [arXiv:2301.04104] 📎。)
- 2026 新进展:
- WAM Survey Wang et al., 复旦, arXiv:2605.12090 — 首次系统综述 World Action Models,把预测状态建模与动作生成统一为联合分布,建立 Cascaded vs Joint WAMs 分类法——「World Action Models」作为子领域被命名的奠基性综述(同 T13)。
- PointWorld Huang et al., NVIDIA + Stanford, arXiv:2601.03782 — 用 3D 点云流统一状态与动作,约 2M 轨迹、500 小时 Franka 单臂与双臂人形数据训练,单一预训练 checkpoint 零样本驱动 Franka 真机。
- 开放问题:
- WM 评估器的可靠性——幻觉成功问题未解(WPE [arXiv:2506.00613] 警示分布内 policy 被低估、分布外 policy 被高估),目前「可信于排序、不可信于绝对值」。
- 像素 WM 太慢——扩散 / 自回归视频生成每帧几十~几百 ms,做实时 MPC 不可行;latent WM 快但不可视、不直接喂图像 policy,两者各有硬伤。
- 物理精确性——学到的是「看起来像」而不是「真物理」,精细操作(接触、摩擦、形变)的物理在像素 WM 里基本学不准。
T10 · VLA 与 WBC 的分层整合
谱系:高层 VLA + 低层 WBC → 双系统(Helix / GR00T N1) → 三层架构(Helix-02 S0/S1/S2)
- 当前 SOTA:GR00T N1 [Bjorck et al., GTC 2025, arXiv:2503.14734] 📎 — 开源人形 VLA foundation model;System-2 Eagle-2 VLM(~1B @ ~10 Hz)+ System-1 MoE-DiT(~1.2B @ ~120 Hz),flow matching + action chunk H=16 + LAPA latent action 预训练;VLM 第 12 层 embedding 作 System-2→System-1 通货。
- 2026 新进展:
- WOLF-VLA Boukheddimi et al., arXiv:2606.25591 — 把全身最优控制(OC)运动合成注入 VLA 训练数据,生成「动态可行、安全、最优」的全身运动;被称为「VLA × humanoid 标志性工作」。
- WholeBodyVLA Jiang et al., OpenDriveLab, ICLR 2026, arXiv:2512.11047 — 端到端 latent VLA,在 AgiBot X2 上首次实现大空间 loco-manipulation;「阵营 B 端到端派当前最强的实证」。
- Ψ₀ (Psi-Zero) [Wei et al., arXiv:2603.12263] — 开放 foundation model,两阶段训练(VLM 预训练 + loco-manip fine-tune),据称超过 NVIDIA GR00T N1.6。
- 开放问题:
- 接口标准未定——社区尚无统一 latent 空间协议,跨论文 / 跨本体不可比,SONIC universal token 是早期候选但是否会被 GR00T N2 / Helix 02 采纳仍开放。
- 触觉反馈缺失——灵巧手精细操作仍开环,分层架构也救不了缺失的触觉信号。
- 三层架构的接口膨胀——Helix 02 的 S0/S1/S2 引入两个接口,「分层越多,接口设计问题越尖锐,不是越少」。
T11 · 灵巧手操作(Dexterous Manipulation)
谱系:OpenAI Hand → AMP-Adroit → DexMV → DexMimicGen → Dexora / TeleDexter
- 当前 SOTA:Dexterous Point Policy Kim et al., KAIST, arXiv:2606.10614 — 直接从人类视频学灵巧手策略、无需机器人示教,把任务相关物体与人手表示成统一 3D keypoint 序列;真机成功率 75%(vs SOTA VLA 基线 1%,数量级跃升),是 2026 上半年性能水位最高、最直接回应「数据规模化」开放问题的工作。
- 2026 新进展:
- Dexora Zhang et al., arXiv:2605.18722 — 首个开源的原生支持双臂-双手高 DoF 操作的 VLA 系统(外骨骼背包采臂 + Apple Vision Pro 采手指),2026 双臂灵巧 VLA 基础设施代表作。
- GraspGen-X Han et al., NVIDIA, CVPR 2026, arXiv:2606.00998 — 20 亿抓取样本 + 夹爪 swept-volume 表示为条件,首次把 6-DoF 抓取生成做到真正 cross-embodiment(详见 T14)。
- TeleDexter Li et al., BIGAI + UCLA, arXiv:2607.11481 — 手-物 co-tracking 控制器,支持工具使用、grasp 切换、in-hand 重定位等人类级技能,「首次把灵巧遥操推到接近人类水平」。
- 开放问题:
- 触觉传感与反馈——「这是灵巧操作的最大瓶颈」;没有触觉,易碎物体、滑动检测、力度调节几乎无解。
- 精细操作的 sim-to-real 特殊困难——接触、摩擦、形变仿真近似粗糙,OpenAI Hand 真机成功率远低于仿真,是灵巧 RL 与 locomotion RL 的本质差别。
- 数据规模化——DexMimicGen 生成 >20k 轨迹但仍远小于 locomotion MoCap,「灵巧 IL 的『OpenX / DROID 时刻』还没到来」。
T12 · 敏捷 Locomotion(Parkour 链 + 剧烈动作)
谱系:Extreme Parkour → HLP → Hiking-in-the-Wild → BeyondMimic → PHP / GaitSpan
- 当前 SOTA:BeyondMimic [Liao et al., CoRL 2025, arXiv:2508.08241] 📎 — 可扩展 RL motion tracking + guided diffusion,从大规模人类动捕学到通用、自然、高动态 whole-body 控制;当前人形 whole-body 多技能的最远端。
- 2026 新进展:
- Perceptive Humanoid Parkour (PHP) Wu et al., UC Berkeley Abbeel + Sferrazza, arXiv:2602.15827 — 模块化框架,用 motion matching 把多个动态人类技能(跳跃、翻越、爬升)按需串接,Unitree G1 自主穿越多障碍长序列;继 Humanoid Parkour Learning / Hiking-in-the-Wild 之后最有影响力的感知 parkour 工作。
- GaitSpan Lin et al., Stanford + Google LeCAR, arXiv:2607.12114 — 技能「成长」框架,不重训而在已训好的 walking policy 上「生长」出慢跑/跑;首次把「技能连续生长」做成人形 locomotion 的可扩展范式。
- Stubborn Ren et al., SYSU + Shanghai AI Lab, arXiv:2606.12814 — 非对称 actor-critic 把 motion tracking 与 fall recovery 合一训练;打破现有方法把跟踪与恢复割裂、多阶段训练且一旦失败立即终止的局限。
- 开放问题:
- 剧烈动作 sim-real 是否本质无解?当前答案是「部分可解、随机性接触仍开放」——ASAP 解决了确定性剧烈动作(踢、跳、转体),但沙地、碎石、软泥等 stochastic 接触 delta model 只能学到均值、方差部分仍迁不过去。
- 人形 parkour 的安全约束——真机失误就摔机器人,数据收集极昂贵;sim 训出来的 policy 在真机上的「失败率-性能」曲线还没摸清。
- 单 skill → 连续多 skill chaining——四足已能 chaining,人形还卡在单 skill demo;核心难点是 skill 之间的「过渡态」没有 motion prior 覆盖。
T13 · 综述与立场(本页归属线索)
谱系:8 篇领域综述 + 14 条技术线索收束(survey-of-surveys;T13 撰写时 T14 尚未独立,现已纳入)
- 关键综述(无单篇 SOTA,列纲领性文献):VLA for Embodied AI [Ma 2024, arXiv:2405.14093]、Humanoid Locomotion & Manipulation [arXiv:2501.02116]、Dexterous & Embodied Manipulation [arXiv:2507.11840]、Sim-to-Real Transfer Survey [arXiv:2009.13303]。
- 2026 新进展(4 篇纲领性文献,集中出现):
- VLA 数据中心综述(TMLR 录用)[Wang et al., arXiv:2604.23001] — 以「数据中心」视角梳理 VLA 的 datasets / benchmarks / data engines,主张未来更依赖「高保真数据引擎 + 结构化评估协议」协同设计。
- WAM 综述 Wang et al., arXiv:2605.12090 — 定义 World Action Model 新范式,建立 Cascaded vs Joint WAMs 分类法,是 VLA × WM 合流的奠基综述(同 T09)。
- WM for Robot Learning 综述 [Hou et al., arXiv:2605.00080] — 把 video-generation-as-world-model 纳入机器人学习版图。
- 「Robots Need More」立场论文 [Karcini et al., arXiv:2606.06556](ETH Hutter、Stanford Schwager 等联合署名)— 对 VLA scaling 至上范式系统反思,提出下一代机器人需要 4 个接口(data / embodiment / world-model / reward)。
- 领域共识(综述揭示):VLA 是 manipulation 未来但不是 locomotion 未来;数据是第一瓶颈;触觉是灵巧操作最大瓶颈;sim-to-real 三路线要组合;全身 loco-manipulation 是下一个十年挑战。
T14 · 抓取(Grasping):几何规划 → 学习 → 生成
谱系:分析式规划 → DexGraspNet / AnyGrasp → 6-DoF 生成 → GraspGen-X(cross-embodiment)
- 当前 SOTA:GraspGen-X Han et al., NVIDIA, CVPR 2026, arXiv:2606.00998 — cross-embodiment 6-DoF 抓取生成模型,用程序化生成夹爪 + 20 亿抓取样本 + 夹爪 swept-volume 表示为条件,在仿真与真机均实现对新物体、新场景、新夹爪形态的零样本泛化——「首次把 6-DoF 抓取生成做到真正 cross-embodiment」。
- 2026 新进展:
- GraspGen-X [arXiv:2606.00998] — 同上 SOTA,2026 CVPR 抓取基础模型方向标杆作。
- From Grasps to Dexterity Yuan et al., CMU Held 组, arXiv:2606.30749 — 把大规模灵巧抓取数据(355k 轨迹)当作 functional dexterity 预训练来源,用「高层手部子目标预测 + 低层目标条件控制」分层 IL 框架迁移到带工具的功能性操作——「抓取(T14)→ 灵巧操作(T11)」桥梁的最新收口。
- 开放问题:
- 未知 / 透明 / 柔性物体——点云质量差,抓取规划失效,透明物尤其难。
- Sim-real gap on grasping metric——合成标注的 force-closure 和真机稳定性有差距。
- 灵巧手抓取的维度爆炸——24-DoF 抓取空间比夹爪大几个数量级,DexGraspNet 只是开始;抓取 + 后续操作的端到端整合也仍开放。
横切开放问题(跨方向共性)
下表把上面 13 条主线里反复出现的开放问题压成 5 条「跨方向共性」。每条都标出它在哪些线索里冒头、2026-07 当前的水位,便于研究者选切入角度。
| # | 横切问题 | 在哪些线索出现 | 2026-07 当前水位 |
|---|---|---|---|
| 1 | 跨本体泛化 | T01(跨形态 retarget)、T02(OpenX 跨本体)、T04(BFM 跨形态)、T06(VLA 跨本体上限)、T10(latent 接口标准)、T14(GraspGen-X cross-embodiment) | LAP-3B 首次实现「完全无本体专属微调」zero-shot 迁移(成功率仍 >50%);GR00T N1 的 LAPA latent action 与 SONIC universal token 是早期候选,但社区尚无统一 latent 协议;跨形态 retarget 在剧烈动作下损耗大。 |
| 2 | 触觉缺失 | T07(ERM 只反馈有无)、T10(分层救不了开环)、T11(灵巧操作最大瓶颈)、T14(抓取验证靠「抬起来看掉不掉」) | 触觉硬件已有(DIGIT、GelSight),缺的是「触觉 + policy 端到端学习」范式;综述预计 2026-2027 突破;力反馈手套成本/延迟仍高于 ERM。 |
| 3 | Sim-to-real 本质 gap | T01(剧烈动作 + 可变形地形)、T03(reward hacking)、T04(retarget 损耗)、T09(WM 物理不精确)、T11(精细接触仿真)、T12(剧烈动作是否本质无解)、T14(透明/柔性物体) | ASAP 把「让仿真器学 gap」固化成范式,确定性剧烈动作基本解决;随机性接触(沙地、碎石)方差部分仍迁不过去;精细操作(接触/摩擦/形变)仿真近似仍粗糙。 |
| 4 | 长程任务规划 | T05(单 chunk 局限)、T06(VLA + WBC 分层)、T09(WM 作规划器)、T10(三层架构接口膨胀)、T12(skill chaining 过渡态) | DP chunk N=16 / π0 H=50 都远不够家居级几十分钟任务;分层 VLA 是当前主流但高层/底层接口(语言 / latent / 关节)尚无共识;Helix-02 三层架构引入两个接口,「分层越多接口设计越尖锐」。 |
| 5 | 安全部署 | T07(认知负荷 + Helix-02 绕过 teleop)、T08(SafePBDS 可证明安全)、T10(OC 注入约束)、T12(真机失误就摔机器人) | SafePBDS 给出「可证明安全」的配置流形加速度;WOLF-VLA 把全身 OC 运动合成注入训练数据;人形 parkour 真机「失败率-性能」曲线还没摸清,数据收集极昂贵。 |
📌 研究者切入建议:横切问题 1(跨本体)与 2(触觉)的「硬件 + 算法」结合点最高产,2026 仍是早期红利窗口;问题 3 与 5 偏算法但需要真机迭代成本;问题 4 偏系统设计,工业实验室优势大。