T07 - 人形遥操技术栈(Humanoid Teleop Stack)演进线索
状态:🟢 活跃(2026 主战场:工业级 "no teleop" 端到端 + 便携化采数硬件 + 接触密集双侧遥操)
🎯 你将学到什么
- 看懂人形遥操栈如何从「演示辅助手段」升格为「具身智能数据基础设施」,三条子线(输入设备 / retargeting 映射 / 跟踪后端)如何交织演进并最终收敛
- 掌握 DexPilot → AnyTeleop → dex-retargeting 的视觉 teleop 工程化脉络,以及 ALOHA 把 teleop 从「实时控制」重定义为「数据采集」的范式意义
- 能解释 H2O / OmniH2O / HumanPlus / Bunny-VisionPro 四条 2024 全身 teleop 路线的精确机制差异(sim-to-data 清洗、teacher-student DAgger、HST/HIT、loop-joint SQP retargeting)
- 理解 HOVER 多模式蒸馏 + HOMIE 半自主如何回应「操作员认知负荷 vs 全身自由度」这一核心矛盾,及 Helix-02 的 S0/S1/S2 三层架构为何宣称 "no teleop"
- 学会按四段流水线(pose estimation → retargeting → WBC → sim-to-real)拆解任意 teleop 系统,并定位其瓶颈环节
本页内容
基础解释
一句话直觉
人远程操控几十个关节的人形机器人,干精细活。
顺手把每个动作录下来,回头当训练数据。
好比提线木偶师。
你动动手,机器人跟着动。
后来他还顺手把每场表演录下来,教木偶自己跳。
从基础理解
要解决的问题
人形机器人有几十个关节。
人怎么"隔空"操控它干精细活?
还要把动作录下来,回头训机器人自己干。
这条线叫遥操作(teleop)。
演进脉络(七个台阶)
- 裸手视觉。一个摄像头看人手,实时控灵巧手 📎。
- 重定向通用化。一个中间件,把人手关节角换算成任意机器手的关节角 📎。
- 当数据采集。同构双臂一对一跟着动,专门录轨迹训自主策略 📎。
- 全身人形实时。单摄像头加强化学习,让人形能走能踢 📎。
- 统一接口。不管输入是头显还是相机,都先变成"身体该怎么摆" 📎。
- 多模式蒸馏。把走、操作、自主三类命令蒸馏进单一策略,多种模式可同时激活 📎。
- 半自主。腿交给预训策略,人只管上半身 📎。
方法核心(大白话)
让"人怎么动 → 机器人怎么动"这步,有一个标准中间层。
最简单的办法是"同构主控":人手怎么动,一模一样的机械臂一对一跟着动。
采集快、精度高,但硬件专属。
更通用的是"视觉加重定向"。
先用相机看人手姿态,再用优化把人手关节角换算成机器手的关节角。
全身人形的难题是平衡。
于是引入"运动学姿态"这个统一接口。
不管你戴头显、还是站摄像头前,都先变成"身体各关节该怎么摆"。
再交给一个强化学习训出来的全身控制器,在物理仿真里稳定地跟踪它。
2025 年后还流行"半自主":腿交给预训策略自个儿走,人只管上半身精细活。
这样人的认知负担骤降。
一句话类比
人形遥操作之于机器人,就像飞行模拟器之于飞行员。
既是操控手段,又是数据来源。
模拟器既教人开飞机,也录下每场飞行供复盘。
这条线索在解决什么问题
遥操(teleoperation)是机器人学的老问题,但 2023-2026 这三年它从"演示辅助手段"升格为"具身智能数据基础设施",并与人形全身控制(WBC)深度耦合。这条线索回答的是:当自由度从 7-DoA 单臂膨胀到 30-DoA+ 的全身+灵巧手,遥操的输入接口、映射(retargeting)方法、底层跟踪器各自如何演化,最终如何收敛到一个能同时支撑实时控制与数据采集的统一栈。
线索内部有三条始终交织的子线:(a) 输入设备——从物理主控 → 视觉裸手 → 消费级 VR;(b) 映射目标——从一对一关节角 → 灵巧手 retargeting → kinematic pose 通用接口;(c) 跟踪后端——从位置 PID → RL WBC → 多模式蒸馏。三者必须放在一起看,因为任何一环的进步都会被另两环的短板抵消。
关键转折点
转折 1:DexPilot 打开"视觉 teleop"之门(2019,先驱)
DexPilot [Handa 2019, arxiv:1910.03135](详见 P-DexPilot-2019)之前,灵巧手遥操只能靠昂贵的外骨骼或动捕服。DexPilot 用单个 RGB 相机观察操作员裸手,实时映射到 23-DoA 的灵巧手-臂系统,第一次证明"零穿戴设备控制高自由度灵巧手"可行。它确立了"感知人手 → retargeting → 跟踪机械手"的三段式,是后续整条视觉 teleop 线的模板——Bunny-VisionPro 的 fingertip keypoint vector 距离最小化目标、AnyTeleop 的 dex-retargeting 中间件,都直接继承自此。
转折 2:AnyTeleop 把 retargeting 通用化(2023)
AnyTeleop [Qin 2023, arxiv:2307.04577, ICRA 2024] 把 DexPilot 的"专机专手"扩展到任意臂/手/相机组合,关键贡献是抽象出 dex-retargeting 这层中间件:给定人手姿态与机械手 URDF,自动求解把人手运动映射到机械手关节角的优化问题(minimize fingertip keypoint vector distance)。dex-retargeting 后来被 Bunny-VisionPro(核心 retargeting 目标 $\mathcal{L}_{hand} = \sum\|\alpha v_i - FK_i(q)\|^2$ 即其变种)、Open-TeleVision、甚至 iDP3 直接复用,成为灵巧 teleop 的事实基础栈。
转折 3:ALOHA / GELLO 重新定义 teleop 的角色(2023)
ALOHA [Zhao 2023, arxiv:2304.13705, RSS 2023](详见 P-ACT-ALOHA-2023)的真正贡献不是双臂硬件,而是把 teleop 从"实时控制"重新定义为"数据采集"——操作员用 ~$20k 同构双臂采 (观测, 动作) 轨迹,再用 ACT(Action Chunking Transformer)训练自主策略。GELLO [Deirmentzoglou 2023, arxiv:2309.13037, RSS 2023] 用 3D 打印同构主控把成本再压一档。这一"teleop-as-data-collection"范式直接催生 2024 年初的 Mobile ALOHA [2401.02117],是 VLA 时代真机数据的主要供给管道。
此处必须明确区分:实时 teleop(低延迟、操作员在线闭环)与采集型 teleop(高保真、操作员离线批量采)虽用相似硬件,优化目标完全不同——前者重带宽与延迟,后者重轨迹多样性与覆盖度。两者在工程上常常共用一套硬件,但属于不同线索。
💡 核心洞察:ALOHA 的真正贡献不是双臂硬件,而是把 teleop 的优化目标从「低延迟闭环」换成「高覆盖度数据集」——这一目标重定义直接催生了 VLA 时代的真机数据供给模式,比任何算法创新影响都更深。
转折 4:2024 全身人形 teleop 爆发
人形硬件平价化(Unitree H1/G1 把全尺寸人形从百万美元级压到 ~$20-90k)+ 消费级 VR 成熟(Apple Vision Pro 2024.02)+ IL/VLA 数据饥渴,三条线同时成熟,催生全身 teleop 爆发:
- H2O [Cheng 2024, arxiv:2403.04436, IROS 2024]:首个单 RGB + Sim2Real RL 的全尺寸人形实时全身 teleop(走、后跳、踢、推)。它证明"无需穿戴设备"的全身 teleop 可行,但接口仅 8 个 keypoints(双肩/双肘/双腕/双踝的位置+差分+速度,约 90 维 state)、无灵巧手自由度——keypoint 跟踪做不到手指级控制。精确机制(详见 P-H2O-2024):三段流水线 (a) sim-to-data 清洗——retarget AMASS 13K 序列到 H1 时先拟合 SMPL shape $\beta'$(消除 in-toed 伪影),再训一个无 domain randomization 的 privileged imitator $\pi_{privileged}$(状态维 778,含全刚体线/角速度)作为"可行性 oracle",过滤掉它跟踪失败的序列,从 10K 筛到 8.5K clean 序列;(b) Sim2Real student——状态只含 real-world 可得量(关节 q/ė、root ω、projected gravity、8 keypoints 位置+差分+速度),约 90 维;reward 共 16 项(penalty/regularization/task 三类),核心步态 reward 是 feet-air-time(鼓励每步抬脚 ≥0.25s,但会导致"原地跺脚"伪影,后被 OmniH2O 替换);DR 覆盖摩擦/质量/CoM/PD gain/torque RFI/control delay [20,60]ms/外部推扰/地形;(c) 部署:30Hz RGB → pose estimator 出 8 keypoints → 50Hz policy → 200Hz PD。Sim Succ 72.5%(privileged 85.5%,这 13 个点就是后续 OmniH2O 要补的 sim-real gap)。
- ExBody [Yoshida 2024, arxiv:2402.16796, RSS 2024]:给出可借鉴人类动捕的全身 motion tracking 后端,是后续多项全身工作的"跟踪器底座"。
- OmniH2O [He 2024, arxiv:2406.08858, ICML 2025]:线索的枢纽。它显式定义 kinematic pose 作为 universal interface——根 link 6D + 全身关节角 + 灵巧手关节角,让 VR/Vision Pro/外骨骼/视觉四种输入都先统一到这个姿态、再由同一 WBC 跟踪。Teacher-student distillation 训练鲁棒 WBC:privileged teacher(913 维)→ DAgger 蒸馏到 1665 维 student(25 步历史×63 + 当前 90),loss $\mathcal{L}=\|a^{privileged}_t - a_t\|^2_2$,把 Succ 从 H2O 的 72.5% 拉到 94.10%、Eg-MPJPE 从 166 mm 压到 141 mm(详见 P-OmniH2O-2024)。关键工程洞察:student 不显式吃 root linear velocity(VIO/MLP 估计的噪声大于让 policy 从历史隐式学到)。这一步把"接口"与"硬件"解耦,是 HOVER、HumanPlus、Bunny-VisionPro 共享的前提。
💡 核心洞察:OmniH2O 的枢纽地位来自「kinematic pose 通用接口」——把 VR/Vision Pro/外骨骼/视觉四种异构输入都先投影到同一姿态再喂同一 WBC,从此 teleop 的进展可以按「输入设备」和「跟踪后端」两条独立子线各演进,是 2024 全身 teleop 大爆发的解耦点。
- HumanPlus [Fu 2024, arxiv:2406.10454, ICML 2025]:Stanford 的 RGB shadowing + IL 全栈。notes 勘误:本仓库
teleop.jsonl标注为 CoRL 2025 是错的,按 PMLR v270fu25a实际为 ICML 2025;teleop_notes.md称其用 "ACT/Diffusion" 也不准确,论文实际使用 HST(Humanoid Shadowing Transformer,shadowing 阶段)与 HIT(Humanoid Imitation Transformer,IL 阶段);"40+ 任务"的表述亦误导——40 是"≤40 条示教即可学会"的示教条数而非任务数,实际任务包括 boxing、cabinet/pot、tossing、piano、ping-pong、typing 等 shadowing 任务,以及穿鞋/站走/仓库卸货/叠毛衣/重排/打字/问候 等 IL 任务。HST/HIT 架构精确细节:HST 是 decoder-only transformer,50 Hz,输入 proprioception(root roll/pitch/angular velocity + joint pos/vel + last action)+ humanoid target pose(target xy velocity、yaw velocity、roll/pitch、19 维关节角),输出 19 维 body joint setpoint,hand targets 直接 passthrough 到 PD 不经 policy,context length 8;HIT 基于 ACT 改 decoder-only,25 Hz,输入双目 ResNet feature + proprioception,输出 50 步 target pose chunk,关键创新是 forward-dynamics image-feature L2 auxiliary loss(强制 transformer 预测未来 image feature tokens,否则 BC 会 overfit proprioception 反复抓空)。HST 用 AMASS 40h 离线训、zero-shot 部署,能抗 100N 推力、深蹲 0.44m、跳 0.35m、跌倒起身(详见 P-HumanPlus-2024)。 - Bunny-VisionPro [Ding 2024, arxiv:2407.03162] / Open-TeleVision [Cheng 2024, arxiv:2407.01512]:Apple Vision Pro 成熟后,两者几乎一夜之间成为灵巧手 teleop 的事实开源标准。Bunny-VisionPro 精确机制(详见 P-BunnyVisionPro-2024):三段解耦——(i) hand retargeting 用 SQP 最小化 fingertip keypoint vector distance(与 dex-retargeting 同源),核心贡献是把 loop joint(如四连杆)实时化:把 n 关节里的 n-k 个被动关节用 $q_j = c_j(q_1,\dots,q_k)$ 表达,reformulate 到 k 维主动空间,backward pass 把被动关节梯度 backprop 到主动关节,单 CPU 核 300 Hz、比硬加约束快 10.2×;(ii) arm motion control 统一 IK + 碰撞 + 奇异为单一优化 $\mathcal{L}_{arm}=\mathcal{L}_{ik}+\mathcal{L}_{sin}+\mathcal{L}_{col}$,link 用 m 个球体近似让距离可微(避 GJK 开销),奇异用 manipulability index $\sqrt{\det[JJ^T]}$ 仅在 $s_0
$1.2 ERM 触觉手套——FSR 指尖传感 + zero-drift baseline 校准 + low-pass filter + PWM 驱动 ERM 振动马达,闭环"机器人摸到 → 操作员手指振"。Telekinesis benchmark 9/10 任务超越基线、完成时间 −45%、IL 泛化 +20%。
转折 5:2025 全身协调与多模式蒸馏
全身 teleop 的下一个瓶颈是"操作员认知负荷"——一个人同时控 locomotion + manipulation 几乎不可持续。2025 出现两条解法:
- HOVER [He 2024, arxiv:2410.21229, ICRA 2025]:NVIDIA/CMU/UC Berkeley/UT Austin/UC San Diego 联合的多模式 policy distillation,是 2024 人形 WBC 的里程碑(详见 P-HOVER-2024)。关键设计是「mode mask + sparsity mask 双层随机化」——先在统一 command space 里定义三类原子控制模式(kinematic-position / joint-angle / root-tracking),upper-body 与 lower-body 可各自独立选一类(3×3=9 大类组合);再在选定模式内用 sparsity mask 屏蔽具体维度(如「只激活左手」或「head + 双手」)。两层 mask 每 episode 开始时按 Bernoulli(0.5) 采样一次、整 episode 固定,让单一 DAgger-distilled student 学会处理任意 mask 子集。蒸馏源是 privileged oracle(特权输入 + 全 reference goal),student 只看 25 步 proprio history + masked command。在 ExBody/H2O/OmniH2O/HumanPlus 四种 prior 命令空间上,HOVER 不仅追平还略胜各自 specialist——20 段真机 standing motion 在 12 个 metric 里 11 个优于对应 specialist。HOVER 的意义是把"遥操 / loco-manipulation / 自主"三类过去需要切换的命令统一进一个神经控制器,是后续 VLA 接入人形的"底座"。
- HOMIE [arxiv:2502.13013, RSS 2025]:这里必须与全身 teleop 区分。HOMIE 走的是"半自主"路线——上半身用同构 exoskeleton(1:1 关节映射)做高保真精细操控,下半身 locomotion 完全委托给预训练 RL policy,操作员用脚踩踏板只下达"前进/转向"等高层指令。这把操作员认知负荷降一个数量级,代价是失去对腿部的细粒度控制。这是全身 teleop 与半自主 teleop 的根本分野。 (jsonl 标注 "ICML 2025/CoRL",实际为 RSS 2025。)
- CLONE [arxiv:2506.08931, CoRL 2025]:MoE 架构做闭环误差修正,提升长时 loco-manipulation 保真度。
- AMO [arxiv:2505.03738, RSS 2025]:扩展 hyper-dexterous 工作空间,做超灵巧 motion imitation。
转折 6:2026 半自主 + 全身协调 + 便携化(teleop-as-data-pipe 全面成熟)
2025 年底到 2026,teleop 出现三个并行的新方向,整体特征是从"实时控制"重心彻底转向"数据管道 + 半自主协调":
方向 (a):工业级 humanoid 直接绕过 teleop、走向端到端自主。这条工业路线的奠基是 Figure AI 2025.02 发布的 Helix(技术报告 / blog,闭源):明确分层双系统——S2 = 7B VLM @ 7-9 Hz 处理语言/场景理解、S1 = 80M visuomotor @ 200 Hz 出高频动作。Helix 的关键工程选择是 S2 → S1 用 latent communication(连续 latent vector)而非关节角通信——S2 把视觉/语言/任务语义压缩进 latent,S1 把 latent 解码为 motor command,避免上层语义被关节角这种低层表达瓶颈限制,也保证 S1 可独立高频运行不被 S2 拖慢(本仓库尚无 P-Helix-2025 独立深笔记,待补;上述机制据 curated jsonl)。其直接后继 Helix-02(2026.02,配合 Figure 03 发布)把双腿/躯干也并入同一神经模型,扩展为 System 0/1/2 三层 "pixels-to-torque" 层级架构——新增的 S0 处理全身 balance / contact / coordination(对标传统 WBC,频率待核),S1/S2 沿用 Helix 的 fast motor control + VLM deliberative planning。Helix-02 明确宣称 "No cloud. No teleoperation.",能跑满 8 小时自主工厂班次、两台机器人协作整理卧室(连续动作数待核)。这条线索的含义:当 VLA + WBC 足够强,teleop 从"运行时控制"完全退化为"训练时数据采集"——Figure 内部用 teleop 采数据,但部署时机器人不再需要人在线。这与本线索 2023 年 ALOHA 提出的 "teleop-as-data-collection" 范式遥相呼应,只是把"采集"与"部署"在时间轴上彻底分离。
💡 核心洞察:Helix-02 的 "no teleop" 宣言把 teleop 的「角色漂移」推到极化——teleop 不再是运行时控制而是训练时数据采集,这反过来回答了 ALOHA 2023 年提出的问题:「数据采集」与「部署」最终在时间轴上彻底分离,是 VLA+WBC 成熟的标志。
方向 (b):极端全身协调——把 teleop + WBC 推到超 agile 动作。HUSKY [arxiv:2602.03205, RSS 2026](TeleAI,白晨佳等)让 Unitree G1 滑板——把滑板建模为 hybrid dynamical system,physics-aware WBC 同时管人-板接触、推行、转向、平衡,是首个真机滑板人形。意义:teleop + WBC 的边界从"走/蹲/推"扩展到"动态工具协同",为后续"人形骑自行车/滑板车/操作外接工具"打开方向。同类工作还有 A Scalable Perceptive Parkour Framework for Humanoids [arxiv:2601.07718, ETH RSL](社区常以 "humanoid hiking-in-the-wild" 称之)把人形感知 parkour 推到复杂野外地形。
方向 (c):便携全身 dex teleop 硬件成熟——把"动捕服 + 外骨骼 + Vision Pro"压缩成可穿戴单件。代表工作:
- RealDexUMI [arxiv:2606.06033]:BeingBeyond 的 wearable UMI,把灵巧手本身做成"shared end-effector module",palm 侧同构 glove,做到"demo 采集与机器人部署零 gap"——继承 DexUMI [CoRL 2025, Xu et al.] 的"人手作 universal interface"思路,但把硬件从 data-collection-only 升级为可实时部署。
- HumanoidExo [arxiv:2510.03022]:轻量可穿戴 exoskeleton,专为 scalable whole-body data collection 设计。
- NuExo:覆盖上肢全部 ROM 的便携外骨骼,支持户外数据采集与 teleop。
- Genie Sim 3.0 [arXiv:2601.02078, AGIBOT, CES 2026]:开源仿真平台(基于 NVIDIA Isaac Sim/Omniverse),集成 PICO VR 低延迟 teleop + LLM-driven 场景生成 + 10K 小时合成数据,是"仿真+teleop+IL"工业级一体化平台的代表。
2026 趋势小结:teleop 不再是"人在线控机器人",而是三件事的合流——(1) 训练时的数据采集管道(RealDexUMI/HumanoidExo/Genie Sim 3.0);(2) 自主失败时的 fallback / shared autonomy(半自主,HOMIE 路线的延伸);(3) 极端动作的 WBC tracking 验证(HUSKY / Perceptive Parkour)。Figure Helix-02 的 "no teleop" 宣言正是这一趋势的极化表达。
工程链:从感知到真机的四段流水线
把上述节点拼起来,当前人形 teleop 的工程链已收敛到相对稳定的四段:
- pose estimation:SMPLer-X / 4DHumans 从单 RGB 还原人体(含手)的运动学姿态。
- retargeting:GMR / OKAMI / dex-retargeting 把人姿态映射到具体机器人的关节角(kinematic pose)。
- WBC:PHC / PULSE / HOVER 把 kinematic pose 转成关节力矩,在物理仿真里稳定跟踪。
- 部署到真机:通过 teacher-student / Sim2Real 把仿真 policy 迁移。
每一段都是相对独立的子领域,但只有四段都对齐时全身 teleop 才能闭环。这也是为什么 2024 年才爆发——四段同时成熟。
演进逻辑:每一步到底解决了什么具体问题
把六个转折串起来看,teleop 栈的演进其实是五个核心矛盾被逐一拆解的过程:
矛盾 1:高自由度 vs 输入设备带宽(DexPilot → ALOHA → Bunny-VisionPro)
- DexPilot(2019)证明单 RGB 能控制 23-DoF,但精度依赖 fingertip keypoint tracking;
- ALOHA(2023)换思路,用同构 leader-follower 把"DoF 匹配问题"消解为"1:1 关节映射",代价是硬件专属;
- Bunny-VisionPro(2024)借 Vision Pro 把"手部追踪精度"问题解决,再用 dex-retargeting 中间件把"输入(任意人手)-输出(任意机器手)"解耦,同时用 loop-joint backward backprop 把欠驱动手也纳入。
矛盾 2:可行性 motion vs AMASS 全集(H2O sim-to-data → OmniH2O augmentation)
- H2O(2024.03)发现 AMASS 里大量 motion(cartwheel、超宽步)对电机人形不可行,naive retargeting 会带坏 policy;用 privileged imitator 作 "可行性 oracle" 过滤;
- OmniH2O(2024.06)补上 H2O 漏的"静止/蹲姿"分布,用 standing/squatting augmentation 解决 H2O 的"原地跺脚"伪影,用 max-feet-height-per-step reward 替换 feet-air-time。
矛盾 3:仿真特权信息 vs 真机可得信息(H2O 直接降维 → OmniH2O teacher-student DAgger)
- H2O 把 privileged 778 维直接砍到 90 维部署版,Succ 从 85.5% 跌到 72.5%(13 个点的 sim-real gap);
- OmniH2O 用 teacher-student + DAgger:student 在仿真里 on-policy rollout,用真值参考反算 privileged states 喂 teacher 得到参考动作,loss 直接是动作 L2,把 Succ 拉回 94.10%。关键洞察:student 不显式吃 root linear velocity,让 policy 从 25 步历史隐式学到——VIO/MLP 估计的速度噪声反而比隐式估计大。
💡 核心洞察:H2O→OmniH2O 的 13 个点 sim-real gap 不是靠「更精细的传感器」补上,而是靠「student 不显式吃 root linear velocity,让 policy 从 25 步历史隐式学到」——这一反直觉选择说明:在 teacher-student 蒸馏里,给 student 的输入维度并非越多越好,噪声大于信号的维度反而要砍掉。
矛盾 4:操作员认知负荷 vs 全身自由度(HumanPlus 单人单相机 → HOMIE 半自主 → HOVER 多模式蒸馏 → 2026 完全自主)
- HumanPlus(2024.06)证明单 RGB 全身 shadowing 可行,但操作员同时控 locomotion + manipulation 极易疲劳;
- HOMIE(2025.02)把下半身委托给预训练 RL policy,操作员只控上半身 + 高层指令,认知负荷降一个数量级,代价是失去腿部细粒度控制——这是"全身 teleop"与"半自主 teleop"的根本分野;
- HOVER(2024.10)用 mode mask + sparsity mask 双层随机化把 kinematic-position / joint-angle / root-tracking 三类原子模式(upper/lower body 独立组合)蒸馏进单一 policy,让"遥操 / loco-manipulation / 自主"三类命令可同时激活;
- 到 2026,Figure Helix-02 用 S0/S1/S2 三层架构直接宣称 "no teleoperation"——当 VLA + WBC 足够强,teleop 在部署时退场、只在训练时作为数据采集存在。
矛盾 5(贯穿始终):触觉反馈缺失(Bunny-VisionPro $1.2 ERM → DOGlove → 力反馈手套)
- 多数 vision-based teleop 完全无触觉;Bunny-VisionPro(2024.07)首次用 ERM 把"接触有/无"反馈给操作员;
- 2025-2026 力反馈手套(DOGlove、SenseGlove R1、Navee EXO S Pro)开始把"力方向与大小"也带进 teleop 环,但成本与延迟仍高于 ERM 振动方案。
一句话总结演进:teleop 栈从"物理同构主控"(ALOHA)→"视觉裸手 + retargeting 中间件"(DexPilot/AnyTeleop/Bunny-VisionPro)→"全身 RL WBC + kinematic pose 通用接口"(H2O/OmniH2O/HumanPlus)→"多模式蒸馏 + 半自主"(HOVER/HOMIE)→"半自主 + 便携硬件 + 完全自主 VLA"(2026 HUSKY/RealDexUMI/Helix-02)。每一步都在拆解上面五个矛盾中的一个,且每一步都让 teleop 离"实时控制"更远、离"数据管道"更近。
2026 最新进展
承接转折 6 的工业级 / 极端协调 / 便携化三条主线,2026 上半年 teleop 子领域同时沿「灵巧手-人形硬件统一 / 免标定 retargeting / 低成本力反馈硬件 / 接触密集双侧遥操」四条轴线深化——核心是把「retargeting 与硬件门槛」从灵巧遥操的瓶颈拉下来:
- Handroid:一台硬件统一灵巧手与人形两种形态:Handroid [Li et al., arxiv:2607.16187](Berkeley + Tsinghua + Shanghai Qi Zhi,Ding 组)是一台 27-DoF 桌面级双形态机器人——同一电机械本体可作灵巧手(0.33 m / 2.05 kg)或桌面人形,整机开源。首次用单一本体统一灵巧手与人形两种典型形态,让灵巧手研究成果可顺滑迁移到桌面人形;开源硬件降低人形 + 灵巧研究门槛,为「灵巧-人形连续体」提供共享基座——直接打破本线索「输入设备/映射目标/跟踪后端」三段式中硬件本体隔离的传统约束。
- AnyDexRT:免标定 + few-shot 人类引导的灵巧 retargeting:AnyDexRT [Wang et al., arxiv:2607.08341](Shanghai Jiao Tong Lu 组)提出calibration-free 的灵巧手 kinematic retargeting 方法,通过少量人类引导即可在不同灵巧手之间直观迁移,避免现有方法对手工目标函数、精确标定或全局形状匹配的依赖——把 dex-retargeting(AnyTeleop/Bunny-VisionPro 的中间件)从 per-hand 调参 + 精确标定,推到通用化、免标定化,对推动灵巧遥操 / IL 数据采集的跨平台通用性有直接价值,回应演进逻辑矛盾 1「输入设备-本体解耦」。
- DEX-Mouse:$150 灵巧遥操硬件门槛:DEX-Mouse [Koh et al., arxiv:2604.15013](KAIST Nam Lab)是一个手持式、免标定、operator-agnostic 的灵巧手遥操接口,集成动觉力反馈,全部用 COTS 元件制造,成本低于 150 USD,无需校准或穿戴式动捕手套,跨操作者 / 跨平台通用。直接把灵巧手遥操硬件门槛压到百美元级且免标定,回应演进逻辑矛盾 5「触觉反馈与硬件成本」——是 2026 低成本灵巧遥操硬件方向的代表性工作,对推动社区大规模采数有重要价值。
- 双侧遥操框架(contact-rich haptic 闭环):Bilateral Teleoperation Framework [Gasperina et al., arxiv:2606.15434](ETH Knoop/Kang 组)提出模块化bilateral 遥操框架:把操作端输入接口与机器人端灵巧手 + 柔顺机械臂统一到一个控制架构,支持基于位置的 hand retargeting、差分臂控、多尺度 haptic 反馈与 shared control——把臂-手协调、低延迟反馈、haptic 与 shared control 整合到双侧遥操统一框架,是 contact-rich 灵巧遥操系统方向的代表作,对要部署到真机接触密集操作的遥操系统有直接工程价值。
📌 关键要点
- teleop 栈的演进本质是五个核心矛盾被逐一拆解:高 DoF vs 输入带宽、可行性 motion vs AMASS 全集、特权信息 vs 真机可得、认知负荷 vs 全身自由度、触觉反馈缺失
- OmniH2O 是线索枢纽——kinematic pose 通用接口让 VR / Vision Pro / 外骨骼 / 视觉四种输入都先统一到姿态、再由同一 WBC 跟踪,把「接口」与「硬件」解耦
- ALOHA 把 teleop 从「实时控制」重定义为「数据采集」,是 VLA 时代真机数据的主要供给管道;GELLO / Mobile ALOHA 继承此范式
- 2025-2026 的主线是「teleop 角色漂移」:从运行时控制退化为训练时数据采集,Figure Helix-02 的 "no teleop" 是这一趋势的极化表达
- 当前瓶颈在触觉反馈粗糙($1.2 ERM 只能传「接触有/无」)与认知负荷——HOMIE 半自主 + DOGlove 力反馈手套是部分答案,但跨操作员 / 跨硬件的 motion 分布偏移仍未系统量化
当前局限与开放问题
- 触觉反馈仍粗糙:Bunny-VisionPro 的 $1.2 ERM 只能反馈"接触有/无",无法传力方向与大小;DOGlove / SenseGlove R1 / Navee EXO S Pro 等力反馈手套刚起步,成本与延迟仍高于 ERM 振动方案。
- 认知负荷:长时全身任务对操作员极不友好,HOMIE 的半自主是部分解;2026 工业路线(Helix-02 "no teleop")直接绕过此问题,但要求 VLA + WBC 已足够成熟。
- 敏捷动作 sim-real gap:踢/跳/转在 teleop 下仍易失败,需 ASAP [2502.01143] 式 residual delta dynamics 修正(详见 P-ASAP-2025);HUSKY 类滑板/工具协同动作的 sim-real 迁移仍依赖大量 DR 与 curriculum。
- 数据多样性:单实验室单操作员数据泛化差;2026 的 RealDexUMI / HumanoidExo / NuExo / Genie Sim 3.0 正从便携化 + 合成数据两侧扩池,但跨操作员/跨硬件的 motion 分布偏移仍未系统量化。
- 与 VLA/WBC 分层接口未定:teleop 产出的 kinematic pose 数据要喂给 VLA+WBC 分层架构(见 T10)时,接口标准仍是开放问题;Helix-02 的 S0/S1/S2 层级是工业一侧的事实标准,但学界尚未对齐。
- teleop 的"角色漂移":teleop 正从"运行时控制"退化为"训练时数据采集",但 IL/VLA 失败时是否需要 teleop 作 fallback / shared autonomy、以及如何无缝切换,仍是 2026 开放问题(半自主 HOMIE 路线的延伸)。
与其他线索的交叉点
- IL 主线(T05/T06):teleop 是 ACT/Diffusion Policy/VLA 的数据来源,是生产者-消费者关系。
- Whole-body 控制主线(T01/T08):ExBody/HOVER/AMO 作为 teleop 的"后端",共享 sim2real 栈。
- VLA 主线(T06):HumanPlus/iDP3/TWIST/HumDex 产出的数据正喂养 humanoid VLA(GR00T N1、Helix、π0/π0.5),是 control foundation model 的关键数据管道。
- VLA+WBC 分层(T10):teleop 数据格式(kinematic pose)与分层接口的对接是 2025-2026 最热的交叉点。
关联论文笔记
本线索涉及的核心论文在本仓库已有深度笔记:
- P-OmniH2O-2024.md [He et al., ICML 2025, arxiv:2406.08858]——本线索的枢纽节点。kinematic pose 通用接口 $q_t=(\theta_t,p_t)$ + teacher-student + DAgger distillation(loss $\mathcal{L}=\|a^{privileged}_t-a_t\|^2_2$)+ reward curriculum。详细的状态维度(913 privileged / 138 H2O / 1665 OmniH2O student)、reward 权重表、domain randomization 范围、仿真/真机实验数(94.10% Succ、真机 Eg-MPJPE 47.94 mm,约 H2O 的一半)见该笔记。
- P-H2O-2024.md [Cheng et al., IROS 2024, arxiv:2403.04436]——OmniH2O 的直接前作、第一个 learning-based 全身实时 teleop。sim-to-data 数据清洗(privileged imitator 作可行性 oracle)+ SMPL shape $\beta'$ 拟合消除 in-toed + 16 项 reward(含 feet-air-time)+ DR。Sim Succ 72.5%(vs privileged 85.5%,量化了 13 个点的 sim-real gap)。
- P-BunnyVisionPro-2024.md [Ding et al., arxiv:2407.03162]——VR-based 双臂灵巧手 teleop 事实标准之一。loop joint 实时 SQP retargeting(k 维主动空间 + backward backprop,300 Hz 单核,比硬加约束快 10.2×)+ 统一 IK/碰撞/奇异优化(CPU >60Hz)+ $1.2 ERM 触觉反馈手套。
- P-HumanPlus-2024.md [Fu et al., ICML 2025, arxiv:2406.10454]——RGB shadowing + IL 全栈。HST(50Hz decoder-only transformer,19 维 body setpoint,hand passthrough)+ HIT(25Hz,基于 ACT 改 decoder-only,50 步 action chunking + forward-dynamics image-feature L2 auxiliary loss)。40 demo 学会穿鞋走路 60% 成功率。
- P-HOVER-2024.md [He et al., ICRA 2025, arxiv:2410.21229]——多模式 policy distillation,mode mask + sparsity mask 双层随机化让 kinematic-position / joint-angle / root-tracking 三类原子模式(upper/lower body 独立组合)蒸馏进单一 policy;oracle → student DAgger 蒸馏,HOVER 在 12 metric 里 11 个优于 specialist。
- P-DexPilot-2019.md [Handa et al., arxiv:1910.03135]——视觉 teleop 的起点,确立"感知人手 → retargeting → 跟踪机械手"三段式。
- P-ASAP-2025.md [He et al., RSS 2025, arxiv:2502.01143]——sim-to-real 第四次转向:学 residual delta dynamics model 补 sim-real physics gap,让 H1 学会踢/跳/转等剧烈全身动作。
- P-ACT-ALOHA-2023.md [Zhao et al., RSS 2023, arxiv:2304.13705]——ACT (CVAE-Transformer + action chunking) + ALOHA 双臂 teleop,定义"teleop-as-data-collection" 范式。
- 后续工作 P-HOMIE / P-CLONE / P-AMO / P-Helix-2025 等待补全(见上述转折 5、6)。
- teleop 数据管道下游:P-GR00T-N1-2025.md(消费 humanoid teleop 数据)、P-pi0-2024.md、P-iDP3-2024.md。
可选复盘:常见误区
澄清:"遥操作就是实时控制机器人" —— 不全对。这条线早就分出两条:实时遥操(低延迟、人在线闭环)和采集型遥操(高保真、批量录数据训策略) 。两者常共用硬件,但优化目标完全不同——前者重延迟,后者重轨迹多样性。
"遥操作就是实时控制机器人" —— 不全对。这条线早就分出两条:实时遥操(低延迟、人在线闭环)和采集型遥操(高保真、批量录数据训策略)📎。两者常共用硬件,但优化目标完全不同——前者重延迟,后者重轨迹多样性。
teleop 现在更像"数据采集管道",而不只是"操控手段"。
澄清:"全身遥操和半自主遥操是一回事" —— 错。全身遥操(如 HumanPlus)要求人同时控走路和动手,极易疲劳 ;半自主(如 HOMIE)把腿委托给预训策略,人只控上半身,负担降一个数量级,代价是失去腿部细粒度控制。
"全身遥操和半自主遥操是一回事" —— 错。全身遥操(如 HumanPlus)要求人同时控走路和动手,极易疲劳 📎;半自主(如 HOMIE)把腿委托给预训策略,人只控上半身,负担降一个数量级,代价是失去腿部细粒度控制。
这是两种不同路线,分野在于"人还管不管腿"。
澄清:"输入设备越贵、遥操越准" —— 不一定。关键不在硬件贵贱,而在有没有一层好的"重定向中间件"把人和机器人解耦 。有了它,便宜的摄像头和昂贵的头显都能接到同一个全身控制器;没有它,再贵的设备也只适配一种机器。
"输入设备越贵、遥操越准" —— 不一定。关键不在硬件贵贱,而在有没有一层好的"重定向中间件"把人和机器人解耦 📎。有了它,便宜的摄像头和昂贵的头显都能接到同一个全身控制器;没有它,再贵的设备也只适配一种机器。
解耦的接口层比输入硬件本身更重要。
可选复盘:检查点
用"提线木偶师 + 兼职录表演"类比,向一个没学过机器人的朋友解释:为什么 teleop 这两年从"操控手段"变成了"数据基础设施"?
查看参考答案
- 核心:teleop 不再只是'实时操控机器人',更重要的角色是'采集训练数据'——操作员操控的同时把轨迹录下来,回头训练机器人自主干活。
- 类比锚:提线木偶师既当场操控木偶表演,又顺手把每场表演录下来教木偶自己跳;飞行模拟器既教人开飞机,也录下每场飞行供复盘。
- 驱动力:模仿学习 / VLA 等方法对真机演示数据极度饥渴,teleop 是目前最靠谱的真机数据供给管道。
"运动学姿态"这个统一接口解决的是什么问题?在它之前,不同输入设备(头显、相机)为什么没法接到同一个控制器?
查看参考答案
- 解决的问题:把'输入设备'和'硬件本体'解耦——不管操作员用头显、外骨骼、还是摄像头,都先统一成同一种'身体各关节该怎么摆'的描述。
- 之前为什么接不上:不同输入设备给出的信号格式各异(头显给位姿、相机给关键点),直接喂给控制器要为每种设备各写一套适配;没有公共语言。
- 运动学姿态的角色:当公共中间表示(根位姿 + 全身关节角),下游一个全身控制器统一跟踪它,上游任何设备只要能产出它就行。
前文讲了"同构主控"和"视觉加重定向"两种办法。各举一个优点、一个缺点。
查看参考答案
- 同构主控:优点是采集快、精度高(人手怎么动、一模一样的机械臂一对一跟着动);缺点是硬件专属(换个机器人就得换主控)。
- 视觉加重定向:优点是通用、零穿戴设备(一个相机看人手就能控任意机器手);缺点是依赖人手姿态估计精度,且重定向优化有计算开销。
- 对照点:前者是'1:1 关节映射',后者是'优化换算关节角'。
全身遥操和半自主遥操,对操作员的认知负担差在哪?为什么半自主要"把腿交出去"?
查看参考答案
- 认知负担差:全身遥操要求人同时控走路和动手,极易疲劳、不可持续;半自主把腿委托给预训策略,人只控上半身精细活,负担降一个数量级。
- 为什么把腿交出去:走路是相对标准化的低层技能,已经有训得不错的预训策略可以自动维持;让人腾出注意力专注上半身的精细操作。
- 代价:失去对腿部的细粒度控制(这是'全身 teleop'与'半自主 teleop'的根本分野)。
有人坚持"输入设备越贵、遥操精度越高"。请用 刚学到的"重定向中间件"概念反驳他。
查看参考答案
- 反驳点:精度不只取决于输入硬件贵贱,更取决于有没有一层好的'重定向中间件'把人和机器人解耦。
- 中间件的作用:把任意输入(便宜相机或昂贵头显)的人手姿态,统一换算成目标机器人的关节角;有了它,廉价设备也能接同一个全身控制器。
- 反例:没有这层中间件,再贵的设备也只适配一种机器、换硬件就废;有了它,摄像头和头显都能接同一个底座。
- 结论:解耦的接口层比输入硬件本身更重要。
可选复盘:FAQ
Q1:遥操作出来的数据,能直接喂给 VLA 训练吗?
基本可以,但要先解决"接口对齐"。teleop 产出的多是"运动学姿态"(各关节该怎么摆)轨迹 📎,而 VLA + 全身控制分层架构需要这套姿态能稳定喂给低层控制器。目前学界还没有统一的接口标准,这是 2025-2026 最热的交叉问题之一。
Q2:为什么 2024 年全身人形 teleop 突然爆发?
Q3:teleop 最终会被淘汰吗?
部署时大概率会退场,但训练时不会。2026 年已经有厂商宣称"部署不用 teleop",让单一模型从像素直接控全身 🌐。但这套强模型本身仍靠 teleop 采的数据训出来。所以 teleop 正从"运行时控制"退化为"训练时数据采集",角色在变,不会消失。