⏱ ~76 min

T08 · 动作生成的 physics-aware 转向:从纯 kinematic 到真机可执行

核心问题:动作生成(从文本/视频/音乐生成新动作)怎么从「好看的动画」变成「能上机器人的物理可行轨迹」。
状态:🟢 活跃(合流点是 BeyondMimic;motor foundation 化趋势是 SONIC)
交叉线索:T04(AMP/BFM)、T05(diffusion)、T07(teleop 的 retarget 环节)、T10(VLA+WBC 分层)

🎯 你将学到什么

  1. 看懂动作生成如何从纯 kinematic(脚滑、穿地、悬浮)一步步物理化为真机可执行轨迹,直至被 SONIC 收编为 motor foundation 的下游模态
  2. 掌握四种「物理化」路线的机制差异:post-hoc projection(PhysDiff)、RL finetune(ReinDiffuse)、guidance(GMD / BeyondMimic)、合流式(BeyondMimic / SONIC)
  3. 能解释 BeyondMimic 的 state-action co-diffusion 为何是动作生成线(T08)与 motion prior 线(T04)的真正合流点
  4. 理解 SONIC 的 universal token space(robot / human / hybrid 三 encoder 共享 64 维 quantized token)如何让 VLA 直接出全身动作而无需 retarget
  5. 学会按三段式 pipeline(生成 → retarget → tracking)拆解任意「文本/视频/音乐 → 真机」动作生成系统,并判断其瓶颈在哪一段

T08 动作生成 physics-aware 演进

本页内容

基础解释

一句话直觉

从文字或音乐生成的酷炫动作,看着帅。

可直接喂机器人,它会摔倒或电机过载。

难点在生成的动作"好看但不守物理"。

脚滑、穿地、悬浮,都常见。

好比把童话插图改成可施工的建筑图纸。

光画得漂亮不够,还得算清承重和地基。

从基础理解

要解决的问题

动作生成(从文字、音乐、视频生成新动作)很火。

但生成模型不懂重力、接触摩擦

输出的关节序列会脚滑、穿地、悬浮、抖动。

直接送给真机,机器人要么摔倒,要么电机过载。

这条线追踪三年里,动作生成怎么一步步"物理化"。

演进脉络(四个台阶)

  • 纯动画生成。只比谁生成得像人,不管物理 📎
  • 事后投影。每生成一步,丢进物理仿真器校正一下 📎
  • 强化微调。用物理可行性当奖励,强化学习微调生成模型本身 📎
  • 合流式分工。生成器只管编新动作,跟踪器负责把动作稳定跟住 📎

方法核心(大白话)

纯生成模型就像在太空里画动画,没有重力。

"加物理"有三条思路:

一是"事后校正"。生成一段,丢进物理仿真器修正一下,再继续往下生成。

二是"内生物理"。把物理可行性当奖励,用强化学习微调生成模型,让它自己学会守物理。

三是"实时引导"。生成时不停注入约束,把动作往"别穿地、别撞"的方向推。

最成熟的是"分工"。

生成器只管创意,编出多样的新动作。

一个单独训好的物理控制器,负责把动作稳定地跟住。

两者通过"重定向"衔接,互不干扰。

后来还出现"动作基座模型",把这条链路收编成一个大底座 📎

一句话类比

物理化生成之于动作,就像把童话插图改成可施工的建筑图纸。

插画家管好看,结构工程师管立得住。

一、这条线索在解决什么

动作生成(text-to-motion、music-to-dance、video-to-motion)在 CV/图形学里很火,但有个致命问题:生成出来的动作不能直接喂给机器人

原因:纯生成模型(diffusion、VAEtransformer)输出的 SMPL/joint 序列没有物理约束——没重力、没接触、没摩擦。结果就是:

  • 脚滑(foot skating):脚在地上滑而不是踩
  • 穿地(ground penetration):脚穿过地板
  • 悬浮(floating):身体悬空
  • 抖动、不连续:关节角跳变

直接把这些关节角送给真机,机器人要么摔倒(重心不对),要么电机过载(指令不连续)。

这条线索追踪三年里动作生成怎么一步步「物理化」:从纯 kinematic → physics-aware(post-hoc 投影 / RL finetune / guidance / 合流)→ on-robot(retarget + tracking),再到 2026 年由 motor foundation(SONIC)把整条链路收编为单一可扩展任务。

二、时间线

2021-2022 年是纯 kinematic 生成的黄金期。HumanML3D([Guo 2022, CVPR])定义了基准,TEMOS/MotionCLIP/Bailando 把 VAE/CLIP/GPT 用上。但全是「动画」,不能上机器人。

2022.09 MDM([Tevet 2023, ICLR, arXiv:2209.14916])把 diffusion 搬到动作域,被引 1800+,后续所有工作 baseline。但仍是纯 kinematic。

2023.10 出现第一次「物理化」尝试:PhysDiff([Yuan 2023, ICCV, arXiv:2212.02500])在 diffusion 每步去噪后用物理仿真器投影校正。同期 GMD([Karunratanakul 2023, ICCV])用 guidance 注入物理约束。这是 physics-aware 生成奠基。

2024 年 ReinDiffuse([Han et al., WACV 2025, arXiv:2410.07296])换思路:不用 post-hoc 投影,而是用物理可行性作 reward 直接 PPO finetune diffusionMaskedMimic([2024, SIGGRAPH Asia])用 motion inpainting 统一生成与物理控制。

2025.08 BeyondMimic([2025, arXiv:2508.08241])是合流点:可扩展 RL motion tracking + guided diffusion state-action co-diffusion。让真机学会跳跃、翻滚、sprint 这种之前跟不上的高动态动作。这是动作生成线(本章)和 motion prior 线(T04)的合流

2025.11 SONIC([Luo & Yuan 2025, arXiv:2511.07820])把 tracking 任务本身扩到 motor foundation 规模(100M 帧 / 700 小时 mocap / 21k GPU 小时 / 42M 参数),并提供 universal token space 把「生成 → 真机」直接收编为 VLA 的 action space。这让动作生成不再是一条独立 pipeline,而成为 motor foundation 的下游模态。

2026 上半年动作生成界再次换代:MotionHiFlow([Li 2026, CVPR, arXiv:2604.23264])用 hierarchical flow matching 取代 diffusion 做 text-to-motion,低分辨率→高分辨率渐进生成,声称同时改善文本对齐与物理合理性;UMF([Huang 2026, CVPR])用 Pyramid Motion Flow + Semi-Noise Motion Flow 解决 number-free 文本生成;FrankenMotion([Li 2026, CVPR, arXiv:2601.10909])把 body 当 part-level 组合体,每个 body part 由自己的 temporally-structured 文本 prompt 引导,diffusion transformer 在 sequence/action/part 三层做层级控制;MusicInfuser([Hong 2026, CVPR, arXiv:2503.14505])用 prior-preserving adaptation 把 music 听觉对齐注入预训练的 Mochi 文生视频 diffusion,直接出 music-synchronized 舞蹈视频。还有一条与机器人控制相邻的线:Riemannian Flow Matching Policy (RFMP)([Braun & Jaquier 2024, IROS])以及 2026 的 Riemannian Motion Generation (RMG)(arXiv:2603.15016)把动作当作 product manifold 上的几何对象、用 flow matching 学其上的速度场——为关节角/旋转这类有流形结构的量提供 principled 生成器,是 latent action 类方法的几何底座。

三、三种「物理化」方法的深度辨析

路线 A · Post-hoc projection(PhysDiff 式)

机制(精确细节,见 P-PhysDiff):PhysDiff 不改 diffusion 训练,只在采样时插入一个 physics-based motion projection 模块 $P_\pi$。该模块核心是用 AMASS 等 mocap 数据预训练好的 motion imitation policy $\pi$——一个能在物理仿真器里控制人形 agent 模仿任意输入动作的 RL policy。每次 diffusion 从 $t$ 去噪到 $s$($s强制物理约束(重力、接触、摩擦)的动作 $P_\pi(\hat x_{0|t})$,把它作为下一步去噪的干净-motion 估计继续往前推。论文强调三件事:(1) 这是 plug-and-play,对 MDM / MotionDiffuse 任意 denoiser 都适用;(2) 不能只在最后做一次 post-processing——因为最后那步去噪出的 motion 可能已经「太不物理」以至于 $\pi$ 跟不住、会被推出 data distribution(论文 Fig. 2 用「一次投影 vs 四次投影」做对比演示)。必须在 diffusion 内部把物理和去噪交替迭代,让 motion 一边贴近物理可行空间、一边贴 data 分布;(3) 论文发现projection 调度有 sweet spot:投影步数越多物理合理性越好(单调),但 motion quality 先升后降——太多投影会把 motion 推离 data 分布使其「物理但 unnatural」;而且加在晚期 diffusion step 比早期好(早期 step 的 motion 偏向训练集均值,投影反而把它推得更远)。最终 PhysDiff 在 HumanML3D 上把 physics error 降 >86%、FID 提升 >20%。

优点:不改 diffusion 训练,即插即用;对任意 denoiser 通用。

缺点:(1) 物理约束来自预训练的 imitation policy $\pi$,$\pi$ 跟不住的剧烈动作(跳跃、翻滚)投影也救不了——这恰好是机器人最想要的;(2) $P_\pi$ 不可微,不能端到端梯度回传;(3) 单步 projection 计算开销远大于图像域的约束梯度,不能每步都做。

💡 核心洞察:PhysDiff 的反直觉发现是「投影不能只在最后一步做、且加在晚期 diffusion step 比早期好」——这说明物理可行性与 data 分布必须在去噪过程中交替迭代,一次性 post-processing 会让 motion 偏离 data 分布太远而失控。

路线 B · RL finetune(ReinDiffuse 式)

机制:先正常训 diffusion,再用物理可行性作 reward,PPO finetune 整个 diffusion 网络(denoiser 参数)。让生成器「内生」地学会物理。

优点:物理约束真正进入模型参数;推理时零额外开销。

缺点:训练复杂(diffusion + RL 两套 pipeline),reward 设计难(穿地、脚滑、悬浮都要 term,且彼此 trade-off);diffusion 的长程生成与 RL 的短程 credit assignment 不天然兼容;容易 reward hacking

路线 C · Guidance(GMD 式 / BeyondMimic 式)

机制:diffusion/flow 采样时注入物理/空间/任务约束梯度。不改变训练,只在推理时加约束。

优点:灵活,可指定「必须经过这个点」「必须以这个速度行走」这类约束;可组合多个不同 cost;支持 test-time 的 zero-shot 任务切换。

BeyondMimic 把 guidance 用到极致(见 P-BeyondMimic 的精确机制):它训一个 state-action co-diffusion 模型——同时把未来状态(humanoid 的 link 位姿/速度)和动作(关节 target)作为联合 diffusion 对象,使得任意对未来状态动作定义的 differential cost 都可以做 classifier guidance。这比仅对 action 做 diffusion 的方案强:能把「避免撞障碍」「到达 waypoint」「follow 指定速度」这类直接作用在状态空间的目标作为梯度源,无需把它们折算成 action-space reward。BeyondMimic 论文明确指出:因为 diffusion 学的是 data 分布的 gradient field 而非分布本身,所以支持 test-time 朝任意 differential 目标做梯度优化——这是它「不做 task-specific training 就能解 navigation、joystick、motion inpainting」的根。代价是必须假设「目标可微」;不可微目标(如「不要撞到玻璃」的硬约束)要靠 surrogate cost 近似。

💡 核心洞察:BeyondMimic 的 state-action co-diffusion 把 diffusion 从「学分布」换成了「学分布的 gradient field」——这一抽象升级让它可以 test-time 朝任意可微目标做 classifier guidance,从而一个模型 zero-shot 解 navigation / joystick / inpainting 三类任务,是「不做 task-specific training」能成立的根本原因。

缺点:约束太强会导致采样失败或 mode collapse;guidance scale 调参敏感。

路线 D · 合流式(BeyondMimic / SONIC 式)

机制:不试图让生成器「物理化」,而是分离职责——生成器(diffusion / flow / kinematic planner)负责编排新动作(多样性、语义、风格),物理执行交给一个独立但通用的 RL tracking policy。两者通过 retarget 或 universal token 衔接。

BeyondMimic 的具体配方(论文 Sec "Scalable Human Motion Tracking"):(1) 极简 reward——只保留 3 个 regularization term(保证物理一致)+ 1 个跨 motion 通用的 tracking task reward,故意砍掉 domain randomization 堆叠和 motion-specific reward shaping,理由是「越简单越能 zero-shot 跨动作、跨仿真器、跨真机」;(2) 共享超参 + 单 setup训全量 2.5 小时 mocap,含 single-leg jump、turn kick、180°/360° spin、cartwheel、aerial cartwheel 等剧烈动作;30 段共 15 分钟在 Unitree G1 真机 zero-shot 运行;(3) 实测极限动力学:aerial cartwheel 飞行段峰值加速度 31 m/s²、骨盆角速度峰值 20 rad/s(均值 7.01,专业人类运动员约 7.75),落地干净几乎不需 recover;(4) 力测跑台对比 GRF(ground reaction force)波形——机器人呈现与人一致的 walking 双峰(heel-strike + push-off)、running 单峰,且 loading/push-off 时序对齐;(5) N=77 用户研究:整体偏好 70.8% vs 29.2%、running 84.7% vs 15.3% 优于 Unitree 原厂 controller(walking 单项 57.0% 待核)。

这是当前主流方向。SONIC 把它进一步推到 foundation 规模。

💡 核心洞察:合流式(BeyondMimic/SONIC)的本质是「职责分离」——生成器负责创意(多样性/语义/风格)、独立 RL tracker 负责物理执行,这比让生成器内生物理更可控,因为物理可行性下沉到一个可独立验证、独立 scale 的 tracker 里。

四、三段式 pipeline(生成到真机的标准链路)

把生成动作送到真机,已形成固定 pipeline:


① 生成(kinematic)        ② Retarget 重定向         ③ Tracking via RL
MDM/PhysDiff/MoMask/      GMR/OKAMI                DeepMimic/AMP/PHC
MotionHiFlow/FrankenMotion →  SMPL → 机器人骨架      + sim-to-real + IL
输出 SMPL/joint 序列        (IK/优化/学习)          (HumanPlus/OmniH2O)
(动画轨迹)

关键发现retarget 质量直接决定后续 RL tracking 上限(GMR, ICRA'26 的结论)。retarget 损耗大,tracker 再强也救不回来。

SONIC 在 2026 给这条 pipeline 一个新形态:runtime 免 retarget。它训一个 universal token space(见第五节),把人/机器人/hybrid motion 全部 encode 成同一个 64 维 quantized token,robot 直接当 tracking 目标消费——所以从「生成 motion」到「机器人执行」中间不再需要显式 retarget 步骤。这把三段式压缩成两段:生成(输出 universal token)→ tracking。

五、SONIC 的角色:动作生成线被收编为 motor foundation 的下游模态

SONIC([Luo & Yuan 2025, arXiv:2511.07820],NVIDIA GEAR)对动作生成线的影响是结构性的——它把「让生成动作物理可执行」这件事从「为每个生成器配 tracker」变成了「一个 motor foundation 吃所有模态」。

scaling 三轴:网络从 1.2M 到 42M 参数;数据从 4M 到 100M 帧(50 fps,700 小时 mocap);算力从 2K 到 21K GPU 小时(128 GPU × 7 天)。论文给出关键 scaling curve:success rate 随数据/参数/GPU 小时单调上升(100M 帧时 99.6%、42M 参数时 99.6%),MPJPE-L 单调下降,没看到饱和——证明 motion tracking 这个任务「吃 scaling」,像 LLM 一样。

💡 核心洞察:SONIC 的 scaling curve 首次证明 motion tracking「吃 scaling law」——success rate 随数据/参数/GPU 小时单调上升未见饱和,这把 motor control 从「手调 reward + 任务专属 policy」升级为「数据驱动的 foundation game」,与 LLM 范式同构。

universal token space 的精确机制(论文 Fig. 7 & Sec 3.2):用三个专用 encoder——robot motion encoder $\mathcal{E}_r$、human motion encoder $\mathcal{E}_h$、hybrid motion encoder $\mathcal{E}_m$(upper-body keypoint + lower-body robot motion 组合)——把不同模态的 motion 命令映射到一个共享的 quantized representation(64 维 universal motion token),再由同一个 universal control policy 消费、输出 PD target。量化采用 Finite Scalar Quantization(FSQ)(论文明确选 FSQ 而非 VQ-VAE:避免 codebook collapse、无需 auxiliary commitment loss、clean straight-through gradient 与 PPO 兼容),保证 token 离散可被下游 VLA 预测。论文实测:让 GR00T N1.5 VLA 直接预测「64 维 universal token + 14 维 hand joint」共 78 维 action,比让 VLA 直接预测 SMPL 显著更平滑、更安全(直接 SMPL 会有 jerk 和 directional 失控)。

与生成模型的对接:universal token 让 SONIC 直接吃 video / text / music 驱动的生成 motion(Kocabas / Li 2021 / Tevet 2022 / Zhang 2023 这些生成模型),无需 retarget;同时 SONIC 的 teleoperation 产出的数据又能训 VLA。这是一个闭环:生成 → SONIC 跟踪 → 部署 / 采数据 → 训 VLA → VLA 输出 universal token → SONIC 执行。动作生成不再孤立,而是 motor foundation 的一个上游输入模态。

kinematic planner(论文 Sec 3.3):SONIC 还训了一个实时 kinematic motion planner——autoregressive 生成 0.8-2.4 秒长度的未来 motion 段(duration 由 planner 自决),笔记本 <5ms / Jetson Orin <12ms 推理,最快每 100ms replan 或命令变更即触发。这个 planner + tracker 组合,本质上是把路线 D(合流式)的「生成器 + tracker」彻底做实。

对动作生成线的启示:(1) 「生成 → 真机」的瓶颈不再是 tracker 强不强,而是 token space 统不统一;(2) 物理可行性可以下沉到 foundation 里,让上层生成器只管「创意」,这是 BeyondMimic 路线 D 的工程极致版;(3) 当 motor foundation 足够强,独立 physics-aware 生成器(PhysDiff 式)的边际价值下降——直接接 universal token 即可。

六、2026 最新进展

2026 上半年动作生成 physics-aware 路线沿「flow matching 几何化 / 多角色物理交互 / 球面 latent prior / physics-aware retarget 端到端化 / 几何一致可证安全」五条轴线深化——SONIC 之后的「收编 vs 独立迭代」之争仍未收敛,独立路线把物理化做到更精细的粒度:

  • A2A Flow Matching:把「起点」从噪声换成历史动作(× T05):A2A Flow Matching [Jia et al., arXiv:2602.07322](HKUST Yang 组)以历史 proprioceptive action 序列编码为高维 latent 作为 flow matching 起点,替代标准 diffusion policy 的随机高斯噪声初始化;单步推理即可生成高质量动作,方法推广到视频生成。在原理上挑战了 diffusion/flow policy 必须从随机噪声开始的前提,为 action generation 的实时性与时间连续性提供新范式——既是 T05 diffusion policy 的进展,也是本章「物理化动作生成」在 flow matching 起点侧的新轴线。
  • 接触密集多角色物理跟踪:Physics-Based Motion Tracking of Contact-Rich Interacting Characters [Zhang et al., arXiv:2604.07984](Durham Shum 组)用 Progressive Neural Network (PNN) 让多个 expert 自动按难度专门化学习不同技能,稳定跟踪双人物理接触密集的交互(拳击、推搡、缠斗),无需人工训练调度——把物理角色控制从单角色扩到接触密集多角色交互的边界,解决了力传递导致的不稳定问题,为多人/交互角色动作合成提供新基线。同期的 Learning to Assist [Shibata et al., arXiv:2603.11346](Aoki + Fragkiadaki 组)把 AMP 风格的对抗 motion prior 扩展到多智能体(人-人)协同——是 AMP 路线在 2026 上半年的重要延续。
  • 球面 latent motion prior:SLMP [Tan et al., arXiv:2603.01294]提出用球面(spherical / von Mises-Fisher)潜空间作为 motion prior 的 latent 表示,替代传统高斯 latent,更适合周期性、循环性强的步态与运动数据;在物理 humanoid 控制下游任务中作为 style reward 显著提升自然度——是 AMP 之后「如何替换/改进判别器 style reward」的新答案,球面 latent 与周期动作天然契合。
  • Physics-aware retarget 端到端化(× T07):ReActor [Müller et al., arXiv:2605.06593](Disney Research)提出基于 RL 的 physics-aware retargeting:直接在物理仿真器中训练 retarget policy,使机器人执行 retarget 后的参考动作时既忠实于源动作又在物理上可行,避免了 IK-based retarget 后再单独训 tracker 的两段式流程——在多个基准上超越 GMR 与 OmniRetarget,为人形机器人「从任意人动作到真机执行」提供端到端方案。这把第四节「retarget 质量决定后续 tracking 上限」的结构性痛点直接打通。
  • 几何一致 + 可证安全的运动策略:SafePBDS [Wu et al., arXiv:2605.21811](Stanford C. Karen Liu 组)提出 Safe Pullback Bundle Dynamical Systems:从异构任务流形(配置 $\mathbb{R}^7$、末端 SE(3)、障碍物 $\mathbb{R}$ 等)上的目标与安全约束,计算可证明安全的最优配置流形加速度。为灵巧操作提供「几何一致 + 可证明安全」的运动策略统一框架——弥补学习方法缺乏安全证明的痛点,是 2026 几何控制与灵巧操作交叉方向的代表性理论工作。

📌 关键要点

  1. 纯生成模型(diffusion / VAE / transformer)输出的 SMPL 序列没物理约束——脚滑、穿地、悬浮是三大痼疾,直接喂真机会摔或过载
  2. 四种物理化路线中合流式(BeyondMimic / SONIC)是当前主流:分离职责——生成器负责创意、独立 RL tracker 负责物理执行——比让生成器内生物理更可控
  3. BeyondMimic 用 state-action co-diffusion + classifier guidance 让 diffusion 学 data 分布的 gradient field,支持 test-time 朝任意可微目标优化——这是它「不做 task-specific training 就解 navigation / joystick / inpainting」的根
  4. SONIC 的 scaling curve(1.2M → 42M 参数、4M → 100M 帧、2K → 21K GPU 小时)首次验证 motion tracking 吃 scaling law,universal token 让「生成 → 真机」中间不再需要显式 retarget
  5. retarget 质量直接决定后续 RL tracking 上限(GMR ICRA'26 结论),但 SONIC 通过 universal token 绕过 retarget,是动作生成线被收编为 motor foundation 下游模态的关键

七、数据源:从 mocap 到 YouTube

生成+控制 pipeline 的数据源在扩展:

  • AMASS:动捕演员,质量高但场景单一
  • YouTube 视频:用 4DHumans(HMR 2.0)SMPLer-X 从 wild 视频大规模抽 SMPL——意味着无限数据源
  • SONIC 把数据规模推到 100M 帧 / 700 小时 mocap,已远超 AMASS 单一来源;并验证 tracker 对 OOD motion(content / repetition 两类 PHuMA 测试)零样本泛化

这是潜在的质变点:如果能用 YouTube 抽无限动作,pipeline 的数据瓶颈就消失了。FrankenMotion 还在 part-aware 数据集上提出新的标注范式,把「单条 motion 标一句」扩展为「每个 body part 一个时序 prompt」,让数据维度变高。

八、与其他线索的交叉点

  • T04(AMP/BFM)BeyondMimic 与 SONIC 都是两条线的合流点。T04 从物理 controller 出发用 MoCap 扩能力,本章从生成模型出发往物理靠近,终点都是「真机可执行的多样化动作」。SONIC 把这两条线统一到 motion tracking at scale。
  • T05(diffusion policy):MDM 用 diffusion 生成动作,Diffusion Policy 用 diffusion 生成控制动作——同源技术,不同目标;MotionHiFlow / UMF 把 diffusion 换成 flow matching,与 GR00T N1 的 action flow matching(见 T10)形成同源技术迁移。
  • T07(teleop):teleop 的 retarget 环节(SMPL→机器人)和本章的三段式 pipeline 共用技术(GMR、OKAMI);SONIC 的 universal token 同时支撑 teleop 和生成,是这两条线的工程汇聚点。
  • T10(VLA+WBC):SONIC 的 universal token 让 VLA 直接出全身动作(见 P-SONIC),动作生成「物理化」的最终落点正是 VLA 的 action space。

九、当前局限与开放问题

  1. 数据多样性不足:text-to-motion 几乎全靠 HumanML3D/KIT-ML(都源自 AMASS),缺乏 wild 日常、双手操作、人-物交互。HOI 数据(BEHAVE、OMOMO)规模仍小。FrankenMotion 的 part-aware 数据集是补强方向之一。
  2. 物理一致性仍「贴上去」:post-hoc / reward shaping / guidance 都不是原生物理生成。把 physics deep-bake 进 generative model 仍是开放问题。SONIC 的合流方案回避了这问题,但代价是生成器与物理执行强耦合在一个 foundation 里。
  3. 实时性:diffusion 采样慢(数十步),MotionHiFlow / flow matching 把步数压到个位数,BeyondMimic 的 kinematic planner 做到 5ms 级,但仍难支撑 30Hz 真机闭环对剧烈动作的即时响应。
  4. 剧烈动作的 sim-to-real:BeyondMimic 能做跳跃翻滚(峰值 31 m/s²),SONIC 也验证 6 m/s 跑步,但 sim-real gap 在高动态动作上仍大;可微分仿真 / 并行 sim 数量是当前 scaling 主战场。
  5. motor foundation 与独立生成器的关系未定:SONIC 路线主张「收编」,但生成界(MotionHiFlow、FrankenMotion)仍在独立迭代——最终是「一个 foundation 吃掉一切」还是「生成器 + foundation 协作」,尚未收敛。

十、涉及里程碑论文

  • [Guo 2022, CVPR] HumanML3D —— 动作生成的 ImageNet 基准
  • [Tevet 2023, ICLR, arXiv:2209.14916] MDM —— diffusion 进动作生成
  • [Yuan 2023, ICCV, arXiv:2212.02500] PhysDiff —— physics-aware 奠基(post-hoc projection)
  • [Karunratanakul 2023, ICCV] GMD —— guided diffusion
  • [Han et al. 2024, WACV 2025, arXiv:2410.07296] ReinDiffuse —— RL finetune diffusion
  • [2024, SIGGRAPH Asia] MaskedMimic —— motion inpainting 统一
  • [Braun & Jaquier 2024, IROS, arXiv:2403.10672] RFMP —— Riemannian Flow Matching Policy,几何化生成控制的底座
  • [Liao et al. 2025, arXiv:2508.08241] BeyondMimic —— 合流点:tracking + guided state-action co-diffusion
  • [Luo & Yuan 2025, arXiv:2511.07820] SONIC —— motor foundation,universal token space 收编动作生成
  • [Li 2026, CVPR, arXiv:2604.23264] MotionHiFlow —— hierarchical flow matching text-to-motion
  • [Huang 2026, CVPR] UMF —— number-free text-to-motion via Pyramid + Semi-Noise flow
  • [Li 2026, CVPR, arXiv:2601.10909] FrankenMotion —— part-level diffusion,sequence/action/part 三层文本控制
  • [Hong 2026, CVPR, arXiv:2503.14505] MusicInfuser —— prior-preserving music-conditioned video diffusion
  • [2026, arXiv:2603.15016] Riemannian Motion Generation (RMG) —— product-manifold flow matching,动作生成的几何统一框架

十一、延伸

十二、关联论文笔记

本线索涉及的核心论文在本仓库已有深度笔记:

  • P-MDM-2023.md [Tevet et al., ICLR 2023, arXiv:2209.14916]——本线索的起点。transformer encoder-only(不是 U-Net)+ 预测 $\hat x_0$ 而非 $\epsilon$(让 geometric losses 可用)+ classifier-free guidance($s=2.5$ sweet spot)+ 3 个 geometric losses(position/foot-contact/velocity)。单 RTX 2080 Ti 训 3 天、500K steps、8 层 transformer、latent dim 512。详细的 ablation、$\hat x_0$ 预测为何对 motion domain 关键、与 Diffusion Policy 的对比见该笔记。
  • P-PHCUHC-2023.md [Luo et al. 2023]——MDM 输出 → physics-based imitator 的桥梁(in-betweening)。
  • papers/P-PhysDiff-2023.md待补)[Yuan et al., ICCV 2023, arXiv:2212.02500]——post-hoc projection 路线(A)的奠基。物理约束通过预训练 motion imitation policy $\pi$ 在仿真器里实现,$P_\pi$ 不可微;详细 projection 调度(晚期 step 优于早期、sweet spot 步数)、HumanML3D physics error -86% / FID +20% 数据。该深度笔记尚未撰写——见 curated/papers.jsonl 与 PhysDiff 原文。
  • P-BeyondMimic-2025.md [Liao et al., arXiv:2508.08241]——本线索的合流点(路线 D)。3 regularization + 1 task reward 的极简配方、state-action co-diffusion + classifier guidance、aerial cartwheel 31 m/s² / 20 rad/s 的极限动力学、GRF 波形与人一致、N=77 用户研究整体偏好 70.8% / running 84.7% 优于 Unitree 原厂——详细数据见该笔记。
  • P-SONIC-2025.md [Luo & Yuan et al., arXiv:2511.07820]——motor foundation 化的代表。1.2M→42M / 4M→100M 帧 / 2K→21K GPU 小时的 scaling curve、universal token space(64 维 quantized,三个 encoder)、GR00T N1.5 VLA 预测 78 维 action(64 token + 14 hand)、5 个 loco-manipulation 任务 75% 平均成功率——架构细节见该笔记。

可选复盘:常见误区

澄清:"生成出来的动作,后处理一下就能上机器人" —— 错。只在最后做一次校正救不回来:到结尾那步,动作可能已经"太不物理",跟踪策略跟不上,反而被推离正常数据分布 。事后投影必须在生成过程中"边生成边校正",让动作一边贴近物理可行、一边贴近数据分布。

"生成出来的动作,后处理一下就能上机器人" —— 错。只在最后做一次校正救不回来:到结尾那步,动作可能已经"太不物理",跟踪策略跟不上,反而被推离正常数据分布 📎。事后投影必须在生成过程中"边生成边校正",让动作一边贴近物理可行、一边贴近数据分布。

物理约束要反复迭代进生成循环,不是末端滤镜。

澄清:"物理化就是给生成器加个物理损失项" —— 不全对。这只是"强化微调"一条路。还有"事后投影"(不改生成器、采样时插入仿真器)和"实时引导"(采样时注入约束梯度)两条路,机制完全不同 。当前最成熟的反而是"合流式分工"——生成器和跟踪器各司其职,根本不试图把物理塞进生成器 。

"物理化就是给生成器加个物理损失项" —— 不全对。这只是"强化微调"一条路。还有"事后投影"(不改生成器、采样时插入仿真器)和"实时引导"(采样时注入约束梯度)两条路,机制完全不同 📎 📎。当前最成熟的反而是"合流式分工"——生成器和跟踪器各司其职,根本不试图把物理塞进生成器 📎

物理化有四条独立路线,加损失只是其一。

澄清:"重定向只是格式转换,不影响上限" —— 错。重定向(把人体动作换算成具体机器人的关节角)的质量,直接决定后续跟踪器能不能学会 。重定向损耗大,跟踪器再强也救不回来。

"重定向只是格式转换,不影响上限" —— 错。重定向(把人体动作换算成具体机器人的关节角)的质量,直接决定后续跟踪器能不能学会 🌐。重定向损耗大,跟踪器再强也救不回来。

重定向是整条"生成到真机"链路的精度天花板。

可选复盘:检查点

Q1

用"童话插图改建筑图纸"类比,向没学过机器人的朋友解释:为什么直接把生成动作喂给机器人会出事?

查看参考答案
  • 核心:纯生成模型不懂重力、接触、摩擦,输出的动作会脚滑、穿地、悬浮、抖动('好看但不守物理')。
  • 类比锚:童话插图只管好看(画得漂亮),建筑图纸还得算承重和地基(物理可行);插图直接当图纸施工,楼会塌。
  • 后果:直接送真机,机器人要么摔倒(重心不对),要么电机过载(指令不连续)。
Q2

前文列了三条"加物理"的思路(事后校正、内生物理、实时引导)。各用一句话说出它在哪里"动手"。

查看参考答案
  • 事后校正:生成完一段后,丢进物理仿真器修正一下,再继续往下生成(在'采样过程中'反复插入仿真器)。
  • 内生物理:把物理可行性当奖励,用强化学习微调生成模型本身,让它自己学会守物理(在'模型参数'里动手)。
  • 实时引导:生成时不间断地注入约束梯度,把动作往'别穿地、别撞'的方向推(在'采样方向'上动手)。
Q3

为什么"只在最后做一次校正"救不回来?事后投影必须在哪个环节反复做?

查看参考答案
  • 为什么救不回来:到最后那步,动作可能已经'太不物理',跟踪策略跟不上,反而被推离正常数据分布(越校正越怪)。
  • 必须反复做的环节:要在生成的'每一步去噪过程里'反复插入物理投影,让动作一边贴近物理可行、一边贴近数据分布。
  • 对照:一次末端校正 ≠ 事后投影;真正的方案是'边生成边校正'的交替迭代。
Q4

"合流式分工"为什么比"把物理塞进生成器"更成熟?生成器和跟踪器各负责什么?

查看参考答案
  • 为什么更成熟:把物理塞进生成器(强化微调/引导)训练复杂、易被奖励钻空子、约束太强会采样失败;分工让两个模块各管一件事,互不干扰,更稳。
  • 生成器:只管创意,编出多样、可控的新动作(不管物理)。
  • 跟踪器:一个单独训好的物理控制器,负责把动作在物理仿真/真机上稳定地跟住(管物理执行)。
  • 衔接:两者通过'重定向'衔接。
Q5

有人觉得"重定向就是格式转换,无所谓精度"。请用 刚学到的内容反驳他,并说出它决定了什么。

查看参考答案
  • 反驳点:重定向(把人体动作换算成具体机器人的关节角)不是单纯的格式转换,它的质量直接决定后续跟踪器能不能学会。
  • 决定什么:它是整条'生成到真机'链路的精度天花板——重定向损耗大,跟踪器再强也救不回来。
  • 结论:重定向是这条 pipeline 里被低估的关键一环,不是无所谓的后处理。

可选复盘:FAQ

Q1:生成动作和模仿学习用的参考动作,有啥区别?

生成动作是模型"编"出来的新动作(如根据"一个人高兴地跳舞"生成),可能从没在现实中发生。模仿学习的参考动作通常是真人动捕的、物理上天然可行。生成动作的好处是多样、可控、近乎无限;坏处就是这条线要解决的——不保证物理可行 📎

Q2:哪种"物理化"路线现在最实用?

合流式分工。让生成器专注创意、让一个训好的跟踪器负责物理执行,是目前工程上最稳的方案 📎。事后投影和强化微调仍各有短板(前者救不了剧烈动作、后者训练复杂易被奖励钻空子)。2025 年后,"动作基座模型"把分工收编进一个大底座,进一步压低了使用门槛 📎

Q3:剧烈动作(跳跃、翻滚)能生成并上机器人吗?

能,但很难。跳跃翻滚这类动作加速度大、接触复杂,事后投影的跟踪策略常常跟不上 📎。近年的突破靠合流式:一个可扩展的跟踪策略专门训剧烈动作,已能在真机上跑出与人一致的落地冲击波形 📎。但剧烈动作的仿真到真机差距仍大,是当前主战场之一。