枢纽
物理感知
实时
输入模态vision,tactile

Dream-Tac:给「世界动作模型」装上一双会摸的手

Yunfan Lou, Yifan Ye, Yankai Fu 等(北京大学 + HKUST + 南京大学)。arXiv:2606.08737,2026 年 6 月。 代码开源于 github.com/LYFCLOUDFAN/Dream-Tac · visuo-tactileworld action modeldexterous 线索 T02

🧠 一句话心智模型:当下流行的「世界动作模型」(WAM)只会——预测一段未来视频再吐动作。但插 USB、剥黄瓜、擦白板这类「贴、滑、压」的精细活,摄像头根本看不出名堂。Dream-Tac 给 WAM 加上两只「指尖眼睛」(触觉传感器),并教会模型「只在真正碰到东西的那一刻,才认真听触觉说话」——平时静默,接触瞬间放大。

🎯 为什么重要:视觉的世界模型,在「接触瞬时」是瞎的

世界动作模型(WAM)继承了视频生成模型的预测能力,让机器人「先想象未来、再做动作」。但论文开篇就点出它的死穴:

核心矛盾:精细操作的关键信息——接触 onset、滑动、释放——在 RGB 里是「几乎不可观测」的。摄像头看到的是「快要碰到」和「已经碰到」两帧画面,但是哪一帧真碰上、碰多深、有没有滑,肉眼和视频模型都看不清。视觉 WAM 在这种任务上必然崩。
RGB 摄像头看到的: 即将接触 (看起来没碰) 已经接触 (看起来一样) → 视觉信号「几乎无差异」 触觉传感器看到的: 平直基线 (噪声 ~0) 尖锐脉冲 (接触事件) → 触觉信号「瞬时点亮」
图 1(据论文 Fig.1(a) 重绘):同一时刻,RGB 几乎不变,触觉却出现「尖峰」。这就是接触敏感任务的信息源差异

💡 核心思想:把触觉接进视频 DiT,但用「接触门控」决定何时听它

Dream-Tac 的解法分两步:(1)把触觉当作「第二种视觉」塞进同一个视频扩散主干;(2)但用门控告诉注意力:触觉平时静默,接触瞬间才放大

当前图像 $o$ 当前触觉 $x$ 语言 $l$ 机器人状态 预训练 VAE 统一潜空间 (Wan VAE) 视频 DiT 主干 ×N 联合去噪 CASA contact-aware self-attention 门控 $g_t$ 调节触觉权重 未来图像 $v_{1:T}$ 未来触觉 $x_{1:T}$ 动作 chunk $a_{1:H}$ $g_t = \sigma(k\cdot(\rho_t-m)/s)$ 从相邻帧触觉差 $\rho_t$ 计算
图 2(据论文 Fig.2 重绘):三种模态都被 VAE 编进同一潜空间,共享 DiT 主干联合去噪。触觉不是旁路辅助,而是和视频、动作平起平坐的预测目标。CASA 在注意力层里按门控 $g_t$ 放大触觉对其他 token 的影响。

关键在门控 $g_t$ 的设计——不学、不要未来信息、纯从相邻触觉帧差算:先求左右指尖触觉图像的平均绝对帧差 $\rho_t = \max(\delta_t^L, \delta_t^R)$,再用 median/MAD 风格的固定参数稳健归一化到 $[g_{\min}, g_{\max}]$。结果是:背景噪声几乎被压到 $g_{\min}$,而真正的接触事件把门推开到 $g_{\max}$。这个门值作为加性偏置进入注意力 logit,只在「非触觉 query 看 触觉 key」时生效——一个不对称归纳偏置。

🛠️ 三个让触觉 WAM 真正能跑起来的关键设计

设计心智为什么必要
① 触觉也喂进预训练 VAE把触觉图像当作「另一种视觉」用 Wan 视频模型的 VAE 编进同一潜空间不要为触觉单独训 VAE——论文实测预训练 VAE 已经能把不同触觉模式自动分开(Fig.6 的 latent separability),省一大笔预训练成本
② Contact-Aware Self-Attention(CASA)在注意力 logit 上加一个被 $g_t$ 调节的偏置:$\text{logit}_{ij} = \frac{q_i^\top k_j}{\sqrt{d}} + \alpha\, g_t (1-M_i) M_j$触觉信号99% 时间是平的。若用对称注意力,平直段会被反复 attend,反而稀释真正接触事件的信号。门控让非触觉 token(动作、视觉、状态)只在接触事件发生时才向触觉 token 倾斜
③ 双层加速(FlashBias + step cache)训练时把门控偏置重写成 FlashAttention 兼容的低秩形式;推理时用 diffusion-step cache 把 10 步降到 2 步DiT 的二次注意力 + 多步去噪,加上触觉 token 的额外开销,会让原版训练 80s/iter、推理 5Hz——根本没法实时控制。两招合计 2.9× 训练加速、1.8× 推理加速
🔮 直觉:为什么门控非得是「数据驱动 + 不对称」?
如果让网络自己学一个门控网络,它会过拟合到训练分布里的伪相关;如果对称地放大触觉,平直段也会被放大,等于把信噪比拉低。Dream-Tac 用「帧差 + 固定归一化」算门控,本质上是把「什么时候该认真听触觉」这个判断从模型权重里挪出来,交给一个物理上几乎不证自明的启发式:触觉突变 ≈ 接触事件。这种「不学的东西就不学」的克制,反而是它能在真机泛化的关键。

📊 结果:6 个接触密集任务平均 83.3%,比 Cosmos-Policy 高 31.6 个点

方法类型平均成功率(6 任务)
Dream-Tac(本文)触觉 WAM83.3%
Visuo-tactile WAM + Bias(消融)+ CASA83.3%(即完整版)
Visuo-tactile WAM(消融)触觉但无 CASA74.2%
Visual WAM(消融)无触觉51.7%
Cosmos Policy视觉 WAM 基线51.7%
ForceVLA力觉 VLA50.8%
$\pi_{0.5}$VLA flow45.0%
$\pi_0$VLA flow30.8%
维度数字(来自原文)
任务覆盖6 个接触密集真机任务:Pick Baguette / Insert USB / Clean Whiteboard / Peel Cucumber / Play Mahjong / Cut Banana
平均提升相对 Cosmos-Policy +31.6% 成功率;相对 $\pi_0$ +52.5%
消融:触觉的贡献仅加入触觉(无 CASA):51.7% → 74.2%(+22.5);再加 CASA:→ 83.3%(+9.1
训练加速完整模型 27.5s/iter vs Cosmos-Policy 80.8s/iter,2.9× 加速(H200 GPU)
推理加速1109 ms → 619 ms,1.8× 加速,成功率不变(85%)
极端泛化Play Mahjong 任务在完全视觉遮挡下,Dream-Tac 仍达 100%(训练分布)/ 85%(未见牌面);Cosmos-Policy 在桌面高度变化下从 65% 暴跌到 0%
关键洞察:消融里最值得看的是「触觉 vs 触觉+CASA」的 +9.1 点。这说明光把触觉塞进去只解决了一半问题——另一半在于怎么让模型学会「选择性聆听」。这正是 CASA 的价值。Play Mahjong 的「蒙眼」实验更具说服力:当视觉被完全屏蔽,ForceVLA 这类把力觉当辅助信号的模型仍然依赖视觉先验,而 Dream-Tac 因为有 CASA 强制关注触觉,才能在「视觉失效」时不崩。

🌐 在领域中的位置

视觉策略 / VLA($\pi_0$, OpenVLA) + 力觉/触觉辅助(ForceVLA, RDP, AdapTac) 视觉世界动作模型(Cosmos Policy) Dream-Tac(触觉 WAM)⭐ 多模态物理状态预测(force + tactile + acoustic)

Dream-Tac 是「触觉进入世界动作模型」的标志性工作。它把「世界模型预测什么」从 RGB 视频扩展到了 RGB + 触觉的联合未来,这恰好对应 WAM 综述(arXiv:2605.12090)里点名的「multimodal physical state representation」开放挑战。关联线索:T11 灵巧操作谱系

❓ 常见误区

触觉只是「辅助信号」,加个 concat 不就行了?

不行。论文消融显示,光把触觉 token 塞进模型(Visuo-tactile WAM 无 CASA)确实有效(51.7 → 74.2),但 CASA 又叠加了 +9.1 点。原因在于触觉信号 99% 时间是平的,对称注意力会把它「平均化」稀释;只有门控式的「事件驱动关注」才能把接触瞬间的信号放大到该有的权重。

$g_t$ 这个门控要学吗?要未来信息吗?

都不要。$g_t$ 完全从当前和上一帧的触觉图像 RGB 差计算,参数 $(m, s, k, \epsilon) = (0.002, 0.001, 4, 10^{-6})$ 都是固定超参。这避免了引入「privileged future information」,所以训练和推理都能用同一公式,无障碍部署。

2.9× 训练加速是不是靠砍模型?

不是。加速来源是工程重构:把门控偏置用 FlashBias 的低秩形式重写在 FlashAttention 上,绕开了「naive 实现破坏 fused attention path」的瓶颈。模型容量、触觉 token 数都不变。所以同样的设置下,Cosmos-Policy 加门控偏置要 80.8s/iter,Dream-Tac 只要 27.5s/iter——是同一算法的高效实现,不是算法妥协。