Dream-Tac:给「世界动作模型」装上一双会摸的手
🎯 为什么重要:视觉的世界模型,在「接触瞬时」是瞎的
世界动作模型(WAM)继承了视频生成模型的预测能力,让机器人「先想象未来、再做动作」。但论文开篇就点出它的死穴:
💡 核心思想:把触觉接进视频 DiT,但用「接触门控」决定何时听它
Dream-Tac 的解法分两步:(1)把触觉当作「第二种视觉」塞进同一个视频扩散主干;(2)但用门控告诉注意力:触觉平时静默,接触瞬间才放大。
关键在门控 $g_t$ 的设计——不学、不要未来信息、纯从相邻触觉帧差算:先求左右指尖触觉图像的平均绝对帧差 $\rho_t = \max(\delta_t^L, \delta_t^R)$,再用 median/MAD 风格的固定参数稳健归一化到 $[g_{\min}, g_{\max}]$。结果是:背景噪声几乎被压到 $g_{\min}$,而真正的接触事件把门推开到 $g_{\max}$。这个门值作为加性偏置进入注意力 logit,只在「非触觉 query 看 触觉 key」时生效——一个不对称归纳偏置。
🛠️ 三个让触觉 WAM 真正能跑起来的关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 触觉也喂进预训练 VAE | 把触觉图像当作「另一种视觉」用 Wan 视频模型的 VAE 编进同一潜空间 | 不要为触觉单独训 VAE——论文实测预训练 VAE 已经能把不同触觉模式自动分开(Fig.6 的 latent separability),省一大笔预训练成本 |
| ② Contact-Aware Self-Attention(CASA) | 在注意力 logit 上加一个被 $g_t$ 调节的偏置:$\text{logit}_{ij} = \frac{q_i^\top k_j}{\sqrt{d}} + \alpha\, g_t (1-M_i) M_j$ | 触觉信号99% 时间是平的。若用对称注意力,平直段会被反复 attend,反而稀释真正接触事件的信号。门控让非触觉 token(动作、视觉、状态)只在接触事件发生时才向触觉 token 倾斜 |
| ③ 双层加速(FlashBias + step cache) | 训练时把门控偏置重写成 FlashAttention 兼容的低秩形式;推理时用 diffusion-step cache 把 10 步降到 2 步 | DiT 的二次注意力 + 多步去噪,加上触觉 token 的额外开销,会让原版训练 80s/iter、推理 5Hz——根本没法实时控制。两招合计 2.9× 训练加速、1.8× 推理加速 |
如果让网络自己学一个门控网络,它会过拟合到训练分布里的伪相关;如果对称地放大触觉,平直段也会被放大,等于把信噪比拉低。Dream-Tac 用「帧差 + 固定归一化」算门控,本质上是把「什么时候该认真听触觉」这个判断从模型权重里挪出来,交给一个物理上几乎不证自明的启发式:触觉突变 ≈ 接触事件。这种「不学的东西就不学」的克制,反而是它能在真机泛化的关键。
📊 结果:6 个接触密集任务平均 83.3%,比 Cosmos-Policy 高 31.6 个点
| 方法 | 类型 | 平均成功率(6 任务) |
|---|---|---|
| Dream-Tac(本文) | 触觉 WAM | 83.3% |
| Visuo-tactile WAM + Bias(消融) | + CASA | 83.3%(即完整版) |
| Visuo-tactile WAM(消融) | 触觉但无 CASA | 74.2% |
| Visual WAM(消融) | 无触觉 | 51.7% |
| Cosmos Policy | 视觉 WAM 基线 | 51.7% |
| ForceVLA | 力觉 VLA | 50.8% |
| $\pi_{0.5}$ | VLA flow | 45.0% |
| $\pi_0$ | VLA flow | 30.8% |
| 维度 | 数字(来自原文) |
|---|---|
| 任务覆盖 | 6 个接触密集真机任务:Pick Baguette / Insert USB / Clean Whiteboard / Peel Cucumber / Play Mahjong / Cut Banana |
| 平均提升 | 相对 Cosmos-Policy +31.6% 成功率;相对 $\pi_0$ +52.5% |
| 消融:触觉的贡献 | 仅加入触觉(无 CASA):51.7% → 74.2%(+22.5);再加 CASA:→ 83.3%(+9.1) |
| 训练加速 | 完整模型 27.5s/iter vs Cosmos-Policy 80.8s/iter,2.9× 加速(H200 GPU) |
| 推理加速 | 1109 ms → 619 ms,1.8× 加速,成功率不变(85%) |
| 极端泛化 | Play Mahjong 任务在完全视觉遮挡下,Dream-Tac 仍达 100%(训练分布)/ 85%(未见牌面);Cosmos-Policy 在桌面高度变化下从 65% 暴跌到 0% |
🌐 在领域中的位置
Dream-Tac 是「触觉进入世界动作模型」的标志性工作。它把「世界模型预测什么」从 RGB 视频扩展到了 RGB + 触觉的联合未来,这恰好对应 WAM 综述(arXiv:2605.12090)里点名的「multimodal physical state representation」开放挑战。关联线索:T11 灵巧操作谱系。
❓ 常见误区
触觉只是「辅助信号」,加个 concat 不就行了?
不行。论文消融显示,光把触觉 token 塞进模型(Visuo-tactile WAM 无 CASA)确实有效(51.7 → 74.2),但 CASA 又叠加了 +9.1 点。原因在于触觉信号 99% 时间是平的,对称注意力会把它「平均化」稀释;只有门控式的「事件驱动关注」才能把接触瞬间的信号放大到该有的权重。
$g_t$ 这个门控要学吗?要未来信息吗?
都不要。$g_t$ 完全从当前和上一帧的触觉图像 RGB 差计算,参数 $(m, s, k, \epsilon) = (0.002, 0.001, 4, 10^{-6})$ 都是固定超参。这避免了引入「privileged future information」,所以训练和推理都能用同一公式,无障碍部署。
2.9× 训练加速是不是靠砍模型?
不是。加速来源是工程重构:把门控偏置用 FlashBias 的低秩形式重写在 FlashAttention 上,绕开了「naive 实现破坏 fused attention path」的瓶颈。模型容量、触觉 token 数都不变。所以同样的设置下,Cosmos-Policy 加门控偏置要 80.8s/iter,Dream-Tac 只要 27.5s/iter——是同一算法的高效实现,不是算法妥协。