枢纽

TacImag:「脑补」触觉——训练时用触觉,部署时只看视觉

Zhiyuan Zhang, Adeesh Desai 等(Purdue Industrial Eng. + Texas A&M Mechanical Eng.)。arXiv:2607.01684,2026 年 7 月。 项目页 · tactilevisuotactilemissing-modalitydiffusion

🧠 一句话心智模型:触觉传感器在真机上又脆又贵又难维护——能不能训练时用、部署时不用?TacImag 训一个 diffusion 模型「看着视觉 + 本体感觉,脑补出触觉图像/力场」。部署时只用相机,把脑补出的「假触觉」当作额外输入塞给 policy。性能不掉,反而接近真有传感器的水平——因为脑补出来的不是噪声,是「视觉里其实藏着但 policy 自己提取不出来的接触线索」。

🎯 为什么重要:触觉硬件是「接触富」操作落地的最大包袱

触觉传感器(GelSight、DIGIT 等)在论文里效果惊艳,但在工业部署上是噩梦:

触觉硬件的「三座大山」
· 脆弱:硅胶面一磨就坏,几小时接触就报废;
· 标定:每次安装都要重新校准力-形变关系,温度/湿度都影响;
· 维护:额外走线、同步、驱动,集成成本远超视觉相机。

所以一个直接的工程问题:能不能让机器人「受益于」触觉知识,但部署时不用触觉硬件? TacImag 给了肯定回答。它的关键判断是——视觉里其实已经藏着接触信息(微小变形、相对运动、外观变化),只是端到端 policy 提取不出来。让 diffusion 模型「把视觉里的接触线索翻译成触觉表征」,policy 就能用。

视觉-only 部署最简单 ✓ 相机便宜可靠 ✗ 接触态难推断 ✗ 插入/装配任务崩 接触富任务失败 Visuotactile 性能最强 ✓ 触觉直接给接触 ✗ 触觉硬件脆弱 ✗ 标定/维护贵 部署成本高 TacImag ✅ 部署只用视觉 ✓ 训练时脑补触觉 ✓ 性能接近触觉真机 ✓ 无硬件负担 两全其美
图 1:触觉部署的工程权衡。TacImag 把「触觉传感器的训练红利」和「视觉-only 的部署简洁」解耦——训练时受惠、部署时零硬件。

💡 核心思想:把触觉当作「视觉的翻译」而不是「缺失的测量

这里有个反直觉的洞察。直觉上你会以为:「视觉里看不到接触,所以脑补触觉 = 凭空想象 = 噪声」。但论文的核心假设不一样:

核心假设:在很多操作场景下,接触信息并没有完全缺席于视觉——它只是以微弱、难以端到端学习的形式存在(细微形变、运动学约束、相对位移、阴影变化)。触觉 imagination 的真正作用,不是「补回视觉里没有的信息」,而是「把视觉里已经存在但 policy 抓不住的线索,翻译成触觉表征,让 policy 容易用」。这是一种接触感知的辅助监督
Stage 1:训练 Tactile Imagination 模型(需要配对的 visuotactile 数据) 视觉 o_vis + 本体 o_prop 条件 DDPM G_φ(o_vis, o_prop) → ô_t 脑补触觉 ô_tac L2 逼近真值 o_tac (来自 GelSight) Stage 2:冻结 imagination,训练 touch-informed policy(只用视觉 + 本体) 视觉 o_vis 真机部署时 唯一输入 冻结 G_φ 在线脑补 → 想象的 ô_tac Tac Encoder z_tac Diffusion Policy z_vis ⊕ z_tac ⊕ z_prop → a_t
图 2:TacImag 两阶段。Stage 1 用配对数据训 diffusion「vision → tactile」生成器;Stage 2 冻结生成器,让 diffusion policy 学着消费「想象触觉」。

关键工程选择:Stage 2 训练 policy 时,梯度不回传到 imagination 模型(保持冻结)。这让 TacImag 始终是一个「显式的触觉信息源」而不是被 policy 吸收成隐式参数——便于隔离研究「想象触觉」本身的作用。

🛠️ 工程化:4 个关键设计

设计心智为什么必要
① 两种触觉表征并行研究TacRGB(触觉图像 240×320×3)vs TacFF(力场 10×14×3 grid,法向+剪切力)不同任务需要不同信息:接触/力推理用 TacFF,表面/纹理识别用 TacRGB。论文要回答「想象触觉是否有表征-任务依赖性」
② DDPM 而非确定性回归用条件 DDPM 建模 $p(o_t^{tac} | o_t^{vis}, o_t^{prop})$ 而非 MSE 回归vision→tactile 本质是一对多(同样视觉下多种可能的接触态)。Diffusion 自然处理多模分布,比回归更稳
③ 冻结 imagination + 共享 Tac EncoderStage 2 中 G_φ 冻结;想象触觉和真触觉共用同一个 Tac Encoder 结构① 隔离 imagination 的影响(不被 policy 吸收);② 让「真触觉 policy」和「想象触觉 policy」的编码空间可直接对比,做 controlled study
④ 视角按任务选择接触敏感任务用 wrist-view(近距离看接触区),纹理任务可用 front-viewwrist 相机虽然会被遮挡,但近距离视觉里接触线索最浓;front 相机视野好但看不清细节。案例研究(Fig.7)证明:front 视角下球分类脑补失败,wrist 下成功
🔮 直觉:为什么想象的触觉有时比真触觉还好?
论文 §IV-B 有个反直觉发现:peg-in-hole 上,imagined TacFF (31.3%) 居然略高于 physical TacFF (29.2%)。论文的解释很妙:diffusion 模型学到了一个「更平滑、任务导向」的触觉表征——它主动抑制了无关的传感器噪声/变化,只保留 manipulation 相关的接触线索。换句话说,脑补不是「真实触觉 + 噪声」,而是「真实触觉 - 无关变化」。想象力反而比现实更纯净。但论文也强调:差距很小,不应过度解读为「想象 > 真实」。

📊 关键结果:表征-任务匹配,是 TacImag 的核心规律

论文最扎实的发现是:想象的触觉有没有用,强烈依赖于「用什么表征 + 做什么任务」。这个规律在仿真和真机上都成立。

实验对比数字(源自 PDF)
仿真 6 任务平均Table I:Vision baseline vs +各种触觉Vision 53.6% → +TacFF(real) 58.2% → +TacFF(imag) 57.5%(仅差 0.7pt!);+TacRGB(imag) 53.2%(图像表征对接触任务帮助小)
接触敏感任务 - 仿真Fig.4:USB/Power/PIH/Gear/Bulb 平均提升Vision → +TacFF(real) +4.9% / +TacFF(imag) +4.0% / +TacRGB(real) -1.4% / +TacRGB(imag) -1.2%
纹理敏感任务 - 仿真Fig.4:Ball Sorting(暗光下分球)Vision → +TacRGB(real) +7.4% / +TacRGB(imag) +3.6%;TacFF 系列基本无效
真机接触敏感任务Table III:Bulb / Wiping / Belt InsertionVision 平均 17.8% → +TacFF(imag) 平均 62.2%+44.4pt,部分任务从 6.7%→40.0%)
真机纹理敏感任务Table III:Ball Sorting (wrist view)Vision 33.3% → +TacRGB(imag) 73.3%+40pt);TacFF(imag) 仅 46.7%
触觉 imagination 质量Table II:held-out 集TacFF 方向余弦 0.890;TacRGB SSIM 0.953 / LPIPS 0.157(高质量重建)
关键洞察(论文 §V-C):触觉 imagination 不是万能的。Ball Sorting 任务上,如果用 front-view 相机(看不到表面细节),脑补出来的 TacRGB 是模糊的,性能只能从 26.7% → 33.3%。换成 wrist-view(看得到高尔夫球的 dimple 纹理),脑补成功,性能跃升到 73.3%。这正面证明了「脑补触觉」需要视觉里确实有线索——不能凭空创造信息。

🌐 在领域中的位置

visuotactile policy(全程装触觉) privileged latent distillation(PTLD '26) TacImag: 显式触觉 imagination ⭐ 触觉基础模型(Sparsh / UniT / AnyTouch)

谱系定位:TacImag 处于「missing-modality learning」和「cross-modal generation」的交叉点。和 PTLD 类 privileged distillation 比,它不把触觉信息压进 latent,而是显式生成可解释的触觉观测,便于隔离研究。与 Imagine2Touch / Touch2Touch 等纯生成工作比,它把生成质量落到下游操作性能而非 SSIM/FID。它在「触觉表征」轴上验证了 Beyond Binary (CoP)、ManiFeel 的同一结论:接触任务用力场,纹理任务用图像。

❓ 常见误区

TacImag 是「无触觉传感器」操作吗?

训练时需要触觉(用 GelSight R1.5 采 paired 数据),部署时不需要。所以更准确的说法是「触觉硬件只在数据采集阶段出现」——可以用一个「公共数据集 + 多个机器人共用」的方式分摊成本。一旦 imagination 模型训好,部署到 100 台机器人上,一台 GelSight 都不用装。

为什么用 diffusion 而不是直接 MLP 回归触觉?

vision → tactile 是一对多映射:同样的视觉输入下,可能存在多种合理的接触态(不同摩擦、不同精确位姿)。MLP + MSE 会回归出「平均值」——可能哪一种都不是。Diffusion 自然建模条件分布,能采样出合理的多模态触觉。

为什么用想象触觉训练 policy 时冻结 imagination 模型?

两个原因:① 隔离研究——如果让 policy 梯度回传调整 imagination,「触觉想象」的作用就会被 policy 参数吸收掉,无法独立分析。冻结它,「想象触觉」就是一个显式外部信号,便于 ablation。② 部署一致性——部署时 imagination 也是冻结的,训练和部署行为一致。

那「脑补」到底创造了什么新信息?

论文的立场很明确:没有创造新信息。Ball Sorting 案例证明:如果视觉里看不到 dimple 纹理(front-view),脑补就失败。TacImag 做的是「把视觉里 policy 难以直接学的弱线索,翻译成 policy 容易消费的触觉表征」。它是一种表征变换 + 辅助监督,不是凭空 hallucination。

真机 44.4% 的提升会不会太夸张?

注意这是相对基线的绝对提升,且基线很弱(vision-only 在 belt insertion 只有 6.7%)。这些任务(灯泡旋紧、皮带插入、白板擦拭)本质就是接触敏感——视觉上看不到「拧到位没」「皮带进槽没」,vision-only 自然崩。换成「脑补力场」就解锁了。在已经很简单的任务上,TacImag 的提升会小很多。