TacImag:「脑补」触觉——训练时用触觉,部署时只看视觉
🎯 为什么重要:触觉硬件是「接触富」操作落地的最大包袱
触觉传感器(GelSight、DIGIT 等)在论文里效果惊艳,但在工业部署上是噩梦:
· 脆弱:硅胶面一磨就坏,几小时接触就报废;
· 标定:每次安装都要重新校准力-形变关系,温度/湿度都影响;
· 维护:额外走线、同步、驱动,集成成本远超视觉相机。
所以一个直接的工程问题:能不能让机器人「受益于」触觉知识,但部署时不用触觉硬件? TacImag 给了肯定回答。它的关键判断是——视觉里其实已经藏着接触信息(微小变形、相对运动、外观变化),只是端到端 policy 提取不出来。让 diffusion 模型「把视觉里的接触线索翻译成触觉表征」,policy 就能用。
💡 核心思想:把触觉当作「视觉的翻译」而不是「缺失的测量」
这里有个反直觉的洞察。直觉上你会以为:「视觉里看不到接触,所以脑补触觉 = 凭空想象 = 噪声」。但论文的核心假设不一样:
关键工程选择:Stage 2 训练 policy 时,梯度不回传到 imagination 模型(保持冻结)。这让 TacImag 始终是一个「显式的触觉信息源」而不是被 policy 吸收成隐式参数——便于隔离研究「想象触觉」本身的作用。
🛠️ 工程化:4 个关键设计
| 设计 | 心智 | 为什么必要 |
|---|---|---|
| ① 两种触觉表征并行研究 | TacRGB(触觉图像 240×320×3)vs TacFF(力场 10×14×3 grid,法向+剪切力) | 不同任务需要不同信息:接触/力推理用 TacFF,表面/纹理识别用 TacRGB。论文要回答「想象触觉是否有表征-任务依赖性」 |
| ② DDPM 而非确定性回归 | 用条件 DDPM 建模 $p(o_t^{tac} | o_t^{vis}, o_t^{prop})$ 而非 MSE 回归 | vision→tactile 本质是一对多(同样视觉下多种可能的接触态)。Diffusion 自然处理多模分布,比回归更稳 |
| ③ 冻结 imagination + 共享 Tac Encoder | Stage 2 中 G_φ 冻结;想象触觉和真触觉共用同一个 Tac Encoder 结构 | ① 隔离 imagination 的影响(不被 policy 吸收);② 让「真触觉 policy」和「想象触觉 policy」的编码空间可直接对比,做 controlled study |
| ④ 视角按任务选择 | 接触敏感任务用 wrist-view(近距离看接触区),纹理任务可用 front-view | wrist 相机虽然会被遮挡,但近距离视觉里接触线索最浓;front 相机视野好但看不清细节。案例研究(Fig.7)证明:front 视角下球分类脑补失败,wrist 下成功 |
论文 §IV-B 有个反直觉发现:peg-in-hole 上,imagined TacFF (31.3%) 居然略高于 physical TacFF (29.2%)。论文的解释很妙:diffusion 模型学到了一个「更平滑、任务导向」的触觉表征——它主动抑制了无关的传感器噪声/变化,只保留 manipulation 相关的接触线索。换句话说,脑补不是「真实触觉 + 噪声」,而是「真实触觉 - 无关变化」。想象力反而比现实更纯净。但论文也强调:差距很小,不应过度解读为「想象 > 真实」。
📊 关键结果:表征-任务匹配,是 TacImag 的核心规律
论文最扎实的发现是:想象的触觉有没有用,强烈依赖于「用什么表征 + 做什么任务」。这个规律在仿真和真机上都成立。
| 实验 | 对比 | 数字(源自 PDF) |
|---|---|---|
| 仿真 6 任务平均 | Table I:Vision baseline vs +各种触觉 | Vision 53.6% → +TacFF(real) 58.2% → +TacFF(imag) 57.5%(仅差 0.7pt!);+TacRGB(imag) 53.2%(图像表征对接触任务帮助小) |
| 接触敏感任务 - 仿真 | Fig.4:USB/Power/PIH/Gear/Bulb 平均提升 | Vision → +TacFF(real) +4.9% / +TacFF(imag) +4.0% / +TacRGB(real) -1.4% / +TacRGB(imag) -1.2% |
| 纹理敏感任务 - 仿真 | Fig.4:Ball Sorting(暗光下分球) | Vision → +TacRGB(real) +7.4% / +TacRGB(imag) +3.6%;TacFF 系列基本无效 |
| 真机接触敏感任务 | Table III:Bulb / Wiping / Belt Insertion | Vision 平均 17.8% → +TacFF(imag) 平均 62.2%(+44.4pt,部分任务从 6.7%→40.0%) |
| 真机纹理敏感任务 | Table III:Ball Sorting (wrist view) | Vision 33.3% → +TacRGB(imag) 73.3%(+40pt);TacFF(imag) 仅 46.7% |
| 触觉 imagination 质量 | Table II:held-out 集 | TacFF 方向余弦 0.890;TacRGB SSIM 0.953 / LPIPS 0.157(高质量重建) |
🌐 在领域中的位置
谱系定位:TacImag 处于「missing-modality learning」和「cross-modal generation」的交叉点。和 PTLD 类 privileged distillation 比,它不把触觉信息压进 latent,而是显式生成可解释的触觉观测,便于隔离研究。与 Imagine2Touch / Touch2Touch 等纯生成工作比,它把生成质量落到下游操作性能而非 SSIM/FID。它在「触觉表征」轴上验证了 Beyond Binary (CoP)、ManiFeel 的同一结论:接触任务用力场,纹理任务用图像。
❓ 常见误区
TacImag 是「无触觉传感器」操作吗?
训练时需要触觉(用 GelSight R1.5 采 paired 数据),部署时不需要。所以更准确的说法是「触觉硬件只在数据采集阶段出现」——可以用一个「公共数据集 + 多个机器人共用」的方式分摊成本。一旦 imagination 模型训好,部署到 100 台机器人上,一台 GelSight 都不用装。
为什么用 diffusion 而不是直接 MLP 回归触觉?
vision → tactile 是一对多映射:同样的视觉输入下,可能存在多种合理的接触态(不同摩擦、不同精确位姿)。MLP + MSE 会回归出「平均值」——可能哪一种都不是。Diffusion 自然建模条件分布,能采样出合理的多模态触觉。
为什么用想象触觉训练 policy 时冻结 imagination 模型?
两个原因:① 隔离研究——如果让 policy 梯度回传调整 imagination,「触觉想象」的作用就会被 policy 参数吸收掉,无法独立分析。冻结它,「想象触觉」就是一个显式外部信号,便于 ablation。② 部署一致性——部署时 imagination 也是冻结的,训练和部署行为一致。
那「脑补」到底创造了什么新信息?
论文的立场很明确:没有创造新信息。Ball Sorting 案例证明:如果视觉里看不到 dimple 纹理(front-view),脑补就失败。TacImag 做的是「把视觉里 policy 难以直接学的弱线索,翻译成 policy 容易消费的触觉表征」。它是一种表征变换 + 辅助监督,不是凭空 hallucination。
真机 44.4% 的提升会不会太夸张?
注意这是相对基线的绝对提升,且基线很弱(vision-only 在 belt insertion 只有 6.7%)。这些任务(灯泡旋紧、皮带插入、白板擦拭)本质就是接触敏感——视觉上看不到「拧到位没」「皮带进槽没」,vision-only 自然崩。换成「脑补力场」就解锁了。在已经很简单的任务上,TacImag 的提升会小很多。