Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

给机器人手换上更清晰的摄像头、把负责"看"的那张神经网络做得更大,照常理它该更会干活才对。可在一类要靠手指真去碰、去抓的任务上,这条加视觉的路很快就撞了墙:怎么堆容量,成功率的缺口也只填得动很小一截。一篇新论文 TacGen 想说的是,问题不在视觉不够强,而在缺了一整个维度。 先把这个缺口说清楚。让机械手拧瓶盖、把销子插进孔里,难点往往不在看得清不清,而在那些摄像头根本拍不到的瞬间:指尖到底碰上了没有,握着的东西有没有在打滑,力道是松还是紧。这些都是接触发生那一刻的物理状态,光靠一束从外面打过来的图像,再高的分辨率也读不出来。研究者用的测试台叫 TACTO,是一个专门模拟触觉信号的仿真基准,能在虚拟环境里给机械手配上"会感知压力的指尖"。 有意思的是,他们先沿着"加视觉"这条最直觉的路试到了底。把视觉编码器的容量一路往上堆,操控成功率和理想值之间的差距,最终也只弥合了 4.5%,剩下九成多的缺口纹丝不动。这等于从反面证明:补不上的那部分压根不是视觉能力的问题,再多像素也换不来手指的触感。真正的转折,是换一种喂信号的方式。 他们的做法是把视觉和触觉两路信号"对齐"。所谓对齐,可以想成让两个说着不同语言的人,看到同一个场景时给出能对上号的描述:摄像头拍到的画面和指尖感到的压力,如果指的是同一次接触,就该在模型内部落到相近的位置。这种把两种模态特征拉进同一个空间的训练手法叫对比学习(contrastive),骨干网络直接借用了视觉领域已经很成熟的自监督视觉模型 DINOv2。加上这一路触觉对齐之后,成功率从 0.246 直接抬到 0.979,把前面怎么扩视觉都补不动的那 95.5% 几乎填满。0.246 的成功率,意味着十次操作里七八次都得失手;0.979 则是基本每次都能成,这中间隔着的,正是"敢不敢把活交给机器去做"的那条线。 更省事的一招藏在推理阶段。真触觉传感器贵、易损、装起来也麻烦,TacGen 用一个残差 MLP,把普通 RGB 图像的特征直接投影到训练时学到的触觉表示空间里。换句话说,模型用起来只需要一个摄像头,就能"脑补"出本该由触觉传感器提供的那部分信息,不必真在机械手上插传感器。这一手把触觉从一道硬件门槛,变成了一段可以学出来的映射。 这件事的分量,要放回具身智能里一场没停过的争论里看:机器人理解物理世界,到底是不是非触觉不可,还是视觉够强就能兜底。TacGen 给的答案偏向前者,它用 95.5% 这个数字说明,在接触密集的活儿里,触觉不是锦上添花,而是表征里省不掉的一维。对做抓取、装配、精密插装这类任务的研究者和工程师,这意味着与其继续给视觉加码,不如把触觉这条线补进感知栈。只是要留一句实话:目前所有结论都还长在 TACTO 这个仿真基准里,虚拟指尖和真实世界中千差万别的材质、磨损、温度之间还隔着一段路,这一步证明的是"触觉这一维不能省",而不是"装上就能直接上生产线"。