Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

一个能看懂桌面场景、听懂"把插头插进插座"就动手的机器人模型,往往卡在最后一厘米:它看得见插头和插座,却感觉不到插头有没有对正、要不要再加点力。这类"看图加听指令、输出动作"的模型(简称 VLA)这两年进步很快,可一到接触类的活儿就露怯。 原因在于它们是站在大视觉语言模型的肩膀上——那套看和推理的能力,是在海量图文里预训练出来的,天生擅长回答"这是什么、在哪、指令要我干嘛"。但力,尤其是接触瞬间的横向摩擦和打滑,几乎不会明明白白写在画面上,摄像头拍不出"夹太松正在滑"。以往想补触觉,多半是给模型接一条专门的触觉分支,再拿触觉数据重训,既要改结构,又要一批本就稀缺的触觉标注。 TAP-VLA 换了个更省的路子:不给模型加感官,而是把触觉翻译成它已经看得懂的东西,也就是图里的箭头。用的是"视触觉传感器",本质是一小块软胶下藏个摄像头,物体压上来胶体变形,摄像头就能读出接触面各处往哪个方向被推、被剪切,这就是所谓的剪切力场,方向大致对应"东西正往哪滑"。 拿到这张力的分布图,做法很直接:把每处横向受力换算成一支带方向的箭头,叠回机器人原本的 RGB 视角。触觉于是不再是一路陌生信号,而是以"画面里多出来的箭头"进入模型,论文称之为留在模型的原生观测空间里。好处是连锁的:不动网络结构,不需要触觉预训练数据,原有的视觉语言能力一点不损失,微调阻力也小。 效果上,在四个需要反复接触、拿捏力道的任务里,TAP-VLA 成功率做到 78%;作为对照,只用视觉数据微调的版本连 50% 都够不着,而另外几种把触觉直接拼进模型的融合做法,在部分任务上和随机瞎猜没差别。这组对比说明的不只是"加了触觉更好",而是触觉怎么喂进去比喂不喂更要紧:硬塞一个模型没见过的模态反而可能拖后腿,把它翻译成模型的母语才管用。 当然,这套"箭头即触觉"的巧劲也留了没回答的问题。四个任务规模不大,二维箭头能不能表达三维接触、多点抓握,论文没验证;把力压成几支箭头本身就是有损的,真到需要读绝对力值的精细场合可能不够。它更像给 VLA 补触觉的一条低成本捷径,证明了"复用视觉通道"这个方向走得通,而不是接触感知的终点。