2026-06-23 · 🦾 具身← 本期
Decoupling Declarative from Procedural in VLA (w²VLA)
如果你不在做机器人,可以这样理解这件事的来由:VLA(Vision-Language-Action,视觉-语言-动作模型)是近两年具身智能的主流路线,做法是拿一个十亿参数级的预训练视觉语言模型(VLM)打底,先在大规模机器人数据上微调,再用少量场景特定的示教数据继续调,让它直接输出动作。这套路子在"分布内"的操作任务上能拿到顶尖成绩,但有个反复出现的痛点:模型很脆。空间、语义、任务只要发生小幅变化,性能就掉;想零样本迁移到训练时没见过的新物体,更是受限。
这篇论文把根因诊断得很具体:现在的 VLA 没能把两类知识在表征上分开。一类是声明性知识(declarative),也就是概念和物体语义——"这是什么、它有哪些属性";另一类是程序性知识(procedural)——"具体怎么操作、动作怎么执行"。人脑里这两者是分工的,但 VLA 把它们一锅煮进同一批参数,结果就是换个物体、换个说法,"怎么做"的能力也跟着一起失灵。作者认为,这种无法解耦正是零样本技能迁移到新物体的根本瓶颈。
w²VLA 的对策是重构信息流。以往的典型做法,是把 VLM 编码器产生的所有多模态 token 全部喂进一个庞大且不透明的、基于 transformer 的"动作专家",让它黑箱式地端到端出动作。w²VLA 不这么干:它改成以组合化、可解释的方式,用视觉、空间和技能这三类信息分别去调制(modulate)机器人的状态序列。换句话说,不同来源的信息各司其职地作用到状态表征上,而不是混成一团塞进黑箱——这正是它实现解耦的结构性手段。
这种"调制状态序列"的设计还附带一个好处:可解释。因为视觉、空间、技能信息是分开作用的,理论上更容易看清模型在依赖哪一路信息做决策,而不是面对一个无从拆解的端到端动作专家。这对调试和理解失败原因有现实意义。
作者声称,凭借这套解耦,w²VLA 在面对不相似、未曾见过的物体时,获得了它所称的"前所未有"的零样本技能迁移能力,并表示相比当前最先进的 VLA 有提升。这个方向上的价值是清楚的:如果策略真能脱离对"物体特定示教"的依赖,数据采集的负担会显著下降——而数据采集成本,正是具身智能规模化最现实的拦路虎之一。
需要诚实保留的是分量问题。本条目所依据的原文摘要里,没有给出统一的量化主指标——没有具体的成功率、没有跨物体迁移的对比数字、没有点名基准上的得分。"超过 SOTA""前所未有的零样本迁移"目前都还是作者的定性表述,真实幅度有多大、在哪些任务上成立、相对哪些基线,都要等正文的实验表才能判断。
对做具身、做 VLA 的人,这条值得记下它的问题框定方式:把"声明性 vs 程序性"作为解耦轴,并用分路调制状态序列替代单一黑箱动作专家,是一个清晰且可借鉴的思路。但在看到正文量化结果之前,先把它当作一个有想法的方法提案,而不是已经坐实的性能突破。
相关
- 2026-06-23 · 模型QwenLM/Confident-Decoding —
- 2026-06-23 · 具身ASCII Art Turns LLMs into VLA Controllers