Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

World Value Models for Robotic Manipulation

如果你在做机器人操作策略,尤其是想用大规模、来源混杂的数据训练,那"怎么判断一条演示数据值不值得学"就是绕不开的瓶颈。这篇论文要解决的正是这件事:构建一个通用的价值模型(value model),能对任意一段轨迹给出"任务推进到哪一步、这步质量如何"的判断,从而在质量参差的数据里筛出有用的信号。 先把背景说清。价值模型在机器人里的作用,是给状态或轨迹打分——它告诉策略学习器"现在离完成任务还有多远、刚才那一步是变好还是变坏"。要打得准,模型必须有深度的时序理解:既要用历史上下文锚定"当前处在任务的什么阶段",又要对未来结果有所规划。论文的核心论点是,现有机器人价值模型大多建在视觉语言模型(VLM)骨干之上,而 VLM 的预训练主要面向静态或时间稀疏的视觉观测,本质上缺乏价值估计所需的时序建模能力。换句话说,拿一个"看图说话"为主的底座去做"判断动作好坏随时间如何演进"的活,地基就不太对。 作者给出的解法是换骨架:用世界模型(world model)替代 VLM 作为价值函数的基础。世界模型天生擅长时序建模和对未来的预测/规划——它学的是"环境会怎么随动作演化",这恰好是价值估计需要的能力。论文把世界模型与价值估计结合,构造出通用机器人价值模型 WVM(World Value Model),目标是给出准确的任务进度(task progression)来评估数据质量。这条思路的优雅之处在于动机直接:与其在缺时序能力的底座上打补丁,不如换一个天生具备时序与规划能力的底座。 在评测上,论文报告 WVM 在标准基准上的 Value-Order Correlation(VOC,价值排序相关性,衡量模型给出的价值排序与真实任务进展顺序是否一致)取得 SOTA。注意到现有评测套件大多只含专家(expert)数据,作者额外提出了 Suboptimal-Value-Bench——一个多本体(multi-embodiment)基准,由 800 条次优(suboptimal)轨迹组成,并带有高保真的人工逐帧标注。这个基准的意义在于:真实数据从来不是全专家级的,能在次优数据上把价值排得准,才更贴近"从混杂数据里学习"的实际场景。论文称 WVM 在 Suboptimal-Value-Bench 上同样保持 SOTA,显示它对专家与次优数据都稳健。进一步地,当把 WVM 用于策略学习时,它在多种策略提取(policy extraction)方法下、在仿真与真机部署中都提升了操作表现,为从混合质量数据中学习提供了较稳的指导信号。 对从业者意味着什么:如果你手里是众包/回放/多机器人混合采集的数据,WVM 代表的方向是用一个时序更强的价值模型来做数据质检与策略引导,而不是默认所有演示都同等可信;它提出的 Suboptimal-Value-Bench 也给"在非专家数据上评价值模型"提供了一个可对齐的标尺。 诚实的保留:这是 arXiv v1 的新投稿,摘要层面只给出"SOTA"这一定性结论,原文(就本次可见的摘要)未给出具体的 VOC 数值、对比的基线模型名单,以及真机/仿真提升的量化幅度——这些得看正文表格与第三方复现才能定论。所谓 SOTA 也未注明对照的具体方法集合,强弱差距暂无法判断。Suboptimal-Value-Bench 由作者自建,其标注口径与代表性也需要社区使用后再评估。结论方向有说服力,但量化证据待补。