Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Vesta: A Generalist Embodied Reasoning Model

先说为什么这条值得做具身之外的人也停下来看。今天搭一个能在真实世界干活的机器人,主流做法是"专家拼盘":定位用一个模型,空间推理用一个,导航用一个,长程规划再用一个,最后把它们串成一条流水线。这套做法有两个老毛病——每个模型都要单独跑,算力开销叠加起来很贵;更麻烦的是误差会沿着链条传递,前一环估错了位置,后面的规划全建在错误的前提上,错误一级级放大。Vesta 想验证的是一个更激进的假设:能不能把这些能力都收进一个统一的基座模型,让一个通才顶替一整队专才。 Vesta 把定位、空间推理、导航、长程规划这四类能力合并进了单一的具身基座模型。对不熟具身这块的人,可以这样理解这几个词:定位是知道自己在哪、周围物体在哪,空间推理是理解"杯子在桌子左边、要绕过椅子"这类几何与关系,导航是据此移动,长程规划则是把一个多步骤的任务拆成有序的子动作。过去这是四套独立模型的活,Vesta 把它们压进了同一组参数里。 支撑这件事的关键有两块。第一块是数据:作者整理了一套规模庞大、覆盖多样的多模态语料,专门用来"诱导空间 grounding"——也就是让模型把语言里说的东西和物理空间里的实际位置对应起来,这是空间能力的根基。第二块是一个"简单的多模态记忆机制"(memory harness)。它要解决的是长时间跨度的推理:机器人执行一个长任务时,得记得几分钟前看到过什么、做过什么,才能据此决定下一步。这个记忆模块就是把跨时间的多模态信息保留下来供后续推理调用。值得注意的是,原文强调的是这套记忆机制"简单",并未公开它的具体实现结构。 结果上有三个量化锚点,都来自原文。其一,在多个基准上,Vesta 平均超过各项单任务 SOTA 专家模型 20% 以上——也就是说一个通才在每条赛道上都没输给该赛道的最强专才。其二,更狠的对比是它超过"每个子任务都挑当前最强专家"拼成的集成 10% 以上;这个对照很关键,因为它排除了"通才只是赢在某一项特别强"的可能,对手是一个理论上各项都最优的拼盘。其三,在真正需要记忆与推理的真实机器人任务上,任务成功率提升超过 35%——记忆机制的价值正落在这一类任务上。 把它放进坐标系看:具身领域长期的张力就是"通用 vs 专精"。专家模型在单项上往往更容易调到极致,所以"多模型拼盘"一直是务实的工程默认选项。Vesta 这条工作的分量在于,它用量化结果挑战了这个默认——通才不仅追平专才,还在集成对照下反超,这等于在说"拆成专家"未必再是必选项。这和大模型领域"一个通用基座吃掉一堆专用小模型"的趋势是同一个方向,只是搬到了机器人这个误差更不可逆、对实时性和鲁棒性要求更高的场景。 诚实的保留也得说清楚。原文只给了相对提升的百分比(>20%、>10%、>35%),没有给出对比所用的具体基准名称、绝对分数,也没有公开模型参数量、训练语料的具体规模,以及记忆机制的内部结构——这些原文均未给出。是否开源、有无权重同样未提及。相对提升看着可观,但缺了绝对基线和基准明细,真实分量还得等论文正文与第三方复现来校准。对做具身、做机器人系统集成的人,这条的信号很明确:单一通用基座替代专家拼盘这条路,至少在作者自己的评测里跑通了,值得继续盯。
相关