Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

BFMTrack: Latent Sequence Optimization for Physics-Based Motion Tracking with Behavioral Foundation Models

行为基础模型(Behavioral Foundation Models,BFM)是物理角色控制领域近年的一个重要思路。它的核心是用一个大规模的动作数据集,把一整套物理上可行的行为'打包'组织进一个隐空间(latent space)——隐空间里的每个点对应一种可行的行为,整个空间就成了一个通用的行为先验库。有了这个库,做角色控制时就不必从零学每个新任务,而是在隐空间里导航、调用已有的行为。 但论文点出 BFM 有个明显的能力短板。它们在时间无关(time-invariant)的任务上表现出色——比如到达某个目标点(goal-reaching)、按某个基于状态的奖励去优化。这类任务的共同点是:只关心最终状态或瞬时状态对不对,不关心过程的时序细节。而 BFM 天生不擅长的,恰恰是另一类任务:需要精确跟随一整段随时间展开的参考动作,也就是动作跟踪(motion tracking)。比如让角色精确复现一段舞蹈、一套武术动作——这要求每一帧的姿态都对得上,是高度时序敏感的。 BFMTrack 的解法是在 BFM 的隐空间里做隐序列优化(latent sequence optimization)。直觉是:既然隐空间编码了所有可行行为,那一段精确的参考动作,原则上对应着隐空间里的一条轨迹——一串随时间变化的隐变量。BFMTrack 要做的就是去优化、搜索出这样一串隐变量序列,让 BFM 在它们的引导下驱动物理角色,精确地复现出给定的参考动作。这相当于把'跟踪一段动作'转化成'在隐空间里找一条正确的路径'。 为什么值得关注:它把 BFM 这个通用行为先验的适用范围,从'达成目标'扩展到了'精确模仿过程'。这两类能力对真正通用的角色/机器人控制都不可或缺——既要会自主达成目标,也要能精确执行被指定的动作序列。BFMTrack 补上的是后者这块,让一个预训练好的通用行为模型不必重训就能干精确跟踪的活。 影响层面,对做物理仿真角色控制、人形动画、运动控制的人,这是一条值得关注的路线:复用已有的 BFM 行为先验来做高精度动作模仿,而不是为跟踪任务单独训一套控制器。 局限要标注:隐序列优化的计算代价、能精确跟踪多复杂/多剧烈的动作、以及在物理可行性约束下精度的上限,都需要看完整论文的实验。它依赖底层 BFM 隐空间的质量——如果某段参考动作落在了行为先验覆盖不到的区域,跟踪精度自然受限。这是物理仿真层面的工作,向真实机器人迁移还隔着 sim2real 的距离。