Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning

教会机器人一个新动作,最贵的从来不是算法,是数据。主流的模仿学习靠人握着手柄遥操作机器人、一条条把演示录下来,几百上千条起步;而这批数据几乎不能复用,换一台胳膊长度、抓手都不同的机器人,之前录的全作废。 有人早想到更省的源头:网上到处是人做家务、用工具的视频,为什么不让机器人直接看人学?问题出在具身鸿沟。人有五根手指,机器人多半是两指或三指夹爪,关节自由度也和机械臂对不上,把人手轨迹硬套到机械爪上,往往既抓不稳也够不着。以往做法多在重定向人手姿态上打转,越修越复杂。 Human2Any 把问题挪了个位置。它不再盯着手该怎么动这件跟身体强绑定的事,而是去学物体之间该怎么互动:勺子相对碗的位姿、倒水时杯子的角度。这层关系描述的是任务本身,跟操作者是人还是夹爪无关,于是能从人类视频里干净地抽出来,不掺具身信息。 光有目标还落不了地,机器人还得知道自己够不够得着、抓法稳不稳。Human2Any 于是分两块拼:一块是人类视频学来的物体互动先验,管目标是什么;另一块是机器人侧的可行性推理和运动规划,管这台机器人怎么办得到。两块组合才生成动作,作者称之为约束感知的组合式规划,先验一次学成、跨本体复用,换机器人只需换掉可行性那半边。 验证走的是零样本跨本体:目标机器人上一条演示都没采。同一套人类视频先验,既在 Franka 桌面机械臂上跑通了倒水、挂杯这类活,又搬到了能移动的 RBY-1 人形机器人上。两台机器形态、工作空间、抓手都不同,却共用同一份先验,正是这套拆分想证明的点。 从人类视频里挖机器人技能,是这一两年具身智能最挤的赛道之一,多数路线要么重定向人手动作,要么追踪视频里的点轨迹。Human2Any 把可迁移的东西定义得更靠上一层:不是手的运动,也不是像素点,而是物体之间的关系,抽象层次一抬高,跨本体就更容易成立。 但要泼一盆冷水:论文目前既没放出成功率,也没有和任何基线的量化对比,几个任务更像能力演示而非严格评测,且都是结构化的桌面或工具操作。一旦进到物体遮挡、堆叠杂乱的真实厨房,关系是否还提得准、可行性那半边补不补得上,眼下都是空白。把演示换成可复现的数字,才是这条路接下来要过的关。