2026-06-26 · 🦾 具身← 本期
RGB: RL Guided Whole-Body MPPI for Humanoid Control
人形机器人在接触丰富(contact-rich)的环境里——比如脚要踩地、手要推物、身体要应对外力——需要的全身控制器既要鲁棒又要精确。当前两条主流路线各有长短,而 RGB 想做的是把它们的优点缝起来。
一条路线是深度强化学习(RL)。它通过大量训练能学出非常鲁棒的稳定性,机器人摔不倒、扛得住扰动。但 RL 有个结构性的僵硬:学出来的策略和它训练时用的目标、命令接口是紧耦合的。你想给这个控制器加一个新的反馈目标——比如让它在走路的同时多满足某个新约束——往往做不到,因为这个目标没在训练里出现过,结果就是得重新训练整个策略。在需求多变的真实部署里,这种'改需求就要重训'的代价很高。
另一条思路是 MPPI(Model Predictive Path Integral,一种基于采样的模型预测控制)。它的工作方式是在每个时刻采样大量可能的控制序列,用模型预测各自的后果,再按表现加权融合出实际执行的控制。MPPI 的好处是灵活——新的目标可以直接写进它优化的代价函数里,无需重训。但纯采样式方法的弱点是采样效率:在高维的全身控制空间里盲目采样,很难高效地采到好的控制序列。
RGB 的结合点很巧:把 RL 学到的策略当作 MPPI 的采样先验(sampling prior)。也就是说,MPPI 不再盲目地、均匀地采样控制序列,而是在 RL 策略建议的高质量区域附近采样。这样一来,RL 贡献的是鲁棒性和高效的采样方向,MPPI 贡献的是在线灵活性——新的反馈目标可以随时加进 MPPI 的优化里,而完全不用动那个预训练好的 RL 策略。鲁棒与灵活兼得,且代价是不必重训。
为什么值得关注:'要鲁棒就用 RL、要灵活就用最优控制,但两者难兼得'是机器人控制里一个长期的张力。RGB 提供的是一种分工融合的范式——让擅长鲁棒的负责鲁棒、擅长灵活的负责灵活,而不是逼一种方法同时兼顾两头。这种'RL 当先验引导采样控制'的思路对很多控制问题都有借鉴意义。
影响层面,对做人形/腿足机器人、whole-body 控制、接触丰富操作的人,这是一条值得关注的框架路线:你可以保留已经训好的鲁棒 RL 策略,再通过 MPPI 这一层按需叠加新目标,避免每次需求变化都重训。
局限要标注:MPPI 这类在线采样优化通常计算量大、对实时性要求高,能否在人形机器人的高频控制回路里跑得动是关键的工程约束;融合效果也依赖 RL 先验的质量和模型预测的准确性。论文的验证环境和是否上真机,决定了结论离实际部署有多远,需要看完整论文。