2026-06-26 · 🧠 模型← 本期
BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents
训练长程(long-horizon)LLM agent 时,怎么把最终的成败信号正确地分配到中间每一步,是个核心难题——这就是信用分配(credit assignment)。一类很流行的做法是逐步分组式 RL(stepwise group-based RL):它不去额外学习一个 critic(价值评估网络),而是对同一情境采样多条 rollout,用它们之间的相对表现来估计每一步的局部优势。这套方法的吸引力在于省事——不用训 critic,直接复用采样就能算出优势。
但这篇论文指出它有一个不那么显眼、却更根本的弱点。所有'分组相对'的估计器都隐含一个假设:被放在一起比较的那些步骤,在信用分配的意义上是等价的、可比的。只有当这个等价性成立时,'用一组 rollout 的相对表现来给某一步打分'才合理。而论文展示,在真实的 agentic 任务里,这个假设经常不成立——被比较的步骤所处的状态、可达的后续、面临的选择可能根本不同,强行把它们当等价来做相对估计,会给出系统性偏差的信用分配。
BiPACE 的解法引入了两个概念。一是双模拟(bisimulation)引导的策略优化:双模拟是强化学习里衡量'两个状态是否在行为上真正等价'的严格判据——两个状态双模拟等价,意味着它们在任意动作下导出的奖励和后续转移分布都一致。用它来引导,相当于给'哪些步骤才真正可比'立了一个原则性的标准,而不是默认全都可比。二是动作反事实估计(action counterfactual estimation):估计'如果当时换一个动作会怎样',以此更准确地剥离出某个动作本身的贡献。
为什么值得关注:随着 agent 任务越拉越长,信用分配的误差会沿着轨迹累积放大,地基上的一点偏差到末端可能就是训练不收敛或学到错误策略。这篇没有停留在'换个 reward'的层面,而是去质疑分组相对估计最底层的可比性前提——这是对当前主流 agent RL 范式的一个结构性诊断。
影响层面,对正在用 GRPO 类、group-based 方法训练多步 agent 的人,这篇提醒:你的优势估计可能在悄悄地把不可比的步骤当可比,BiPACE 提供的是一条用双模拟来收紧可比性的思路。
局限需标注:双模拟在大规模、高维 LLM 状态空间里如何近似计算、引入多少额外开销,以及反事实估计的准确性如何保证,是这类方法的常见难点,具体效果和代价要看完整论文的实验。