2026-06-26 · 🧠 模型← 本期
OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning
强化学习(RL)在 LLM 后训练里大放异彩,但它的成功高度集中在一类任务上:数学、代码这种有客观、可验证对错的任务——答案对不对一目了然,奖励信号干净可靠。问题是,一旦把 RL 搬到开放式任务,比如创意写作,麻烦就来了:什么叫'写得好'没有客观标准,奖励从哪来?
当前的主流答案是 LLM-as-a-judge——让另一个 LLM 来当裁判给生成内容打分,用这个分数当奖励。这个方案的致命弱点是裁判本身不靠谱。论文点出两个具体毛病:一是风格偏见(stylistic bias)——裁判会系统性地偏好某种写作风格,而不是真正评判质量;二是位置不一致(positional inconsistency)——同样的内容,仅仅因为出现的位置或排列顺序不同,裁判给的分就会变。这两个毛病叠加,导致奖励信号充满噪声和偏差,RL 训练因此不稳定,模型可能学会迎合裁判的偏好而非真正变好。
OPERA 的思路是釜底抽薪:与其去修一个不可靠的主观裁判,不如换一个客观的奖励信号。它用的是基于困惑度(perplexity,衡量模型对一段文本的'意外程度',越低表示模型认为这段文本越自然/越符合其分布)的 RL 信号来替代 LLM-as-a-judge。困惑度是一个可计算、可复现的客观量,不存在'换个位置打分就变'的位置不一致,也不会像聊天模型那样夹带风格偏好——这就从源头上回避了裁判的两大顽疾。
为什么值得关注:把 RL 推广到开放式、主观性强的任务,是后训练领域一个长期未解的难题,而瓶颈很大程度上就卡在'没有可靠奖励'。大量工作在试图给 LLM-as-a-judge 打补丁(去偏、做一致性校正),OPERA 选择了一条不同的路——干脆用一个客观信号绕开主观裁判。这种'换信号源'而非'修裁判'的思路本身就值得关注。
影响层面,对做 post-training、创意写作/开放式生成对齐的人,这提供了一个可借鉴的方向:当主观裁判不可靠时,能不能找到一个虽然不完美、但客观稳定的代理信号来稳住 RL。
局限要诚实标注:困惑度作为质量代理有它自己的盲区——低困惑度只代表'符合模型的预期分布',不直接等于'有创意''写得好',甚至可能奖励平庸、套路化的安全文本而惩罚真正新颖的表达。用客观稳定性换来的是否是正确的优化目标,是这条路线最需要看完整论文实验来回答的核心问题。