2026-06-26 · 🧠 模型← 本期
Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing
测试时扩展(test-time scaling)是提升语言模型推理能力的一条重要路径:不改模型权重,而是在推理阶段多花算力——多想、多采样、多搜索——来换取更好的答案。它已经被证明能显著提升推理质量,但论文指出现有的实现方式都卡在一个两难里。
一头是长链式思维(long chain-of-thought)采样:让模型生成一长串推理过程。它的问题是单线程(single-threaded)——推理沿着一条链顺序展开,无法并行,想多探索几条路只能串行地一条条来,效率受限。另一头是句子级或解法级的搜索:在更粗的粒度上分叉、探索多个候选(比如生成多个完整解法再择优)。它能并行探索,但代价是计算昂贵,而且这种粗粒度的搜索结构很难端到端训练(hard to train end-to-end)——搜索的离散决策和模型的梯度优化难以打通。
于是矛盾很清楚:要么单线程但好训,要么能并行探索但贵且难训。LBR(Local Branch Routing,局部分支路由)的思路是把扩展的粒度下沉到 token 级别。它不是在句子或解法这种粗粒度上分叉,而是在 token 这个最细的粒度上做局部的分支路由——在生成过程中的合适位置进行局部分叉,并由一个可训练的路由机制决定怎么分、怎么走。
这个设计的用意是同时避开两头的硬伤。token 级的局部分支,意味着探索可以更精细、更灵活,不必像长 CoT 那样被锁死在单一线程上;而'可训练'(trainable)这个关键词意味着它把分支路由设计成了能端到端学习的组件,从而绕开了粗粒度搜索难训练的问题。换句话说,LBR 想要的是既有并行探索的好处,又能像普通模型一样被端到端优化。
为什么值得关注:test-time scaling 是当前 reasoning 模型提升能力的主战场之一,而'怎么在推理时更高效地花算力'是核心问题。现有方法在'好训'和'能并行/可控成本'之间二选一,LBR 提出在 token 这个更基础的粒度上重新设计扩展机制,试图破开这个二选一。粒度选择本身就是一个有意思的设计维度——把扩展从宏观(解法)推到微观(token)。
影响层面,对做推理增强、test-time scaling、reasoning 模型训练的人,这提供了一个新的设计点:与其在解法级别做昂贵的搜索,不如考虑在 token 级别做可训练的局部分支,或许能在成本和效果间找到更好的折中。
局限要标注:token 级分支路由的实际计算开销、它带来的推理质量提升相对长 CoT 和解法级搜索到底有多大、以及'可训练'在多大训练成本下能学好这个路由,都是决定它实用性的关键,需要看完整论文的实验对比。更细的粒度也可能带来更复杂的控制和更碎的探索,是否真比粗粒度搜索更优,仍需数据说话。