2026-06-23 · 🎛️ 后训练← 本期
Test-Time Training with Next-Token Prediction (TTT-NTP)
先说为什么这条值得停下来看。做长上下文的人都知道一个尴尬:你手里的预训练 checkpoint 已经定型了,想让它在某段超长文档上表现更好,要么重新训、要么换架构,成本都不低。TTT-NTP 给的是另一条路——让模型在读你这段 prompt 的过程中,顺手对自己做一点点"测试时训练(test-time training, TTT)",而且用的监督信号就是模型本来就在用的"预测下一个 token"。换句话说,prompt 里每一个 token 不只是输入,也是一份现成的训练标签。
要理解它的新意,得先看 TTT 这条线此前卡在哪。所谓 TTT,是在推理时临时更新一小撮"快权重(fast weight)",让模型针对当前这段上下文做即时适应。但很多 TTT 架构有个前提:模型得在设计之初就为测试时自适应做过准备,这就限制了它们直接套用到已经发布的 LLM checkpoint 上。后来出现的 in-place(原地) TTT 方法解决了"不重设计 backbone 也能做快权重自适应"这一步,但留下一个核心问题没答:每次快权重写入,到底该存什么?
现有做法是训练快权重去匹配一个"学出来的局部价值代理(local value proxy)"。TTT-NTP 的判断是,这个代理目标和模型真正赖以工作的下一 token 预测信号没有直接挂钩,于是它换了个目标:用模型自身"下一个上下文隐藏状态(next contextual hidden state)"来监督每次更新。具体存的是什么?按原文,价值目标是"对单个下一位置上下文状态的逐点线性投影"。这样一来,每一次局部写入遵循的就是支撑下一 token 预测的那条因果计算,而不是另起炉灶学一个代理。
落到工程上,它把自己定位成 drop-in、可直接挂到已发布预训练 LLM 上的快权重适应方法——这点对实践者最关键,因为不用动 backbone、不用重训主模型,相当于在推理侧加一个轻量自适应模块。
至于效果,原始 arXiv 摘要页给出了一些数字(这部分是从一手页面取到的,selected 素材里原标注为"原文未给具体提升数字",此处以论文页面披露为准):在 RULER 这个长上下文合成基准上,按 4k/8k/16k/32k 几个长度平均,Llama-3.1-8B 约 +3.9、Mistral-7B-v0.3 约 +3.0、Qwen3-4B 约 +4.1、Qwen3-0.6B 约 +2.9;在更贴近真实场景的 LongBench-v2 长文档 QA 上,Llama-3.1-8B 约 +5.6、Mistral-7B-v0.3 约 +3.7。论文同时称该方法能保住常识与知识类任务的表现,也就是长文能力涨的同时不以牺牲基础能力为代价。需要提醒的是,这些是各基准上的相对增量、跨多个模型规模,绝对分值和完整设置仍以论文正文为准。
把它放进坐标系看:这是"测试时训练 / 快权重"这条研究线里偏向落地的一步——卖点不在刷出某个 SOTA 大数字,而在于把一个原本需要专门设计才能用的能力,做成能直接套到现成 checkpoint 上的即插即用方案,门槛被拉低了。
诚实的保留也要说清楚。一是这些增量数字来自论文一手页面而非本期已核的 fact,第三方复现与未污染评测还需观望;二是测试时训练本身会带来额外的推理时计算/延迟开销,摘要层面没有展开它在吞吐和延迟上的代价,关心 serving 的人得看正文的开销分析;三是收益集中在长上下文相关基准上,是否能泛化到更广任务仍待验证。对正在维护长上下文模型、又不想为提点长文能力付重训成本的团队,这是个值得读正文细看的方向。
相关
- 2026-06-23 · 智能体A-Evolve-Training: Autonomous Post-Training of a 30B Model