2026-06-26 · 🧠 模型← 本期
Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding
推测解码(speculative decoding)是当下提升 LLM 推理吞吐的主力技术之一。它的核心思路是分工:用一个小而快的草稿模型先一口气草拟出一串候选 token,再让大模型一次性并行验证这串 token 是否都符合自己的分布——验证一串比逐个生成快得多,被接受的部分就直接采纳。在很多场景下这能显著提速。
但这篇论文指出,在多 batch、长上下文的场景下,推测解码的效率被一个特定瓶颈卡住了:验证阶段的延迟被 KV cache 加载所主导。KV cache 是注意力机制缓存的键值对,上下文越长它越大;当大模型要并行验证一串草稿 token 时,得把这块巨大的 KV cache 加载进来,而在长上下文 + 多 batch 下,这个加载开销大到盖过了推测解码本该带来的收益。换句话说,省下来的生成时间,被验证时的访存又吃回去了。
直觉上的解法是压缩 KV cache,减少要加载的量。但论文指出现有压缩方法在这个特定 regime 下都失灵。静态淘汰(static eviction,预先决定丢弃哪些 token 的缓存)会掉精度,原因是'重要性会漂移'(saliency shift)——某个 token 此刻看着不重要、被丢了,后面却可能变得关键,静态决策抓不住这种动态变化。动态方法则有它自己的代价(论文摘要在此处被截断,但已点出动态方案同样不理想)。
Dustin 的解法是把草稿增强的稀疏验证(draft-augmented sparse verification)和推测解码结合起来,专门打这个验证瓶颈。核心是让验证变得稀疏——不是加载完整 KV cache 去验证,而是借助草稿信息来稀疏地、有选择地验证,从而砍掉验证阶段最沉重的访存开销,同时尽量不牺牲推测解码的接受率和正确性。
为什么值得关注:长上下文推理正变得越来越普遍(长文档、长对话、长 agent 轨迹),而推测解码是这个场景下的关键加速手段。如果验证瓶颈不解决,推测解码在长上下文下的收益就会大打折扣。Dustin 针对的正是'长上下文 + 推测解码'这个具体且日益重要的交叉点。
影响层面,对做推理引擎、推理加速、长上下文 serving 的人,这是一条值得关注的优化路线:它不试图替换推测解码,而是补上它在长上下文多 batch 下的短板,属于可叠加的工程改进。
局限要标注:稀疏验证天然要在'省访存'和'保接受率/正确性'之间权衡,稀疏得太狠可能让验证漏判、拉低接受率甚至影响输出质量,具体的质量-速度权衡曲线需要看完整论文的实测。它的收益也高度依赖上下文长度和 batch 规模,在短上下文场景下未必有优势。