Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

iLLaDA:8B 掩码扩散语言模型,从零训练的非自回归范式

今天主流 LLM 几乎清一色用自回归分解加因果注意力——一个 token 接一个 token 地预测。iLLaDA 走的是另一条路:掩码扩散(masked diffusion),训练时随机遮住一部分 token,模型用全双向注意力一次性并行恢复,生成阶段则通过多步去噪逐渐填出答案。它的关键不在于'又一个扩散模型',而在于第一次把这条路线从零训练扎扎实实推到了 8B 规模。 背景上,扩散语言模型并不新,前代 LLaDA 已经证明这条路走得通,但规模和质量都不足以让人放下自回归。问题一直是:非自回归到底是个有趣的玩具,还是能在真实 LLM 量级上竞争的范式?iLLaDA 就是冲着这个问题去的。 技术内核上,iLLaDA 的设计是'纯粹':它不在中途切回自回归,而是让掩码扩散目标贯穿预训练和监督微调(SFT)全过程,注意力始终是全双向的。这意味着它放弃了自回归的因果结构带来的训练效率和成熟工程栈,换取的是双向上下文和并行生成的潜力。 关键数字很能说明问题。预训练吃了 12 万亿 token,指令微调再加 250 亿 token。base 版相对前代 LLaDA,BBH 提升 21.6 分、ARC-Challenge 提升 14.9 分;走到指令版,MATH 提升 14.5、HumanEval 提升 16.5。这些不是边际改进,而是跨档位的跃升,说明范式本身还有大量未释放的空间。 影响层面,对不同技术栈的人含义不同。做 serving 的需要注意:扩散生成的并行特性和自回归的 KV cache 优化逻辑完全不同,现有推理栈不一定能直接套用。做 post-training 的则要关注双向注意力下 SFT 和 RL 的范式差异。整体看,它把'扩散能不能当主力 LLM'这个问题从理论争论推到了需要拿数据说话的阶段。 局限也要诚实标注。论文给出的基准提升主要是相对前代 LLaDA 的自比,和顶级自回归模型的横向对比、以及推理速度/成本的实测,需要看完整论文才能下结论。8B 也还没到第一梯队的参数规模,能否继续 scale 是悬而未决的关键。但权重和代码都已开源,社区可以直接上手验证——这本身就降低了它被证实或证伪的门槛。