Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

循环语言模型的'读出盲区':密集监督不够用

循环语言模型(looped language models)是近年权重共享、深度可变方向的一个重要分支:它把隐状态当成运行时状态,每一步既解码出预测、又把状态喂回未来的计算,相当于让同一组权重'循环'多次来加深有效推理深度。一个看似理所当然的假设是——既然每一轮都加了交叉熵监督,那训练信号应该覆盖了所有状态变量。这篇论文要拆的就是这个假设。 核心论断是:密集的逐层交叉熵,实际只控制了'读出'(readout)这一步暴露给预测的那些变量,而不是每一轮计算里真正活跃的全部隐状态。换句话说,监督信号有个结构性的视野盲区——它管得到能直接读出来的东西,管不到那些在循环内部流转、但没被读出暴露的隐状态。作者把这叫'读出盲区'(readout blind spot)。 这个盲区不是纯理论担忧,它有可观测的后果。论文给出的硬证据是:在标准训练下,44M 和 129M 参数的循环 transformer,隐状态的范数会膨胀到数千甚至上万的量级。范数失控通常意味着数值不稳定、表示退化,而密集监督对此完全'看不见'——因为爆炸发生在它管不到的盲区里。 为什么这件事重要:循环/权重共享是用更少参数换更深推理的诱人方向,但如果标准训练范式本身存在监督盲区,那很多基于它的结果可能建立在不稳定的地基上。这篇等于指出,'每轮都加监督'给人的安全感是假的。 他们的修法是 scale-visible 读出加上范数惩罚:让更多状态对监督可见,并直接对范数施加约束。结果是在匹配推理深度的条件下拿到更低困惑度——说明压住盲区不只是'更安全',还能转化为实际的建模质量提升。 局限上,实验规模停在 44M/129M,是否在更大模型上同样显著、修法的额外开销有多大,需要看完整论文。但对正在做循环 transformer、Universal Transformer 类架构或任何权重共享深度循环结构的人,这篇提出的诊断本身就有直接的实操价值:先去看看你模型的隐状态范数是不是已经在悄悄爆炸。