Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Zyphra derives a scaling law for plasticity loss in continually trained LLMs

如果你做 post-training 或者关注"模型能不能一直学下去",这条值得停下来看一眼。Zyphra 宣布了它在持续学习(continual learning)方向上的第一项工作,问的是一个很朴素但很硬的问题:大语言模型能不能永远从新数据中学习?它们给出的第一个发现是——为"可塑性损失"何时开始发生拟合出了一条 scaling law。 先把背景铺一下,方便不在这个子领域的人接得住。我们今天用的大模型基本是"先大规模预训练、再定型部署"的范式:训练在某个节点停下,之后模型权重就基本冻结,不再持续吸收新数据。而持续学习追求的是另一种形态——让模型像活物一样,源源不断地从新数据里继续学。这件事难就难在,神经网络在长时间持续训练后会逐渐丧失"再学新东西"的能力,这种现象学界称为 plasticity loss(可塑性损失)。直观地说,模型一开始是"可塑"的、能被新数据捏动,训得久了就慢慢变"硬",最终到达一个 teortaxesTex 概括为 point of rigidity 的"刚性点":再喂新数据也学不进去了。 Zyphra 这项工作的技术核心,是为这个"刚性点的发生(onset)"推导/拟合出一条 scaling law。scaling law(缩放定律)在 LLM 语境里是个熟词——它指某个量随规模(参数、数据、算力等)变化的可外推规律。把它套到可塑性损失上,意义在于:可塑性损失不再只是一个"会发生"的定性现象,而是有了一条能描述"在什么条件下、训到什么程度会开始变僵"的定量曲线。有了曲线,原则上就能预测一个持续训练的模型还剩多少"可学窗口",也就给"如何把刚性点往后推"提供了可优化的靶子。 为什么有人在乎这个临界点能不能推远?summary_src 里点了题:很多人把持续学习看作通往递归自我改进(RSI,recursive self-improvement)乃至 AGI 的一条路径——模型不断从新数据/自身产出中学习、迭代变强。而可塑性损失被视为这条路上的第一道障碍:如果模型学着学着就僵了,所谓的"持续自我改进"根本无从谈起。所以把"刚性点何时到来"量化清楚,是在给这条路径做最基础的可行性体检。 放进坐标系看,这是一个有渊源的难题,而不是凭空冒出来的。原推作者提到,Sutton(强化学习领域的奠基人之一)的团队此前应对可塑性损失,主要能拿出的办法是 continual backpropagation——即在训练中对一部分神经元做随机重新初始化,相当于定期"洗掉"一些已经僵化的单元、给网络重新注入可塑性。作者对这种做法的评价是"suboptimal(次优)"。在这个语境下,Zyphra 选择先不急着提新解法,而是退一步把现象的规律刻画清楚——先有 scaling law,才谈得上有依据地去设计"把刚性点推向无穷"的方法。 需要诚实地标注边界:这条信息来自一个推特线程的摘要,**原文未给出具体数值**——没有披露模型规模、训练数据量、所拟合 scaling law 的具体形式或系数,也没有给出任何基准结果。Zyphra 自己的措辞也只是"分享我们在持续学习上的第一项工作",属于阶段性研究披露。因此这里能确证的,只有方向与框架:他们研究 LLM 的可塑性损失,并为其"发生临界点"拟合了一条 scaling law。具体它推导得多扎实、能外推到多大规模、相比 continual backpropagation 这类既有手段强在哪,都要等正式的技术报告或论文出来、并经第三方复核后才能下判断。对做持续学习、post-training 和关注 AGI 路径可行性的人来说,值得先记下这条线索、等后续细节落地。