Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs

如果你在纠结开源权重和控制敏感能力能不能两全,这篇给了一个不太一样的答案。 先说痛点。开源权重的价值在于谁都能下载、研究、部署,但代价是你交出了访问控制权——模型里那些不想随便给人用的能力,公开之后没法再设门槛。业界现在的两条应对路线各有硬伤:一条是发布前就把危险能力压制掉,问题是这既扛不住越狱(jailbreak),又是一刀切——为了防住少数滥用者,把能力给所有正常用户都削了;另一条是干脆不开权重、改成闭源服务,靠专门的模型变体、输入输出监控和 API 权限来中介访问,可这条路和开源这件事根本不兼容。 这篇提出的分级语言模型(TLM)想绕开这个二选一。核心机制是:一套发布出去的权重,内含多个能力档位。在默认的公开配置下,它表现得就是一个常规 LLM,任何人下载到的就是这一档;而一把紧凑的密钥(compact secret key)会指定对一小部分参数的置换(permutation),这个置换在同一份权重之上诱导出一张替代计算图,从而暴露出额外的能力。也就是说,敏感能力不是被删掉了、也不是放在另一个模型里,而是以一种需要密钥才能激活的形式编织进同一套权重。 训练协议是这套设计能成立的关键:作者从零开始联合预训练公开配置与带密钥配置两套,使二者共享权重;之后再在私有数据上微调带密钥的那套,并加正则项,约束它不要破坏公开模型原有的行为。这样公开档的表现尽量不受影响,私有档则承载额外能力。 要客观看的保留也不少。摘要里没有给出任何量化结果——公开档与带密钥档之间的能力差距到底有多大、私有微调对公开行为的影响有多小,都还看不到数字。更关键的安全问题——密钥一旦泄露是否等同于直接发布了高能力模型、攻击者能否在不知道密钥的情况下逆向参数置换撞出隐藏能力、这套机制对蒸馏与微调攻击是否稳健——摘要都未展开。作为安全与对齐方向的新框架,思路有意思,但真正的安全性要看完整论文里的威胁模型与攻击评估。
相关