Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Meta restricts use of Claude Code and Codex to keep rival AI out of its training data

Meta 这次限制内部使用 Claude Code 和 Codex,出发点和多数公司封第三方工具正好相反。别的公司怕自家敏感代码从工具里漏出去,Meta 怕的是反方向:对手的东西顺着工具流进来,污染它正在训练的模型。 被保护的对象叫 MetaCode,是 Meta 自研的编程助手,目标是减少对外部工具的依赖、把居高不下的成本压下来,内部文件预计今年在 AI 上的内部开销要以十亿美元计。问题在于,自研模型要变强,最省事的一条路恰恰绕不开对手。 这条路叫蒸馏。从头训练一个强模型极贵,但如果能拿一个现成强模型的输出当'标准答案',成批喂给自己的模型去模仿,就能用低得多的成本把对方的能力复制过来。这在学术上本是正当技术,叫知识蒸馏;可一旦用在竞品身上,性质就变成隔着接口偷师。 危险就藏在日常开发里。工程师随手用 Claude Code 生成一段代码、或让它帮着分析测试任务,这些输出很容易顺着提交、评审的流水线渗进 MetaCode 的训练集,而没人专门盯着。Anthropic、OpenAI、Google 的服务条款都白纸黑字写明:不得用其模型输出构建竞品。所以 Meta 的新政不止是禁用工具,还硬性要求 AI 输出必须经人工审核,不得直接用于生成测试任务或做代码分析。那份内部备忘录措辞很重,说一旦对手的模型输出泄进 Meta 的训练数据,可能引发与合作方的'严重升级'。 把镜头拉开,这远不是 Meta 一家的顾虑。Anthropic 指控阿里巴巴实施了已知规模最大的一次蒸馏攻击;马斯克本人四月就承认,xAI 部分蒸馏过 OpenAI 的模型。头部厂商一边靠对方的 API 提效,一边防着自家管线被对方反向学走,整个行业正滑进互相提防的阶段。 对同时在用 AI 写代码、又在自研模型的公司来说,真正棘手的不是这纸禁令,而是它几乎无法执行。训练数据一旦混合,几乎没法事后把某段能力'是学来的还是自己练的'剥离清楚。禁令挡得住明面上的调用,挡不住能力在模型之间的悄悄扩散。当强模型越来越依赖彼此的输出互相拔高,'原创'和'抄来的'这条线,在模型时代本身就在变淡。