2026-06-26 · 🧠 模型← 本期
Small edits, large models: How Wikipedia advocacy shapes LLM values
大模型的价值取向从哪里来?通常的答案是预训练数据加对齐。这篇论文把镜头对准了一个更上游、也更少被讨论的环节:数据源本身可以被有意塑造,而塑造它的门槛低得惊人。它问的问题很具体——一小群志愿者,仅靠编辑维基百科,能不能改变 AI 系统讨论动物福利的方式?答案是能。
机制的关键在于维基百科在训练数据里的特殊地位。它几乎出现在每一个主流语言模型的训练集中,而且通常被赋予高于普通网络爬取文本的权重——因为它被视为相对可靠、结构化的高质量语料。这种'被优待'恰恰使它成为一个高杠杆的影响点:改动维基百科,等于在多个模型的训练信号里同时撬动了一个被加权放大的来源。
研究对象是 Pro-Animal Wikipedians(PAW),一个动物福利倡导者群体。他们的做法不是破坏或灌水,而是往相关词条里添加'有据可查'(sourced)的动物福利内容——表面上完全符合维基百科的编辑规范。论文的实证结果是:这些编辑可以测量地改变多个主流 LLM 在动物福利话题上的表达倾向。也就是说,一个组织化的小群体,通过完全合规的编辑行为,就在下游模型里留下了可观测的价值印记。
为什么这件事的含义远超动物福利:它揭示的是一条普适的影响通道。任何有组织、有耐心的群体,原则上都能用同样的方式,针对任何话题去塑造维基百科,进而影响一大批共享这个数据源的模型。这不是传统意义上的数据投毒(poisoning)——内容是有来源、合规的——但效果上同样是在向模型注入特定立场。
影响层面,对做数据治理和预训练的人,这指出了一个现实的供应链风险:你的高质量语料越集中、越被信任,它被定向影响的杠杆就越大。对做对齐和安全的人,这是一个新的、上游的影响面——下游再怎么对齐,也很难分辨某个倾向是'世界本来如此'还是'被人有意写进了维基百科'。
局限要诚实标注:论文聚焦动物福利单一话题,效应在其他更有争议、编辑战更激烈的话题上是否同样可控,以及效应的量级有多大、能持续多久,都需要看完整论文。它也不必然意味着恶意——同样的机制既可被用于善意倡导,也可被用于操纵。但它把一个重要事实摆上了台面:训练数据的上游并不是中立的自然存在,而是可以被低成本、有组织地塑造的。