Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

机制可解释性(mechanistic interpretability)有一个很有吸引力的终极愿景:可控性。逻辑听起来天衣无缝——如果我们能在模型的激活空间里定位到某个行为(比如说真话、有害倾向、某种风格)被表示在哪里,那我们就应该能通过修改那个方向来控制这个行为。激活引导(activation steering)、表示工程(representation engineering)这一整套技术都建立在这个直觉上。 但这篇论文指出,这个愿景依赖一个几乎从未被明说、更从未被检验的隐藏前提:检测某个行为的方向,和控制这个行为的方向,是同一个,或者至少彼此很接近。只有当这个前提成立时,'我找到了表示某行为的方向'才能顺理成章地推出'我可以用这个方向去改变这个行为'。论文要做的,就是把这个被默认为真的前提拎出来,用几何方法严格地测一测。 核心发现非常反直觉,也很干净:完美的检测可以和失败的操控并存。具体说,存在这样的方向——用它来探测(probe)某个行为,分类准确率可以做到极高,几乎完美地'读出'模型当前是否在表现这个行为;但当你沿着同一个方向去干预激活、试图'写入'或'抹掉'这个行为时,操控却失败了。检测方向和控制方向在几何上并不重合。 为什么这件事重要:它戳破的是 interpretability 领域一个流传很广的隐含等式——'看得见'等于'改得动'。大量工作用探测分类器的高准确率来论证'我们理解了模型在哪里表示了 X',并暗示这种理解能转化为控制力。这篇说明,探测的成功并不保证操控的成功,二者是可以解耦的。一个方向能区分两类状态,不代表推动这个方向就能让模型从一类变到另一类。 影响层面,对做激活引导、表示工程、概念擦除、安全干预的人,这是一个需要重新校准的预期:不能因为某个方向能高精度检测出有害行为,就默认能靠它来抑制有害行为。检测和控制需要分别验证,不能从前者外推到后者。 局限要标注:这是一篇偏理论与几何分析的工作,结论的强度取决于它在哪些模型、哪些行为类型上做了验证,以及'检测'与'控制'的具体操作化定义,需要看完整论文。它指出的是一个普遍存在的解耦风险,但并不意味着所有方向都不可控——具体哪些行为的检测方向恰好也可控、哪些不可控,仍是开放问题。