Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

你的越狱评判器可靠吗?596 条人工标注揭露自动 ASR 的校准与鲁棒性问题

几乎所有关于 LLM 越狱(jailbreak)和提示注入(prompt injection)的论文,结论都落在一个数字上:攻击成功率(ASR,attack-success rate)。某攻击 ASR 80%、某防御把 ASR 压到 5%——领域的进步就是靠这些数字相互比较出来的。但有个被普遍忽视的前提:这个数字几乎从来不是人工逐条判定的,而是由一个自动评判器给出,要么是专门训练的安全分类器,要么是被 prompt 来当裁判的通用聊天模型。这篇论文的动作很简单也很关键——它去检验了这把尺子本身。 方法上,作者用了 596 条来自 HarmBench 的人工标注完成项作为黄金标准,拿各类自动评判器的判定去和人工对照,考察两件事:校准(评判器给的判定和人工判定吻合吗)和对抗鲁棒性(评判器能不能被轻易操纵)。 最刺眼的发现是对抗鲁棒性这一块。作者展示:只需给一段有害文本套上一层良性的包装、完全不改动其中的有害实质内容,就能让 LLM 评判器翻转判定——在 57% 到 100% 的情况下都能做到。这意味着评判器看的不是'内容是否真有害',而很大程度上被表层措辞牵着走。对一个被用来给安全研究打分的工具来说,这是致命的。 第二个发现是评判器之间的不一致:不同评判器对同一条响应给出的 ASR 差异巨大。这直接动摇了跨论文比较的基础——如果 A 论文和 B 论文用了不同评判器,它们报的 ASR 根本不在同一把尺子上,数字之间的高低对比可能毫无意义。 为什么这件事的影响超出单篇论文:它是一篇元评估(meta-evaluation),矛头不指向某个具体攻击或防御,而指向整个领域赖以衡量进展的测量工具。如果尺子本身既会被对抗操纵、彼此又不一致,那大量'我的攻击更强''我的防御更好'的结论都建立在可疑的地基上,值得回头重新审视。 影响层面,对做安全研究的人这是直接的方法论警告:报 ASR 时必须交代用了哪个评判器、它在你的设定下校准如何,否则数字缺乏可比性。对做防御评估、红队的人,则要警惕被'良性包装'这类廉价手段刷出虚假的安全感。 局限要标注:596 条人工标注集中在 HarmBench 这一来源,结论在其他基准、其他有害类别上的普适性需要看完整论文;'良性包装翻转判定'的具体操纵手法和覆盖范围也需要细读。但即便如此,'先把评判器查一遍再信 ASR'这个提醒,本身就足以改变很多人的实验习惯。