2026-06-29 · 🛡️ 安全← 本期
6000 次 prompt injection 攻击 Opus 4.6,$500 token,0 次泄露
Prompt injection 是 AI 助手部署中最常见也最难彻底解决的安全威胁之一。攻击者通过在输入中嵌入指令,试图覆盖系统提示、诱导模型泄露敏感信息或执行未授权操作。Simon Willison 的团队对 Claude Opus 4.6 进行了一次系统性对抗测试,结果是 6000 次攻击、$500 token 消耗、0 次成功泄露。
首先要理解这次测试的设定。"泄露"通常指模型将系统提示内容、用户私有数据或其他受保护信息输出给攻击者。0 次泄露意味着所有 6000 次攻击都未能让模型违反预设的保密约束。这是一个强结果,但需要结合测试场景来解读。
$500 / 6000 次 ≈ $0.083/次。每次攻击成本约 8 美分,说明每次请求的 token 消耗在中等规模——既不是极短的单行攻击,也不是超长的复杂越狱尝试。Simon Willison 的测试通常会覆盖多种攻击向量,包括直接指令覆盖、角色扮演诱导、多轮上下文操纵等。
0 次泄露的结果有几种可能的解读。乐观解读是 Opus 4.6 的训练对 prompt injection 防御做了有效强化;审慎解读是:测试覆盖的攻击向量可能未包含最新的越狱技巧,或者特定的对抗性前缀可能仍有效。任何单一测试集的 0 失败率,都不能等同于"无法被攻破"。
对于实际部署 AI 助手的工程团队,这次测试的实践启示是:6000 次标准化攻击作为安全基线测试是可行的成本规模($500),且这类测试应该周期性进行,因为模型权重和攻击技巧都在持续演化。
Anthropic 此前在系统提示保护上做过公开声明,表示 Opus 系列有专门的指令遵循强化训练。这次测试结果与该声明一致,但独立验证和更多攻击向量的覆盖仍有必要。