Claude Opus 5刷新提示注入防御纪录,15次围攻成功率仅2%
2026-08-11 10:27 freebuf

Gray Swan IPI 基准测试(2026 年第一季度)中的间接提示注入攻击(来源:Anthropic)
Gray Swan IPI基准测试(2026年第一季度)中的间接提示注入攻击
与非Claude系统的差距更大。Muse Spark是测试中表现最强的非Claude模型,其在15次尝试内的成功率为16.5%。
这一数值是Opus 5报告成功率的八倍以上。GPT 5.6 Sol被描述为能力最强的变体,其成功率达到了20.0%,接近GPT 5.5的20.8%。
Claude Opus 5的系统卡报告称,Sol被成功攻击的可能性是Opus 5的十倍。GPT-5.6 Terra和Luna的攻击成功率更高,分别为30.4%和43.9%。
单次尝试的对比同样值得注意。对GPT 5.6 Sol的单次攻击尝试成功率为3.1%。这一数字超过了Opus 5的2.0%成功率——后者是在15次尝试后才达到的值。
这一对比表明,Opus 5的防护机制能够更有效地抵御反复的对抗性提示。然而,基准测试分数不应被视为对现实世界安全性的完整衡量标准。
Part03
企业分层防御
对于安全团队而言,这些结果强化了围绕AI部署建立分层防御的必要性。组织应继续将可信指令与不可信数据分离,限制工具权限,对敏感操作要求确认,并监控Agent的活动。
基准测试的领先地位固然有用,但并不能使提示注入变得不可能。攻击者可以改变载荷、利用工作流弱点,并针对集成环节而非仅针对模型本身发起攻击。
关键的操作性问题在于,AI系统在遇到恶意内容时能否安全地失败。Opus 5的结果显示出有意义的进展,但企业仍需负责构建安全架构、进行测试和应急响应。
