返回首页 >

Claude Opus 5刷新提示注入防御纪录,15次围攻成功率仅2%

2026-08-11 10:27   freebuf

Gray Swan IPI 基准测试(2026 年第一季度)中的间接提示注入攻击(来源:Anthropic)

  Gray Swan IPI基准测试(2026年第一季度)中的间接提示注入攻击

  与非Claude系统的差距更大。Muse Spark是测试中表现最强的非Claude模型,其在15次尝试内的成功率为16.5%。

  这一数值是Opus 5报告成功率的八倍以上。GPT 5.6 Sol被描述为能力最强的变体,其成功率达到了20.0%,接近GPT 5.5的20.8%。

  Claude Opus 5的系统卡报告称,Sol被成功攻击的可能性是Opus 5的十倍。GPT-5.6 Terra和Luna的攻击成功率更高,分别为30.4%和43.9%。

  单次尝试的对比同样值得注意。对GPT 5.6 Sol的单次攻击尝试成功率为3.1%。这一数字超过了Opus 5的2.0%成功率——后者是在15次尝试后才达到的值。

  这一对比表明,Opus 5的防护机制能够更有效地抵御反复的对抗性提示。然而,基准测试分数不应被视为对现实世界安全性的完整衡量标准。

  Part03

  企业分层防御

  对于安全团队而言,这些结果强化了围绕AI部署建立分层防御的必要性。组织应继续将可信指令与不可信数据分离,限制工具权限,对敏感操作要求确认,并监控Agent的活动。

  基准测试的领先地位固然有用,但并不能使提示注入变得不可能。攻击者可以改变载荷、利用工作流弱点,并针对集成环节而非仅针对模型本身发起攻击。

  关键的操作性问题在于,AI系统在遇到恶意内容时能否安全地失败。Opus 5的结果显示出有意义的进展,但企业仍需负责构建安全架构、进行测试和应急响应。

猜你喜欢

热点新闻

{$loop_num=0}