Claude Opus 5刷新提示注入防御纪录,15次围攻成功率仅2%
2026-08-11 10:27 freebuf

Part01
提示注入风险
Anthropic的Claude Opus 5在其System Card(系统卡)中提供的测试结果中,创下了Gray Swan最新基准测试中Indirect Prompt Injection(间接提示注入)攻击成功率的最低纪录。
该模型将攻击者在15次尝试内的成功率降至2.0%。这一结果使Opus 5领先于所有接受测试的其他模型,包括更早的Claude版本以及竞争性的前沿系统。
这一发现凸显了业界对间接提示注入日益增长的关注。这是一种安全问题,可能影响连接到文档、网站、电子邮件和业务工具的AI Agent。
间接提示注入是指恶意指令被隐藏在AI系统随后读取的不可信内容中。被投毒的网页、文档或消息可能会试图覆盖用户的任务、泄露敏感信息或触发不安全操作。
当模型能够使用工具、检索数据或在企业环境中执行操作时,危险程度会进一步增加。仅靠强大的模型行为并不能消除风险,但可以降低恶意指令成功改变Agent决策的可能性。
Part02
模型基准表现对比
在IPI基准测试中,Opus 5相比Claude Opus 4.8有了显著提升。其15次尝试的攻击成功率从5.5%降至2.0%。在单次尝试场景下,该比例从0.5%降至0.2%。
这些结果也超越了Claude Sonnet 5和Claude Mythos 5:前者在15次尝试中的成功率为5.9%,后者为2.6%。Anthropic表示,Opus 5是该基准测试条件下评估过的最稳健的模型。
