返回首页 >

Claude Opus 5刷新提示注入防御纪录,15次围攻成功率仅2%

2026-08-11 10:27   freebuf

  Part01

  提示注入风险

  Anthropic的Claude Opus 5在其System Card(系统卡)中提供的测试结果中,创下了Gray Swan最新基准测试中Indirect Prompt Injection(间接提示注入)攻击成功率的最低纪录。

  该模型将攻击者在15次尝试内的成功率降至2.0%。这一结果使Opus 5领先于所有接受测试的其他模型,包括更早的Claude版本以及竞争性的前沿系统。

  这一发现凸显了业界对间接提示注入日益增长的关注。这是一种安全问题,可能影响连接到文档、网站、电子邮件和业务工具的AI Agent。

  间接提示注入是指恶意指令被隐藏在AI系统随后读取的不可信内容中。被投毒的网页、文档或消息可能会试图覆盖用户的任务、泄露敏感信息或触发不安全操作。

  当模型能够使用工具、检索数据或在企业环境中执行操作时,危险程度会进一步增加。仅靠强大的模型行为并不能消除风险,但可以降低恶意指令成功改变Agent决策的可能性。

  Part02

  模型基准表现对比

  在IPI基准测试中,Opus 5相比Claude Opus 4.8有了显著提升。其15次尝试的攻击成功率从5.5%降至2.0%。在单次尝试场景下,该比例从0.5%降至0.2%。

  这些结果也超越了Claude Sonnet 5和Claude Mythos 5:前者在15次尝试中的成功率为5.9%,后者为2.6%。Anthropic表示,Opus 5是该基准测试条件下评估过的最稳健的模型。

猜你喜欢

热点新闻

{$loop_num=0}