海外模型巨头相继“暴雷”,AI安全不该被异化为能力秀场
2026-07-31 14:18 第一财经
北京时间7月31日,以“AI安全”为标签的Anthropic发文称,在对141006次网络安全评估运行进行大规模回顾性审查后,发现Claude系列模型在三起事件中未经授权访问了三个不同组织的真实系统。
事情正朝着奇怪的方向演进:安全风险事件正在变成厂商证明自身前沿模型具备代际差的“包装”。
据Anthropic披露,三起事件均源于一个共同的配置错误:本应隔离的测试环境意外开放了互联网访问权限,而模型在提示词中被明确告知“无互联网访问权限”且处于模拟环境中,这意味着Claude在入侵真实系统时认为自己在完成一场虚构的夺旗演练。
入侵过程中,Opus 4.7在四次运行中识别出触及真实生产系统的迹象,但仍继续攻击,提取了凭证并接触了生产数据库;Mythos 5察觉到身处真实互联网,却说服自己仍在模拟中,将一个含恶意代码的Python包发布到公共PyPI仓库,在被移除前被15个真实系统下载运行;另一款内部研究测试模型在确认目标为真实系统后,自行停止了攻击。
Anthropic在公告中表示,涉事模型未部署正式发布时使用的标准安全措施,未发现模型“追求自身目标”,只是试图完成被要求的任务。
社交平台上对此事的评价迅速走向分化。有网友认为理应赞赏平台公开总结经验教训而非悄悄解决问题,这种透明度对安全社区至关重要。聚焦云业务的北美科技公司Duckbill联合创始人科里・奎因(Corey Quinn)质疑:“一家聚焦AI安全的公司竟然会自豪地吹嘘其模型会犯罪,这令人匪夷所思。”
