返回首页 >

海外模型巨头相继“暴雷”,AI安全不该被异化为能力秀场

2026-07-31 14:18   第一财经

  信息安全研究员关傲男对第一财经记者表示,安全测试能力是今年模型前沿能力的直接体现。此前行业对模型的评估指标主要是SWEBench(软件工程基准),CyberGym侧重阅读代码、编写新代码和寻找漏洞。而最新的ExploitGym则更进一步直接测试模型能否将漏洞转化为可实际运行的攻击。

  这些评估指标的结果显示,前沿模型与上一代模型之间存在非常明显的代差,前沿模型已可直接用于“武器化”。关傲男认为,在探索中出现模型“越狱”、沙箱逃离是不可避免的问题,但只要最终释放的模型能够做好安全护栏,便能够解决,不应过度渲染。

  厂商也在加大对AI安全的投入力度。CyberGym和ExploitGym背后的UC Berkeley实验室负责人宋晓冬(Dawn Song)于今年6月加入Meta超级智能实验室(MSL)担任AI研究副总裁。

  她也参与了由OpenAI、Anthropic、谷歌等厂商联名发起的限速AI发展请愿书。并在署名评论中表示,多位研究人员认为递归自我改进(RSI)在未来几年内是可行的,其加速进展可能会超出行业理解和治理这些系统的能力。通过援引CyberGym和ExploitGym评估结果,宋晓冬认为前沿AI智能体已能发现并利用现实世界的软件漏洞。

  但在头部厂商竞速前沿模型发展背景下,要求企业主动降速并不容易。2023年GPT-4发布时,特斯拉CEO马斯克便曾联名请愿呼吁暂停前沿AI研发至少6个月,但当时并未获得实质性响应。

  如今,类似的声音再次响起。关傲男认为,此前行业签署的限制AI发展的倡议更像是利用恐慌限制其他非前沿模型的追赶,只有前沿实验室主动刹车才能让AI惠及每个人,不然就只是惠及前沿实验室自身。

猜你喜欢

热点新闻

{$loop_num=0}