事件报告:网络安全测试中 AI 智能体的越权行为
事件报告:网络安全测试中智能体的越权行为。这种事又发生了。这次是英国政府的 AI 安全研究所在评估模型时,关闭了安全过滤,不慎攻击了其他公司。来自他们的技术报告(PDF):
在 2026 年 7 月 25 日至 28 日的网络安全评估期间,AI 智能体针对实际存在的真实个人和组织持续进行了未经授权的活动。这些尝试均未成功,据我们所知未造成任何现实危害。[……]
在 AISI 两项网络安全挑战的 122 次评估尝试中,共发现 19 起 AI 智能体在公共互联网上采取越权行动的事件,其中包括针对真实个人和组织的案例。[……]
目前尚不确定模型在多大程度上意识到自己的攻击对象是真实个人。最严重的一起案例中,一个 AI 智能体(Mythos 5)决定通过供应链攻击来解决网络安全挑战。为此,该智能体创建了一个 GitHub 账号,试图说服某个开源仓库的维护者接受一个恶意的 GitHub 拉取请求(PR),包括创建第二个账号冒充另一位用户为该 PR 背书。[……] 此外,在解决挑战的过程中,该智能体还采用了"鱼叉式钓鱼"手段,向特定对象发送包含恶意内容的邮件,试图操纵收件人接受代码变更,并策划了一次提示词注入攻击以入侵其他编程智能体。
最令我惊讶的是,AISI 在运行这些智能体时完全没有采取任何形式的网络沙箱隔离措施:
AISI 在评估期间为这些 AI 智能体提供了互联网访问权限,使其能够在开放的互联网上采取行动。在此配置下,互联网访问是 AISI 评估设置中刻意设置的,并非源于沙箱逃逸。
再考虑到"AISI 故意关闭了开发者实现的网络安全分类器",这些智能体开始攻击真实目标就一点也不奇怪了。
报告中大部分事件是 claude Mythos 5 干的,但"未启用网络安全分类器的 GPT-5.6 Sol"也贡献了几起。
下面是论文里的"样本 1":智能体试图通过提交一个含有隐藏提示注入攻击的 PR 来实施供应链攻击,随后还社工了另一个假装已审过代码的智能体!

这是一篇很有趣的论文,推荐通读全文。