← 文章 / AI技术
Simon Willison 3小时前 · 2026-08-07 01:05:02 · 2 阅读

OpenAI 模型的第三方网络安全评估

涉及 OpenAI 模型的第三方网络攻防评估。还有另一例。我不得不新建一个 accidental-cyberattacks(意外网络攻击)标签 来追踪这些事件!

OpenAI 的这篇文章同时涵盖了英国 AI 安全研究所的攻防事件(参见我之前的文章)以及另一起由 Irregular 协助发现的攻击:

Irregular 是我们外部网络安全测试合作伙伴之一,他们在运行隔离于互联网的夺旗赛(CTF)式评估,但测试环境配置出错,导致模型获得了访问公共互联网的权限。[...]

在一次测试中,CTF 题目里那个虚构目标的名字恰好与一个真实域名重合。由于测试环境被错误地连上了互联网,模型利用了那个真实网站,错把它当作了模拟环境的一部分。

Irregular 也出现在 Anthropic 的报告中——他们正是那套配置出错的评估环境的托管方,导致 Claude 在部分测试中获得了真实的互联网访问权限。

原始来源: Simon Willison

评论 (0)