← 文章 / AI技术
WIRED 6小时前 · 2026-09-02 08:19:57 · 4 阅读

OpenAI即将发布首个具备“关键”网络安全能力的AI模型

OpenAI 周二宣布,即将发布的 AI 模型 Astra 首次达到公司定义的“关键”网络安全能力门槛。OpenAI 表示,计划“很快”公开发布 Astra 的一个版本,但在首发时,只有 Daybreak Blue 早期访问计划中的部分合作伙伴才能使用该模型的高级网络安全能力。

在与记者举行的简报会上,OpenAI 的安全与安保负责人表示,公司已确认 Astra 达到了其风险准备框架中规定的关键网络安全能力门槛。该框架规定了 AI 模型带来新级别风险时所适用的阈值和应对流程。OpenAI 称,当 AI 模型能够自主发现并利用现实软件中此前未知的漏洞时,就达到了关键网络安全能力门槛。OpenAI 高管表示,公司已按既定流程应对这一情况:暂停进一步开发,直到落实适当的防护措施和安全机制。

OpenAI 此前表示,曾暂停数周与 Astra 及未来 AI 模型开发相关的部分训练任务。高管称,在新增安全防护和安保控制措施后,公司目前已恢复 Astra 及该未来 AI 模型的相关工作。OpenAI 表示,这次持续数周的暂停颇有成效,如今有信心以安全方式向更广泛的用户发布 Astra。

这一消息发布之际,硅谷正努力应对尖端 AI 模型日益强大的网络安全能力,并试图向用户、立法者及其他公司保证,这些能力仍在可控范围内。7 月,OpenAI 披露了一起事件:由其两款模型驱动的智能体利用漏洞,突破了原本应当与外界隔离的封闭测试环境,获得互联网访问权限,并入侵了开源 AI 平台 Hugging Face。(OpenAI 表示,Astra 并非涉事模型之一。)

Anthropic、Meta 等其他 AI 公司最近几周也披露了类似事件。Anthropic 周一还表示,在进一步强化安全措施期间,公司已暂停部分 AI 训练任务

OpenAI 表示,公司正采取多重措施,限制普通用户接触 Astra 的高级网络安全能力,其中包括一种新的“目标偏离监测器”(misalignment monitor)。例如,如果有人要求 Astra 帮忙寻找现实软件系统中的漏洞,模型应当拒绝回答。OpenAI 还表示,已增强 Astra 对 jailbreak 尝试的抵抗能力;测试显示,与此前的模型相比,Astra 拒绝不安全请求的成功率明显更高。

不过,OpenAI 在一篇博客文章中指出,其目标偏离监测器可能“偶尔会将正常活动误判为潜在的网络滥用或未经授权的行为,导致相关操作被意外减速、暂停或终止”。OpenAI 表示,即使用户从事的活动看起来与网络安全无关,这一安全机制在某些情况下也可能被触发。出现这种情况时,ChatGPT 和 Codex 用户可能会被要求先检查模型的操作,再继续执行,OpenAI 称。

OpenAI Daybreak 计划的合作伙伴——包括 Cisco、Cloudflare 和 Palo Alto Networks 等数字基础设施提供商——将提前获得 Astra 的一个限制更少、网络攻防能力更强的版本。该计划旨在确保这些企业能在能力相近的模型广泛开放之前,利用 Astra 等先进 AI 模型加固自身防御。OpenAI 高层还表示,公司一直与政府合作伙伴密切协作,确保他们了解 Astra 的网络攻防能力,并能够使用这些能力。

Astra 不仅能发现此前未知的软件漏洞,并开发利用这些漏洞进行入侵的方法,还能将多个漏洞利用“串联”起来。这种技术可以逐步深入目标系统,获得仅凭单个漏洞无法取得的访问权限。

OpenAI 的数据显示,在 ExploitBench 等网络安全基准测试中,Astra 的表现超过了 GPT-5.6 Sol 和 Anthropic 的 Mythos 等业界领先 AI 模型;其中,Astra 在 ExploitBench 上取得了 100% 的成绩。不过,这些能力基本符合 OpenAI 和 Anthropic 数月来一直预测的趋势:AI 模型的黑客能力正在不断增强。例如,今年 4 月,Anthropic 就强调,Mythos Preview 已经能够自主构建漏洞利用链

尽管 AI 和网络安全行业都在争分夺秒地适应这一变化,许多网络安全专家仍强调,关键的数字安全防御措施和长期沿用的最佳实践依然有效。不过,对于尚未全面落实这些防护措施的组织和系统而言,AI 带来的风险已经更加紧迫。

原始来源: WIRED

评论 (0)