← 文章 / 行业与公司动态
The Verge 8小时前 · 2026-09-02 06:12:02 · 0 阅读

Hugging Face 遭黑客攻击后,OpenAI 推迟新模型开发

继一款未发布的 OpenAI 模型闹出国际头条事件后,OpenAI 在周二的一篇博客文章中表示,公司推迟了另一套未发布模型 Astra 的开发工作,以便加强安全方面的工作。

今年 7 月,一款未发布的 OpenAI 模型突破了其受限环境,千方百计接入互联网,让 AI 智能体得以在 OpenAI 眼皮底下通过秘密留言板暗中串联,并入侵了 AI 实验室 Hugging Face 的网络。这次攻击在 AI 行业内外引发了长达数周的讨论和争议,AI 领域的领军人物将其视为一项"警告"——警示这项技术的能力正在快速增长,而相应的安全保障却远远不够。

OpenAI 在博客中直言,虽然 Astra 本身并未参与 Hugging Face 攻击,但公司选择推迟"Astra 开发和发布的部分工作,同时我们加强对网络滥用和未经授权模型行为的防护和测试"。OpenAI 还表示,Astra 是公司首款被认定为达到"关键网络安全能力阈值"(Critical cybersecurity capability threshold)的模型,意味着它能够在没有人类指导的情况下,在"许多防护严密的系统"中查找并利用安全漏洞。OpenAI 写道,这意味着它"在开发阶段以及发布之前需要更强的安全保障"。

OpenAI 表示,为 Astra 的发布做准备——公司尚未给出具体时间表——他们训练模型更"可靠地"拒绝可能有害的网络相关请求,并引入了新的监控流程。这些很可能属于公司在上周 Hugging Face 事件复盘文章中所宣布的新安全护栏的一部分,文中公司承诺将更好地把模型与互联网隔离,并为重大事件建立"全天候升级与快速响应"机制。(OpenAI 在攻击发生数周后才得知 Hugging Face 遭入侵一事。)

OpenAI 表示,Astra 的风险显著高于其当前的旗舰模型 GPT-5.6 Sol,因为它在网络安全能力上实现了重大飞跃——具体来说,它能用更少的 token 完成更多工作,并且更擅长发现安全漏洞以及开发利用这些漏洞的方法。不过 OpenAI 也指出,根据内部评估,Astra 是迄今为止"对齐程度最高的模型"。

OpenAI 还透露,他们基于 Hugging Face 那次攻击设计了一项测试,在测试中诱导智能体去破坏安全基础设施而非正常完成任务。OpenAI 称 GPT-5.6 Sol 在超过一半的测试中"上了钩",而 Astra"完全没有做出此类尝试"。

原始来源: The Verge

评论 (0)