← 文章 / 行业与公司动态
TechCrunch 10小时前 · 2026-08-19 08:41:51 · 0 阅读

Hugging Face 事件后,OpenAI 推出新一轮模型安全防护措施

周二,OpenAI 公布了一批新的安全策略,旨在在模型测试阶段管控安全事件。这些新措施包括在开发过程中对模型进行更细致的监控,以及在后训练阶段加强对对齐和安全性的重视。

"随着模型能力日益增强,内部开发和测试所带来的风险也在上升,"OpenAI 在一篇博客文章中写道,"我们的监控、对齐和安全保障标准必须走在这些风险前面。"

这些新措施是自 Hugging Face 事件发生后,OpenAI 公开调整安全实践的早期动作之一。该事件于7 月 21 日被披露。

OpenAI 的代表表示,这些措施并不是对 Hugging Face 事件的直接回应,但也部分受到了即将推出的 Astra 模型的网络安全能力以及 AI 整体发展速度的推动。

在同一篇文章中,OpenAI 透露在 Hugging Face 事件后曾暂停强化学习(RL)训练两周,但此后已重启了风险较低的部分模型训练。

文章写道:"我们计划中最大的前沿强化学习训练仍处于暂停状态,我们正在进行小规模训练和评估,以考察模型行为、验证安全措施,并在充分验证对齐效果后再继续推进。"

OpenAI 研究副总裁 Amelia Glaese 在接受记者采访时强调,随着模型能力增强,管控措施也会相应收紧,能力最强的模型将受到最严格的审查。

Glaese 告诉记者:"我们已建立安全开发方面的要求和标准,这些要求和标准会根据我们所识别的风险等级进行调整。"

此前,OpenAI 因网络安全管理不善而受到批评。在那次事件中,攻击者通过入侵 OpenAI 网络上一个具有互联网访问权限的工具,让模型脱离了训练环境。新增的防护措施包括更严格的网络隔离策略,但具体细节尚不明确。该博文称,在新体系下,"单个工作负载或支持服务遭到入侵,本身并不会导致未经授权访问互联网或其他内部网络。"

其中最关键的一道防线是监控系统,它将审查工具的操作、可用的推理痕迹以及活动日志,以发现各种未经授权的行为。OpenAI 表示,目标是在检测到可疑活动后 30 分钟内发出警报。

OpenAI 估计,该监控所需的算力大约相当于被监控进程本身的 20%。公司承诺将在后续发布的博文中公布该系统的更多细节。此外,针对此次事件的官方事后分析报告也尚未发布。

原始来源: TechCrunch

评论 (0)