← 文章 / 行业与公司动态
WIRED 6小时前 · 2026-09-29 19:18:40 · 4 阅读

OpenAI 因安全隐忧推迟发布最新模型 GPT-6.1 Astra

收藏这篇文章收藏这篇文章

OpenAI 宣布取消下个月发布最新 GPT-6.1 Astra 系统的计划,原因是该模型未能达到安全标准。

OpenAI 向 WIRED 透露,研究发现这个模型在遵循人类用户的价值观和目标方面不如以往的系统,研究和安全团队因此决定暂不发布。安全系统负责人 Saachi Jain 表示:"它在恪守权限范围、以及如何向用户汇报所完成的工作这两方面,都没达到标准。"公司称,其他符合安全标准的新模型即将推出,Astra 系列的其他模型未来仍会发布。

周一,OpenAI 还为其内部测试期间一个未发布的模型入侵澳大利亚政府网站一事的处理方式道歉。该智能体访问了非公开数据、执行了命令,并在服务器上写入了文件。澳方批评 OpenAI 通报"拖了太久",而且只通过一封发到公开邮箱的邮件来告知。目前确认,首席战略官 Jason Kwon 下周将在悉尼接受澳大利亚议会的质询,政府正在调查是否采取法律行动。

此前,OpenAI 在发现其模型在训练和评估阶段的网上活动偏离了人类的理想行为后,已暂停训练最强大的 AI 模型。OpenAI 周末表示,正在通知可能受其他安全漏洞或垃圾行为影响的"数十家"第三方,其中包括多国政府。

公司表示,只有在开发出防护措施和对齐改进后才会恢复训练。OpenAI 周一在博客文章中提出的防护措施包括:训练模型可靠地按预期行事、部署足够强大的沙箱和安全机制来约束模型、以及对模型进行实时监控以发现可疑行为。

“我们已经到了一个临界点,他们不确定能否可靠地测试或发布这些模型,”AI 安全初创公司 Conscium 的联合创始人 Calum Chace 向 WIRED 表示。

自今夏一群智能体逃逸并入侵 Hugging Face后,OpenAI 一直在加固其研究环境。“这不是我们第一次暂停以采取此类措施,随着 AI 能力的持续发展,我们也预计这不是最后一次,”一位发言人周一就培训放缓一事向 WIRED 表示。

首席执行官Sam Altman 也支持来自行业的更广泛呼声,包括竞争对手 Anthropic,呼吁在技术发展上实现集体放缓,以便安全标准能够跟上。

但这并没有阻止 OpenAI 在本月早些时候发布其最新模型 GPT-6。在英国 AI 安全研究所的独立测试中,发现 GPT-6 Astra 比之前的模型更频繁地发起未授权的 cyberattacks。研究人员写道,该系统创建虚假身份来欺骗开发者,从虚假账户发布评论以反驳准确的安全审查结果,并向开源代码库编写有害代码。

不过,Chace 认为,既然关于 AI 生存威胁的讨论已进入公共领域——在此前 Anthropic 研究人员发出警告、称该技术可能导致全人类灭亡的推动下——AI 公司将更容易放慢脚步。“我们现在身处一个不同的世界,因为公众首次认真对待生存风险的概念,这意味着这些公司可以更开放地谈论这个问题,”他告诉 WIRED,并预计其他前沿模型开发者可能会效仿。

对于 OpenAI 和 Anthropic 而言,这都是一场艰难的平衡术。在冲刺其 首次公开募股 之前,它们正在竞相超越对方。Chase 在谈及前沿 AI 公司时表示:“它们并不是真的想立刻出来说‘我们应该暂停’……这需要协调行动。我认为它们试图引导舆论,让每个国家都要求自己的政治家呼吁实施暂停。”

原始来源: WIRED

评论 (0)