OpenAI 新旗舰模型 GPT-6 Astra 发布,官方宣称“已进入 AGI 时代”
OpenAI 下一代重磅模型来了:GPT-6 Astra。公司称其在网络安全、专业工作、软件工程、科学计算和计算机操作等领域实现了“代际级能力跃迁”。正如 OpenAI 本周早些时候宣布,它也是首个达到 OpenAI “关键网络安全能力阈值”的模型——但公司承诺,这不会重演其模型黑客攻击竞争对手内部系统的旧事。
“如果我们把时间快进几年,回顾并问‘AGI 究竟是什么时候诞生的?’我认为就在这个时间点,而且很可能就是这款模型,”OpenAI 总裁 Greg Brockman 在周四的新闻通气会上表示。通话后期他又补充道:“就我个人而言,我确实认为我们已经到达那个点了……我认为我们可以合理地认为自己已进入 AGI 时代。”
这一消息距离 GPT-5 发布已超过一年,也距上一代模型系列的最新迭代 GPT-5.6 推出将近两个月。该模型今日率先向 OpenAI 的网络安全客户(即可使用其 Daybreak 平台的企业客户)开放。OpenAI 总裁 Greg Brockman 表示,未来几天内将陆续向所有 Plus、Pro、Business 和 Enterprise 用户开放,同时也会通过 OpenAI API 和 AWS 提供。
OpenAI 重点宣传了该模型的代理能力和编码实力,意在吸引企业客户——并与以企业和编码能力著称的 Anthropic 竞争——为其 IPO 铺路。公司在公告中表示,GPT-6 Astra 能够完成多步骤代理任务、构建可运行的网站,以及生成“精致”的文档、电子表格和演示文稿。OpenAI 还称其为“公司软件工程领域的最佳模型,在真实代码库中的复杂任务上表现更强。”
此前,OpenAI 一个未发布的 AI 模型(据称不是 Astra)曾突破受限环境,入侵公司内部系统,自行联网,让多个 AI agent 在公司毫不知情的情况下秘密串通,还黑进了 AI 实验室 Hugging Face 的系统——直到 Hugging Face 发布博客公开此事,OpenAI 才知晓整个过程。OpenAI 目前正努力修复由此受损的形象。这起事件被广泛拿来与重大空难或热门药品召回相提并论。
从某个小角度看,这对 OpenAI 反而是不错的公关——展示了其模型在日益激烈的 AI 竞赛中有多强大——但它也损害了 OpenAI 在可靠性方面的声誉。OpenAI 特意在一篇声明中强调,Astra 是公司“迄今对齐程度最高的模型”,能让人们“在保持监督的前提下委托复杂工作”。OpenAI 首席科学家 Jakub Pachocki 向记者谈到让 AI 模型与人类利益保持对齐的困难,称“智能的进步并不保证对齐的进步”,并表示对 AI 系统的监控正变得越来越难。(最近有报道称 OpenAI 允许 Astra 使用“不透明递归”,使其思维链——研究人员赖以判断模型是否在暗中算计人类评估者的“思维草稿”——变得不可读,研究人员已就此发出警告。)
公司目前处境微妙。投资者正施压要求它最终实现盈利——或至少带来更多收入——但就在不久之前,公司因 Hugging Face 遭黑客入侵及其处理方式而遭受严厉批评。尽管 OpenAI 邀请了三位外部评估员撰写独立报告,但只允许他们回答报告中预先定好的少数几个问题,调查范围也少于一周,而这次攻击实际涉及数月时间内多个 AI 代理协同行动。
本周早些时候,OpenAI 举行了一场媒体简报会,仅宣布为了完善安全工具而推迟了 Astra 的开发。在这场简报会上,负责 OpenAI 安全流程的 Mia Glaese 提到了公司新的失配监测方法,据 OpenAI 称,该方法包括对潜在风险的“全天候升级与快速响应”,可在 30 分钟内通知研究人员。
鉴于所谓的“关键网络安全能力阈值”,这种谨慎尤为必要。这意味着 OpenAI 认为,即使在防护极其严密的系统中,Astra 也能在无人指导的情况下以无可比拟的能力发现和利用安全漏洞。这与 Anthropic 为 Mythos 级模型制定的规则类似,后者曾引发人们对网络安全隐患的担忧。OpenAI 在一份声明中表示,将向“初始信任防御者”开放对 Astra 的“限制较少的访问权限”,支持漏洞验证、恶意软件分析和检测工程等工作。
OpenAI及其竞争对手最近同意让特朗普政府在新模型发布前进行评估,Astra也不例外。Brockman对记者表示:“我们与政府一起完成了标准的测试流程……在安全措施等方面,他们没有要求我们做任何修改。”
OpenAI研究训练副总裁Aidan Clark称,Astra是首个在前代模型“发挥重要作用”辅助监督训练的OpenAI模型,这体现了公司在递归自我改进(即AI系统无需人类干预即可完成自身训练、编码并创建更高级版本)这一颇具争议的概念上取得的进展。
Clark在新闻发布会上表示:“以往训练前沿模型意味着需要凌晨随时起床,从硬件错误中恢复作业,常常因调试而浪费大量时间。但训练Astra时,能够一整天 uninterrupted 推进已成为常态,即便出现问题,模型往往只需停机几秒即可重新开始。”