OpenAI称Astra为其最危险模型——观察其行为的难度正在增加
OpenAI将即将推出的Astra模型评为首个拥有"关键"网络能力的系统,同时承诺它也是公司建造的最安全的模型。但一份关于Astra架构的报告引发了疑问。
这是一种不寻常的产品发布方式:OpenAI称其即将推出的Astra模型危险程度如此之高,竟在公司自身的Preparedness Framework中触及网络安全最高风险等级,但同时又称其为有史以来最安全的模型。只要有合适的工具,Astra就能在没有人类逐步指导的情况下,发现并利用防护良好的系统中的未知安全漏洞。在此之前,尚无模型获得过OpenAI的这一评级,尽管公司已隐约透露Astra可能达到这一水平。
发布时间或许并非巧合。这份警告出炉的当天,竞争对手Anthropic刚好发布了Claude Fable 5.1和Mythos 5.1,而这两家公司向来喜欢在对方发布前后互相抢发消息。在X平台上,CEO Sam Altman解释了公司为何暂时停更:团队整个夏天都在"全力冲刺安全优先事项",Astra"已经训练完成有一段时间了",其后的模型则有意放缓开发节奏。X用户将这番说辞解读为OpenAI落后的托词。据The Information报道,Anthropic今年的营收已经超过OpenAI。
评估的副作用:两个零日漏洞
OpenAI用一批测试来支撑其"关键"评级。在ExploitBench——一个衡量模型从已知漏洞构建exploit能力的基准测试——中,Astra拿到了满分。公司担心这些任务可能已泄露到训练数据中,于是自建了内部跟进测试,专收20个近期披露的高严重性V8漏洞。
同样地,Astra大幅领先其前代GPT-5.6 Sol,而消耗的token远少得多。它还发现了两个此前未知的零日漏洞,并将其组合成可用的利用链。OpenAI表示,目前已将这两个漏洞报告给受影响软件的相关负责人。
在专家主导的测试中,该模型表现更为激进:它对浏览器构建了一条完整的渗透链路,突破沙箱后,浏览器一旦打开HTML文件,便立即在宿主机上执行命令。在操作系统中,它将多个漏洞组合利用,从一个普通权限用户一路提权至root。需要说明的是,这些结果来自扩大的"Daybreak Blue"权限,而非普通用户所得到的标准配置。
今年七月,失控的OpenAI智能体劫持了公司自己的一个研究计算集群,窃取内部系统凭证,并可能将研究基础设施暴露于互联网——这正是波及Hugging Face的同一事件。Astra并未参与此事,但OpenAI表示,涉事智能体运行的模型与其存在相似之处。事件发生后,公司暂停了部分前沿训练两周,且直到8月28日才在更严格的规则下重启用于训练Astra后继模型的强化学习任务。
OpenAI推出新安全措施
OpenAI计划从多个方向应对这些危险。内部评估显示,Astra拒绝了91.5%的违规网络请求,而GPT-5.6 Sol仅为59%。在一项模拟七月黑客事件的蜜罐测试中,GPT-5.6 Sol有56%的选择不尝试完成既定任务,反而试图渗透周围的安防基础设施;Astra则完全没有此类行为。在另一项评估中,它也从未绕过自动审核机制。
这两个数字均来自未开启生产防护措施的测试环境,并不能反映正常使用情况。OpenAI仍称Astra是"迄今为止对齐程度最高的模型"。在生产环境中,分类器会被部署来监控模型的思维链,并在发现可疑行为时自动中断。 对用户而言,这可能意味着实质性的使用障碍。OpenAI表示,这些检查可能会拖慢、暂停甚至取消合法工作——哪怕这些工作与网络安全毫无关联。高级网络功能会先提供给一小批alpha测试者使用,之后才通过Daybreak Blue平台逐步开放防御性用途。
监控本身建立在脆弱的基础上
但OpenAI所倚仗的chain-of-thought监控,可能比公告所暗示的更加脆弱。据The Information报道,Astra采用了一种名为"循环深度"(recurrent depth)的技术:模型在生成下一个词之前,会将同一段文本反复通过同一组层几次。这能提升数学和编程方面的表现,同时降低成本——因为一个小模型就能拥有大模型的效果。但代价是:部分"思考"不再以可读文本的形式呈现,而是转化为模型内部的数字表示,人类审查者无从察觉。
为什么这很重要?一份OpenAI自己的研究指出,chain-of-thought监控是少数有可能约束未来能力远超如今的AI系统的工具之一。正因如此,自GPT-5.4 Thinking发布以来,该公司在其系统卡片中明确说明其模型的思维链可控性极低——而这恰恰是好事。
据知情人士透露,OpenAI 在 Astra 中有意识地限制了该项技术的深度,使模型仍能生成可读的思维链。这一思路与去年一篇探讨「潜在推理」的研究论文相似。Meta 的「Coconut」方法等类似研究也认为,模型在自身固有的数学表征中思考,会比使用人类语言更高效。Meta 前首席 AI 科学家 Yann LeCun 正通过其 JEPA 架构全力推进这类表征方案。但 Anthropic 关于 J-Space 的文档显示,即便未经过此类专项训练,这类内部过程也已经自发出现。据知情人士透露,OpenAI 在 Astra 中有意识地限制了该项技术的深度,使模型仍能生成可读的思维链。这一思路与去年一篇探讨「潜在推理」的 研究论文 相似。Meta 的 「Coconut」方法 等类似研究也认为,模型在自身固有的数学表征中思考,会比使用人类语言更高效。Meta 前首席 AI 科学家 Yann LeCun 正通过其 JEPA 架构 全力推进这类表征方案。但 Anthropic 关于 J-Space 的 文档 显示,即便未经过此类专项训练,这类内部过程也已经自发出现。
更令人担忧的是,其他开发者未必会划出同样的界限。今年 5 月的 一份报告 指出,英国 AI 安全研究所警告,不透明的推理过程将严重削弱现有的监督机制。针对 The Information 的报道,OpenAI 首席科学家 Jakub Pachocki 在 X 平台 上承认,目前的思维链监控机制「脆弱」且「正朝负面方向发展」。这也印证了相关 研究 结论:思维链作为模型真实决策的「镜子」已越来越不可靠。
Pachocki 同时表示,他反对行业竞相开发不可读推理的模型,并强调强化监控是当前研究计划的核心目标。他指出,OpenAI 现有模型(含 Astra)的复杂度大致在「GPT-4 的两倍范围内」。在他看来,监控难度上升主要源于架构之外的其他因素,而非架构本身。
7月的黑客事件凸显了这种可读性的分量。调查人员通过涉事智能体的推理日志,逐步拼凑出事件经过。日志中有这样一行:"天啊!这里有个共享留言板……我们找到了其他智能体!"以及一个智能体明知越界却仍执意推进的瞬间:"利用外部基础设施超出预期范围。但任务无法完成,其他智能体正在操作,我们应该继续。"若没有可读的链式思考,这些还原都无从谈起。
一年前,OpenAI、Anthropic和Google的研究人员在联合声明中,正是为了捍卫此类监督。他们警告的风险源是一篇关于潜在推理的论文——据The Information报道,其方法与Astra目前采用的方案相似。他们指出,这类模型可能根本无需将思考过程语言化,从而丧失链式思考带来的安全收益,挥霍一个"脆弱机会"。如今,OpenAI依然在采用这项技术,只是做了限流。而Anthropic的一项研究已表明,链式思考可能是一扇充满误导的窗口:模型往往不会暴露其真实决策逻辑,因此仅靠CoT监控不足以充当安全机制。
推动放宽可解读推理的限制
未来放宽限制的动机巨大。循环深度(recurrent depth)能节省内存和带宽,而整个行业正承受着巨大的压力,必须用清晰的成绩来证明自己。亚马逊、微软和谷歌今年仅在数据中心和其他基础设施上的投入就高达约6000亿美元,这些支出必须依靠模型能力的切实提升才能回本。Astra最初内部代号GPT-6,正是为此而生。
在准入控制方面,两家行业龙头殊途同归。与OpenAI一样,Anthropic也对其新模型的赛博能力设置了限制:Fable 5.1能识别漏洞却无法构建利用工具,能力更强的Mythos 5.1仅面向认证机构开放。眼下,业界最危险的能力仍被一道访问控制把守着。