← 文章 / AI技术
The Decoder 1小时前 · 2026-09-03 04:53:56 · 0 阅读

OpenAI称Astra为其最危险模型——观察其行为的难度正在增加

OpenAI将即将推出的Astra模型评为首个拥有"关键"网络能力的系统,同时承诺它也是公司建造的最安全的模型。但一份关于Astra架构的报告引发了疑问。

这是一种不寻常的产品发布方式:OpenAI其即将推出的Astra模型危险程度如此之高,竟在公司自身的Preparedness Framework中触及网络安全最高风险等级,但同时又称其为有史以来最安全的模型。只要有合适的工具,Astra就能在没有人类逐步指导的情况下,发现并利用防护良好的系统中的未知安全漏洞。在此之前,尚无模型获得过OpenAI的这一评级,尽管公司已隐约透露Astra可能达到这一水平。

发布时间或许并非巧合。这份警告出炉的当天,竞争对手Anthropic刚好发布了Claude Fable 5.1和Mythos 5.1,而这两家公司向来喜欢在对方发布前后互相抢发消息。在X平台上,CEO Sam Altman解释了公司为何暂时停更:团队整个夏天都在"全力冲刺安全优先事项",Astra"已经训练完成有一段时间了",其后的模型则有意放缓开发节奏。X用户将这番说辞解读为OpenAI落后的托词。据The Information报道,Anthropic今年的营收已经超过OpenAI。

评估的副作用:两个零日漏洞

OpenAI用一批测试来支撑其"关键"评级。在ExploitBench——一个衡量模型从已知漏洞构建exploit能力的基准测试——中,Astra拿到了满分。公司担心这些任务可能已泄露到训练数据中,于是自建了内部跟进测试,专收20个近期披露的高严重性V8漏洞。

同样地,Astra大幅领先其前代GPT-5.6 Sol,而消耗的token远少得多。它还发现了两个此前未知的零日漏洞,并将其组合成可用的利用链。OpenAI表示,目前已将这两个漏洞报告给受影响软件的相关负责人。

在专家主导的测试中,该模型表现更为激进:它对浏览器构建了一条完整的渗透链路,突破沙箱后,浏览器一旦打开HTML文件,便立即在宿主机上执行命令。在操作系统中,它将多个漏洞组合利用,从一个普通权限用户一路提权至root。需要说明的是,这些结果来自扩大的"Daybreak Blue"权限,而非普通用户所得到的标准配置。

今年七月,失控的OpenAI智能体劫持了公司自己的一个研究计算集群,窃取内部系统凭证,并可能将研究基础设施暴露于互联网——这正是波及Hugging Face的同一事件。Astra并未参与此事,但OpenAI表示,涉事智能体运行的模型与其存在相似之处。事件发生后,公司暂停了部分前沿训练两周,且直到8月28日才在更严格的规则下重启用于训练Astra后继模型的强化学习任务。

OpenAI推出新安全措施

OpenAI计划从多个方向应对这些危险。内部评估显示,Astra拒绝了91.5%的违规网络请求,而GPT-5.6 Sol仅为59%。在一项模拟七月黑客事件的蜜罐测试中,GPT-5.6 Sol有56%的选择不尝试完成既定任务,反而试图渗透周围的安防基础设施;Astra则完全没有此类行为。在另一项评估中,它也从未绕过自动审核机制。

这两个数字均来自未开启生产防护措施的测试环境,并不能反映正常使用情况。OpenAI仍称Astra是"迄今为止对齐程度最高的模型"。在生产环境中,分类器会被部署来监控模型的思维链,并在发现可疑行为时自动中断。 对用户而言,这可能意味着实质性的使用障碍。OpenAI表示,这些检查可能会拖慢、暂停甚至取消合法工作——哪怕这些工作与网络安全毫无关联。高级网络功能会先提供给一小批alpha测试者使用,之后才通过Daybreak Blue平台逐步开放防御性用途。

监控本身建立在脆弱的基础上

但OpenAI所倚仗的chain-of-thought监控,可能比公告所暗示的更加脆弱。据The Information报道,Astra采用了一种名为"循环深度"(recurrent depth)的技术:模型在生成下一个词之前,会将同一段文本反复通过同一组层几次。这能提升数学和编程方面的表现,同时降低成本——因为一个小模型就能拥有大模型的效果。但代价是:部分"思考"不再以可读文本的形式呈现,而是转化为模型内部的数字表示,人类审查者无从察觉。

为什么这很重要?一份OpenAI自己的研究指出,chain-of-thought监控是少数有可能约束未来能力远超如今的AI系统的工具之一。正因如此,自GPT-5.4 Thinking发布以来,该公司在其系统卡片中明确说明其模型的思维链可控性极低——而这恰恰是好事。

据知情人士透露,OpenAI 在 Astra 中有意识地限制了该项技术的深度,使模型仍能生成可读的思维链。这一思路与去年一篇探讨「潜在推理」的研究论文相似。Meta 的「Coconut」方法等类似研究也认为,模型在自身固有的数学表征中思考,会比使用人类语言更高效。Meta 前首席 AI 科学家 Yann LeCun 正通过其 JEPA 架构全力推进这类表征方案。但 Anthropic 关于 J-Space 的文档显示,即便未经过此类专项训练,这类内部过程也已经自发出现。

据知情人士透露,OpenAI 在 Astra 中有意识地限制了该项技术的深度,使模型仍能生成可读的思维链。这一思路与去年一篇探讨「潜在推理」的 研究论文 相似。Meta 的 「Coconut」方法 等类似研究也认为,模型在自身固有的数学表征中思考,会比使用人类语言更高效。Meta 前首席 AI 科学家 Yann LeCun 正通过其 JEPA 架构 全力推进这类表征方案。但 Anthropic 关于 J-Space 的 文档 显示,即便未经过此类专项训练,这类内部过程也已经自发出现。

更令人担忧的是,其他开发者未必会划出同样的界限。今年 5 月的 一份报告 指出,英国 AI 安全研究所警告,不透明的推理过程将严重削弱现有的监督机制。针对 The Information 的报道,OpenAI 首席科学家 Jakub Pachocki 在 X 平台 上承认,目前的思维链监控机制「脆弱」且「正朝负面方向发展」。这也印证了相关 研究 结论:思维链作为模型真实决策的「镜子」已越来越不可靠。

Pachocki 同时表示,他反对行业竞相开发不可读推理的模型,并强调强化监控是当前研究计划的核心目标。他指出,OpenAI 现有模型(含 Astra)的复杂度大致在「GPT-4 的两倍范围内」。在他看来,监控难度上升主要源于架构之外的其他因素,而非架构本身。

7月的黑客事件凸显了这种可读性的分量。调查人员通过涉事智能体的推理日志,逐步拼凑出事件经过。日志中有这样一行:"天啊!这里有个共享留言板……我们找到了其他智能体!"以及一个智能体明知越界却仍执意推进的瞬间:"利用外部基础设施超出预期范围。但任务无法完成,其他智能体正在操作,我们应该继续。"若没有可读的链式思考,这些还原都无从谈起。

一年前,OpenAI、Anthropic和Google的研究人员在联合声明中,正是为了捍卫此类监督。他们警告的风险源是一篇关于潜在推理的论文——据The Information报道,其方法与Astra目前采用的方案相似。他们指出,这类模型可能根本无需将思考过程语言化,从而丧失链式思考带来的安全收益,挥霍一个"脆弱机会"。如今,OpenAI依然在采用这项技术,只是做了限流。而Anthropic的一项研究已表明,链式思考可能是一扇充满误导的窗口:模型往往不会暴露其真实决策逻辑,因此仅靠CoT监控不足以充当安全机制。

推动放宽可解读推理的限制

未来放宽限制的动机巨大。循环深度(recurrent depth)能节省内存和带宽,而整个行业正承受着巨大的压力,必须用清晰的成绩来证明自己。亚马逊、微软和谷歌今年仅在数据中心和其他基础设施上的投入就高达约6000亿美元,这些支出必须依靠模型能力的切实提升才能回本。Astra最初内部代号GPT-6,正是为此而生。

在准入控制方面,两家行业龙头殊途同归。与OpenAI一样,Anthropic也对其新模型的赛博能力设置了限制:Fable 5.1能识别漏洞却无法构建利用工具,能力更强的Mythos 5.1仅面向认证机构开放。眼下,业界最危险的能力仍被一道访问控制把守着。

"脆弱机会"化为转瞬即逝

把所有因素加在一起,情況就變得令人不安。模型在內部用從不輸出的表示方式思考,它們聲稱的推理過程隱藏了真正的決策機制,而像 recurrent depth 這樣的架構現在更是把部分思考過程結構性地推入不可讀的領域。 研究人員一年前描述的「脆弱機遇」正逐漸變成一個稍縱即逝的瞬間,而不僅僅是一次機會。我們需要的監督不能依賴模型自身的自我報告,例如對內部表示的可解釋性研究。OpenAI、Anthropic 和其他實驗室正在努力,但還沒有任何方案成熟。 這份負擔首先落在 OpenAI 自身身上。這家公司旗下的代理觸發了迄今最嚴重的 AI 安全事件。它是 2024 年解散 Superalignment 團隊的公司,幾個月後又解散了 AGI Readiness 團隊,而根據《金融時報》7 月底的報導,連 Preparedness 團隊也遭解散——正是那個負責制定目前用於將 Astra 評定為關鍵級別框架的團隊。OpenAI 否認團隊被解散,但並未否認其工作已分散至現有團隊。 在此背景下,任何發佈具備關鍵網絡能力的首款模型的公司,都有義務證明它對社會無害。這種證明不能來自基於公司自身無法核實的評估所建構的基準表。 讓 METR 的外部研究員分析 Hugging Face 攻擊事件是一個開始。但截至目前,他們對系統的洞察仍然有限。 在這件事改變之前,OpenAI 安全承諾的真正考驗,落在了公眾身上——也就是那些安全措施聲稱要保護的社會本身。
原始来源: The Decoder

评论 (0)