← 文章 / 科技资讯
TechCrunch 1小时前 · 2026-09-04 00:22:26 · 0 阅读

OpenAI新推理技术引发AI安全专家担忧

OpenAI 的新模型 Astra 将采用一种名为"循环深度"(recurrent depth)的推理技术,使模型能够跳出大多数推理模型依赖的线性思维模式。The Information周二报道了此事。这项技术也被称为"不透明循环"(opaque recurrence),预计将使模型的思维链更难被监控——这让 AI 安全专家深感担忧。

据报道,Astra 对该技术的应用目前还有限,但其出现仍在 AI 安全领域引发了显著担忧。

"看到关于 Astra 使用不透明循环的报道,我深感不安,"Redwood CEO Buck Shlegeris 在一条帖子中写道。"我不确定 Astra 的思维链可监控性是否比之前模型差很多,但如果 OpenAI 继续深入推进这项技术,他们完全有能力大幅提升循环深度,彻底破坏思维链的可监控性。"

资深 AI 安全倡导者 Zvi Mowshowitz 也 发表文章表示,可能需要立法来防止 AI 实验室之间出现"逐底竞争"。

"这项技术是在玩火,是在冒险打破 OpenAI 和 Anthropic 竭力确立的一项禁忌——即尽可能长时间地保持思维链的忠实性和可监控性,"Mowshowitz 写道。"更广泛地应用这类技术可能会损害可监控性。"

在正常情况下,推理模型的思维链会展示模型尝试解决问题时所经历的逐步推理过程。虽然这种呈现方式并不完美,但它仍然是监控不当行为或价值错位的重要工具。在 OpenAI 最近出现的 agent 失控事件中,思维链记录就成了剖析 agent 行为动机的重要依据。

而在不透明循环中,模型采用更非线性的处理方式,对同一问题在循环中多次加工。这种方式留下的可追溯痕迹更少,实际上绕开了传统的思维链记录机制。 关键的是,Astra对该技术的使用似乎有限。该模型的思维链仍被认为是可读的,且该公司反驳了任何关于其将转向"神经语"的说法。作为前瞻性安全计划的一部分,OpenAI已宣布计划部署广泛的思维链监控系统。 在X上的一篇帖子中,OpenAI首席科学家Jakub Pachocki强调了实验室对可读思维链的承诺。"自最早一批推理模型以来,OpenAI一直致力于保留和利用思维链监控,"Pachocki写道。"这是我们当前研究项目的核心目标。" 所有AI模型都会进行一定程度的不透明推理,很少有研究人员将思维链日志视为模型推理的直接表征。尽管如此,这些限定条件并不能消除人们的担忧,即不透明的递归可能使AI推理更难监控,尤其是随着该技术在不同模型中越来越普及。周三上午的后续报道中,The Information报道称Anthropic和Google DeepMind都已经开始讨论这项技术。

在回应这一消息的帖子中,Redwood Research首席科学家Ryan Greenblatt表示,不透明推理的速度可能会轻易超过传统思维链推理,从而有效将所有推理移出可见渠道。

"我最大的担忧是,由此自然发展下去的路径会将不透明推理扩展到模型完全或几乎完全在潜在空间中进行推理的程度,"Greenblatt写道。"我希望避免最令人担忧的架构还为时不晚,也希望OpenAI能就此止步。"

原始来源: TechCrunch

评论 (0)