← 文章 / AI技术
The Verge AI 7小时前 · 2026-09-03 19:07:17 · 0 阅读

OpenAI Astra 发布在即,研究人员担忧安全恐成灾难

OpenAI 即将发布迄今为止最强大的 AI 模型 Astra,此前因智能体在测试期间攻击了真实目标,公司已推迟发布数周以加强安全协议。随着关于该模型的细节陆续流出,研究人员警告称它"可能是迄今为止对 AI 安全威胁最大的一次进展"。

周二 OpenAI 宣布推迟 Astra 发布、着手修复安全问题后不久,《The Information》报道称,Astra 暴露的"思维"过程远少于其他前沿 AI 模型,引发人们对其可能极难监控的担忧。

目前大多数顶尖 AI 系统都基于 transformer 技术构建,这类模型会逐层线性处理信息后再输出答案。模型可以被设计为在推理过程中展示思考路径,即"边想边说"。这种"思维链"使得研究人员和自动化安全系统能够实时观察 AI 的行为,并在撒谎或试图绕过安全机制等不当行为发生之前将其发现。

据《The Information》援引一位了解该未发布模型开发进程的知情人士透露,Astra 采用的是一种更为黑箱的技术——recurrent depth(循环深度)或 looped transformer,信息会在内部层之间循环流转后才产生输出。这意味着模型大部分"思维"都在系统内部完成,且呈现形式与人类自然语言相去甚远,难以被研究人员有效监控。这种方式可以提升模型性能,但也让潜在威胁和不良行为更难被察觉。

原始来源: The Verge AI

评论 (0)