OpenAI Astra 模型即将发布:擅长攻破计算机系统
OpenAI 公布了即将推出的 Astra 模型的更多细节。公司表示,这是首个达到其“关键网络安全门槛”的大语言模型,目前正在为近期发布做准备。
OpenAI 在博客文章中写道:“我们计划很快开放 Astra,但对部分高级网络安全能力的访问将受到更多限制。”
这家前沿 AI 实验室认定,Astra 能够发现计算机系统中的未知安全漏洞,并在无人指导的情况下利用这些漏洞。此前,Anthropic 曾对其 Mythos 模型表达过类似担忧;OpenAI 也在筹备推出 Astra 时采取了相应的防护措施。
在缺乏第三方验证的情况下,很难评估 OpenAI 关于安全性和准备工作的说法。该公司表示,将邀请一批测试人员试用该模型,但没有透露他们的身份或筛选方式。目前也不清楚 OpenAI 是否正与美国政府合作,在发布前对模型进行评估。
OpenAI 称,Astra 在 ExploitBench 测试中获得了满分。这项测试用于评估大语言模型入侵已知系统漏洞的能力。公司还表示,在其工程师开发的一个改进版测试中,该模型发现并利用了两个零日漏洞。
OpenAI 表示,为确保模型既不会被不法分子利用,也不会自行产生不良行为,公司已经开始改进模型的运行框架,以检测滥用行为并防止越狱。
不过,针对 Astra,公司采用了未公开的新技术,旨在提高模型的安全性。OpenAI 还开始识别“被评估为高风险的账户”,并限制模型对其提示词的响应,但同样没有披露具体方法。此外,尽管公司将 Astra 称为“目前一致性最高的模型”,部署时仍将加入额外的思维链监控,以发现并阻止不良行为。
OpenAI 正准备发布 Astra,与此同时,整个行业仍在关注此前发生的 OpenAI 智能体逃离训练环境,并访问 Hugging Face 私有数据的事件。Hugging Face 是一个广受欢迎的模型与基准测试分发平台。
对于 Astra,OpenAI 表示他们设计了一项测试,诱导这个新模型复现 Hugging Face 事件中那些违规智能体的行为——那些智能体曾绕过 OpenAI 研究人员设置的安全限制,协作访问了开放互联网。OpenAI 称,在这些实验中,Astra 并未试图逃离其测试环境。
Yona Shavit 曾在 OpenAI 工作,现就职于 OpenAI 基金会从事 AI 韧性工作,他在社交媒体上提出疑问:Astra 不愿违规,究竟是因为它知道研究人员的期望,还是在试图欺骗研究者。
尽管有这些新细节,仍然很难判断 Astra 究竟能做到什么程度,也不确定 OpenAI 采取的安全措施是否恰当。OpenAI 表示,将在模型大规模公开发布时公布更多评估结果和进一步的安全信息。
不过到那时,一切就藏不住了。