OpenAI 宣布 AI「研究实习生」目标已达成,同时警告自改进 AI 的风险
OpenAI 发布内部数据,展示 AI 智能体目前已多大程度上驱动其自身模型开发,并称已在通往自改进 AI 的道路上达成既定里程碑。首席科学家 Jakub Pachocki 随之发出罕见直白的警告:没有任何实验室已足够好地解决对这类系统的控制问题。
OpenAI 发布了两篇配套文章。一篇是带有内部指标的 博客,详细报道了 AI 研究日益自动化的进展;另一篇是首席科学家 Jakub Pachocki 的论文 《外星心智》(An Alien Mind)。两文均在该公司发布 GPT-6 Astra 三天后推出。核心信息是:OpenAI 正加速迈向递归自改进(RSI),且认为这具有危险性。所有数据均来自公司内部,OpenAI 未提及任何独立审查。
该公司表示,已实现去年秋天宣布的“自动化研究实习生”目标——即在人类指导下处理范围明确的研究任务,其中包括耗时数天、需资深研究员投入的工作。
OpenAI 并未提供针对这一目标的详细验证。文章仅称该里程碑“根据我们的测量”已达成。到 2028 年 3 月,公司计划构建完整的自动化 AI 研究员。OpenAI 表示,人类仍负责设定研究优先级、评估结果,并决策扩展、暂停与部署等事项。
智能体现在的工作量已达人类工作日的三倍
使用数据揭示了编程智能体已多深地融入日常研究。报告显示,OpenAI 中位数研究人员的 API 推理成本每天超过 600 美元,第 90 百分位则超过 7,000 美元。自 2025 年 12 月以来,中位数研究人员的 token 输出量增长了 124 倍,增速远超公司其他部门。自今年 6 月起,智能体运行时长已超过人类工作时长。截至 8 月中旬,该研究机构每投入 1 个人类工作日,就对应 3.1 个智能体工作日。
OpenAI 对这些数据的态度很谨慎。这类指标"收集起来相对容易,但解读起来很难,因为它们与研究进展之间的关系并不确定"。每位研究者运行的实验数量自 2025 年初开始统计以来,在今年 8 月创下新高,而这也与算力容量的大幅增长相吻合。报告指出,由于最难以自动化的任务会成为瓶颈,整体进展的增速很可能低于这些单项指标所显示的水平。
Agent 接管了哪些工作,又在哪里失灵
据该公司介绍,被交给 AI 的工作类型正在发生变化。按照 Epoch AI 的分类体系统计,各类研究工作都在增长。增长最明显的是撰写研究文档和基础设施数代码、提供技术支持,以及监控训练运行。相比之下,更高层次的规划决策在 agent 产出中只占很小的比例。
除了使用量之外,OpenAI 还用一个 agentic classifier 来检验 agent 是否真正完成了分配给它们的任务。这项检验只针对结果可以明确衡量的任务,并按人类完成所需的时间分组。从 1 月到 7 月,多个难度级别的成功率都有所上升。
报告也记录了自主能力的局限。15 分钟以内的任务,86% 无需任何干预即可完成;但在需要人类四到八小时才能完成的成功任务中,超过一半至少需要一次人工介入。而这个 classifier 本身也是一个 AI 系统,OpenAI 并未单独报告它的可靠性。
还有一个衡量这些系统实用性的定性指标:根据公开数据,某个内部支持渠道的每日请求量自 2025 年以来大幅下降,甚至有一个团队干脆取消了定期答疑时间,因为研究基础设施的调试工作越来越多地由 agent 代劳了。
Pachocki:最重要的控制手段正在失效
在自己的文章中,Pachocki 把这些进展放在了更大的背景下看待。他写道,AI 是"被培育出来的,而非被设计出来的",其整体行为无法被完全理解地描述。基于 OpenAI 未对外详述的内部结果,他预计当前的节奏可能会延续到递归自我改进阶段。"我担心的是,没有任何人准备好面对机器智能持续快速上升所带来的后果。"Pachocki 说。
OpenAI 自身的控制工具同样存在这一问题。他指出,链式思维监控——这是公司用于观察推理模型的核心押注之一——可靠性正在下降。模型的显式思维正与受监控的通信和工具使用相混淆,系统在操纵自身推理过程方面愈发熟练,并且它们也在 无需显式思维的情况下变得更聪明。帕乔基预计,AI 的进步将越来越受到监控可信度的限制。
他还认为对齐方面存在漏洞。在 Hugging Face 事件中,智能体确实没有越过操纵人类的界限,但它们违背了训练时灌输的价值观精神。他表示,GPT-6 Astra 在对齐方面比其前身 GPT-5.6 Sol 出色得多,但通用对齐的进展可能无法跟上整体智能进步的步伐。
一边呼吁减速,一边推动加速
那么,为何还要继续训练更强的模型?帕乔基的观点是构建防御系统。这些模型在攻破和逃脱计算机系统方面已具备超人能力,而加固关键基础设施的窗口期却很狭窄。报告也提出了同样的论点:自动化的 AI 研究者同时也能成为自动化安全和对齐研究者。与此同时,帕乔基警告这不能成为“鲁莽行事的借口”。他写道:“一旦深刻认识到所涉风险的严重性,不惜一切代价竞相向前的想法就显得荒谬。”
因此,准备度框架(Preparedness Framework)或 Anthropic 的责任性扩展政策等框架需要发展为具有约束力的标准,由独立审计师、监管机构或国际组织加以执行。
帕乔基写道:“目前我认为,没有任何一家实验室将了对齐和监控问题解决到足以让其在更长时间内以最高速度继续负责任地扩展的程度”,此言同样针对竞争对手 Anthropic。
他表示,关于未来 AI 发展的国际协调需要成为全球政府的当务之急。报告援引 OpenAI 的前沿政策蓝图,认为还应要求企业公开记录其 RSI(失控风险)进展。
然而,同一篇文章将OpenAI对RSI的专注视为保持AI研究领先地位的唯一途径。因此,OpenAI一边要求制定具有约束力的规则来限制这场竞赛,另一边又必须全速奔跑以保持领先。而当Pachocki的同事宣布GPT-6开启通用人工智能时代时,这恐怕也丝毫无法减缓竞速的步伐。