刚刚,OpenAI最大预训练模型Doug重磅曝光
刚开通 GPT 不知道怎么用?回复 「蓝皮书」,直接领取入门教程。
大家好,我是全栈君。
过去两年,模型圈最醒目的进步大多来自后训练:强化学习让模型学会推理,测试时计算让它愿意“多想一会儿”,路由系统把快模型和深度推理模型组合在一起。如今,一个名为 Doug 的代号浮出水面,把行业注意力重新拉回最昂贵、也最基础的那一步——大规模预训练。
根据长期追踪 OpenAI 动向的 X 用户 ChrisGPT 以及 SemiAnalysis 的说法,Doug 可能是 OpenAI 迄今规模最大的预训练项目,而且与被猜测为 GPT-6 的 Astra 并非同一个模型。OpenAI 尚未正式确认 Doug 的身份、规模与发布时间,因此下面更值得看的,是这组线索指向的训练路线变化。
Doug 爆料的核心信息
ChrisGPT 在公开帖子中称,GPT-5.5 不会是 OpenAI 最后一次大规模预训练,年底前后还可能出现一轮更大的 pre-training,内部代号为 Doug。他同时把 Doug 与 GPT-6 区分开来,认为前者是另一条更大的底座训练线。

如果消息准确,重点并不只是“参数更多”。全规模预训练决定模型能吸收多广的知识、形成多强的通用表示,以及后训练还能在多高的底座上继续塑形。底座升级后,同一套强化学习、工具使用和推理训练可能获得新的上限。
但代号不能直接等同于产品名。大型实验室会并行训练、蒸馏、评测多个模型,内部项目也可能合并、延期或不对外发布。把 Doug 简单写成“GPT-7”或某个确定发布日期,都会超过目前公开信息能支持的范围。
Doug 与 GPT-6 可能不是一回事
在后续互动中,有人询问 Astra 是否就是 GPT-6,以及 Doug 是否会承担下一代训练任务。ChrisGPT 给出的回答强调两条线并存:Astra 更接近已有模型家族的下一次发布,Doug 则代表新的大型预训练。
这种并行并不奇怪。产品模型不一定等于最新、最大的底座模型。一套面向用户的系统可能使用不同尺寸模型、路由器、工具、记忆与安全层;新的基础模型也要经过后训练、红队、安全评估和基础设施适配,才可能进入稳定产品。
因此,开发者看到新代号时最好拆开三个问题:训练项目是否存在,模型是否完成并进入评测,最终是否作为产品公开。三者之间可能相隔数月,也可能在任何阶段改变计划。
时间表为什么仍然只能当作线索
ChrisGPT 预计 Doug 最迟可能在 11 月前后推出,并提到预训练时长、网络安全测试等因素。这个时间表来自外部爆料,不是 OpenAI 的产品承诺。
前沿模型发布往往受训练稳定性、数据处理、推理成本、安全测试和算力调度共同影响。训练跑完不代表可以上线,评测优秀也不代表服务成本可接受。越大的底座,部署端需要解决的并行、缓存、吞吐和容量问题越复杂。
对应用团队来说,最稳妥的做法不是围绕传闻日期排版本,而是保持模型层可替换:统一调用接口,固定回归集,记录成本和延迟基线,把提示词与工具逻辑从具体模型名中解耦。真正发布时,才能在几天内验证收益,而不是重新改造整套应用。
为什么行业重新盯上预训练
SemiAnalysis 在研究备忘录中写道,OpenAI 已克服部分预训练问题,一个规模大得多、代号 Doug 的模型正在推进。这条线索比单个社交帖子更早出现,也让 Doug 与 OpenAI 过去两年的训练路线联系起来。

2024 年 GPT-4o 发布后,OpenAI 的公开进展越来越强调后训练和推理计算。o1展示了大规模强化学习带来的推理能力,后续产品又把快速回答、深度推理和路由组合到统一体验中。
这条路线证明,模型能力不是只由预训练规模决定。给模型更好的奖励信号、任务环境和推理预算,能够把已有知识组织成更可靠的行动。但后训练不是无中生有,它能放大的能力仍受底座表示与知识边界约束。
后训练路线为何可能接近边际
外部研究者曾提出一个判断:OpenAI 自 GPT-4o 后,没有完成一轮被广泛部署为新一代主力的全规模预训练。OpenAI 没有公开确认这一训练血缘,但这个判断解释了为什么市场会对 Doug 如此敏感。

强化学习可以让模型更会使用已有能力,却可能遇到奖励设计、任务覆盖和可验证反馈的瓶颈;增加推理时间能提升复杂任务表现,却会同时推高延迟与成本。如果底座长期不换代,后训练的每一分增益都可能越来越贵。
新的预训练底座相当于扩大原材料空间。它可能提高数据效率、长上下文表示、多模态统一和稀有知识覆盖,再让已经成熟的 RL 与推理框架在更高起点上工作。这正是“底座重新 scaling”最吸引人的地方。
Garlic 可能扮演了什么角色
Doug 之前,另一个代号 Garlic 已经出现在报道中。相关消息称,Garlic 在代码和推理评测中表现不错,并使用了训练过程中的一系列修复经验;更重要的是,团队据称已把这些经验应用到一个更大的后续模型。

如果把训练看成软件工程,Garlic 更像一次验证关键修复的稳定版本:先确认数据管线、优化器、分布式训练与故障处理能在可控规模上工作,再放大到更昂贵的项目。Doug 则可能是把同一套修复真正推向全规模后的结果。
前沿预训练最怕的不是单次报错,而是错误在数万张加速卡上运行数周后才显现。数据重复、数值不稳定、网络抖动、检查点恢复和训练目标偏差,都可能吞掉巨额算力。所谓“解决预训练问题”,通常意味着整条工程链更可靠,而不是找到一个神奇算法。
真正值得观察的是三条 Scaling 轴
模型竞争已经从单一的“堆预训练算力”变成三条轴同时推进:pre-training 决定底座,post-training 与 RL 决定行为和专业能力,inference-time compute 决定单次任务愿意投入多少思考。

这三条轴不是替代关系。更强底座能让强化学习覆盖更困难的任务,更好的 RL 能让模型高效调用知识,测试时计算又能在关键问题上继续搜索。真正的代际跃迁,往往来自三者重新组合,而不是某一项单独放大。
对开发者而言,这意味着模型评测也要改变。不要只测聊天正确率,还要记录工具调用成功率、长任务完成率、单位任务 token、真实延迟和失败恢复能力。底座更强如果换来成本暴涨,未必适合所有线上请求;推理更深如果无法稳定执行工具,也未必能提高业务完成率。
Doug 若成立,会改变什么
第一,前沿竞争会再次把焦点拉回训练基础设施。更大预训练需要数据、网络、能源、检查点和容错系统协同,拥有稳定大规模训练能力的团队会获得更高门槛。
第二,后训练积累不会作废。过去两年形成的推理环境、奖励模型、工具数据和安全评测,可以迁移到更强底座上,甚至产生乘数效应。
第三,产品层会更像系统工程。即使 Doug 本身足够强,最终体验仍由路由、记忆、Harness、权限与成本控制决定。最大的模型可能只负责最难的一小部分请求。
第四,发布时间会比训练代号更不确定。模型越强,网络安全、能力风险和滥用评估越重要。外部爆料可以帮助理解方向,却不能代替正式发布与系统卡。
最后
Doug 最值得关注的,不是一个听起来亲切的内部代号,而是它可能代表 OpenAI 重新把预训练底座推向下一代。过去两年,行业学会了用 RL 和推理计算从现有模型里挖出更多能力;下一轮竞争,很可能是新底座与成熟后训练体系第一次真正叠加。
在官方信息出现前,规模、时间和产品名称都应保留不确定性。但路线信号已经足够清楚:模型能力的增长不会只押注一条轴。谁能同时把预训练做稳、把后训练做深、把推理成本压下来,谁才有机会把“更大的模型”变成开发者手里真正更好用的系统。
