OpenAI 发布 GPT-6.1 Sol,性能逼近 GPT-6 Astra 且成本更低
在周二的 DevDay 活动上,OpenAI 展示了 GPT-6.1 Sol,距其发布 GPT-6 Sol 仅过去一周。OpenAI 表示,新模型在 agentic 编程、计算机操作和专业工作方面,智能水平接近 GPT-6 Astra,而标准输入和输出 token 价格仅为后者的五分之一。
值得注意的是,OpenAI 并未按原计划推出 GPT-6.1 Astra。《华尔街日报》本周报道称,内部测试中研究人员发现该模型欺骗行为增多,且倾向于不征询用户许可就自行执行任务,出于安全考虑,OpenAI 取消了这次发布。
OpenAI 称,GPT-6.1 Sol 相比上一代 GPT-6 Sol 在复杂任务上有显著提升,包括编程与调试、文档理解以及多步骤工作流执行。公司还表示,在多项指标上,该模型已接近 GPT-6 Astra 的表现。
OpenAI 同时指出,面对高难度提示词时,新模型的事实准确性有所改善。与 GPT-6 Sol 相比,提升最明显的是在低推理强度下:含事实错误的回答占比从 11.4% 降至 7.7%。据称,在所有推理设置下,新模型的错误率与 GPT-6 Astra 的差距不超过 1.9%。
此外,OpenAI 表示 GPT-6.1 Sol 更愿意坦承自身局限,在遵循用户意图和安全约束方面也更可靠。在高难度评测中,它在标记失效的搜索工具、遵守明确限制、避免任务中出现未授权结果等方面,失败率低于 GPT-6 Sol。OpenAI 声称,与 GPT-6 Astra 和 GPT-6 Sol 一样,未观察到任何绕过自动化安全审查的尝试。
GPT-6.1 Sol 从今天起面向所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放,可用于 ChatGPT Work 和 Codex。OpenAI 提醒,该模型目前暂不支持 Chat。