越壑知途 11小时前 · 2026-09-06 08:27:48 · 3 阅读
OpenAI最强模型GPT-6 Astra 发布:接近满分的成绩单,和一场关于 AGI 的争论
当一家公司为同一个产品给出两种截然相反的评价,这件事本身就值得拆开看。9月3日(美东时间)晚间,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,并称之为一次“代际跃迁”。总裁 Greg Brockman 在发布会最后说:“欢迎进入 AGI 时代。”而就在两天前,CEO Sam Altman 才公开表示,AGI 充其量是一个“定义非常糟糕的术语”,甚至称它“像一个无关紧要的营销术语”。一个模型,两种判断。谁对谁错,不能靠口号,要看实测。这篇文章不打算复述发布会,而是把 Astra 的实测数据、独立评测和可复现的验证方法摆出来——它到底强在哪、哪些分数要打问号、以及为什么说它可能真的改变了游戏规则。01 发生了什么:一次把“能说”变成“能干”的发布
Astra 是 OpenAI 首次将 “Astra” 作为旗舰模型后缀命名的产品,也是继 GPT-5 系列之后最具分量的一次更新。它首次在得克萨斯州 Stargate 数据中心、用超过 10 万张 GPU 完成训练,官方给它的标语很直白:“你在电脑上能做的任何事,Astra 都能替你做。”这句话不是比喻。OpenAI 把 Astra 定位为“专为执行计算机任务而生的模型”——控制应用程序、填写电子表格、搭建网站,而不是仅仅描述怎么做。它的工作方式也不再依赖软件开发商预先写好 API 接口,而是像人一样直接“看”屏幕上的像素,然后移动鼠标、敲击键盘完成操作。这意味着无论是最新的设计软件,还是公司内部运行了十年的老 ERP 系统,Astra 都能直接上手。接入节奏上,Astra 先向“可信访问”项目和 Daybreak 网络安全项目中的有限企业组织开放,未来几天陆续覆盖 ChatGPT Plus、Pro、Business 和 Enterprise 用户,并同步上线 OpenAI API 与亚马逊 AWS(Bedrock)。也就是说,你现在很可能还没用到它,但它已经进入真实的生产环境了。02 一张接近满分的成绩单(实测数据)
先把最硬核的分数摆出来。以下数据来自 OpenAI 官方发布材料、ARC Prize Foundation 与 Artificial Analysis 的独立评测(截至 2026 年 9 月 4 日):【抽象推理 ARC-AGI-3】Astra 最高 99.9%,上一代 GPT-5.6 Sol 为 7.8%,Claude Opus 5 为 30.2%。这是衡量模型在陌生环境中“自己学会怎么办”的核心测试——没有说明书、没有规则,只能靠探索试错。【数学 FrontierMath Tier 4】Astra 97.6%,Sol 为 83.0%。官方表示,Astra 已帮助解决数学领域长期悬而未决的开放问题,包括在素数间隔研究中取得两项新的理论结果。【电脑操作 OSWorld 2.0】Astra 72.6%,Sol 为 65.7%。更关键的是速度:完成同样任务,Sol 平均约 75 分钟,Astra 只要约 40 分钟,效率提升近一半。【终端编程 Terminal-Bench 4.0】Astra 57.9%,Sol 37.3%,Claude Fable 5.1 为 55.8%。【自主科研 Terminal-Bench Science 0.1】Astra 64.6%,Fable 5.1 为 52.6%,且估算 API 成本低约 31%。【业务流程自动化 Automation Bench】Astra 41.4%,上一代 Sol 仅 18.1%,翻倍有余。【网络安全 ExploitBench】Astra 100% 满分,Sol 为 78.5%。它也是 OpenAI 首个达到内部“准备度框架”中“关键”级网络安全能力门槛的模型——在拿到工具和权限后,可以自主寻找此前未知的漏洞并开发利用方式,不再需要人类逐步指导。03 “少说,多想”:这次发布真正的主线
如果只记一句话,Astra 的主线是“更少的字,干更复杂的活”。OpenAI 给出的证据分散在多个场景里:最高档设置下,Astra 的输出 Token 比 Claude Opus 5 少约 65%;独立评测机构 Artificial Analysis 的 Coding Agent Index 测试显示,Astra 的 Token 用量只有 Sol max 档的三分之一、Opus 5 xhigh 档的五分之一。Token 不是玄学,它是成本、是延迟、是能塞进多少任务。Astra 用更少的推理步骤完成同一件事,意味着同样的预算能跑更多任务,也意味着长任务里“写写删删”的浪费更少。这一点可以自己验证,不需要信宣传。Responses API 的返回体里有一个 usage 字段,包含精确的输入、输出和推理 Token 数。把同一批真实任务分别丢给 gpt-6-astra 和 gpt-5.6-sol,对比两边 output_tokens 的比值——在多步智能体任务上,这个比值大概率落在 0.3 到 0.5 之间(Astra 只写 Sol 的三到五成)。用官方给的标价把 Token 数乘成钱,就是每个任务的真实成本。官方的演示案例同样能说明问题:给 Astra 一张电路原理图,它在 KiCad 里独立完成元器件布局和布线,用时 2 分 54 秒;寻找猫咪临时看护,要大量搜索、比对、汇总成文档,Astra 用时 5 分 27 秒,而 OpenAI 给出的人类对照基线是 30 分钟;求职准备——搜索岗位、匹配简历、整理申请流程——Astra 用时 2 分 51 秒,人类基线是 5 小时。04 从“能说”到“能干”:它开始替你干活了
Astra 的能力升级不只在跑分。它在办公场景强调“遵循模板”:给它几页公司 PPT,它能按同样的布局、语气和视觉风格补完整套;处理文档和表格时只挑真正相关的信息,而不是把上下文复述一遍。填表、更新 CRM、整理日历、在线调研后生成报告、制作财务模型、分析科研数据、搭建网站、设计 PCB 电路板、创建 3D 游戏场景,都在 OpenAI 明确列出的场景里。软件工程是提升最明显的领域之一。配合新版 Codex Harness,Mind2Web 网页任务完成速度是 Sol 的 1.9 倍;内部数据库迁移任务得分 63.9%,Sol 为 42.7%;SRE-Bench(系统运维)单次尝试解决 88.0%、四次尝试 99.2%,Sol 分别为 55.9% 和 68.7%。Codex 还加入了一个长任务上下文机制:模型能在不同上下文窗口间保存自己的笔记,同时完整上下文依然可搜索,解决了过去“任务太长就压缩、压缩就丢细节”的痛点。另一面是行为更克制。OpenAI 公布的电脑操作安全压力测试中,Astra 的不当行为率 2.4%,Sol 高达 22.0%;能力幻觉率从 9.4% 降到 2.0%。越狱鲁棒性也显著优于 Sol——在涉及 5.4 万个内部 Codex 任务的模拟测试中,Astra 严重未对齐行为标记约为 Sol 的一半。05 代价:能力翻倍,价格也翻了
强是有代价的。Astra 的 API 定价为每百万输入 Token 10 美元、每百万输出 Token 50 美元;对比上一代 Sol(输入 4 美元、输出 20 美元),输出价格翻了 1.5 倍、总价翻了一倍多。缓存读取享 90% 折扣,推理强度从 low 到 max 五档可调,Batch 与 Flex 半价。参数层面:上下文窗口 105 万 Token,最大输出 12.8 万 Token,知识截止 2026 年 4 月 30 日,支持文本与图像输入、文本输出,支持网页搜索、文件搜索和代码执行。一个需要注意的坑:单次输入超过约 272K Token 会整单按长上下文价计费(输入 20 美元、输出 75 美元),长文档任务要提前切块。所以“更少 Token”不只关乎体验——它直接决定 Astra 在涨价之后,单任务成本能不能真的压下来。这也是为什么官方和第三方都在强调效率,而不是单纯堆分数。06 99.9% 背后的两个问号
成绩单很亮眼,但有两个问号必须打上。第一,99.9% 是有条件的。ARC Prize 自己的博客把 Astra 的成绩拆成两套测试工具:在厂商中立、所有模型统一的 Standard harness 下,Astra 最高只有 62.7%;拿到 99.9% 的 Provider Adapter harness,是允许 Astra 使用 OpenAI 专门设计的上下文管理机制、保留推理状态并压缩超长对话的“特制环境”。OpenAI 官方也注明,如果用同一套工具,Sol 的对比分大约在 30% 而不是 7.8%。ARC Prize 的结论是:这是“前沿能力的阶跃式变化”,但“不宣称这是 AGI”。第二,OpenAI 高层自己都不统一。Brockman 说“我个人认为,我们可能已经到达 AGI 了”,Altman 则说 AGI 是“无关紧要的营销术语”。这背后是真实的竞争压力:Anthropic 的 ARR 已超过 650 亿美元、估值 9650 亿美元,双双压过 OpenAI;英国《金融时报》把 Astra 的发布视为 OpenAI 在上市前重新确立技术领先地位的一次反击。发布后,OpenAI 的 Pre-IPO 衍生品市值一度飙升 21.6%、达 1.48 万亿美元。另一个插曲是“首日翻车”:上线数小时,部分付费用户被挡在门外无法使用,Altman 随后紧急道歉。发布顺利与否和产品成不成熟,是两回事。还有一点需要留意:普通用户拿到的是“受限版”。因为 Astra 的网络安全能力达到“关键”级,面向大众的版本只用于安全代码审查和漏洞修复,会拒绝更高级的利用任务;限制更少的版本,之后通过 Daybreak 计划面向防御场景逐步开放。能力越强,防的是谁,也是问题。07 接下来该看什么
对普通用户:未来几天 Astra 会陆续进入 ChatGPT Plus、Pro 等订阅,建议先用真实任务试一遍——让它做一份 PPT、处理一次表格、完成一次多步操作,感受“像人一样操作电脑”到底好不好用,而不是只看跑分。对开发者:不要听信任何一方的宣传。拿自己的仓库任务跑一遍 usage 字段对比,用真实成本和通过率做决策。多步智能体任务里 Astra 的 Token 优势最明显,短问答场景差距则小很多,那时 Sol 的价格优势更实在。对行业:接下来真正值得关注的是三件事——Astra 能否在真实生产环境稳定复现演示效果;OpenAI 与 Anthropic 的竞争会把“最强模型”的定义推向哪个方向;以及“关键级”网络安全能力的分级开放,会如何改写 AI 安全监管的规则。关于 AGI,Brockman 说“可以留给外界判断”。而 ARC Prize 说得更克制:饱和一个基准,不是 AGI 的证明。Astra 到底是不是那个转折点,数据会说话——但先别急着下结论,让它多跑几轮真实任务再说。
原始来源: 越壑知途