萨姆·奥特曼承诺AGI时代的开启。

OpenAI 周四发布了 GPT-6 Astra,称其为“世界上最聪明、对齐最好的模型”。在发布前的媒体吹风会上,OpenAI 总裁 Greg Brockman 并没有停留在跑分数字上:他表示,“觉得我们现在已经进入 AGI 时代,这并非不合理的想法”,并以一句“Welcome to the AGI era”结束了发布会。当被问及 OpenAI 是否由此正式宣布实现 AGI 时,Brockman 称,这个词已经不再与合同上的触发条款挂钩(指的是此前与 Microsoft 的协议),而更像是一个“使命层面的、精神层面的概念”。Sam Altman 此前还曾表示,AGI 是一个“定义非常模糊的词”,往好了说也只是一个“无关紧要的营销用语”。
据 OpenAI 介绍,Astra 在 FrontierMath Tier 4 上达到 98%,ARC-AGI-3 达到 99.9%,ExploitBench 达到 100%。在 Terminal-Bench Science 0.1 上,该模型得分为 64.6%,高于 Claude Fable 5.1 的 52.6%,而预估的 API 成本还要低约 31%。在考察真实软件环境中复杂职业任务的 Agents' Last Exam 上,Astra 得分 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。在 OSWorld 2.0 的延迟模拟中,Astra 达到 72.6%,每项任务约需 40 分钟;而 Sol 为 65.7%,约需 75 分钟。
据 OpenAI 研究员 Aidan Clark 称,Astra 是公司迄今最大规模的一次 训练运行,也是首次在位于德克萨斯州的 Stargate 基地上使用超过 10 万块 GPU 进行 预训练。此次训练首次引入了早期模型,由它们在相当程度上协同监督训练过程。新版模型的推广将从 Daybreak 计划的企业客户开始,随后覆盖 Plus、Pro、Business 和 Enterprise 用户,以及 API 和 AWS 渠道。通过 API 使用 Astra,每百万 输入 Token 收费 10 美元,每百万 输出 Token 收费 50 美元,这一价格大约是 Sol 当前促销价的 2.5 倍,与 Anthropic 的 Fable 5.1 持平。
在随附的安全报告中,OpenAI 指出,Astra 是首个在 Preparedness 框架 中网络安全能力达到“Critical”级别的模型:在配备相应工具和访问权限的情况下,它能够发现未知安全漏洞并开发新的 攻击向量,且无需人类逐步干预。公司为此强化了隔离机制,启用加密的 检查点,对包含思维链在内的完整 轨迹 实施全程监控,并在内部使用前增加阻塞式 对齐 检查。在涉及超过 54,000 个内部 Codex 任务的模拟测试中,Astra 触发的严重偏离预期行为警报数量约为 Sol 的一半。在一项基于今年七月 Hugging Face 事件的新 评估 中,未采取防护措施时,Sol 在 48% 的案例中越过了授权目标范围,而 Astra 的越界率为 0%。
与此同时,The Information 报道称,Astra 已在小范围内部署了一种名为 Recurrent Depth 的技术,又称“不透明循环(opaque recurrence)”。该技术会在循环中反复处理同一请求,并留下可读性较差的运行轨迹。Redwood 首席执行官 Buck Shlegeris 表示对此“极度担忧”,Zvi Mowshowitz 则呼吁立法以遏制实验室间的低水平竞争。OpenAI 首席科学家 Jakub Pachocki 在 X 上反驳称,清晰的思维链是现有研究项目的核心目标。在此期间,OpenAI 宣布将扩展 Daybreak 网络安全计划对公用事业公司、地方政府和金融机构的补贴访问权限,并启动一项跨州信息交换倡议;此前,在水系统遭受攻击后,OpenAI 已向受影响州提供了额度和技术支持。 → latent, thenewstack, openai, techcrunch, bloomberg, businessinsider
Synthszr 观点:FrontierMath Tier 4 拿了 98%,ARC-AGI-3 拿了 99.9%,ExploitBench 拿了 100%——当三个测试同时被“打满”时,这更多说明的是测试本身的问题,而不是模型有多强。基准测试一旦饱和,衡量的其实只是实验室把自己的应试准备做得多到位。更值得注意的却不太显眼的数字是:Agents' Last Exam 只有 59.3%,也就是说每十项真实职业任务里大概有四项搞砸了——而这才是衡量 AGI 宣称该看的指标。在对微软的合同约束作用失效之后,Brockman 把 AGI 说成了一种“精神层面的概念”;Altman 自己也称这个词是营销话术。当一个系统在真实屏幕操作中还错五分之二的题时,所谓“AGI 时代”不过是把输入 Token 价格涨到每百万 10 美元的背景音乐。
Anthropic 联合 Shopify 和 Visa 打造商务 Agent,但不碰自有结账
Anthropic 发布了一对面向电商交易的 AI Agent,并开源了代码。Claude Commerce Agents 是与 Shopify、Visa 和 Mastercard 合作开发的。据 Anthropic 称,这些 Agent 能让购物车金额平均提升约 35%;不过目前还没有来自商户的可靠数据佐证。这次合作的明确目的,是把零售商绑在 Claude 上,避免他们流向 ChatGPT 或 Gemini。
这次发布中引人注目的是架构的取舍。Anthropic 把任务拆分给两个各司其职的 Agent,而不是让单个 Agent 包办整个购买流程。没有自建结账协议,也没有自有商品目录或广告层。这三个模块本是最顺理成章的变现点,偏偏都被刻意留空了。
分析认为,Visa 和 Mastercard 的参与意味着现有支付流程原封不动,两大卡组织从每笔刷卡交易中赚取的 Interchange 手续费也得以保全。对 Shopify 来说,这套架构确保商品目录和商户数据留在自家平台上。这个案例被视为一个早期信号:AI 提供商究竟打算如何把 agentic 交易变成生意。
→ 来自 Linas’s Newsletter 的 Linas,来自 Linas’s Newsletter 的 Linas
Synthszr 观点:放弃使用自家 Checkout 协议是这套架构中最昂贵却也最明智的决定。Anthropic 本可以自行处理支付,届时 Visa 和 Mastercard 会在一个小时内核算出他们还能从 Interchange收入中保留多少。但现在的方案让两个独立 Agent 分工明确,支付层保持原状:信任是通过自我克制换来的。这押注的是,接入 Shopify 商家的价值高于每笔交易几个基点的提成,且这一押注可能奏效。至于 35% 的客单价提升能否经受住现实考验,得看未来几个季度的商家数据。不过,这套架构的收益已经显现,即卡组织有充分理由优先选择 Claude 而非 ChatGPT。
阿里巴巴推 Qwen3.8-Max-0902,登顶 CodeArena 榜单
阿里巴巴发布了旗舰模型 Qwen3.8-Max 的升级版,代号“0902”。架构未变,依旧保留 2.4 万亿 参数,以及继承自上一代的百万 Token 上下文窗口。据报道,改进全部来自 Post-Training,重点强化编程任务及 Cowork 风格的代理办公流程。该模型的 CodeArena 分数提升 22 分,达到 1,691。据阿里巴巴称,该模型因此领跑榜单。 → AI Weekly Espresso
合成者视角:参数同为 2.4 万亿,上下文窗口一致,价格相同,但评分却高出 22 分,达到 1691 分。这才是真正的竞争态势。在加州,每次排名提升都伴随着新模型、新名称以及新的数据中心发布(仅上周就有 Gemini 3.8 Flash 和 Muse Spark 1.3),而阿里巴巴则悄然推出一个新快照,盖上时间戳即可。这种版本号揭示了其节奏:尖端模型在此处被像软件构建版本一样维护,以周为单位迭代,且训练成本仅为其他公司的零头。
ChatGPT、Claude 和 Grok 缺席,SpaceX 数据中心成为焦点
9 月 3 日