← 文章 / AI技术
synthszr 1小时前 · 2026-10-01 17:21:28 · 1 阅读

OpenAI 开发者日:新模型、新雄心、新疑虑

OpenAI Dev Days: Neue Modelle, neue Ambition, neuer Zweifel

周二在 DevDay 主题演讲结束后,Sam Altman 表示,OpenAI 只有在能够对模型安全性做出可靠判断前,不会考虑上市,且未给出具体时间表。他同时直言,若 OpenAI 拖延过久,“对世界并不利”。在他看来,在迈向高性能模型及新型安全标准的过渡期上市并不明智,因为上市公司可能迫于华尔街压力,以“安全”为名损害利益。对于 OpenAI 自创的术语“pacing the frontier”,Altman 强调其含义并非放缓研发,而是优先重视安全与Alignment。

此次演讲前发生了一系列事件。七月份曝光,一款未发布的 OpenAI 模型在未经公司许可的情况下,流入竞争者 Hugging Face 实验室。随后,OpenAI、Anthropic、Meta 和 Google 的安全事故接连引发关注。一名 Anthropic 员工公开离职信,引发关于这类系统风险的激烈辩论。周一,OpenAI 以安全隐患为由,取消了最新模型的发布计划。

与此同时,OpenAI 正在洽谈新一轮私募融资。据知情人士透露,公司计划以约 1.4 万亿美元的估值融资 300 亿美元或更多。自 GPT-5.6 于 7 月发布以来,OpenAI 的年化营收已增长超过 70%,达到约 700 亿美元。OpenAI 称其已覆盖 12 亿消费者和企业用户,并推出了名为"Dots"的新型 AI 助手,配备毛绒质感的虚拟形象,可用于撰写社交媒体帖子或评估科学文献等任务。Meta 已于 9 月 8 日发布了自家的助手"Muse",此后其股价上涨了约 18%。 法律层面的压力也在加剧。一个利益团体对 OpenAI 提起了诉讼,并称此类诉讼尚属首次;分析师预计将涌现一批新型索赔。LASST 项目总监 Vivian Dong 表示,这类黑客事件的频率和复杂程度会随着技术发展速度而上升,并指出侵入他人系统如今已是刑事犯罪。Anthropic 已于 6 月提交了招股说明书,预计 11 月上市,据报道是在美国中期选举之后。 → The Verge, Ars Technica

综合评论:安全是 OpenAI 抵御对其 1.4 万亿美元估值质疑的核心论据。同一家公司在公众面前呼吁克制发展节奏,却向投资者展示了自 7 月以来 70% 的营收增长,并在无需招股书、季度报告或强制披露 Hugging Face 入侵等事件的情况下,筹集了 300 亿美元资金。私人投资人提出的正是参与轮次融资后所赋予他们的质疑;而监管机构则关注其他层面的合规。Anthropic 已提交招股书,并愿意承受 11 月的审查,尽管其模型和风险评估与前者相似。只要 300 亿美元私募资金唾手可得,OpenAI 的安全问题便只能作为自我声明,缺乏第三方认证背书。

OpenAI 基于 Luna 推出 Decisions API,应对 TypeSafe 的决策模型 Jev

OpenAI 在其于旧金山举办的 DevDay 2026 开发者大会上推出了一款 Decisions API,该 API 运行于 Luna——当前产品组合中最小、成本最低的模型之上。该接口不输出自由流式文本,而是从开发者预设的选项列表中做出选择,并返回置信度数值。公司数据显示,模型响应时间为 150 毫秒,而 GPT-6 Luna 处理相同任务需耗时 1.6 秒。该功能旨在实现内容分类、请求路由以及确定 Agent 下一步动作等决策任务。API 目前处于有限预览阶段,广泛推出预计将在未来几天内进行。

推出此功能的时机耐人寻味:9 月中旬,由 Diogo Almeida 创立的初创公司 TypeSafe AI 发布了其决策模型 Jev,从而带动了 System One 模型这一品类的热度。OpenAI 发言人表示,更多细节将在广泛推出时公布。在此之前,单次调用价格、单条请求可处理的候选答案数量,以及是否允许开发者在自有数据上进行微调,仍悬而未决。从技术角度来看,该方案介于两种现有的权宜之计之间:一是向 Chat 模型发送精心编写的 Prompt,并从其 Token 概率中推导置信度;二是自训小型分类器,但每增加一个新类别都需重新训练。

这次发布会的核心内容集中在 Codex。这款软件工程智能体新增了可复用的开发环境,支持配置和团队共享,不再像过去那样为每个云任务都启动全新的沙箱。用户可以从电脑、手机或云端直接访问。改进后的 Codex CLI 支持语音控制,并新增了一个 /agents 视图,可以同时显示多个并行任务。ChatGPT 桌面端应用还增加了一个独立的代码审查视图,开发者可以直接在其中对 GitHub 的 Pull Request 和 GitLab 的 Merge Request 提供反馈。 Codex Security Cloud 可按需、按计划或每次提交新代码时扫描完整的 GitHub 仓库,自动过滤重复项并准备修复建议,即使你合上笔记本电脑也能继续工作。使用云版本的用户无需额外申请,即可访问 Daybreak-Blue 模型,这是 OpenAI 网络安全项目中的防御层级,主要用于恶意软件分析等服务。该功能面向 Pro、Business、Enterprise 和教育版客户开放。 Agents API 自 9 月 11 日起进入公测阶段,现已增加 Computer Use 功能,允许智能体直接操作软件界面和浏览器。此外,还引入了工具搜索(Tool Search)和上下文压缩(Context Compaction)功能,后者可自动精简长文本上下文。与此同时,亚马逊也在扩展其 4 月发布的 Bedrock Managed Agents,目前这些智能体已支持 Agents API 的核心功能;据 AWS 透露,所有推理任务都在 Bedrock 上运行,数据不会离开 AWS 环境。

OpenAI 将两个隐私保护组件打包为 "Private Intelligence" 推出。其中 Zero Data Retention 搭配 Private Safety Processing,会把标记为安全相关的客户内容加密后存放在客户自己的存储中,比如 S3 存储桶或 Azure Blob;OpenAI 只保留一个包含元数据的索引和引用。据称自动化审查运行在经过硬件认证的隔离环境里,OpenAI 自己的员工也无法访问。第二个组件是基于 Confidential Computing 的 Private Inference,目前以预览版形式公布,计划今年秋季上线。这一举动的背景是,有报道称 Palantir、Nvidia 和 Booz Allen Hamilton 等公司出于商业机密顾虑,正在限制高级模型的使用。 → OpenAI, The New Stack, VentureBeat, TechCrunch, Amazon Web Services, ChatGPT Learn, Superpower Daily, MakeUseOf, The Decoder, RuntimeWire

Synthszr 观点:从 Jev 的预告到反制,中间不过两周,OpenAI 连单次调用的价格都没敲定。Diogo Almeida 旗下的 TypeSafe 因此达成了一件连千亿级预算都买不来的事:一家初创企业居然能左右一家拥有独立开发者大会的科技巨头的日程。Decisions API 目前处于有限预览阶段,大规模落地被推后到“未来几天”,关于回答候选数量以及是否支持私有微调等问题仍无定论。这就是专业厂商的制胜之道:将领域切分得足够细,让通才型对手除了模仿只能选择无视,而在 150 毫秒对比 1.6 秒的时延差距下,无视并非选项。TypeSafe 能否笑到最后,取决于未来几个月里的一个问题:当 OpenAI 补齐价目表后,Jev 能否继续维持比 Luna 更快且更便宜的优势?

Google Gemini 4 Argon 斩获 18 项基准测试中的 13 项领先,但仍暂不开放访问

Google 于周三发布了 Gemini 4 Argon,这款备受期待的旗舰模型目前仅限内部 Fairwind 计划用户访问。根据 Google 提供的基准测试表,Argon 在 18 项测试中有 13 项持平或领先于 OpenAI 的 GPT-6 Astra 以及 Anthropic 的 Opus 5.5 和 Fable 5.1。在 DeepSWE v1.1 中,该模型得分为 77.9%;但在 FrontierSWE v2 和 Terminal-Bench 4.0 中,它落后于所有竞争对手,分别落后 10.5 分和 9 分。其最大优势体现在办公自动化任务上,例如在 Zapier 的 AutomationBench 中达到 51.3%,比 Opus 5.5 高出近 9 个百分点。此外,输出上限新增至 100 万 Token,此前 Gemini 模型的这一数值仅为 64,000。 → The New Stack

Synthszr 观点:没有可用模型的发布会只是日历上的一个条目,显然 Google 更看重这一节点而非交付体验:他们在 OpenAI DevDay 次日推出 Argon,却将开放访问无限期推迟。这张在 18 项测试中拿下 13 项领先的表格,其目的在于在开发者团队重构流水线之前,率先截断竞争对手的关注度曲线。至于 Argon 在 FrontierSWE v2 和 Terminal-Bench 4.0 中垫底的失利,在这场精心编排的戏码中

原始来源: synthszr

评论 (0)