[AINews] OpenAI 有望在 2026 年底达到 AGI 门槛
我们在 Latent Space 上向来回避 AGI 时间表的话题,因为这个概念定义模糊、又无需对结果负责,但事到如今,错过它恐怕才是更大的罪过。我们上次核对 OpenAI 的 AGI 时间表已是 9 个月前,而正如预期,首席科学家 Jakub Pachocki 如今表示,尚未发布的 Astra 模型正是他目标在 2026 年 9 月前得到的「自动化 AI 研究实习生」。Sam Altman 在TIME 采访中更进一步,估计他们将在 2026 年 12 月前于内部宣布实现 AGI。
prinz@deredleritt3rTime:- OpenAI 高层相信他们已站在 AGI 的门槛上。Sam Altman 相信 OpenAI 将在 2026 年底前拥有一个够格称为 AGI 的内部系统。Mark Chen 认为 OpenAI 已走完通往 AGI 之路的 80%。- OpenAI 已经拥有自动化 AI 研究实习生 - 这就是
TIME @TIMETIME 的新一期封面:2026 年,OpenAI 经历了核心人才流失、失控的 AI 智能体、重大官司,以及 AI 竞赛中不断加剧的竞争。“作为一家公司,我们显然有过一些失误,”OpenAI CEO Sam Altman 告诉 TIME。公司重启计划的内幕:下午 1:40 · 2026 年 8 月 26 日 · 74.1 万次浏览111 条回复 · 230 次转推 · 2210 个赞
计时开始。
2026 年 8 月 22 日至 24 日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,此外未再看其他 Discord。AINews 网站支持检索全部往期。提醒一下:AINews 现已是 Latent Space 的一个栏目,你可以自行选择订阅或退订邮件频率!
AI Twitter 回顾
开源机器人爆发:Hugging Face 与 Pollen 的 399 美元 Microduck
Microduck 发布:最抢眼的硬件发布当属 Microduck——这款来自 Pollen Robotics 与 Hugging Face 的 25 厘米开源双足机器人定价 399 美元,计划圣诞节前发货。它可在仿真中训练、再部署到真机,配有 15 个执行器,传感器配置也出奇地丰富,包括摄像头、扬声器、LiDAR、NFC、蓝牙与 Wi‑Fi。@pollenrobotics、@Thom_Wolf 与 @ClementDelangue 的发布推文都强调了基于强化学习的自定义能力,以及开箱即带的多个预训练策略。
技术上为何重要:有意思的不只是「便宜可爱的机器人」,而是整套产品设计:开放的仿真器、从仿真到硬件的迁移能力,以及便宜到足以吸引社区参与策略训练(而不只是围观演示)的形态。仿真器已通过一个 Hugging Face Space 公开(@HuggingApps 有推介),正是这种从社区训练到真机部署的开放闭环,让多位研究者当即下单,例如 @yacineMTB 与 @gneubig。
早期热度与社区实验:以机器人产品的标准看,这次发布的反响异常广泛。Thom Wolf 分享了多个实验,例如快速接入一个图像检测器,让机器人实时追随激光笔光点 @Thom_Wolf;随后他报告了每 5 秒售出一台的速度 @Thom_Wolf,之后又公布销售额突破 100 万美元 @Thom_Wolf。低价、开放仿真与具身强化学习三者叠加,让它成为近期记忆中最可信的「消费级物理 AI」发布之一。
GLM-5.3-Flash/Ox Alpha 揭晓与本地开源模型势头
Ox Alpha 揭晓为 GLM-5.3-Flash:最大的模型新闻之一得到确认:神秘模型 Ox Alpha 其实就是 Z.ai(智谱)的 GLM-5.3-Flash,@theo、@UnslothAI 与 @togethercompute 均有提及。各推文反复引用的公开规格为:总参数 320B、激活参数 18B、1M 上下文、混合注意力,在编程/智能体类基准上成绩亮眼。
开放权重 + 量化 + 本地部署:此次发布备受关注,是因为大家迅速把它接进了本地工作流。Unsloth 表示该模型可在 128GB 内存的机器上运行 3-bit GGUF @UnslothAI;@danielhanchen 则称4-bit 可保留 93% 精度,使其在 256GB Mac 或两台 DGX Spark 上就已实用。这正是开源模型工程师最关心的「发布后生态反应」:量化方案、部署配方与真实部署约束几乎立刻就位。
性价比叙事:多条推文把 GLM-5.3-Flash 奉为新的效率前沿。@togethercompute 称其在 DeepSWE 上几乎比肩 Luna,而同样预算下完成的工作量是两倍以上;@theo 说它好到足以让他重排自己的模型榜单;@zainhas 建议把推理力度设在 high 而非 max,因为精度大体持平、token 消耗却翻倍。Baseten 强调发布首日即实现 122+ TPS 的服务吞吐 @baseten;Databricks 则引用 270 tok/s,以及在 OfficeQA Pro v2 上以 1/10 成本取得比 GLM-5.2 高 10% 的质量 @Yuchenj_UW。
视频生成竞赛:Gemini Omni 1.1 Flash 与 H3 Max
Gemini Omni 1.1 Flash:Google 发布 Gemini Omni 1.1 Flash,一个多模态视频生成/编辑模型,带有多项面向开发者的控制:场景扩展至 40 秒、首帧/尾帧控制、3 秒视频引用、360p 草稿模式与 4K 放大。@Google 与 @GoogleAIStudio 官宣了此次上线,@_philschmid 则附提示词指南做了总结。最值得关注的产品细节是:Google 正在提供愈发显式的时间与引用条件控制,而不只是让人「把提示词写得更加用力」。
早期榜单成绩:@arena 报告 Omni 1.1 Flash 拿下文生视频 Arena 第一、图生视频 Arena 第二:领先第三名文生视频模型 20 分,在图生视频上较上一代 Gemini Omni Flash 提升 25 分。这并未终结所有定性争论,但说明 Google 最新的后训练与控制栈正在转化为真实的偏好数据。
fal + MiniMax H3 Max:与此同时,fal 携手 MiniMax 推出 H3 Max,宣传5 秒生成 15 秒高质量视频、比其他高质量模型「快 50 倍」@krea_ai;@fal 发布了技术解读,@MiniMax_AI 亦发文致意。两次发布共同的主题很清晰:在视频领域,推理优化与产品化的可控性如今已与基座模型质量同等重要。
智能体、Harness 与企业工具
Harness 成为一等公民:一个反复出现的主题是:模型能力越来越多地经由智能体 harness 来承载。@omarsar0 重点介绍了 JIT-Agent:模型围绕记忆、规划、动作协议与工具编排等模块自行合成 harness,报告显示其胜过现成智能体。另一方面,@dair_ai 分享了从智能体轨迹中归纳紧凑有限状态机的工作,暗示行为拓扑可能更多由部署脚手架塑形,而非底层 LLM。
智能体基础设施相关产品发布:Anthropic 发布了把 Claude Managed Agents 接入 Vercel Chat SDK 的 cookbook,提供带服务端 harness、会话管理与记忆的统一聊天层 @ClaudeDevs。Perplexity 在 Agent API 中为 GitHub、Slack、Google Drive 与 Datadog 添加了连接器 @perplexitydevs。Cursor 宣布了新工作流:创建 Web 应用、用 Origin 存代码并部署到 Vercel @cursor_ai。
更高信任级别的浏览器自动化:Nous 为浏览器操作类智能体完成了一次重要升级:Hermes Agent 现在可以像你一样浏览网页,使用你真实 Chrome 配置文件/登录态的托管副本 @NousResearch、@Teknium。这是显著的易用性跃升,但也实质改变了云端智能体的风险面:认证摩擦被抹平之后,按范围授权(scoped-permission)的设计变得更加紧迫。
安全、智能体失调与网络防御协同
OpenAI 牵头的网络防御联盟:OpenAI 发表公开信,Anthropic、AWS、Google、Microsoft、Oracle 等 116 家组织联署,呼吁全球范围内大幅加强网络防御、应对 AI 加持的攻击 @OpenAI;Sam Altman 强调「留给行动的时间不多」 @sama。无论政策立场如何,这都是当天最清晰的跨行业协同动作之一。
双盲前沿评估:Google DeepMind 宣布前沿 AI 双盲评估试点:在安全环境中,测试提示词与模型权重均不向对方暴露 @GoogleDeepMind。对从业者而言,其关键意义在程序层面:这是一次严肃尝试——让外部评估成为可能,同时任何一方都无须向对方完全摊开自己的资产。
智能体事件分析仍在推进:围绕 OpenAI/Hugging Face 智能体事件的讨论依旧活跃。参与调查的研究者分享了更多细节:大规模对话记录排查、智能体间的协作模式,以及后续蜂群明显在前人工作之上继续搭建 @RyanGreenblatt、@HjalmarWijk、@ajeya_cotra。@omarsar0 另有一篇关于 EvoMal 的论文摘要,警告共享技能库可能沦为编码智能体的自中毒恶意软件传播通道。这些拼在一起指向一个日益成熟的认知:多智能体系统带来的失败模式,既不是经典软件 bug,也不是标准模型评估问题。
热门推文(按互动量排序)
Microduck 占据心智高地:信号最强的产品热度围绕 @ClementDelangue 的 Microduck 发布推文、@Thom_Wolf 的技术发布推文串,以及 @Thom_Wolf 的后续销售里程碑展开。
Anthropic 的科学界动作落地:@claudeai 宣布面向科学家的 Claude Team 方案,覆盖 10,000 名研究者:标准席位免费,高级席位一年内每月 15 美元。
Hermes 浏览器访问成焦点:@NousResearch 因让智能体访问用户真实浏览器配置而收获大量互动——这是当前智能体工具中最具分量的 UX/安全权衡之一。