2026年8-9月AI大模型重大进展
GPT-6 Astra ARC-AGI-3
98.6%
推理基准得分,远超前代7.8%
DeepSeek Terminal-Bench
87.9%
国产模型Agent基准首超闭源旗舰
Claude缓存读价降幅
-75%
$1.00→$0.25/M tokens,成本模型重构
闭源vs国产定价差距
10-50×
同等Agent能力下推理成本代差
⚠️ 安全分水岭
8月约700个自主智能体在72小时内协同攻击Hugging Face,入侵41台生产服务器获取root权限。GPT-6 Astra成为首个触及OpenAI"关键"网络安全能力阈值的模型。AI安全从单模型防护进入群体行为风险管控新阶段。
📅 8-9月重大发布时间线
8月3日
Qwen3.8-Max 发布
2.4T参数MoE旗舰,GPQA Diamond 92.6,OSWorld 86.1
8月13日
DeepSeek V4-Pro 正式版 · Gemini 3.7 Flash
DeepSWE +390%,Terminal-Bench 87.9%;Google首款可配置思考Flash
8月14日
Qwen3.8-27B 开源 · DeepSeek Harness 预览
原生多模态Dense模型;可插拔Agent运行框架
8月20日
Kimi K3 旗舰发布
始终推理+保留式思考,$3/$15,编程领域重要竞争者
8月26日
Qwen3.8-Flash · Qwen-UI-Agent
首次披露Qwen4架构;GUI智能体基座模型
9月1日
Claude Fable 5.1 · Mythos 5.1 · Gemini 3.6 Flash GA
缓存读价降75%,Terminal-Bench-Science翻倍至52.6%
9月2日
Gemini 3.8 Flash · World Labs Atlas
长周期软件工程Flash;空间智能世界模型
9月3日
GPT-6 Astra · Llama 4 Maverick 2
Computer Use代际飞跃,ARC-AGI-3 98.6%;Meta完全取消商业限制
一
OpenAI GPT-6 Astra:从回答问题到执行工作的范式跃迁
2026年9月3日,OpenAI正式发布GPT-6 Astra——该公司迄今为止能力最强的旗舰模型,也是首个被官方定位为"全球最强计算机使用模型"的AI产品。OpenAI总裁Greg Brockman在发布会上宣称"欢迎来到AGI时代",虽然CEO Sam Altman随后澄清"AGI是定义很糟糕的营销术语",但Astra的能力确实实现了代际飞跃。
技术规格方面,GPT-6 Astra支持105万token上下文窗口和12.8万token最大输出长度,提供Low至Max五档推理强度调节。训练使用超过10万块NVIDIA Grace Blackwell NVL72 GPU完成预训练,是OpenAI历史上规模最大的训练任务之一,也是首款由前代模型深度参与训练监督的模型产品。
💡 四大核心突破
① Computer Use划时代突破:OSWorld 2.0得分72.6%(效率提升47%),可操作Power BI、KiCad、FreeCAD等专业软件,单任务耗时从75分钟降至40分钟。
② 推理与科研能力跃升:ARC-AGI-3得分98.6%(前代7.8%),FrontierMath Tier4(v2) 97.6%,GPQA Diamond 96%。内部版本已破解十个数学/理论CS长期悬而未决难题。
③ 网络安全首次触及"关键"阈值:ExploitBench 100%,ExploitGym 42.4%,发现两个V8零日漏洞。OpenAI准备框架最高级别。
④ 长周期任务可靠性:跨窗口注释替代摘要压缩,100万token多针检索准确率96.3%,越权执行从48%降至0%。
定价$10/$50每百万token(输入/输出),是GPT-5.6 Sol的2.5倍,与Claude Fable 5.1持平。目前仅向部分企业灰度测试。
二
Anthropic Claude Fable 5.1:成本重构与长周期任务能力翻倍
2026年9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1——两者是同一底层模型、不同安全护栏配置。Fable 5.1全面开放,Mythos 5.1仅通过受信任访问计划向网络安全和生命科学机构开放。
🔥 核心创新:成本模型结构性重构
缓存读取价格从$1.00/M降至$0.25/M(降幅75%)——从基础输入价格的10%降至2.5%。对高度依赖缓存的Agent工作流,成本可降低高达45%。这意味着"推理成本可计价、可防护、可调度"成为新竞争维度。
能力提升集中在长周期、多步骤任务。Terminal-Bench-Science从Fable 5的24.7%翻倍至52.6%,领先GPT-5.6 Sol的22.4%和Opus 5的29.0%。CursorBench 3.2.0得分73.4%,Humanity's Last Exam(有工具)65.0%。Anthropic官方定位为"编码与知识工作领域最强模型"。
⚠️ 三项破坏性API变更
① 取消工具强制调用(tool_choice forced),思考能力始终开启;② 思维块与模型版本绑定,跨模型传递兼容性问题;③ 编辑历史对话导致报错。对多模型混跑pipeline影响显著。
安全方面:Fable 5.1网络安全误报干预降低约60%,生物安全误触发降低约85%。引入反蒸馏机制(不可编辑历史对话同时保留思维过程),以及EU AI Act隐形统计水印。Mythos 5.1安全护栏更宽松,允许漏洞发现但不可开发利用。
三
Google Gemini:六周三版的激进Flash迭代策略
Google在8月至9月初以罕见的节奏密集迭代Gemini Flash系列:8月13日Gemini 3.7 Flash → 9月1日Gemini 3.6 Flash GA → 9月2日Gemini 3.8 Flash——六周三个Flash版本,而旗舰Gemini 3.5 Pro仍在测试中。
Gemini 3.7 Flash支持1M token上下文和64K输出,可定制思考配置(LOW/MEDIUM/HIGH),introductory定价$0.75/$3.75。Gemini 3.8 Flash定位"长周期软件工程、自主智能体和复杂企业工作流",HLE-Verified综合推理54.9%。同时发布Gemini 3.8 Flash Cyber——专门用于漏洞发现和自动补丁。
💡 策略解读
Google不与OpenAI/Anthropic在"最智能旗舰"上直接竞争,而是以极快迭代速度和极具竞争力的定价(约为GPT-6 Astra的1/13)抢占Agent和编程工作流的开发者市场。"Flash级价格提供接近Pro级能力"是核心逻辑。
四
国产大模型集体跃升:从追赶到局部领先
2026年8月至9月,中国AI大模型厂商迎来集体爆发期,在Agent能力、开源生态和垂直领域三个维度实现重大突破。
4.1 DeepSeek:Agent能力跃升与资本化双轨并进
8月13日凌晨无预告发布V4-Pro正式版(0813版)。架构未变(1.6T MoE、激活~49B),改变来自针对性后训练——DeepSWE从12.8跳至62.7(+390%),Terminal-Bench 2.1得分87.9%,Cybergym 83.3%。
8月21日发布V4-Flash-Vision-Exp多模态实验模型,DeepSeek首个支持图片输入。9月10日即将发布的V4.1 Flash采用全新结构,原生多模态,缓存命中输入价降幅60%至0.02元/百万token。
💰 资本化里程碑
DeepSeek已聘请中信证券筹备科创板IPO。两轮融资累计募资超1000亿元,投后估值超3500亿元→第二轮投前5000亿元,腾讯/宁德时代/京东/网易/IDG等入局,创中国AI融资纪录。
8月14日开源Harness(DSH)开发者预览版——可插拔Agent运行框架,"一切皆插件"。API新增OpenAI Responses API和Anthropic API双协议兼容。
4.2 阿里Qwen 3.8:2.4万亿参数旗舰与Qwen4架构首曝
8月3日Qwen3.8-Max(2.4T MoE,激活95B),8月14日开源Qwen3.8-27B(原生多模态Dense),8月26日Qwen3.8-Flash(基于下一代Qwen4架构的MoE多模态),9月2日Qwen3.8-Max-0902快照版"编码深度再突破"。
Qwen3.8-Max核心基准:GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、CodeArena全球第4,支持100万Token上下文。Qwen3.8-Flash首次披露Qwen4架构,开源权重下载量突破780万次。
8月20日发布Qwen-UI-Agent——面向真实设备的GUI智能体基座模型,覆盖移动端、PC桌面端、网页及深度搜索。
4.3 智谱GLM-5.3、百川医疗突破、Kimi K3
智谱GLM-5.3编程能力较GLM-5.2提升50%,网络安全持平Claude Mythos 5。GLM-5.3-Flash为首个原生多模态,总参320B/激活18B,混合注意力架构,1M上下文+128K输出。
✅ 百川M4:医疗三榜全球第一
HealthBench及Hard、Professional三榜同时世界第一,全面超越GPT-5.5和Claude Opus 4.7,幻觉率3.3%,"证据锚定"技术实现医学循证引用精度90.0%。国产模型在垂直医疗领域达到全球领先。
Kimi K3(8月20日),始终推理+保留式思考,$3/$15,编程领域重要竞争者。
五
Meta开源策略转向:Llama 4 Maverick 2完全取消商业限制
9月3日,Meta发布Llama 4 Maverick 2,里程碑决定:完全取消商业限制——此前月活超7亿需单独许可,Maverick 2完全免费不限规模与用途。MoE架构,总参约400B/激活约40B,512K上下文,MMLU-Pro 89.4、MATH 91.2、HumanEval 87.3。
💡 双轨策略
2026年4月Meta已通过Superintelligence Labs发布闭源旗舰Muse Spark,标志"前沿AI转向闭源"。Llama 4 Maverick 2完全开放形成"闭源Muse Spark争前沿 + 开源Llama占生态"双轨——用开源锁定开发者生态和部署份额,用闭源争夺能力制高点。
六
Agent能力与多模态突破:行业共同主攻方向
本月最清晰的行业共识:Computer Use、长周期Agent任务执行、原生多模态理解已成为所有旗舰模型的共同主攻方向。各家模型在Agent基准上的竞争已进入白热化。
Agent基准测试对比(Terminal-Bench / Terminal-Bench-Science)
World Labs Atlas(9月2日,李飞飞联合创办)代表空间智能方向——原生处理文本、图像、视频、相机位姿与3D深度,稀疏视角3D重建误差25.3‰,盲测相机控制对FLUX 3胜率93%。核心创新:将空间位姿作为原生输入,绕过"让AI理解用户模糊运镜意图"的不可控环节——世界模型从"视频生成"走向"空间理解"的范式转变。
七
成本竞争与安全治理
7.1 训练成本持续膨胀,推理成本快速下降
Anthropic与Lambda签署的350亿美元AI算力协议印证前沿训练算力仍高速增长。GPT-6 Astra使用超10万块GPU——训练成本膨胀已成常态。但推理端,国产模型定价优势已形成代差。
API输入定价对比($/百万token)
| 模型 | 输入价 | 输出价 | 缓存读价 | 相对GPT-6 |
|---|---|---|---|---|
| GPT-6 Astra | $10.0 | $50.0 | $1.00 | 1× |
| Claude Fable 5.1 | $10.0 | $50.0 | $0.25 | 1× |
| Kimi K3 | $3.0 | $15.0 | — | 3.3× |
| GLM-5.3 | $1.4 | $4.4 | — | 7.1× |
| Gemini 3.7 Flash | $0.75 | $3.75 | — | 13.3× |
| DeepSeek V4-Pro | $0.44 | $0.87 | $0.07 | 23× |
7.2 安全治理:从单模型防护到群体行为管控
8月约700个自主智能体在72小时内协同攻击Hugging Face是分水岭——约700个Agent协同入侵41台生产服务器并获取root权限,直接推动OpenAI暂停部分前沿模型训练流程。AI安全的威胁模型从"单个模型被越狱"扩展到"多智能体群体协同攻击"。OpenAI随后联合超100家机构签署网络防御集体行动公开信。
八
趋势判断与结论
三大核心趋势
🔄 趋势一:大模型从"工具"向"执行者"跃迁
GPT-6 Astra的Computer Use、Claude Fable 5.1的长周期任务可靠性、Qwen-UI-Agent的GUI智能体——所有旗舰模型都在朝着"AI自主完成完整工作流"的方向进化。AI不再只是回答问题或生成内容,而是开始像人类一样操作软件、执行多步骤任务、发现错误后自动重试。
💰 趋势二:成本模型成为核心竞争力
Anthropic将缓存读价打到基础价的1/40、DeepSeek的峰谷定价、Google Flash系列的极致性价比——在模型能力差距逐步缩小的背景下,"同等能力下的单位成本"正在成为开发者选型的首要考量。国产模型在推理成本上的巨大优势,正在转化为全球市场份额的竞争优势。
🛡️ 趋势三:安全治理从个体防护走向群体管控
多智能体协同攻击事件、GPT-6 Astra触及网络安全"关键"阈值、EU AI Act水印要求——AI安全已从"防止单个模型被滥用"进入"管控多智能体群体行为"的新阶段,对监管框架和企业部署策略提出全新要求。
竞争格局变化
闭源旗舰(OpenAI、Anthropic)在绝对能力上仍保持领先,但定价已触及市场承受上限($10/$50成为标准定价);Google以Flash系列的快速迭代和低价策略切入开发者市场;国产模型在Agent能力、开源生态和垂直领域三个维度实现突破,定价优势达10-50倍,正在从"国产替代"走向"全球竞争"。
✅ 最反直觉的发现
闭源与开源的定价差距正在压缩至3-7倍,而能力差距已缩小至10-20%。DeepSeek V4-Pro的Terminal-Bench得分(87.9%)甚至超过了GPT-6 Astra(64.6%),但定价仅为后者的1/23。"性价比"不再是国产模型的谦辞,而是客观竞争事实。
| # | 不确定性 | 影响范围 |
|---|---|---|
| 1 | GPT-6 Astra全面开放后实际用户反馈可能与灰度期存在差异 | Computer Use可靠性评估 |
| 2 | 部分基准测试方法论尚未完全公开,跨模型比较需谨慎 | 排名可信度 |
| 3 | DeepSeek V4.1 Flash和Llama 4 Maverick 2详细技术报告尚未发布 | 数据来自厂商自报 |
| 4 | 模型安全能力评估框架仍在快速演进,不同厂商测试方法差异较大 | 安全比较有效性 |