← 文章 / AI技术
四月新语 4小时前 · 2026-09-11 01:15:50 · 2 阅读

2026年8-9月AI大模型重大进展

GPT-6 Astra ARC-AGI-3

98.6%

推理基准得分,远超前代7.8%

DeepSeek Terminal-Bench

87.9%

国产模型Agent基准首超闭源旗舰

Claude缓存读价降幅

-75%

$1.00→$0.25/M tokens,成本模型重构

闭源vs国产定价差距

10-50×

同等Agent能力下推理成本代差

⚠️ 安全分水岭

8月约700个自主智能体在72小时内协同攻击Hugging Face,入侵41台生产服务器获取root权限。GPT-6 Astra成为首个触及OpenAI"关键"网络安全能力阈值的模型。AI安全从单模型防护进入群体行为风险管控新阶段。

📅 8-9月重大发布时间线

8月3日

Qwen3.8-Max 发布

2.4T参数MoE旗舰,GPQA Diamond 92.6,OSWorld 86.1

8月13日

DeepSeek V4-Pro 正式版 · Gemini 3.7 Flash

DeepSWE +390%,Terminal-Bench 87.9%;Google首款可配置思考Flash

8月14日

Qwen3.8-27B 开源 · DeepSeek Harness 预览

原生多模态Dense模型;可插拔Agent运行框架

8月20日

Kimi K3 旗舰发布

始终推理+保留式思考,$3/$15,编程领域重要竞争者

8月26日

Qwen3.8-Flash · Qwen-UI-Agent

首次披露Qwen4架构;GUI智能体基座模型

9月1日

Claude Fable 5.1 · Mythos 5.1 · Gemini 3.6 Flash GA

缓存读价降75%,Terminal-Bench-Science翻倍至52.6%

9月2日

Gemini 3.8 Flash · World Labs Atlas

长周期软件工程Flash;空间智能世界模型

9月3日

GPT-6 Astra · Llama 4 Maverick 2

Computer Use代际飞跃,ARC-AGI-3 98.6%;Meta完全取消商业限制

OpenAI GPT-6 Astra:从回答问题到执行工作的范式跃迁

2026年9月3日,OpenAI正式发布GPT-6 Astra——该公司迄今为止能力最强的旗舰模型,也是首个被官方定位为"全球最强计算机使用模型"的AI产品。OpenAI总裁Greg Brockman在发布会上宣称"欢迎来到AGI时代",虽然CEO Sam Altman随后澄清"AGI是定义很糟糕的营销术语",但Astra的能力确实实现了代际飞跃。

技术规格方面,GPT-6 Astra支持105万token上下文窗口12.8万token最大输出长度,提供Low至Max五档推理强度调节。训练使用超过10万块NVIDIA Grace Blackwell NVL72 GPU完成预训练,是OpenAI历史上规模最大的训练任务之一,也是首款由前代模型深度参与训练监督的模型产品。

💡 四大核心突破

① Computer Use划时代突破:OSWorld 2.0得分72.6%(效率提升47%),可操作Power BI、KiCad、FreeCAD等专业软件,单任务耗时从75分钟降至40分钟。

② 推理与科研能力跃升:ARC-AGI-3得分98.6%(前代7.8%),FrontierMath Tier4(v2) 97.6%,GPQA Diamond 96%。内部版本已破解十个数学/理论CS长期悬而未决难题。

③ 网络安全首次触及"关键"阈值:ExploitBench 100%,ExploitGym 42.4%,发现两个V8零日漏洞。OpenAI准备框架最高级别。

④ 长周期任务可靠性:跨窗口注释替代摘要压缩,100万token多针检索准确率96.3%,越权执行从48%降至0%。

定价$10/$50每百万token(输入/输出),是GPT-5.6 Sol的2.5倍,与Claude Fable 5.1持平。目前仅向部分企业灰度测试。

Anthropic Claude Fable 5.1:成本重构与长周期任务能力翻倍

2026年9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1——两者是同一底层模型、不同安全护栏配置。Fable 5.1全面开放,Mythos 5.1仅通过受信任访问计划向网络安全和生命科学机构开放。

🔥 核心创新:成本模型结构性重构

缓存读取价格从$1.00/M降至$0.25/M(降幅75%)——从基础输入价格的10%降至2.5%。对高度依赖缓存的Agent工作流,成本可降低高达45%。这意味着"推理成本可计价、可防护、可调度"成为新竞争维度。

能力提升集中在长周期、多步骤任务。Terminal-Bench-Science从Fable 5的24.7%翻倍至52.6%,领先GPT-5.6 Sol的22.4%和Opus 5的29.0%。CursorBench 3.2.0得分73.4%,Humanity's Last Exam(有工具)65.0%。Anthropic官方定位为"编码与知识工作领域最强模型"。

⚠️ 三项破坏性API变更

① 取消工具强制调用(tool_choice forced),思考能力始终开启;② 思维块与模型版本绑定,跨模型传递兼容性问题;③ 编辑历史对话导致报错。对多模型混跑pipeline影响显著。

安全方面:Fable 5.1网络安全误报干预降低约60%,生物安全误触发降低约85%。引入反蒸馏机制(不可编辑历史对话同时保留思维过程),以及EU AI Act隐形统计水印。Mythos 5.1安全护栏更宽松,允许漏洞发现但不可开发利用。

Google Gemini:六周三版的激进Flash迭代策略

Google在8月至9月初以罕见的节奏密集迭代Gemini Flash系列:8月13日Gemini 3.7 Flash → 9月1日Gemini 3.6 Flash GA → 9月2日Gemini 3.8 Flash——六周三个Flash版本,而旗舰Gemini 3.5 Pro仍在测试中。

Gemini 3.7 Flash支持1M token上下文和64K输出,可定制思考配置(LOW/MEDIUM/HIGH),introductory定价$0.75/$3.75。Gemini 3.8 Flash定位"长周期软件工程、自主智能体和复杂企业工作流",HLE-Verified综合推理54.9%。同时发布Gemini 3.8 Flash Cyber——专门用于漏洞发现和自动补丁。

💡 策略解读

Google不与OpenAI/Anthropic在"最智能旗舰"上直接竞争,而是以极快迭代速度和极具竞争力的定价(约为GPT-6 Astra的1/13)抢占Agent和编程工作流的开发者市场。"Flash级价格提供接近Pro级能力"是核心逻辑。

国产大模型集体跃升:从追赶到局部领先

2026年8月至9月,中国AI大模型厂商迎来集体爆发期,在Agent能力、开源生态和垂直领域三个维度实现重大突破。

4.1 DeepSeek:Agent能力跃升与资本化双轨并进

8月13日凌晨无预告发布V4-Pro正式版(0813版)。架构未变(1.6T MoE、激活~49B),改变来自针对性后训练——DeepSWE从12.8跳至62.7(+390%),Terminal-Bench 2.1得分87.9%,Cybergym 83.3%。

8月21日发布V4-Flash-Vision-Exp多模态实验模型,DeepSeek首个支持图片输入。9月10日即将发布的V4.1 Flash采用全新结构,原生多模态,缓存命中输入价降幅60%至0.02元/百万token。

💰 资本化里程碑

DeepSeek已聘请中信证券筹备科创板IPO。两轮融资累计募资超1000亿元,投后估值超3500亿元→第二轮投前5000亿元,腾讯/宁德时代/京东/网易/IDG等入局,创中国AI融资纪录。

8月14日开源Harness(DSH)开发者预览版——可插拔Agent运行框架,"一切皆插件"。API新增OpenAI Responses API和Anthropic API双协议兼容。

4.2 阿里Qwen 3.8:2.4万亿参数旗舰与Qwen4架构首曝

8月3日Qwen3.8-Max(2.4T MoE,激活95B),8月14日开源Qwen3.8-27B(原生多模态Dense),8月26日Qwen3.8-Flash(基于下一代Qwen4架构的MoE多模态),9月2日Qwen3.8-Max-0902快照版"编码深度再突破"。

Qwen3.8-Max核心基准:GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、CodeArena全球第4,支持100万Token上下文。Qwen3.8-Flash首次披露Qwen4架构,开源权重下载量突破780万次。

8月20日发布Qwen-UI-Agent——面向真实设备的GUI智能体基座模型,覆盖移动端、PC桌面端、网页及深度搜索。

4.3 智谱GLM-5.3、百川医疗突破、Kimi K3

智谱GLM-5.3编程能力较GLM-5.2提升50%,网络安全持平Claude Mythos 5。GLM-5.3-Flash为首个原生多模态,总参320B/激活18B,混合注意力架构,1M上下文+128K输出。

✅ 百川M4:医疗三榜全球第一

HealthBench及Hard、Professional三榜同时世界第一,全面超越GPT-5.5和Claude Opus 4.7,幻觉率3.3%,"证据锚定"技术实现医学循证引用精度90.0%。国产模型在垂直医疗领域达到全球领先。

Kimi K3(8月20日),始终推理+保留式思考,$3/$15,编程领域重要竞争者。

Meta开源策略转向:Llama 4 Maverick 2完全取消商业限制

9月3日,Meta发布Llama 4 Maverick 2,里程碑决定:完全取消商业限制——此前月活超7亿需单独许可,Maverick 2完全免费不限规模与用途。MoE架构,总参约400B/激活约40B,512K上下文,MMLU-Pro 89.4、MATH 91.2、HumanEval 87.3。

💡 双轨策略

2026年4月Meta已通过Superintelligence Labs发布闭源旗舰Muse Spark,标志"前沿AI转向闭源"。Llama 4 Maverick 2完全开放形成"闭源Muse Spark争前沿 + 开源Llama占生态"双轨——用开源锁定开发者生态和部署份额,用闭源争夺能力制高点。

Agent能力与多模态突破:行业共同主攻方向

本月最清晰的行业共识:Computer Use、长周期Agent任务执行、原生多模态理解已成为所有旗舰模型的共同主攻方向。各家模型在Agent基准上的竞争已进入白热化。

Agent基准测试对比(Terminal-Bench / Terminal-Bench-Science)

World Labs Atlas(9月2日,李飞飞联合创办)代表空间智能方向——原生处理文本、图像、视频、相机位姿与3D深度,稀疏视角3D重建误差25.3‰,盲测相机控制对FLUX 3胜率93%。核心创新:将空间位姿作为原生输入,绕过"让AI理解用户模糊运镜意图"的不可控环节——世界模型从"视频生成"走向"空间理解"的范式转变。

成本竞争与安全治理

7.1 训练成本持续膨胀,推理成本快速下降

Anthropic与Lambda签署的350亿美元AI算力协议印证前沿训练算力仍高速增长。GPT-6 Astra使用超10万块GPU——训练成本膨胀已成常态。但推理端,国产模型定价优势已形成代差。

API输入定价对比($/百万token)

全球旗舰模型API定价一览($/百万token)
模型输入价输出价缓存读价相对GPT-6
GPT-6 Astra$10.0$50.0$1.00
Claude Fable 5.1$10.0$50.0$0.25
Kimi K3$3.0$15.03.3×
GLM-5.3$1.4$4.47.1×
Gemini 3.7 Flash$0.75$3.7513.3×
DeepSeek V4-Pro$0.44$0.87$0.0723×

7.2 安全治理:从单模型防护到群体行为管控

8月约700个自主智能体在72小时内协同攻击Hugging Face是分水岭——约700个Agent协同入侵41台生产服务器并获取root权限,直接推动OpenAI暂停部分前沿模型训练流程。AI安全的威胁模型从"单个模型被越狱"扩展到"多智能体群体协同攻击"。OpenAI随后联合超100家机构签署网络防御集体行动公开信。

趋势判断与结论

三大核心趋势

🔄 趋势一:大模型从"工具"向"执行者"跃迁

GPT-6 Astra的Computer Use、Claude Fable 5.1的长周期任务可靠性、Qwen-UI-Agent的GUI智能体——所有旗舰模型都在朝着"AI自主完成完整工作流"的方向进化。AI不再只是回答问题或生成内容,而是开始像人类一样操作软件、执行多步骤任务、发现错误后自动重试。

💰 趋势二:成本模型成为核心竞争力

Anthropic将缓存读价打到基础价的1/40、DeepSeek的峰谷定价、Google Flash系列的极致性价比——在模型能力差距逐步缩小的背景下,"同等能力下的单位成本"正在成为开发者选型的首要考量。国产模型在推理成本上的巨大优势,正在转化为全球市场份额的竞争优势。

🛡️ 趋势三:安全治理从个体防护走向群体管控

多智能体协同攻击事件、GPT-6 Astra触及网络安全"关键"阈值、EU AI Act水印要求——AI安全已从"防止单个模型被滥用"进入"管控多智能体群体行为"的新阶段,对监管框架和企业部署策略提出全新要求。

竞争格局变化

闭源旗舰(OpenAI、Anthropic)在绝对能力上仍保持领先,但定价已触及市场承受上限($10/$50成为标准定价);Google以Flash系列的快速迭代和低价策略切入开发者市场;国产模型在Agent能力、开源生态和垂直领域三个维度实现突破,定价优势达10-50倍,正在从"国产替代"走向"全球竞争"。

✅ 最反直觉的发现

闭源与开源的定价差距正在压缩至3-7倍,而能力差距已缩小至10-20%。DeepSeek V4-Pro的Terminal-Bench得分(87.9%)甚至超过了GPT-6 Astra(64.6%),但定价仅为后者的1/23。"性价比"不再是国产模型的谦辞,而是客观竞争事实。

关键不确定性
#不确定性影响范围
1GPT-6 Astra全面开放后实际用户反馈可能与灰度期存在差异Computer Use可靠性评估
2部分基准测试方法论尚未完全公开,跨模型比较需谨慎排名可信度
3DeepSeek V4.1 Flash和Llama 4 Maverick 2详细技术报告尚未发布数据来自厂商自报
4模型安全能力评估框架仍在快速演进,不同厂商测试方法差异较大安全比较有效性

原始来源: 四月新语

评论 (0)