← 文章 / 未分类
synthszr 4小时前 · 2026-09-16 22:33:31 · 1 阅读

发布日:谷歌仍在大战中,Meta 在编程领域居首

发布日:Google 仍在赛道上,Meta 宣称登顶编程榜单

Google 于 2026 年 9 月 2 日发布了 Gemini 3.8 Flash 及其安全版本 Gemini 3.8 Flash Cyber,距上一代 3.7 Flash 仅三周。这是六周内第三次 Flash 发布,四个月内第四次。 introductory 定价维持不变:每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元;该价格将于 2026 年 12 月 31 日到期,随后翻倍至 1.50 美元和 7.50 美元。该模型支持文本、图像、视频、音频和 PDF,上下文窗口为 1,048,576 Token,最大输出 65,536 Token。此外,6 月宣布的 Gemini 3.5 Pro 至今仍未发布;8 月,DeepMind 负责人 Demis Hassabis 转任董事长,运营管理由升任 SVP 的 Koray Kavukcuoglu 接手。

谷歌表示,3.8 Flash 在 DeepSWE v1.1 基准测试中,针对长周期软件工程任务的表现超过了大多数前沿模型,而成本仅为后者的一小部分。在 Artificial Analysis Intelligence Index 上,该模型在高推理级别下获得 59 分,比前代高出 3 分,与 GPT-5.6 Sol 和 Grok 4.6 持平。排名更高的模型包括:GLM-5.3 和 Kimi K3(均为 60 分),Grok 4.6 和 GPT-5.6 Sol(均为 61 分),Claude Opus 5(63 分)以及 Claude Fable 5.1(66 分)。成本方面,据 Artificial Analysis 统计,Flash 3.8 每道 Index 任务的成本为 0.58 美元,而 Fable 5.1 则为 3.76 美元。在 OSWorld 2.0 智能体计算机使用测试中,该模型较 3.7 Flash 有所提升,但仍明显落后于 Claude Opus;在 Terminal-Bench 4.0 测试中,其得分率为 19.1%。

谷歌承认 3.8 Flash 消耗了更多 Token:该模型会执行额外的推理步骤,并迭代调用工具。Artificial Analysis 的测量结果显示,尽管 Token 单价保持不变,但由于输出 Token 增加了 30% 且每个智能体交互回合数增多,单道任务的成本比前代高了约 40%。开发者仍可选择低、中、高三档推理级别,或继续使用 3.7 Flash。

p>该网络版本取代了 Gemini 3.5 Flash Cyber,用户仅能通过全新的 Fairwind 项目访问该项目。该项目目前涵盖约 650 家合作伙伴,包括 Accenture、CrowdStrike、Datadog、Palo Alto Networks、Snowflake、Wiz 以及 Internet Security Center。参与者还将获得 CodeMender Agent 的访问权限。根据提供商内部数据,Chrome 安全团队报告 补丁 准确率提升了 2.6 倍,云团队在 2 小时内发现了一个关键漏洞,而在 CWE-Bench 基准测试中,通过率达到了 47.2%。据制造商称,这两款模型均内置了防范滥用机制,特别针对 CBRN 领域及进攻性网络行动。

与此同时,3.8 Flash 在发布当天就被加入了 Google 搜索 AI Mode 的模型菜单。Google 搜索产品副总裁 Robby Stein 宣布,该模型现已面向全球 Google AI Pro 和 Ultra 订阅用户开放使用,在输入框中点击加号图标即可选择。免费版用户没有模型选择权限,仍将使用默认模型。此前两代 Flash 模型的新版本后来都成为了全球默认模型。 → Search Engine Land, The New Stack, The Verge, Vals AI, Ars Technica, The Register, Search Engine Journal, blockchain, NPowerUser, MarkTechPost

**Synthszr 观点**:六周内发布三个 Flash 模型,3.7 与 3.8 的间隔仅为 21 天。这种高频迭代节奏并非自愿,而是源于旗舰模型缺位的现实困境。原本承诺在 6 月发布的 Gemini 3.5 Pro 始终未现身;Hassabis 于 8 月转任董事长后,谷歌只能依靠低价位产品线维持市场声量。对于将这些模型嵌入产品的开发者而言,发布频率本身构成了隐性成本:三周前基于 3.7 Flash 完成的评估,如今针对的已是一个在菜单中消失的旧版本;而任务成本 40% 的上涨,往往要到下个月的账单才体现出来。判断竞争压力不应只看基准测试分数,更要看厂商让自家模型在市场上停留的时间有多短。临近跨年,大概率还会有新 Flash 版本发布,且 1 月 1 日起价格体系也将翻倍调整。

Meta 宣称 Muse Spark 1.3 与 OpenAI 和 Anthropic 实力相当

2026 年 9 月 2 日,Meta 发布了 Muse Spark 1.3,这是其超级智能实验室迄今推出的最强模型,意在追平头部实验室水平。Meta 首席 AI 官 Alexandr Wang 在接受彭博社采访时表示,这是该公司迄今为止最大的性能飞跃,称其“可与 Claude Fable 5.1 竞争”,且在代码生成任务上“优于 GPT-5.6 Sol”。该模型现已通过 Meta Model API 和 Muse Code 开放使用,在 Facebook、Instagram 及 Meta AI 应用中的全面推广将在未来几天内落地。自今年 4 月 Spark 系列首次亮相以来,这已是第四个版本。

Artificial Analysis 的独立测评数据部分印证了这些说法。max 版本在智能指数中得分 62 分,在 636 个受评模型中位列第 6,落后于 Claude Fable 5.1 和 Claude Opus 5。面向客户开放的 xhigh 级别得分为 61 分,与 GPT-5.6 Sol (max)、Grok 4.6 (high) 和 Claude Opus 5 (high) 持平,高于 8 月份 Muse Spark 1.2 的 57 分。max 版本目前仍限合作伙伴在预览阶段使用。Meta 自家发布的对比表格基于内部Harness评测得出,因此其证据类型与外部指数有所不同。

在单任务成本方面,Muse Spark 1.3 定价为 0.55 美元,相比之下 GPT-5.6 Sol 为 0.95 美元,Grok 4.6 为 0.94 美元。在得分相同的情况下,Muse Spark 1.3 比 OpenAI 的模型便宜 42%。在 9 月 2 日的对比中,没有任何得分不低于 59 分的模型比它更便宜;最接近的是 Gemini 3.8 Flash,得分 59 分,定价 0.58 美元。Token价格保持不变,输入Token每百万 1.25 美元,输出 4.25 美元,缓存输入 0.15 美元。不过与自家前代产品相比,单任务成本从 0.40 美元涨至 0.55 美元,主要因为实测每个任务的输入 Token数量增加了约 57%。此外,还有一档 Contributor 级别,具有较低的速率限制,且允许使用用户提示词进行训练,其输入价格为 0.10 美元,输出价格为 0.20 美元。

提升最大的领域是多步工具使用:在 Tau3-Bench Banking 上从 35% 升至 47%,在 Terminal-Bench 2.1 上从 80% 升至 85%。有两项指标出现回落:AA-LCR 从 83% 降至 79%,Omniscience 准确率下降了三个百分点,同时弃答率有所上升。据该公司介绍,模型在面对含糊的 Prompts 时会主动追问,遇到阻碍时会求助用户,并在执行高风险操作前进行确认。一个「max reasoning」模式将在通过更多安全测试后推出。Mark Zuckerberg 还在 X 上宣布,将「很快」发布 Muse Spark 的开放权重版本——此前 Meta 已凭借 Spark 系列放弃了 Llama 路线,转向自研策略。 → Artificial Analysis, SiliconANGLE, implicator, unite, The Register

Synthszr 观点:「追平了」是分析师电话会上的说法,但它勉强才够得上自家的测量基准。Muse Spark 与 Claude 模型之间只差 62 对 61 分,而那个 62 分的版本目前仅向部分合作伙伴提供限量预览,任何想把它用于生产环境的人都无从验证。Wang 在接受 Bloomberg 采访时称该模型「优于」GPT-5.6 Sol,但 Meta 的对比表跑在 Meta 自家的 Harness 上,而且有两项独立测量数据出现下滑:AA-LCR 从 83% 降至 79%。真正可靠的数字在价格那一栏:每项任务 0.55 美元,OpenAI 是 0.95 美元,而指数得分同为 6。

原始来源: synthszr

评论 (0)