← 文章 / AI技术
The Decoder 3小时前 · 2026-09-03 20:07:11 · 4 阅读

Meta Muse Spark 1.3 发布:逼近顶尖性能,价格碾压竞品

核心要点

  • Meta 已发布 Muse Spark 1.3。xhigh 版本现已可用,而更强大的 max 版本目前仅作为有限预览。
  • 该模型在代理任务上进步最大,但在多数基准测试中仍落后于 Claude Fable 5.1 等顶级选手。
  • 每任务仅需 0.55 美元,是当前同性能级别中最便宜的。Meta 还称开源版本即将到来。

Meta 发布了 Muse Spark 1.3,这是其五个月内的第四款模型。独立测试显示该模型在代理任务上实力大增,但距顶尖仍有差距。真正打动人的是它的价格。

Meta 通过 Muse Code 和 Meta Model API 发布了 Muse Spark 1.3。该系列于四月启动,1.1 版本七月跟进,1.2 版本八月推出。xhigh 版本现已可用,而计算需求更高的 max 版本还需进一步安全测试,目前仅作为有限合作伙伴预览,据 Artificial Analysis 报道。

输入和输出 token 的单价分别维持不变的 $1.25 和 $4.25 每百万,单次任务成本为 $0.55。在得分 59 分及以上的模型中,没有其他更便宜的选择,同级别的竞品价格在 $0.94 至 $1.23 之间。不过 Muse Spark 1.3 确实比 1.2 版本贵,后者仅 $0.40。

加分项集中在指数权重高的测试中

Intelligence Index 上,max 得分 62 分,xhigh 得分 61 分,较八月的 57 分和七月的 53 分均有提升。这一跃升源于指数的测试权重设计:GDPval-AA v2 占 20%,Terminal-Bench 2.1 占 16%,τ³-Bench Banking 占 14%,而 Meta 在这三项测试中都取得了最大幅度的进步。

在 τ³-Banking 中,代理需在模拟银行场景中操作工具,max 达到 52%。据 Artificial Analysis 数据,这是目前排名第一,也是该模型唯一的绝对领先项。可用的 xhigh 版本达到 47%,与 Claude Fable 5.1 (max) 和 GLM-5.3-Flash 持平,并非领先。前代 1.2 版本仅为 35%。

Terminal-Bench 2.1 测试终端编程能力,Muse Spark 1.3 在 xhigh 档位从 80% 提升至 85%,在 max 档位达到 86%;但 Claude Fable 5.1 仍以 max 档位 91.4%、xhigh 档位 91.0%、high 档位 89.9% 的成绩保持榜首。在该指数权重最高的测试项 GDPval-AA v2 中,分数校准基准为人类专家在 220 项真实职业任务中的平均水平(1,000 分),Meta 从 1,615 分提升至 1,709 分(xhigh)和 1,754 分(max)。Claude Fable 5.1(max)则为 1,853 分。Meta 通过算力堆叠拿下 max 档位的领先优势,Reasoning tokens 消耗比 xhigh 高出 62%。
图片来源:Artificial Analysis

脱离 Agent 测试后,模型表现中规中矩

在 GPQA Diamond(面向专家级科学问题的测试)上,Muse Spark 从 90% 升至 94%,跻身第一梯队,但仍低于 Gemini 3.8 Flash(high)的 95.3% 和 Grok 4.6(high)的 94.9%。CritPt(覆盖研究物理领域)从 18% 跃升至 26%,与 GPT-5.6 Sol(max)的 32.3% 和 Claude Fable 5.1(xhigh)的 31.1% 仍有较大差距。

另有两项得分较 1.2 版本不升反降:AA-LCR 从 83% 跌至 79%;AA-Omniscience 的事实准确率下滑最多三个百分点,原因是模型在不确定时更倾向于拒绝作答。

Meta 与 Artificial Analysis 均未公布 max 变体的定价。更大的模型及开源权重版本 forthcoming。

原始来源: The Decoder

评论 (0)