Muse Spark 1.2
Muse Spark 1.2 是 Meta 于 2026 年 8 月 5 日发布的 Muse Spark 系列编程向升级版本,与终端编程智能体 Muse Code 同期推出;模型保持 1M token 上下文与多模态输入,官方重点强化长程编程、复杂调试与工具调用可靠性,通过 Meta Model API 提供,输入 / 输出价格为 1.25 / 4.25 美元每百万 token。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
Muse Spark 1.2模型基本信息
推理过程支持思考模式思考水平 · 极高 (Extra-High)上下文长度1M tokens最大输出长度暂无数据模型类型推理大模型输入/输出模态文本、图像、音频、视频、pdf → 文本发布时间2026-08-05模型文件大小暂无数据MoE架构否总参数 / 激活参数暂无数据 / 不适用知识截止暂无数据Muse Spark 1.2开源和体验地址
代码开源状态不开源预训练权重开源不开源GitHub 源码暂无Hugging Face暂无在线体验meta.aiMuse Spark 1.2官方介绍与博客
官方论文Introducing Muse Code and Muse Spark 1.2 DataLearnerAI博客暂无Muse Spark 1.2API接口信息
接口速度4/5💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。了解不同定价模式详解标准模式| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $1.25/ 1M | $4.25/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | $0.150/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Muse Spark 1.2评测结果
Muse Spark 1.2 当前已收录的代表性评测结果包括 MCP-Atlas(1 / 40,得分 90.30)、Creative Writing(12 / 99,得分 1835.40)、Context Arena(35 / 126,得分 81.56)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
思考模式全部常规思考工具使用全部使用工具不使用工具写作和创作
共 1 项评测评测名称 / 模式得分排名/总数Creative Writing常规模式1835.4012 / 99文本向量检索
共 4 项评测评测名称 / 模式得分排名/总数Context Arena低81.5635 / 126Context Arena中80.6139 / 126Context Arena高81.5536 / 126Context Arena极高78.5744 / 126AI Agent - 工具使用
共 2 项评测评测名称 / 模式得分排名/总数MCP-Atlas思考模式工具90.301 / 40Terminal-Bench 2.1极高工具82.9018 / 47编程与软件工程
共 1 项评测评测名称 / 模式得分排名/总数DeepSWE极高工具59.3014 / 31生产力知识
共 2 项评测评测名称 / 模式得分排名/总数GDPval-AA v2思考模式工具16319 / 22AA-Briefcase极高工具1364.239 / 19查看评测深度分析与其他模型对比Muse Spark 1.2发布机构
Facebook AI研究实验室查看发布机构详情 Muse Spark 1.2 by Meta Superintelligence Labs模型解读
2026 年 8 月 5 日,Meta Superintelligence Labs 发布 Muse Spark 1.2,同时推出面向终端的编程智能体 Muse Code。官方将 1.2 定位为 Muse Spark 1.1 的编程向更新,称其在代码生成、复杂调试、代码库理解和端到端开发工作流上均有提升。
相较前代的变化
Meta 表示,Muse Spark 1.2 相对 Muse Spark 1.1 显著扩大了编程任务上的训练算力投入,并扩展了训练环境的多样性。官方描述模型在长程编程任务上做了针对性训练,覆盖整仓库级生成、大型端到端项目和自动化研究类任务;为支撑这类长任务,模型使用规划来编排工作顺序、通过目标条件化保持方向,并对上下文进行压缩。官方给出的一个案例是:模型在一项 GPU kernel 优化任务上持续迭代,跨越 1000 次以上工具调用、最长约 24 小时,相对给定基线实现取得了明显改进。
上下文、模态与接口能力
Muse Spark 1.2 的上下文窗口为 1,048,576 tokens(1M),官方称长任务可在一个会话内从头跑到尾。输入支持文本、图像、视频、音频和 PDF 文档,输出为文本。接口层面支持结构化输出和并行函数调用,可使用 tools / tool_choice 参数以及基于 JSON Schema 的响应格式约束。推理强度方面,官方评测方法学文档说明 Muse Spark 1.2 的最高可用档位为 xhigh reasoning effort。Meta 未公开该模型的参数规模、最大输出长度和知识截止时间,相关字段暂留空。
官方评测成绩
Meta 在发布材料与《Muse Spark 1.2 & Muse Code Evaluation Methodology》中给出了下列成绩(Muse Spark 1.2 均使用 xhigh reasoning effort,经 Meta Model API 提供服务):
- Terminal-Bench 2.1:82.9%。使用 Muse Code 作为智能体产品,覆盖官方 2.1 版全部 89 个任务,在隔离的 Daytona 沙箱中运行,报告 5 次尝试的平均任务成功率(pass@1)。
- DeepSWE v1.1:59.3%。同样以 Muse Code 运行,采用 Harbor 格式数据集、尽量对齐官方 runner Pier v0.3.0;评测期间禁用外部网络,仅保留模型端点可达,任务需同时通过功能校验器与回归检查才算通过,报告 5 次尝试的平均 pass@1。
- MCP-Atlas:90.3%。该成绩由 Scale AI 使用基准自带的智能体 harness 与评分流水线产出,任务在覆盖率不低于 0.75 时判定通过。
- GDPval-AA v2:1631 Elo。成绩由 Artificial Analysis 在其 Stirrup 智能体 harness 中产出,覆盖 220 项真实职业任务,指标为盲对比得出的 Elo(人类基线锚定为 1000)。
- Meta Internal Coding Bench:70.6%。基于 Meta 内部代码库的 440 个任务,使用内部 harness 与专用评分容器,每任务两次尝试。该基准不对外开放,无法独立复核。
需要注意口径差异:Terminal-Bench 2.1 与 DeepSWE v1.1 的官方公开榜单使用统一 harness(DeepSWE 官方榜单为 mini-swe-agent),而 Meta 的评测让每个模型搭配各自的智能体产品,因此与公开榜单并非同一 harness;Meta 也说明其评测设置未针对第三方专有模型调优。截至 2026 年 8 月 7 日,Terminal-Bench 2.1 官方公开榜单尚未收录 Muse Spark 1.2 的核验条目,上述成绩应视为厂商自报结果。
访问方式、价格与许可
Muse Spark 1.2 通过 Meta Model API 提供,也可在 Muse Code 中调用。官方公布的价格为输入 1.25 美元 / 百万 tokens、输出 4.25 美元 / 百万 tokens,缓存读取 0.15 美元 / 百万 tokens,联网搜索按 2.50 美元 / 1000 次调用计费。
许可方面,Muse Spark 1.2 在 8 月 5 日发布时为闭源托管模型,未公开权重。2026 年 8 月 10 日,Mark Zuckerberg 宣布 Meta 将在“未来几周”开放 Muse Spark 1.2 的权重,这是 Meta 自 2026 年 4 月推出 Muse Spark 并停止 Llama 系列以来对闭源路线的一次调整;同日 Meta 以 Apache 2.0 许可发布了 300 亿参数的开放权重模型 Muse Glimmer。截至本页更新时,Muse Spark 1.2 的权重尚未实际放出,因此目前仍按闭源模型对待。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
