Muse Spark 1.3 匹敌 GPT-5.6-Sol,确认 Meta 超级智能为最新前沿实验室,训练价格享超 90% 折扣
看看它终于拿出了与 OpenAI 和 Anthropic 前沿模型(Opus,非 Fable)相当的成绩,还承诺开源权重(!!!):
马克·扎克伯格 @finkd
Muse Spark 1.3 今天正式推出,性能已达前沿水准,而价格低得近乎免费。这是我们在编码和智能体任务上最大的跨越。欢迎在 Muse Code 和我们的 API 中体验。
接下来 🍉 和 Muse Spark 开源权重版本即将发布。
2026年9月2日 晚7:26 · 48.1万浏览494 回复 · 543 转发 · 7,03K 点赞 他们还有一套有趣的定价模式:如果允许用于训练,价格能便宜 90% 以上:

2026年8月22日至24日AI新闻汇总。我们爬取了12个子版块、544条推文,未覆盖Discord频道。AINews官网支持检索往期内容。温馨提示:AINews现已成为Latent Space的一个版块,你可自行选择邮件推送频率!
AI Twitter 回顾
Agent工程课程、教学大纲与开发者实践
斯坦福大学正在将AI原生软件工程确立为一门正式学科:@mihail_eric宣布新版《现代软件开发者》课程,聚焦他所称的软件工程"2026年蜕变"。本次更新的真正看点并非课程本身,而是大纲的全面重置:2025秋季学期85%的内容将被替换,新增主题包括Agent技能、Context工程、MCP门户、Agent就绪的代码库设计、智能体代码审查、安全、并行后台Agent及软件工厂。课程还要求学生向真实开源仓库提交PR,合作支持方包括Browserbase、OpenHands、Semgrep、Milvus、Marimo、CrewAI、Warp、Vercel、Unsloth、Anyscale等。
斯坦福第二门课程聚焦从零构建智能体:@Diyi_Yang 与 @michaelryan207 推出了CS329Z:AI智能体工程,课程设计明确围绕"从零开始"构建智能体展开。结合 Mihail Eric 的课程,可以看出整体教学思路正从"提示词工程"转向面向系统的智能体工程:重点在 harness、评估、记忆、工具链、编排和生产约束,而不再局限于模型使用本身。
实践讨论正收敛于"状态感知的智能分配"而非简单路由:在一场小组讨论中,@HarryStebbings 引用了 @EnoReyes 的观点:要充分发挥模型能力,仅靠路由还不够,智能体必须理解任务状态、刚刚发生了什么、下一步该做什么,才能动态分配智能。这与 @jerryjliu0 的观点相呼应——厂商中立的创业公司可以通过端到端优化 harness,并在前沿模型与开放权重模型之间灵活取舍,从而在细分任务上跑赢前沿实验室。
模型架构与推理:Astra 传闻、Looped Transformers 与实时推理服务
「Astra 是一个循环 Transformer」这个传闻可能没有标题党说的那么新:@rasbt 梳理了围绕 OpenAI 传闻中Astra架构的报道,指出所谓"循环深度"或"循环 Transformer"的概念其实只是一个比较克制的架构微调,谈不上突破。他举出了Nanbeige 4.2-3B作为开源先例:一个22 层 Transformer 堆栈被复用两次,等价于一个44 层模型,但参数存储量并未翻倍。代价也很清晰:内存占用相近,计算量约 2 倍,且在 token 效率上只保留了标准堆栈的部分优势。更实在的历史参照是Mixture-of-recursions——通过一个可学习的路由器动态决定每个 token 需要几次 pass,简单 token 提前退出,困难 token 获得更多计算。
隐式推理并非循环结构的必然产物:@rasbt 进一步澄清,层复用并不会天然地"掩盖思维链"。它只是把更多计算移到了 token 生成前的隐式激活中。如果循环深度确实减少了可见的推理痕迹,那是因为模型可能需要发出更少的中间 token,而不是因为循环 Transformer 本质上会压制文本形式的 CoT。
推理基础设施持续面向实时多模态工作负载优化:@vikhyatk 发布了Photon 2.1,为实时多模态推理引擎新增了文本转语音模型和NVIDIA B200 支持。另 한편,Baseten 宣布GLM-5.3 Fast可提供托管服务,通过 @baseten 强调更高的 TPS 和实时部署定位。
Agent 编排、技能检索与 RL 后训练工具链
字节跳动 Seed 的 HarnessDev:以"工具链"为核心的智能体评估框架:@omarsar0 推荐了一篇关于 HarnessDev 的新论文。该方法要求模型从一个虽弱但可运行的种子出发,构建执行 harness,再在第二阶段利用下游反馈对其进行优化。两个阶段均从能力与执行 token 消耗两个维度评分,将效率纳入优化目标。在六款创作者 LLM、四个领域、2,207 个保留下游实例上的测试结果表明,生成的 harness 在代码、搜索和研究三类任务上仍落后于成熟的人工工程系统,但在写作和 ML 实验上可达到甚至超越人工方案。核心结论是:自演化 harness 确有增益,但收益不稳定、依赖模型且仅可部分迁移。
相关生态信号:exo 与递归自我改进工具链:@omarsar0 还提及了 exo harness,作为理解递归自我改进工作流的入门工具,反映出业界对"让智能体不仅优化输出、还优化自身框架"的框架兴趣日益增长。
技能检索的聚合指标可能好看,实则损害触发它的任务本身:@dair_ai 总结了一篇提出Retrieval-Invoked Actual-Use Effect的论文,这是一种配对评估方法:对同一任务分别在有/无技能开启条件下运行两轮,仅统计技能实际触发的任务。在17 款 LLM的代码和数学任务上,论文发现存在这样一种情况:检索提升了整体分数,却在被使用的子集任务上产生了负向的"同任务效应"。对于维护技能库或工具目录的团队来说,这是一个实用提醒——不要过度解读聚合指标的提升。
强化学习后训练基础设施正变得更加产品化:SGLang 团队联合 Baseten 与 NVIDIA Dynamo 推广了Miles,这是一个使用SGLang 作为 rollout 推理引擎的 RL 训练框架,能带来更快、更可靠的强化学习后训练@sgl_project。@AravSrinivas 则单独将Miles定义为开源的 RL-as-a-service,进一步印证了业界正从定制化内部流水线转向可复用后训练栈的趋势。
Google Gemini 3.8 Flash Cyber 及围绕 Google 工具的摩擦
Google 推出了专攻网络安全领域的模型,基准成绩亮眼:@sundarpichai 宣布Gemini 3.8 Flash Cyber,定位为其最强网络安全模型,同时保持Flash 级的速度与定价。公布的数据显示其在CyberGym 上达到 86.2%,CWE-Bench 修复任务得分 47.2%,并在涉及20 种编程语言的内部漏洞发现基准测试中取得了70%+ 的成功率。
与此同时,开发者的情绪反映出对工具链和风险封禁的担忧:@theo 指出,Google 目前在 harness、代码应用、第三方集成等方面开发者体验偏弱,尤其与核心 Google 账户绑定的封禁政策过于激进。@QuinnyPig 进一步指出,这种风险的波及范围可从 Gmail/Workspace 延伸到同一身份关联的 Google Cloud 账户。Theo 后续对 Gemini 在编码任务中响应缓慢、工具调用频繁的抱怨(1,2,3)虽属个案,但折射出基准成绩与生产级开发者体验之间的落差。
Meta Muse Spark 1.3 及视频/多模态发布节奏
Meta 推出 Muse Spark 1.3,面向智能体与编码工作负载:@shengjia_zhao 将 Muse Spark 1.3 定位为 Spark 系列中针对智能体和编码任务最强的模型,特别强调更长的任务跨度以及对复杂指令更可靠的遵循能力。社区反响聚焦于其性价比,包括 @alexandr_wang 指出它「仅需一美分」就能做到的事情,其他用户也认为它在速度和 Token 效率上优于竞品「xhigh」系列。
阿里万相 3.0 在视频第三方榜单上表现强劲:@ArtificialAnlys 报道 Wan 3.0 在 Artificial Analysis 榜单上位列视频编辑(含音频)第 1、文生视频(含音频)第 2、图生视频(含音频)第 5。该版本定位为一体化生成与编辑模型,支持文本、图像、视频、音频、文档和网页作为参考,原生支持音频,可生成最高 30 秒 1080p 视频。公开预览定价为 480p 每秒钟 0.05 美元,1080p 为 每秒钟 0.20 美元。
重度参考的多模态交互体验也在进步:@imagine 宣布支持每个视频最多添加 14 个参考素材,通过提示词中的
@标签引用图片、声音和角色,虽是小改动,却为多素材创意控制提供了实用界面提升。
开源模型、机器人与热搜推文
开源模型努力持续扩大规模:@percyliang 分享称,Marin 535B-A23B 的训练进度已达 13%,计算资源由 Jen-Hsun 和 Lori Huang 基金会资助,并在 CoreWeave 上运行。这条帖子真正的看点不在于基准测试,而在于慈善计算支持下的超大规模开源模型训练的可持续性得到了验证。
物理AI与开源机器人平台稳步推进:@maze_rapid 宣布推出 Palmimo DevKit,这是一款桌面级AI机器人平台,采用开源软件与可更换的AI"大脑"设计,让开发者无需深厚的机器人学背景,仅用几行Python即可控制机器人应用。目前尚属早期阶段,但作为智能体框架向具身系统延伸的一个例子值得关注。
热帖精选(按互动量)
@mihail_eric:斯坦福 revamped 的AI原生软件开发者课程,大幅更新教学内容并推动开源协作。
@sundarpichai:发布Gemini 3.8 Flash Cyber,在网络安全基准测试中表现亮眼。
@rasbt:详细拆解looped transformers架构,指出Astra相关传闻可能夸大了其创新性。
@Diyi_Yang / @michaelryan207:斯坦福新课程CS329Z:AI智能体工程。
AI Reddit 精选
/r/LocalLlama + /r/localLLM 精选
1. Muse Spark 与 Spark-X2.5 开源权重模型
Muse Spark 开源权重即将发布 (热度: 902):这张截图来自 Mark Zuckerberg/X 的帖子,宣布 Muse Spark 1.3 正式上线,声称在编程、agent 工作流和长上下文任务上均有重大提升,并透露开源权重"即将到来"。附带的 benchmark 表格显示 Muse Spark 1.3 优于 Muse Spark 1.2,与 GPT 5.6 Sol 和 Opus 5 在 agent、长上下文和编程评测上各有胜负,但发帖者表示 Spark 体量大、自己的硬件跑不动,正在等 Llama 5 或者介于 Glimmer 和 Spark 之间的中间版本。 评论者认为这表明多家顶尖实验室在技术上趋于收敛,有人称"没有秘密武器",前沿差距可能只剩几个月。另有评论者认为 Muse Glimmer 被低估,在非编程任务上表现优于 Qwen 3.8:27B。
评论者注意到一个异常高的长上下文分数:MRCR
512k–1m达到98.1%,有人据此询问这是否意味着 Muse Spark 已经基本解决了百万 token 级的"上下文衰减"问题。如果属实,该 benchmark 将是本帖最具技术亮点的 claim——因为当前多数开源和闭源模型在512k+上下文下的检索/推理能力仍是短板。有用户反映 Muse Glimmer "相当不错",主观感受上在非编程任务中优于 Qwen 3 8/27B,暗示 Muse 的小模型/旧版在非编程领域已具竞争力。该对比属个人经验,但说明模型优势往往因任务而异,而非榜单上的全面领先。
多位评论者质疑上述分数背后的参数量,推测若 benchmark 属实,Muse Spark 可能达到 万亿参数量级。这引发了落地担忧:普通爱好者大概无法本地运行,但开源权重对因政策/合规原因需要非中国模型的用户仍有价值。
新模型:Spark-X2.5-4B、Spark-X2.5-1.7B(热度:301):XHToken 发布了
1.7B和4B两个版本,似乎采用了自定义架构而非简单的微调,官方模型卡声称支持原生1Mtoken 上下文、多语言,并在约20Ttoken 数据上预训练,同时进行了长上下文和后期训练阶段的优化。据称其架构混合使用全注意力与滑动窗口注意力,以降低长上下文 KV/cache 的计算开销;4B版本的 benchmark 成绩被宣传为可与 Qwen 系列约9B参数模型相媲美。llama.cpp 中尚未合并上游运行时支持,需等待待处理PR #27868或 XHToken 的自定义 fork,GGUF 文件已有1.7B和4B两个版本。讨论者主要对20T-token 的预训练规模印象深刻,尤其关注在不到 5B 参数规模下声称的原生1M上下文能力。对于 benchmark 成绩——特别是4B能否匹配约9B模型——独立复现后的结果仍持谨慎观望态度。评论者重点关注 Spark-X2.5 报告的
20T训练 token 规模,这在1.7B/4B参数量级中极为罕见,若 benchmark 能复现,也解释了为何4B版本敢宣称可与9B模型媲美。另一突出规格是此量级模型的原生1M上下文,读者普遍认为比单纯的 benchmark 对标更具技术含金量。
有测试者报告了使用"pi harness"时的早期定性行为:当被问"你是什么模型"时,该模型似乎会先用工具检查/分析 harness 名称,再给出回答,这表明了代理/工具使用倾向,但同时也"想太多了"。在一次快速推理测试中,它未能通过"洗车"测试,测试者计划进一步与Qwen3.5 9B对比日常使用质量。
2. Qwen3.8 基准测试与 GGUF 加速
Qwen 将成为王者?(热度:732):图片显示了 Arena AI Code Arena WebDev 排行榜,其中 Qwen3.8-Max-0902 以
1,691分位居榜首,微弱领先 Claude Opus 5 Max 的1,688分和 Kimi K3 Max 的1,674分。结合帖子语境,这一结果被用来论证 Qwen 的扩展推理/后训练缩放可能正在缩小与更大规模前沿系统的差距,或许在 Qwen 4 发布或可能的开源权重更新之前就能实现。评论者对本地/开源 Qwen 变体普遍持乐观态度,有人称Q3.8-27B在本地运行时在编码能力上超越了其付费 ChatGPT 体验。也有人质疑表现最佳的 Max 模型是否会开源,另有一人称赞了扩展推理能力,但指出其权衡:数小时的延迟以应对复杂任务。一位用户报告了Q3.8-27B搭配PI使用的强大本地编码表现,声称其在编码任务上优于之前付费使用的ChatGPT 5.1。他强调了实际的任务执行力:当提供 wiki 页面等上下文(如
.txt文件)时,模型能在本地 PC 上完全运行并保护数据隐私的情况下,生成只需少量修改即可工作的代码。多位评论者将扩展推理视为关键差异点:有人表示Qwen 3.8 Max在其挑战集上"100% 正确",但可能需要数小时才能得出答案。这凸显了准确性/可靠性与推理密集型工作负载极高推理延迟之间的权衡。
对公布的基准测试图存在质疑,有评论者称数据看起来「严重粉饰」,也有人问为何对比中缺少 Fable 5.1。核心担忧是模型排名结论可能高度依赖基准选择、报告方式或遗漏了某些竞争模型。
MTP 已适配 Qwen3.8-Flash-Next-GGUF(热度:671):****Unsloth 发布了
Qwen3.8-Flash-Next-GGUF的 MTP 支持文件,测试说明关联 Unsloth 的llama.cpp分支/PR(unslothai/llama.cpp#144),GGUF 使用路径面向本地运行时和 OpenAI 兼容端点。评论中有人提到刚合并的 upstreamllama.cpp优化(ggml-org/llama.cpp#28123),报告代码场景吞吐量从123 tok/s → 183 tok/s、散文从83 tok/s → 144 tok/s,对比不开草稿时的108 tok/s;补丁合入前,散文的 MTP 甚至比不开草稿更慢。讨论以实用为主:用户关心 SSD 卸载是否稳定可用,并指出相关 MTP 文件可能已公开数天。有评论者引用刚合并的 llama.cpp 优化 PR(ggml-org/llama.cpp#28123),显示 Qwen3.8-Flash-Next-GGUF 的 MTP 吞吐量大幅提升:不开草稿基线为
108 tok/s,优化前代码123 tok/s但散文仅83 tok/s,优化后代码达183 tok/s、散文达144 tok/s。关键技术点是:合入前 MTP 在散文任务上可能比正常解码还慢,而该补丁使草稿机制在各场景下均能带来稳定收益。多位评论者在追踪 llama.cpp 中尚未解决的运行时和支持细节,包括 SSD offload 是否稳定,以及
-shared选项与 MTP 文件的非共享模式有何区别。另一位用户表示,他认为所需 llama.cpp 功能支持仍未完全合并,并报告本地性能仅约9 tok/s,意味着硬件/配置敏感性仍然显著。