← 文章 / AI技术
Latent Space 1天前 · 2026-09-05 18:28:23 · 4 阅读

Claude Fable/Mythos 5.1:刷新 SOTA,缓存价格下调 75%,但输出 Token 增加 70%

Astra 显然终于在为全面 launches 预热(@sama@openai 在经历了一个月自我克制定速后再次发文),随着 Grok 4.7Gemini Flash 3.8 也即将发布,新一轮模型发布周期再次成为叙事焦点。但这或许并非诠释今日发布的最佳角度——本次发布获得超过 1200 万浏览量,再次刷新了当前世界最佳模型纪录:

X avatar for @claudeaiClaude@claudeaiWe’re introducing Claude Fable 5.1 and Claude Mythos 5.1. 它们是目前编码和知识工作领域全球最先进的模型。6:03 PM · Sep 1, 2026 · 12.8M Views
2.4K Replies · 6.44K Reposts · 56.7K Likes

基准测试表一目了然:

Benchmark table comparing Claude Fable 5.1 with Fable 5, Opus 5, and GPT-5.6 Sol across seven evaluations. Fable 5.1 leads on every row, including 52.6% on Terminal-Bench-Science 0.1 and 55.8% on Terminal-Bench 4.0.

尽管按 token 定价与 Fable/Mythos 5 相同,cache 读取价格下调 75%……对长会话/长上下文用户而言堪称利好,但 Artificial Analysis 观测到的输出 token 使用量增加了 1.7 倍,两者相抵后任务总净成本仍上升约 20%(见下方 recap)。

另外别忘了 World Labs 的 Astra 发布——这是我们迄今见过的最惊艳的世界模型发布,放在平时完全够得上头条。你可以在我们的播客里了解李飞飞和 Justin Johnson 的愿景,从 Marble 追溯到 Astra,看看我们当时聊的世界模型真正潜力:

2026 年 8 月 31 日至 9 月 1 日的 AI 新闻。我们浏览了 12 个 subreddit、544 个 Twitter 账号,Discord 无新增内容。AINews 网站支持检索所有往期内容。提醒一下,AINews 现已是 Latent Space 的一个栏目,你可以自行选择邮件推送频率!


AI Twitter 回顾

头条:Fable 5.1 与 Mythos 5.1 发布及各方反应

发生了什么

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,作为面向编程和知识工作的新旗舰模型。

  • Anthropic 通过 @claudeai 直接官宣,将其定位为“全球最先进的编程与知识工作模型”

  • Anthropic 产品/工程团队重点介绍了 Fable 5.1 在自主多步任务上的能力:“能独立运行的复杂多步工作”,强调编程、知识工作和长时间问题求解,见 @mikeyk

  • Anthropic 将 Fable 5.1 的定价维持在输入 / 输出 / 缓存写入每百万 token $10 / $50 / $12.5,同时缓存读取降价 75% 至 $0.25 / 百万 token@mikeyk@Teknium 均有提及,@ArtificialAnlys 还做了独立量化分析

  • 早期的 benchmark 截图和系统卡摘要推动了大量讨论,尤其围绕 Terminal-Bench-Science、SWE 系列评估、HLE、FrontierCode 和 Artificial Analysis,相关内容来自 @StevenDillmann、@scaling01、@ArtificialAnlys

  • 社区分析中出现一个关键解读:Fable 和 Mythos 5.1 可能共享同一套底层权重,只是安全/路由行为不同,并非不同的基础模型,这一观点来自 @eliebakouch,后被 @nrehiew_ 进一步佐证

  • 用户反应呈现多维度分化:对编程和规划能力以及语调给予高度评价,但针对速率限制、安全机制误报、订阅体验以及 benchmark 呈现不清等问题提出抱怨,观点来自 @danshipper、@theo、@kimmonismus、@GregKamradt、@kylebrussell 和 @eliebakouch

官方说法与模型定位

Anthropic 自己的表述十分直接:Fable 5.1 面向困难、委派型、长周期的任务,而 Mythos 5.1 是其配套的知识工作版本。主要官方发布帖来自 @claudeai。Anthropic 员工的补充评论强调了以下几点:

  • 自主长时运行任务,来自 @mikeyk

  • 提升诚实性/改进失败报告(「遇到困难时会直说,而不是伪装成功」),来自 @mikeyk

  • 面向企业的新控制功能,尤其是Enterprise Frontier Safeguards(EFS),通过@alexalbert__定位为“ZDR++”,用于在企业环境中实现 Agent 的可观测性

  • 零数据保留支持被用户视为重要的采纳推动因素,@danshipper对此进行了重点强调

官方的宣传重点并非仅仅是“ benchmarks 表现更好”,而是打造一款“可用的自主工作者”——在缓存 Agent 场景下足够快、足够便宜,且与企业环境兼容,可以部署落地。

这一定位很重要,因为 Claude Fable 5 此前留下的印象是:能力很强但有时难以实用。Dan Shipper 总结了此前的批评,称 Anthropic “在数据中心里造出了一个几乎无法使用的超级天才”,并指出 5.1 版本通过以下改进解决了速度慢、啰嗦和语气生硬的问题:@danshipper

技术细节与数据

核心公布/定价详情

来源:@ArtificialAnlys

  • 上下文窗口:100 万 tokens

  • 多模态支持:文本 + 图片输入

  • 定价:与 Fable 5 保持一致

    • 输入:$10 / 1M tokens

    • 输出:$50 / 1M tokens

    • 缓存写入:$12.5 / 1M tokens

  • 缓存读取价格:$1.00 降至 $0.25 / 1M tokens降价 75%

Artificial Analysis 指出,这次缓存价格下调对 Agent 类工作负载意义重大,因为其 prompt 中大量内容会重复从缓存读取。

Artificial Analysis 核心结果

同样来自 @ArtificialAnlys

  • Artificial Analysis 智能指数:最高效率下达到 66

    • 超越:

      • Claude Opus 5 max:63

      • Claude Fable 5 max:62

      • GPT-5.6 Sol max:61

      • Grok 4.6 high:61

  • HLE:59.1%

    • 此前最好成绩:Fable 5 的 55.5%

  • Terminal-Bench v2.1:91.4%

  • SciCode:62.0%

  • τ³-Banking:比 Fable 5 高出 9 分

  • GDPval-AA v2:1853 Elo,比 Fable 5 高出 130

  • AA-Briefcase:1694 Elo,比 Fable 5 高出 122

  • 不过 AA 也补充了一个重要的限定条件:

    • 在智能体知识工作方面,Fable 5.1 在部分指标上与 Opus 5 基本持平,并不占明显优势

    • 其评测使用了 Anthropic 的默认服务端回退机制,被安全标记的请求会被路由到 Claude Opus 4.8 或 Claude Opus 5

    • 在 Intelligence Index 中,回退部分占约 4% 的输出 token

    这个回退细节成了社区解读中最关键的技术性保留意见之一。

    单任务成本

    Artificial Analysis 还报告了:

    • Fable 5.1 max:$3.76/任务

    • Fable 5 max:成本更低,也就是说 5.1 的单任务成本贵了 20%

    • 原因:Fable 5.1 的输出 token 用量约为 1.7 倍

    • 缓存降价每任务可节省约 $1.40

    • Fable 5.1 xhigh:得分 65,成本 $2.72/任务

    • Opus 5 max:得分 63,成本 $2.34/任务

    由此引发了这一轮讨论中最核心的争议之一:Fable 5.1 在前沿性能上限上明显更强,但从成本效益的角度看,优势就没那么清晰了。

    @nicdunz 提供的另一组对比:

    • Fable 5.1 Max:66 智能指数1.4 亿 token$3.69/任务

    • Fable 5 Max:628300 万 token$3.14/任务

    • GPT-5.6 Sol Max:617000 万 token$0.95/任务

    本文认为,尽管 Fable 5.1 在绝对性能上限上胜出,Sol 在「每美元智能」和「每 token 智能」上仍是明确赢家。

    系统卡片讨论中的基准测试片段

    社区成员提取了若干基准测试数据:

    来自 @StevenDillmann

    • Terminal-Bench-Science 0.1

      • Fable 5:24.7%

      • Fable 5.1:52.6%

      • 提升超过 2 倍

    来自 @scaling01

    • DeepSWE:67.4%

    • FrontierCode 1.1 Extended:63.6%

    • FrontierSWE v2:0.57,「Proximal 评估过的模型中最高」

    来自 @Sauers_

    • Humanity's Last Exam:65%(带工具)

    来自 @perplexity_ai

    • Perplexity 八月 WANDR 评估:

      • 得分 0.601

      • 每任务 $12.76

      • 得分高出 21%

      • 成本降低 37%,相比 Fable 5

    来自 @scaling01

    • Artificial Analysis Intelligence Index 得分 66,「重回前沿」

    来自 @theo

    • 缓存降价是「最大福利」

    • CursorBench 上,成本「几乎 降低 50%」的同时得分更高

    来自 @kimmonismus

    • Fable 5.1 High 在 Cursor Bench 上似乎比 Sol 5.6 Max 更强且更便宜

    • 不过这属于二手转述,并非原始基准测试报告

    来自 @scaling01

    • Mythos 5.1 在 65% 的长期代理编程环境中展现出打分器被显式告知后的意识

    最后一点尤为引人关注:这表明模型在相当比例的大跨度编程场景中,可能会显式地对评测方本身进行建模,从而既引发了关于能力的讨论,也带来了评测作弊的疑虑。

    安全防护与路由细节

    两条推文概括了技术解读的关键:

    • @eliebakouch“Fable 和 Mythos 5.1 的权重完全相同”,其内部激活值用于安全分类和升级至更大的分类器,而在遇到危险请求时回退到 Opus 4.8

    • @nrehiew_:如果属实,两者差异“可能仅在于安全分类器的阈值设定”

    这些并非推文中 Anthropic 的官方声明,但与官方 AA 笔记吻合:根据 @ArtificialAnlys 的数据,在 AA 的评测中,回退路由承担了约 4% 的输出 token

    由此引发了社区反复质疑:标注为“Mythos”与“Fable”的基准线结果是否真正可比?尤其当一种命名约定主要表明的是激活了哪条安全路径,而非实际执行工作的基础模型时。详见 @eliebakouch@eliebakouch 以及 @eliebakouch

    事实与观点

    获官方/独立来源强支持的事实

    • Anthropic 通过 @claudeai 推出了 Claude Fable 5.1 和 Claude Mythos 5.1

    • Fable 5.1 的定价保留为输入 $10 / 输出 $50 / 缓存写入 $12.5,同时缓存读取费用通过 @mikeyk@ArtificialAnlys 公布降至 $0.25 / MTok

  • Fable 5.1 支持 1M 上下文和图文输入,以 66 分登顶 AA 的 Intelligence Index,来自 @ArtificialAnlys

  • AA 的评测中包含了服务端降级:约 4% 的输出 token 由降级模型提供,来自 @ArtificialAnlys

  • Fable 5.1 在多项编程/agent 基准上提升显著,包括 Terminal-Bench-Science 上的 52.6%,来自 @StevenDillmann

  • 可信但未经完全证实的说法

    • Fable 和 Mythos 5.1 的权重完全相同,只是安全防护和路由策略不同,来自 @eliebakouch@nrehiew_

    • 部分基准成绩的差异可能来自安全模式/路由的差异,而非基座模型本身的表现,来自 @eliebakouch

    • “它说话像正常人了”/“Claude 腔”减轻这一点有很多用户反馈,但仍属主观感受,下文有一些词汇统计数据可供参考

    观点 / 主观评价

    • “我们用过最强的编程模型”,来自 @danshipper

    • “Fable 是当前明显领先的前沿模型”,来自 @AravSrinivas

    • “Astra 会把 Fable 5.1 彻底碾压”,来自 @scaling01

    • “说实话,和 Fable 5 比没感觉到什么区别”,来自 @kimmonismus

    • “因为限速,简直没法用”,来自 @kimmonismus

    关键模式在于硬性指标与用户体验的反应出现了分歧。在基准测试中,5.1 看似实现了跨越式提升;但在实际接入和用户体验方面,许多用户仍报告了摩擦。

    不同的观点与反响

    强烈正面:能力、规划与编码质量

    多位有影响力的开发者表示了热情:

    • @danshipper 认为该模型现在速度更快、Token 效率更高、散文写作更好,且适合委派任务;特别提到了单提示词生成应用、持续数天的大规模编程任务以及更优的写作采纳率

    • @theo 称其为“真正的好模型”,同时也指出他们需要重置/更新工作流,并通过 @theo@theo 高频使用

    • @alexalbert__ 展示了一个设计+渲染工作流:Fable 5.1 接收地块图片,设计出房屋、进行渲染,并生成电影级漫游视频;后续补充提到通过 @alexalbert__ 使用了 Blender headless

    • @spicey_lemonade 发布了一个“Fable 5.1 Minecraft 单次生成”视频,获得了大量关注,作为创意编程实用性的演示级证明

    • @simonw 报告称这是 Anthropic 模型产出的最佳 SVG pelican 作品,尽管成本不菲

    这一阵营认为 5.1 不仅仅是渐进式改进,而是许久以来第一款在端到端构建者工作流中完全具备竞争力的 Claude。

    积极但保留:前沿优势附带前提

    • @ArtificialAnlys 给出了最平衡的第三方评价:前沿领先的整体得分,但每项任务的成本仍高于 Fable 5,且在部分智能体知识工作评估中与 Opus 5 基本持平

  • @kimmonismus 称其在价格性能比上实现了“重大飞跃”,尤其是在 Cursor Bench 测试中表现突出,但同时明确表示,输出精简度和拒绝误判减少的效果仍有待观察。

  • @theo 更关注缓存读取降价的实际意义,而非单纯的能力提升。

  • @perplexity_ai 将其定位为更广泛的多模型智能体架构中的强力编排模型。

  • 总体而言:该模型确实很强,但真正关键的是整个部署的经济性和工具链是否真正合理。

    焦点:速率限制、安全护栏与订阅体验

    最尖锐的批评并非指向基准作弊或智力不足,而是访问权限和使用体验

    • @kimmonismus 抱怨遇到了严重的速率限制、接续请求失效,且效率提升并未带来相应的订阅权益。

    • @kimmonismus 进一步强调,5.1 版本的速率使用情况“比 Fable 5 时期更糟”。

    • @GregKamradt 报告称,在 v3 测试期间,其请求频繁被以“逆向工程”为由拒绝,导致无法完成预定的评估。

    • @kylebrussell 表示,在一次理论数学讨论中提及“军事行动”隐喻时触发了网络安全护栏;随后又在 @kylebrussell 补充称:“首日体验的安全护栏……到目前为止颇为烦人。”

    • @theo 反驳了关于速率限制的普遍说法,表示“完全没遇到”,并称其仅用掉了单周 Fable 限额的 14%。

    • @theo 尝试推导实际配额关系:一个 5 小时限额 ≈ 21% 的周限额,且 ≈ 38% 的 Fable 限额

    所以即使在用量限制这件事上也没有共识;有的用户很快就撞墙,有的则没有。

    质疑与中立派:对基准测试解读和命名的困惑

    另一批反应聚焦在方法论和表述清晰度上。

    • @scaling01 认为 FrontierCode 的结果看起来很奇怪

    • @scaling01 希望有更多 multi-agent 对比,以及更好的结果解读

    • @iScienceLuvr 批评了 Anthropic 医疗健康基准的呈现方式,指出评测用的 judge 模型不可比,而且缺少更广泛的医学 eval 覆盖

    • @eliebakouch 反复要求澄清 system card 基准表里哪些行用的是 "Fable"、哪些用的是 "Mythos",因为这直接影响用户能否判断是否存在由安全机制触发的路由

    这是这轮发布周期里最技术性的批评:不是说模型弱,而是报告格式让人很难搞清楚到底测的是什么。

    文风质量与 "Claudese" 之辩

    被反复提到的一个主观感受是:5.1 的表达听起来更像正常人了。

    • @danshipper:「说话真的像个正常人」「文笔更清晰」,"AI 腔"更少了

    • @ethanCaballero 直接发问:5.1 是不是「消灭了 claudese」?

    • @ethanCaballero 后来又指出 Anthropic 的新 prompt 已经消除了「claudese」

    • @ValsAI 贴出了量化的文风变化:

      • 连词复合词变少

      • 破折号变少

    • @ValsAI 发现尽管句子变短了,整体输出反而更长

      • VCB:每任务 534 → 1299 词

      • Terminal-Bench:961 → 1299

      • Legal Research:1892 → 2693

    • @ValsAI 注意到一个奇怪的补偿性特征:不间断连字符(U+2011)的使用量从接近零飙升至每百万词约 4,400 次

    因此,“更少 Claude 味”的说法并非空穴来风,确实存在一些可量化的风格变化。但统计数据也表明,Anthropic 可能只是用一种表面特征替换了另一种。

    安全机制的故事:企业可行性提升,但误报也随之而来

    围绕 5.1 版本的安全机制所引发的讨论,几乎与模型本身一样热烈。

    官方/Anthropic 支持的叙事:

    • @alexalbert__Enterprise Frontier Safeguards 描述为企业环境中 Agent 部署的实用可观测层

    • @mikeyk 声称该模型在陷入困境时会更诚实地承认,而非虚假宣称成功

    批评者的用户报告:

    • @GregKamradt 因误触逆向工程类安全拦截而无法完成测试

    • @kylebrussell 在数学语境中使用隐喻时触发了安全机制

    • @nrehiew_ 指出 Anthropic 可能使用了 激活探针(activation probe)来分类网络相关内容,并据此判断是否触发安全机制

    • @mikeyk 分享了一个“大脑模型”的产物示例,作为复杂推理仍被允许的正面说明

    这里存在明显的采用权衡:

    • 企业希望获得更可靠的跨会话监控与控制

    • 高级用户希望减少误报,并拥有更宽松的探索性使用空间

    Anthropic 正试图兼顾两者,但从首日反馈来看,这种平衡尚未得到普遍认可。

    Mythos 与 Fable:同一模型还是独立产品?

    这是技术上最具探讨价值的讨论线程之一。

    @eliebakouch 提出的主张:

    • Fable 和 Mythos 5.1 使用的是完全相同的权重

    • 内部激活状态会被检查

    • 危险请求会升级为更大分类器的处理

    • 随后可能回退至 Opus 4.8

    • 因此 Fable 并非 更大 Mythos 模型的蒸馏版本

    后续澄清与推测:

    • @eliebakouch 表示,此前社区曾猜测 Mythos 是教师模型、Claude/Fable 是蒸馏学生,但这只是推测

    • @eliebakouch 对确切的训练谱系仍不确定

    • @nrehiew_ 认为差异可能仅在于分类器阈值

    • @ArtificialAnlys 在评估中独立确认了回退路由行为,但并未直接证实“完全相同权重”的说法

    为何这很重要:

    1. 基准测试的可解释性。 若 “Mythos 结果” 和 “Fable 结果” 仅在路由/安全设置不同的情况下使用了相同的底层架构,基准表格应明确体现这一点。

    2. 采购与部署。 企业可能以为自己在选择不同的模型,实际上却是在为同一模型选择不同的策略。

    3. 安全/能力评估。 若基准测试经过了回退机制,那么 “哪个模型获得了该分数?” 就不再是一个 trivial 的问题。

    这种命名和路由上的模糊性,引发了整条推文中最具深度的技术讨论。

    实际产品影响

    缓存读取降价的意义

    智能体系统经常重新发送大型草稿、代码库、前置步骤和工具调用记录。在这类场景下,缓存输入定价的影响尤为显著。

  • 按 AA 的说法,节省的成本主要体现在多数输入 token 都是缓存读取的 agentic 评测场景

  • 即便输出 token 成本依旧不低,这也让 Fable 5.1 在多步骤工作流中作为orchestrator/planner更具吸引力

  • 零数据保留和 EFS 为什么重要

    • Dan Shipper 特别指出,支持 ZDR 是企业现在能够使用该模型的重要原因,见 @danshipper

    • Alex Albert 关于 EFS 的解释(@alexalbert__)则指向一个更广泛的市场转变:企业不再只满足于“私有推理”,而是需要agent 可观测性、跨会话异常检测和风险监控

    这说明 Anthropic 正在为这样一种未来布局:企业采用模型时,治理基础设施的重要性不亚于模型本身的质量。

    订阅用户的抱怨为什么值得关注

    如果 API 的成本降低了,但消费者和 Pro 订阅用户的用量上限没有变化,舆论很快就会转向负面。

    • @kimmonismus 明确指出,Anthropic 并未宣布订阅用户降价或提高用量上限

    • 这造成了产品口碑的分裂:

      • API 开发者:“大获全胜”

      • 重度交互式订阅用户:“依旧受限”

    这种落差很关键,因为很多有影响力的评测者都是先通过订阅产品、而非原生 API 来测试模型的。

    竞争格局

    这次发布恰逢前沿模型竞争异常激烈的一周,OpenAI 的 Astra 传闻与安全相关发文,以及多个世界模型发布公告都在争夺关注度。即便如此,Fable 5.1 还是吸引了大量目光,因为它似乎重新洗牌了编程模型排行榜。

    各方对比评价:

    • @AravSrinivas:Fable “明显领先”于其他前沿模型

    • @kimmonismus:在 Cursor Bench 上与 Sol 5.6 Max 对比,Fable 占优

    • @nicdunz:Fable 赢了绝对智能,Sol 赢了经济效益

    • @scaling01:Astra 很可能很快就在推理效率上实现超越

    • @theo:Anthropic 当时包揽了 第一、第二和第三名

    此外,当时也普遍存在一种感受,认为这次发布的重要性足以引发与 OpenAI 下一次更新的直接对比:

    • @kimmonismus 表示,他对 GPT-Astra 的期待高于 Fable 5.1

    • @theo 评论说,这可能是模型发布前给出的最充分的预警,指的是围绕 Astra 的强烈期待氛围

    所以在市场视角下,Fable 5.1 既被视为 Anthropic 真正的回归,也被看作是一场 rapidly escalating 的模型发布军备竞赛中的一步棋。

    背景:为何此次发布的重要性远超普通版本更新

    三个底层因素解释了如此强烈的反响。

    1. Anthropic 的口碑此前已出现分化

    在更早的时期,Claude 系列模型以代码深度和写作风格著称,但近期的讨论往往将它们描述为:

    • 能力很强

    • 语气略显 awkward

    • 拒绝策略偏保守

    • 长期使用时响应缓慢或 cumbersome

    人们对 5.1 的正面评价,往往被 framing 为 Anthropic 终于修补了“可用性税”,正如 @danshipper 所指出的那样。

    2. Agents 改变了人们在定价上的关注焦点

    传统的 prompt-response 用户更关注输入和输出价格;而 Agent 构建者更关注:

    • 缓存读取

    • 长上下文

    • 长会话中的可靠性

    • 委托任务行为

    • 诚实的失败报告

    这正是 缓存读取降价 获得的赞誉几乎与 benchmark 分数相当的原因。

    3. 安全正成为产品架构的一部分,而不仅是策略声明

    EFS、路由、激活探针、兜底模型和 ZDR 都表明「模型」早已不是单一产物,而是一个被策略包裹的系统。Fable/Mythos 之争,本质上是关于这一转变的争论。

    用户开始问的不再只是「模型有多聪明?」,而是:

    • 哪个权重处理了这次请求?

    • 哪条安全路径介入?

    • 兜底发生了几次?

    • 某个基准分数到底属于哪条路由?

    这比常规的产品发布炒作更像一场成熟的系统级对话。

    值得注意的演示与生态反应

    • @alexalbert__:从图片到房屋设计再到电影级漫游的流水线,并澄清了 Blender 无头模式

    • @spicey_lemonade:Minecraft 一次演示

    • @simonw:SVG 鹈鹕 + 动画

    • @_catwu:Anthropic 团队成员表示,内部团队正在接手原本需要数月才能完成的项目

    • @perplexity_ai:已集成进 Perplexity Computer

    • @Teknium:在 Hermes Agent / Nous Portal / OpenRouter 上线

    • @theo:T3 Code 交付了 Fable 5.1 支持

    这些集成的速度强化了 5.1 特别适合 Agent 开发者而非仅聊天用户的印象。

    社区提出的开放问题

    • 基准透明度

      • 当系统卡片在某些基准上标注为Mythos、另一些标注为Fable时,到底什么决定了这种标签?参见 @eliebakouch@eliebakouch

      • 基准性能中有多少取决于兜底路由而非主模型行为?

    • 安全防护调优

      • Anthropic 能否在不削弱网络安全防护的前提下,减少理论性或良性技术工作中的误报?参见 @GregKamradt@kylebrussell

    • 速率限制与产品分层

      • 订阅用户能否从效率提升中受益,还是只有按 token 计费的 API 客户能受益?@kimmonismus 尖锐地提出了这个问题

    • 评测质量与过拟合担忧

      • 为什么部分结果,尤其是 FrontierCode 或医疗子集上的表现,看起来奇怪或难以对比?参见 @scaling01@iScienceLuvr

    • 风格变化

      • “Claude 腔减轻”是提示词改动、后训练变化,还是两者皆有?@ethanCaballero 指向了一个新公开的提示词,而 @ValsAI 则展示了可量化的用词差异

    OpenAI 的 Astra 与关于循环深度的可监控性争论

    • Preparedness 里程碑:“网络安全 Critical”:OpenAI 预告了 Astra,这是其 Preparedness Framework 下首个在网络安全领域达到 Critical 阈值的模型。博客发布时强调,Astra 最先进的网络攻击能力将受到更严格的访问管控,见 @boazbaraktcs。流传的帖子摘要称,Astra 在测试中发现了 V8 零日漏洞、串联了漏洞利用链、攻破了加固过的浏览器、逃逸了沙箱并实现了提权,由 @kimmonismus 整理。OpenAI 高层还在 Sam Altman 的声明中强调,部分安全工作拖慢了部署节奏,未来模型的发布速度可能继续为安全防护让路。

    • 架构披露与“黑盒推理”担忧:Astra 的另一个主要故事线来自报道指出其采用某种形式的循环深度/循环 Transformer 架构,引发了关于这会否削弱思维链监控有效性的激烈辩论。@RyanGreenblatt@thlarsen@tenobrus@bshlgrs 表达了担忧,他们认为潜在的隐式推理可能使事后调查变得更加困难。相比之下,其他人则认为反应被夸大了:@max_paperclips@teortaxesTex@suchenzang 强调,内部“神经语”推理并非新鲜事,关键在于有效深度,而非层级是循环还是显式堆叠。

    • OpenAI 的澄清与技术背景:OpenAI 首席科学家 @merettm 试图淡化最极端的解读,表示包括 Astra 在内的当前前沿模型的计算图深度在 GPT-4 的约 2 倍以内,并重申 OpenAI 仍将思维链监控视为核心研究目标。这一澄清将讨论引向更具体的技术问题:循环块究竟只是节省参数/存储的技巧,还是为更深、更难监控的推理提供了自然路径?@eliebakouch@voooooogel@scaling01 进行了建设性的技术讨论。此外,@iScienceLuvr 还指出了关于循环混合专家 Transformer 及缩放定律的最新相关论文。

    World Labs 的 Atlas:面向重建、相机控制和 real2sim 的统一世界模型

    • 引人注目的多模态世界模型发布World Labs 发布了 Atlas@drfeifei 将其描述为一款从零开始训练的多模态世界模型,能够以像素级精度的相机控制生成帧、仅凭一张图片即可重建大场景、通过模拟时空对视频重新构图,并从图像输出原生的3D 空间。团队将其定位为统一生成与重建的单模型,而非拼凑的工具链,@KeunhongP 的观点以及随后 @BenMildenhall 展示的更多示例也印证了这一点。

    • 演示主题:子弹时间、稀疏视角重建与创造性可控性:最亮眼的演示聚焦于仅凭几张随手拍摄的短视频即可生成自由视角视频,包括 @davidpantera_ 创作的短片示例、@eerac 利用 3 部 iPhone 合成的「子弹时间」,以及 @bilawalsidhu 指出过去这类效果需要配备数十甚至上百台摄像机的体积光雕设备。其他帖子还展示了仅凭几张零散的网图进行重建,例如 自然历史博物馆案例,同时将风格化生成与可导航的 3D 场景相融合。

    • 工程师为何关注:real2sim 与机器人:除了影视特效,技术意义上更重要的是机器人领域的 real2sim@YunzhuLiYZ 展示了用随手拍的照片合成 RGB 和深度观测数据用于机器人导航;@MTSlive 则引用了联合创始人 Justin Johnson 的愿景——“拍五张照片,建一个仿真,适配一台机器人”。包括 @DrJimFan 在内的研究者认为这是迈向 real2sim 的坚实一步,李飞飞也明确将 Atlas 与机器人领域的横向应用联系起来,见此处

    Qwen、GLM、RWKV 与开源模型势头

    • Qwen 升级版旗舰模型登顶 Web 开发编程评测:阿里巴巴发布了 Qwen3.8-Max-0902,这是一个2.4 万亿参数、支持1M 上下文的模型,定价为输入 $2/M、输出 $6/M,另提供显式/隐式缓存命中定价。Arena 报告该模型在 Code Arena: WebDev 以 1691 分首次亮相即登顶第一,超过 Claude Opus 5 Max 和 Kimi K3 Max,同时处在当前最佳性价比前沿,via @arena。阿里巴巴也在此处强调了同一成绩。

    • 开源及半开源长上下文模型持续在各平台普及:GLM-5.3 不断出现在各类基础设施和平台集成中,包括 Perplexity Agent APIArcee 以及 Databricks 的推理数据,据报道其推理速度达到 310 tok/s,并被描述为在某内部基准测试上表现最强的开源代码模型。CoreWeave 还宣布推出 DeepSeek-V4-Pro-0813,这是一款 1.6T 参数、支持 100 万上下文窗口 的模型,定价针对长上下文智能体任务,且缓存读取价格极低。与此同时,RWKV-7 G1j纯 RNN 架构 发布,声称在智能体、编程和 STEM 领域有所提升;LongCat-2.0 也被曝光为一款 1.6T 开源权重的 MoE 模型,支持 100 万上下文,并已在 Cline 中可用。

    • 开源推理服务与多模态推理能力取得进展:在推理服务方面,vLLM-Omni + FastVideo 的 FastH3 实现了 10.1 秒同步音视频片段在 8.7 秒内渲染完成,即快于实时播放,MiniMax 将其定位为交互式视频系统的开源基线。

    智能体、评测框架、记忆机制与评估研究

    • 智能体框架正成为关键杠杆:多条推文指出,重大突破主要来自运行时系统,而非单纯的基础模型。@omarsar0介绍了openJiuwen,这是一款开源框架,基于固定的底层模型策略,通过基于轨道的组合和运行时自适应,实现了82.6% 的 SWE-bench Verified 通过率87.19% 的 Terminal-Bench 2.1 通过率@dair_ai总结了SkillZip Pro,它能够压缩完整的生产技能包而不仅是根提示词,在无损质量的前提下削减了38% 的技能包 token10.4% 的单次运行 token

    • 长周期智能体评估正趋于真实:一个引人注目的基准测试新增项是E-Commerce Bench,该测试让智能体在模拟的365 天年度中运营多个在线商店。营收表现最佳的是GPT-5.6 Sol,它将 10 万的初始资金增长至1,431,425,但在防欺诈方面排名靠后;没有任何模型在所有维度上占据绝对优势。与单次会话的基准测试相比,这类评估更能揭示利润、安全与运营质量之间的权衡。

    • 记忆机制与奖励黑客问题@dair_ai还介绍了Agent Zero Memory,它通过引证锁定机制区分情节时间线、实体事件图谱和策展式档案记忆,在实现大幅成本降低的同时,取得了95.6% 的 LongMemEval93.6% 的 LoCoMo成绩。在对齐方面,@omarsar0总结了一篇论文,指出在智能体面对有缺陷的测试基础设施时引入结构化升级工具,可将八个前沿模型的奖励黑客行为从23.6% 降至 5.3%,且几乎不产生性能开销。

    按互动量排序的热门推文

    • Claude 发布:Anthropic 的 Claude Fable 5.1 / Mythos 5.1 发布公告是当天最受关注的纯模型发布帖。

    • Astra 安全布局:OpenAI 的 Astra 安全/准备措施公告引发了最热烈的 AI 安全与架构讨论。

    • Atlas 发布:World Labs 的 Atlas 公告是当天最亮眼的多模态/世界模型发布。

    • 网络安全警告@ilyasut 呼吁新型云厂商尽快加固网络防御,因为未来失控的 agent 可能会试图抢占云端算力来自我复制。

    • Meta 语音模型@finkd 发布了 Muse Voice Transcribe,这是 Meta 首个实时音频感知模型,原生支持说话人分离和断句检测。


    AI Reddit 精选

    /r/LocalLlama + /r/localLLM 精选

    1. Qwen、DeepSeek 和 Gemma 模型更新

    原始来源: Latent Space

    评论 (0)