← 文章 / 行业与公司动态
Latent Space 1小时前 · 2026-09-23 21:12:54 · 0 阅读

Claude Opus 5.5 成为 AINews 默认模型,各厂商集体降价 40-50%

OpenAI 也拼了一回:GPT-6 Sol 和 Luna 以比 GPT-5.6 低 50% 的价格发布。但凭借1700万浏览量还在持续上涨,今天注定属于 Claude Opus 5.5——"Claude 5.5 系列的首个模型",大多数任务上达到"Claude Fable 5.1 的水平",运行成本还比 Opus 5 便宜 40%。

Claude@claudeai推出 Claude Opus 5.5,Claude 5.5 系列的首个模型。 它的大多数任务表现达到 Claude Fable 5.1 的水平,且运行成本比 Opus 5 低 40%。2026年9月22日 下午4:31 · 1720万 次浏览
2740 回复 · 8010 转发 · 8.52万 赞

Opus 5.5 在大多数基准测试上超越 Fable、挑战 Astra,两家实验室都把 API 降价归功于效率优化——但从 prefill、decode 到整体算力,各项指标都有两位数的巨大提升……

Theo - t3.gg@theoOpus 5.5 比 Opus 5 更小??Anthropic 的后训练是不是大幅进步了?太猛了。2026年9月22日 下午6:53 · 11万 次浏览
127 回复 · 74 转发 · 3880 赞

……不过在部分前沿任务上,token 消耗的增加抵消了一部分效率收益。

Artificial Analysis@ArtificialAnlysClaude Opus 5.5 (max) 每个 Intelligence Index 任务成本为 $5.98,与 Opus 5 (max) 的 $5.86 相近,但这其中包含了 token 用量的显著增长与 Anthropic 的降价 相比 Opus 5,Opus 5.5 增加的 token 用量会带来约 80% 的……2026年9月22日 晚上11:34 · 3.61万 次浏览
39 Replies · 25 Reposts · 603 Likes

不过,Claude 发布中少见的重点强调了写作能力的提升:“它会优先呈现最关键的信息,并严格遵循你给出的写作规则,这让长时间会话的体验更连贯易读。”

我们亲自验证了这一点。以下是今日的 AINews 板块在 Opus 5.5 和 Sol 6 上运行的结果。两者差异巨大——我们将立即在 AINews 中全面切换到 Opus 5.5,直至上线下一个模型或 AINews 版本。

Anthropic 还发布了关于大规模多智能体集群的初步工作(以及效率方面):

Lisan al Gaib@scaling01 很自豪 Anthropic 成为首个在系统卡中报告将多智能体系统扩展至 100 个并行智能体的实验室Lisan al Gaib @scaling01 Opus 5.5 系统卡 https://t.co/D1PDkVqChC5:01 PM · Sep 22, 2026 · 82.2K Views
30 Replies · 60 Reposts · 1.19K Likes

2026 年 9 月 21 日至 9 月 22 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有额外的 Discord 渠道。你可以在 AINews 网站搜索所有往期内容。提醒一下,AINews 现已成为 Latent Space 的一个板块。你可以选择订阅或退订特定频率的邮件通知!


AI Twitter 摘要

头条新闻:Claude Opus 5.5 发布、数据表现及各方反应

事件经过

Anthropic 发布了 Claude Opus 5.5,这是全新 Claude 5.5 家族的首款模型。其卖点是以 Opus 的定价提供 Fable 5.1 级别的能力,同时速度更快、写作质量更高。OpenAI 在约一小时前发布了 GPT‑6 Sol 和 Luna。

  • 发布时的宣称。 Opus 5.5 “在大多数任务上的表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%”(@claudeai@AnthropicAI)。

  • 领先领域。 Anthropic 称其在 agentic coding、计算机使用和知识工作方面处于领先地位(@claudeai)。

  • 速度与成本。 相比 Opus 5,其速度提升约 30%,单任务成本降低约 40%(@ClaudeDevs@lydiahallie)。

  • 沟通优化。 该模型将最关键的信息前置,并严格遵循用户的写作规范。这主要针对 Opus 5 收到的最普遍的用户反馈(@claudeai)。

  • 订阅服务变更:

    • 5 小时会话的额度限制提升了 20%。

    • 因价格降低,同等限制下的使用量可多出 25%。

    • Pro、Max 和 Team 用户将获得可灵活使用的时间累积重置额度(@claudeai@ClaudeDevs@trq212)。

  • 新的默认设置。 Opus 5.5 现为 Claude Code 和 Claude 应用(包括 Cowork)的默认模型。默认努力程度为中等,被描述为“智能水平堪比 Fable 5.1 但速度更快”(@_catwu)。

  • 可用渠道。 该模型已在 Claude Code 和 Claude Platform API(@ClaudeDevs)上线,并集成到 Slack 的 Claude Tag 中(@_catwu)。

  • 路线图。Sonnet 5.5 和 Haiku 5.5 将“在未来几周内”发布(@mikeyk@AiBattle_)。这也澄清了 Haiku 已被砍掉的传闻(@kimmonismus)。

  • 安全防护。Opus 5.5 是首个配备与 Fable 5.1 同级安全防护的 Opus,覆盖网络、生物和前沿 LLM 开发领域。被标记的请求会回退到另一个模型处理,Anthropic 表示正在“努力减少误标”(@ClaudeDevs)。

  • 发布前信号。官宣前不久,有人已在 Claude Code 里发现了这个模型(@kimmonismus)。

  • 系统卡。随发布同步公开(@scaling01)。

  • 定价与 token 经济学(事实)

    • 标价。Token 价格下调 20%,从每百万输入/输出 token 的 $5/$25 降到 $4/$20(@ValsAI)。

    • 但被更高的 token 消耗抵消。Vals 指出,Opus 5.5 往往消耗更多 token,尤其是在它提升最大的编码任务上。较低的标价有一部分会被用量吃掉。

    • Artificial Analysis 成本拆解。在最大推理力度下,Opus 5.5 每个 Intelligence Index 任务的成本为 $5.98,而 Opus 5(max)是 $5.86。他们的拆解如下(@ArtificialAnlys):

      • 仅 token 用量增加这一项,就会把单任务成本推高约 80%,达到 $10.51。

      • 基准价格下调 20% 后降到 $8.41。

      • 更便宜的缓存读取($0.20)再降到 $5.98。

    • 这意味着什么。在最大推理力度下,相比 Opus 5 的单任务成本优势不复存在。“便宜 40%”的说法只在默认(中等)设置下成立。

    • 对比 Fable 5.1。Cline 报告称,Opus 5.5 在 Artificial Analysis Intelligence Index 上以约 2.5 倍更低的成本击败了 Fable 5.1(@cline)。

    • Prompt 缓存。在 Claude Code v2.1.280+ 中,会话中途切换 effort 模式不会破坏 prompt 缓存(@lydiahallie)。

    • 模型规模(推测)。@theo 声称 Opus 5.5 比 Opus 5 更小,并将此归因于 post-training。官方并未确认这一点。

    基准测试与独立评测

    Anthropic 官方表格。在 Anthropic 发布的重点对比表中,Opus 5.5 在所有行上都优于 Fable 5.1,并在大多数项目上超越 GPT‑6 Astra(@kimmonismus@synthwavedd@scaling01)。

    @ShayneRedford(Anthropic)总结了声称的改进:

    • 在 CursorBench、KWBench 和 OSWorld 上表现优于 Astra。

    • 风格和指令遵循能力大幅提升。

    • 科学和健康领域能力更强。

    • 对网络与生物滥用更具鲁棒性。

    第三方及合作伙伴评测:

    EvalResultSourceVals 指数排名第1,较 Opus 5 上升2个名次/2分;Anthropic 占据前三席位(GPT‑6 Sol 待发布)@ValsAIVals RSI 指数排名第1;该模型在 LM Training 任务上首次超越其协议下的公开参考基准;性能超过 Fable 5.1@ValsAI@ValsAIFrontierSWE (Proximal) 得分 62.3%,位列第2,落后于 GPT‑6 Astra(65.5%);领先于 Fable 5.1(56.3%)和 Opus 5(52.0%)@ProximalHQFrontierCode 1.1 (Cognition) 在扩展模式(Extended)下得分 65.3%,“以极低的成本”从 Fable 5 手中夺回榜首@cognitionCursorBench 得分 57.8%(Max 模式),成为新的最强模型;单任务成本比 Opus 5 低 40%@cursor_aiPerplexity WANDR 得分 0.610,成本为 $4.13/任务;性能略高于 Fable 5.1,且成本低 67.6%@perplexity_aiParseBench(表格)得分 93.9%,比 Opus 5 高 7 分;超越 Fable、Gemini 和 Astra@jerryjliu0Roboflow 视觉/检测“Anthropic 迄今视觉能力最强的模型”;目前已在 Playground 排行榜上超越 Google 模型@skalskip92@skalskip92

    评测详情与注意事项:

    • Vals 运行配置。 RSI 在原生 Claude Code 环境中以最大力度(max effort)运行,配置为 1M 上下文、128K 最大输出 tokens,temperature 设为 1(@ValsAI)。

    • ParseBench 注意事项。 模型在处理图表、格式和布局时仍有困难。LlamaIndex 指出其每页 5.8¢ 的成本对于生产环境下的 OCR 而言过于昂贵。但请注意,该评价出自拥有竞品产品的厂商。

    • AI 研发与编码对比。 @eliebakouch 解读系统卡时称,该模型在 AI 研发方面“表现大致相当”,但在智能体编码(agentic coding)上“实力强劲”。

  • 已饱和。@scaling01 问 CoBench 是不是“完蛋了”。@synthwavedd 调侃这个新基准一出就饱和了。

  • Arena。Opus 5.5 已上线 Agent Arena,并在 WebDev、文本、视觉和文档类目的 Battle Mode 中可用。目前还没有分数(@arena)。

  • Effort 扩展的异常现象。在一张 agentic coding 图表上,xhigh effort 的成本约为 medium 的 2.8 倍,分数却低了 3.2 分@LearnOpenCV)。@Yuchenj_UW 称之为“最离奇的基准测试结果”,建议直接用 medium。

    @nrehiew_ 给出了一种解释:

    • Opus 5 在 FrontierCode 上也有同样的表现。

    • FrontierCode 会惩罚不必要的改动,而更高的 effort 会带来范围蔓延。

    • 因此模型“在更高的推理 effort 下表现反而持续变差”。

    System card 细节

    • 多智能体扩展。system card 在 8.12 节报告了最多扩展到 100 个并行 agent 的测试。@scaling01 称这是首家实验室发布此类报告。@maksym_andr 将其视为多智能体 scaling law 的实证依据。

    • ProgramBench 的争议。ProgramBench 作者 @OfirPress 指出,Anthropic 接近 100% 的解决率来自 166/200 的子集,而这个子集很可能剔除了最难的程序,比如 FFmpeg 和 PHP 编译器。他还指出了指标口径不一致的问题(@OfirPress@OfirPress):

      • Anthropic 报告的是平均测试通过率。

      • ProgramBench 报告的是完整任务完成率。

      • 部分完成的任务通常能通过 60–70% 的测试,这会推高通过率指标。

    • 与 Mythos 5.1 的对比。Opus 5.5 在 Anthropic 的 ECI 基准测试中得分高于 Mythos 5.1,并在所有测试过的网络安全评估中胜出(@scaling01@scaling01)。

    • 奇怪的价值对齐发现。@teortaxesTex 引用了一段文字:“恶意输出几乎完全出现在 Claude 在产生恶意输出之前做了一个不大可能且无害错误的案例中”。他质疑 Anthropic 是否“给自己植入了潜伏代理”。

    • “源自 RSI 的训练”。他另外引用了一行关于“第一个源自 RSI 训练的模型”的描述,并认为这令人担忧(@teortaxesTex)。

    • 生物医学影像。@iScienceLuvr 欢迎了据报道具备的生物医学图像分析能力。

    • 更多需求。@scaling01 希望提供不带思维链的时间跨度选项。

    安全立场与保障措施争议

    官方立场:

    • Sam Bowman:Opus 5.5 比前代模型“安全得多,发布它更有可能降低与价值对齐相关的风险”,尤其是针对最极端的对齐风险(@sleepinyourhat@sleepinyourhat)。

    • 他也承认对跟上不断升级的风险节奏感到担忧,但同时表示在当前能力水平下现有工具仍然可信(@sleepinyourhat)。

    • Mike Krieger 提到了广泛的价值对齐测试和外部评估,包括来自 METR 的评估(@mikeyk)。

    摩擦点:

    • 备用模型触发过度。@iScienceLuvr 在要求 Opus 5.5 治愈癌症后,被降级至备用模型。

    • 针对中国的定位(单项测试)。 @xlr8harder 称快速测试显示,前沿 LLM 开发的分类器针对的是中国硬件。他呼吁进行更多深入探究。

    • 对涉华动向的反应。 @teortaxesTex 认为此举意在打压中国 AI 发展。而 @jakehalloran1 则解读为保护 Trainium 的专有技术。

    “把控前沿节奏”的叙事框架:

    • @theo 指出,今日发布的模型均不属于 Astra 或 Fable 级别,这是有意放缓节奏的表现。

    • @goodside 表示,实验室呼吁把控前沿节奏的做法,削弱了他之前“暂停研发”的立场。

    • @dejavucoder 讽刺了这种说法,因为 Opus 5.5 的性能实际上优于 Fable 5.1。

    写作、提示词与行为表现

    • 团队成员的写作优化。 如 @_sholtodouglas 所言“我们修复了写作问题”,以及 @NotTomBrown 提到的“我们修正了口音”。
      @_sholtodouglas@NotTomBrown

    • 罕见的坦率。 Anthropic 的 @nmca 发帖称:“比 Opus 5 好得多,好太多。抱歉之前那个模型表现不佳。”
      @theo 称这条推文惊人,释放出沟通风格更宽松的信号。

    • 破折号。 @theo 指出输出中已不再出现破折号。这是互动率最高的回应帖。

    • Anthropic 的提示词攻略 (@ClaudeDevs):

      • 整体交付任务,并明确“完成”标准及检查点。

      • 无需再说“仔细思考”,因为模型总会先进行思考。

      • 长时间运行后,询问模型还需要什么才能继续推进。

    • 老套路为何失灵。 @dbreunig 指出,旧的 prompt 技巧如今与模型训练相冲突,这说明了可重新编译的 prompt 优化的必要性。

    • 长时间运行的引导。 @omarsar0 关注到 Anthropic 针对长时任务给出的 prompt,模型有时会停下来汇报而不是继续执行。

    • Bug 反馈。 线上模型有时会生成 user 角色的对话(@BlackHC)。

    • 实战写作质量。 Hamel Husain 直播了「Is Slop Dead?」来测试模型的写作能力(@HamelHusain)。@nptacek 也分享了个人写作评测中一次生成的结果。

    视觉、3D 和代码即艺术的演示

    • 感知能力提升。 Sholto Douglas 表示 5.5 系列在 3D 理解和建模上有「质的飞跃」,模型「现在能看见了,以前有点瞎」(@_sholtodouglas@_sholtodouglas)。

    • 用代码作画。 @jkeatn 让模型用纯 Python 逐像素生成绘画:

      • 约 7500 行代码,仅用标准库模拟笔刷风格。

      • 不依赖图像模型,也没有参考图。

      • Sholto 将这种「手工笔刷」式的创作与 diffusion 模型做了对比(@_sholtodouglas)。

    • Blender 场景。 Alex Albert 展示了在 claude.ai 上用一个 prompt 生成的 Blender 粘土动画(@alexalbert__)。他还基于史料还原了 1906 年的旧金山 Market Street:

      • 素材来自 Sanborn 地图、当年的影片和档案照片。

      • 纯程序化生成,不依赖下载的网格或纹理(@alexalbert__提示词)。

      • @karpathy 对这个概念进行了发挥:将历史图片或视频转化为可漫游的定制 GTA 风格世界。

    • 更多演示:

      • 代码绘制的 JS 动画(@kevin_t_ngo)以及官方探索帖(@claudeai)。

      • 代码生成的金门大桥,在 3D 场景方面被评为“媲美 Astra”(@petergyang)。

      • “我测试过的所有模型中视觉效果最好”(@other__reality)。

      • 珊瑚礁壁纸;构建者表示其速度快了约 3 倍且成本更低(@chaseleantj)。

    • 开放性问题。 @teortaxesTex 询问为何这一代模型在将函数映射到像素方面表现如此出色,并建议关注其泛化能力。

    反响:支持、质疑与对比

    支持声音:

    • 流水线漏洞。 @rishdotblog 指出其发现了 Fable 和 Astra 错过的流水线问题。它还发现了 7 处 SEC 文件错误,包括 Comfort Systems 将 Q1 营收在 XBRL 中误标记为全年营收(@rishdotblog)。

    • 回流用户。 “Claude 回来了”:@Yuchenj_UW 表示,离开一个月后,他正重新回到 Claude Code。

    • 使用限额。 全天候高强度使用对限额的消耗“微乎其微”(@theo)。

    • 怀旧情绪。 人们将其与备受好评的 Opus 4.5 和 4.6 进行比较(@arohan@kimmonismus)。

    • 竞争视角。 @scaling01 表示 Anthropic “又在前沿模型上耍大牌了”。@kimmonismus 称 “他们选择与 OpenAI 开战”。

    持怀疑或中立态度:

    • 信任赤字。 @kylebrussell 称他不再相信 Opus 的新版本会令人感到惊艳。Sholto 回复询问这次发布是否能让信任重获新生(@_sholtodouglas)。

    • 限制并非人人受限。 @stablequan 表示反正自己从来不触及使用限制。

    • 价格成为头条。 @dbreunig 提问,如果两家公司主打的卖点都是 token 降价,这意味着什么?

    与 GPT‑6 Sol 正面交锋:

    • 偏向 Opus。 @andrew_n_carr 称 Opus 5.5 “让 Sol 望尘莫及”。@synthwavedd 认为 Sol 表现未达预期,Anthropic “赢得了这一局”。

    • 反对 Opus。 @teortaxesTex 指出,鉴于 Sol 的价格仅为 Opus 5.5 的一半,其成本和多智能体优势会被 “Astra+Sol+Luna 的频繁调用所抵消”(@scaling01)。

    • 中立。 @kimmonismus 的总结认为胜负难分:Anthropic 在能力惊喜上领先,OpenAI 则在价格上占优。@simonw 发布了一篇评测文章,在不同 effort 级别下用鹈鹕网格(pelican grids)对比了这三款模型。

    OpenAI 发布 GPT-6 Sol 与 Luna:基于 Astra 的更便宜模型,覆盖 Codex、Work 和 API

    • OpenAI 数小时内便作出回应,推出 GPT-6 SolGPT-6 Luna,主打更快、更便宜,并继承了 GPT-6 Astra 在编程、计算机操作、事实性和对齐方面的大部分进展 @OpenAI @OpenAIDevs。定价相当激进:Sol 为每百万输入/输出 token $2 / $10Luna 为 $0.10 / $0.50,均比对应的 GPT-5.6 前代便宜约 50% @OpenAI。两款模型已上线 ChatGPT Work 和 Codex 以及 API,桌面端应用中的 Free 和 Go 用户也可以使用 Luna,但值得注意的是暂不支持 Chat 模式 @OpenAI

    • OpenAI 的宣传重点放在单位任务成本的 Pareto 优化上,而非旗舰级的绝对性能领先。官方示例称,在 AutomationBench 上,Sol 以 xhigh effort 运行可超过 Claude Opus 5 max,而成本仅为每任务约 9%;在 OSWorld 2.0 离线测试中,Luna max 优于 GPT-5.6 Sol medium,成本只有十分之一 @reach_vb。第三方集成也迅速跟进:Perplexity 将 Sol 设为默认的 “Light” effort 编排模型 @perplexity_aiDevin 称 Sol 在每任务成本低 61% 的情况下与 GPT-5.6 Sol 表现相当,Luna 则以约四分之一的成本胜过前代 @cognitionArena 也已加入两款模型用于 agent 和代码方向的测试 @arena

    • 深层基础设施的故事可能比产品命名更重要。OpenAI 称其提升了缓存与推理效率,支持针对缓存输入令牌读取高达 90% 的折扣,并推出了新的 Prompt Caching Dashboard 及诊断 API,以帮助理解缓存复用故障 @OpenAIDevs @OpenAIDevs。这对长期运行的 Agent 尤为关键,因为工具切换或推理变更引发的缓存失效一直成本高昂。市场反应不一:许多人称赞其经济性,尤其是 Luna 的价格底线;另一些人则认为 Anthropic 在顶级模型质量上胜出,而 OpenAI 在亲民定价与部署易用性上占优 @kimmonismus @synthwavedd

    Agent 基础设施、评测工具及基于真实场景的后续训练

    • 多篇帖子指向一个日益熟悉的趋势:价值重心正从单纯的模型访问转向<強> Harness、评测、路由及基于专有轨迹的后续训练。DigitalOcean Managed Agents 进入公测,支持 Claude Code、Codex 及 LangGraph 风格的 Agent,具备闲置暂停运行时、受治理的工具端点及 75+ 模型选择 @digitalocean。在开发工作流方面,VS Code Agent Merge 引入了实验模式,可自动在 PR 中解决评审意见、失败检查及合并冲突 @code

    • Perplexity 分享了目前较为具体的训练后(post-training)报告之一:其 Computer agent 混合使用了拒绝采样微调(rejection-sampling fine-tuning)和提示引导的自蒸馏(hint-guided self-distillation),基于真实用户会话数据,从成功轨迹和明确的工具调用错误中学习。据称在在线 A/B 测试中,工具调用失败率降低了 21.2% @perplexity_ai @AravSrinivas。这是一个很好的例子,展示了实验室如何通过生产环境追踪数据(production traces)而非纯合成强化学习环境,将仿真到真实的跨越(sim-to-real bridging)落地应用。

    • 评估(Eval)和可观测性(observability)工具也备受关注。Lenny’s newsletter 列举了 Ramp、Shopify、Harvey 和 Cursor 等公司投资评估体系带来的具体投资回报率,并推荐了 Hamel HusainShreya Shankar 关于高级评估系统的后续文章 @lennysan。Hamel 还发布了一个评估技能/插件,旨在自动化评估审计和错误分析的部分环节 @lennysan。在可观测性方面,LangSmith 增强了对 决策模型(如 Jev/SemIf)的支持,使 agent 追踪中的状态、问题、选项和输出更易检查 @hwchase17 @LangChain。来自多位从业者的核心观点:即使模型和提示词相同,执行框架(harness)也可能显著改变基准测试结果 @omarsar0

    开放模型、压缩以及在更小硬件上运行更大模型的工程实践

    • Tim Dettmers开启了“开源周”,发布了集成到 bitsandbytes2运行时动态压缩框架,目标是高质量实现 1.5–2.0 bit 压缩,并承诺提供“惰性压缩”——在部署时自动找到更优的内存/质量/速度权衡方案 @Tim_Dettmers @Tim_Dettmers。这套方案明确面向内存受限、想要运行大型开源权重模型(包括不断增长的 KV cache)的小团队和个人。

    • 硬件与本地部署也是本周的主题之一。一篇关于 NVIDIA DGX Spark 的上手文章介绍了这款 15×15×5.05 厘米、重 1.2 kg 的设备:搭载 GB10 Grace Blackwell 芯片、128 GB 统一内存,理论算力最高可达 1 PFLOP FP4 稀疏计算。NVIDIA 声称经量化后可本地推理高达 200B 参数的模型,并可通过 QLoRA 等方法微调最高 70B 的模型 @kimmonismus。另外,Reka EdgeQ 展示了一款针对 Qualcomm Hexagon NPU 直接优化的端侧 VLM,TTFT 仅 0.73 秒、每次推理耗电 6.9 mWh,且让 GPU 保持空闲以维持持续散热表现 @RekaAILabs

    • 在开源模型方面,除了常规的讨论,还涌现了几项有实质意义的发布。Step Code v0.1.0 基于 MIT 协议推出,这是一个编码代理 CLI,据称在 Terminal-Bench 2.1 上得分 80.9%,在 Multi-Frame(一项包含 150 个长程任务的基准测试)上得分 73.3% @StepFun_aiMing-Image-0.1-Design 是一个 6B 参数量的开源权重图像设计模型家族,发布时同步推出了 UI 设计和“图像转可编辑 PPT”等代理技能,并声称在 Artificial Analysis 的 UI/UX 设计排行榜上位列 开源权重模型第一 @AntLingAGI。此外,Rigel 带来了一项规模较小但在技术上颇具亮点的预训练成果,这是一款 2.3B 总参/360B 激活参数的 Hybrid Mamba-2 MoE 模型,据称是在 H100/A100/V100 及 TPU v5p/v6e 等异构混合硬件上、基于同一套代码库训练而成的,仅用 Llama-3.2-3B 预训练 FLOPs 的 <1% 便达到了与其差距无几的性能 @MayankMish98

    多模态模型:图像、视频、语音与世界模型

    • 在图像生成与编辑领域,Qwen-Image-2.1 在社区排行榜上表现强劲,同时在 Image Edit ArenaText-to-Image Arena 中拿下 开源模型第一,整体表现已逼近前沿闭源系统 @arena。生态配套工作方面,包括支持 Unsloth DesktopINT8/FP8 及 GGUF 格式,配合内存卸载可在 6–8 GB VRAM 下运行 @danielhanchen,以及 Gradio 致力于将 Qwen 默认的 9B 提示词改写器 精简至 0.8B 以便在笔记本电脑上运行 @Gradio

    • 在视频和实时媒体领域,PixVerse R2 被宣布为一款实时世界模型,强调可编辑、持久化的“活体世界” @PixVerse;而 fal 则发布了 H3 Max 的技术栈拆解,声称通过涵盖后训练、GPU 执行、权重加载、扩展及服务等环节的优化,实现了3 秒内生成 5 秒视频 @fal。其世界模型加速器接口值得关注,该接口将请求/响应语义替换为针对交互式模型的持久化 WebRTC 会话 @fal

    • 语音领域同样活跃。AssemblyAI Universal-3.5 Pro 在 OpenRouter 上线,支持19 种语言的同步 STT,并通过关键词和提示词实现领域导向,目前还有临时折扣 @OpenRouterStepAudio 3 ASR 在 Artificial Analysis 的AA-WER 指数上达到了1.7% 的词错率,在非流式语音转文本领域基本与榜首持平,尽管价格略高 @ArtificialAnlysMoondream 还发布了支持25 种语言的本地 STT 模型 Parakeet ReduxParakeet Ultra,分别针对 CPU 和 GPU 进行优化 @moondreamai

    热门推文(按互动量排序)

    • Claude Opus 5.5 发布:Anthropic 的主要发布帖互动量最高,定义了当天最大的模型事件 @claudeai

    • GPT-6 Sol 和 Luna 发布:OpenAI 推出更便宜的 Astra 衍生模型,是当天的另一大头条 @OpenAI

    • Managed Agents 预览版:DigitalOcean 为 Claude Code/Codex/自定义智能体推出的托管运行时公开预览,引发了异常高的基础设施关注度 @digitalocean

    • OpenAI 标准提案:Sam Altman 关于 AI 标准与治理的发帖引发了大量讨论,热度超出一般产品新闻 @sama

    • Epoch 谈 AI 成本曲线:Epoch 估算自 2023 年以来,同等性能下的 AI 成本每季度下降约 47%,这是当天颇有价值的宏观数据 @EpochAIResearch


    AI Reddit 摘要

    /r/LocalLlama + /r/localLLM 摘要

    1. Qwen、DeepSeek 与 AliceAI 大模型路线图

    • Qwen4-27B 已获确认(热度:2353):一张会议幻灯片 截图似乎确认了即将推出的 Qwen4 系列,明确列出了 Qwen4-27B,与 Qwen4-Max、Qwen4-Flash 和 Qwen4-Plus 并列。帖子指出,社区关心阿里巴巴是否也会发布更小的 MoE 变体如 35B-A3B,有评论者推测 N-gram 之类的架构改动可能降低显存需求。评论者主要在讨论 Qwen4-27B 能否超越 Qwen 3.8 Flash Next,以及最佳本地推理方案会偏向独立显卡还是大容量统一内存设备。大家还期待在 Qwen4 FlashQwen3.8 Flash NextQwen4-27B 都以开放权重发布后进行对比。

      • 有评论者推测,如果 Qwen4-27B 采用 N-gram 风格架构,显存需求可能更低,但帖子里没有给出具体实现细节或显存数据。

      • 有人提出在假设三者都以开放权重发布的前提下,对比 Qwen4 FlashQwen3.8 Flash NextQwen4-27B。核心问题是:稠密/标准 27B 模型能否足够明显地超越更小的 Flash 变体,从而决定用户该优先选择独立显卡还是大统一内存系统。

        • 有用户希望Qwen4 Flash能保持类似Flash Next的内存占用,目标部署在128 GB显存以内,反映出大家关注大型开源权重 Qwen 模型在本地进行推理的可行性。

      • 阿里巴巴计划推出参数量达 5 万亿至 10 万亿的 AI 模型,并发布新芯片(互动量:648):据报道,阿里巴巴正计划开发参数量在 5T–10T 区间的 AI 模型,并展示了新款 AI 芯片,暗示其前沿规模训练/推理目标远超当前消费级或本地部署的实用性。评论者将此举与此前对 DeepSeek R1 671B/691B 级别规模的激动情绪相联系,并预计任何实际下游应用都将通过蒸馏到更小的 Qwen 家族模型来实现,例如假设中的 Qwen 4 27B 主要争论在于对本地推理可行性的怀疑——“每个 token 需数分钟”——与乐观观点之间的对立,后者认为阿里巴巴可能会将内部更大的模型(可能是“Astra”)蒸馏为一个真正具有竞争力的中国前沿模型。

        • 评论者指出,5T–10T 参数的阿里巴巴模型对绝大多数用户而言将仅支持 API 调用,在家庭实验室硬件上进行本地部署不切实际,且在没有重大稀疏化、量化或专用服务硬件的情况下,生成速度可能慢至“每个 token 需数分钟”

        • 多篇评论将可能的实用价值框架为蒸馏,并将其与DeepSeek R1 671B/691B级别参数量引发的兴奋之情相比,建议用户不妨等待一个更小的衍生模型(如假设的Qwen 4 27B),以便能在本地运行。

        • 一位评论者推测,如果阿里巴巴已成功蒸馏或融入了Astra的能力,这可能意味着其对中国前沿模型的推进更为认真,但该线程并未提供基准测试证据或实现细节来验证这一说法。

    原始来源: Latent Space

    评论 (0)