← 文章 / AI技术
Latent Space 5小时前 · 2026-09-12 22:26:48 · 4 阅读

DeepSeek v4.1-Flash 发布:采用 763B 参数混合架构,视觉能力回归,巨鲸归来

虽然这篇发得有点晚,但总比不发强。最近一直忙着敲定第二届 AIE NYC,一个月后见。趁票价还没涨,赶紧买票——下周我们会公布演讲嘉宾名单,包括 Bridgewater、Ramp、Coatue、Mastercard、Vanguard、Coinbase、BlackRock、Fidelity、Point72、Capital One、JPMC、Wells Fargo、Bloomberg、A24(对,就是那家电影工作室)、Labs、Two Sigma、Apollo Global 等机构的大佬!


DeepSeek 追求研究议程的方式简直令人着迷。 在 v2、v3 到 v4 等主要版本之间,他们发布了若干中间论文,每篇都聚焦于某项架构的极致改进,几乎篇篇命中,比如数学方向 (尤其是 GRPO)、代码方向以及R1此外还有近期关于流形约束超连接与压缩稀疏注意力的研究。自 2025 年上半年 R1 论文引发巨大关注后,DeepSeek 开始低调行事,过去这一年里,他们很乐意让 GLM 和 Kimi 等同行在开源模型领域唱主角。

前一阵子局面一度不太乐观,但真正的“鲸鱼铁粉”从未动摇。如今 DeepSeek 在传递一个相当矛盾的信号:一边推出全新的架构,一边让 V4 Pro 退役,全力押注这个新模型——却只把它命名为 v4.1 Flash。这像是在测试你有没有能力透过表面标题看懂真正的技术突破。

没错,从某些 benchmark 来看,v4.1 Flash 确实落后于其他开源模型。但原因在于,我们还没有能准确衡量 v4.1 及 DeepSeek 整个研究路线真正目标的测试——那就是公开讲清楚的有史以来最具创造力、最高效的上下文利用方式。

X avatar for @deepseek_aiDeepSeek@deepseek_ai🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6 6:10 AM · Sep 10, 2026 · 6.04M Views
933 Replies · 3.02K Reposts · 27.7K Likes

如果你只看模型版本号和 benchmark 标题,那你恰恰就是 DeepSeek 想要“迷惑”的那种肤浅读者。要理解 DeepSeek 这次的巨大进步,最好的方式是看看 Sebastian 的这张梗图:

X avatar for @rasbtSebastian Raschka@rasbt我知道,抱歉,但这很难拒绝 3:21 AM · 2026年9月11日 · 6.72K 浏览
8 条回复 · 3 次转发 · 120 个赞

模型名称没变,但在任何标准下这都绝不仅仅是 0.1 的微小更新,他们甚至直接加入了视觉能力,无需等待单独发布的视觉模型。为了更直观地理解,你可以查看所有模型创新如何随时间层层叠加,追溯至《Attention is All You Need:》中的初代 Encoder-Decoder 架构:

X avatar for @petergostevPeter Gostev@petergostev我让 Astra 阅读了 DeepSeek v4.1 Flash 论文,并将其与原始 Transformer 架构进行了 3D 对比 - 你可以放大并并排检查每个元素。变化确实很大。 亲自试试:…architecture.petergostev.chatgpt.site 8:43 PM · 2026年9月10日 · 218K 浏览
54 条回复 · 334 次转发 · 2.76K 点赞

如果你读过我们的 DeepSeek V4 Pro 解读Engram 论文,应该已经掌握了截至 2026 年 4 月 DeepSeek 的基本架构脉络。但我们非常推崇的是这里引入的 prefill/decode 分离设计:prefill 阶段使用 8B 参数处理输入 token,decode 阶段使用 16B 参数生成输出 token。若沿用 MoE 的命名惯例,这套架构可称为“DeepSeek v4.1-Flash: 763B-P8B-D16B”,对应的稀疏度约为 1-2%。配合 DeepSeek v4.1 Flash 技术报告中提到的 Sliding-Window Attention Bounded Replay 等优化,其 KV cache 占用量仅为 V4 Flash 的 1/8,显著提升了长周期 agent 任务的效率、速度与性价比:

很高兴看到 DeepSeek 重新发布 SOTA 级别的研究成果。我们要重点提一下他们在 post-training 方面的观点,他们很大程度上 认同了唐杰教授

X avatar for @lu__jasperJasper Lu@lu__jasper这个信号很重要。DeepSeek 一直是最先探索新算法和新架构的实验室,如今却表示:现阶段提升数据质量的投入回报率,已经远超研究新的 post-training 算法。 我认为事实上这一转变早已持续了一段时间……X avatar for @deepseek_aiDeepSeek @deepseek_ai🚀 发布 DeepSeek-V4.1-Flash:更聪明、更快、更高效。 🔹 推出全新架构家族中尺寸最小的模型,并原生支持视觉理解。 🔹 设计目标是在能力更强、推理更快、吞吐更高的同时,向更大规模模型扩展。 1/64:08 PM · Sep 10, 2026 · 176K Views
56 Replies · 143 Reposts · 1.67K Likes

2026年9月9日至10日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,未包含其他 Discord。AINews 网站支持搜索全部往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目,你可以自行选择订阅或退订邮件推送频率!


AI Twitter 回顾

DeepSeek 发布了 V4.1-Flash,这是一个全新的开放权重旗舰模型,主打极致的推理效率和低成本。

  • 独立基准测试机构 Artificial Analysis 报道,DeepSeek V4.1 Flash 性能超越 DeepSeek V4 Pro 0813,但价格远低于后者。其在 Artificial Analysis Intelligence Index 上得分 40,略低于 GLM-5.3-Flash,高于最新 V4 Pro。输入价格 $0.30 / 百万 tokens,输出价格 $1.20 / 百万 tokens,缓存输入价格 $0.006 / 百万 tokens,并有 50% 非高峰折扣。该机构还指出,该模型 总参数 763B输入激活参数 8B输出激活参数 16B上下文长度 1M tokens,支持文本 + 图像输入,采用 MIT 许可证,可由 DeepSeek 官方通过美国 / API 访问 @ArtificialAnlys@ArtificialAnlys@ArtificialAnlys

  • Vals 称其为 Vals Index 上排名第一的开放权重模型,超越 Kimi K3,单次测试成本仅 $0.30,是开放权重前 10 名中最便宜的模型。他们还强调,评估过程采用 1M 上下文最大输出 384 tokenstemperature 1、默认 top-p/top-k 以及 高强度推理 @ValsAI@ValsAI@ValsAI

  • Baseten 提供首日支持,并将产品定位概括为:比 DeepSeek v4 Pro 0813 更聪明、更快、更高效,具备 文本与视觉能力仅限美国服务ZDR1M 上下文 @baseten

  • Ollama 开始向 Max 和 Team 账户推送该模型,随后扩展至 Pro 订阅用户 @ollama@ollama@ollama

架构与论文级技术细节

备受关注的技术亮点在于其因果编码器-解码器(causal encoder-decoder)设计,旨在降低活跃计算量及 KV/缓存成本。

  • Artificial Analysis 指出,该模型采用了新颖的因果 Encoder-Decoder 架构,输入/预填充阶段的活跃参数为 8B,输出/解码阶段为 16B @ArtificialAnlys

  • Sebastian Raschka 将 V4.1 形容为一次“重大革新”,并表示“本应称之为 DeepSeek V5”,明确强调编码器-解码器结构是相对于以往 DeepSeek 代际的关键突破 @rasbt

  • 多位技术读者对这种设计给出了“ unusually 混合”的评价:有人形容其是“研究中保守甚至陈旧的思想,与工程中前沿效率及硬件设计的有趣结合” @_xjdr

  • Stochastic Chasm 对该架构的精读分析将其设计理念与 HySparse、NSA 以及 DeepSeek V4 自身的 CSA/HCA 进行了对比,总结认为该架构本质是局部滑动窗口分支加上稀疏检索分支,暗示这种稀疏/局部混合范式正成为一种更广泛趋势 @stochasticchasm

  • 同一账号还提到多模态方面的改动并不激进,称 DeepSeek 主要“让骨干网络处理大部分任务并接收视觉 token”,采用了 3x3 像素解交织(unshuffle),而非更常见的 2x2 @stochasticchasm

  • 该账号随后指出其与 K3 在视觉编码器上存在“巨大差异”,暗示其视觉前端设计与国内近期同侪有实质不同 @stochasticchasm

  • TeortaxesTex 观察到 DeepSeek 一贯在前 N 层做非常规处理的规律——此前是密集连接或哈希路由,现在变为仅 SWA(滑动窗口注意力)——并推测这可能反映了早期层在训练上的反复困难 @teortaxesTex

  • 随后,同一账号指出该架构“只剩 40 层,其中真正算数的 decoder 层可以说只有 20 层”,凸显 DeepSeek 在 decode 关键路径上的有效深度压缩可能激进到什么程度 @teortaxesTex

  • TeortaxesTex 的另一条推文片段暗示 DeepSeek 在做多种压缩频率,“反正全是 CSA2”,这是他对内存压缩相关架构讨论的回应 @teortaxesTex

  • Nrehiew 的技术分析强调KV cache 压缩是整个设计的核心,称这是一个典型案例——“执着于 KV Cache 压缩,就能做出一个超高效的前沿模型” @nrehiew_

  • 在后续推文中,nrehiew 摘录了报告中的基础设施细节:减少长尾阻塞的 dispatch 策略基于先前 checkpoint 的 router replay、通过数据集级别封顶管理短补全的 off-policy 效应、丢弃方案有界的 off-policy 比例与 loss masking,以及更新新 checkpoint 时的KV 和 router 持久化;他还提到最后阶段采用了在 40 多个教师模型上进行全词表 OPD @nrehiew_

  • Nrehiew 总结称,这套设计看起来比 V4 里旧的 HSA + CSA 组合更干净,“明显是为推理而设计的”,并引用了一个惊人的数字:在该基准分数区间内 KV 大小约为 ~890 字节/token @nrehiew_

  • Stochastic Chasm 推测模型对 KV cache 做了 QAT(量化感知训练),这可以解释为什么它在 FP4 KV cache 下表现优于同类模型 @stochasticchasm

  • 基准测试结果与数据

    各家独立评测一致表明,V4.1-Flash 在性价比、长上下文和自动化方面异常强悍,但有个重大短板:输出太啰嗦。

    • Artificial Analysis 的头条数据:40 AA Index,高于 V4 Pro,低于 GLM-5.3-Flash @ArtificialAnlys,Scaling01 也独立证实了这一结果 @scaling01

    • Artificial Analysis 报告称 AutomationBench-AA 得分为 69%,与 GPT-6 Astra(69%) 持平,优于 Grok 4.6(67%);相比 V4 Flash 0731 提升 15 分,高出 V4 Pro 0813(57%)12 分,高出 GLM-5.3(62%)7 分 @ArtificialAnlys

    • 在 GDPval-AA v2 上,据报道其得分提升 164 Elo,从 1468 升至 1632,超越得分 1584 的 Kimi K3 @ArtificialAnlys

    • AA-LCR v1.1 基准测试中得分为 84%,与 GPT-5.6 SolGemini 3.8 Flash(均为 84%)持平 @ArtificialAnlys

    • Artificial Analysis 还指出,V4.1 Flash 是已测模型中输出最冗长的之一,平均每个 Intelligence Index 任务生成 89k tokens——比 GLM-5.3(71k)多 25%,比 GLM-5.3-Flash(69k)多 29%,比 V4 Pro 0813(55k)多 62%,甚至高于 Fable 5.1(78k)Claude Opus 5(73k) @ArtificialAnlys

    • 尽管输出较为冗长,AA 估算每个 Intelligence Index 任务成本仅为 $0.27,约为 GLM-5.3($2.01)Kimi K3($2.00)1/7,且比 V4 Pro 0813($0.67)约 2.5 倍 @ArtificialAnlys

    • Vals 的结果进一步巩固了其成本优势:$0.30/测试,在其榜单上位列开源权重模型第一名 @ValsAI

  • 另一个讨论串更激进地总结了 DeepSWE 风格的论断,声称 V4.1 Flash 在 DeepSWE 基准上表现优于 GPT-5.6 Sol 和 Opus 5,且 API 成本降低了 94%。不过,该陈述属于二手转述,而非本数据集中的原始基准测试帖子 @kimmonismus

  • 本地运行体验与推理工程界的反应

    大量讨论集中在令人惊讶的一点上:借助 Offload(内存溢出策略)和 SSD 流式加载技术,V4.1-Flash 能轻松在消费级本地硬件上运行。

    • Fraser Price 报道,仅用 64GB 系统内存,在 4 张 Max-Q 显卡上运行全精度 DeepSeek 4.1 Flash + DSpark,即可达到 200 TPS;该方案将 200GB 的 Engram/哈希表卸载至 NVMe SSD。他表示,这使得无需将完整结构常驻内存成为可能,并预告将分享一份 vLLM 配置方案 @fraserpricee

    • 随后他进一步将性能提升至 4 张 RTX Pro 显卡上 300+ TPS,依然保持 全精度 运行,且 系统内存峰值低于 32GB,使用的是 自定义 vLLM 分支 并支持 SSD 流式加载 @fraserpricee

    • Antirez 展示了 DwarfStar 在 128GB M5 Max 上运行 V4.1 Flash 的情况,并指出 SSD 流式加载带来了意想不到的速度提升。他推测,近期 SSD 流式加载机制的改进以及 DS4.1 可能“更频繁地复用同一组专家”这两点共同促成了这一效果 @antirez

    • TeortaxesTex 感叹道,“竟然能主要依靠 SSD 运行前沿模型,简直不可思议” @teortaxesTex

    • Elie Bakouch 发布了一张反应表情包,专门针对 推理工程师视角 下的 V4.1 Flash 架构,反映了此次发布在系统开发人员中引发的强烈共鸣 @eliebakouch

    • vLLM 的新版本还将 DeepSeek-V4 的 shared experts 融合进了 MegaMoE,同时 Mooncake Store 可以卸载 decode KV,这解释了为何开源基础设施部署这类模型正变得日益轻松 @vllm_project@vllm_project

    事实与观点

    事实及直接引用的说法

    • V4.1 Flash 发布后,Ollama 和 Baseten 迅速提供了支持 @ollama@baseten

    • 第三方基准测试报告显示 AA Index 40AutomationBench-AA 69%AA-LCR 84%GDPval-AA v2 1632 Elo1M 上下文MIT 许可证,且 API 定价低廉 @ArtificialAnlys

    • Vals 报告称该模型在其指数中位列开源权重模型第一,测试成本为 $0.30/test,在其测试框架设置下最大输出为 384 tokens @ValsAI@ValsAI

    • 本地部署报告称 4 GPU 配置下先达到 200 TPS,后又跑到 300+ TPS,还在 M5 Max 上通过 SSD 流式加载成功运行 @fraserpricee@fraserpricee@antirez

    解读与观点

    • Raschka 说“他们本该叫它 V5”,这是对架构改动幅度之大的一种评价 @rasbt

    • TeortaxesTex 猜测 DeepSeek“在训练首层时屡屡遇到困难”,这只是推断,并非 DeepSeek 官方确认的说法 @teortaxesTex

      • Nrehiew 的观点认为,这份报告比之前的 HSA/CSA 设计更简洁,且由于 OpenAI 和 Anthropic 拥有自研芯片,其做法可能与众不同。这属于个人见解,而非客观事实。@nrehiew_

      • “DeepSeek 发布的是内部研究产物而非产品”这一批评是外部观察者的判断,并非官方发布的说明。@teortaxesTex

      • “数据是关键”或“研究已结束”等断言本身也受到了批评,被认为反应过度。@shikibmehri

      不同观点与反应

      支持与赞叹

      • 基准测试人员和研究者给出了强烈正面反馈,重点强调了其在性价比上的飞跃:Vals 称其为“新的第一开源权重模型”,Artificial Analysis 突出了其成本调整后的表现,许多人也称赞其是一次“有趣且令人耳目一新的发布”。@ValsAI@ArtificialAnlys@dejavucoder

      • Raschka 评价其“超级酷且令人耳目一新”。@rasbt

      • XJDR 欣赏其工程思维,尽管在美学上持保留态度。@_xjdr

      • Nrehiew 称之为“又一份重磅技术报告”。@nrehiew_

      • Stochastic Chasm 总结道,虽然这篇论文内容“密集”,但很欣赏其多智能体训练视角和稀疏化设计思路。@stochasticchasm@stochasticchasm

      中立/分析性

      • 部分观察者主要对设计进行了剖析而非捧场,关注点包括稀疏/局部混合机制、首层异常结构、多模态分词、KV 量化以及共置异步强化学习等。 @stochasticchasm@stochasticchasm@nrehiew_

      • Gordic Aleksa 利用这篇论文作为证据,构建了一个更广泛的预训练数据分类法,将 DeepSeek 归入有机数据阵营,并惊讶地发现,根据其公开文献,他们似乎甚至没有使用合成的改写数据 @gordic_aleksa

      批判性/怀疑观点

      • TeortaxesTex 多次反驳外界的普遍印象,认为 DeepSeek 往往表现出较高的内部评估分数,但外部鲁棒性较弱、存在脆弱性且技能缺口怪异,因为其“交付的是内部研究产物而非产品” @teortaxesTex

      • 该账号称某些评估结果“非常怪异”,特别是AutomationBench 排名第一的现象以及 CritPt 的性能回退,并呼吁 DeepSeek 团队“深思这些问题” @teortaxesTex

      • 他们还指出,V4 GA 版本在很大程度上受益于工具/技能框架的接入,而 V4.1 似乎对框架脚手架的依赖更少,在“极简框架”下表现更佳 @teortaxesTex

      • 在实际使用体验中,他们报告称多智能体“DSH 智能体团队”可能会降低质量,除非项目具有非常清晰的模块化设计。在至少一个案例中,V4.1 单智能体模式的表现优于团队模式,因为子智能体产生了低质量内容或在不必要的研究上浪费了 Token @teortaxesTex@teortaxesTex

      • Jared Z 的更宏观的产品市场观点——用户如今非常在意 token 成本,日常使用的编码模型应该又便宜又聪明——虽非针对该模型,却恰好契合 V4.1 Flash 的定位 @imjaredz

      背景

      为什么这在技术和战略上都很重要

      • 此次发布正值行业更广泛转型的当口:从“更大的稠密对话模型”转向系统优化、稀疏、长上下文、面向 agent 的模型,这类模型才能真正实现低成本、本地化的部署。

      • V4.1 Flash 的定位异常激进:开放权重、MIT 许可、1M 上下文、多模态输入、低激活参数量、极端的缓存折扣,还验证了在依赖 SSD/offload 的消费级设备上也能跑起来 @ArtificialAnlys@fraserpricee@antirez

      • 跑分呈现出一个有意思的权衡:输出极其啰嗦,但由于 token 价格极低,总任务成本依然极低 @ArtificialAnlys

      • 其架构也反映了行业大势:把 prefill 和 decode 的经济性拆开优化,让长上下文和 agent 工作负载更可行,而不必为每个 token 都付出前沿稠密模型的成本。

      • 这次发布进一步印证:开源模型的竞争力不再只体现在权重可获取,还体现在可部署性上——能否融入 offload 流水线、量化 KV 方案、本地部署和开源推理服务器。

      • 它还激化了关于 2026 年模型进步关键所在的争论:是架构、RL 与推理的协同设计、数据质量,还是系统工程?Shikib Mehri 明确反驳了“DeepSeek 论文意味着研究已终结”的说法,认为发力的杠杆面反而从架构扩展到了数据工厂和奖励设计研究 @shikibmehri

      • 最后,DeepSeek 在业界形象上也颇具争议:人们赞赏其发布不拘一格的科研成果与详尽报告,但部分从业者认为它不够精致,产品体验不如以商业化见长的竞争对手,存在一些奇怪的评估盲区和行为不稳定。这些问题在真实工作流中比内部宣传数据暴露得更明显@teortaxesTex@teortaxesTex

      OpenAI 发力语音、智能体与企业市场

      • OpenAI 将 GPT-Live-1 推向 API,并迅速构建其生态系统:这款新模型被定位为全双工语音接口,支持边说边听,并能将工具调用或推理任务委派给后台模型。核心发布由@OpenAIDevs完成,详情显示,开发者可控制语调、节奏、表现力、回复长度及语言。OpenAI 自己的基准测试博客称 GPT-Live-1 相比 GPT-Realtime-2.1 有显著提升:搭配GPT-6 Astra在 Tau3 基准上的首次尝试任务完成率达 83.6%,在 Artificial Analysis Conversational Dynamics 上得分97.3%,Full Duplex Bench v1 的响应起始延迟为 0.798 秒详细数据在此。

      • 周边工具链正加速向托管式智能体基础设施演进:OpenAI 同步发布了公测版的 Agents API,并搭载 Codex harness,还推出了通过托管云智能体管理代码执行、文件与产物的 OpenAI 托管沙箱上线)。这顺应了将模型、运行时与沙箱统一整合至单一界面的行业趋势。LiveKitHeyGenTelnyxSpeak 以及 Cognition 的 Devin Voice 的集成公告表明,GPT-Live-1 有望比此前的实时技术栈更快成为生产级语音智能体的默认基座。

      • 企业数据访问正在成为核心产品原语:OpenAI 在产品层面宣布在 ChatGPT Work 中引入 数据智能体,承诺针对已连接的公司数据源提供仪表盘、回答及操作功能(@ChatGPT);与此同时,Box 将其集成定义为“AI 的文件系统”,旨在将受治理的企业上下文导入 ChatGPT。结合谷歌面向智能体的文档推广以及 Cursor 新增的持久化工作区,行业趋势正迈向有状态、组织感知的智能体环境,而非无状态的模型端点。

      Cognition、Cursor 与向持久化编码智能体的转变

      • Cognition 迎来了相当强势的一天:发布了 SWE-2,称其为“迄今最接近前沿的模型”,在主流编程评测上号称达到同等水平,成本最高降低 70%,并明确表示把 RL 扩展到了数万亿参数规模 发布ybenpan 补充指出,团队自研了算法、基础设施和数据silasalberti 则分享了一条实用的 RL 经验:简单的线性长度惩罚能在不同 effort 级别间保持训练时 Pareto 曲线的形状。

      • Devin 产品栈正变得更多媒体化、更深度融入开发者工作流:除了 SWE-2,Cognition 还推出了由 GPT-Live 和 SWE-2 驱动的 Devin Voice 推文,并宣布 Dioxus Labs 加入 Cognition,参与 Devin 的 VM、computer use 和测试开发,同时继续维护 Dioxus 及相关 Rust 开源项目 Cognition。这是编程 agent 厂商收购基础设施和系统人才(而不仅仅是模型研究员)的一个具体案例。

      • Cursor 新推出的 “Projects” 功能从 IDE 侧指向了同一个方向Cursor 引入了带协调 agent 的持久化线程、跨 agent 共享的内存/产物,以及在用户设备和 agent 机器之间的同步。实际效果上,这是从“一个任务一个聊天”转向长期存续的软件项目底座,让子 agent 随时间不断积累状态。结合 Claude Code 新推出的面板弹出托管 agent 会话查看器 / 自动模式来看,市场正在收敛到同一共识:编程 agent 需要的是持久化上下文、可检视的会话和明确的编排控制,而不只是更好的代码补全。

      Agent 研究:评测框架、边界、并行检索与自我进化

      • 多篇论文聚焦于同一主题:评测框架(harness)如今已成为核心优化对象。Salesforce 的一篇广受欢迎论文摘要(由 omarsar0 分享)指出,在更强专家模型的完整轨迹上训练较弱的模型,可能会因评测框架的进化导致性能下降 4–30 分,原因在于微调后的模型会形成不兼容的规划风格。提出的解决方案——仅重写较弱模型自身 rollout 中的失败轮次——保留了模型与评测框架的匹配度。与此同时,Sumanth_077 对字节跳动 HarnessDev 的介绍描述了能够构建并迭代改进自身可运行评测框架的智能体,其泛化能力表现不一:仅有 34/64 的变更在留出任务上实现了方向性迁移。

      • 长时程和长上下文智能体训练也获得了更严谨的方法论dair_ai 总结了 Qwen 关于 Elastic Horizon 的工作,这是一个闭环控制器,通过追踪成功轨迹长度的第 90 百分位数来调整最大交互时程,从而在提高成功率的同时最多节省 25% 的轨迹 token。另外,omarsar0 重点介绍了 PARSER,该方法通过并行冻结的子智能体加上一个经 RL 训练的主智能体,在多轮散射-收集迭代中替代了顺序分块读取;报告的提升包括在 896K 上下文下性能提升 12 分,以及延迟降低多达 11 倍

      • 技能与工具使用数据的生成也在走向形式化:dair_ai 在介绍 SkillAdam 时将技能自进化建模为离散优化问题,借鉴了 Adam 优化器的一阶/二阶动量思想,以稳定更新方向并控制编辑幅度。与此同时,Google Research 提出的 ToolGrad在提示词之前生成带有真值标签的工具调用链,并报告了在数据集创建环节接近100% 的通过率以及下游工具使用能力的提升。综合来看,这批工作表明该领域正从单纯“加强提示工程”转向对脚手架结构、轨迹预算、技能文档及工具调用轨迹的闭环优化

      安全、滥用、可监控性与模型治理

      • Anthropic 的威胁情报报告主导了安全领域的讨论:该公司发布了迄今最详尽的滥用报告,涵盖了利用 Claude 进行网络攻击、影响力行动、监控、生物威胁及武器研发的尝试,并声称已瓦解报告中描述的所有相关行动发布推文)。大量讨论聚焦于涉及竞争对手实验室和国家关联滥用的数据提取与路由模式,引发了包括 pradeepXkapoorlogangraham 以及前 Meta 威胁应对负责人 David Agranovich 在内的众多高互动回复。David 认为,尽管某些表述框架仍有待商榷,但 Anthropic 在此透明度上理应获得认可。

      • 另一条讨论主线是推理可监控性与“神经语言”(neuralese)风险Redwood Research 提出针对可能削弱或消除思维链可见性架构的透明度规范,Ryan Greenblatt 则认为,在部署大幅降低 CoT 依赖的架构之前,公司应先公布证据与政策。Neel Nanda 的相关评论指出,GPT-6 Astra 可能意味着 no-CoT 推理 的一次令人担忧的跃升,暗示其架构变革超出了常规 scale 的范畴。

      • 前沿实验室的在职员工与离职员工之间,在风险文化上也出现了明显分歧Chris Hayduk 强调 AI 的人道主义正面价值,而 balesnijkcarlsmith 则公开支持灭绝风险大于 10% 的观点。治理方面,Thom Wolf 宣布在 Hugging Face 成立新的 Open Alignment 团队,Richard Ngo 则发表了一篇尖锐的批评文章,矛头指向 Paul 加入 OpenAI 董事会一事,以及他所认为的安全社区被 AGI 公司收编的现状。

      互动量最高的推文

      • Anthropic 威胁情报报告@AnthropicAI 详细披露了 Claude 在网络攻击、舆论影响、生物、监控及武器等领域遭到的复杂滥用情况。

      • OpenAI 因 Astra 算力紧张暂停新的 $200 Pro 订阅@thsottiaux 表示现有用户不受影响,API 及其他套餐仍可正常购买。

      • GPT-Live-1 API 上线@OpenAIDevs 将新的全双工语音模型开放到了 API 中。

      • ChatGPT 企业数据智能体@ChatGPT 发布了一款支持数据连接的企业级智能体,专注于仪表盘、问答和操作执行。

      • SWE-2 发布@cognition 推出新的编程模型,称其在成本大幅降低的同时,达到了接近前沿水平的大模型评测表现。

      • Cursor Projects@cursor_ai 推出了持久化的项目线程,支持协调智能体、共享记忆和产物同步。


      AI Reddit 综述

      /r/LocalLlama + /r/localLLM 综述

      1. DeepSeek V4.1 Flash 发布与架构

      • DeepSeek V4.1 Flash:更强、更快、更易获取(活跃度:317):DeepSeek 发布了 V4.1 Flash,这是一款552B参数的 MoE 模型,原生支持多模态视觉,并采用了新的 Causal-Encoder-Decoder 非对称架构:8B参数用于输入端,16B参数用于输出端。官方宣称其能力超越 V4 Pro,但推理成本更低(来源模型权重技术报告)。DeepSeek 声称相比上一代,HBM 占用降低,SSD 占用降低;相比初代模型,HBM 占用降低437×。API 用户可切换至deepseek-flash,而即将弃用的deepseek-v4-flashdeepseek-v4-flash-vision-exp以及未来的deepseek-v4-pro将路由至 V4.1 Flash,并采用新的峰谷定价策略。 技术讨论主要集中在前沿 LLM 中罕见回归的编码器-解码器式架构上,评论者质疑该编码器在长提示词和多模态分割中的作用。另有观点指出,尽管稀疏激活,但 552B 总参数量使得本地推理即便在多 DGX Spark/Strix 风格的配置下也不切实际,因此基于 V4/Qwen 的小型编码模型在本地 Agentic 工作流中仍更具现实性。

        • 多位评论者关注其宣称的编码器-解码器/非对称架构,质疑 DeepSeek 如何在现代 GPT 风格 LLM 中应用编码器:例如,提示词是在解码器自注意力之前进行嵌入还是压缩,以及这种设计如何扩展至按句、段或模态切分的长输入。一种解读认为,该非对称设计可能意味着其生成路径在结构上区别于标准的纯解码器 Transformer。

        • 大家还围绕该模型传闻的 552B 参数规模讨论了本地推理的可行性,评论者认为即便用多台 DGX Spark/Strix 级别的高端本地设备也不现实。比较务实的做法是:用更大的 DeepSeek V4 级模型做规划,再用更小的或蒸馏后的模型(如 Q38-27BQ38-35B-DistillOrnith35B)在本地 agentic 编码流水线中执行。

        • 帖子里一个技术上很亮眼的说法是自第一代以来 KV-cache 缩减了 437×,评论者认为这对长上下文推理的成本和内存扩展意义重大。如果属实,这种量级的削减将显著改善长上下文服务的吞吐量和部署经济性,尤其相比传统的 decoder-only 注意力缓存方案。

      • DeepSeek V4.1 Flash 是 748B 参数,而非 552B(热度:575):楼主检查了 Hugging Face 上的 safetensors 文件,认为 DeepSeek V4.1 Flash 的总参数量约为 748.5B(主干+engram),而非此前传闻的 284B305B485B522B。其中主干网络为 551.566B,engram 模块为 196.929B;若计入可选的 DSpark/MTP(14.225B)和视觉编码器(0.485B),完整模型的存储参数规模约为 763.21B,文件大小约 511.76 GB。这种差异被归结为统计或元数据错误:例如,NVIDIA 论坛 的估算低估了主干参数量;Hugging Face 标注的 485B 可能是将 FP4 打包权重误按字节而非“每字节两个参数”计算所致,这与 GLM-5.3-Flash-NVFP4 的情况类似;而 vLLM 的使用指南 早期列出 522B 后又在后续版本中修正了参数细节。主干网络绝大部分由 MoE FFN 专家组成:543.582B 参数采用 FP4 量化,仅约 7.984B 参数分布在注意力、共享嵌入层及其他组件中。这意味着 128–256 GB 的内存/显存对于在本地完整运行该模型是不充足的。 有评论者指出,“Flash” 这一命名可能与其低延迟特性有关,声称其在预填充阶段仅激活约 9B 参数。另一个技术问题讨论了针对 engram/ngram 风格查找表的 SSD 卸载策略,应优先考虑顺序吞吐量还是随机 4K 读取 IOPS,但提供的评论中未包含实质性的答案。

        • 评论者还讨论道,DeepSeek V4.1 Flash 报告的总大小可能显得更大,是因为其中包含了 n-gram/查找表类组件。但有人认为,这些组件不应像常规激活的神经网络参数那样计算,因为它们可以存储在外部 SSD 上,而无需作为模型权重加载到 VRAM/RAM 中。

      • 有技术观点指出,“Flash” 变体之所以快,是因为其在 prefill 阶段仅使用约 9B 参数。这意味着实际计算路径远小于标称的 748B 规模,这也可能是其主打低延迟品牌策略的原因。

      • 针对本地部署,一位用户估算 256GB 系统内存加上 64–96GB 显内存即可满足需求,而 n-gram 数据可存储在任意 PCIe Gen 3 及以上标准的 NVMe SSD 上。讨论还涉及 SSD 性能应优先考虑顺序吞吐量还是 4K 随机读取,因为基于磁盘的查找表可能对访问模式敏感。

    • DeepSeek 已悄悄退役 DeepSeek V4 Pro(热度:1598):配图是一张推文截图,指出 DeepSeek 正在实质性地“软退役” DeepSeek V4 Pro:V4 Pro 的流量将被自动路由至 DS V4.1 Flash,并按更便宜的 Flash 定价计费,直到 V4.1 Pro 发布。其理由在于,V4.1 Flash 在性能、成本、速度和总使用时长上均优于旧的 V4 Pro,暗示尽管 V4 Pro 规模更大,但更小且更廉价的 Flash 变体已取代其成为首选的生产级模型。评论者推测 V4 Pro 的 GA 版本可能遭受了 reward hacking 和糟糕的 scaling 问题,有人指出它“尽管规模几乎是 Flash 模型的 6 倍,但表现并没有实质性更好。” 此外,人们还在争论 DeepSeek 和 Google 是否因独立的训练轮次、架构差异或数据混合问题而出现了类似的小模型胜过大模型的现象;另一位评论者抱怨 Flash 在创意写作方面较弱,并认为这反映了行业向代码优化模型转变的大趋势。

      • 多位评论者认为 DeepSeek V4 Pro GA 的表现配不上其规模,其中一人声称其存在“高程度的 reward hacking”,尽管规模约为 Flash 模型的 ,但表现并无实质性提升。技术层面的担忧在于,Pro 更大的参数/计算足迹未能转化为基准测试或真实场景中的能力增益,如果推理成本高昂,那么将其退役是合理的。

      • 有推文对比了 DeepSeekGoogle 的案例:较小的 “Flash” 版本反而能追平甚至超越大模型,这暗示它们可能不是简单从一次大训练蒸馏而来。评论者猜测差距可能来自不同的架构选择、训练流程差异或数据配比,而非单纯参数规模,并由此引出一个问题:为什么小模型在某些任务上泛化更好。

      • 一些用户区分了 API 下线与模型消失:据说 DeepSeek 停止服务 V4 Pro,但权重仍然可以获取,这与 OpenAI/Anthropic 完全闭源式的下线不同。另一种技术猜测是,DeepSeek 可能在释放推理算力,或逐步转向国产推理芯片,优先保障更便宜的 Flash 级别服务——即使 Pro 保留了更多对规划/通用任务有用的世界知识。

    • DeepSeek-V4.1-Flash surprised ....(活跃度:537):配图image)虽是表情包,但指向一个技术观点:DeepSeek-V4.1-Flash 把全局 KV cache 压缩到每 token 仅 890 bytes,远低于之前版本;DeepSeek-V4.1-Flash-Base 据展示是一个 552B 参数的骨干网络,激活参数只有 8B/16B。帖子据此推断,未来的中型模型可以结合 MoE 或稠密骨干、10–15B 规模的 “Engram” 组件,以及 Flash 式的 KV cache 优化,来提升长上下文的记忆效率。评论者猜测,极小的 KV cache 设计会让 M5 Ultra 512GB 这类大内存本地推理硬件或多机 Spark 方案更有吸引力,Qwen 等其他模型家族可能也会采用类似的 KV 压缩。还有评论者纠正了对 Engram 规模的直觉:它大约占参数总量的 1/3–1/2,例如 30B 的稠密骨干应搭配约 10–15B 的 Engram。

      • 评论区关注点集中在内存压力与硬件可行性。网友指出,优异的“AA 得分”可能会让高内存本地推理方案(如 M5 Ultra 512GB 及多 Spark 配置)更具吸引力。有用户质疑,当使用多个子智能体时,即使 512GB 的统一内存是否也足以让 DeepSeek-V4.1-Flash“从容”运行;这暗示在模型权重之外,KV cache 和并发开销可能占据主导。

      • 一个技术帖深入探讨了架构参数分配:Engrams(长期记忆模块)估计占总参数的 1/31/2。这意味着若采用 30B 稠密骨干网络,将额外增加 10B–15B 的 Engrams 组件,总参数量约为 40B–45B。另一位评论者预测 Qwen 将采用“Tiny KV”设计,该设计通过直接降低上下文内存需求,从而减少对 KV cache 量化辩论的依赖。

    原始来源: Latent Space

    评论 (0)