← 文章 / AI技术
The Decoder 1小时前 · 2026-09-10 21:47:30 · 4 阅读

DeepSeek 新模型 V4.1-Flash 大幅降低 AI Agent 内存需求

Image description

要点

  • Deepseek 发布了新一代 AI 模型 V4.1-Flash,通过大幅缩减处理长文本所需的缓冲区,显著降低了运营成本。
  • 该模型还将数据输入的算力需求减半,通过技术上的拆分,让读取信息阶段调用的算力少于后续生成文本阶段。
  • 在编程任务上,这款免费模型的表现与 OpenAI 和 Anthropic 的顶级闭源模型相当,但在复杂科学任务和图像分析方面仍显不足。

Deepseek 这款新多模态模型的核心目标是降低长上下文的运营成本,收益主要体现在内存使用上,同时官方也承诺模型性能有所提升。

根据技术报告,Deepseek 对 V4.1-Flash 有一个明确目标:缩小所谓的 KV cache。这个缓冲区保存模型已处理的上下文部分,避免每走一步都重新计算所有内容。对于需要多步执行的 agent 来说,它会迅速膨胀,给 GPU 内存、SSD 和数据带宽带来压力,从而推高部署成本。

该语言模型核心拥有 5520 亿参数,可处理最长 100 万 token 的上下文。官方表示,高速 GPU 内存中的缓冲区现在只需前代 Deepseek-V4-Flash 所需空间的约四分之一;永久卸载到 SSD 或主机内存的部分则缩减至约八分之一。与 Deepseek-V1 相比,每 token 的全局 KV cache 尺寸缩小了 437 倍。

Globaler KV-Cache pro Token bei verschiedenen Deepseek-Modellen
自 V1 以来,Deepseek 大幅缩减了全局 KV cache。 | 图片:Deepseek

减少输入侧算力开销

Deepseek 通过多种技术协同实现了这一目标。其中核心一项是把模型拆成两半:前半部分处理输入数据,后半部分直接复用前半部分的结果,而不用重新计算。读取输入时,模型每个 token 只激活 80 亿参数,而在实际生成文本时激活 160 亿。

Deepseek V4.1 Flash 采用 Causal Encoder 和 Decoder 的架构
V4.1-Flash 将语言主干拆分为 encoder 和 decoder。| 图片来源:Deepseek

Deepseek 表示,这种做法几乎将处理输入所需的算力减半,目标直指 AI agent——这类应用需要频繁调用工具、不断处理新输入。此外,Deepseek 还把主要 KV cache 从 FP8 改为 FP4 存储,据报告,这部分缓存的内存占用也因此几乎减半。

该模型从零开始训练,数据集包含 45 万亿 token,覆盖文本和图像。在后训练阶段,Deepseek 刻意没有采用新方法。公司表示,主要收益并非来自新算法,而是来自更大规模、更好控制的数据、任务和训练环境。Deepseek 认为,就目前而言,这种规模的扩展比算法上的小修小补更有帮助。

Deepseek V4.1 Flash 在代码 agent 基准测试上随强化学习训练增加的性能表现
随着 RL 训练的推进,多个代码 agent 基准测试的成绩不断提升。| 图片来源:Deepseek

但 Deepseek 也发现,训练出的 agent 有时会试图钻奖励系统的空子,有时还会不小心弄崩测试环境,甚至利用新披露的安全漏洞,或删除关键系统文件。

在编程基准测试上与 Opus 5 和 GPT-5.6 Sol 打平

尽管激活参数占比相对较小,Deepseek 称该模型在多项基准测试中已接近头部水平。在 Agent 基准测试中,它有时能与顶尖闭源模型持平。在软件测试 DeepSWE v1.1 上,它以 74.2% 的得分险胜 Anthropic Opus 5OpenAI GPT-5.6 Sol 等模型,但在 ProgramBench 上则明显落后。

在需要专业知识的高难度科学 Agent 任务上,它与超大模型之间仍有明显差距。技术报告也承认,在解读复杂图像方面,与领先的闭源系统之间尚有可量化的差距。

与其他推理模型类似,该模型的"思考深度"可以调节。用户通过一个参数值控制模型的工作深度,在算力开销与准确率之间取舍。报告显示,最高档位能显著提升多项基准测试的表现,但输出 token 量约为原来的 2.5 倍。

不同推理深度下 Deepseek V4.1 Flash 的准确率与输出长度
更高的推理深度能提升效果,但会增加 token 消耗。 | 图片来源:Deepseek

Deepseek 已在 Hugging Face 上以开源 MIT 协议发布模型文件,定位为更廉价的 AI Agent 开发的起点。该模型也提供 API 接入,价格与 V4-Flash 相同。

Deepseek 直到7月底才通过0731版本大幅提升了前代V4-Flash。该模型拥有2840亿参数,其中130亿处于激活状态,在 Artificial Analysis Intelligence Index 上仅落后 OpenAI 的 GPT-5.6 Luna 一分,单任务成本却低了约60%。8月中旬,Deepseek 结束了旗舰模型 V4-Pro 的测试期,同时上调了 API 价格——缓存命中(即已缓冲的输入)费用直接翻了六倍。据台湾安全公司 TeamT5 称,自中国黑客组织开始利用 Deepseek 编写漏洞利用代码、执行网络扫描等操作以来,其攻击量已翻倍不止。

今年6月,Deepseek 以超过500亿美元的估值完成了首轮外部融资,募资约74亿美元;据路透社报道,该公司现已聘请中信证券筹备在中国 IPO。

原始来源: The Decoder

评论 (0)