← 文章 / AI技术
囧哥的token看台 6小时前 · 2026-09-13 17:26:33 · 4 阅读

AI大模型为什么这么贵?算力、内存、上下文,一篇讲透AI的成本账

同一个九月,两件事往相反的方向走。

9 月 10 日,DeepSeek 发布新模型 V4.1-Flash。技术报告里,比参数量更扎眼的是一组存储数字:模型每"记住"一个字,只占 890 字节——是它第一代模型的 1/437

同一天,OpenAI 公布了自己的存储平台:每周服务超过 10 亿用户,管着 500PB 数据,每秒要顶住 7000 万次请求。

一边把"记忆"压到极致,一边把"记录"堆到极致。

看着像两件不相干的事。其实它们打的是同一场仗——AI 最贵的地方,从来不是它想得多快,是它记得多少。

算错了地方

过去几年,我们习惯用参数理解大模型。70 亿、700 亿、上万亿,数字越大越厉害,像在比谁脑袋大。

这个比方从根上就偏了。参数更像一座图书馆的藏书量:书多当然好,可决定你多快能查到东西的,是书架怎么摆、一次能同时翻几本,还有一件更要命的——**它能同时接待几个读者。**

DeepSeek 这次的新模型,主干 5520 亿参数。听着是天文数字,可技术报告开篇就说透了:这一整套设计,是围绕一个瓶颈做的。

卡住它的地方在记忆,不在运算。

模型其实什么都不记得

这里要先破一个大多数人都会搞错的点。

你可能以为,AI 跟你的对话是"攒"起来的——聊得越久,它记得越多,像一个越来越熟的朋友。

完全不是。

大模型本身不存任何东西。它每回答你一次,都要把你前面说过的所有话,从头到尾重新读一遍、重新算一遍。你聊到第三十句,它就得把前二十九句全部重算;聊到第五十句,前四十九句全部重算。

那干脆别存,每次都重算,行不行?不行。它读进去的每一个字,背后都是几百亿次运算。你聊到第五十句,前面四十九句里的每一个字都要再走一遍——这笔账,谁也付不起。

这也是为什么你有时候会感觉它"忘了"——不是它记性差,是它每次都在从头开始。

既然每次都要重算,那有没有可能偷点懒?有。**把算过的中间结果留下来,下次直接用。**

这就是它真正在做的事。

每读进去一个字,它就在心里记一笔:这个字长什么样、在句子里干什么活、和前面哪些字有关系。后面需要"回头看"的时候,直接翻这一笔,不用重新算一遍。

这笔账,业内叫 KV cache。你可以把它理解成一沓便签。

名字里带 cache(缓存),意思很直白:**它是临时的。** 一段对话结束,这沓便签就作废,下次重新贴。也正是因为临时,它必须老老实实待在内存里——内存一满,就什么都干不了了。

那这沓便签有多厚?

便签的数量,和它读进去的字数成正比。让它读 100 万字,它就要留 100 万张。更要命的是——每一路同时进行的对话,都得各留一份。十个人同时用,就是十沓;一万人同时用,就是一万沓。

到这里,成本的结构就清楚了:

算力决定它想一次要多快

内存决定它能不能同时想很多件事

而过去几年,整个行业的力气几乎都压在第一条上。

为什么 AI 一"干活",内存就爆

早几年的 AI 是问一句答一句。你说三行,它回三行,便签不多,几百张就够了。

现在的 AI 开始"干活"了。读一份几十页的合同,翻一整个代码仓库,连着跑几十轮搜索和计算,每一步的结果都得记住——因为下一步可能就要用到上一步。它读的东西越来越长,便签越贴越多,而且中间还不能撕。

这就是为什么今年所有大模型公司都在死磕同一个词:**上下文窗口。**

这个词你大概听过,但很少有人讲清楚它到底意味着什么。说白了一句话:**上下文窗口,就是 AI 一次能"拿在手里"的信息量。**

窗口小的时候,它只能看到你刚说的这几句。你让它读一份长合同,它读了后面就忘了前面,读到第三页已经想不起第一页写了什么。窗口大,它才能把一整份材料摊开来一起看。

所以窗口从几千字,一路涨到几万字,再到上百万字。这背后没有花活,纯粹是它一次能干的事,真的变多了。

可窗口开大,便签就跟着膨胀。

我们把这个账算具体一点:每记住一个字占 890 字节,读进去 100 万字,光便签就要 890MB 左右。一台机器上能同时跑几路对话,直接由它决定。**便签省一半,同一台机器就能多接一倍的人。**

过去一年 AI 的价格战,打的其实就是这个。

890 字节:这笔账是怎么砍下来的

DeepSeek 这次做的事,拆开是三个动作。

第一个动作:让"答题"的那一半,不再单独记账。

他们把 40 层网络切成前后两半:前 20 层负责读题,后 20 层负责答题。过去各记各的账,现在答题那一半不自己记了,直接从前半部分借。

省下的很实在:读题阶段的算力,几乎砍掉一半。

第二个动作:把笔记写小一号。

便签上的内容本身,被压进了更低精度的格式。记的东西没变,占的地方小了一半。

第三个动作:别翻整本书,只看最近 128 页。

模型每次"回头看"时,不再从头翻到尾,改成主要看最近 128 个字,更早的内容用一个更省的方式间接取到。

三个动作叠起来,落到一个数字上:**每记住一个字,只占 890 字节。**

前面说过,读 100 万字需要 890MB。换回第一代的记法,这个数字会逼近 400GB——同一个活儿,过去要将近 400GB 的地方才装得下,现在 890MB 就够。

这条路具体走了多远,看三组对比:

•第一代到 V3.2,缩小 8.1 倍

•V3.2 到 V4-Flash,再缩小 13.7 倍

•V4-Flash 到这次,又缩小 3.9 倍

乘起来,大约 437 倍

还有一个更反直觉的数字:上下文从 4000 字扩到 100 万字——**涨了 250 倍**——而单个字解码时的算力,只多花了 四分之一

放在几年前,这是不可想象的事。以前想开那么大的窗口,光内存就先把预算烧光了。

这对普通人意味着什么

你可能会想,这些跟我有什么关系。

关系很直接。**便签便宜了,AI 就能记住更多、装下更多,而且更便宜。**

它可以一次读完一整本书、一整个代码库,中间不用你分段喂。它能同时接待更多人,单价就能往下走——发布当天,国内就有平台跟进上线,还有的直接开了两周免费试用。那些原本"算不过来所以做不了"的事,也开始变得做得了:前阵子有团队让 AI 智能体去攻一个 260 位的密码学难题,刷新了公开纪录;也有产品能让一个"主管"AI 带着几千个"下属"AI 一起干活。这些事的前提,都是先把长上下文的成本压下来。

但这里得泼一盆冷水。

省下来的是单位成本,不是总账单

每个字的开销便宜了 437 倍,可你的用量可能涨了不止 437 倍。OpenAI 那个存储平台就是明证:每秒 7000 万次请求、500PB 数据。单位成本一路往下走的同时,总投入一路创下新高。就在这周,英伟达被曝要以基石投资者身份投 Anthropic 至多 100 亿美元,后者估值要冲 2 万亿。

每一项让 AI 变便宜的技术,最后都变成了让 AI 用得更多的理由。

从电到带宽,技术普及都是这么走过来的。这笔账的走向,大概率也不会例外。

收束

我们习惯用"聪明"形容 AI,用"算力"解释它的贵。

但真正决定它能不能再往前迈一步的,是它记住一件事要占多大的地方。

890 字节。这个数字不响亮,可它决定了下一代 AI 能装下多大的世界。



原始来源: 囧哥的token看台

评论 (0)