← 文章 / AI技术
智码识途 4小时前 · 2026-10-07 22:16:45 · 10 阅读

差距只剩 3%?国产大模型比起美国AI究竟差在哪?

全文约 1,700 字 · 阅读约 4 分钟

国庆这几天刷手机,你可能也看到过这么一个数字:3%。

说的是中美 AI 的差距。彭博行业研究的分析师 Robert Lea 出了份报告,说中美最强的 AI 模型现在只差 3% 了,是有史以来最近的一次。

我翻了一下前面的数:年初还差 15%,5 月差 9%,这才几个月,又砍掉了一大半。

年初 15% → 5 月 9% → 现在 3%

—— 彭博行业研究 · 中美最强模型差距

看到这儿,估计不少人心里会冒出一句:国产大模型这是要追上了?

先别急。这个 3% 到底怎么算的,我们一点点拆开看。

01

3% 是怎么算出来的

彭博参考的是一个叫 LiveBench 的榜单。你可以把它理解成大模型的“统考”,问答、推理题、动手干活的题都有,各家模型都来考一遍,按总分排名。

这次中国考得最好的,是 DeepSeek 9 月 10 日刚发的 V4.1 Flash,81.1 分,全球第 6。美国最高分是 Anthropic 家的 Claude Fable 5.1,83.4 分。

LiveBench 总分 · 得分

DeepSeek V4.1 Flash

81.1

Claude Fable 5.1

83.4

DeepSeek 为中国最高分,全球第 6

81.1 和 83.4,差了 2.3 分,折算下来就是 3% 左右。

打个比方,一个考 83 分,一个考 81 分,放在班里基本算同一档的学生了。

02

分数差不多,价钱差太多

光看分数,你用起来大概很难分辨谁强谁弱。可一看价格,差距就出来了。

按输出 100 万个 token 来算(token 可以简单理解成 AI 处理文字的计数单位),V4.1 Flash 闲时 4 块钱,高峰期 8 块。Claude Fable 5.1 呢?50 美元,换成人民币三百多块。

输出 · 每百万 token · 价格

DeepSeek V4.1 Flash

¥4 – ¥8

Claude Fable 5.1

$50 ≈ ¥300+

V4.1 Flash 闲时 ¥4,高峰期 ¥8

同样的活,一边花一杯奶茶钱,一边花一顿火锅钱,差了 40 多倍。

还有个细节程序员朋友可能会更在意。榜单里有一项叫“智能体编程”,考的是 AI 能不能自己把一个开发任务从头做到尾:写代码,跑起来,看报错,再改,全程不用人管。据 LiveBench 的数据,这一项 DeepSeek 拿了 77.3 分,Claude 是 66.1 分,国产这回反过来领先了。

LiveBench · 智能体编程 · 得分

DeepSeek

77.3

Claude

66.1

换句话说,有些写代码、跑自动化的活,换成国产模型,钱省了一大截,效果也未必打折。

03

那到底还差在哪?

话说回来,分数只差 3%,不代表真的就“差不多了”。我觉得至少还有四个地方,不能光看这个数。

01  尖子生少。3% 比的是两边各自最强的那一个。LiveBench 前 15 名里,中国模型只有 3 个,剩下的基本都是美国的。能跟美国顶尖模型掰手腕的,国内目前就那么几家。

02  换张卷子,分差就变了。今年 5 月,美国国家标准与技术研究院(NIST)旗下的一个机构也测过一次,结论是 DeepSeek 落后美国大概 8 个月。不过那次也挺有争议,9 套题里有 2 套没公开,差距最大的偏偏就是这两套。斯坦福今年的 AI 指数报告用公开榜单算,差距又只有 2.7%。卷子不一样,结论能差出老远。

03  会考试不等于会干活。榜单题目再多,跟真实的工作场景还是两码事。DeepSeek 在智能体编程上的高分,目前也还没有独立的第三方复测过。好不好用,最后还得自己上手试。

04  也是我觉得最要命的:钱还没赚到。Robert Lea 的判断是,中国 AI 行业可能要到 2030 年才能赚钱。为啥?国内有 1100 多个大模型在抢市场,价格一个比一个低,大家主要靠卖 token 挣钱,利润薄得很。DeepSeek 和腾讯的聊天机器人到现在还免费,变现做得最好的是字节的豆包。模型再强,一直不赚钱,后面研发的钱从哪来,这是个大问题。

04

最后说两句

对我们普通用户和开发者来说,最实在的好处就是:又好用又便宜的选择越来越多了。

接下来还有好戏。DeepSeek V4.1 Pro 已经在灰度测试,阿里的 Qwen4 也说快了。美国那边新模型也是一个接一个地出。这 3% 是继续缩小,还是又被拉开,过几个月我们再回来看看。

●●●

你现在写代码、干活,主力用的是国产模型还是国外的?

评论区聊聊。

●●●

智码识途 · AI 资讯

探索 AI 编码的无限可能性

内容整理自彭博行业研究、LiveBench 及公开报道

2026.10.06

原始来源: 智码识途

评论 (0)