AI技术人指南 3小时前 · 2026-10-06 03:47:19 · 10 阅读
彭博称中美AI差距缩至3%:国产大模型的技术追赶与规模优势
朋友,今天这条新闻可能会改变你对"中美AI差距到底有多大"的认知。彭博行业研究(Bloomberg Intelligence)10月5日发布了一份报告,结论很直接:中国顶尖AI大模型与美国竞争对手的性能差距,已经缩小到只有3%。3%是什么概念?去年年初这个数字还是15%,今年5月份是9%,现在直接干到了3%。一年多时间,差距缩了五分之四。更有意思的是另一组数据:OpenRouter最新的全球大模型调用量显示,上周(9月28日到10月4日),中国大模型周调用量达到57.46万亿Token,美国是16.2万亿——中国是美国的3.5倍,而且已经连续23周领跑全球。一边是技术差距快速逼近,一边是应用规模遥遥领先。今天咱们就来聊聊这件事:这3%的差距到底意味着什么?国产大模型是怎么追上来的?调用量第一又能说明什么问题?以及,那个突然冒出来、直接冲上榜首的匿名模型"太空兔",到底是什么来头?一、3%差距:从"望尘莫及"到"望其项背"
先说说彭博这份报告的核心数据。报告的高级分析师罗伯特·利亚(Robert Lea)的判断依据主要是LiveBench基准测试。这个排行榜类似于AI界的"智商测试",通过模型对各种问题、谜题和任务的回答与分析来打分,相对客观一些。目前排名最高的是Anthropic的模型,得分83.4分。而DeepSeek V4.1 Flash的得分是81.1分,排在全球第六,也是排名最高的中国模型。简单算一下,差距确实是2.3分,也就是大约2.8%,四舍五入3%。这个进步速度确实惊人:- 2025年初:差距大约15%
- 2026年5月:差距缩小到约9%
- 2026年10月:差距约3%
第一,3%是顶尖模型之间的差距,不是整体差距。
彭博报告里也提到了,LiveBench前15个模型里只有3个来自中国。也就是说,第一梯队已经追上来了,但中坚力量的差距可能还比较大。这就像奥运会金牌榜,头部选手很强,但整体厚度还需要时间积累。第二,基准测试不等于真实体验。
这个咱们聊过很多次了。跑分高不代表用起来就好,尤其是在复杂的长任务、多轮Agent协作、工具调用的稳定性上,体验差距可能比跑分差距更大。OpenAI和Anthropic在真实生产环境的鲁棒性、边界处理、长上下文一致性方面,依然有不少护城河。第三,变现能力是另一个维度的差距。
彭博分析师自己也说了:"无论模型在排行榜上的排名如何,变现都可能很困难。"OpenAI年经常性收入已经接近700亿美元,而国产大模型的商业化还在早期阶段。技术追上了,商业能不能跟上,这是另一场考试。但不管怎么说,3%这个数字本身已经很说明问题了。三年前谁能想到国产模型能跟Claude、GPT掰手腕?现在不仅能掰,而且差距已经小到可以用"个位数百分比"来衡量。二、调用量碾压:57.46万亿 vs 16.2万亿
如果说性能差距的缩小还有点"纸面数据"的味道,那调用量的数据就更接地气了。上周全球AI大模型总调用量是166万亿Token,环比增长13.69%。其中:- 中国大模型:57.46万亿Token/周
- 美国大模型:16.2万亿Token/周
- Space Bunny Alpha(太空兔)— 38.7万亿Token/周,环比暴增179%
- DeepSeek V4.1 Flash— 25.6万亿Token/周,环比增31%
- 智谱GLM 5.3 Flash— 9.73万亿Token/周,环比下滑40%
- 小米MiMo-V2.6-Flash— 9.63万亿Token/周,环比增75%
- 腾讯Hy4 preview— 6.51万亿Token/周,环比下滑32%
第一,"Flash战争"已经全面打响。
你看名字就知道了:DeepSeek V4.1Flash、GLM 5.3Flash、小米MiMo-V2.6-Flash……各家都在推Flash版本,核心就是"快+便宜"。这背后的逻辑很清晰:当模型能力达到一定门槛后,用户更在意的是响应速度和使用成本。谁能把高频、低价值的通用任务用更低成本承接住,谁就能拿到最大的流量基本盘。谷歌在六周内连续三次更新Flash系列,也说明这不是中国市场的独特现象,而是全球趋势。区别只在于,中国厂商在Flash赛道上跑得特别猛。第二,中国市场的应用规模优势正在形成。
57.46万亿对16.2万亿,这个差距比性能差距大得多。为什么?我觉得有几个原因:一是中国互联网用户基数大,消费端和企业端的AI需求都很旺盛;二是国产模型的定价策略更激进,很多API调用成本只有海外模型的几分之一,刺激了用量增长;三是国内应用场景丰富,从内容创作到客服到教育到代码,各种场景都在快速AI化。调用量的领先不是小事。用得越多,数据越多,模型迭代越快,这就是数据飞轮效应。当然,前提是调用质量要高——如果大部分都是无意义的闲聊,那飞轮转得再快也没用。但从目前的趋势看,生产级调用的比例在快速上升。第三,前五名的波动很大,说明格局还远未定。
你看,智谱GLM 5.3 Flash环比下滑40%,腾讯Hy4 preview下滑32%,而小米MiMo反而增长75%,太空兔直接暴涨179%。这说明什么?用户的忠诚度还很低,哪里好用、哪里便宜就去哪里。现在的领先不代表永远领先,谁下个月出个更强的Flash版本,排名可能立马就变了。这对用户来说是好事——竞争越激烈,我们得到的产品就越好、越便宜。三、神秘的"太空兔":匿名模型时代来了?
这周最大的悬念,是那个突然冒出来就直接拿了第一的"Space Bunny Alpha",中文名叫"太空兔"。38.7万亿Token的周调用量,比第二名DeepSeek V4.1 Flash还多出一半,环比增长179%——这个增长曲线简直是垂直起飞。这个模型有几个特点:- 9月23日才在OpenRouter上线
- 主打快速推理和编程
- 100万Token上下文窗口
- 支持文本、图像和视频输入
- 提供可调节的推理强度与工具调用能力
第一,降低品牌预期压力。
如果直接用MiniMax的名义发布一个"旗舰新品",大家的预期会拉得很高,会拿它去跟GPT-6、Claude Opus比。如果比不过,口碑就崩了。用匿名模型的方式,可以先在真实市场环境里测一测,看看用户反馈和实际表现,不行就悄悄迭代,行了再官宣。第二,快速验证市场需求。
匿名发布可以最快速度拿到真实用户数据——调用量、留存率、付费转化率,这些都是最真实的市场反馈。比起在内部做各种评测,直接扔到市场里跑一圈,数据最有说服力。第三,营销悬念感。
"神秘模型登顶榜首"本身就是最好的话题。你看,咱们现在不就在讨论它吗?等热度发酵得差不多了,官方再来个"原来是我们"的揭晓,传播效果可能比直接发新品好得多。不管太空兔到底是谁家的,"匿名模型"这种玩法可能会成为行业新常态。以后我们可能会看到更多"不知道是谁做的但就是很好用"的模型在市场上跑,这也挺有意思的——消费者用脚投票,模型靠实力说话,而不是靠品牌光环。四、国产AI为什么追得这么快?
从15%到3%,这个速度确实有点超出很多人的预期。国产模型是怎么追上来的?我梳理了几个核心因素。第一,研发投入和人才密度上来了。
过去两年,中国AI领域的人才回流速度非常快。很多在海外顶尖实验室工作过的研究员选择回国创业或者加入国内大厂,DeepSeek、智谱、月之暗面这些公司的核心团队都有很强的学术背景。人才是AI行业最核心的生产要素,人到位了,进步速度自然就上去了。第二,开源生态的助力。
这个不能不提。Llama、Mistral等海外开源模型的蓬勃发展,客观上降低了整个行业的技术门槛。国产模型站在开源社区的肩膀上,结合自己的技术路线做优化和创新,追赶速度自然更快。当然,走到最顶尖的位置,还是得靠自己的东西——这也是为什么3%之后的最后一公里反而最难。第三,针对国产硬件的优化能力。
彭博报告里特别提到了一点:中国模型技术的崛起,得益于"研究人员针对国产硬件优化模型的能力"。这个很关键。因为芯片管制的原因,国产模型不能像海外同行那样随便堆最先进的GPU。反而倒逼出了更强的硬件适配和优化能力——昇腾、海光、壁仞……各种架构都能跑,而且跑得还不错。这种"逆境中练出来的本事",长期来看反而是一种竞争力。第四,应用场景丰富,数据反哺模型。
中国的互联网应用生态非常丰富,从电商到社交到短视频到企业服务,各种场景都在快速AI化。海量的真实应用数据反过来喂给模型,形成正向循环。调用量全球第一不是白来的,这些调用数据本身就是最宝贵的训练资源。五、冷静看差距:还远远没到"赶超"的时候
说完成绩,咱们也得泼泼冷水。3%的差距很鼓舞人心,但如果因此就觉得"中美AI已经平起平坐",那是自欺欺人。我觉得至少有几个层面的差距还是客观存在的。第一,前沿模型的天花板差距。
3%是顶尖国产模型对标美国顶尖模型的跑分差距,但在"真正难的问题"上——比如复杂的科学推理、长周期Agent任务、极端情况下的鲁棒性——差距可能不止3%。基准测试能衡量的东西有限,真实世界的复杂度要高得多。第二,基础设施和芯片差距。
这个是老生常谈了,但确实是根本差距。最先进的制程、最顶级的GPU、最成熟的EDA工具……这些目前还是卡脖子的地方。模型层面的追赶相对快一些,但底层硬件的追赶需要更长时间的积累。不过好消息是,这个方向也在不断突破。比如壁仞科技的BR20X据说性能已经超越英伟达H200,华为昇腾的生态也越来越完善。虽然高端芯片还有差距,但中低端以及特定场景的替代正在加速。第三,商业生态和变现能力差距。
OpenAI一年700亿美元的ARR(年度经常性收入),这个数字是很恐怖的。国产大模型的商业化还在摸索阶段,大部分收入还是来自政府和大企业的定制项目,通用API的付费占比还比较低。技术追上来只是第一步,能不能建立可持续的商业模式,是更大的考验。第四,基础研究和原创能力差距。
Transformer是Google发明的,扩散模型是UC Berkeley的,RLHF是OpenAI推的……AI领域最底层的范式创新,目前还是主要来自海外。国产模型更多是在工程实现和应用优化层面做得很好,但底层原创的突破还比较少。当然,这个差距也在缩小。比如DeepSeek在MoE架构、长上下文、推理效率等方面已经有不少自己的创新了。只是从"跟跑"到"并跑"再到"领跑",每一步都需要时间。六、几个值得思考的问题
最后,我想抛出几个问题,咱们一起琢磨琢磨。问题一:3%的差距之后,下一个里程碑是什么?
当性能差距小到一定程度,"谁更强"可能就不再是用户最关心的问题了。就像手机芯片,当旗舰芯片都足够好用之后,用户更在意的是续航、拍照、系统体验这些东西。AI会不会也走到这一步——当模型能力都跨过了某个门槛,竞争的焦点会转向生态、工具链、场景整合、价格服务?我觉得很有可能。到那时,调用量的优势、应用场景的深度、开发者生态的完善程度,可能会比基准测试的那几分差距更重要。问题二:美国的出口管制还有没有用?
彭博报告里有句话很有意思:"这些进展也让人们开始质疑美国限制技术出口的做法是否有效。"确实,如果芯片管制的目的是让中国AI落后几年,但实际情况是差距在快速缩小,那是不是说明管制的效果不达预期?或者说,管制反而激发了国产替代的动力,倒逼出了更强的自主创新能力?这个问题没有简单答案。但有一点是清楚的:技术封锁在短期内会造成阵痛,但长期来看,往往会逼出被封锁方的自主能力。历史上这样的例子太多了。问题三:调用量全球第一,会不会是"虚胖"?
57.46万亿Token的调用量确实很惊人,但这里面有多少是高质量的生产级调用,有多少是闲聊、测试、甚至刷量?如果大部分调用都是低价值的,那规模优势可能没那么大意义。但如果生产级调用的比例在持续提升,那就真的很可怕了——因为这意味着数据飞轮在加速转动,越用越好,越好越用,形成正循环。从目前的趋势看,企业级应用、开发者调用、Agent工作流这些高质量场景的增长速度很快,所以我倾向于认为这个调用量是有"含金量"的。尾声
3%这个数字,确实值得高兴。但更值得我们关注的,是数字背后的趋势:国产AI正在从"跟跑"走向"并跑",而且这个速度比大多数人预想的都要快。不过话说回来,AI这个赛道的特点就是变化太快。今天的3%,下个月可能变成5%,也可能变成1%。可能某个实验室的一个突破,就把差距重新拉开了。也可能某个国产团队的一个创新,就实现了反超。作为观察者和使用者,我们能做的就是保持关注,保持理性,既不妄自菲薄,也不盲目乐观。毕竟,AI这场马拉松才刚刚开始。你怎么看中美的AI差距?你觉得国产模型什么时候能真正实现反超?欢迎在评论区聊聊你的看法。原始来源: AI技术人指南