← 文章 / AI技术
树枝报告 6小时前 · 2026-09-07 20:43:20 · 2 阅读

AI大模型调研:小模型正在“干翻”大模型?

架构创新已死?不,是“不创新”成了最好的创新。小模型靠全注意力+海量数据疯狂追赶SOTA,国内厂商卡在Online RL的Infra鸿沟上,而B端应用的未来,几乎注定属于微软谷歌的生态护城河。

一、一个反直觉的开场:不搞架构创新的模型,反而赢了

想象一下这个场景:

在某个顶级AI实验室里,一群工程师面对着一个艰难的选择——要不要给自家模型上最新的稀疏注意力、KDA压缩、滑动窗口?

Gemini Flash团队的选择是:都不用。

一位参与谷歌内部测试的专家透露了一个让人意外的事实:

"采用最经典的 Transformer 架构,不进行任何稀疏注意力改造,似乎是效果最好的方法。"

Gemini Flash大约每三周半迭代一次,每次都能在AI benchmark上提升好几分——没有任何架构创新,纯粹靠学习优化器来优化整个模型的损失收敛过程。

更扎心的是,专家强调:"当前阶段,进行架构创新反而可能带来负面影响。"

为什么?因为大模型必须做妥协。训练更大的模型,就必须用各种压缩技术——Kimi用的KDA、业界常用的滑动窗口注意力——但这些技术都会丢信息

Gemini Flash呢?60多层,全部使用全注意力(full attention),不丢失任何信息。专家算了一笔账:

"Gemini Flash的60多层全注意力层,其信息处理能力相当于一个300层、其中20%为全注意力层的大模型。"

这就是小模型的“暴力美学”——不做权衡,用最直接的方法,配上海量数据硬训。

二、最讽刺的一幕:潜力最大的模型,团队只有20人

谷歌Gemini Flash的投入有多少人?

20多人。

Gemini 4的团队规模是Gemini Pro的四倍,Gemini Pro又是Flash团队的三倍。也就是说,大模型团队是小模型团队的十几倍

但小模型的潜力还没见顶。专家指出,Gemini Flash目前的训练数据量已远超其参数量的200倍,性能饱和的迹象尚未出现。最新测试的3.9版本checkpoint显示,这类小模型仍有很大发展空间。

这不是孤例。看一组参数数据:

  • 当前主流模型参数量:4T-6T(如OpenAI的4.6、4.8版本)
  • 即将发布的新一代大模型:普遍10T左右(如xAIGrok
  • 谷歌Flash:仅200B,最新的5.3版本也才300B-400B

一边是万亿级军备竞赛,一边是几百B的轻骑兵快速包抄。市场可能尚未充分意识到小模型正在快速追赶这一趋势。

三、C端用户“永远要最好的”,B端用户“够用就行”

这里有一个非常精彩的用户行为观察。

C端用户:固定月费也无所谓,反正要用就用最强的模型处理所有任务。

B端用户:精打细算。专家透露,很多客户认为Gemini 1.5 Pro就够用了,并不追求最新的3.1 Pro版本——“这与传统IT系统的采购逻辑相似,即‘够用即可’。”

更扎心的是边际效应递减:

"从GPT-4.6升级到4.8,员工能明显感知到差异;但从4.8升级到GPT-4o,除了从事AR/VR、3D、机器人和部分程序员外,公司90%的程序员感觉不到二者在质量上的显著区别。"

专家甚至说了一句略带黑色幽默的话:

"目前在测试新的Gemini 1.5 Flashcheckpoint时,最大的挑战已不是跑分,而是找到能够有效识别新旧版本细微差异的内部员工。"

当模型好到没人分得出好坏,竞争的战场就必须转移了。

四、国产模型的“体检报告”:各有各的病

谷歌内部同时部署了GLMKIMIDeepSeek做基准测试和AB Testing。这份“体检报告”值得细读。

DeepSeek:文本强者,Vision瘸腿

DeepSeek在纯文本和长上下文方面表现出色,其长上下文采用变长处理(而非Kimi式的定长窗口压缩)。短板也很明显。

"DeepSeek系列模型普遍存在一个显著短板,即多模态的Vision输入能力相对较弱。处理UI设计、3D内容或解析包含图文批注的文档时,Vision能力依然是必要的。"

Kimi:长上下文是致命伤

Kimi在谷歌内部每日运行数万个trajectory进行AB测试,多模态能力尚可,但——

"Kimi在超过128k上下文长度后,其性能衰减的幅度远高于其他模型。"

原因有二:一是KDA技术用固定长度向量表示所有长度的上下文,上下文越长,信息丢失越严重;二是1:4或1:5比例的稀疏注意力,仅有部分层用Full Attention,造成第二层信息损失。

而企业内部场景动辄超过128k(Gemini的prefill lens约250k-300k),这直接限制了Kimi在大型企业中的应用

GLM:均衡没有短板,但缺“半个产品”

智谱GLM是“各方面表现均衡、没有明显短板的模型”,非常适合企业级部署。但它面临所有开源模型的共同困境:

"企业需要的是一个完整的产品解决方案,而不仅仅是模型能力。GLM模型本身不自带知识库,且其内置知识库对欧美地区的产品和人物了解相对有限。"

想进欧美企业?得先和Fireworks AITogether AI这类知识库部署服务商合作。

五、真正的瓶颈:Online RL背后的Infra鸿沟

假设数据问题解决了,国产模型冲SOTA还缺什么?

专家给出了一个清晰的答案:Online RL(在线强化学习)

道理很直白——Offline RL只能让模型模仿“老师”模型,让自身概率分布趋近目标模型;Online RL才能让模型实现持续的自我提升

而Online RL对AI Infra的要求极高。专家讲了一个残酷的时间对比:

数千张卡(约10到30个pod,每个pod 64张卡)的环境,领先机构训练一至两万个step,一个周末即可完成。而国内顶尖公司动用全部资源做同样的训练,却需要一个多月的时间

一个月 vs 一个周末。这就是能否在性能上再上一个台阶的关键差距

六、最深的护城河:藏在谷歌文档里的“隐藏索引”

为什么Claude调用量在GCP监控数据里“非常低”?答案藏在一份普通的谷歌文档里。

每一份谷歌文档创建时,都会自动生成一个隐藏索引——包含各类摘要、切片和完整的文档结构信息。Gemini Flash编辑这份文档时,直接调用全局索引,快、准、省token。

Claude呢?

“必须先将整个文档下载到本地,解析其结构,确定插入位置和格式,完成修改后再将整个文档上传。这个过程消耗的token量至少高出一个数量级,且耗时更长。”

“一旦涉及编辑复杂文档,例如在表格中修改数据或插入图表,由于无法访问文档内部的切片和隐藏索引,它基本上无法完成这类任务。”

微软谷歌的数据生态是为人设计的,不是AI原生的——但这恰恰成了AI时代最深的护城河。只要企业的主要数据仍留存在这两大生态中,第三方模型就很难正面攻入。

更现实的路径是什么?专家指出:作为模型能力提供商,通过微软的Copilot Team或GeminiEnterprise平台接入,调用巨头提供的工具——而不是独立开发直接访问文档的产品。

七、应用侧的“钱都流向了哪里”?

最后说说落地。2026年至今,AI应用没有涌现全新领域,而是在传统领域里token消耗持续暴涨。三大主战场:

  1. 企业级研究(Auto Researcher)——对话式、增强版的企业内部搜索
  2. 审核领域——保单审核、视频及社交媒体内容审核,日益成熟
  3. 客服领域——很多“转接人工”背后其实是难以分辨的AI机器人

但真正的token吞噬怪兽是——代码领域。专家给出的数据是:代码领域的token消耗量是上述三个领域总和的十倍以上

至于Agent的未来,两个方向值得关注:一是让Agent的循环机制能解决开放性问题(比如“如何提升产品日活”);二是协作轨迹技术——程序员编码只占工作时间的10%左右,剩下的会议、沟通、文档、头脑风暴如何被Agent全链路赋能?Meta正在做相关数据收集,CloudSlack集成的功能也在探索这一方向。

这次调研最强烈的感受是三个“反差”:

  • 不创新架构的小模型,跑得最快
  • 潜力最大的方向,团队人最少
  • 最深的壁垒,不在模型,而在数据和工具生态

国产模型在长上下文、多模态、Online RL的Infra上各有短板,但小模型的崛起或许正是弯道超车的机会窗口。

AI行业的下半场,比的可能不是谁的模型更大,而是——谁能真正住进你的工作流里

以下为调研提纲,一起学习更多干货,请查看下方图片。

Q:在模型架构方面,中短期内是否存在新的技术倾向?当前是否会延续现有架构,以及哪些核心论文可能产生较大影响?

Q:既然小参数模型如 Gemini Flash 表现出巨大潜力,谷歌对其投入和期望是怎样的?

Q:是否有针对 DeepSeek 模型的具体评测?

Q:如何评价 KIMI 模型,尤其是在长上下文处理方面的表现及其背后的技术原因?

Q:随着 KIMI 等国内模型厂商计划将模型参数提升至 3T 级别,应如何看待国内模型在 SOTA 领域的后续冲击力,以及当前存在的主要瓶颈?

Q:实现 Online RL 需要具备哪些核心能力,以及目前国内厂商在这方面与领先水平的主要差距体现在哪里?

Q:在当前模型架构未出现重大创新的背景下,小模型正快速追赶 SOTA 模型,这是否预示着未来的行业竞争将更多地围绕中小参数模型的能力表现展开?

Q:如何评价智谱 GLM 模型的综合能力及其未来的市场竞争力?

Q:从 2026 年至今,AI 应用的发展方向呈现出哪些变化?未来哪些领域的 AI 应用更具发展潜力?

Q:目前在应用端,主流模型的参数规模是怎样的?未来参数量是会继续提升还是可能下降?

Q:在未来的 AI 应用中,是否会以数百亿参数级别的 Flash 模型为主,而万亿级参数的超大模型在实际应用中则面临挑战?

Q:目前 AI Agent 或类似技术的发展状态如何?未来是否会迎来新一轮的爆发式增长?

Q:在企业应用场景中,AI 模型的技术范式似乎没有新的创新,是否可以通过丰富工具集来解决相应的问题,并构筑壁垒?

Q:鉴于微软和谷歌在工具与数据生态方面的深厚护城河,是否意味着未来 B 端企业级应用的发展将主要围绕这两家公司展开?

免责声明:本文内容基于公开报告/纪要整理,仅为信息分享。文中观点基于报告/纪要翻译与总结,或有不正确之处,请以原文为准。所有内容包括评级随时会有调整,不构成任何具体的建议。
原始来源: 树枝报告

评论 (0)