小模型时代已经到来
过去几周,我一直在试用 gpt-5.6-luna。它的能力、速度和智能程度都惊人。我经常看到它达到约 100 tps,在我的代码库、邮箱和知识库之间快速穿梭。
当然,luna 最大的优势还是成本。我试着让它处理一些相当复杂的研究任务,却很难真正累积出高额账单。即使让它检索数千封邮件,API 成本最终也只有几十美分。
有了 GLM 5.3,我们甚至在 Pareto 前沿上多了一个新选择。
做编程工作时,我几乎总是优先使用最昂贵、能力最强的模型(Fable 5、5.6 Sol)。所以,小型快速模型取得的进展很容易被我忽略。
我和几位投资人聊过,他们提到了一件事:“奇怪,为什么我们还没看到更多面向消费者的 AI 公司?”
答案其实很简单:token 成本。
在 AI 出现之前,大型消费互联网应用通常遵循这样的路径:
- 做一个有吸引力、运营成本相对低的网站
- 吸引大量用户(通常借助一定的病毒式传播)
- 融资,扩大用户规模
- 搭建广告市场
大多数大型消费互联网公司(Google、Facebook、Snapchat 等)大致都走过这条路。1
但如果你想在产品中加入 AI 呢?那每次请求都会产生实实在在的推理成本!所需资金规模也会突然大幅上升。
我个人很喜欢做的一项评测,是搭建一个专属于我的每日新闻网站:
在互联网上搜索 @calvinfo,判断他们可能感兴趣的新闻;搭建一个微型网站,展示今天的头条,并为他们进行个性化定制;搜索 HN、Reddit、Twitter 等平台。
如果使用上一代模型(Sonnet 级别),要让它完成这些工作,大概要花 1 美元。对于面向消费者的应用来说,每月收费 30 美元根本不可持续。这里显然还有很多优化空间,但如果你的收费标准和 WSJ 或《经济学人》一样,那就必须提供相近的价值。
不过,看看 luna 的表现,结果相当不错,平均成本约为 0.10 美元。这就有意思了!
我觉得,更有意思的其实是它在商业领域的应用。
最近,我和 Segment 的联合创始人 Peter 徒步时交流了彼此的观察。在他创办的几家公司里,Peter 发现工作大致分为两类:
- “IQ 180”型工作:由天才般的疯狂科学家想出你从未考虑过的奇妙方案。
- “token 喷射器”型工作:响应极其迅速,在几十条战线上不断推进事情。
Peter 同时经营着多家公司。除了 Segment,他还为 Charm Industrial 融资超过 1 亿美元,最近又完成了 Revoy 的 A 轮融资。他安排事务非常井井有条,时间利用效率也极高。
但 Peter 提到,他所做的工作大约 95% 都属于第二类:参加电话会议、跟进他人、处理各种具体事务。
需要说明的是,Peter 也表示,如果没有具备 IQ 180、能够解决深层次问题的技术人才,他的公司今天早就举步维艰了。只是他自己的大部分工作都属于第二类。2
我认为,对“前沿级”模型的需求还会持续增长,尤其是在需要原创突破或探索发现的领域(工程、硬科学、模型训练)。
但与此同时,我也认为,对“快速、便宜、够用”模型的需求即将迎来爆发。
想想你每天打交道的人:同事、供应商和客户。十次里有九次,你希望对方响应迅速,能替你把事情妥善处理好。如今企业里的大多数“人类 token”都花在这类工作上——招聘需求也明显偏向快速、便宜、够用的这一类人。
要让快速、便宜、够用的模型真正适用于商业场景,还有很多工作要做,包括开发新的 harness、确保 prompt injection 安全,以及设计角色和权限体系。不过,我相信这些问题最终都能解决。
如果你也在尝试让小模型变得实用,欢迎联系我。
图片来自