← 文章 / AI技术
Hacker News 6小时前 · 2026-08-28 16:21:30 · 5 阅读

小模型时代已经到来

过去几周,我一直在试用 gpt-5.6-luna。它的能力、速度和智能程度都惊人。我经常看到它达到约 100 tps,在我的代码库、邮箱和知识库之间快速穿梭。

当然,luna 最大的优势还是成本。我试着让它处理一些相当复杂的研究任务,却很难真正累积出高额账单。即使让它检索数千封邮件,API 成本最终也只有几十美分。

图片来自 artificialanalysis.ai

有了 GLM 5.3,我们甚至在 Pareto 前沿上多了一个新选择。

做编程工作时,我几乎总是优先使用最昂贵、能力最强的模型(Fable 5、5.6 Sol)。所以,小型快速模型取得的进展很容易被我忽略。


我和几位投资人聊过,他们提到了一件事:“奇怪,为什么我们还没看到更多面向消费者的 AI 公司?”

答案其实很简单:token 成本。

在 AI 出现之前,大型消费互联网应用通常遵循这样的路径:

  • 做一个有吸引力、运营成本相对低的网站
  • 吸引大量用户(通常借助一定的病毒式传播)
  • 融资,扩大用户规模
  • 搭建广告市场

大多数大型消费互联网公司(Google、Facebook、Snapchat 等)大致都走过这条路。1

但如果你想在产品中加入 AI 呢?那每次请求都会产生实实在在的推理成本!所需资金规模也会突然大幅上升。

我个人很喜欢做的一项评测,是搭建一个专属于我的每日新闻网站:

在互联网上搜索 @calvinfo,判断他们可能感兴趣的新闻;搭建一个微型网站,展示今天的头条,并为他们进行个性化定制;搜索 HN、Reddit、Twitter 等平台。

如果使用上一代模型(Sonnet 级别),要让它完成这些工作,大概要花 1 美元。对于面向消费者的应用来说,每月收费 30 美元根本不可持续。这里显然还有很多优化空间,但如果你的收费标准和 WSJ 或《经济学人》一样,那就必须提供相近的价值。

不过,看看 luna 的表现,结果相当不错,平均成本约为 0.10 美元。这就有意思了!


我觉得,更有意思的其实是它在商业领域的应用。

最近,我和 Segment 的联合创始人 Peter 徒步时交流了彼此的观察。在他创办的几家公司里,Peter 发现工作大致分为两类:

  1. “IQ 180”型工作:由天才般的疯狂科学家想出你从未考虑过的奇妙方案。
  2. “token 喷射器”型工作:响应极其迅速,在几十条战线上不断推进事情。

Peter 同时经营着多家公司。除了 Segment,他还为 Charm Industrial 融资超过 1 亿美元,最近又完成了 Revoy 的 A 轮融资。他安排事务非常井井有条,时间利用效率也极高。

但 Peter 提到,他所做的工作大约 95% 都属于第二类:参加电话会议、跟进他人、处理各种具体事务。

需要说明的是,Peter 也表示,如果没有具备 IQ 180、能够解决深层次问题的技术人才,他的公司今天早就举步维艰了。只是他自己的大部分工作都属于第二类。2

我认为,对“前沿级”模型的需求还会持续增长,尤其是在需要原创突破或探索发现的领域(工程、硬科学、模型训练)。

但与此同时,我也认为,对“快速、便宜、够用”模型的需求即将迎来爆发。

想想你每天打交道的人:同事、供应商和客户。十次里有九次,你希望对方响应迅速,能替你把事情妥善处理好。如今企业里的大多数“人类 token”都花在这类工作上——招聘需求也明显偏向快速、便宜、够用的这一类人。

要让快速、便宜、够用的模型真正适用于商业场景,还有很多工作要做,包括开发新的 harness、确保 prompt injection 安全,以及设计角色和权限体系。不过,我相信这些问题最终都能解决。

如果你也在尝试让小模型变得实用,欢迎联系我。

脚注

  1. Amazon 和 Netflix 是其中为数不多的例外

  2. Peter 这里其实还挺谦虚的。他非常聪明。

原始来源: Hacker News

评论 (0)