← 文章 / AI技术
Simon Willison 6小时前 · 2026-09-22 07:55:52 · 2 阅读

Jev 推出新型 LLM 形态:System One,即决策模型

Jev 推出新型 LLM 形态:System One,即决策模型

2026年9月21日

上周,TypeSafe AI 发布了 Jev,这是他们首个属于新模型类别的示例,他们称之为“System One 模型”(我认同 Maggie Appleton 的观点,认为“决策模型”是更好的名称)。Jev 是对传统 LLM 形式的一种有趣变体:它仍然接受文本输入,但不再输出文本,而是返回对应类别、是否判断、评分及置信度的浮点数。

TypeSafe 对 Jev 的描述如下:

可以将 Jev 视为一种前沿智能函数调用:输入非结构化状态,输出类型化的概率决策。

Jev 速度极快,而且非常便宜。常规 LLM 按输入和输出 Token 计费,且输出费率通常显著更高。Jev 只收取输入费用,输出免费——其首个模型的输入价格为每百万 Token 0.042 美元——甚至比 OpenAI 的 GPT-5 Nano(每百万 0.05 美元)还要便宜。

Jev 允许用户对文本或半结构化数据提出问题。你构造一个包含字符串、字符串数组或名称-值对集合的“状态”对象——这可能描述一篇文章、一位客户或任何其他类型的记录。然后,你将该对象连同一个问题或多个问题发送给他们的 API,并获取每个问题的回复。

你可以提出三类问题:

  • 是否问题,Jev 称之为“Noul”问题——其 CEO 在 Hacker News 上确认,这是取自伯努利分布(Bernoulli distribution)的缩写。你陈述一个命题,模型返回一个 0 到 1 之间的浮点数,表示该命题为真的置信度。
  • 选择问题,模型从给定选项集合中挑选一项——实际上返回的是一个置信度分数以及所有选项上的概率分布。
  • 评分问答:你提供带有描述的分层级数值序列,模型会在该范围内给出一个具体的浮点分数。

Jev API 可以接收单个文档(即“状态”),并容纳尽可能多的问题。这些问题并行处理,因此发送大量问题所耗时间与发送单个问题大致相当。

我认为决策模型这一框架有助于理解 Jev 的适用场景。它非常适合任何可表述为分类任务的场景——例如垃圾邮件检测、标签建议、优先级排序和排名等。

我也在探索将其用于搜索重排序:先使用 BM25 这类低成本算法获取 100 个潜在匹配项,然后让 Jev 根据原始查询对这 100 个候选项的相关性进行评分。

黑箱卷土重来

让我对 Jev 感到有些不安的是,它进一步将系统推向了黑箱机器学习的深处。

LLM 本身已是黑箱——你可以要求它解释决策依据,但无法保证这些解释既有用又准确。

而 Jev 连这点都做不到:无论输入多少文本,你拿到的唯一输出就是一个浮点数。如果 Jev 将某内容标记为垃圾邮件,究竟是哪些内容特征触发了这一判断?无从知晓。

这也意味着,偏见问题必须置于核心考量。我真心希望没人会用 Jev 来给求职者排名——那个浮点数可能掩盖了模型内部各种看不见的偏见,且通过实验去拆解这些偏见将是一项棘手的任务。

(我做过一个实验,让 Jev 对旧金山湾区的每个城市就“是否是个好城市”这一问题给出是/否评分——结果库比蒂诺(Cupertino)得分最高,东帕罗奥多(East Palo Alto)得分最低。有意思。)

实际上,这意味着评估和结构化实验的重要性远超常规 LLM 项目。幸运的是,Jev 成本极低,即使运行数百甚至数千条实验性提示,费用也仅为几美分。

Jev 的非传统用途

这几天看着更广泛的社区为 Jev 想出各种潜在用例,实在很有意思。以下是一些让我眼前一亮的创意项目:

  • Kyle Pena 的 jevchat 把 Jev 变成了一个(很糟糕的)聊天模型。它的做法是每一步都问 Jev 一个问题:「给定用户的问题和已写出的回复,下一个符号是什么?」Hacker News 上的 ericpruitt 评论说:「这简直就是 Morty 用死亡水晶说话的数字版」。
  • Fatih Kadir Akın 的 jev-leftpadleft-pad 的思路实现了一个补空格工具,提示词是「value 前面需要多少个空格才能达到 targetLength?」,并通过 一次选项查询 从「需要 0 个空格」到「需要 10 个空格」之间做出选择。
  • Andy Gayton 的 jev-2048 用 Jev 来玩 2048 滑块游戏

开源权重复刻版

还有一大批项目在尝试基于开源权重模型打造类似 Jev 的模型。Kev 是一个有趣的例子,它用 Qwen 3.5 生成了 0.8B、4B 和 9B 三个规格的模型。这是对应的 Hacker News 讨论帖,里面有人贴出了一个已经冒出来的 JevBench 基准测试,专门用来比较「Jev 级别的决策模型」。

考虑到 Jev 发布还不到一周,围绕它的活跃程度实在令人惊叹。

原始来源: Simon Willison

评论 (0)