← 文章 / AI技术
Tom's Hardware 1小时前 · 2026-09-21 23:56:07 · 3 阅读

TypeSafe AI 发布 System One 模型 Jev,号称比 LLM 快 193 倍、成本低 445 倍

在 AI 领域,新模型层出不穷,偶尔也会出现一些真正新颖的事物。上周,TypeSafe AI 的首款 “System One” 模型 Jev 正式发布。与传统的 LLM 不同,Jev 不用于对话,而是专为编程场景下的命题评估与决策制定而设计。

Jev 由前 OpenAI 工程师 Diogo Almeida 创立,他曾参与编写 ChatGPT 的核心训练技术。根据 TypeSafe 的测算,Jev 比 GPT-6 Astra 等前沿 AI 模型快几个数量级,据称速度提升高达 194 倍,成本降低 445 倍。因此,该公司称 Jev 的“每美元智能”数值“高得离谱”,不过最终效果仍需实际使用来检验。

TypeSafe 认为,这主要归功于两点。首先,System One 模型采用“校准决策强化学习”(Reinforcement Learning for Calibrated Decisions,RLCD)进行训练,旨在生成结构化答案,而非长篇散文。其次,由于不需要上下文关联,同一请求中的各个问题可以并行处理,这与 LLM 的连续文本生成方式形成鲜明对比。

TypeSafe Jev 速度

TypeSafe Jev 的速度与成本。(图片来源:TypeSafe AI)

向普通 LLM 提问时,得到的是开放式文本对话;而 Jev 仅针对具体问题进行回答,每个答案都附带置信度。Jev 专为代码和机器使用而设计。代码通过 API 与 Jev 交互:提供一个“状态”(即给定情境及其相关数据),要求 Jev 评估特定命题。每个独立请求都会提供该状态,系统没有全局知识库或保留记忆。

举个例子:公司可以把客户的信用卡交易记录、一些基本的账户信息、客户最近写的内容喂给 Jev,然后问一句“这个客户是在申请退款吗?”Jev 会回答是或否,并附上置信度。如果置信度超过某个阈值,比如 85%,就可以继续让客户选择退款方式,选项为“退款”、“商店积分”或“不明确”,Jev 会为每个选项给出概率分布。接下来你的代码就可以尝试处理退款,或者进一步向客户确认。

Jev question/reply

向 Jev 提问。(图片来源:TypeSafe AI)

Jev 的输出(以及可选的输入)都是预定义的数据格式,本质上就是纯 JSON。与 LLM 交互不同,这里没有多余的废话、冗长的思考过程,也不用特意要求模型简洁输出。同样,也不需要全局上下文提示或保存记忆——这些通常是为了让 LLM 表现得尽量“确定”而不得不做的折腾。至于输入解析、日期处理、数据库读取等操作,仍然由你自己的代码负责,Jev 一概不管。

乍一看,这似乎只是一个更简洁的 LLM 接口,但两者有本质区别。Jev 并不需要——甚至不想要——问题之前的完整上下文:提供无关信息反而会降低准确率,而且它的上下文窗口也只有区区 64,000 tokens。由于它每次都会给出置信度百分比,所以不会像常见聊天机器人那样凭空编造陈述和数据,也就是不会产生那种典型的“幻觉”。

Jev question/reply

Jev 的回答。(图片来源:TypeSafe AI)

根据置信度做出决策是开发者的责任,而不是 Jev 的。Jev 仍可能错误分类信息、遭受对抗攻击,或者只按字面意思而非真实意图作答。

Jev(以及未来的 System One 模型)最常见的用例预计会是:在提交问题后,围绕逻辑工作流进行封装。由于始终可获得置信度指标,将其集成到决策步骤中变得非常便捷。例如,“如果我们比较确定用户要求退款,且他们偏好商店额度,同时发现他们通常在 9 月左右购买更多 PC 硬件,那么也可以向他们提供一个 RTX 5090 的 8 折优惠。”文档中还提供了其他使用示例,如意图路由引用核查

Jev 的优势并不在于像 Agent 那样行动或推理广泛的复杂问题——TypeSafe 明确指出,开放式任务更适合由 LLM 处理,甚至可以将 LLM 整合到同时调用 Jev 的代码中。一个例子是监控系统:Jev 可以利用提供的信息评估是否存在严重的系统问题,如果有,再引入 LLM 来检查日志、查找原因并生成报告。同样,Jev 未在客户数据上进行训练,也不会从提供的状态及其自身训练数据以外的任何地方进行推断。

我并非 AI 工程师,但作为一个普通开发者的看法是:如果 Jev 能如其承诺般合理工作,它或许能解决深度集成 AI 入软件时的一个主要障碍——即处理聊天机器人 LLM 的问题。实际上,这些 LLM 就像令人恼人的无定形团块,行为不可预测,可能产生也可能不产生期望的输出(更别提正确的输出了),而且速度慢、成本高昂。拥有一个简单的评估/响应/置信度接口,无需特定训练或精心编织的文本咒语,就能轻松、干净地集成到代码中,这感觉自然得多,也更容易使用。

原始来源: Tom's Hardware

评论 (0)