← 文章 / AI技术
TechCrunch 4小时前 · 2026-09-19 03:20:14 · 2 阅读

ChatGPT 发明者推出新型 AI 模型 Jev:不输出语言只输出概率,开发者抢疯了

ChatGPT 伤了 Diogo Almeida 的心。 Almeida 曾是 OpenAI 的研究员,参与打造了这款聊天机器人,还参与发明了基于人类反馈的强化学习(RLHF)——这项模型训练技术可以说是当前 AI 时代最重要的推手。但即便 ChatGPT 能力出众,他依然感到失望。 “我们手里握着闪电,却派不上用场,”Almeida 告诉 TechCrunch。“从那以后我一直在和这个问题较劲。过了好一阵子我才想明白:问题在于我们优化的是人类语言……四年来我们对人类语言的掌握已经炉火纯青,但它对自动化没用,因为计算机说的是另一种语言。” 两年前,Almeida 离开 OpenAI,创办了 TypeSafe AI,一家致力于解决这个问题的创业公司。本周,公司发布了一款基于 Transformer 的新模型 Jev,它并非大语言模型(LLM),输出的不是文本,而是概率——也就是公司所说的“校准决策”。 抛弃语言带来了几个好处:模型极其便宜、速度快;由于用户预先定义了输出结果,它不会产生幻觉;它的输出 token 免费,输入 token 按“十亿”而非“百万”计费。
截图展示 Jev 与 OpenAI 模型响应相同请求的对比。图片来源:TypeSafe AI / TypeSafe AI
开发者对这款产品兴趣浓厚,需求一度大到公司 API 无法承受。Jev 最适合的用途似乎是软件自动化。到目前为止,软件开发者把它看作一种更便宜、更稳定的方式,用来在代码中嵌入智能。 例如,Vercel(一家开发 agentic 基础设施的公司)的软件工程师 Pranit Sharma ,公司之前用 OpenAI 的 ChatGPT Luna 5.6 运行一个分类器来审查命令的安全性。换成 Jev 后,速度提升了 5 到 18 倍,准确率也更高。

另一位开发者、Bryo AI CTO Nikhil Mudholkar 测试了 Jev 与 Gemini 在商业邮件分类任务上的表现。他的测试结果显示,Gemini 的准确率略高,但价格却贵了 10 到 20 倍。对 Mudholkar 来说更有趣的是 Jev 的置信度评分——“它是唯一一个能返回真实概率的模型,这使得它非常适合用于自动化工作流!!”

除了在某些用例中替代 LLM,这种新模型还能增强 LLM 的能力,充当监控不当行为的智能检查器。使用智能体(agents)来监控其他智能体成本高昂,但 Almeida 认为使用 Jev 来实现这一点是合理的。他设想用户可以部署 Jev 来追踪 LLM 智能体的行为轨迹并防止越狱(jailbreaks)。

“归根结底,它将幻觉问题的一部分转移给了用户,”Earendil 公司 CTO Armin Ronacher 解释道,该公司开发了开源模型框架 Pi。“用户需要判断:如果返回的概率只有 50%,那可能就像掷硬币一样随机,我会忽略它。但如果是 95%,那就可以放心地利用这个结果。”

Ronacher 指出,Jev 的另一个潜在用途是模型路由。预测特定工作负载是否需要特定模型非常有用,但用 LLM 来执行这项任务代价太高。Jev 的低成本和高速度使得这种实时分类成为可能。

这也是 Almeida 的愿景。该模型以 19 世纪经济学家 William Stanley Jevons 命名,其同名悖论描述了商品成本下降如何导致其使用量激增。在这里,智能成本的下降应该推动其广泛部署。

“我们认为,智能软件将会无处不在,以一种涌现和分布的方式存在……这更像早期的互联网,而不是人们现在试图打造的那些超级应用,”Almeida 说。

Almeida 对模型的架构守口如瓶,外部观察者怀疑它是基于开源权重的 LLM 构建的。公司将 Jev 称为“System One 模型”,专注于直觉而非推理,并特别专注于正确的任务。Almeida 表示,Jev 完全使用合成数据进行训练,采用了一种他称为“基于校准决策的强化学习”的技术。

“我们早期押注于完全自研生成数据,这是我做过的最明智的决定之一——在我看来,比公司上市、比 RLHF 都更划算,”他告诉 TechCrunch,“我们一半的[业务]是一个实验室,基本上垄断了统计特性明析的合成数据这一细分领域,这如今成了我毕生的乐趣所在。” 目前,Jev 是这类模型中唯一的独苗,但 Ronacher 预计,随着其实际效用日渐明朗,竞争对手将会接踵而至。 他说:“从很多方面来看,我们本应更早看到这种现象。不过,想必是因为 LLM 太过廉价且受补贴,用户往往还没到非创新不可的地步。” TypeSafe 自身也计划基于新模态构建更多版本的模型。当被问及 TypeSafe 是否算前沿实验室时,Almeida 表示:“前沿实验室的主打产品是恐惧或炒作。我希望我们的主打产品是智能……[但我们]并非那种意义上的实验室,你知道的那种——赌注押在无限财富上,或是把它奉为宗教,又或是在数据中心里造个上帝,或者是如今流行的那种东西。”
原始来源: TechCrunch

评论 (0)