ChatGPT 发明者推出新型 AI 模型 Jev:不输出语言只输出概率,开发者抢疯了

另一位开发者、Bryo AI CTO Nikhil Mudholkar 测试了 Jev 与 Gemini 在商业邮件分类任务上的表现。他的测试结果显示,Gemini 的准确率略高,但价格却贵了 10 到 20 倍。对 Mudholkar 来说更有趣的是 Jev 的置信度评分——“它是唯一一个能返回真实概率的模型,这使得它非常适合用于自动化工作流!!”
除了在某些用例中替代 LLM,这种新模型还能增强 LLM 的能力,充当监控不当行为的智能检查器。使用智能体(agents)来监控其他智能体成本高昂,但 Almeida 认为使用 Jev 来实现这一点是合理的。他设想用户可以部署 Jev 来追踪 LLM 智能体的行为轨迹并防止越狱(jailbreaks)。
“归根结底,它将幻觉问题的一部分转移给了用户,”Earendil 公司 CTO Armin Ronacher 解释道,该公司开发了开源模型框架 Pi。“用户需要判断:如果返回的概率只有 50%,那可能就像掷硬币一样随机,我会忽略它。但如果是 95%,那就可以放心地利用这个结果。”
Ronacher 指出,Jev 的另一个潜在用途是模型路由。预测特定工作负载是否需要特定模型非常有用,但用 LLM 来执行这项任务代价太高。Jev 的低成本和高速度使得这种实时分类成为可能。
这也是 Almeida 的愿景。该模型以 19 世纪经济学家 William Stanley Jevons 命名,其同名悖论描述了商品成本下降如何导致其使用量激增。在这里,智能成本的下降应该推动其广泛部署。
“我们认为,智能软件将会无处不在,以一种涌现和分布的方式存在……这更像早期的互联网,而不是人们现在试图打造的那些超级应用,”Almeida 说。
Almeida 对模型的架构守口如瓶,外部观察者怀疑它是基于开源权重的 LLM 构建的。公司将 Jev 称为“System One 模型”,专注于直觉而非推理,并特别专注于正确的任务。Almeida 表示,Jev 完全使用合成数据进行训练,采用了一种他称为“基于校准决策的强化学习”的技术。
“我们早期押注于完全自研生成数据,这是我做过的最明智的决定之一——在我看来,比公司上市、比 RLHF 都更划算,”他告诉 TechCrunch,“我们一半的[业务]是一个实验室,基本上垄断了统计特性明析的合成数据这一细分领域,这如今成了我毕生的乐趣所在。” 目前,Jev 是这类模型中唯一的独苗,但 Ronacher 预计,随着其实际效用日渐明朗,竞争对手将会接踵而至。 他说:“从很多方面来看,我们本应更早看到这种现象。不过,想必是因为 LLM 太过廉价且受补贴,用户往往还没到非创新不可的地步。” TypeSafe 自身也计划基于新模态构建更多版本的模型。当被问及 TypeSafe 是否算前沿实验室时,Almeida 表示:“前沿实验室的主打产品是恐惧或炒作。我希望我们的主打产品是智能……[但我们]并非那种意义上的实验室,你知道的那种——赌注押在无限财富上,或是把它奉为宗教,又或是在数据中心里造个上帝,或者是如今流行的那种东西。”