Amazon 发布自研 Jev 克隆决策模型,顺应网络爆发式增长的需求
Amazon Web Services 发布了一个受 TypeSafe Jev 启发的开源决策模型。随着 AI 开发者越来越渴望比前沿 LLM 更适合计算机自动化的智能,这类需求日益增长。
Amazon 于 OpenAI 宣布类似产品 的同一周发布了 Strands Decider 2B。这是一款高速、低成本的模型,用于在预设选项中进行筛选,并输出其对选择的置信度指标。该模型完全开源,现已可用,且体量足够小,支持本地运行。
Amazon 杰出工程师 Marc Brooker 在看到 Jev 并试图 构建自己版本 的此类模型后,发起了这一项目。这个自研项目成功程度颇高——它曾短暂占据 Jevbench 同级模型排名的榜首——以至于 Amazon 工程师对其进行了清理优化,并将其作为其 Strands Labs 的组织发布。Strands Labs 专注于开发用于部署 AI Agent 的新工具与协议。
Brooker 表示,这类工具的需求源于与 AWS 客户的交流。客户的 Agent 工作流并不总是需要全功能 LLM 那样的能力或成本。
Brooker 告诉 TechCrunch:“最初引起我对这类模型兴趣的原因是,它们作为工作流步骤的决策器非常完美——‘根据我当前的状态,下一步该做什么?’” 他指出,这为客户提供了一个更可靠的工作流步骤,“得益于置信度评分和答案的封闭域,[该步骤] 具有更低的延迟,且潜在成本更低。”
与其他决策模型一样,Strands Decider 基于 LLM 的“躯干”构建,在此案例中为 Qen3.5-2B,但它不生成文本,而是提供校准过的选择。TypeSafe 将其模型命名为 Jev,以纪念经济学家 William Stanley Jevons,希望借此唤起他的理论:某样东西——比如计算机智能——成本的下降,实际上可能会增加对其的需求。
TypeSafe 最初提出这个想法后,研究人员陆续推出了几十款类似的模型,这既说明该领域备受关注,也让人不禁疑问:这些模型到底有多大价值?Brooker 认为,难点在于如何优化模型的快速决策能力,同时不牺牲其智能水平。
他告诉 TechCrunch:“这里面需要找到一个很微妙的平衡点——既要提升模型在这类任务上的准确性和校准能力,又不能损害它在多语言理解和知识储备上的表现,而后者正是它通用、有趣且实用的关键。”
不过,他并不认为前沿实验室就一定能主导这个领域,尤其考虑到这些市场规模不大,做出一个有意思的模型只需要几百到几千美元的成本。
TypeSafe 的高管则表示,他们会专注自身,持续打磨未来的模型。
“我理解大家觉得这是一场淘金热,但他们可能低估了让模型真正变聪明的难度。”CEO 兼创始人 Diogo Almeida 对 TechCrunch 表示,目前他还没看到真正能对自己公司构成威胁的竞争者。
“现在这批人更像是想实现一个酷炫架构的 ML 工程师,而不是真心想让人工智能变得有用的团队。”