← 文章 / AI技术
The Decoder 2小时前 · 2026-10-03 02:27:56 · 0 阅读

Cloudflare 发布 Clef 模型,AI Agent 决策无需人工介入

Image description

要点

  • Cloudflare 发布了 Clef 和 Clef-flash 两款面向 AI agent 的决策模型,与 TypeSafe AI 的 Jev 直接竞争。
  • 这类模型不生成文本,而是为预定义的选项分配概率,让下游系统可以直接根据结果自动执行操作。
  • 两款模型均基于 Qwen 构建,支持文本和图像。Cloudflare 称 Clef-flash 中位响应时间为 39 毫秒,Clef 为 209 毫秒,快于同类竞争产品。

Cloudflare 发布了 Clef 和 Clef-flash 两款面向 AI agent 的决策模型。速度是该公司对标领跑者 Jev 的主要卖点。

决策模型不返回长篇文本,而是输出带概率的简短分类结果。比如面对一条客户支持消息,Clef 会评估其紧急程度,并判断该由哪个团队处理。下游代码可以据此分发工单、触发升级流程,或转交人工处理。

Cloudflare 表示,"agentic 决策不再一定需要人工介入"。Agent 可以"以程序化方式收集上下文、做出决策并执行任务,必要时再交由人工"。Clef 这个名字取自乐谱中的谱号(clef)——它为五线谱上的线条赋予音高,正如决策模型为后续行动设定框架。它与"Jev"发音相似,恐怕也并非巧合。

Diagram showing a support ticket about API errors and two questions about team and urgency flowing into a decision model that outputs 100 percent for the technical team and 100 percent for urgency in parallel.
决策模型能同时回答关于输入的多个预设问题,并返回每个答案选项的概率。| 图片:Cloudflare

这类“决策模型”填补了大语言模型与传统分类器之间的空白。语言模型具备推理和调用工具的能力,但其输出缺乏稳定性且速度较慢。传统分类器速度很快,但每增加一个新类别都需要重新训练。Cloudflare 将 Clef 视为对 TypeSafe AI 的 Jev 模型 的直接回应,同时保持 API 完全兼容,方便客户轻松切换。

Clef-flash 在 39 毫秒内返回决策

根据 Cloudflare 的数据,在 43 项基准测试中,Clef 和较小的 Clef-flash 的速度均快于所有相关的竞品决策模型。该公司报告称,Clef-flash 的中位延迟约为 39 毫秒,Clef 约为 209 毫秒,而 Jev 仅为 524 毫秒多一点。这两个模型直接运行在 Cloudflare 的基础设施上,该公司表示,这使得它们能够受益于靠近边缘数据中心的优势。

散点图,Y轴为决策指数得分,X轴为中位延迟(毫秒)。Clef 在约 210 毫秒时得 61.2 分,Clef-flash 在约 40 毫秒时得 57.1 分,Jev 在约 525 毫秒时得 57.9 分。图中还包含 AutoJev-27B 和 Kev 9B 等开源模型的数据点。
根据 Cloudflare 公布的数据,Clef 提供了最高的决策质量,而 Clef-flash 在极低的延迟下,准确率几乎赶上 Jev。 | 图片来源:Cloudflare

Cloudflare 的威胁情报团队已在测试 Clef 用于网站分类。例如,该模型判定某域名有 95% 的概率是时尚网站,85% 的概率是在线商店,而成为钓鱼网站的概率低于 1%。获取、渲染并分类该网站仅耗时 2.2 秒。相比之下,该公司最快的通用语言模型完成同样流程需 4.7 秒,且仅返回了两个类别。

Cloudflare 称 Clef 还能处理图像,而 Jev 目前仅限文本。Clef 拥有 64,000 token 的上下文窗口,容量是 Jev 的两倍。在 Cloudflare 自测中,Clef 在 Jev 决策指数上也领先。

基准测试 · 准确率 Clef Clef-flash Jev DiffusionGemma Jev Kev 9B Laya
API Bank 91.93 93.11 88.19 83.66 56.30 11.41
When2Call 72.37 65.58 80.97 75.44 49.62 11.94
PhishNChips 79.60 75.05 62.55 85.35 50.75 50.15

Cloudflare 基于 Qwen 模型构建

据 Cloudflare 介绍,Clef 基于 Qwen3.8-27B,Clef-flash 则基于更小的 Qwen3.5-9B。Cloudflare 在训练过程中保持基础模型不变,而是用自研的合成数据训练额外的组件,这些组件可以从模型的内部计算中提取答案选项和概率。

Cloudflare 还采用了自己版本的 RLCD(Reinforcement Learning for Calibrated Decisions,用于校准决策的强化学习),这也是 TypeSafe 用来训练 Jev 的方法。RLCD 让模型在一次调用中回答关于输入的多个问题,目标是让输出的概率与答案实际正确的频率相匹配。此前,Cloudflare 还曾用 DiffusionGemma 做实验,尝试从语言模型的内部计算中得出固定的决策值。

客户可以针对自己的任务微调 Clef

随产品发布,Cloudflare 还推出了一项强化学习服务,让客户可以把 Clef 调整到自己的任务上。前期将由一支前线部署工程师团队协助客户完成微调,自助服务平台后续推出。

客户可以通过 AI Gateway 记录请求来构建数据集,然后在作为 RL 沙箱的容器中评估这些请求。新的 trainer 组件则支持把微调后的模型部署到 Workers AI 上。为了运行自定义模型,Cloudflare 使用了 Replicate 的技术——该公司已于 2025 年底收购 Replicate。

Flowchart of the planned fine-tuning process showing AI Gateway for logging requests, custom data preparation, an RL training loop using Workers AI, Containers, and RL Trainer, and deployment on Workers AI with a custom model.
Cloudflare 计划推出的自助服务平台将记录生产数据,通过强化学习微调 Clef,并直接重新部署定制化模型。 | 图片来源:Cloudflare

Cloudflare 表示,计划内部使用 Clef 来审查滥用报告、分类支持请求,并区分有益和有害的 bot。两款模型均运行在 Cloudflare 的 Workers AI 平台上,以 Apache-2.0 许可证开放在 Hugging Face 上。

这一方法由 TypeSafe AI 推广,该公司由前 OpenAI 研究员 Diogo Almeida 创立,于 9 月中旬推出 Jev。TypeSafe 将 Jev 宣传为“无幻觉”模型,但这仅保证它在预定义答案选项中保持输出,并不能防止其选错。9 月下旬,OpenAI 也跟进推出基于 GPT-6 Luna 构建的 Decisions API,同样支持文本或图像作为上下文输入。

Cloudflare 主要运营全球内容分发、DNS 和安全服务网络,其自研 AI 模型一直鲜受关注。近期相关新闻多聚焦于赋予网站所有者访问控制权。7 月,该公司允许站点运营者根据用途精细控制对 AI bot 的屏蔽或允许。

原始来源: The Decoder

评论 (0)