Cloudflare 发布 Clef 模型,AI Agent 决策无需人工介入
要点
- Cloudflare 发布了 Clef 和 Clef-flash 两款面向 AI agent 的决策模型,与 TypeSafe AI 的 Jev 直接竞争。
- 这类模型不生成文本,而是为预定义的选项分配概率,让下游系统可以直接根据结果自动执行操作。
- 两款模型均基于 Qwen 构建,支持文本和图像。Cloudflare 称 Clef-flash 中位响应时间为 39 毫秒,Clef 为 209 毫秒,快于同类竞争产品。
Cloudflare 发布了 Clef 和 Clef-flash 两款面向 AI agent 的决策模型。速度是该公司对标领跑者 Jev 的主要卖点。
决策模型不返回长篇文本,而是输出带概率的简短分类结果。比如面对一条客户支持消息,Clef 会评估其紧急程度,并判断该由哪个团队处理。下游代码可以据此分发工单、触发升级流程,或转交人工处理。
Cloudflare 表示,"agentic 决策不再一定需要人工介入"。Agent 可以"以程序化方式收集上下文、做出决策并执行任务,必要时再交由人工"。Clef 这个名字取自乐谱中的谱号(clef)——它为五线谱上的线条赋予音高,正如决策模型为后续行动设定框架。它与"Jev"发音相似,恐怕也并非巧合。

这类“决策模型”填补了大语言模型与传统分类器之间的空白。语言模型具备推理和调用工具的能力,但其输出缺乏稳定性且速度较慢。传统分类器速度很快,但每增加一个新类别都需要重新训练。Cloudflare 将 Clef 视为对 TypeSafe AI 的 Jev 模型 的直接回应,同时保持 API 完全兼容,方便客户轻松切换。
Clef-flash 在 39 毫秒内返回决策
根据 Cloudflare 的数据,在 43 项基准测试中,Clef 和较小的 Clef-flash 的速度均快于所有相关的竞品决策模型。该公司报告称,Clef-flash 的中位延迟约为 39 毫秒,Clef 约为 209 毫秒,而 Jev 仅为 524 毫秒多一点。这两个模型直接运行在 Cloudflare 的基础设施上,该公司表示,这使得它们能够受益于靠近边缘数据中心的优势。

Cloudflare 的威胁情报团队已在测试 Clef 用于网站分类。例如,该模型判定某域名有 95% 的概率是时尚网站,85% 的概率是在线商店,而成为钓鱼网站的概率低于 1%。获取、渲染并分类该网站仅耗时 2.2 秒。相比之下,该公司最快的通用语言模型完成同样流程需 4.7 秒,且仅返回了两个类别。
Cloudflare 称 Clef 还能处理图像,而 Jev 目前仅限文本。Clef 拥有 64,000 token 的上下文窗口,容量是 Jev 的两倍。在 Cloudflare 自测中,Clef 在 Jev 决策指数上也领先。
| 基准测试 · 准确率 | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
|---|---|---|---|---|---|---|
| API Bank | 91.93 | 93.11 | 88.19 | 83.66 | 56.30 | 11.41 |
| When2Call | 72.37 | 65.58 | 80.97 | 75.44 | 49.62 | 11.94 |
| PhishNChips | 79.60 | 75.05 | 62.55 | 85.35 | 50.75 | 50.15 |
Cloudflare 基于 Qwen 模型构建
据 Cloudflare 介绍,Clef 基于 Qwen3.8-27B,Clef-flash 则基于更小的 Qwen3.5-9B。Cloudflare 在训练过程中保持基础模型不变,而是用自研的合成数据训练额外的组件,这些组件可以从模型的内部计算中提取答案选项和概率。
Cloudflare 还采用了自己版本的 RLCD(Reinforcement Learning for Calibrated Decisions,用于校准决策的强化学习),这也是 TypeSafe 用来训练 Jev 的方法。RLCD 让模型在一次调用中回答关于输入的多个问题,目标是让输出的概率与答案实际正确的频率相匹配。此前,Cloudflare 还曾用 DiffusionGemma 做实验,尝试从语言模型的内部计算中得出固定的决策值。
客户可以针对自己的任务微调 Clef
随产品发布,Cloudflare 还推出了一项强化学习服务,让客户可以把 Clef 调整到自己的任务上。前期将由一支前线部署工程师团队协助客户完成微调,自助服务平台后续推出。
客户可以通过 AI Gateway 记录请求来构建数据集,然后在作为 RL 沙箱的容器中评估这些请求。新的 trainer 组件则支持把微调后的模型部署到 Workers AI 上。为了运行自定义模型,Cloudflare 使用了 Replicate 的技术——该公司已于 2025 年底收购 Replicate。

Cloudflare 表示,计划内部使用 Clef 来审查滥用报告、分类支持请求,并区分有益和有害的 bot。两款模型均运行在 Cloudflare 的 Workers AI 平台上,以 Apache-2.0 许可证开放在 Hugging Face 上。
这一方法由 TypeSafe AI 推广,该公司由前 OpenAI 研究员 Diogo Almeida 创立,于 9 月中旬推出 Jev。TypeSafe 将 Jev 宣传为“无幻觉”模型,但这仅保证它在预定义答案选项中保持输出,并不能防止其选错。9 月下旬,OpenAI 也跟进推出基于 GPT-6 Luna 构建的 Decisions API,同样支持文本或图像作为上下文输入。
Cloudflare 主要运营全球内容分发、DNS 和安全服务网络,其自研 AI 模型一直鲜受关注。近期相关新闻多聚焦于赋予网站所有者访问控制权。7 月,该公司允许站点运营者根据用途精细控制对 AI bot 的屏蔽或允许。