
Clef 故意复制 Jev 的 API——而这正是有趣之处
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Clef 是 Cloudflare 推出的一个 270 亿参数多模态模型,只回答键入的问题,别的什么都不做。你交给它一个状态——文本、JSON、图像、视频帧——再加上一个最多包含 64 个命名问题的模式,它就会在一次前向传播中为每个允许的选项返回一个概率。不生成文本,不需要解析器,也没有解码循环。让 Cloudflare/clef 值得一读的,不是它借用的那个设计,而是它选择的传输格式:Cloudflare 构建 Clef,是为了兼容 Jev System One 的请求体和响应体,这是 TypeSafe 最先发布的决策模型,并通过相同的 POST /v1/systemone 路径提供服务。在这里,互操作性就是整个商业论点。如果你的流水线已经以那种形式向决策模型提问,那么 Clef 只是改一个 URL 和一个模型字符串,而不是一次迁移。
对一篇发布文章来说,把这一点埋没起来很不寻常,而 Cloudflare 并没有把它埋没——模型卡直截了当地声明,该 API“完全兼容 Jev 和 SystemOne”,博客开篇则将这一品类进入大众视野归功于 TypeSafe,随后把 Clef 定位为一个内部实验的第二代版本。因此,对这次发布最诚实的解读包含三个部分:兼容性决策为你带来了什么,Cloudflare 自己的数据说明了 Clef 在哪些方面胜出、哪些方面落后,以及哪些内容仍未得到验证——因为那张表中的每一个数字,都是由发布该模型的厂商给出的。
分类来自其他地方
Cloudflare 的这篇文章对其渊源直言不讳。让模型返回有界结构化输出而非散文的想法,被归功于 TypeSafe 的 Jev System One。Cloudflare 自己进入这条路线的方式,是一个更早的演示:它通过暴露 logprobs,把扩散模型掰成能输出确定性概率的模型;此外还有 Matt Mastracci 所做的社区工作,让推理引擎能够处理这种模式。Clef 在这一概念基础上,采用了不同的骨干网络、专门构建的评分头,以及——真正具有商业意义的部分——一个与在位者相匹配的请求体。
当一家供应商既复制竞争对手的 wire format,又拿自己与对手的指数做基准对比时,这种兼容性就不是模型的脚注,而是产品战略。在现有端点背后替换一个决策模型,是新进入者被试用成本最低的方式,也是已经接好其中一个这类端点的团队成本最低的实验。
实际交付了什么,以及代价是什么
• 参数 — 27B,其构建方式是:冻结 Qwen3.8-27B 及其视觉编码器,并在其之上训练一个联合模式头以及秩为 256 的低秩适配器。
• 同系列 — Clef-Flash,基于 Qwen3.5-9B 的同一配方,9B 版本。单独文章,单独权衡。
• 上下文——65,536 个 token,依据 Workers AI 模型页面和博客文章。捆绑的编码辅助工具默认设置为 max_length=16,384,这是一个默认值而非上限,但如果你按原样使用该加载器,得到的就是这个默认值。
• 问题类型 — noul (真/假,返回为真的概率)、选择 (2 到 26 个具名选项)、评分 (2 到 26 个有序等级)。每个请求支持 1 到 64 个问题。
• 价格 — 在 Cloudflare 的 Workers AI 上,每百万输入 token 仅需 $0.24;也可以基于 Apache-2.0 权重自行托管,这些权重分为十二个分片,总计约 55 GB。
• 许可证 — Apache 2.0,遵循 Qwen3.8-27B 基础检查点。

在哪些方面它胜出,在哪些方面则不然
Cloudflare 的 Decision Index 运行结果是本节所有内容的来源,而托管它的排行榜也归 Cloudflare 所有。下文没有任何内容经过独立复现。请把它当作供应商给出的最佳情况来读,并注意它有多么不均衡。
这一簇胜利正是自家训练的分类器应当取胜的地方。Clef 在 BANKING77 意图 macro-F1 上取得 94.2,而 Jev 为 79.7;在带范围外处理的 CLINC150 上取得 97.4,而 Jev 为 89.3——30 个百分点的差距,是表中与决策最相关的单元格,因为拒绝分类是路由中较难的那一半。它还在 CRUXEval 上取得 86.7,在 CLadder 上取得 94.0,并在家用电器模拟器上取得 83.0。
这些损失同样真实,理应放在同一段里。在通用知识和硬推理方面,较旧的 Jev 完胜:GPQA Diamond 78.3 对 48.0,MMLU-Pro 82.7 对 65.9,BBH 92.9 对 73.7。这是表中最大的三处差距,而且全都指向同一个方向。Clef 在其自身对比中,于安全领域的 PhishNChips 数据集上也不是最佳模型:它得分为 79.6,而一个竞品条目得分更高。
在四项端到端工作流评估中,这些评估取自 TypeSafe 自己的公开评估集,并依据共识标签评分,两者差距小到几乎像抛硬币。Clef 在精确操作上的发票处理以 64.7 对 61.8 胜出,在安全事件集上以 62.9 对 61.7 胜出;Jev 在智能体轨迹可观测性上以 71.6 对 68.5 胜出;客户服务则是 76.3 对 76.0 的平局,在这个差距下毫无意义。
延迟上的差距是结构性的,而非边际性的。Cloudflare 报告 Clef 的中位数为 209.3 毫秒、p95 为 238.6 毫秒,而 Jev 则为 524.1 和 536.0。这种排序源自非自回归设计,而非基准测试的偶然特性,因此它是最有可能经受住真实部署检验的数字。绝对毫秒数是在 Cloudflare 自己的硬件上测得的,单看本身意义不大。
发布内容中最有说服力的数据点并不是基准测试中的某一行。Cloudflare 表示,其威胁情报团队把一个域名连同其浏览器渲染服务一起交给 Clef,并在 2.2 秒内得到了类别判定——相比之下,其自家最快的通用 LLM 在同一工作流上需要 4.7 秒,而且 Clef 返回的分类结果更多。这是内部轶事,不是研究——但正是这类故事解释了为什么有人会构建它,而不是去提示一个通用模型。

API 参考文档会告诉你两件事,而有一件事它不会告诉你
文档中记录的陷阱虽小,但在移植任何东西之前都值得一读。confidence字段衡量的是概率的集中程度,而不是答案正确的概率——一个校准良好的模型可能返回低置信度的正确答案,也可能返回高置信度的错误答案。当两个选项打平时,答案会遵循模型的选项顺序,所以请把你偏好的选项放在前面。任何人在没有读这两句话的情况下移植基于提示的分类器,都会误读自己的日志。
更大的限制没有被记录在任何地方,因为它是结构性的。Clef 完全没有文本生成路径,这意味着它无法起草回复、总结讨论串、调用工具或进行对话,也不会编造一个你未声明的类别。整个设计假定你可以预先枚举出允许的答案。这悄然排除了一大类问题,再多的基准性能也无法改变这一点。
兼容性论点的价值何在
这时候,这次发布就不再是一次模型评审,而变成了一个架构问题。如果 Clef 兼容 Jev 的请求形态,那么你决策端点背后的模型就是一个配置值,而采纳它的明智方式是并行并存,而不是替换——用你自己的流量同时运行两者,保留在你的数据上表现更好的那个,并让切换保持低成本。
Clef 本身并不在我们的路由列表上;OrcaRouter 目录对它返回 404,因此这里没有任何内容应被解读为我们对它可用性的声明。我们确实提供的是它当初被打造来取代的那款现有方案。TypeSafe 的 Jev 1.13 是一条已列出的路由,价格为每百万输入 token $0.042,上下文长度为 65,536 token,通过相同的POST /v1/systemone 请求体提供服务,因此对二者做 A/B 测试只是换一个模型字符串,而不是重写代码。按提供商列表价透传,不按 token 加价,跨提供商自动故障转移——把两者都放在同一个密钥之下——200 多款模型——正是这一点让那项测试在有人决定在意它之后的那个星期之后仍能持续运行,而不是退化成配置文件里一条过时的注释。你留在手边、用来对决策模型得出的任何结论采取行动的通用模型,也能通过同一个密钥触达,而无需再签一份合同。

什么会改变这个读数
Cloudflare 之外的某个人需要重新跑一遍 Decision Index。这套测试是公开的,评估也被描述为可复现,因此第三方运行就是厂商表格与事实之间的分水岭——而最重要的那些单元格,恰恰是彼此指向相反方向的那些。在范围外意图检测上拿到 97.4,紧挨着在 GPQA Diamond 上拿到 48.0,这并不是一条平滑的能力曲线;它描述的是一个模型非常擅长其训练分布中的分类形态,而在它未曾见过的推理上则要弱得多。如果这一点在独立测试下依然成立,那么它就是关于 Clef 在运营层面最重要的事实,而它并不在亮点之中。
生产流量同样需要像延迟表那样。在单块 H200 上测得的 209 毫秒中位数,说明不了并发下的 p95 是什么情况,而这个设计的全部卖点就在于它位于热路径之中。
而微调平台得拿出点成果来。Cloudflare 的帖子描述了一个 RL 循环——用 AI Gateway 从你自己的流量中捕获数据集,用 Workers AI 生成 rollout,用 Containers 作为评分沙箱,用 Trainer 更新权重,再重新部署到 Workers AI 上——而这一切就写在宣布这些模型的同一篇帖子里,却没有附带任何客户成果。一个经过微调的 Clef,如果能在基座从未训练过的任务上击败基座,那对这个品类而言,会是比表格里任何一行都强得多的证据。
在此之前,公允的总结是这样的:Cloudflare 发布了一个真实的、采用宽松许可证的、真正快速的决策模型,并让它能与最早推出的那个模型轻而易举地互换。这比大多数开放发布所能提供的故事都要好,而且到目前为止,这仍然完全只是厂商对自身的自述。
