
Clef 对比 Qwen3.8-27B:同一骨干,两种输出契约
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Clef写不出一个句子,而它却是用一个能写句子的模型搭建出来的。Cloudflare/clef 是一个 270 亿参数的多模态决策模型:你交给它一个状态,以及一份由带类型问题组成的 schema,它就会为每个允许的选项返回一个概率,而不会产出哪怕一个词元的散文。支撑它的底层骨干是 Qwen3.8-27B,一个开放权重的稠密视觉语言模型,被就地冻结,只在上面外挂了一个小型头部。这使本页成为少数几个“模型对模型”页面之一,而在这类页面里,双方根本算不上对手——它们是一个检查点与它的衍生物,共享 55 GB 的权重,分歧只在于答案是供你阅读的东西,还是供你用来计算的东西。
两者的权重都比说明文字先一步公开。2026 年 9 月 30 日 21:15(UTC),Cloudflare 以 Apache-2.0 许可在 Hugging Face 上创建了Cloudflare/clef仓库,并于次日下午发布了公告文章——《Introducing Clef: our open-source decision models, and new RL fine-tuning platform》。在大约十八个小时里,一个 55 GB 的模型可以下载,并已在 Cloudflare 自家的边缘 GPU 上运行,而其厂商对此只字未提。三天之内,它就有了一个挂在 Ollama 0.35.1 底下的 Ollama 库页面——本文正是在那里发现它的——以及来自十几个不同上传者的 NVFP4、FP8、EXL3、INT8、Q4 和 Q8 构建版本。
从仓库中可知的内容异常完整,而把它与不可知的部分区分开来是值得的。可知:架构、基础检查点、许可证、可运行的参考实现,以及完整的评估矩阵。不可知:这些数字中是否有任何一个能在并非 Cloudflare 的人重新运行后依然成立。下文归于 Clef 的每一项得分,都来自厂商自己对一套由厂商托管的测试套件的运行结果。与一个已有一个月独立使用记录的模型相比,这种不对称正是本次比较诚实的脊梁,而文章余下部分讨论的则是它真正产生影响的地方。
两个仓库并排
先从下载开始,因为这种相同本身就是重点。Clef 的 safetensors 共有 54.97 GB,分布在十二个分片中。父模型的则有 55.56 GB,分布在十八个分片中。Clef 保留了 Qwen3.8-27B 的视觉编码器——处理器、视觉塔、整个多模态前端——所以没有为了缩小模型而剥离任何东西。Cloudflare 添加的是一个 256 MB 的联合 schema 头:四层、宽度 1,024、十六个头、宽度 4,096 的前馈网络,以及两个读取骨干网络最终隐藏状态的路由层。训练方案是冻结的骨干网络、该头,以及秩为 256 的低秩适配器,并针对有效的 schema 答案使用标签平滑交叉熵,再配合 Brier 损失来提升校准。
然后是分歧所在,这完全在于模型被允许输出的内容。
• 参数 — Clef 27B,基于 Qwen/Qwen3.8-27B 后训练而成。Qwen3.8-27B 为 27B 稠密模型,64 层,隐藏维度 5,120,词表规模 248,320,由 16 ×(3 × Gated DeltaNet → FFN)与 Gated Attention 交替组成。
• 输出 —— Clef:每个允许的选项对应一个 logit,按问题做 softmax,完全不存在生成路径。Qwen3.8-27B:token、工具调用,以及一个默认开启的推理块。
• 问题形态 — Clef 每次请求接收 1 到 64 个带类型的问题,分为三种形式:noul(为真的概率),choice(2 到 255 个命名选项),score(2 到 10 个有序等级,返回一个可能落在这些等级之间的概率加权值)。Qwen3.8-27B 没有这样的契约;你得到的是自然语言文本,解析器得由你编写。
• 许可证——两者均为 Apache-2.0,这就是第三方量化能在一个周末内完成的原因。
• 冻结那一半的代价——Clef 的头部是 256 MB,而主干是 54.97 GB。几乎整个下载内容都是父模型。如果你的磁盘上已经有 Qwen3.8-27B,那你就是在第二次下载它,只为获得关于如何作答的不同意见。

重新调整方向的代价,用两个数字说明
Cloudflare 的评估是内部运行的 Decision Index 0.2.1 套件,它是一张关于决策模型的表格——共六列:Clef、Clef-flash、Jev、DiffusionGemma Jev、Kev 9B 和 Laya。Qwen3.8-27B 在其中没有对应的行,而 Clef 在 Artificial Analysis Intelligence Index 上也没有对应的行。因此并不存在共用的记分板,本文也不会凭空编造一个。
不过,有一个基准测试是双方都经受过的,而差距之大,足以成为本次发布中最具决策相关性的数字。在 GPQA Diamond——研究生水平的科学选择题——上,Cloudflare 测得 Clef 为 48.0。母模型在 Artificial Analysis 的评测框架上为 90.5,在厂商自己的模型卡上为 89.2。这是通用知识上四十个百分点的断崖,而这并不神秘:Clef 的作答方式是对交给它的一组固定选项打分,而把同样的权重指向通用知识选择题,离“处理这张工单”再远不过了。要把这一比较视为指示性的,而非受控的——两套评测框架、两个实验室,既不是厂商的,也不是追踪方的。但方向毋庸置疑,而这就是这份合同的代价。
同样的模式也出现在 Clef 其余通用能力单元格中。MMLU-Pro 65.9,BBH 73.7,在带越界处理的 CLINC150 上,27B 对 Jev 的 89.3 拿下 97.4——最后这一项是罕见的单元格:这个衍生模型直接击败了更早的决策模型,而这一点很重要,因为拒绝分类恰恰是路由中更难的那一半。Clef 的强项恰恰落在一款内部自训练分类器本就该强的地方:BANKING77 意图 macro-F1 为 94.2,BFCL case-exact 为 98.5,API-Bank 为 91.9。而在它的弱项上,来自竞争实验室的一款纯文本决策模型——TypeSafe 的 Jev——在 GPQA Diamond 上以三十分的优势击败它,$0.042 每百万输入 token在我们自己的目录中计费,而这恰好提醒我们:“27B”本身并不构成论据。
父模型保留下来的,是决策索引(Decision Index)从不询问的一切。无论是在它自己的卡片上,还是在我们目录中来自 AA 的那些行里,都记录着:Terminal-Bench 2.1 为 73.0,SWE-bench Pro 61.7,LiveCodeBench v6 90.3,OSWorld-Verified 84.3,DeepSWE 1.1 为 42.2,AA Coding 68.1,在 138 个采样模型中排名第 35。这些项目都没有 Clef 行,因为 Clef 无法尝试它们。它没有工具调用路径,没有长时程规划,也没有办法输出补丁。
一个决策的代价是什么,以及为什么输出行就是整个论证
Workers AI 模型页面为 Clef 只列出了唯一一个单价:每百万输入 token 0.24 美元。没有输出那一行,而原因就在响应里。Ollama 自家文档中的示例——一张被分流到三个问题上的支持工单——返回的是"usage": {"input_tokens": 1204, "output_tokens": 3}。三个问题,三个输出 token。Cloudflare 是否为这三个 token 计费几乎无关紧要:一次决策的输出成本不是一个费率,而是一个问题的计数。
把它与我们自己产品目录中母公司的费率表对照一下,即每百万输入 token 为 $0.33,每百万输出 token 为 $2.40,并提供 262,144 token 的窗口。相同的 1,204-token 状态,相同的单一路由决策:
• Clef —— 1,204 个输入 token 按每百万 $0.24 计算,大约是 每次决策 $0.00029,也就是每百万次决策约 $289。答案变难时,这个数字几乎不变;只有当状态变长时,它才会变化。
• 关闭思考功能的 Qwen3.8-27B——相同状态下的输入成本约为 $0.00040,再加上大约十个输出 token,按每百万 $2.40 计算。就算它 $0.00042,也就是每百万 $421。Clef 大约便宜 1.5 倍,而这并不是大家在讲的那个故事。
• Qwen3.8-27B 在思考模式保持开启的情况下——这是该检查点的默认设置。如果模型花费 400 个 token 去推理一封密码重置邮件该归入四个分桶中的哪一个,那又是 $0.00096,而该判断的总花费便接近$0.0014,即每百万次 $1,357。这 400 个 token 只是一个假设,而非实测值,而倍数会随之线性变化。
所以,定价论点中诚实的版本比乍看之下更窄。面对一个关闭思考模式运行的通用模型,Clef 在花费上以约 1.5 倍胜出——这是真实的,但并不具有变革性。面对处于默认配置下的同一模型,差距则取决于冗长程度,而冗长恰恰是语言模型所具备、对选项进行打分的评分器式设计完全不具备的。这就是结构性论断:Clef 的成本以状态长度为界,而父级的成本则以父级决定说多少内容为界。

唯一一个不接近的数字
Cloudflare 报告称,在其自身的边缘 GPU 上,Clef 的请求延迟中位数为 209.3 毫秒,p95 为 238.6 毫秒,这是在其运行中的 43 项基准测试中测得的。Cloudflare 之外没有人复现过这一结果,而供应商的基础设施正是该数字如此之低的原因——这个模型被设计为与调用方位于同一网络上。
对于父级,我们可以做得比厂商给出的数字更好,因为它是我们的路由之一。在截至 2026 年 10 月 2 日的七天窗口内,OrcaRouter 自己的 playground 测得 Qwen3.8-27B 的 p50 为 1,929 毫秒,以及每秒 235.8 个输出 token,基于该窗口内 1.363 亿个 token 的流量。每日序列才是有意思的部分:p95 在七天中的六天恰好停在 10,000 毫秒,这读起来像是一个上限,而不是一次测量;而 p50 则随日期在 1,751 毫秒到 4,296 毫秒之间波动。将中位数视为大约是 Clef 的九倍,并在有人发布真实分布之前,将尾部视为不具信息量。
这个差距不是调优上的差异,也不会弥合。仅预填充的一遍处理加上一个并行评分头,一次扫描即可完成;而自回归模型则要等到无话可说时才会结束。厂商为 Clef 给出的绝对数字理应照例打个折扣,但这一排序是架构本身的属性,而不是 Cloudflare 硬件的属性。
其中一个的上下文以三种方式被引用。
两个模型都接受文本、JSON、图像和视频。它们的窗口并不相同,而且其中一个的数值会因你查阅的位置不同而出现不一致的说法。
• Clef,托管版——65,536 个 token,依据 Workers AI 模型页面和发布公告。这个数字限定了 API 调用方的上限,而 Cloudflare 自己的表述带有对比意味:是 Jev 的 32K 窗口所能承载状态的两倍。
• 磁盘上的 Clef——已发布的 config.json 声明 max_position_embeddings 为 262,144,因为冻结的主干是父模型的,仍带有父模型的位置上限。捆绑的 encode_record 辅助函数默认 max_length=16,384,并可通过 max_state_tokens 单独限制状态。这三个数字没有一个是错的;它们回答的是不同的问题,而一个宣称 256K 的运行时列表读取的是配置,而不是端点。
• Qwen3.8-27B — 原生支持 262,144,搭配合适的服务配置可扩展至 1,000,000,依据供应商的产品卡和我们的目录行。至少是托管版 Clef 窗口的四倍。
实际影响比这个比例所暗示的要小。Clef 消耗的是一份状态——一张工单、一张发票、一张截图——而不是一段对话,而且它的一个卖点是,你可以把一个很大的扁平化载荷交给它,并围绕它提出六十四个问题,而不必为每个问题重复支付该载荷的费用。父级需要这个窗口,因为它必须保存历史记录、工具结果以及自身的推理。不同的需求,不同的上限。
它们俩看到的是相同的像素。
视觉编码器是继承而来的,因此这并不是一个模型是多模态、而另一个不是的情况。Clef 每次请求最多接受四张图像,采用 base64 编码的 PNG、JPEG 或 WebP 格式,由有效载荷中的每个问题共享,视频帧也可以以帧数组的形式添加——卡片中的收据示例提出了一个关于总额是否清晰可辨的是/否问题,这正是该设计的缩影。Qwen3.8-27B 是一个原生视觉语言模型,在厂商的卡片上,OmniDocBench 1.5 为 91.1,RealWorldQA 为 85.9,CharXiv 为 78.8。
不同之处在于你得到的结果。Clef 给你逐字段的决策,并附带概率,这是关于一份文档的类型化答案。父级给你的是对文档的描述,然后你再解析它。对于一大类文档工作——检查这张表单、定位这个条款、判断这个总额是否高于阈值——类型化答案就是全部工作,而描述则是你付出成本、随后丢弃的开销。
这条线实际上落在哪里
• 采用 Clef——答案可以预先枚举,而且你宁愿不编写解析器。路由、分诊、门控、策略检查、文档字段提取。封闭集合,每个问题 2 到 255 个选项,最多 64 个问题一起评分。
• 选择 Clef —— 该决策位于热路径上,209 ms 对 1,929 ms 会改变流水线所能做到的事。这是迁移的唯一最强理由,且它是延迟层面的理由,而非准确率层面的理由。
• 选择 Clef——你追求的是确定性。你没有声明的选项不可能再冒出来,因为根本不存在能产生它的生成步骤。
• 保留 Qwen3.8-27B——答案不是从列表里挑出来的:总结、起草、对新问题展开推理、编写代码、在长周期内驱动工具。这些 Clef 一样都做不到,而且它不会告诉你。
• 保留 Qwen3.8-27B —— 你需要让模型能说出“以上都不是”。决策模型只会给它所拿到的选项打分。把一个账单/技术/销售的分类体系和一个隐私请求交给它,它会从这三者中返回最不糟糕的那个,而不是拒绝。而父模型则会把你没想到要问的问题摆到台面上。
• 保留 Qwen3.8-27B —— 用于上下文或长文档任务。在百万 token 扩展之前,其上下文窗口是托管版本的四倍。
请把这份列表当作一条流水线来读,而不是当作一个定论,因为它本来就是如此。这种架构让两者的关系变得字面意义上的直白:Clef 就是父级预填充(prefill)阶段,只不过在末端接上了不同的作答机制。合理的设计会把 Clef 放在前面——决定路由、优先级、升级标志——并让 Qwen3.8-27B 留在其后,依据这一决策行事。两者是互补关系,只是恰好共享同一个下载包。
在哪里运行它们中的每一个
Clef 托管在 Cloudflare 的 Workers AI 上,输入价格即为上文所述的每百万 token 0.24 美元,而 Apache-2.0 权重则归你所有,可在本地运行。Ollama 库中的收录是最新的入口:ollama pull clef 需要 Ollama 0.35.1 或更高版本,因为该模型通过 Ollama 为决策模型新增的 /v1/systemone 端点进行通信。要留意标签,而不是标题数字——默认标签和 clef:27b 标签都是 18 GB,这是一个 55 GB 模型的四位量化版本;clef:27b-q8_0 是 30 GB,clef:27b-nvfp4 是 18 GB,clef:27b-mxfp8 是 31 GB,而 clef:27b-mlx-bf16 是面向 Apple 芯片的完整 55 GB 版本。只要你将它指向本地 Ollama 并提供任意 API 密钥(运行时并不理会该密钥),TypeSafe 自家的 Python SDK 就能与它通信。有一个在生产环境中会带来麻烦的注意事项:confidence 衡量的是概率分布的集中程度,而不是答案正确的可能性,并且出现并列时会按你声明的选项顺序来裁决。
父模型是如今更容易置于 API 之后的一个。Qwen3.8-27B 可在 OrcaRouter 上路由,采用上文所用的每百万 $0.33 和 $2.40 费率,并具有 262,144 token 的上下文窗口;它是可通过单个 OpenAI 兼容密钥访问的 200 多个模型之一。由于提供商标价以 0% 加价原样传递,此对比中任一方的供应商降价都会在其落地当天于我们的路由上生效。
Clef 本身不是我们的路由之一——我们的公开目录不会为它返回任何内容,这里的任何内容都不应被解读为我们对其可用性的声明。我们确实提供的是让这种决策模式无需 Cloudflare 账户即可触达的模型:TypeSafe 的 Jev 1.13 是一条已列出的路由,每百万输入 token 收费 $0.042,具有 65,536 token 上下文,在同一个七天窗口内测得的 p50 为 148 ms,并且它采用完全相同的 POST /v1/systemone 请求形态。由于 Clef 有意与 Jev 保持 API 兼容,针对其中任一者构建的流水线距离另一者只有一次配置更改之差——而这正是路由层旨在让其变得无需代价的情形。让两者都保持可触达,用你自己的标签来衡量,让胜出者成为一个数据点,而不是一项架构承诺。如果某个决策模型最终门控着一个智能体,那么依据该决策采取行动的模型仍然必须可触达,而这一半已经位于同一个密钥之后。

什么会改变这个读数
三件事,按它们对其影响程度从低到高排列。
第三方需要重新运行 Decision Index。该套件是公开的,Cloudflare 将这些评估描述为可复现的,所以这是可以做到的——而 CLINC150 的 out-of-scope 单元格是值得关注的那一个,因为 27B 的 97.4 要么是在路由最难的一半上相较 Jev 的 89.3 的真正优势,要么是内部自建测试框架带来的假象。Cloudflare 之外的任何人都还不知道。
有人需要在同一个分类任务上,用相同的标签,为 Clef 和 Qwen3.8-27B 打分。这是唯一能判定,就闭集决策而言,重新设置分类头到底是一种质量取舍还是一次质量升级的比较;而两家厂商都没有动力去做这项比较。在那之前,40 分的 GPQA 差距仍是关于被移除内容的最佳现有证据,而它是关于错误任务的证据。
而且 Clef 的延迟需要在并发下达到 p95 要求。209 毫秒的中位数是供应商在供应商控制的硬件上测得的,而这个模型的全部卖点就在于它位于热路径中。相对于自回归父模型的排序是架构性的,并将继续成立。绝对毫秒数才是不该轻信的数字,而整个商业论证恰恰依赖于这个数字。
Qwen3.8-27B 是通过单个 OpenAI 兼容密钥即可访问的 200 多个模型之一——Qwen3.8-27B。
