一张生成的标题卡,上面写着“Clef vs Gemma 4 12B”,副标题为“一个 64K-token 的决策模型对阵一个 256K-token 的通才模型”,并带有显示“65,536 vs 256,000 上下文”和“概率 vs 散文”的标签。OrcaRouter 标志合成在右下角。
Engineering & Research

Clef 与 Gemma 4 12B 对比:64K Token 的决策一体机对阵 256K Token 的通用模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

的对比中最有用的数字Clef与Gemma 4 12B并非基准测试分数,而是 65,536 对 256,000——也就是上下文窗口。Cloudflare/clef是一个拥有 270 亿参数的多模态决策模型,基于 Qwen3.8-27B 后训练而来;它读取一个状态以及一套带类型的问题模式,并在单次非自回归前向传播中为每个允许的答案返回一个概率。Gemma 4 12B——即 Unified 检查点,google/gemma-4-12B-it——是该厂商推出的 119.5 亿参数、无编码器的任意到任意模型,于 2026 年夏季发布,能在 256,000 个 token 的窗口内用 140 多种语言生成文本。把一文件夹的合同同时摆在两者面前,决策模型耗尽空间的速度会快上四倍,因为它的上限是有明确记录的 65,536 个 token,而通用模型则是 256,000。这种不对称绝不是无关紧要的脚注。对于整整一类路由工作——长文档、粘贴过来的对话串、多页表单——在准确率还没被讨论之前,它就已经决定了取舍。

所以,这不是一个关于哪个模型更好的页面。这是一个关于它们真正有所不同的两个轴的页面:各自能容纳多少状态,以及各自在物理上能够产生什么形态的答案。其他一切,要么是无人复现过的厂商数字,要么是一种并不像表面看起来那样的比较。

每一项分别是什么,每项用一段话说明。

Clef 是 Cloudflare 的 27B 决策模型,以 Apache-2.0 许可发布,权重位于 Hugging Face,并在 Workers AI 上提供托管端点。Cloudflare 冻结了 Qwen3.8-27B 主干(包括其视觉编码器),附加了一个联合 schema 头以及 rank-256 低秩适配器,并用标签平滑交叉熵进行训练,以生成有效的 schema 答案,同时用 Brier 损失来提升校准。你提供 状态——文本、JSON、图像或视频帧——以及 1 到 64 个命名问题,每个问题的类型为 noul(真/假,返回为真的概率),choice(2 到 26 个命名选项)或 score(2 到 26 个有序级别)。返回的是每个问题的一个分布,仅此而已。完全没有文本生成路径。

Gemma 4 12B 是一个生成文本的通用模型。它没有编码器:不设独立的视觉或音频塔,而是让原始图像块和波形通过轻量线性层直接投影到语言模型的嵌入空间中,这正是它能接收文本、图像、视频和音频而无需按模态单独构建流水线的原因。它具备可配置的思考模式、原生函数调用、262K 词表,以及一种混合注意力机制,将 1,024 token 的滑动窗口注意力与完整的全局注意力交错起来。它采用 Apache-2.0 许可,同时附带厂商自己的使用条款,而且当人们说“在本地运行这个尺寸”时,多数人指的就是这个检查点。

在继续之前,有一件事需要明确说明:这两个模型都不是 OrcaRouter 上的路由。我们的目录对 cloudflare/clef以及同一系列中的 12B 检查点都会返回 404,而且本文中的任何内容都不应被解读为我们对其可用性的声明。我们从 Gemma 系列确实提供的是两个更大的版本,它们的价格见下文。

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

选项列表是一个接口,而它有一种失效模式。

这两者之间的结构性差异在于,对于不合适的输入会发生什么。

• 输出 — Clef 会为每个已声明的选项返回一个概率,且仅限这些选项。Gemma 4 12B 返回生成的文本。

• 拒答 —— 除非你自己把“以上皆非”写进标准里,否则 Clef 没有这个选项。Gemma 4 12B 可以描述出与你所问的任何情况都不相符的案例。

• 失败模式——Clef 的错误是静默的:在你的 schema 范围内自信地做出选择,不抛出任何异常,也不触发任何回退分支。而通用模型的错误通常是响亮的:一段无法解析的自然语言文本。

• 可测试性 ——固定的选项集使组件可复现、审计成本低。自由文本则更灵活,但验证成本高。

Clef 自己针对那个拒答问题给出的数字,是它所发布的最弱的一组数据。在带范围外处理的 CLINC150 上——即意图检测中一个有效答案是“这不属于任何类别”——27B 得分 97.4 macro-F1,这是 Cloudflare 表格中的最佳成绩,也是相比自家 9B 同门更值得关注 27B 的原因,后者在同一基准上得分 66.8。两个用同一配方构建的模型之间相差三十分,说明范围外行为正是后期训练规模所换来的东西,也正是大多数路由流水线默默依赖的东西。Cloudflare 记录的缓解办法是在 schema 中加第二个问题——添加一个 noul 字段,询问该状态到底是否适配,然后对其设阈值——这个办法有效,而且这是你的活儿,不是模型的活儿。

数字从哪里来,比它们说了什么更重要。

本文中每一个 Clef 数字都来自 Cloudflare:其模型卡、其发布博文,或其 Decision Index 运行结果。这套评测套件本身就是 Cloudflare 自家的,托管这些分数的排行榜也是 Cloudflare 自家的。这无异于一个供应商在自家掌控的硬件上测自家产品,而对手的 API 还是它刻意模仿来的。没有任何第三方复现过其中任何一项,本文也不打算假装并非如此。

Gemma 4 12B 这一列则是另一类证据。厂商自家的卡片公布其 MMLU Pro 为 77.2%,GPQA Diamond 为 78.8%,AIME 2026 无工具条件下为 77.5%,LiveCodeBench v6 为 72.0%。独立追踪机构 Artificial Analysis 将该推理配置的 Intelligence Index 标为 14.18,列出的价格为每百万 tokens $0.10 / $0.30,实测输出速度中位数约为每秒 113 个 tokens——而该机构自己的页面也注明,这些数字会因工作负载和硬件而异。

诚实的解读是,这两列根本不可比。一列是由厂商自己运行的厂商决策质量套件;另一列则是厂商基准测试与一个通用模型独立评估的混合体。把97.4和77.2并列引用,仿佛它们是同一张表里的两列,会是这个页面所能做出的最具误导性的一件事。

延迟是两者至少可以用相同单位来讨论的唯一领域,而且即便在那里,各种限定条件也层层叠加。Cloudflare 在其自有基础设施上测得,Clef 的中位数为 209.3 毫秒,p95 为 238.6 毫秒。Artificial Analysis 在推理配置下测得 12B 的首个 chunk 时间为约 2.4 秒,其中包含一个决策模型所不具备的思考预算。209 毫秒的非自回归单次前向传播对比 2.4 秒的生成启动,是真正的架构差异——单次前向传播对解码循环——也是 Clef 主张适用于热路径的最有力论据。另外,它是一个 27B 模型,需要 H200 级别的硬件才能达到这一数字,而 Cloudflare 为你运行它时,每百万输入 token 收费 0.24 美元。

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

64K 上下文实际能给你带来什么

情境是这一比较变得切实可行之处,也是通才在纸面上以大幅优势胜出的地方。

• Clef — 根据 Workers AI 模型页面和发布文章,共有 65,536 个 token;捆绑的编码辅助工具默认设置为 max_length=16,384,这是一个默认值而非上限,但如果你按原样使用该加载器,这就是你会得到的默认值。

• Gemma 4 12B — 根据厂商的规格说明,支持 256,000 个 token,并采用 1,024 token 的滑动窗口注意力机制以降低长上下文的成本。

• 图像——Clef 通过继承的视觉编码器,将图像和视频帧与文本状态联合评分。Gemma 4 12B 则通过其无编码器路径处理文本、图像、视频和音频。

• 语言 — Clef 的卡片未声称多语言支持;Gemma 4 12B 则记录了超过 140 种语言。

对于一张工单、一份发票或一张渲染后的截图,64K 很宽裕,差别只是理论上的。对于一份你想逐字段分类的200页合同,这就是全部关键所在:通用模型能容纳整份文档,而决策模型不能。Clef 对此的答案是分块,而在你决定如何处理文档之前就把它分块,意味着你已经做了一个本应由模型做出的决定。这是一个真实的限制,并且它值得被当作限制来明确说明。

你实际需要支付多少,以及在哪里支付

两个型号都不在我们的产品目录中,所以价格问题分成三种情况。

• Clef —— 在 Cloudflare 的 Workers AI 上每百万输入 token 0.24 美元,或从 Apache-2.0 权重自托管;Cloudflare 公布的延迟是在单块 H200 上使用 torch 2.11 和 transformers 5.10.2 测得的,而两天内出现的社区量化版本表明,它可以被进一步压缩到更小,代价是某种尚未有人测量过的准确率损失。

• Gemma 4 12B —— 这里完全没有托管路由。你要么自行获取约 24 GB 的 BF16 权重并自己部署服务,要么借助第三方平台。我们无法给出任何按 token 计费的价格。

• 路由替代方案 — Gemma 4 26B A4B,一款混合专家模型,总参数 25.2B,激活参数 3.8B,在 OrcaRouter 上标价为每百万输入 token $0.06、每百万输出 token $0.33,上下文长度 262,144 token。Gemma 4 31B 是它的稠密多模态姊妹模型,支持可配置思考与原生函数调用,标价为 $0.13 和 $0.38。两者均可通过一个密钥使用,提供商标价原样透传,不按 token 加价,并支持跨提供商自动故障转移。

最后那一行,才是我们在这次对比中实际参与程度的诚实版本。如果你需要的只是一个能读完一份长文档、再写出一句话的通用型模型,那么通往它的省钱路径就是我们确实在提供服务的某个 Gemma 4 规模版本,而它每百万 token 的成本,比在租来的 GPU 上自托管一个 12B 还要低。如果你需要的是热路径中一个有界的决策,那么 Clef 209 毫秒的中位数就是一项实打实的架构特性,而我们目录里最接近它的,是 TypeSafe 的 Jev 1.13 —— 也就是 Cloudflare 拿来对标、并照抄其线上格式的那个模型 —— 每百万输入 token 收费 0.042 美元,上下文长度为 65,536 token,并通过同一个 POST /v1/systemone 形式提供服务。由于两者在一个轻量适配层之后是 API 兼容的,拿 Clef 去对照现有方案更像是一次实验,而不是一次迁移;而当双方都能经由同一个端点访问时,这场实验就能一直保持低成本。

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

这个决定,被表述为一项决定

当答案可枚举、状态能容纳在64K内、决策位于延迟敏感路径,并且你愿意自行承担残差类别时,选择Clef。27B在超出范围意图检测上的97.4,正是你宁愿为它而不是9B同级模型付费的原因,而它的固定输出形态,正是让该组件无需解析器即可审计的关键。

当输入很长、模态是音频或视频、答案需要用散文体表达,或者类别尚不明确时,就选 Gemma 4 12B——因为“把这堆东西按任何说得通的分组方式做分诊”这种请求,决策模型根本无法接受,而不是处理得不好。它是一个通才,背后有独立评测支撑,而对于开放式工作来说,这比一张厂商的对比表更有价值。

而且要对这两组数字都保持怀疑,理由正是本文反复重申的那一点:Cloudflare 的任何结果都没有经过独立复现,而那张卡片是厂商自家的基准测试表。这两组数字中唯一真正有意思的一个——一个 27B 的 schema head 是否真能在它未经训练的数据上保持其 97.4 的 out-of-scope 得分——恰恰是两家厂商都无法定论、而第三方可以定论的那个数字。