
Clef 對決 Gemma 4 12B:一款 64K Token 的決策裝置對抗 256K Token 的通用型模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在Clef與Gemma 4 12B的比較中,最有用的數字並不是基準測試分數,而是 65,536 對上 256,000——也就是脈絡視窗。Cloudflare/clef是一個擁有 270 億參數的多模態決策模型,以 Qwen3.8-27B 為基礎後訓練而成,能讀取一個狀態與一組具型別問題的結構描述,並在單次非自迴歸的前向傳遞中,為每個允許的答案回傳機率。Gemma 4 12B——即 Unified 檢查點,google/gemma-4-12B-it——是該廠商於 2026 年夏季推出的 119.5 億參數、無編碼器的任意對任意模型,可在 256,000 個詞元的視窗內以超過 140 種語言生成文字。把一整個資料夾的合約放到兩者面前,決策模型會早四倍耗盡空間,因為它的上限是文件記載的 65,536 個詞元,而通用型模型則有 256,000 個。這種不對稱並非無關緊要的附註。對於一整類的路由工作——長文件、貼上的討論串、多頁表單——它在準確率都還沒被討論之前,就已決定了選擇。
這不是一頁關於哪個模型更好的頁面。這是一頁關於它們真正不同的兩個維度:各自能容納多少,以及各自實際上能產生什麼形態的答案。其餘的一切,不是沒有人重現過的廠商數字,就是一個並非表面上看起來那樣的比較。
每一個是什麼,各以一段說明
Clef 是 Cloudflare 的 27B 決策模型,以 Apache-2.0 授權發布,權重放在 Hugging Face,並在 Workers AI 上提供託管端點。Cloudflare 凍結了 Qwen3.8-27B 主幹(包含其視覺編碼器),接上一個聯合結構描述頭(joint schema head)加上秩 256 的低秩適配器,並以標籤平滑交叉熵訓練它給出有效的結構描述答案,同時搭配 Brier 損失來讓校準更銳利。你提供 狀態——文字、JSON、圖像或視訊影格——以及 1 到 64 個具名問題,每個問題的型別為 noul(真/假,回傳為真的機率)、choice(2 到 26 個具名選項)或 score(2 到 26 個有序等級)。回傳的內容是每個問題一個分佈,別無其他。完全沒有文字生成路徑。
Gemma 4 12B 是一款能生成文字的通才模型。它不採用編碼器:有別於各自獨立的視覺或音訊塔,原始影像區塊與波形會透過輕量線性層,直接投影到語言模型的嵌入空間,這正是讓它無需各模態專屬管線,就能接收文字、圖像、影片與音訊的原因。它具備可設定的思考模式、原生函式呼叫、262K 詞彙表,以及混合注意力機制,會將 1,024 個 token 的滑動視窗注意力與完整的全域注意力交錯運用。它採用 Apache-2.0 授權,並同時附有廠商自家的使用條款;而當人們說「在本機執行這個尺寸」時,大多指的就是這個檢查點。
在繼續之前,有一點必須先說清楚:這兩個模型都不是 OrcaRouter 上的路由。我們的目錄會對 cloudflare/clef 以及同一系列中的 12B 檢查點回傳 404,而本文中沒有任何內容應被解讀為我們對可用性的聲明。我們確實有提供 Gemma 系列中兩個較大的尺寸,它們的價格會在下文說明。

選項清單是一種介面,而它有一種失效模式
這兩者之間的結構性差異,在於當輸入不符合時會發生什麼情況。
• 輸出 — Clef 會針對每個已宣告的選項傳回機率,而且僅限這些選項。Gemma 4 12B 則傳回生成的文字。
• 拒答 — Clef 沒有「以上皆非」的選項,除非你自己把這個選項寫進條件裡。Gemma 4 12B 能夠描述一個完全不符合你所詢問任何條件的案例。
• 失敗模式 — Clef 的錯誤是無聲的:在你的結構定義內自信地做出選擇,不會引發例外,也不會觸發任何備援分支。通用型模型的錯誤則通常很大聲:無法解析的散文。
• 可測試性——固定選項集使元件可重現且稽核成本低。自由文字則具彈性,但驗證成本高。
Clef 自己針對那個拒答問題公布的數字,是它發表過最疲弱的數據。在 CLINC150 上,具備範圍外處理——也就是意圖偵測,其中一個有效答案是「這不屬於任何類別」——27B 拿下 97.4 macro-F1,這是 Cloudflare 表格中最好的成績,也是比起自家 9B 同門模型更值得關注 27B 的理由;9B 在同一個基準測試上的得分是 66.8。兩個以相同配方打造的模型之間出現三十分的差距,說明了範圍外行為正是後訓練規模化所換來的東西,而它也是大多數路由管線默默依賴的東西。Cloudflare 記載的緩解措施,是在結構描述中加入第二個問題——新增一個 noul 欄位,詢問該狀態究竟是否符合,然後對它設定閾值——這做法有效,而且這是你的工作,不是模型的工作。
數字從何而來,比它們說了什麼更重要。
本文中的每一個 {{1}}Clef{{/1}} 數字都來自 Cloudflare:它的模型卡、它的發布文章,或它的 Decision Index 測試結果。這套測試套件本身是 Cloudflare 自家的,而存放這些分數的排行榜也是 Cloudflare 自家的。這無異於一個供應商在自己掌控的硬體上評測自家產品,對上一個它刻意模仿其 API 的競爭對手。沒有任何第三方重現過其中任何一項,而本文也不會假裝不是如此。
Gemma 4 12B 這一欄是另一種證據。廠商自家的模型卡公布了 MMLU Pro 77.2%、GPQA Diamond 78.8%、AIME 2026 在未使用工具時達到 77.5%,以及 LiveCodeBench v6 達到 72.0%。獨立追蹤機構 Artificial Analysis 將該推理配置的 Intelligence Index 列為 14.18,標示價格為每百萬個 token 0.10 美元 / 0.30 美元,並測得中位輸出速度約為每秒 113 個 token——而它自己的頁面也註明,這些數字會因工作負載與硬體而異。
誠實的解讀是:這兩欄根本不能相提並論。一欄是廠商自行執行的決策品質評測套件,另一欄則是廠商基準測試與針對通用模型的獨立評測混在一起。把 97.4 和 77.2 並列引用,彷彿它們是同一張表裡的兩欄,會是這個頁面所能做出最誤導人的一件事。
延遲是兩者至少能以相同單位討論的唯一領域,而且即便在那裡,但書也層層疊加。Cloudflare 回報 Clef 的中位數為 209.3 毫秒、p95 為 238.6 毫秒,是在其自家基礎設施上測得。Artificial Analysis 在推理配置下測得 12B 的首個分塊時間約為 2.4 秒,而該配置包含決策模型所沒有的思考預算。209 毫秒的非自迴歸傳遞對上 2.4 秒的生成啟動,是真正的架構差異——單次前向傳遞對比解碼迴圈——而這是 Clef 主張自己適用於熱路徑的最強論據。它同時也是個 27B 模型,需要 H200 等級硬體才能達到該數字,而 Cloudflare 代你運行它時,每百萬輸入 token 收費 0.24 美元。

64K 的上下文究竟能帶給你什麼
情境是這項比較變得實際的地方,也是通才在紙面上以大幅優勢勝出之處。
• Clef — 65,536 個 token,根據 Workers AI 模型頁面與發布文章;內建的編碼輔助工具預設為 max_length=16,384,這是預設值而非上限,但如果你使用隨附的載入器,這就是你會得到的預設值。
• Gemma 4 12B — 根據廠商規格卡,具備 256,000 個 token,並採用 1,024 個 token 的滑動視窗注意力,以降低長上下文成本。
• 圖像 — Clef 透過繼承的視覺編碼器,將圖像與影片幀連同文字狀態一起評分。Gemma 4 12B 則透過其無編碼器路徑處理文字、圖像、影片與音訊。
• 語言 — Clef 的卡片並未提出任何多語言方面的宣稱;Gemma 4 12B 的相關記載則涵蓋超過 140 種語言。
對工單、發票或渲染後的螢幕截圖來說,64K 很充裕,差異也只是學術上的。但對於你想逐欄位分類的 200 頁合約,這卻是整個爭論的核心:通用型模型能容納整份文件,決策模型卻不行。Clef 對此的解法是分塊,而在你對文件做出判斷之前就將它分塊,意味著你已經做了原本應該由模型做的決定。這是真正的限制,值得被明確指出為一項限制。
你實際會支付多少,以及在何處支付
這兩款型號都不在我們的目錄中,所以價格問題會分成三種情況。
• Clef — 在 Cloudflare 的 Workers AI 上,每百萬個輸入 token 收費 $0.24,或可從 Apache-2.0 授權的權重自行託管;Cloudflare 公布的延遲數據是在單張 H200 上以 torch 2.11 與 transformers 5.10.2 測得,而兩天內出現的社群量化版本顯示,它還能被壓縮得更小,代價是某些尚未有人量測過的準確度損失。
• Gemma 4 12B —— 這裡完全沒有託管路徑。你得自行取得約 24 GB 的 BF16 權重並自行部署服務,否則就得求助第三方平台。我們無法報出任何每 token 價格。
• 路由替代方案 — Gemma 4 26B A4B 是一款混合專家模型,總參數量 25.2B、活躍參數 3.8B,在 OrcaRouter 上的定價為每百萬輸入 token $0.06、每百萬輸出 token $0.33,並具備 262,144 個 token 的上下文長度。Gemma 4 31B 則是其密集多模態的兄弟型號,支援可配置的思考功能與原生函式呼叫,定價為 $0.13 與 $0.38。兩者皆使用同一把金鑰,供應商列表價格原樣透傳,不收取任何每 token 加價,並提供跨供應商的自動容錯移轉。
最後那句話,才是我們參與這項比較最誠實的說明。如果你需要的是一個能讀長篇文件、再寫出一句話的通用型模型,取得這種模型最便宜的路徑,就是我們實際有在提供的 Gemma 4 某個規模版本,而且它每百萬 token 的成本,比在租來的 GPU 上自行託管 12B 模型還低。如果你需要的是在熱路徑上做出有界決策,Clef 的 209 毫秒中位數是貨真價實的架構特性,而我們型錄中最接近這個特性的,是 TypeSafe 的 Jev 1.13——也就是 Cloudflare 拿來做基準測試、並從中複製其傳輸格式的那個模型——在 65,536 token 的上下文下,每百萬輸入 token 為 $0.042,並透過同樣的 POST /v1/systemone 形式提供。因為這兩者在一個薄轉接層之後即為 API 相容,所以拿 Clef 對上現行方案來試,是一項實驗,而不是一次遷移;而當兩邊都能透過同一個端點觸及時,這項實驗就能維持低成本。

這項決定,以決定本身來表述
當答案可列舉、狀態能容納於 64K、決策位於延遲敏感路徑上,且你願意自行負責殘餘類別時,就選擇 Clef。27B 在範圍外意圖偵測上的 97.4,正是你會選擇它而非 9B 同系列模型的原因;而它固定的輸出形狀,正是讓該元件無需解析器也能接受稽核的原因。
當輸入很長時、當模態是音訊或視訊時、當答案需要是成段文字時,或當類別尚不清楚時,就選 Gemma 4 12B——因為「把這堆東西分診成任何說得通的分組」是決策模型無法接受的請求,而不是它處理得不好的請求。它是有獨立評估支持的通用型模型,而對於開放式工作來說,這比廠商比較表更有價值。
而且,基於這篇文章不斷重複的理由,要對這兩組數字都抱持懷疑:Cloudflare 尚未在任何項目上被獨立重現,而那張卡本身就是供應商自己的基準表。這對當中唯一真正有趣的數字——27B schema head 是否真的能在它未受訓練的資料上維持其 97.4 的 out-of-scope 分數——正是兩家廠商都無法給出定論、而第三方可以的那個數字。
