一張生成的標題卡,標題為「Clef」,副標為「Cloudflare 從不寫出任何 token 的決策模型」,並附有兩個標籤,分別寫著「權重 2026年9月30日」與「部落格 2026年10月1日」。OrcaRouter 標誌合成於右下角。
Engineering & Research

Clef 故意複製 Jev 的 API——而這正是有趣之處

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Clef是 Cloudflare 推出的 270 億參數多模態模型,只回答有型別標註的問題,其他一概不做。你交給它一個狀態——文字、JSON、圖片、影片影格——再加上一份最多包含 64 個具名問題的結構定義,它就會在一次前向傳遞中回傳每個允許選項的機率。不生成文字、不需要解析器、沒有解碼迴圈。讓 Cloudflare/clef值得一讀的並不是那個設計(那是借來的),而是它選擇的傳輸格式:Cloudflare 打造 Clef 時,讓它能說 Jev System OneTypeSafe 最先推出的決策模型,服務於同一個 POST /v1/systemone 路徑的請求和回應主體語言。這裡的互通性就是整個商業論證。如果你的管線已經用那種形式向決策模型提問,那麼換用 Clef 只是改個 URL 和模型字串,而不是一次遷移。

一篇发布公告把这一点埋在不起眼处很不寻常,而Cloudflare并没有把它藏起来——模型卡直言该API“与Jev和SystemOne完全兼容”,博客开篇则把这一类别进入大众视野归功于TypeSafe,随后把Clef定位为一个内部实验的第二代版本。因此,对这次发布最诚实的解读包含三个部分:兼容性决策为你带来了什么;Cloudflare自己的数据如何说明Clef在哪些方面胜出、哪些方面落后;以及哪些内容仍未得到验证,因为表格中的每一个数字都由发布该模型的厂商自己给出。

這個類別來自其他地方

Cloudflare 的文章坦然談及其淵源。這種讓模型回傳有界結構化輸出、而非散文式文字的想法,歸功於 TypeSafe 的 Jev System One。Cloudflare 自身切入的途徑,是一個較早的示範:透過暴露 logprobs,把擴散模型拗成能輸出確定性機率;再加上 Matt Mastracci 的社群貢獻,讓推論引擎能處理這種模式。Clef 在此概念上更進一步,採用不同的主幹、專門打造的評分頭,以及——在商業上至關重要的部分——與現有領導廠商相符的請求主體。

當一家供應商既複製對手的傳輸格式,又拿對手的索引來為自己做基準測試時,相容性就不是這套模型的附註,而是產品策略。在既有的端點背後換掉決策模型,是新進者最省成本的試用方式,也是已經把這類系統接好的團隊最省成本的實驗。

實際推出了什麼,以及其代價為何

• 參數 — 27B,作法為凍結 Qwen3.8-27B 及其視覺編碼器,並在其上訓練一個聯合結構描述頭(joint schema head)以及 rank-256 低秩適配器。

• 同系列——Clef-Flash,與 Qwen3.5-9B 相同配方,但規模為 9B。獨立文章,各有取捨。

• 上下文 —— 根據 Workers AI 模型頁面與部落格文章,為 65,536 個 token。隨附的編碼輔助工具預設為 max_length=16,384,這是預設值而非上限,但若你直接使用隨附的載入器,這就是你會得到的預設值。

• 題型 — noul(是非題,回傳為真的機率)、選擇(2 至 26 個具名選項)、評分(2 至 26 個有序等級)。每個請求 1 至 64 題。

• 價格——在 Cloudflare 的 Workers AI 上,每百萬個輸入 token 為 0.24 美元;或使用 Apache-2.0 權重自行託管,這些權重約 55 GB,分散於十二個分片。

• 授權條款 — Apache 2.0,沿用 Qwen3.8-27B 基礎檢查點。

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

在哪些方面取勝,在哪些方面不取勝

Cloudflare 的 Decision Index 測試運行是本節所有內容的來源,而託管該排行榜的也是 Cloudflare。以下內容均未經獨立重現。請將其視為供應商最有利的說法,並留意它有多麼參差不齊。

勝出項目集中在一個自家訓練的分類器本應勝出的領域。Clef 在 BANKING77 意圖分類的 macro-F1 拿下 94.2,Jev 則為 79.7;在含範圍外處理的 CLINC150 上則是 97.4 對 89.3——這三十點的差距是整張表中最具決策相關性的一格,因為拒絕分類正是路由中最難的那一半。它也在 CRUXEval 拿下 86.7、CLadder 拿下 94.0,以及家電模擬器拿下 83.0。

這些劣勢同樣真實,也應放在同一段。在一般知識與困難推理方面,較舊的 Jev 完全勝出:GPQA Diamond 78.3 對 48.0,MMLU-Pro 82.7 對 65.9,BBH 92.9 對 73.7。那是表中三個最大的差距,而且全都指向同一方向。在安全領域的 PhishNChips 資料集上,Clef 在自己參與的比較中也不是最佳模型,它得分 79.6,而有個競爭項目得分更高。

在四項端到端工作流程評估中,這些評估取自 TypeSafe 自家的公開評估集,並根據共識標籤評分,兩者接近到如同擲硬幣般難分高下。Clef 在發票處理的精確動作上以 64.7 對 61.8 勝出,在安全事件集則以 62.9 對 61.7 勝出;Jev 在代理追蹤可觀測性上以 71.6 對 68.5 勝出;客戶服務則是 76.3 對 76.0 的平局,在那樣的差距下毫無意義。

延遲正是差距屬於結構性、而非邊際性的地方。Cloudflare 報告指出,Clef 的中位數為 209.3 ms、p95 為 238.6 ms,而 Jev 則是 524.1 與 536.0。這樣的排序源自非自迴歸設計,而不是基準測試的怪癖,因此這個數字最有可能在實際部署後依然成立。絕對毫秒數是在 Cloudflare 自家硬體上測得的,單看這些數字意義不大。

這次發布中最有說服力的資料點,並不是基準測試裡的某一行數據。Cloudflare 表示,其威脅情報團隊把一個網域連同其瀏覽器渲染服務交給 Clef,並在 2.2 秒內得到類別判定;相較之下,自家最快的通用 LLM 在同一工作流程上需要 4.7 秒,而且 Clef 回傳的分類更多。這是內部軼事,不是研究——但正是這類故事說明了,為什麼有人會打造這個,而不是直接向通用模型下提示。

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

API 參考文件告訴你的兩件事,以及它沒告訴你的一件事

這些已記錄的陷阱雖小,但在你移植任何東西之前值得一讀。這個信心度欄位衡量的是機率有多集中,而不是答案正確的機率——一個校準良好的模型可能回傳低信心度的正確答案,以及高信心度的錯誤答案。而當兩個選項同分時,答案會依模型的選項順序而定,所以請把你偏好的選項放在最前面。任何人在移植以提示為基礎的分類器時,若沒讀過這兩句話,都會誤讀自己的日誌。

更大的限制之所以沒有在任何地方被記載,是因為它屬於結構性的。Clef 完全沒有文字生成路徑,這意味著它無法擬回覆、摘要一個討論串、呼叫工具或進行對話,也不會自行發明你未宣告的類別。整體設計假設你能事先列舉出允許的答案。這默默排除了一大類問題,而再多的基準效能也無法改變這一點。

兼容性論證的價值何在

這正是這個版本不再只是模型審查,而變成架構問題的地方。如果 Clef 支援 Jev 的請求格式,那麼你決策端點背後的模型就只是一個設定值,而採用它的合理方式是多軌並行,而非直接取代——讓兩者同時跑你的實際流量,保留在你的資料上衡量表現較好的那一個,並讓切換維持低成本。

Clef 本身並不在我們的路由清單上;OrcaRouter 目錄對它回傳 404,而這裡的任何內容都不應被解讀為我們對其可用性的聲明。我們確實提供的是它當初被打造來取代的那個現任者。TypeSafe 的 Jev 1.13 是已列出的路由,在 65,536 個 token 的脈絡下,每百萬輸入 token 為 $0.042,並透過相同的POST /v1/systemone主體提供服務,因此兩者之間的 A/B 測試只是換一個模型字串,而不是重寫程式。將兩者放在同一把金鑰之後——200 多個模型,供應商定價原樣轉嫁、不收取每 token 加價,跨供應商自動容錯移轉——正是讓那項測試在某個人決定開始在意它之後的那一週仍能持續運作的原因,而不是衰變成設定檔裡一段過時的註解。你留著用來對決策模型所做出的任何結論採取行動的通用模型,可以從同一把金鑰取得,而不需要第二份合約。

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

什麼會改變這個讀數?

Cloudflare 以外的人需要重新執行 Decision Index。這個測試套件是公開的,而且這些評估被描述為可重現,因此第三方執行就是供應商表格與事實之間的差別——而最重要的那些儲存格,正是彼此指向相反方向的那些。在範圍外意圖偵測上拿到 97.4,緊鄰著 GPQA Diamond 上的 48.0,這不是一條平滑的能力曲線;它描述的是一個模型,非常擅長其訓練分布中的分類型態,卻在它未曾見過的推理上弱得多。如果這在獨立測試下仍成立,那就是關於 Clef 在營運上最重要的事實,而它並不在亮點之中。

生產環境的流量也必須和延遲表所呈現的一致。在一顆 H200 上測得的 209 毫秒中位數,並不能說明高併發下的 p95 表現,而這套設計的最大賣點,正是它位於熱路徑上。

而微調平台必須拿出實際成果。Cloudflare 的文章描述了一個 RL 迴圈——用 AI Gateway 從你自己的流量中擷取資料集,用 Workers AI 產生 rollout,用 Containers 作為評分沙箱,用 Trainer 更新權重,再重新部署到 Workers AI 上——而且就在宣布這些模型的同一篇文章裡,卻沒有附上任何客戶成果。一個經過微調的 Clef,若能在基礎模型從未受訓過的任務上勝過基礎模型,對這個品類而言,會比表格中的任何一列都來得更有說服力。

在這之前,公允的總結是這樣的:Cloudflare 發布了一個真實、採用寬鬆授權、確實快速的決策模型,並讓它能輕易地與最初推出的那個模型互換。這比大多數開源發布所提供的說法都更精彩,而且到目前為止,這仍然完全是廠商自己的說法。