「Clef vs Qwen3.8-27B — 1つのバックボーン、2つの出力契約」と書かれたタイトルカード。その下に2枚のカード:Clef、27B意思決定モデル、選択肢ごとに1つのロジット。およびQwen3.8-27B、27B dense VLM、トークンとツール呼び出し。
Guides & Insights

Clef vs Qwen3.8-27B:1つのバックボーン、2つの出力コントラクト

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Clefは文を書くことができないのに、それができるモデルから作られている。Cloudflare/clef は270億パラメータのマルチモーダル意思決定モデルだ。状態と型付き質問のスキーマを渡すと、散文のトークンを一切生成することなく、許可されたすべての選択肢について確率を返す。その土台となっているのはQwen3.8-27Bという、オープンウェイトの密な視覚言語モデルで、小さな追加ヘッドを付けたまま固定されている。そのためこれは、モデル対モデルの数少ないページの一つとなっている。そこでは両者はまったくライバルではなく、一方はチェックポイント、もう一方はその派生であり、55ギガバイトの重みを共有しながら、答えが読むものなのか、それとも計算に使うものなのかで意見を異にしている。

両方の重みは、発表の言葉より先に公開されていた。Cloudflare が Hugging Face 上で作成したのはCloudflare/clefリポジトリで、2026年9月30日 21:15 UTC、Apache-2.0 のもと、翌日の午後に発表記事——「Clef の紹介:オープンソースの意思決定モデルと、新たな RL ファインチューニングプラットフォーム」——を公開した。約18時間にわたって、55ギガバイトのモデルは、ベンダーがそれについて何も語らないまま、ダウンロード可能で Cloudflare 自身のエッジ GPU 上で動いていた。3日以内には Ollama 0.35.1 に続く Ollama ライブラリページができ——本稿がそれを見つけたのはそこだ——、さらに十数名の異なるアップローダーによる NVFP4、FP8、EXL3、INT8、Q4、Q8 ビルドも登場していた。

リポジトリから知り得ることは異常なほど完全であり、それを知り得ないことから切り分ける価値がある。知り得ること:アーキテクチャ、ベースチェックポイント、ライセンス、実行可能なリファレンス実装、そして完全な評価マトリクス。知り得ないこと:それらの数値のいずれかが、Cloudflare ではない人物による再実行に耐えるかどうか。以下で Clef に帰されるすべてのスコアは、ベンダーがホストするスイートをベンダー自身が実行した結果に由来する。独立使用の1か月の裏付けがあるモデルに対するこの非対称性こそが、この比較の正直な背骨であり、本稿の残りは、それが実際にどこで効いてくるかについてである。

並べて表示した2つのリポジトリ

まずダウンロードから始めよう。なぜなら、同じであること自体が要点だからだ。Clefのsafetensorsは、12個のシャードに分かれて合計54.97 GBになる。親モデルのsafetensorsは、18個のシャードに分かれて43.12 GBになる。ClefはQwen3.8-27Bの視覚エンコーダ——プロセッサ、ビジョンタワー、マルチモーダルフロントエンド全体——をそのまま保持しているので、小型化のために何も削られていない。Cloudflareが追加したのは256 MBのジョイントスキーマヘッドだ。4層、1、ワイド、16ヘッド、4,096幅のフィードフォワード、バックボーンの最終隠れ状態を読み取る2つのルーティング層からなる。学習レシピは、凍結されたバックボーン、そのヘッド、およびランク256の低ランクアダプタで、有効なスキーマ回答に対するラベルスムージング付きクロスエントロピーを、キャリブレーションを鋭くするためのBrier損失と対にしたものである。

次に、その相違は、モデルが出力することを許されている内容に完全にあります。

• パラメータ — Clef 27B。Qwen/Qwen3.8-27B から事後学習。Qwen3.8-27B は 27B の密モデルで、64 層、隠れ次元 5,120、語彙数 248,320 トークン、16 ×(3 × Gated DeltaNet → FFN)が Gated Attention と交互に配置されています。

• 出力 — Clef:許可された選択肢ごとに1ロジット、質問ごとにソフトマックス化、生成パスは一切なし。Qwen3.8-27B:トークン、ツール呼び出し、およびデフォルトで有効な推論ブロック。

• 質問の形式 — Clef はリクエストごとに1〜64個の型付き質問を3つの形式で受け取ります: noul(真である確率)、choice(2〜255個の名前付き選択肢)、score(2〜10段階の順序付きレベルで、それらの間の値になり得る確率加重値を返します)。Qwen3.8-27B にはそのような契約はなく、得られるのは文章であり、パーサーは自分で書くことになります。

• ライセンス — どちらも Apache-2.0。だからこそサードパーティによる量子化が週末で片付いた。

• 凍結された半分のコスト — Clefのヘッドは256 MBで、バックボーンは54.97 GB。ダウンロードのほぼ全体が親モデルです。すでにQwen3.8-27Bをディスク上に持っているなら、どう答えるかについて別の見解を得るために、それを二度目にダウンロードしていることになります。

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

見出しの再設定にかかるコストを、2つの数字で

Cloudflareの評価は、社内で実行されたDecision Index 0.2.1スイートであり、意思決定モデルに関する表です — 6つの列:Clef、Clef-flash、Jev、DiffusionGemma Jev、Kev 9B、Laya。Qwen3.8-27Bにはその中に行がなく、ClefはArtificial Analysis Intelligence Indexに行がありません。したがって、共通のスコアボードは存在せず、本稿はそれをでっち上げたりしません。

とはいえ、双方が受けさせられたベンチマークが一つあり、その差は今回のリリースで最も意思決定に関わる数値と言えるほど大きい。GPQA Diamond——大学院レベルの科学問題、多肢選択——において、Cloudflare は Clef を48.0と測定している。親モデルは90.5を Artificial Analysis のハーネスで記録し、89.2をベンダー自身のモデルカードで記録している。これは一般知識における40ポイントの断崖であり、謎ではない。Clef は与えられた固定の選択肢のセットを採点して答えるのであり、一般知識の多肢選択は、同じ重みを向ける先として「このチケットをルーティングせよ」から最も遠いものだ。この比較は統制されたものではなく参考程度に捉えるべきだ——ハーネスが二つ、ラボが二つ、どちらもベンダーのものでもトラッカーのものでもない。しかし方向性は疑いようがなく、それがこの契約の代償なのだ。

同じパターンは、Clefの汎用セルの残りにも表れている。MMLU-Pro 65.9、BBH 73.7、スコープ外処理を含むCLINC150は27Bで97.4、対するJevは89.3——この最後のセルは、派生モデルが旧来の判断モデルを完全に上回る珍しい例であり、分類を拒否することがルーティングの難しい半分を占めるだけに重要な意味を持つ。Clefが強いのは、内製学習の分類器がまさに強くあるべき領域だ。BANKING77の意図分類マクロF1は94.2、BFCLのケース完全一致は98.5、API-Bankは91.9。弱いところでは、競合ラボのテキスト専用判断モデル——TypeSafeのJev——がGPQA Diamondで30ポイント上回り、しかも当社自身のカタログでは100万入力トークンあたり0.042ドルを請求している。これは「27B」それ自体は論拠にならないという有益な戒めだ。

親が保持しているのは、Decision Index が問い合わせないものすべてだ。それ自身のカード上および AA 由来の当社カタログでは、Terminal-Bench 2.0 が 73.0、SWE-bench Pro 61.7、LiveCodeBench v6 90.3、OSWorld-Verified 84.3、DeepSWE 1.1 が 42.2、AA Coding 68.1 がサンプリングされた 138 モデル中の順位。それらのどれにも Clef の行はない。Clef はそれらを試すことができないからだ。それにはツール呼び出しの経路も、長期的な計画も、何かを出力する手段もない。

一つの決断が何を犠牲にするか、そしてなぜ出力行が議論のすべてなのか

Workers AI のモデルページには、Clef の単価がちょうど 1 つだけ記載されています:100万入力トークンあたり$0.24。出力の行はなく、その理由は応答の中にあります。Ollama 自身が文書化している例——3 つの質問に振り分けられたサポートチケット——は、次のものを返します:"usage": {"input_tokens": 1204, "output_tokens": 3}3 つの質問に対して出力トークンは 3 つ。Cloudflare がその 3 つのトークンに課金するかどうかは、ほとんど重要ではありません。意思決定の出力コストは料金ではなく、質問の数なのです。

それを、自社カタログにある親モデルの料金表と照らし合わせると、100万入力トークンあたり$0.33、100万出力トークンあたり$2.40で、262,144トークンのウィンドウを備えています。同じ1,204トークンの状態、同じ単一のルーティング判断:

• Clef — 1,204入力トークンは100万あたり$0.24で約1判断あたり$0.00029、100万判断あたり約$289となる。この数値は答えが難しくなってもほとんど変わらず、状態が長くなったときにだけ動く。

• 思考を無効にしたQwen3.8-27B — 同じ状態では、入力が約$0.00040、さらに出力トークンがおよそ10個で100万トークンあたり$2.40かかる。これを$0.00042、つまり100万トークンあたり$421と呼ぼう。Clefは約1.5×安いが、それは誰も語っていない話だ。

• Qwen3.8-27B、thinking を有効にしたまま使用 — これがこのチェックポイントでのデフォルトです。モデルが、パスワードリセットのメールが4つのバケットのどれに属するかを推論するのに400トークン費やすと、さらに $0.00096 かかり、その判定は$0.0014近く、つまり100万件あたり $1,357 になります。この400トークンは実測値ではなく仮定であり、倍率はそれに比例して線形に変化します。

価格論の正直なバージョンは、一見したよりも狭い。思考をオフにして実行する汎用モデルに対しては、Clef は金額で約1.5倍の差をつけて勝つ——現実的ではあるが、変革的ではない。同じモデルのデフォルト設定に対しては、差は冗長性の関数であり、冗長性こそが言語モデルが持ち、scorers-over-options 設計がまったく持たないものである。それが構造的な主張だ。Clef のコストは状態の長さによって制約され、親のコストは親がどれだけ言うことを決めるかによって制約される。

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

唯一近くない数字

Cloudflareは、Clefについてリクエストレイテンシの中央値が209.3 ms、p95が238.6 msだと報告している。これは同社の実行における43のベンチマーク全体にわたり、同社自身のエッジGPU上で測定されたものだ。Cloudflareの外部でこれを再現した者はいない。そして、この数値がこれほど低いのはベンダーのインフラストラクチャが理由である——このモデルは、呼び出し元と同じネットワーク上に配置されるよう設計されている。

親モデルについては、私たちはベンダーが公表する数値よりも良い形で示せる。それは私たちのルートの一つだからだ。2026年10月2日までの7日間において、OrcaRouter自身のプレイグラウンドは、Qwen3.8-27Bをp50 1,929 ms、毎秒235.8出力トークンで、この期間の1億3,630万トークンのトラフィックを対象に測定した。興味深いのは日次系列だ。p95は7日中6日でちょうど10,000 msに位置しており、これは測定値というより上限のように読める。またp50は日によって1,751 msから4,296 msの間で変動する。中央値はClefのおおよそ9倍とみなし、実際の分布が誰かによって公開されるまでは、テールを情報量がないものとして扱うこと。

その差はチューニングの違いではなく、埋まることもない。プリフィルのみのパスと並列スコアリングヘッドの組み合わせは一巡で完了するが、自己回帰モデルは話すことがなくなったときに終わる。Clef に関するベンダー公表の絶対値には、いつもの割引を適用すべきだが、この順序はアーキテクチャの性質であり、Cloudflare のハードウェアの性質ではない。

そのうちの1つについては、文脈が3通りに引用されている

どちらのモデルもテキスト、JSON、画像、動画を扱えます。ウィンドウは同じではなく、一方についてはどこを見るかによって記載される数値が一致しません。

• Clef、ホスト型 — 65,536トークン、Workers AIのモデルページと発表記事によると。これがAPI呼び出し元を縛る数値であり、Cloudflare自身の説明は比較によるものだ:Jevの32Kウィンドウが保持する状態の2倍である。

• Clef、ディスク上 — リリースされた config.json は宣言しています:max_position_embeddings は 262,144 です。なぜなら、凍結されたバックボーンは親のものであり、依然として親の位置上限を引き継いでいるからです。同梱の encode_record ヘルパーはデフォルトで max_length=16,384 を使用します。また、max_state_tokens が状態を別途制限するために利用できます。これらの3つの数値はどれも間違っていません。それぞれ異なる問いに答えており、256K を宣伝するランタイム一覧はエンドポイントではなく設定を読んでいるのです。

• Qwen3.8-27B — ネイティブで262,144、適切なサービング構成により1,000,000まで拡張可能(ベンダーのカードおよび当社カタログの行による)。少なくともホスト型Clefウィンドウの4倍。

実用的な帰結は、その比率が示唆するほど大きくはない。Clefが消費するのは状態——チケット、請求書、スクリーンショット——であって会話ではなく、その売りの一つは、大きなフラット化されたペイロードを渡し、質問ごとにペイロードのコストを再度支払うことなく、それについて64の質問をできることにある。親にはウィンドウが必要だ。履歴、ツールの結果、そして自身の推論を保持しなければならないからだ。要件が違えば、上限も違う。

両方とも同じピクセルを見ている

ビジョンエンコーダは継承されているため、一方のモデルがマルチモーダルで、もう一方がそうではないという話ではない。Clefは1リクエストにつき最大4枚の画像を、base64でエンコードされたPNG、JPEG、WebPで受け付け、これらはペイロード内のすべての質問で共有され、動画フレームはフレーム配列として追加できる。カード内のレシートの例では、合計金額が判読可能かどうかを尋ねるはい/いいえ形式の質問をしており、これはこの設計を縮図にしたものだ。Qwen3.8-27Bはネイティブな視覚言語モデルで、ベンダーのカードではOmniDocBench 1.5が91.1、RealWorldQAが85.9、CharXivが78.8となっている。

異なるのは、返ってくるものだ。Clef は、確率が付随したフィールドごとの判定を返す。これは文書に関する型付きの回答だ。親は文書の説明を返し、それをあなたが解析する。多くの種類の文書作業——このフォームを確認する、この条項を探す、この合計がしきい値を超えているか——では、型付きの回答が作業そのものであり、説明は支払ってから捨てるオーバーヘッドにすぎない。

実際の線引きはどこにあるのか

• Clef を使う — 回答は事前に列挙可能で、パーサーを書きたくない場合。ルーティング、トリアージ、ゲーティング、ポリシーチェック、文書フィールド抽出。閉集合、質問あたり2~255個の選択肢、最大64問をまとめてスコアリング。

• Clef を採用する — 判断はホットパス上にあり、1,929 ms に対する 209 ms はパイプラインで何ができるかを変える。これが移行すべき唯一最も強い理由であり、それは精度ではなくレイテンシの理由である。

• Clef を採用しよう — 決定性が欲しいのだから。宣言していないオプションが戻ってくることはない。なぜなら、それを生成するステップが存在しないからだ。

• Qwen3.8-27B をキープ — 答えはリストから選ぶものではない。要約、下書き、未知の問題の推論、コードの記述、長期的なホライズンにわたるツール操作。Clef にはそのいずれもできず、そうとは教えてくれない。

• Qwen3.8-27B は残しておく — 「どれでもない」とモデルに言わせる必要があるから。決定モデルは、与えられた選択肢を採点する。請求/技術/営業のスキーマとプライバシーに関する問い合わせを渡せば、拒否ではなく、その3つのうち最もマシなものを返してくる。親は、あなたが思いつかなかった問いを浮かび上がらせる。

• Qwen3.8-27B を維持 — コンテキストや長文ドキュメント作業向け。100万トークン拡張前で、ホスト版ウィンドウの4倍。

そのリストは判定ではなくパイプラインとして読むべきだ。なぜなら、実際にそうなのだから。このアーキテクチャはその関係を文字どおりのものにしている。Clef は親モデルのprefillパスに、末尾で異なる回答メカニズムを付けたものだ。まともな設計ではClefを前面に置き——ルート、優先度、エスカレーションフラグを決め——Qwen3.8-27Bをその背後に置いてその決定を実行させる。両者は相補的な関係にあり、たまたま同じダウンロードを共有しているだけだ。

それぞれをどこで実行するか

Clef は上記の入力100万あたり $0.24 という価格で Cloudflare の Workers AI 上にホストされており、Apache-2.0 の重みはローカルで自由に実行できます。Ollama ライブラリへの掲載は最新のサーフェスです:ollama pull clef には Ollama 0.35.1 以降が必要です。というのも、このモデルは /v1/systemone エンドポイントを通じて応答するからです。これは Ollama が意思決定モデル向けに追加したものです。見出しではなくタグに注目してください — デフォルトおよび clef:27b タグは 18 GB で、これは 55 ギガバイトモデルの 4 ビットビルドです;clef:27b-q8_0 は 30 GB、clef:27b-nvfp4 は 18 GB、clef:27b-mxfp8 は 31 GB、そして clef:27b-mlx-bf16 は Apple silicon 向けのフル 55 GB です。TypeSafe 自身の Python SDK は、ローカルの Ollama を指定して任意の API キーを渡せばこれと通信します(そのキーはランタイムには無視されます)。本番環境で痛い目を見る注意点が 1 つあります:confidence は確率がどれだけ集中しているかを測るものであって、答えが正しい確率ではありません。また、同点の場合は宣言した選択肢の順序で解決されます。

親モデルのほうが、今日では API の背後に置くのが簡単です。Qwen3.8-27B は OrcaRouter 上で、上記で使用した 100 万トークンあたり $0.33 と $2.40 の料金でルーティング可能で、262,144 トークンのウィンドウを備えており、単一の OpenAI 互換キーでアクセスできる 200 以上のモデルの 1 つです。プロバイダーの定価は 0% のマークアップでパススルーされるため、この比較のどちらかのベンダーによる値下げも、それが実施された当日に当社のルートで有効になります。

Clef自体は当社のルートのひとつではありません——当社の公開カタログには何も返ってきませんし、ここにある記述は当社による可用性の主張として読まれるべきものではありません。当社が実際に提供しているのは、Cloudflareアカウントなしでこの意思決定パターンに到達可能にするモデルです。TypeSafeのJev 1.13は、100万入力トークンあたり$0.042で掲載されているルートで、コンテキストは65,536トークン、同一の7日間ウィンドウにおけるp50は148 msと測定されており、まったく同じPOST /v1/systemoneリクエスト形式に対応しています。Clefは意図的にJevとAPI互換であるため、どちらかに対して構築されたパイプラインは、もう一方へ設定を変えるだけで移行できます——これはまさに、ルーティングレイヤーが無償化するために存在するケースです。両方を到達可能に保ち、自社のラベルで測定し、勝者をアーキテクチャ上のコミットメントではなくひとつのデータポイントとしましょう。意思決定モデルがエージェントをゲートすることになった場合、その意思決定に基づいて行動するモデルも依然として到達可能でなければならず、その半分はすでに同じキーの背後にあります。

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

何がこの読みを変えるだろうか

3つのこと。それがどれだけ動かすかの昇順で。

第三者が Decision Index を再実行する必要がある。このスイートは公開されており、Cloudflare は評価を再現可能と説明しているので、これは達成可能だ — そして CLINC150 の out-of-scope セルが注目すべきものだ。なぜなら 27B の 97.4 は、ルーティングの最も難しい半分における Jev の 89.3 に対する真の優位性か、自社製ハーネスの人為的産物のどちらかだからだ。Cloudflare の外部では、まだ誰も知らない。

誰かが、同じ分類タスクで同じラベルを使ってClefとQwen3.8-27Bを評価する必要がある。それだけが、再ヘッド化が閉集合の判断にとって品質のトレードオフなのか、それとも品質のアップグレードなのかを決着させる唯一の比較であり、どちらのベンダーにもそれを実行するインセンティブはない。それまでは、40ポイントのGPQAギャップが、何が取り除かれたかについて利用可能な最良の証拠であり続けるが、それは間違ったタスクに関する証拠だ。

さらに、Clef のレイテンシは同時実行下で p95 を満たす必要がある。209 ms という中央値は、ベンダーが管理するハードウェア上で、ホットパスに位置することこそが売りのすべてであるモデルについて、ベンダー自身によって測定されたものだ。自己回帰型の親モデルに対する順序関係はアーキテクチャに由来するもので、これからも維持される。疑うべきは絶対的なミリ秒数であり、ビジネスケース全体が依拠しているのもまさにその数値なのだ。

Qwen3.8-27Bは、単一のOpenAI互換キーでアクセスできる200を超えるモデルの1つです——Qwen3.8-27B。