生成されたタイトルカードには「Clef vs Gemma 4 12B」と表示され、サブタイトルは「64Kトークンの意思決定モデル vs 256Kトークンの汎用モデル」、チップには「65,536 vs 256,000 コンテキスト」と「確率 vs 散文」と表示される。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

Clef 対 Gemma 4 12B:64Kトークンの意思決定用アプライアンス 対 256Kトークンの汎用モデル

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

両者を比較するうえで最も役立つ数字はClefとGemma 4 12Bのベンチマークスコアではありません。それは 65,536 対 256,000 —— コンテキストウィンドウです。Cloudflare/clefは、Qwen3.8-27B からポストトレーニングされた 270 億パラメータのマルチモーダル意思決定モデルで、状態と型付き質問のスキーマを読み取り、単一の非自己回帰パスで許容されるすべての回答に対する確率を返します。Gemma 4 12B —— 統合チェックポイント、google/gemma-4-12B-it —— は、2026 年夏にリリースされたベンダーの 119.5 億パラメータのエンコーダ不要な any-to-any モデルで、256,000 トークンのウィンドウにわたり 140 以上の言語でテキストを生成します。両者に契約書のフォルダーを渡すと、意思決定モデルのほうが 4 倍早く容量を使い果たします。その上限が仕様上 65,536 トークンであるのに対し、汎用モデルの上限は 256,000 トークンだからです。この非対称性は脚注にとどまる話ではありません。ルーティング業務のあるカテゴリ —— 長い文書、貼り付けられたスレッド、複数ページのフォーム —— では、精度が議論される前にどちらを選ぶかを決めてしまうのです。

つまり、これはどちらのモデルが優れているかについてのページではない。本当に両者が異なる2つの軸、すなわちそれぞれが保持できる状態の量と、それぞれが物理的に生成できる答えの形についてのページだ。それ以外はすべて、誰も再現していないベンダーの数値か、見た目どおりの意味を持たない比較のどちらかである。

それぞれが何なのかを、それぞれ1段落で

Clef は Cloudflare の 27B 意思決定モデルで、Apache-2.0 のもとで公開されており、重みは Hugging Face に、ホスト型エンドポイントは Workers AI にあります。Cloudflare は Qwen3.8-27B バックボーンをビジョンエンコーダーごと凍結し、ジョイントスキーマヘッドとランク 256 の低ランクアダプターを接続し、有効なスキーマ回答に対するラベルスムージング付きクロスエントロピーと、キャリブレーションを鋭くするための Brier 損失を併用して学習させました。state — テキスト、JSON、画像、動画フレーム — と、1~64 個の名前付き質問を指定します。各質問の型は noul(true/false、true の確率を返す)、choice(2~26 個の名前付き選択肢)、または score(2~26 段階の順序付きレベル)です。返ってくるのは質問ごとの分布だけで、それ以外はありません。テキスト生成の経路はまったく存在しません。

Gemma 4 12B はテキストを生成する汎用モデルです。エンコーダーフリーであり、独立した視覚や音声のタワーではなく、生の画像パッチと波形が軽量な線形層を通じて言語モデルの埋め込み空間へ直接射影されます。これにより、モダリティごとのパイプラインなしで、テキスト、画像、動画、音声を扱えます。設定可能な思考モード、ネイティブの関数呼び出し、262K 語彙、そして 1,024 トークンのスライディングウィンドウ注意と完全なグローバル注意を交互に組み合わせるハイブリッド注意方式を備えています。Apache-2.0 で、併せてベンダー独自の利用条件も付属しており、「このサイズをローカルで動かす」と言うときにほとんどの人が指すチェックポイントです。

先へ進む前に、はっきり述べておくべきことが一つあります。どちらのモデルも OrcaRouter 上のルートではありません。当社のカタログは cloudflare/clef および同ファミリーの 12B チェックポイントに対して 404 を返しますし、本記事のいかなる記述も、当社による提供可否の主張として読まれるべきではありません。Gemma ファミリーから当社が実際に取り扱っているのはより大型の 2 サイズで、その価格は下の方に記載されています。

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

オプションリストはインターフェースであり、それには故障モードがある

これら2つの構造上の違いは、当てはまらない入力に対して何が起こるかという点にある。

• 出力 — Clef は宣言された選択肢ごとに確率を返し、それらの選択肢のみを返します。Gemma 4 12B は生成されたテキストを返します。

• 拒否 — Clefには、自分で基準に書き込まない限り「該当なし」という選択肢がありません。Gemma 4 12Bは、あなたが尋ねたことのどれにも当てはまらないケースを記述することができます。

• 故障モード — Clef のエラーは静かです。スキーマ内での自信に満ちた選択で、例外も発生せず、フォールバック分岐も作動しません。汎用モデルのエラーはたいてい派手です。解析できない散文になります。

• テスト容易性 — 固定されたオプションセットはコンポーネントを再現可能にし、監査を低コストにします。自由入力テキストは柔軟性をもたらしますが、検証にはコストがかかります。

その拒否問題に関するClef自身の数値は、同社が公表している中で最も弱い数字だ。スコープ外処理を伴うCLINC150——「これはどのカテゴリにも属さない」が有効な答えの一つとなる意図検出——において、27BはマクロF1で97.4を記録する。これはCloudflareの表で最高値であり、同じベンチマークで66.8を出す9Bの兄弟モデルではなく27Bに注目すべき理由でもある。同じレシピで作られた2つのモデルの間に30ポイントの差があるということは、スコープ外の挙動こそがポストトレーニングのスケールによって得られるものであり、多くのルーティングパイプラインが密かに依存しているものだということだ。Cloudflareが文書化している緩和策は、スキーマに2つ目の質問を加えること——状態がそもそも当てはまるかどうかを尋ねるnoulフィールドを追加し、それにしきい値を設ける——であり、これは機能するし、モデルではなくあなたの仕事である。

数字が何を語るかよりも、その数字がどこから来たかの方が重要だ

この記事にあるすべてのClefの数値はCloudflareに由来する。同社のモデルカード、ローンチ投稿、またはDecision Indexの実行結果である。スイート自体はCloudflare自身のものであり、スコアを掲載するリーダーボードもCloudflare自身のものである。つまり、これはサプライヤーが、自ら管理するハードウェア上で自社製品を、APIを意図的に模倣した競合他社と比較して測定しているということだ。第三者がこれを再現したことはなく、本稿もそうでないふりをするつもりはない。

Gemma 4 12Bの列は、別種の証拠である。ベンダー自身のカードは、MMLU Pro 77.2%、GPQA Diamond 78.8%、ツールなしのAIME 2026で77.5%、LiveCodeBench v6で72.0%を公表している。独立系トラッカーのArtificial Analysisは、その推論構成をインテリジェンス指数14.18と評価しており、100万トークンあたり$0.10 / $0.30という記載と、測定された中央値出力速度が毎秒約113トークンであることを示している。そして、そのページ自体が、これらの数値はワークロードとハードウェアに依存すると注記している。

正直に読み取れば、この2つの列はまったく比較できるものではない。一方はベンダーが実施するベンダーの意思決定品質スイートであり、もう一方はベンダーのベンチマークと、汎用モデルに対する独立評価を混ぜ合わせたものである。97.4を77.2の隣に、まるで同じ表の列であるかのように並べて引用することは、このページがなしうる最も誤解を招く行為だろう。

レイテンシは、少なくとも両者を同じ単位で論じられる唯一の領域であり、そこでさえ注意点が山積する。Cloudflareは自社インフラ上で測定したClefの中央値を209.3 ms、p95を238.6 msと報告している。Artificial Analysisは、推論構成における12Bの最初のチャンクまでの時間を約2.4秒と測定している。これには、意思決定モデルにはない思考予算が含まれる。209 msの非自己回帰パス対2.4秒の生成開始は、実際のアーキテクチャ上の違いであり——1回のフォワードパス対デコーディングループ——、Clefがホットパスに対して持つ最強の論拠である。また、27Bでは、その数値を達成するためにH200クラスのハードウェアを必要とするモデルでもあり、Cloudflareはそれを代わりに実行するのに100万入力トークンあたり0.24ドルを課金する。

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

64Kのコンテキストが実際にもたらすもの

文脈こそ、この比較が実用的になる場面であり、ジェネラリストが紙の上では大差で勝つ場面である。

• Clef — Workers AI のモデルページとローンチ記事によると 65,536 トークン。同梱のエンコーディングヘルパーはデフォルトで max_length=16,384 に設定されています。これは上限ではなくデフォルト値にすぎませんが、ローダーを出荷時のまま使うとこのデフォルト値が適用されます。

• Gemma 4 12B — ベンダーの仕様カードによると256,000トークンで、長文コンテキストのコストを抑えるために1,024トークンのスライディングウィンドウアテンションを採用。

• 画像 — Clef は、継承されたビジョンエンコーダを通じて、画像と動画フレームをテキスト状態と一緒にスコアリングします。Gemma 4 12B は、エンコーダフリーのパスを通じてテキスト、画像、動画、音声を処理します。

• 言語対応 — Clefのスペック表には多言語対応の記載はありませんが、Gemma 4 12Bは140以上の言語で文書化されています。

チケットや請求書、レンダリングされたスクリーンショットなら、64Kは十分すぎるほどで、その差は理論上のものにすぎない。200ページの契約書をフィールド単位で分類したいとなれば、そこが議論のすべてになる。汎用モデルなら文書全体を保持できるが、意思決定モデルにはそれができない。これに対するClefの答えはチャンキングだが、文書について判断する前にチャンキングするということは、本来モデルが下すはずだった判断をすでに下してしまっているということだ。これは実際の限界であり、限界として明言されるに値する。

実際に支払う金額と、その支払先

どちらのモデルも当社のカタログには載っていないため、価格の話は3通りに分かれます。

• Clef — Cloudflare の Workers AI では入力トークン 100 万あたり $0.24、または Apache-2.0 の重みからセルフホスト可能。Cloudflare が公開したレイテンシは、torch 2.11 と transformers 5.10.2 を備えた単一の H200 上で測定されたもので、2 日以内に登場したコミュニティによる量子化は、誰も測定していない精度コストと引き換えに、さらに小さくできることを示唆している。

• Gemma 4 12B — ここにはホスト型の提供経路が一切ありません。約24 GBのBF16ウェイトを自分で取得して自身でサービングするか、サードパーティのプラットフォームに頼ることになります。当社が提示できるトークン単位の価格は存在しません。

• ルーティングされた代替モデル — Gemma 4 26B A4B は、合計 25.2B、アクティブ 3.8B のパラメータを持つ Mixture-of-Experts で、OrcaRouter 上では入力 100 万トークンあたり $0.06、出力 100 万トークンあたり $0.33、コンテキスト 262,144 トークンで提供されています。構成可能な思考とネイティブな関数呼び出しを備えた密なマルチモーダルの兄弟モデルである Gemma 4 31B は、$0.13 と $0.38 で提供されています。どちらも 1 つのキーでプロバイダー定価をトークンあたりのマークアップなしでそのまま適用とプロバイダー間の自動フェイルオーバーが利用できます。

この最後の一行は、この比較における当社の関与を正直に述べたものです。必要なのが、長い文書を読んで一文を書き出す汎用モデルであれば、それを安く手に入れる道は、当社が実際に提供している Gemma 4 のサイズのものであり、レンタル GPU 上で 12B をセルフホストするよりも 100 万トークンあたりのコストが低く済みます。必要なのがホットパスにおける境界の定まった判断であれば、Clef の中央値 209 ms はれっきとしたアーキテクチャ上の特性であり、当社のカタログでそれに最も近いのは TypeSafe の Jev 1.13 —— Cloudflare がベンチマークで比較し、ワイヤフォーマットをそのままコピーしたモデル —— で、65,536 トークンのコンテキストで 100 万入力トークンあたり $0.042、同じPOST /v1/systemoneという形式で提供されます。両者は薄いアダプターの背後で API 互換であるため、Clef を既存のものに対して試すのは移行ではなく実験であり、双方に単一のエンドポイントから到達できるなら、その実験は安価なままです。

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

決定として述べられた決定

回答が列挙可能で、状態が64Kに収まり、判断がレイテンシに敏感な経路にあり、残余クラスを自分で引き受ける覚悟があるなら、Clefを選べ。27Bのスコープ外意図検出における97.4は、9Bの兄弟モデルではなくこちらに対価を払う理由であり、その固定された出力形状が、パーサーなしでコンポーネントを監査可能にしている。

入力が長いとき、モダリティが音声または動画のとき、回答を散文で書く必要があるとき、あるいはカテゴリがまだわからないときは、Gemma 4 12B を選びましょう。なぜなら、「この山を、意味の通る任意のグループに振り分けて」というのは、決定モデルが受け入れられない要求であり、処理が苦手な要求ではないからです。Gemma 4 12B は独立した評価に裏打ちされた汎用モデルであり、オープンエンドな作業においては、そのことがベンダーの比較表よりも価値を持ちます。

そして、この記事が繰り返し述べている理由から、両方の数値セットには懐疑的になるべきだ。Cloudflare はどの点についても独立に再現されていないし、そのカードはベンダー自身のベンチマーク表にすぎない。その2つのうち本当に興味深い唯一の数字——27B のスキーマヘッドが、学習に使っていないデータに対して本当にその 97.4 という範囲外スコアを保つのかどうか——は、まさにどちらのベンダーにも決着をつけられず、第三者ならつけられる数字だ。