生成されたタイトルカードには「Clef」と表示され、サブタイトルは「トークンを一切書き出さないCloudflareの意思決定モデル」。2つのチップには「weights 2026年9月30日」と「blog 2026年10月1日」と記されている。右下隅にはOrcaRouterのロゴが合成されている。
Engineering & Research

Clefは意図的にJev's APIをコピーしている——そしてそこが興味深い点だ

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Clefは、Cloudflareによる270億パラメータのマルチモーダルモデルで、型付きの質問に答えるだけで、それ以外は何もしません。テキスト、JSON、画像、動画フレームといった状態と、最大64個の名前付き質問のスキーマを渡すと、1回のフォワードパスで、許可されたすべての選択肢に対する確率を返します。生成テキストも、パーサーも、デコーディングループもありません。何がCloudflare/clefを読むに値するのかというと、借用したその設計ではなく、選んだワイヤフォーマットです。CloudflareはClefを、Jev System One、TypeSafeが最初に出荷した意思決定モデルであり、同じPOST /v1/systemoneパスで提供されている同モデルのリクエストボディとレスポンスボディを話すように作りました。ここでの相互運用性が、商業的な主張のすべてです。既存のパイプラインがすでにその形で意思決定モデルに質問しているなら、ClefはURLの変更とモデル文字列だけで済み、移行ではありません。

リリース記事がそれを埋もれさせるのは異例なことだが、Cloudflareはそれを埋もれさせていない。モデルカードは、APIが「JevおよびSystemOneと完全に互換性がある」と明確に述べており、ブログは、TypeSafeがこのカテゴリを世に知らしめたことを称えるところから始まり、そのうえでClefを社内実験の第2世代版として位置づけている。したがって、このリリースを正直に読み解くと3つの部分がある。互換性の判断が何をもたらすか、Cloudflare自身の数字がClefの勝ち負けについて何を示しているか、そしてあの表のすべての数値がモデルを提供するベンダーによって作られたため、何が未検証のままか、である。

このカテゴリはどこか別の場所から来ました

Cloudflareの投稿はその系譜について率直だ。散文ではなく、境界のある構造化出力を返すモデルというアイデアは、TypeSafeのJev System Oneに帰される。Cloudflare自身の参入経路は、logprobsを公開することで拡散モデルを決定論的な確率を出力するように曲げた初期のデモと、推論エンジンがそのパターンを扱えるようにするMatt Mastracciによるコミュニティ作業だった。Clefは、異なるバックボーン、目的特化のスコアリングヘッド、そして——商業的に重要な部分——既存事業者のものと一致するリクエストボディによって、そのコンセプトを基に構築されている。

ベンダーが競合のワイヤーフォーマットをそのままコピーし、さらにその競合のインデックスに対して自社をベンチマークしている場合、その互換性はモデルにとっての脚注ではなく、製品戦略そのものである。既存のエンドポイントの背後にある意思決定モデルを差し替えることは、新規参入者が試用されるための最も安価な方法であり、すでにこうしたものを1つ接続済みにしているチームにとっては最も安価な実験でもある。

実際に出荷されたもの、そしてそのコスト

• パラメータ — 27B。Qwen3.8-27B をビジョンエンコーダごと凍結し、その上に統合スキーマヘッドとランク256の低ランクアダプタを学習させることで構築。

• 姉妹モデル — Qwen3.5-9Bから9Bで同じレシピを用いたClef-Flash。別記事、別のトレードオフ。

• コンテキスト — Workers AIのモデルページおよびブログ記事によると、65,536トークンです。同梱のエンコーディングヘルパーはデフォルトでmax_length=16,384となっており、これは上限ではなくデフォルト値ですが、ローダーをそのままの状態で使用した場合に適用されるデフォルトです。

• 質問タイプ — noul(true/false、trueの確率を返す)、choice(2〜26個の名前付きオプション)、score(2〜26個の順序付きレベル)。1リクエストにつき1〜64問。

• 価格 — CloudflareのWorkers AIでは入力トークン100万あたり$0.24、または12個のシャードに分かれた約55 GBのApache-2.0ライセンスの重みを使用したセルフホストも可能です。

• ライセンス — Apache 2.0、Qwen3.8-27B ベースチェックポイントに準拠。

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

それが勝つところと、そうでないところ

CloudflareによるDecision Indexの実行がこのセクションのすべての情報源であり、それをホストしているリーダーボードもCloudflareのものです。以下の内容はどれも独立に再現されていません。これは供給側のベストケースとして読み、それがいかに不均一であるかに注目してください。

自社訓練の分類器が勝つべき勝利群だ。ClefはBANKING77意図マクロF1で94.2を記録し、Jevの79.7を抑え、スコープ外処理を含むCLINC150では97.4対89.3——この30ポイント差は表の中で最も意思決定に重要なセルである。なぜなら、分類を拒否することこそがルーティングの難しい半分だからだ。またCRUXEvalでは86.7、CLadderでは94.0、家電シミュレーターでは83.0を獲得している。

損失も同じくらい現実的で、同じ段落に含めるべきだ。一般知識と難度の高い推論では、旧型のJevが完全に勝利する。GPQA Diamondは78.3対48.0、MMLU-Proは82.7対65.9、BBHは92.9対73.7だ。これらは表の中で最大の3つの差であり、いずれも同じ方向を示している。Clefもまた、セキュリティ分野のPhishNChipsセットにおける自身の比較で最良のモデルではなく、そこで79.6にとどまり、競合エントリの方が高いスコアを出している。

TypeSafe自身の公開評価セットから抽出し、コンセンサスラベルに照らして採点した4つのエンドツーエンドのワークフロー評価では、両者はコイントスと言えるほど接戦だ。Clefは請求書処理の正確なアクションで64.7対61.8、セキュリティインシデントのセットで62.9対61.7と上回り、Jevはエージェントトレースの可観測性で71.6対68.5と上回る。カスタマーサービスは76.3対76.0の引き分けで、その差では何の意味もない。

レイテンシーは、差がわずかではなく構造的になる領域だ。CloudflareはClefについて中央値209.3 ms、p95で238.6 msを報告しており、Jevは524.1と536.0だった。この順序はベンチマークの癖からではなく、非自己回帰型の設計から生じる。だからこそ、実際のデプロイ環境に触れても揺るがない可能性が最も高い数字なのだ。絶対的なミリ秒値はCloudflare自身のハードウェアで測定されたものであり、それ単体ではほとんど意味を持たない。

このリリースで最も説得力のあるデータポイントは、ベンチマークの一行ではない。Cloudflareによれば、同社の脅威インテリジェンスチームがブラウザレンダリングサービスと併せてあるドメインをClefに渡したところ、2.2秒でカテゴリ判定が返ってきた。同じワークフローで同社最速の汎用LLMでは4.7秒だったのに対し、返された分類結果はより多かったという。社内の逸話であり、研究ではない — しかし、汎用モデルにプロンプトを投げるのではなく、なぜこれを構築しようとするのかを説明してくれる類の話ではある。

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

APIリファレンスが教えてくれる2つのこと、そして教えてくれない1つのこと

文書化されている落とし穴は小さく、何かを移植する前に読む価値がある。その信頼度フィールドは、確率がどれほど集中しているかを測るものであり、答えが正しい確率を測るものではない — 適切に較正されたモデルは、低信頼度の正解や高信頼度の誤答を返すことがある。また、2つの選択肢が同点の場合、回答はモデルの選択肢の順序に従うので、優先する選択肢を最初に置くこと。これら2つの文を読まずにプロンプトベースの分類器を移植する人は、自分のログを誤読することになる。

より大きな制約はどこにも文書化されていない。それが構造的なものだからだ。Clefにはテキスト生成の経路がまったくない。つまり、返信の下書きをしたり、スレッドを要約したり、ツールを呼び出したり、会話をしたりすることはできず、あなたが宣言していないカテゴリを勝手に作ることもない。設計全体は、許容される回答を事前に列挙できることを前提としている。それはある大きなクラスの問題を静かに排除しており、ベンチマーク性能がどれだけ高くてもそれは変わらない。

互換性の議論にはどれほどの価値があるのか

ここが、リリースがモデルレビューではなくアーキテクチャの問題になる地点だ。Clef が Jev のリクエスト形状に対応しているなら、あなたの意思決定エンドポイントの背後にあるモデルは設定値になり、それを導入する賢明な方法は置き換えではなく並行して行うことだ。両方をあなた自身のトラフィックで実行し、あなたのデータでより良い結果を示す方を残し、切り替えを低コストに保とう。

Clef自体は当社のルート一覧にはありません。OrcaRouterのカタログはClefに対して404を返しますし、ここに書かれている内容は当社からの提供可否の主張と解釈されるべきではありません。当社が実際に提供しているのは、Clefが置き換えるために作られた既存モデルです。TypeSafeのJev 1.13は、65,536トークンのコンテキストで入力トークン100万あたり$0.042で掲載されているルートであり、同じPOST /v1/systemoneボディ経由で提供されるため、この2つのA/Bテストは書き直しではなくモデル文字列の変更で済みます。両方を1つのキーの背後に置くこと——200以上のモデル、プロバイダー定価をトークン単位の上乗せなしでそのまま適用、プロバイダー間の自動フェイルオーバー——が、誰かがそれを気にかけると決めた週の後も、このテストを設定ファイルの古びたコメントとして朽ち果てさせることなく動かし続けるために必要なものです。決定モデルが下した結論に基づいて行動するために常備しておく汎用モデルも、別の契約ではなく同じキーから利用できます。

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

何がこの読みを変えるだろうか

Cloudflare外部の誰かがDecision Indexを再実行する必要がある。このスイートは公開されており、評価は再現可能と説明されている。したがって、第三者による実行は、ベンダーの表と事実との違いを生む — そして最も重要なセルは、相反する方向を指しているものだ。スコープ外の意図検出で97.4、GPQA Diamondで48.0というのは、滑らかな能力曲線ではない。それは、訓練分布内の分類パターンには非常に優れているが、見たことのない推論はかなり苦手なモデルを描写している。もしそれが独立したテストでも成り立つなら、それはClefに関する運用上最も重要な事実であり、ハイライトには載っていない。

本番トラフィックもレイテンシ表のようでなければならない。1台のH200で計測された中央値209 msは、並行実行時のp95について何も語らない。しかもこの設計の最大の売りは、それがホットパスに位置することにある。

そして、ファインチューニング基盤は何かしらの成果を生み出す必要がある。Cloudflareの投稿はRLループを説明している——AI Gatewayで自社トラフィックからデータセットを収集し、Workers AIでロールアウトを生成し、Containersをスコアリング用サンドボックスとして使い、Trainerで重みを更新し、その後Workers AIに再デプロイする——モデルを発表する同じ投稿の中で、顧客の成果も添えずに。ベースモデルがこれまで訓練されたことのないタスクでベースを上回るファインチューニング済みのClefは、表のどの行よりも、このカテゴリにとってはるかに強い証拠となるだろう。

それまでは、公平な要約はこうだ。Cloudflareは、実在し、許容的ライセンスで提供され、真に高速な意思決定モデルを出荷し、それを最初に登場したものとごく簡単に交換可能にした。それはほとんどのオープンリリースが提供するものより良い話であり、そしてこれまでのところ、依然として完全にベンダー自身による自己申告にすぎない。