
Clef vs MathForm-8B:一方はあなたの質問に答え、もう一方は証明を書く
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
を置く理由は、Cloudflare/clef の隣に openbmb/MathForm-8B今オープンウェイトで最も混同しやすい2つであり、混同するとトレーニング実行1回分の損になるからです。どちらもそれぞれ Qwen3.8-27B と Qwen3-8B チェックポイントを基にしたファインチューニングです。どちらも Apache-2.0 です。どちらも過去10週間以内に公開されました。どちらも狭い目的特化型で、制作者によって汎用ではなく専門特化であると説明されています。そして、一方はあなたが提供したリストから選ばれた数値を生成し、もう一方は証明支援系が検証するための Lean 4 ソースコードをトークンごとに生成するので、両者にはまったく何の関係もありません。
ClefはCloudflareの270億パラメータのマルチモーダル意思決定モデルだ。状態と型付き質問のスキーマを与えると、許可されたすべての答えに対して較正済みの確率を単一の非自己回帰パスで返し、経路のどこにもテキスト生成はない。OpenBMBのMathForm-8Bは自動形式化モデルであり、自然言語の数学的命題を入力するとLean 4が出てくる。それを訓練したパイプラインは、2026年8月14日に重みとともに公開されたarXivプレプリントに記述されている。一方のモデルの天井は、あなたの選択肢リストのサイズだ。もう一方の天井は、Leanの型理論の強さだ。どちらが優れているかを問うのはカテゴリー錯誤であり、両方がApache-2.0のオープンウェイト微調整の80億から270億パラメータであるという事実こそが、まさにその誤りを犯しやすくしている。
各モデルのインターフェースが物理的に禁じていること
その分岐を確かめる最速の方法は、それぞれが何を返せるかを読むことだ。
• 入力 — Clef は状態(テキスト、JSON、画像、または動画フレーム)と、1~64 個の名前付き型付き質問を受け取ります。MathForm-8B は自然言語による数学的記述を受け取ります。
• 出力 — Clefは許可された各選択肢につき1つの確率を返し、質問ごとにsoftmax化されます。MathForm-8BはLean 4のソースコードを返します。
• 質問タイプ — Clef のものは noul(真偽、真である確率付き)、choice(2〜26 個の名前付き選択肢)および score(2〜26 段階の順序付きレベル)です。MathForm-8B には質問という概念がまったくありません。
• キャリブレーション — Clef は回答ごとに信頼度フィールドを公開しており、MathForm-8B は構文チェックと一貫性チェックの下で Pass@8 率を公開しています。
• サービング — Clef は Jev/SystemOne 互換の POST /v1/systemone ボディ経由で提供されます(ホスト型または自己運用)。MathForm-8B には Transformers、vLLM、SGLang の手順が同梱されており、いずれも OpenAI 互換の補完エンドポイントを 16,384 トークンのコンテキストで公開し、max_new_tokens は 16,384 に設定されています。
実用的な帰結はすぐに導かれる。あるテキストについてはい/いいえの判定が必要なら、二者のうちそれを作り出せるのは Clef だけだ——MathForm-8B に「これの Lean 4 を書け」以外の質問をする方法はない。Lean 4 が必要なら、二者のうちそれを絶対に作り出せないのは Clef だけであり、それは弱さによるものではない。スキーマ拘束型のスコアラーに定理を形式化するよう求めるのはその契約に合わないため、その要求はまずい回答が返されるのではなく、設計上拒否される。

二人ともが属するパイプライン
これら2つのモデルが隣り合って配置される実際のアーキテクチャが存在し、その分割を抽象的ではなく具体的に示してくれるので、順を追って見てみる価値がある。研究者や学生のために数学を形式化するサービスを考えてみよう。
文は自然言語で届き、その種類に上限はない。何かを形式化する前に、何が届いたのかを決める何かが必要だ。これは証明すべき定理か、追加すべき定義か、既存の証明を検査する依頼か、それとも誰かが Lean に触れる前に明確化が必要な質問か? それは自己完結しているのか、それともユーザーが提供しなかった文脈に依存しているのか? 記号は慣習的なものか、それともシステムがこれまで見たことのない記法か? これらの一つ一つは、選択肢の少ない有界な問いであり、まさに Clef の形だ。そして各回答に付随する較正された確率があるからこそ、このサービスは不確かなものに対して妥当な処理ができる。つまり、しきい値を下回るものは推測せず人間に回すのだ。
第2のステップはMathForm-8Bが担当する。すでに既知の記法を伴う自己完結的な定理として分類済みの命題を受け取り、Lean 4を出力する。これは生成の問題であり、品質の問いは、出力がコンパイルされる頻度と、元のものと同じ意味になる頻度がどれだけ高いかということだ——これはまさに、ベンダーの2つの評価軸が測っているものである。この組み合わせから抽出する価値のある一般的なパターンは次のとおりだ。高価な専用生成器の手前に安価で範囲の限定された分類器を置くことは、生成器自身にそもそも動作すべきかどうかを判断させるようプロンプトするよりも、通常はより安価で信頼性が高い。
各側の数字が実際に何を測定しているのか
OpenBMBのarXiv抄録によると、MathForm-8Bは6つのベンチマークにおいて、Syntax Checkで平均Pass@8率88.06%、Consistency Checkで72.37%を達成し、FATE-HおよびFATE-Xサブセットでは一貫性合格率63%と37%を達成しており、いずれも論文が比較対象とした最強の専門特化ベースラインを上回っている。この主張で興味深いのは学習パイプラインの部分だ。検索プランナーが生成前にMathlibから関連する定義と既存の形式化を引き出し、生成された命題はコンパイラの診断情報と意味的一貫性のフィードバックを用いて修正される。約36万7千件の検証済みLean 4例からなるFormalVerseデータセットは、教師ありファインチューニングと強化学習の前に、この方法で構築された。これらは論文とモデルカードに記載されたベンダー報告の数値である。独立した第三者が追試したものはない。
Clef の数値はまったく別のものを測っており、比較できるものではない。Cloudflare の Decision Index の実行結果は、BANKING77 の意図マクロ F1 が 94.2、スコープ外処理を含む CLINC150 が 97.4、GPQA Diamond が 48.0——そこでは旧 Jev が 78.3 を記録している——、リクエストレイテンシ中央値が 209.3 ms であると報告している。これは分類とルーティングに関する表であり、ベンダー自身のスイート上でベンダーによって作成され、ベンダー自身のリーダーボードに掲載され、再現されていない。
この2つの列について書ける唯一の正直な文は、それらがベンチマークも単位も評価哲学も共有していないということだ。MathForm-8Bの難しい形式化サブセットにおける37%と、Clefの範囲外意図検出における97.4は、どちらも異なる仕事についての製作者による本物の主張であり、それらを並べて見比べた読者は、両方の数値が存在するということ以外に何も学んでいない。
何を実行するのか、そしてそれにいくらかかるのか
どちらのモデルもOrcaRouter上のルートではなく、この記事は利用可能性について何ら主張するものではありません — カタログが404を返すのはcloudflare/clefとMathForm-8Bに対してです。MathFormリポジトリは約16.4 GBで、両モデルはApache-2.0なので、ハードウェアさえあれば誰でも明日にでもセルフホストできます。
• Cloudflare上のClef — Workers AIでは入力トークン100万個あたり$0.24、公表されているレイテンシは単一のH200で測定。
• MathForm-8B セルフホスト — ベンダーによるホスティングなし、トークンごとの課金なし、そして文書化された16,384トークンのコンテキスト。これは注目に値する制約だ。長い論文のセクションは一度に収まらない。
• 分類器側向けのルーティングされた代替手段 — TypeSafeのJev 1.13。100万入力トークンあたり$0.042、65,536トークンのコンテキストに対応し、同じPOST /v1/systemoneボディをClefが使用して提供されるため、上記パイプラインの最初のステップにそのまま組み込めるドロップインとなっています。
この特定の組み合わせで、ルーティング層がその存在価値を発揮するのはまさにそこです。パターンは決定役と生成役からなり、生きた代替手段を備えているのは決定役のほうです — 200以上のモデルの手前に置く1つのエンドポイント、プロバイダーの定価がトークン単位の上乗せなしでそのまま適用され、そして自動フェイルオーバーにより、あるプロバイダーの不調な午後がパイプラインの玄関口をふさぐことはありません。生成役の半分は自分で実行する16.4 GBのアーティファクトであり、どのエンドポイントもそれを変えられません。

サイズが隠しているもう一つのこと
パラメータ数は、成立しない比較を誘う。Clef は 27B、MathForm-8B は 8B なので、大きいモデルのほうが高性能で、小さいほうが専門特化型だと考えるのは自然だ。だが、性質としては逆である。Clef が大きいのは、スクリーンショットや請求書を読むために必要な、凍結されたマルチモーダル基盤を抱えているからであり、その上に載る学習済み部分は rank-256 アダプタを備えた小さなスキーマヘッドにすぎない。MathForm-8B が小さいのは、Lean 4 が狭いターゲットであり、Qwen3-8B ベースでそこに到達するのに十分だったからで、本当のエンジニアリングは、その学習データを生成した検索・検証パイプラインの側にあり、パラメータ数にあるのではない。
サイズとは、言い換えれば、各モデルが何を担う必要があったかを示すものであって、解いている問題がどれほど難しいかではない。レシートを読み取って「billing, 0.98」と返す27Bも、コンパイル可能なLeanを出力する8Bも、どちらも自分が作られたとおりのことをしているだけであり、80億対270億という見方は、およそ半分の確率で間違ったほうへあなたを導くだろう。

決断、そしてどちらのベンダーも答えていない問い
無制限の自然言語を取り込み、それに計算資源を費やす前にルーティングする必要があるパイプラインがあるなら、最初の一手は範囲を限定した分類器です — マルチモーダル入力が重要な場面で、あなたのデータ上で数値が良好に見えるなら Clef、同じリクエスト形状をより低い定価で得たい、しかも評価を誰も再現していないベンダーにアーキテクチャを縛られたくないなら Jev 1.13。第二の一手は専門特化型の生成器で、その生成器が Lean 4 なら、MathForm-8B はまさにそのために作られたオープンモデルであり、公開されたパイプラインとその背後にあるコーパスを備えています。
両側に欠けているのは、同じ種類の証拠だ。Clef の Decision Index の実行は Cloudflare 自身によるもので、独立して再現されたことは一度もない。MathForm-8B の Pass@8 の数値は、MathForm-8B 自身の論文に由来する。どちらも、誠実なテストが説明するのは安く、実行するのは高くつく分野における野心的な主張だ——どちらのベンダーも学習に使っていないデータを取り、同じパイプラインを適用し、結果を公開する、というテストである。どちらかのモデルについて誰かがそうするまでは、この比較が伝えられる有用なものは形だけだ。これらの一方は、何が到着するかを決めるパイプラインの前方に属し、もう一方はその背後で困難で狭い作業を行うことに属する。そして、どのパラメータ数においても、どちらも他方の代わりにはならない。
