生成されたタイトルカードには「Clef vs LFM2.5 2.6B Base」と表示され、サブタイトルは「H200での55 GB対ラップトップでの5.4 GB」、チップには「27B意思決定モデル」と「2.69B事前学習済みベース」と表示されている。OrcaRouterのロゴは右下隅に合成されている。
Engineering & Research

Clef vs LFM2.5 2.6B Base:H200では55 GB、ノートPCでは5.4 GB

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これは、モデルより先にハードウェアが議論の勝敗を決める比較です。Cloudflare/clef は270億パラメータのマルチモーダル意思決定モデルで、Qwen3.8-27Bからポストトレーニングされたもので、そのリポジトリは12個のバックボーンシャードと小さなジョイントスキーマヘッドにまたがり、サイズは55 GB強です。LiquidAI/LFM2.5-2.6B-Base は26.9億パラメータのテキスト専用チェックポイントで、その重みは単一の5.4 GBファイルであり、2026年8月1日にLiquid AIからLFM Open Licenseの下で公開されました。Cloudflare自身が公開したClefのレイテンシ — 中央値209.3 ms、p95 238.6 ms — は、単一のH200上で測定されたものです。Liquid AIがLFM2.5ファミリー向けに想定している展開先は、ノートPC、スマートフォン、またはRyzenハンドヘルドです。両ベンダーとも自社モデルを小型・高速・効率的と説明しており、そして両社とも異なるマシンについて真実を語っています。

最初のギャップの背後にはもう一つのギャップがあり、実際に計画を変えるのはそちらだ。どちらもClefもLFM2.5 2.6B Baseも、おそらくあなたが期待するであろう形で、そのまま質問に答えてくれるわけではない。Clefは、逸脱することのできない一つのタスクのために完全に訓練された状態で届く。すなわち、タイプされた質問に答えることであり、それ以外のことは一切しない。Liquidのチェックポイントは、何に対しても未訓練の状態で届く。つまりベースモデルであり、意図的にインストラクションチューニングが施されておらず、Liquid AI自身のカードには、大規模なファインチューニングにのみ推奨されると記載されている。したがって、本当の問いはどちらを動かすのが安いかではない。あなたが買っているのは完成したコンポーネントなのか、それとも出発材料なのかということであり、その答えは両者で異なる。

それぞれがどこで実行されるのか、そしてなぜそれだけが比較のすべてなのか

デプロイ形態は、これら2つのモデルにとって補足事項ではない。意思決定モデルにとって、それはアーキテクチャそのものだ。なぜなら、209 msのフォワードパスと「手元のマシンで動く」という話は、同じ主張を両端から語ったものだからである。

• パラメータ — Clefは27Bで、Qwen3.8-27Bビジョンエンコーダを維持。LFM2.5 2.6B Baseはテキスト専用で2.69B。

• ディスク — Clef 向けの 55 GB リポジトリ。Liquid チェックポイント用の 5.4 GB の safetensors ファイル 1 つと、それに合わせて公開された量子化 GGUF、ONNX、MLX ビルド。

• ハードウェア — Cloudflareはtorch 2.11とtransformers 5.10.2を使い、単一のH200上でClefをテストしており、そのレイテンシ値はこの実行から得られたものです。Liquid AIによるこのチェックポイントの事後学習済みの兄弟モデルは、Apple M5 Maxで毎秒220トークン、AMD Ryzen CPUで毎秒113トークンを、2.5 GB未満のメモリで実行し、ベンダーはスマートフォンでも毎秒30トークンが達成可能だと述べています。

• コンテキスト — Workers AI のモデルページとローンチ記事によると、Clef は 65,536 トークン、LFM2.5 2.6B Base は 131,072 トークンです。

• 入力 — Clefはテキスト、JSON、画像、動画フレームを読み取り、それらをまとめてスコアリングします。Liquidチェックポイントはテキスト専用です。

• ライセンス — Clef は Apache-2.0。LFM2.5 は LFM Open License v1.0 で、これは OSI のオープンソースではなくソース公開型だ。商用利用は、組織の年間収益が1,000万ドル未満にとどまることが条件であり、その線を超えると、ライセンスは商用利用を許諾しない。このしきい値は脚注ではなく、調達上の事実である。

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

決定あたりのコストは、トークンあたりのコストと同じ問題ではない

ここで誘惑されるのは、2つの価格を割り算して勝者を宣言することだ。しかしそれは、この2つのモデルが実際に何をするかと突き合わせれば、とても通用しない。

Clef は Cloudflare の Workers AI で、入力トークン100万個あたり $0.24 です。その出力は文章ではないため、通常の出力トークンの行は存在しません。状態に対して一度だけ支払い、見返りとして分布を得ます。1日に数百万件の小さな判断を下すルーティング層にとって、その数字が運用コストのすべてであり、それは自分の電気料金からではなく、ベンダーからしか得られない数字です。

LFM2.5 2.6B Baseは呼び出しごとのコストがかからず、意思決定を行うこともできない。そこから意思決定あたりのコストを算出するには、まず自分のタスクでファインチューニングする必要があり、それはデータを集め、学習ジョブを実行し、結果を評価し、そしてようやくkVAとエンジニアリング時間でどれだけのコストがかかるのかを突き止めることを意味する。2.6Bチェックポイントの魅力的な経済性は確かに本物だが、それはまだ行われていない作業の後工程にあり、トークンあたりの価格を比較している人はそのことをすっかり飛ばしている。

正直なところ、これは2つの異なる購入だ。Clefは定価とホスティング費用を伴うコンポーネントだ。Liquidチェックポイントは原材料であり、そのコストはどちらにせよ支払うことになるトレーニング実行そのものだ。そしてその見返りは、その後あなたが成果物を完全に所有することであり、その時点で意思決定の限界費用は本当に電気代だけになる。狭く、大量で、安定したタスクでは、その取引は多くの場合正しい。まだ仕様を定めていないタスクでは、それは本末転倒だ。なぜなら、記述できない目標に向けてファインチューニングすることはできないからだ。

未学習のベースは劣ったモデルではなく、異なるスタートラインなのだ

Liquidチェックポイントにベンチマーク表がないのを、隠れた弱点として読みたくなる。だがそうではない。事前学習済みベースモデルを指示追従ベンチマークで採点すれば、測れるのはファインチューニングの欠如であって、基盤の品質ではない。まさにそのため、Liquid AIは事後学習済みのLFM2.5-2.6Bをベンチマークし、ベースは未評価のままにしている。この空欄はあなたの側で検証可能であり、そこが要点だ。5.4 GBをダウンロードし、自分のタスクで自分自身の評価を実行し、何かを提供すると決める前に答えを知ろう。

Clefの表は証拠の形が正反対で、問題も正反対だ。Cloudflareは40数行のベンチマーク行、完全なワークフロー評価セット、レイテンシ分布を公開しているが、そのすべてはCloudflare自身のDecision Index上でCloudflareによって作成されたもので、第三者による再現は一切ない。Clefの列はLiquidの列よりもはるかに情報量が多いが、その中の数値は一つとして他人に検証されていない。それは空白よりも強い主張であり、見た目よりも弱い主張だ。

自分で測定できるものも、同じように分かれる。Liquid チェックポイントなら、すべてを自分で測定できる——自分のディスク上で 5.4 GB だ。Clef では、Apache-2.0 の重みも同様に自分でダウンロードして実行できるが、Cloudflare の 209 ms 中央値に合わせるには Cloudflare が使ったクラスの GPU が必要なので、実際にはほとんどのチームはホスト型エンドポイント経由で測定し、そのレイテンシとともにベンダーの可用性も引き継ぐことになる。

それぞれについて、ルーティング層がどこに当てはまるか

ClefもLFM2.5のどのバリアントもOrcaRouter上のルートではなく、本記事は可用性を主張するものではない——カタログはどちらについても404を返すため、ClefはCloudflareのWorkers AIまたはあなた自身のGPUから提供され、Liquidチェックポイントは独自の配布経路から提供される。

ここでルーティング層が本当に果たす役割は、両方のモデルが示唆するパターンそのものです。判断を下す小さな境界付きスコアラーと、その判断に基づいて行動するより大きな汎用モデルは、構造上2モデルアーキテクチャです — そしてClef自身のバックボーンがその後半を具体化します。なぜなら、Cloudflareがポストトレーニングの基にしたモデル、Qwen3.8 27Bは、262,144トークンのコンテキストで、100万入力トークンあたり$0.33、100万出力トークンあたり$2.40のリストされたルート。200以上のモデルの前に1つのエンドポイントがあるということは、安価な判断役と有能な実行者が同じキーの背後に位置することを意味し、ルーティングDSLを通じて単一の呼び出しにまとめられ、手作業で配線するのではなく、自動フェイルオーバーを備えているので、プロバイダーの不調な午後が意思決定パスを巻き込んでダウンさせることはありません。代わりにLiquidチェックポイントをセルフホスティングし、自分のファインチューンを打ち負かすべきモデルと比較している場合、同じエンドポイントがあれば、その比較は調達サイクルではなく設定変更になります。

TypeSafeのJev 1.13は、特にセルフホスティングの場合に名前を挙げる価値があります。それはCloudflareが比較検証した意思決定モデルであり、意図的に同じPOST /v1/systemoneリクエスト形式をClefと同様に用います、これは65,536トークンのコンテキストで100万入力トークンあたり$0.042の掲載ルートであり、そして、存在する必要がないかもしれない基盤に学習実行を費やす前に、境界付き意思決定モデルがあなたのパイプラインに役立つかどうかを知るための低労力な方法です。

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

どちらが、何のために?

タスクが狭く、大量処理で、学習データを作成できるほど十分に仕様が定まっており、ルーティングされた API では解決できない 2 つの厳しい制約のどちらかに縛られているときは、Liquid のチェックポイントを採用する。その制約とは、データをあなたのインフラから出せないか、実行しなければならないマシンがあなたの机の上にあるマシンである、というものだ。LFM 1.0 の売上高しきい値は最初に確認すべきものである。ライセンスがそもそもあなたに利用可能かどうかを決めるからだ。

決定がすでに列挙可能で、状態が64Kに収まり、答えが文ではなく較正済みの確率を必要とし、ホットパスでの209 msこそが購入する特性であるなら、Clefを使え。その固定スキーマこそが特徴だ——監査可能で再現可能、パーサー不要の出力形状——そしてその55 GBのフットプリントは、トレーニング実行の後ではなく一発目で正確にするバックボーンの代償だ。

すべきでないのは、パラメータ数で選ぶことだ。応答できるようになる前に学習が必要な2.69Bモデルは、すでに応答できる27Bモデルの小型版ではないし、タイトルにある2つの数字——55 GBと5.4 GB——は、1つの尺度上の2点ではなく、2つの異なる予算を表している。

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

未解決の問い、そしてそれは双方にとって同じものである。

どちらのベンダーも、独立した検証に耐える証拠を公表していない。CloudflareのDecision Indexの実行は自己管理によるもので、再現されていない。Liquid AIのスループット数値は、同社が選んだハードウェア上でのベンダー自身による測定値だ。LFM2.5 2.6B Baseは設計上、ベンチマークがまったく存在せず、Clefの表には選択により非常に多くが存在する。

Liquidチェックポイントについては、不足している証拠を埋めるのは安価で、完全にあなたの手に委ねられています——そのファイルは、ノートPCで午後一つ分あれば評価できるほど小さいのです。Clefについてはそうはいきません。209 msという中央値を再現するには、Cloudflareが使ったハードウェアと、Cloudflareの外の誰もまだ揃えていない状態が必要です。この非対称性こそが、どちらの仕様にある何よりも、今月この二つのどちらを軸に計画すべきかを決める要素になるはずです。