「Liquid AI d1-3B vs LFM2.5-2.6B-Base」という見出しと「決定モデルとその祖先」というサブ見出しを持つヒーロータイトルカード。左から右へのファミリーツリーとして描かれている:LFM2.5-2.6B-Base 生の重みとラベル付けされたカード、ポストトレーニングとラベル付けされた矢印、そしてd1-3Bが質問に答えるとラベル付けされたカード。左のカードの下にはトレーニング継続チップ、右のカードの下にははい/いいえ、ラベル、スコアのチップがある。
Guides & Insights

Liquid AI d1-3B 対 LFM2.5-2.6B-Base:意思決定モデルとその祖先

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これは二人のライバル同士の対決ではない。Liquid AIが2026年10月7日に公開したオープンウェイトの意思決定モデル、Liquid AI d1-3Bは、ベンダーがLFM2.5-2.6Bの重みとLFM2.5-VL-3Bのテキストバックボーンを平均して構築したベース上に作られた。LFM2.5-2.6B-Baseはその最初の親である — Liquidが2026年8月1日にアップロードした生の事前学習済みチェックポイントで、2.69Bパラメータ、34兆の訓練トークン、131,072トークンのコンテキスト、指示チューニングなし、チャットテンプレートなし。したがって、この比較を正直に位置づけるなら、子孫対祖先である。非常に特定の仕事に事後学習されたモデルが、それが形作られた元の形のない基盤の隣に立っている。一方は今夜質問に答える。もう一方は、あなたが答えを必要としている質問が誰もまだ尋ねていないものである場合に、始める場所である。

それぞれが実際に何なのか

この2つのモデルカードは、生産ラインの異なる段階の文書のように読める。そして両者の違いは文体上のものではない。

Liquid AI d1-3Bは3.12Bパラメータ、400MのSigLIP2 NaFlex視覚エンコーダ、32,768トークンのコンテキストウィンドウ、128,000トークンの語彙、16の文書化された言語を備えています。これは意思決定モデルです。状態といくつかの名前付き質問を渡すと、はい/いいえの確率、信頼度付きの選択されたラベルと完全な選択肢分布、または順序付きスコアを返します — 単一のフォワードパスで、出力トークンは生成されません。また、system_one呼び出し(1つの状態に複数の質問)や、パディングなしで多数のリクエストをまとめるバッチ版、そして基盤となる分布にアクセスする生のprobabilitiesアクセサを提供します。これはチャットモデルではなく、テキストも書きません。カードにもまさにその言葉でそう書かれています。

LFM2.5-2.6B-Baseは、30層に2.69Bのパラメータを擁する——22個の二重ゲート付きショートコンボリューションブロックと8個のグループ化クエリアテンションブロック——34兆トークンで学習され、ミッドトレーニング中に131,072トークンのコンテキストへ拡張され、同一の128,000トークン語彙と同じ16言語を備えている。これは事前学習済みのテキスト専用チェックポイントであり、指示チューニングはなく、モデルカードにベンチマークもなく、推奨事項は警告のように読める。すなわち、大規模な微調整を必要とするタスクにのみ使用すること。テキストを補完する。指示には従わない。

どちらもLiquid独自のオープンライセンスに基づく、ゲートなしのダウンロードです。どちらもテキスト主体です。どちらも当社のカタログには掲載されておらず、ここに記した内容はどちらについても入手可能であることを示す主張ではありません。

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

系譜のほうが面白い部分だ

Liquidは、d1リリースを作るために新しいモデルをファインチューニングしたのではない。2つのチェックポイント——LFM2.5-2.6BとLFM2.5-VL-3Bのテキストタワー——を平均して、より良い出発点を得てから、異なるランダムシードとデータ混合で複数の実行をファインチューニングし、それらを再びマージした。結果を改善したものについてのベンダーの説明には、奇抜な技術がいっさい出てこないのが際立っている。長い入力での学習、回答選択肢が現れる順序をシャッフルすること、学習データからショートカットを除去することが、彼らが試したどんな高度な手法よりも大きな効果を上げた。

そのショートカット除去の細部は、少し立ち止まって考える価値がある。なぜなら、このカテゴリが避けるために存在する失敗を言い当てているからだ。多肢選択式の質問に答えるよう訓練されたモデルは、選択肢Bがたいてい正しいとか、最も長い選択肢が勝つ、といったことを喜んで学習してしまう。訓練中に選択肢の順序をシャッフルすることが、それを防ぐ。状態を読む代わりに位置事前分布を学習してしまった意思決定モデルは、役立たずどころではない——大規模に自信を持って間違えるのだ——そして、本物の意思決定モデルとプロンプト付きの分類器を分けるのは、まさにこの点である。

また、率直に名指しする価値のある後退もある。ベンダーはそうしないからだ。ベースチェックポイントのコンテキストウィンドウは131,072トークンで、Liquid AI d1-3Bは32,768だ。意思決定モデルへの事後学習で、使用可能なコンテキストの4分の3が犠牲になった。子孫がすべての軸で祖先を厳密に支配していると想像していたなら、そうではない。長文書の意思決定こそ、古いチェックポイントのほうにより余地がある軸だ——原理上は。ただし、それを使うための意思決定ヘッドがないのだが。

スコアボード、非対称性が付いたままで

この2つをベンチマークで比較するのはカテゴリーエラーだが、示唆に富む形をしたカテゴリーエラーではある。なので、注意書きを添えた上で示しておこう。d1-3Bの数値はすべてLiquid自身によるもので、公開リーダーボードに提出されたものではなく、ベンダーが公式スコアラーを用いて採点したものであり、第三者による再現はなされていない。LFM2.5-2.6B-Baseの数値はすべて存在しない。ベースモデルには測定すべきものがないからだ。

• Decision Index 0.2.1 — Liquid AI d1-3B 48.57、ベンダーの表で10B未満のすべての中で1位、そして12倍の規模の意思決定モデルをも上回る。LFM2.5-2.6B-Base — スコアなし、決定ヘッドなしではスコア付け不可。

• テキストベンチマーク — Liquid AI d1-3B は、理解度、有害性、意図、医療QA、クロスリンガル理解にわたる7つの公開ベンチマークで平均82.9を記録しています。LFM2.5-2.6B-Base はベンチマーク表を一切公開していません。

• 視覚 — Liquid AI d1-3B は、意思決定として読み取った 11 の画像ベンチマークで平均 74.1 を記録する。画像を除くと、同じ質問は 45.1 に低下する。LFM2.5-2.6B-Base はテキスト専用で、視覚タワーを備えていない。

• パラメータ — 3.12B 対 2.69B。意思決定モデルは二者のうち大きい方であり、これは通常のポストトレーニングの話とは逆である。

• コンテキスト — 32,768トークン 対 131,072。祖先はこの行で勝利し、それが勝利する唯一の行である。

• レイテンシ — Liquid AI d1-3B は RTX 4090 上で単一の質問に 8 ms で回答し、Jetson Orin Nano では 50 ms で、4090 では 64 個のパックされた状態を毎秒 475 回実行します。LFM2.5-2.6B-Base には、質問に回答するものへとファインチューニングするまで、引用できるレイテンシがありませんが、その時点での数値はあなたのファインチューニングによるものです。

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

実際には、あなたが何と何の間で選んでいるのか

ここでの判断ルールは異例なほど明快だ。というのも、この二つのチェックポイントは同じ予算項目を争っているわけではないからだ。

Liquid AI d1-3Bを採用するのは、問いがすでに存在し、意思決定モデルが扱う3つの形のいずれかである場合だ。すなわち、はいかいいえか、名前付き集合からの選択、順序尺度上の評価である。公開されているアプリケーションはどれも見覚えのある実務作業だ — トリアージとルーティング、モデレーション、意図とトピックの分類、抽出チェック、再ランキング、エージェントのガードレール、視覚検査。ベンダーが10月5日に実施したデモの数値では、d1をGPT-6.1 SolおよびClaude Opus 5.5と、そうした6つのタスクで比較し、4つでGPT-6.1 Solに匹敵するか上回り、コストは19分の1から200分の1になると主張している。方法論ページには、各アプリケーションはモデルごとに1回だけ実行されたと明言されているので、主張の形こそを知見と捉え、小数点以下の桁を捉えるな。本当に際立っているのは検査デモだ。4本の生産ラインにまたがる良品と不良品の仕分けを、モデルが一度も訓練されたことのないタスクで、短い説明から理解し、85~97%の精度で行っている。

LFM2.5-2.6B-Baseを選ぶのは、まだ問いが存在しないときだ。自分で所有するつもりのファインチューニングにとって、これはより安価な出発点になる——ドメイン判断ヘッド、特注の分類器、誰もチェックポイントを持っていないタスク。アーキテクチャ、トークナイザー、長いコンテキストは引き継ぎ、計算資源、データ、評価で支払う。ベンダーがd1を中心に構築した4つのアプリケーションのうち2つは、ゼロからではなくオープンソースプロジェクトから始まった。これは、ベースチェックポイントと規律が実際に何を生み出すかをよく示している。

実用的な落とし穴は、ベースチェックポイントをそのまま差し替え可能なものとして扱ってしまうことだ。それはアシスタントではなく、プロンプトにも従わないし、チャットモデルとして評価すればほぼゼロに近いスコアになる――これはその品質に関する事実ではなく、「ベース」とは何を意味するかに関する事実である。

どちらか一方をセルフホストすること、そしてその上のレイヤー

どちらもウェイトとして提供され、d1側についてはベンダーがデプロイ作業を担っています。初日からのllama.cppサポート、DGXからJetsonまでを含むNVIDIAスタック、NVFP4量子化、8ビットのウェイト&アクティベーション版、そしてHugging Face上でのGGUF変換です。ベースチェックポイントは、より広いLFM2.5ファミリーを通じて独自のGGUF、ONNX、MLX版も備えています。自分で何もホストしたくない場合は、Liquidがホスト版のd1を自社APIから提供しており、料金は入力トークンのみに基づき、画像は32×32ピクセルパッチあたり1.5トークンとして課金されます。テキストのみのアクセスはサードパーティのプラットフォームからも利用できます。

どちらの道を選んでも変わらないのは、スタックの残りの部分です。自分でホストするモデルは、稼働させ続け、バージョン管理し、フェイルオーバーしなければならないモデルです — そしてそれが供給する意思決定は、あなたがホストしていない生成呼び出しの隣に依然として置かれます。その混在こそ、ルーターが一本化する層です。200以上のモデルをまたぐ単一のエンドポイント、0%のマークアップでパススルーされるプロバイダーの定価、それによりベンダーの価格変更が同じ日にあなたの側で有効になり、自動フェイルオーバー、それにより、あるアップストリームの不調な午後があなたの障害になることはありません。その隣で3Bの意思決定モデルをセルフホストすると、ルーティングの問いはむしろ和らぐどころか鋭くなります。なぜなら、今ではパイプラインの半分を所有し、残りの半分を借りているからです。

どれを、誰のために

今週答える必要がある問いが、意思決定モデルが取る3つの形のいずれかであり、それが誰かがすでに想像していた問いなら、その派生形はすでに完成していて無料で、GPUのないデバイスでも50 msで動く——Liquid AI d1-3Bを使えばそれで終わりだ。

まだ誰も問いかけていない問いに答えるものを作ろうとしていて、それを自ら手中に収めるためのデータと計算資源があるなら、LFM2.5-2.6B-Base は正直な出発点だ。そして、この記事に登場するその子孫が、あなたがこれからたどろうとしているまさに同じ道筋によってそれから作られたことは、知っておく価値がある。

そして、その2つの状況のどちらに自分がいるのか確信が持てないなら、答えはほとんど常に最初のほうだ。意思決定ヘッドへ事後学習させるのは高くつく選択であり、他人のものを動かすのは無料だ。

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新