「Liquid AI d1-3B vs MiniCPM5-2B」という見出しで、サブ見出しが「確率か散文か、ラップトップ規模で」のヒーロータイトルカードは、等号で結ばれた2枚のカード(ゲージアイコンと「ラベルと信頼度」チップ付きのd1-3B、鉛筆アイコンと「書かれた回答」チップ付きのMiniCPM5-2B)を示し、その上に「どちらもラップトップに収まる」と書かれた幅広のチップがある。
Guides & Insights

Liquid AI d1-3B 対 MiniCPM5-2B:ノートPC規模で、確率か、散文か

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

オープンウェイトのモデルが2つある。どちらも目の前のマシンで動かせるほど小さく、そしてモデルが何を返すべきかについて意見が分かれている。Liquid AI d1-3BはLiquid AIの3.12Bの意思決定モデルで、2026年10月7日にオープンウェイトとして公開された。状態と名前付きの質問群を読み取り、1回のフォワードパスでラベル、選択肢ごとの確率、確信度を返し、何も生成しない。MiniCPM5-2BはModelBestとOpenBMBの2.52Bのdenseモデルで、7月19日の世界人工知能会議で披露され、2026年9月上旬にApache-2.0の下でHugging Faceにひっそり公開された——推論、コーディング、ツール呼び出しを行うアシスタントで、回答を書き、XMLで関数を呼び出し、すでに100万回以上ダウンロードされている。小さい方は4倍のコンテキストウィンドウとはるかに寛容なライセンスを持ち、大きい方は、たとえ望んでもトークンを1つも生成できない。その2つの形のどちらがあなたのパイプラインに属するかは、呼び出しの下流にあるものが数値と文章のどちらを求めているかだけにかかっている。

まず注目すべき逆転

この組み合わせについての直感的な予想はほとんどすべてが逆さまなので、まずはそこから始めよう。

MiniCPM5-2Bはより小さいモデルであり、より長いコンテキストを保持しています。131,072トークンに対して、Liquid AI d1-3Bは32,768トークンです。また、二つのうちより寛容なライセンスのものでもあります — Apache-2.0、ゲートなし、重みとともにUltraDataファミリーの一部としてトレーニングデータセットがリリースされています。Liquid AI d1-3BはLiquid独自のlfm1.0ライセンスの下で提供されており、ダウンロードおよびファインチューニングは可能ですが、標準的な許容ライセンスではなくベンダーライセンスです。

Liquid AI d1-3Bはより大きなモデルです — 合計で3.12B対2.52Bですが、非埋め込みパラメータでは比較が再び逆転します — そして、書くことができないのはそれの方です。それには視覚機能があり、MiniCPMはテキスト専用です。それはたった一つのことのためにポストトレーニングされており、MiniCPMは多くのことのためにポストトレーニングされています。そして、MiniCPM5-2Bが自身のサイズクラスのトップに位置づける比較チャートとともに登場するのに対し、Liquid AI d1-3Bは単一の指標スコアと一連のレイテンシテーブルとともに登場します。

そうしたことのどれも、一方が優れているというわけではない。それは、両者が異なる用途を目指しているという意味であり、その手がかりとなるのは、それぞれが返す答えの形だ。

ワイヤ上で何が返ってくるか

MiniCPM5-2Bは生成言語モデルだ。推論し、散文で回答し、XML形式のツールコールを出力する。それをSGLang内蔵のminicpm5パーサーがOpenAI互換のtool_callsに変換する。カスタムアダプターは不要だ。そのポストトレーニングこそが、このモデルの物語の興味深い部分である。4000億トークンに及ぶ深い思考の教師ありファインチューニング、続いてJustRL IIから借用したクリティックベースのアルゴリズムによる強化学習、そして16の専門的なRL教師——うち5つはエージェント的——を1つの密なネットワークへと折り畳むオンポリシー蒸留。カードは、RLと蒸留により、推論および一般タスクで平均10.96ポイント、エージェント的タスクで6.96ポイントの向上をもたらしたとし、独自の比較セット全体で平均53.9を報告している。これはそのセットに含まれる最大のモデルをも上回る。これらはModelBestの数値であり、社内で作成されたもので、独立した再現はまだ公表されていない。

Liquid AI d1-3Bは構造を返します。noulの質問は0から1の間のP(yes)として返ってきます。choiceの質問は、ラベル、信頼度、および選択肢ごとの確率として返ってきます。scoreの質問は、2から10の順序尺度上の期待レベルとして、その分布と凡例とともに返ってきます。usageオブジェクトはoutput_tokens: 0を報告し、生のprobabilitiesアクセサがあります。未加工のベクトルが必要な場合に利用できます。そのポストトレーニングは逆の種類の作業でした。2つのチェックポイントを平均化し、異なるデータ混合で複数のシードを微調整し、それらをマージし、その後、長い入力のトレーニングに労力を費やし、回答選択肢の順序をシャッフルし、トレーニングデータからショートカットを除去しました。なぜなら、「選択肢Bが通常正しい」と学ぶ意思決定モデルは、状態を読む代わりに、役立たず以下だからです。

一方はモデルに考えてから何か言うよう求め、もう一方はモデルがすでに信じていることを尋ねる。

A two-column scoreboard for Liquid AI d1-3B and MiniCPM5-2B. The d1-3B column reads: output label, confidence, probabilities; 3.12B parameters; 32,768-token context; text and image input; Liquid lfm1.0 licence; Decision Index 48.57 (vendor). The MiniCPM5-2B column reads: output generated text and tool calls; 2.52B dense parameters; 131,072-token context; text-only input; Apache-2.0 licence; Decision Index not scored. The footer reads 'Both sets vendor-reported; MiniCPM5-2B figures are ModelBest's own comparison set.'

並べて、来歴をラベル付けして

以下の数値はすべてベンダー報告によるものです。MiniCPM5-2Bの数値は、ModelBest自身のモデルカードおよび独自の比較セットに基づいています。Liquid AI d1-3Bの数値は、公開リーダーボードに提出するのではなく、Liquidが公式Decision Indexスコアラーを自ら実行して得たものです。オープンウェイト公開時点で、どちらのモデルも第三者による独立したベンチマーク評価を受けていません。

• パラメータ — Liquid AI d1-3B 合計3.12B、400MのSigLIP2ビジョンエンコーダと128,000トークンの語彙を備える;MiniCPM5-2B 合計2,516,756,480、非埋め込み1,981,982,720、48層、16クエリヘッド、2 KVヘッド、語彙130,560。

• コンテキスト — Liquid AI d1-3B では 32,768 トークン、MiniCPM5-2B では 131,072

• 入力モダリティ — Liquid AI d1-3B はテキストと画像、MiniCPM5-2B はテキストのみ。

• 出力 — Liquid AI d1-3B 向けの、出力トークンゼロでの確率、ラベル、信頼度、順序付きスコア;MiniCPM5-2B 向けの生成テキスト、推論、XML ツール呼び出し。

• ヘッドラインスコア — Liquid AI d1-3B は Decision Index 0.2.1 で 48.57 を記録し、ベンダーの表では 10B 未満のモデルの中で首位。MiniCPM5-2B は独自の比較セット全体で平均 53.9 だが、これは別のセットであり、測定しているものも異なる。

• 速度 — RTX 4090では質問あたり8 ms、Jetson AGX Orin 64 GBでは26 ms、Jetson Orin Nanoでは50 ms、Liquid AI d1-3Bでは1パスあたり64個のパック状態を毎秒475回。MiniCPM5-2Bの速度は生成するトークン数に依存するため、それと対比させる単一の数値は存在しない。

• ライセンス — Apache-2.0、ゲートなし、トレーニングデータ公開済み、MiniCPM5-2B向け;Liquid AI d1-3B向けのLiquidのlfm1.0。

• 根拠 — MiniCPM5-2B は Hugging Face で100万回以上ダウンロードされ、コミュニティによる量子化が1か月続いている。一方、Liquid AI d1-3B は存在して2日で、サードパーティによる実行はない。

それぞれが実際に得意な仕事

両方のモデルが実行できるワークフローがあり、それをどう実行するかの違いが議論のすべてだ。

サポートチケットをトリアージしたり、取得した文書が質問に答えているかを判断したり、LLM の出力をルーブリックに照らして採点したりしているとします。MiniCPM5-2B はその3つすべてを実行できます。ツール呼び出しと長いコンテキストを備えた、有能な小型推論モデルであり、ほかのアシスタントと同様に実行し、ラベルを要求してから返ってきたものを解析することになるでしょう。時にはきれいな JSON を返します。時には説明で包まれた JSON を返します。時には正しい答えを誤った形で返し、その取りこぼしはモデルではなくパーサーのバグです。

Liquid AI d1-3B はそれ以外のことは何もできないが、まさにそこが要点だ。同じ3つのタスクで、それは確率とラベルを返すだけで、解析すべきものは何もない。1つの状態に対して3つの質問をすると、1つの場合の1.3倍の時間がかかり、故障モードは「フォーマットが壊れた」から「信頼度が誤校正されていた」へと移る——少なくともこれは測定可能だ。なぜなら信頼度は応答の中にすぐそこにあるからだ。

MiniCPM5-2B が完全に勝るのは、意思決定より下流のあらゆる部分です。131K トークンを保持できるため、状態は長い文書の 1 ページ目ではなく、リポジトリのファイルツリー全体または長い文書そのものにできます。ツール呼び出しをネイティブに書き出します。小さなエージェントを構築できるモデルであり、エージェント型の作業向けに明示的にポストトレーニングされています。さらに Apache-2.0 ライセンスなので、よくある企業法務弁護士とのやり取りは発生しません。

Liquid AI d1-3B が明確に優位に立つのは、レイテンシの下限とモダリティだ。GPU なしで 50 ms で判断を実行するデバイスは、MiniCPM5-2B を動かすデバイスではない。パラメータ数は近いのに、両者は異なるハードウェア層に生きている。そして 3B は「見る」——ベンダーの報告では、判断として読まれる 11 の公開画像ベンチマークで 74.1、それが基になった視覚言語モデルは 73.9 だった。さらに画像を取り除くと、同じ質問は 45.1 まで崩落すると報告しており、これは答えがピクセルから来ていることを示すための彼らなりの方法だ。生産ラインの目視検査は、テキスト専用の 2B にはそもそも任せられないタスクである。

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

それらを実行すること、そしてそれらを取り巻くレイヤー

どちらもセルフホストの話であり、どちらもデプロイ作業は済んでいます。Liquid AI d1-3B は初日から llama.cpp をサポートし、DGX から Jetson までの NVIDIA スタック一式、NVFP4 量子化、8ビットの重みと活性化のビルド、そして公開済みの GGUF 変換を備えています。MiniCPM5-2B は素の LlamaForCausalLM アーキテクチャでカスタムカーネルは不要、BF16 safetensors シャードが1つ、より広いファミリーには GGUF と MLX のビルドがあり、ツールコールパーサーが必要な場合には SGLang が好まれると文書化されています。どちらも当社のカタログには載っておらず、本記事はどちらについても提供状況を主張するものではありません。

ホスト型の代替手段は、ベンダー自身のAPIとサードパーティのプラットフォームです。Liquidはホスト型のd1を提供しており、入力トークンのみで課金され、100万トークンあたり0.04ドル、画像は32×32ピクセルのパッチあたり1.5トークンとして入力扱いで課金され、出力の課金行は一切ありません。MiniCPM5-2BにはファーストパーティのAPIがありませんが、これはApache-2.0のオープンウェイトリリースでは普通のことです。

両者が最終的に行き着く先は、同じアーキテクチャ上の問題です。分類、ルーティング、ガードレールチェックを担うローカルの2Bまたは3Bモデルは、あなたがホストしていない生成呼び出しの手前に位置します。そして、所有する推論と借りる推論が隣り合うこの混在こそ、ルーティング層が吸収するために存在するものです。200以上のモデルをまたぐ単一のエンドポイント、プロバイダーの定価を0%のマークアップでそのまま渡すことで、ベンダーの価格変更が当日に反映され、自動フェイルオーバーで上流のいずれかが劣化したときに対応します。小さいモデルを所有することは、ルーティングの問いを簡単にするどころか、難しくします。なぜなら今や、あなたのハードウェアと他人のハードウェアの境界は、リクエストごとに下さなければならない判断だからです。

回答タイプで選択

もしあなたが必要としているものがラベル、確率、評価のいずれかで、選択肢の集合が事前にわかっているなら、Liquid AI d1-3B のほうがより正直な計器だ — それはその要求のために作られたもので、回答が壊れた形で届くことはない。ベンダーライセンス、32K コンテキスト、そして2日前の証跡を、その代償として受け入れよ。

必要としているのが、推論し、ツールを呼び出し、長い文書を保持し、言葉で答えられる小型モデルなら、MiniCPM5-2B のほうが大差で高性能なマシンです。しかも Apache-2.0 と、他者による100万ダウンロード分のテストという裏付けがあります。

どちらのリリースからも最も多くを得るチームは、両方を動かしているチームだ。前面に意思決定モデルを置き、そこでは答えは数値であり、ミリ秒が重要になる。その背後に小さな生成モデルを置き、言語を必要とする仕事の部分を担わせる。両者は競合ではない。一方はフィルターであり、もう一方はスピーカーだ。

A capture of our own models catalogue page showing the filter rail for input modalities, context length, input price, status and series, a header reading '207 models, 16 providers, one API key, one bill', and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.