「Liquid AI d1-3B vs Gemma 4 12B」という見出しのヒーロータイトルカードで、サブ見出しは「汎用モデルに対する意思決定モデル」、小さな3.12Bのチェックリストカードが確率チップを伴い、文書、波形、フィルムフレームのアイコンと記述回答チップを備えたより大きな11.96Bのカードの隣に表示されている。
Guides & Insights

Liquid AI d1-3B 対 Gemma 4 12B:汎用モデルに対する意思決定モデル

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較を最も手っ取り早く間違える方法は、Liquid AI d1-3B と Ge​mma 4 12B を同じベンチマークに載せて、勝者が決まるのを待つことだ。両者は同じ問いに答えているわけではない。Liquid AI d1-3B は 2026年10月7日にオープンウェイトとして公開された 3.12B の意思決定モデルで、状態と名前付きの質問群を与えると、確率と選択されたラベル、そして信頼度を返す。出力トークンはゼロ、生成ステップもない。Ge​mma 4 12B は Goo​gle のエンコーダー不要の any-to-any 汎用モデルであり、11.96B のチェックポイントで、テキスト・画像・音声・動画を受け取り、256,000トークンのウィンドウにわたって 140 以上の言語で回答を書き出す。一方は、基板が4つのうちどれなのかを教えてくれる。もう一方は、その理由を教えてくれる。品質だけで両者を比べても何も学べない。出力がそもそも比較可能ではないからであり、しかも両ベンダーが互いをベンチマークしたことは一度もない。実際の呼び出しが何を返すのか、いくらかかるのか、そしてそれぞれがどこで限界を迎えるのかで比べれば、この組み合わせは真に有用な境界テストになる。

2つの異なる出力コントラクト

ここで重要な役割を果たしている区別は、通信回線上で返ってくるものだ。

Liquid AI d1-3B は構造化された回答オブジェクトを返します。リクエスト内の各質問はタイプを宣言します — noul は P(yes) を伴うはい/いいえ用、choice は、名前付きの選択肢セットの1つに対するもので、信頼度と選択肢ごとの確率を伴うもの、または score は、順序付けられた2~10段階の尺度上の位置に対するもので、期待されるレベルとその分布を伴うものです。モデルは output_tokens: 0 を報告します。何も書き出されないためです。1つの状態に関する複数の質問は単一の順伝播で読み取られ、その状態とその画像はそれらすべてに対して一度だけエンコードされます。

Ge​mma 4 12Bは散文を返します。要求したJSONを返すこともあれば、正確には要求していなかったJSONを返すこともあり、答える前に推論することもできます。これは何よりもまず言語モデルであり、分類できるものはすべてテキストとして表現します。それは、答えを人間に説明しなければならない場合や、言語を期待する下流のステップに渡す場合には強みとなり、必要なものが確率だけであった場合にはコストになります。

下流のすべてはそこから導かれる。d1-3Bの応答がパースに失敗することはない。また、自己を説明することもできず、モデルカードにも直接そう記されている。それはチャットモデルではなく、テキストを書かない。

証拠の手がかりは今どうなっているか

2つの数値セットの出所は同等ではなく、ここではそのことのほうが数値そのものよりも重要だ。

• Decision Index 0.2.1 — Liquid AI d1-3B は 48.57 を獲得。ベンダーが公式スコアラーを用いて採点したもので、10B 未満のモデルの中で首位となり、47.11 の Decider 35B-A3B をも上回る。Ge​mma 4 12B は Decision Index ではまったく採点されていないため、この行に対応する項目はない。

• 推論ベンチマーク — Ge​mma 4 12BはAIME 2026で77.5、GPQA Diamondで78.8、Codeforces ELO 1,659を記録し、推論モードでArtificial Analysis Intelligence Index 22、推論オフで13を獲得。Liquid AI d1-3Bには推論ベンチマークがない。なぜなら、意思決定モデルは採点対象となる推論トレースを生成しないからだ。

• ロングコンテキスト — Gemma 4 12Bは256,000トークンに対応し、Google自身のモデルカードでは128kでのMRCR v2 eight-needleで43.4%を記録しています。Liquid AI d1-3Bは32,768トークンに対応します。もしあなたの「状態」が40ページの文書とスキャン類なら、その差が判断のすべてであり、接戦でもありません。

• ビジョン — Liquid AI d1-3B は、11 の公開画像ベンチマークをそれぞれの選択肢集合に対する意思決定として読み取った平均で 74.1 を示し、その基になった LFM2.5-VL-3B バックボーンの 73.9 を上回る。またベンダーによれば、画像を取り除くと同一の質問は 45.1 まで落ち込む。Ge​mma 4 12B のものはより強力だが、それは名前付き選択肢に対する精度としてではなく、生成品質として報告されている。

• 言語 — Liquid AI d1-3B では16言語が文書化されており、Ge​mma 4 12B では140以上です。

• 速度 — Liquid AI d1-3B は、RTX 4090 で1つの質問に8ミリ秒、Jetson AGX Thor で16ミリ秒、Jetson AGX Orin 64 GB で26ミリ秒、Jetson Orin Nano で50ミリ秒で回答し、4090 では64個の状態を単一パスに詰め込んで毎秒475回を処理します。Ge​mma 4 12B は生成型であるため、そのレイテンシは書き出すトークン数に依存します。

• 証拠の質 — Ge​mma 4 12Bの結果はGoo​gleのもので、2026年6月に公開され、その後、大規模なコミュニティによって検証され、量子化され、再実行されてきた。Liquid AI d1-3Bの結果はLiquidのもので、2日前に公開されたばかりで、ラボ外の誰にも再現されていない。2列目はそれを踏まえて読むこと。

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

彼らが本当に競い合う唯一の場所

実際に重なる部分があり、それはリーダーボード上の話ではない。それはLLM-as-a-judgeの呼び出しだ。

多くの本番パイプラインはすでに、中規模の汎用モデルを評価レイヤーとして使っている。このチケットの緊急度を採点する、この出力がルーブリックを通過するか判断する、エージェントが次に呼び出すべきツールを選ぶ、検索されたパッセージが質問に答えているか確認する、といった用途だ。今日では、そうした呼び出しのほとんどは、数値やラベルをテキストとして出力するよう求められる生成モデルに送られ、そこで出力される数値は、選択肢集合に対するソフトマックスではなく、サンプラーが生成したそのままの値になっている。それこそが Liquid AI d1-3B が置き換えるためにポストトレーニングされたワークフローであり、公開されているデモはすべてそのバリエーションだ — 150件のサポートチケットに対して yes か no を答える SQL 述語、各ツール出力を保持・削減・破棄し、トークンを52%削除するエージェントのコンテキスト圧縮ループ、4つの生産ラインから良品と不良品を選別し、訓練されたことのないタスクで85~97%の精度を達成した外観検査アプリ。

Ge​mma 4 12Bはこれらの仕事をすべてこなし、さらにそれ以上のことも行います。要約を書くことも、256Kのドキュメントを視野に収めることも、録音された電話通話を入力として受け取ることも、140以上の言語のいずれかで回答することもできます。パイプラインが評価とナレーションを必要とするなら、12Bは1回の呼び出しで2つの仕事をこなし、3Bの意思決定モデルがそのうちの1つを担っていることになります。

境界はコンテキスト長と出力形状にある。長い状態、音声入力、多数の言語、あるいは読者が期待する説明なら——Ge​mma 4 12B、比べるまでもない。短い状態、固定された選択肢セット、1リクエストあたり1桁ミリ秒のレイテンシ予算、あるいは回答が必ずパースされるという厳格な保証——それが d1-3B の列であり、汎用モデルはあなたが使わない能力にコストを払っている。

それぞれの通話料金

どちらのモデルも当社のカタログには載っていないため、どちらについてもルーティング価格をご提示できません — Gemma 4 12B は当社が提供している Gemma のサイズには含まれておらず、Liquid AI d1-3B はご自身でホストするか、ベンダー自身の API やサードパーティのプラットフォームを通じてアクセスするオープンウェイトです。そのファミリーの Gemini 寄りの側面について補足すると、当社がルーティングしている Gemma 4 の2つのサイズは、Gemma 4 26B A4B が入力100万トークンあたり $0.06、出力100万トークンあたり $0.33、Gemma 4 31B が $0.13 と $0.38 で、いずれも 262,144 トークンのコンテキストとテキスト・画像・動画入力に対応しています。Gemma 4 12B について他社で提示されているプロバイダー価格の中央値は $0.10 と $0.30 前後です。

Liquidのホスト型d1は、入力トークンのみを課金対象とし、100万トークンあたり$0.04、画像は32×32ピクセルのパッチあたり1.5トークンとして入力にカウントされます。したがって、意思決定リクエストには出力トークンの行がまったく存在せず、これが、ベンダー自身によるはるかに大規模なモデルとのコスト比較が今の結果に落ち着く構造的な理由です。オープンウェイトには呼び出しごとの価格はなく、ハードウェアで支払います。どちらも、あなたが呼び出す他のすべてと同じパイプラインに収まる必要があり、それがルーターが存在する理由となるレイヤーです — 200以上のモデルにまたがる単一のAPI、プロバイダーの定価を0%のマークアップでパススルー、そして自動フェイルオーバーにより、単一の上流側の一時的な不具合があなたの障害になることはありません。それは比較を取り巻く配管であり、比較そのものではありません。

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

正直なところ、どう決めればいいのか

モデルからではなく、回答フォーマットから始めよう。下流システムが確率、ラベル、信頼度を利用でき、回答セットが小さく既知であるなら、Liquid AI d1-3B は 12B からのダウングレードではない。それは別の道具であり、そのレイテンシの数値は、それを根本的に異なるデプロイにする。Jetson Orin Nano での 50 ms というのは、12B を動かす筋合いがまったくないデバイスだ。

答えが文でなければならない場合、または状態が32,000トークンを超える場合、または誰かがそれを話す場合、または出力言語がベンガル語である場合、Gemma 4 12Bはその仕事をできる2つのうちの唯一のものであり、比較は始まる前に終わっている。

ほとんどのチームにとって本当に有用なのは、両方を別々の場所で使うことだ。高コストな呼び出しの手前に判断モデルを置き、言語を必要としないトリアージ、ルーティング、ガードレールのチェックを担わせる。その背後に汎用モデルを置き、言語を必要とする作業を担わせる。これらは同じパイプラインであり、一方はフィルター、もう一方はペイロードだ。そして、d1リリースから最も多くを得られるのは、すでにイエスかノーを答えるために12Bを使っているチームだ。

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.