
Liquid AI d1-3B と d1-omni-600M:一言も書かないモデル向けのオープンウェイト
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Liquid AI d1-3B と Liquid AI d1-omni-600M は2026年10月7日にHugging Faceで公開され、この2つのチェックポイントには、今年読んだあらゆる比較表を根本から間違った形にしてしまう特性がある。どちらもテキストを生成しない。Liquid AI d1-3Bに状態——サポートチケット、JSONペイロード、写真、あるいはその3つすべてを同時に——と、名前付きの質問群を渡すと、モデルのあなたの選択肢上の分布から直接抜き出した答えを返す。はい/いいえを確率として。ラベルの中からの選択を信頼度と完全な確率ベクトル付きで。順序尺度上の位置を。サンプリング工程も、解析すべきJSONも、暴走生成もなく、ベンダー自身の使用量カウンターがそれを端的に報告する:output_tokens: 0。3Bモデルは話題の中心だ——ベンダー採点のDecision Index 0.2.1で48.57を記録し、10B未満のあらゆるモデルを上回り、12倍のサイズの意思決定モデルさえ上回る。600Mの兄弟モデルのほうが注目に値する:同じトランク重みを通して画像と最大30秒の音声を読み取り、早期研究リリースとして位置づけられている。
意思決定モデルとは何か、1段落で
このカテゴリは、システム1モデルや「分類器ではない分類器」といった名前のもとで1年かけて形成されてきたが、d1のペアはこれまででその最も明快な表明だ。生成モデルは質問を投げかけられて答えを書き出す。その答えは解析されなければならず、解析は失敗しうるし、書き出すトークンごとに金と時間がかかる。決定モデルは質問を投げかけられ、すでに信じていることを報告する。Liquidの質問には3つのタイプがある。noulははい/いいえの質問で、0から1の間のP(yes)で答えられる。choiceは名前付きの集合から1つのラベルを選び、そのラベル、信頼度、各選択肢の確率を返す。scoreは状態を2〜10レベルの順序尺度上に位置づけ、期待されるレベルをその分布と凡例とともに返す。1つの状態は複数の質問を同時に保持でき、その状態とその画像はそれらすべてに対して一度だけ読み取られる。
その最後の特性こそが、ビジネスケースのすべてだ。1枚のチケットについての3つの質問にかかる時間は、1つの質問の1.3倍であり、3倍ではない。モデルが入力に対して1回のフォワードパスを行い、そこから複数の答えを読み取るからだ。書くべきものは何もない。だから、下手に書くべきものも何もない。
3Bと600Mは反対の方向から作られている
ここがこのリリースが技術的に面白くなるところであり、ローンチ時の報道がほとんど触れてこなかった部分だ。この2つのモデルは系統を共有していない。
Liquid AI d1-3Bは、同ベンダーのデコーダーのみの視覚言語モデルであるLFM2.5-VL-3Bの系譜に連なる。3.12Bのパラメータ、SigLIP2 NaFlexの形状最適化された400Mの視覚エンコーダー、32,768トークンのコンテキストウィンドウ、128,000トークンの語彙、そして文書化された16言語を備える。これを構築するにあたり、LiquidはLFM2.5-2.6BとLFM2.5-VL-3Bのテキストバックボーンの重みを平均し、複数のランダムシードとデータ混合からファインチューニングしたチェックポイントを作成し、その結果を再びマージした。何が重要だったかについてのベンダー自身の要約は、清々しいほど地味なものだ。長い入力での学習、回答選択肢の順序のシャッフル、訓練データ内のショートカットの追跡が、最終的な数値にとってどんな高度な技法よりも役立ったというのである。
Liquid AI d1-omni-600MはLFM2.5-Encoder-350Mから派生しています。これは双方向エンコーダであり、まったく別種のネットワークです。パラメータは合計587Mで、381Mの共有トランクと決定ヘッド、LFM2.5-VL-450Mから借用した94Mの視覚エンコーダ、17層のFastConformerで構築された112Mの音声エンコーダに分割されています。すべてのモダリティは同じトランク重みを通ります。コンテキストは16,384トークンで、テキスト、画像、音声の位置をまとめてカバーします。画像が添付されている場合、状態と質問のテキストは896トークンに切り詰められます。それがトレーニングされた内容だからです。音声には、カードが曖昧さなく述べる1つの警告があります。この機能は英語話者とアシスタントの間のリクエストでトレーニングされており、クリップは30秒で切られます。
つまり、このファミリーは同じモデルを2つのサイズで展開したものではない。それはデコーダーとエンコーダーであり、まったく異なる2つのメカニズムで同じ仕事をするようにポストトレーニングされていて、一方は見て、もう一方は聞く。

数字、そしてそれが誰のものか
このセクションのすべての数値はLiquid自身によるものです。d1モデルのDecision Indexの行は、公式スコアラーを使ってベンダーが採点したもので、リーダーボードには提出されていません。一方、競合する行はすべてv0.2.1時点の公開リーダーボードから来ています。まだどの独立系ラボもこれを再現しておらず、これを書いている時点でモデルは2日前のものです。
• Decision Index 0.2.1 — Liquid AI d1-3B は48.57を記録し、サブスコアはKnowledge 23.8、Language 56.4、Retrieval 52.8、Tools 74.5、Arts 36.3。Liquid AI d1-omni-600M は15.95で、Toolsは15.1。
• 48.57がどこに位置するか — ベンダーが公開した表で、10B未満のすべての中で首位であり、47.11のDecider 35B-A3Bを上回っている。総合では2位で、50.02のWinnow-12Bに次ぐが、そのサイズは4倍だ。
• テキストベンチマーク、ベンダー報告値 — d1-3Bは7つの公開ベンチマークで平均82.9となり、Decider 4Bの81.1を上回る。d1-omni-600Mは平均78.4で、約4分の1のパラメータ数ながらDecider 2Bの77.1を上回る。600Mは表内最高の有害性スコア(Civil Comments 95.8)と言い換えスコア(PAWS-X 79.5)を記録する。
• 視覚、ベンダー報告 — d1-3Bは、11の公開画像ベンチマークで、各ベンチマークの選択肢に対する判断として読み取った場合、平均74.1となり、そのバックボーンであるLFM2.5-VL-3Bの73.9を上回る。画像を除くと、同じ質問は45.1まで下がる。これは、回答がピクセルから得られていることをベンダーが示す方法である。
• レイテンシ(ベンダー測定値)— 1 つの質問にかかる時間は、RTX 4090 で 8 ms、AMD MI325X で 9 ms。Jetson AGX Thor で 16 ms、Jetson AGX Orin 64 GB で 26 ms、最小構成の Jetson Orin Nano で 50 ms、Apple M5 Pro で 30 ms。64 個の状態を単一パスにまとめた処理は、4090 では毎秒 475 回実行される。
• 何が欠けているか — d1-omni-600M には推論テーブルがまったくありません。Liquid は活発に開発中であり、そのレイテンシを単に報告していないと述べています。また、リリースのどこにも音声判定ベンチマークはありません。なぜなら、ベンダーの言葉を借りれば、専用の音声判定ベンチマークは現在未解決の問題だからです。
リリースが実際に打ち出している主張
モデルの重みが公開される2日前に、Liquidはこのモデルのホステッド版を公開し、6つのアプリケーションでGPT-6.1 SolとClaude Opus 5.5に対して実行しました。その要約は次のとおりです。d1は6つのうち4つでGPT-6.1 Solと同等かそれを上回り、コストは19倍から200倍低く、すべてのタスクでより速く回答します。公開された方法論は、そのいずれかを繰り返す前に読む価値があります。各アプリケーションは2026年10月5日にモデルごとに1回実行され、チャットモデルはデフォルトの推論設定でJSONで回答し、d1のコストは入力トークン100万あたり0.04ドルで計算されました。
デモはより説得力のある半分です。4つの生産ライン——回路基板、キャンドル、カシューナッツ、ガム——から良品と不良品を85~97%の精度で選別し、そのモデルはそのタスクのために訓練されたことはなく、短い説明からそれを理解しました。150件のサポートチケットそれぞれに対してyesかnoで答えるSQL述語。コーディングエージェントのセッションで各ツール出力を読み取り、それを保持、削減、または破棄するコンテキスト圧縮ループ。トークンを52%削減しながら、タスクに必要なすべての出力を保持します。テトリスでは、完全にテキストで記述できるゲームに画面を追加することで、スコアが70ライン消去から81ライン消去に上がりました——テキストのみの分類器ではどれほど優れていても得られない視覚による結果です。
これらはベンダーが実施し、ベンダーが選んだタスクを使ったデモであり、方法論のセクションにもそう書かれている。それでもなお、これらは意思決定モデルが何のためのものかについて、これまでに誰かが公表した中で最も明確な全体像である。

Where it runs, and what it costs to call
オープンウェイトはローカル実行向けに作られており、ベンダーが統合作業を事前に済ませています。llama.cppへの初日対応、DGXからJetsonまでを含むNVIDIAスタック全体、NVFP4量子化、そしてベースチェックポイントと同時に公開された8ビットのウェイト/アクティベーション版です。GGUF変換版はすでにHugging Faceで公開されています。自分でホストしたくない場合は、Liquidが自社APIからホスト版のd1を提供しています。入力トークンのみで出力トークンはなく、画像は32×32ピクセルのパッチあたり1.5トークンとして入力課金されるため、1024×1024の画像は1,536トークンになります。テキストのみのアクセスはサードパーティのプラットフォームからも利用できます。
率直なルーティングに関する注記:Liquid AI d1-3B も Liquid AI d1-omni-600M も当社のカタログにはなく、本記事はどちらの提供可否を主張するものでもありません。d1 のペアがルーターにもたらす変化は、その周囲にあるパイプラインの形です。ミリ秒で応答し、出力トークンのコストが一切かからない意思決定モデルは、置き換えではなくフィルターです——良品と不良品の仕分けやチケットのトリアージは生成呼び出しの手前で行われ、生成呼び出しこそが、200以上のモデルにまたがる単一のエンドポイント、0%のマークアップでそのまま提供されるリスト価格、そして自動フェイルオーバーが真にその価値を発揮する場所です。レイヤーは違っても、パイプラインは同じ。
何がその議論に決着をつけるのだろうか
未解決のことが3つあり、そのいずれも時間だけが決着をつける類いのことだ。
第一は独立した再現です。Decision Indexの数値はベンダーが公式スコアラーで生成し、競合の行はすべて公開リーダーボードから取得したもので、これは防御可能な方法であり、第三者があなたのモデルを実行することとは同じではありません。第二はオーディオです。一回のフォワードパスで音声コマンドをルーティングする600Mのチェックポイントは真に新しい能力であり、それがどれほどうまく機能しているかを測定するベンチマークは存在しません。第三はカテゴリそのものです。答えが書き出されるのではなく分布から読み取られる場合、小規模モデルの通常の失敗モード — ループ、ドリフト、拒否、フォーマットの幻覚 — は単に発生し得ず、それらに取って代わるものについての優れた説明は誰も公表していません。キャリブレーション誤差は明らかな候補であり、それはまさにすべての回答の信頼度フィールドがあなた自身に測定を促すものです。
10のデモが、公開されたHugging Faceスペース上で、ライブカメラ入力に対してLiquid AI d1-3Bをループ実行しています。これは、自分自身の意見を形成するための最も安上がりな方法です。重みは無料で、問いは具体的です。それは、今年のほとんどのリリースが提供するものよりも良い出発点です。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
