
Liquid AI d1-3B 対 Qwen 3 8B:8Bの分類ワークロードは意思決定モデルに移行すべきか?
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
ほとんどの本番スタックのどこかで、Qwen 3 8Bがyesかnoかを答えるために報酬を得ている。それはコメントをモデレーションし、サポートチケットにタグを付け、検索で得た一節が関連するかを判断し、あるいは別のモデルの出力をルーブリックに照らして採点する——そしてそれは、下流の何かが後でパースするテキストを生成することで行われる。Liquid AI d1-3Bは、Liquid AIが2026年10月7日にオープンウェイトで公開した3.12Bの意思決定モデルで、まさにその仕事を、何も生成せずに行うために存在する。状態を入力し、名前付きの質問集合を入力すると、確率、ラベル、信頼度を、出力トークンゼロの単一フォワードパスで出力する。Qwen 3 8Bは、ベンダーが2025年4月に公開したオープンウェイトの主力モデルであり、約8.2Bのdenseパラメータ、119言語、リクエストごとにthinkingをオン/オフできる柔軟さ、そして16か月にわたるコミュニティでのデプロイ実績を備えている。この組み合わせが実際に投げかける問いは、狭く実用的だ。あなたのトラフィックのうち分類に当たる部分にとって、2026年にラベルを得る最も安価な方法は8Bの汎用モデルなのか、それともその仕事の形はその足元で変わってしまったのか?
あなたが実際に8Bに支払ってやらせていること
二つの出力契約を並べてみれば、その非効率は漸進的なものではなく構造的なものだとわかる。
Qwen 3 8B の分類呼び出しは生成です。ラベルを記述したプロンプトを書き、モデルは任意で入力について推論し——このモデルではリクエストごとにその推論をオンまたはオフにでき、これがこの種の作業においてこのモデルが持つ最も有用な調整つまみです——その後、モデルは答えを書き戻します。その答えはテキストです。JSON を求めたなら通常は JSON が返ってきますが、ときには文の中に JSON が入っていたり、前置きや、望まなかった末尾の説明が付いたりします。あなたが注目するラベルはトークン列のどこかにあり、パーサーがそれを取り出します。モデルが書き出すすべてのトークンに対して課金され、捨てるトークンも含まれます。
Liquid AI d1-3Bにはトークンストリームがありません。質問は型を指定して宣言します:noulははい/いいえ用で、0から1の間のP(yes)として回答されます;choiceは名前付きオプションセットから1つのラベルを選ぶためのもので、ラベルと信頼度、およびオプションごとの確率として回答されます;scoreは、順序付けられた2~10段階の位置用で、期待レベルとその分布および凡例として回答されます。応答には、次を表示する累計が含まれます:output_tokens: 0。何も書き込まれていないため解析するものは何もなく、生のprobabilitiesアクセサがあり、丸められていない分布が必要な場合はargmaxではなくそちらを使用します。
請求額を変えるのは、複数の質問を扱うときに何が起きるかだ。1つの状態は多くのものを抱えられる。これは返金リクエストか、どのチームが担当すべきか、どれほど緊急か。状態とその画像は一度だけ読み取られ、Liquid は1つの状態に対する3つの質問が、1つの場合の3倍ではなく1.3倍の時間で済むと報告している。それが畳み込まないのは入力課金だ — ベンダーの請求に関する注記は明快で、各質問はそれ自身のプロンプトとして、そのテキストとすべての画像を含めて課金される。レイテンシは減り、入力トークンは同じ。それは見出しに対する正直な但し書きであり、ベンチマークではなく料金の段落を読むことで初めて見つかる類のものだ。

Qwen 3 8Bの16ヶ月がもたらすもの
小型モデルをアップグレードとして扱う前に、現行モデルが何をもたらすのかを正確に把握すべきです。それはパラメータ数だけにとどまるものではありませんから。
• コンテキスト — Qwen 3 8B はネイティブで 32,768 トークンを実行し、YaRN を通じて検証済みの 131,072 まで拡張します。Liquid AI d1-3B は 32,768 トークンを固定で実行し、文書化された拡張パスはありません。長い文書が状態である場合、8B はこの 2 つのうち、それを保持できる唯一のものです。
• 言語 — Qwen 3 8Bでは119言語と方言、Liquid AI d1-3Bでは文書化されているのは16言語です。
• 推論制御 — Qwen 3 8B では、リクエストごとに思考をオンまたはオフにできます。Liquid AI d1-3B には制御できる推論モードがありません。これは、思考を何に使っていたかによって、簡素化とも制限とも言えます。
• 広さ — 8Bは書き、説明し、要約し、翻訳し、コードを書く。Liquid AI d1-3Bはそれらのどれも行わない。そのカードには明白に記されている:チャットモデルではなく、テキストを書かない。
• 根拠 — Qwen 3 8B には、16か月にわたる公開ベンチマーク、量子化、ファインチューニング、本番利用の実績がある。Liquid AI d1-3B の Decision Index スコア 48.57 は、公開リーダーボードに提出されたものではなく、Liquid が公式スコアラーを使用して算出したものであり、まだ数日しか経っておらず、第三者による再現もない。
• 視覚 — この行は逆方向に進みます。Liquid AI d1-3B は画像を扱い、ベンダーは11の公開画像ベンチマーク全体で74.1を報告しており、これは各ベンチマークの選択肢セットに対する判断として読まれ、また画像を取り除くと同じ質問が45.1にまで崩壊すると報告しています。テキスト専用の Qwen 3 8B は、そのいずれを行うにも別の視覚モデルをその前段に必要とします。
• 速度 — RTX 4090では1つの質問を8 msで、Jetson AGX Thorでは16 msで、Jetson Orin Nanoでは50 msで処理し、4090では1パスあたり64個のパック状態を毎秒475回処理します。生成ベースの分類器には比較できる数値がありません。そのレイテンシは回答の長さに依存するためです。
正直にまとめると、8B はより優れた汎用の道具であり、3B の意思決定モデルはより優れた特化型であり、重要な問いはただ一つ、あなたのトラフィックのどれだけがその特化したケースなのかということだ。
慎重に行うコスト計算
ここが、その比較が元を取れるかどうかの分かれ目であり、だからこそ、スローガンではなく実際の構造をもって取り組む価値がある。
Liquidがオープンウェイト公開の2日前に発表した主張は、同社のホスト型意思決定モデルが6つの実アプリケーションのうち4つでGPT-6.1 Solに匹敵するか上回り、コストは19倍から200倍低く、すべてのタスクでより速く回答するというものだ。繰り返す前に方法論を読んでほしい。各アプリケーションは2026年10月5日にモデルごとに1回実行され、チャットモデルはデフォルトの推論設定でJSONで回答し、d1のコストは入力100万トークンあたり0.04ドルで計算された。この0.04ドルという数字は、ホスト型のd1入力レートであり、存在する唯一のレートだ — 加算すべき出力行はない。
では、Qwen 3 8B 分類器について同じ形の見積もりを組み立てよう。そうすれば、誰のプロバイダー価格を引用しなくても、非対称性が見えてくる。8B には課金対象項目が2つあるのに対し、意思決定モデルには1つしかなく、増えるのは2つ目の項目だ。先に推論する分類は推論の分を支払い、JSON を水増しする分類は水増しの分を支払う。意思決定モデルの入力料金は、状態と質問によって固定される。8B の入力料金は、状態だけから予測できるどんなものによっても固定されない。
これが一方的な敗北になるのを防いでいる対抗要因が二つある。第一に、決定モデルは各質問をそれぞれ独自のプロンプトとして課金するので、一つの長い文書について五つの質問をすると入力が五倍になる——8Bは五つすべてを一度の呼び出しで尋ね、文書の代金を一度だけ払う。第二に、そしてより大きな要因だが、決定モデルは、その形式で答えるように事後訓練された質問にしか答えられない。説明、要約、あるいは言葉で表現された判断を必要とするものは何であれ、あなたを汎用モデルに戻し、実際には両方の代金を払う状態に戻す。

その二人が本当に得意としていること
ベンチマークを取り除いてしまえば、その分割はパラメータ数から示唆されるよりもすっきりしている。
Liquid AI d1-3Bは、イエス/ノー、リストからの選択、そして評価(レーティング)のためのモデルであり、生成モデルには決して到達できないレイテンシの下限で動作し、Jetson Orin Nano では50 ms、ラップトップでも動くハードウェアを含む範囲をカバーする。Liquid が10月に披露したアプリケーションは、すべてこの形のバリエーションだった。150件のサポートチケットに対してイエスかノーを答える SQL 述語、各ツール出力を保持・縮小・破棄してトークンの52%を削減するエージェントのコンテキスト圧縮ループ、4つの生産ラインから良品と不良品を選別する検査アプリ(まったく訓練されたことのない、短い説明から理解したタスクで85〜97%の精度)。最後のデモは、このカテゴリが何のためにあるのかを最も明確に語っている。答えはいくつかのうちのどれかであり、状態は画像で、説明は一切求められない、そんな仕事だ。
Qwen 3 8Bは、言語として返ってくる必要がある作業、119言語にまたがる作業、32,000トークンを超える文書を保持する作業、または確定する前に声に出して推論する作業に向いています。また、分類が上記の3つの型のいずれでもない場合の正解でもあります — ラベルセットがオープンエンドである場合、あなたが思考を求めたくなるほど基準がニュアンスに富む場合、同じ呼び出しが、2つのモデルの間でルーティングすることなく、易しいケースと難しいケースの両方を処理しなければならない場合です。そして、レビュアーがどのような独立したベンチマークが存在するのかと尋ねたときの安全な選択肢でもあります。なぜなら、その答えは、たくさんあり、1年半前までさかのぼるからです。
これを正しくやっているチームは、どちらかを選んだりしない。判断モデルを汎用モデルの前段に置き、答えが数値になるトラフィックの部分を担当させ、文章が必要なものはすべて8Bに処理させる。フィルターは3Bで8 ms、8Bはペイロード用に残る。
ペアをデプロイしています
Liquid AI d1-3Bは、デプロイ作業がすでに済んだ状態の重みとして登場します。初日からのllama.cpp対応、DGXからJetsonまでをカバーするNVIDIAスタック全体、NVFP4量子化、8ビットの重み&活性化版、そしてHugging Face上でのGGUF変換です。Qwen 3 8Bは、この重みクラスのどのモデルよりも深いセルフホスティングのエコシステムを備えています。どちらも当社のカタログには掲載されておらず、ここに記した内容はどちらについても提供可否を主張するものではありません。Liquid AI d1-3Bのホスト型の利用経路は、ベンダー自身のAPIとサードパーティのプラットフォームであり、そこでホストされるd1の価格は入力トークンのみに基づいて100万トークンあたり0.04ドル、画像は32×32ピクセルのパッチあたり1.5トークンとして課金されます。
両方が同じパイプラインに入れば、ルーティングの問題はもはや理論上の話ではなくなる。自社で保有する小規模モデル、ホストするか借りるかする8B、そして確実に借りることになる生成呼び出しがあり、リクエストごとに、特定の入力がどれに当たるべきかを決めることこそ、まさにルーティング層が存在する理由である判断だ。プロバイダーの定価を0%のマークアップでそのまま渡し、ベンダーの価格変更が同じ日にあなたの側で反映される自動フェイルオーバーを備えているので、アップストリームの不調な午後があなたの障害になることはない。分類トラフィックが年間数十億回の呼び出しで測られるようになると、3Bの判断モデルによる節約が実際に回収されるのはこの層なのだ。
評決
もしあなたの8Bがクローズドクエスチョン——これは有毒か、これは関連するか、これはどのキューに属するか、どれほど緊急か——を問われているなら、あなたはラベル1つのために汎用モデルの2行分の請求と生成1回分のレイテンシを払っており、Liquid AI d1-3Bは、証拠の裏付けが弱く、ライセンスに実際の違いがあることを比較検討すべき直接的な代替だ。32Kのコンテキスト上限、16言語、そしてLiquidの外部ではまだ誰もそれをスコア評価していないという事実を受け入れよ。
あなたの8Bが説明、要約、翻訳、長い文書の保持、または決定前の推論を求められているなら、この比較はあなたには当てはまりません。8Bを使い続け、判断モデルは、事前に簡単な種類だと見極められるトラフィックのプレフィルターとしてのみ検討してください。
注目すべき興味深い数字は、どちらのモデルのベンチマークスコアでもない。それは、d1 Decision Indexの最初の独立した再現がどれだけ早く出るかであり、まさにその瞬間に、この比較はベンダーの主張であることをやめ、計画の根拠にできる事実になるからだ。

