
Liquid AI d1-3B 対 Intern-Decision-4B:実際に必要な較正済み意思決定モデルはどちらか?
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
オープンウェイトの2つのモデルが今や、何も書かないことで質問に答えている。そして、両者のI/Oスキーマを並べて見るまでは、同じアイデアが2回繰り返されているだけのように見える。Liquid AI d1-3Bは、2026年10月5日にHugging Faceへアップロードされ、2日後にLiquidが発表した3.12Bのマルチモーダル意思決定モデルで、そのモデルカードには、同モデルが「チャットモデルではなく、テキストを書きません」と率直に記されている。InternLMのIntern-Decision-4Bは、2026年9月26日に、ブログ記事もツイートもローンチページもないまま、InternLM organisationにひっそりとアップロードされた、Qwen3.5-4Bからファインチューニングされた4Bの意思決定モデルで、同様にすべての質問に対して1回のフォワードパスで回答分布を返す。表面上は同じ契約だ。だがその下にある違い——あなたにとって厄介になるライセンス、意図せずテキストを書いてしまう可能性のある契約、そして誰も比較したことのないマシン——が、どちらがあなたのスタックに属するかを決める。
両者が実際にどれほど近いのか
まずはっきりさせておくべきは、この比較のどこまでが引き分けなのかということだ。両モデルとも状態と名前付き質問のスキーマを受け取り、どちらもサンプリングではなくプレースホルダー位置のロジットから信号を読み取り、どちらもマルチモーダルで、どちらも何も書いていないと報告している。呼び出しの形としてはほぼ同一で、興味深い違いは周辺の細部にある。
• サイズ — Liquid AI d1-3B は合計 3.12B で、Liquid の LFM2.5-VL-3B をベースに構築。Intern-Decision-4B は 4B(モデルカードに記載されているテンソル数では約 4.54B)で、Qwen3.5-4B からファインチューニングされています。
• 質問タイプ — d1-3B と Intern-Decision-4B は同じ3つを使用します:noul ははい/いいえ用、choice は名前付きセットの1つ用、score は順序尺度上の点用
• 回答フィールド — d1-3B は回答に加えて信頼度と確率を返す;InternLM のスキーマは分布に加えて、モデルカードが較正済み確率ではないと警告している信頼度値を返す
• 入力上限 — d1-3B はコンテキスト 32,768 トークン、Intern-Decision-4B は 8,192 トークンの上限で、それより長いリクエストは切り詰めるのではなく一律に拒否し、画像もその上限にカウントされる
• ライセンス — d1-3B は Liquid の LFM Open License v1.0 の下で、InternLM 側は Apache 2.0
• 言語 — d1-3B は16言語を列挙、Intern-Decision-4B のカードには記載なし
• インターフェース — d1-3B はtrust_remote_code=Trueで読み込んで呼び出すモデルとして提供されます。Intern-Decision-4B はpip installする Python ライブラリとして提供され、実装されているバックエンドは1つだけで、リクエスト自体のmodelフィールドではチェックポイントを明示的に切り替えることはできません
• ベンダー自身のスコア — d1-3B は Decision Index 0.2.1 の公開スプリットで 48.57;Intern-Decision-4B は自身の7セット表で平均 90.02、ブライアスコア 0.347、期待キャリブレーション誤差 0.065
最後の2つの数値は比較できるものではなく、それらをスコアボードのように扱うことは、このページで最も簡単に犯してしまう唯一の間違いだろう。それらは異なるハーネス、異なる問題セット、異なる採点者から来ている。

キャリブレーションこそが製品のすべてであり、印刷物でそれを保証しているのは、そのうちの一社だけだ。
意思決定モデルは、答えの隣に返す数値が意味を持って初めて、そのレイテンシーに見合う価値を持つ。それがキャリブレーションだ:表明された信頼度0.9は、10回中約9回は正しいはずであり、自信がありながら間違えるモデルは、わからないと言うモデルよりも悪い。
InternLM がこれに取り組んでいる。そのモデルカードには、適合された温度 1.99241824 が記録されている。これは、1,728 件の指定されたキャリブレーションケースに対して負の対数尤度最小化によって導出され、1,693 件が検証用にホールドアウトされ、再現可能なように小数点以下 8 桁まで表示されている。また、96 件のケースに対する前後のパイロットを公開し、メカニズムが機能していることを主張するのではなく示している。キャリブレーション前の Brier 0.628 と ECE 0.213 に対し、後は 0.550 と 0.089 である。Brier と ECE は、提示された確率が正直かどうかを測る 2 つの標準的な指標であり、その傾向は顕著である。
Liquidは同等のものを公開していない。d1-3B自身のカードには精度系ベンチマークが記載されている——SQuAD 2.0 85.3、Civil Comments 93.0、MASSIVE intent 87.3、PubMedQA 66.0、BoolQ 86.7、XNLI 85.0、PAWS-X 76.9、平均77.1——さらにDecision Indexでの48.57と並び、同モデルが掲げる売りは較正された型付き回答だ。しかしECEの行も、Brierの行も、公開されたフィット温度もない。
その非対称性は、Qwen3.5-4Bの派生モデルがLFM2.5-VL-3B上に構築された3Bよりもキャリブレーションが優れているという意味ではない。それは、これら2つのカードのうち、一方は主張を再現するための計算を与え、もう一方は主張だけを与えるという意味だ。パイプラインが信頼度にしきい値を設けているなら——0.8超はルーティングし、0.4未満はエスカレーションする——今夜InternLM側は検証できるが、Liquid側は抜き取りチェックしかできない。
その注意点は双方に当てはまる。どちらの数値群もファーストパーティのものだ。どちらのモデルも独立した第三者によって評価されておらず、InternLMのキャリブレーションに関する主張は、InternLM自身のフィットに対するInternLM自身の96ケースのパイロットに依拠している。
番号の入力を求めてくるライセンス
Intern-Decision-4B は Apache 2.0 であり、Qwen3.5-4B から継承され、上流の通知も保持されています — 商用利用、再配布、ファインチューニング、その中に収益に関する問題はどこにもありません。
d1-3B は Liquid の LFM Open License v1.0 に基づいており、第5条は調達部門が読むまで誰も読まない部分です。商用利用は、あなたまたはあなたの法人が、同じ文書で年間収益1,000万米ドル以上と定義されているThresholdを下回っている場合に限って許諾されます。それを上回る利用は単にライセンスされていません。非営利団体と研究利用者は除外されています。
個人または小規模チームにとっては、どちらも無料です。財務部門があるような組織では、この2つのリポジトリは別の製品であり、その違いは、あなたが上回っているかどうかという数値です。
d1-3Bのベンチマーク表の末尾こそが、その真の主張だ
Liquidのカードの見出し数値はDecision Index 0.2.1で48.57で、Winnow-12Bの50.02からDecider 2Bの28.97まで及ぶ表の中で、他の10B未満の行を上回っている。その数値を引用に値するものにしているのは、その下に位置する識別指数(discrimination index)だ。Decision Index自体のサブスコアでは、d1-3BはToolsで74.5、Artsで36.3を記録する一方、Knowledgeでは23.8しか出せていない——それに対して、その12倍の規模を持つ36Bのmixture-of-expertsモデル、Decider 35B-A3Bは、Toolsで56.5、Artsで32.6、Knowledgeで31.8を記録している。

言い換えれば、3Bは一律に少し劣る小型モデルではない。構造化されたツール形式の判断では際立って強く、世界知識を必要とする問いでは際立って弱い小型モデルであり、それが作られた目的の仕事に最も近い2つのカテゴリでは36Bを上回る。あなたの判断が「この5つの名前付きアクションのどれか」と「これは検索されたパッセージに根拠があるか」であるなら、サイズ差が果たす役割は予想より小さい。あなたの判断が、モデルがあらかじめ保持していなければならない事実に依存するなら、23.8の差が現れると予想しておくといい。
その主張には、視覚側にもう一つのバージョンがある。d1-3Bは11の公開画像ベンチマークで平均74.1なのに対し、自身のベースモデルは73.9で、画像を取り除くと同じ質問のスコアは45.1になる——つまり画像に関する質問では、答えは本当に画像から来ている。それはベースモデルより優れているというより同等であり、ベンチマークごとの数値は一長一短だ。CV-Benchは82.1対87.6、POPEは88.5対90.1、BLINKは59.2対58.7。
InternLMのカードに見られる足踏みも注目に値する。高い総合値はTyped Decision 80.55やToolACE 96.45といった質問駆動型タスクによるもので、一方Jevons-Hardは73.87にとどまっている。スキーマが難しくなる箇所で、スコアは下がる。
スピード:ギャップは予想外の場所にある
d1-3Bは、RTX 4090での単一質問に対して8 ms、MI325Xで9 ms、1つの状態を共有する3つの質問で21 ms、Jetson AGX Thorで16 msを公称し、パックドスループットは4090で毎秒475決定、MI325Xで毎秒1,106決定です。
Intern-Decision-4Bのカードは、同じRTX 4090上でエンドツーエンド平均44.16を計測し、中央値は44.03 ms、P95は44.60 msです。
それは5倍の勝利に見えるが、そうではない。なぜなら、両者は別のものを測定しているからだ。Liquid の数値はウォーム状態でのモデル呼び出しで、一度に1リクエストずつ、カーネル選択とコンパイルのコストを前払いしている——カードには、4090 で CUDA graph コンパイルなしの場合、1つの質問に 16 ms かかると明記されており、新しい shape での最初の呼び出しはコンパイルのコストを支払う。InternLM の 44 ms は、実装済みバックエンドがローカルの Hugging Face 推論だけである Python ライブラリを通した、クエリごとのエンドツーエンドの値なので、周辺の仕組みも抱え込んでいる。どちらの数値も間違ってはいない。両方を同じハーネス、同じマシン、同じリクエスト形状の下に置けば、その差は、仮定するのではなく測定したくなる程度まで縮む。
疑問の余地がないのは上限です。8,192トークンはInternLM側では明確な拒否となり、画像トークンも同じ予算から消費されるため、長い文書とスクリーンショットの組み合わせは、切り詰められるのではなく拒否されて返ってくるリクエストになります。d1-3Bなら32,768トークンを扱えます。ステートがチケットや短いやり取りなら、この差が問題になることはありません。ページ単位の大きさなら、どのベンチマークよりも先にこの差が結論を決めます。
それらを入れ替えではなく、パネルとして実行してください。
Answering a specific yes/no and answering "which of six named things is this, and how sure are you" are different asks, and the two cards are shaped differently enough — one with a hard input ceiling and a published calibration fit, the other with 32K of context and a better scoring tail — that the useful deployment for a team evaluating both is often not a replacement but a panel: the same state posed to both models, with disagreements routed to a human or to a larger model.
どちらのモデルも当社のカタログには掲載されておらず、これは可用性に関する主張でもありません。どちらもセルフホスト型の成果物です。しかし、パネルはまさに、事務処理ではなくルーティング層が実際の仕事を担う形です。OrcaRouterは1つのAPIキーの背後に200を超えるモデルを公開しており、プロバイダーの定価を0%のマークアップでそのまま提供 — つまり、当社の背後でルーティングしているベンダーが値下げすれば、あなたの請求額も同じ日に動きます — そして、プロバイダー間の自動フェイルオーバーによって、2モデルのパネルが2つの単一障害点になるのを防ぎます。今日あなたがルーティングしているモデルはこの2つではありません。それらは、あなたが置き換えようとしているホスト型の汎用モデルです。例えばQwen3.5-27Bは、100万入力トークンあたり$0.086、100万出力トークンあたり$0.688で、これはGPUを計算に入れた後にセルフホストの3Bが打ち負かさなければならない数字です。
今週やること
意思決定が短いステートなら、ライセンスが自社のレビューを通過する必要があり、できるだけ広い範囲のビルドターゲット — llama.cpp、Ollama、LM Studio、64 個のステートを 1 回のパスで実行するパック済みバッチ経路 — が欲しいなら、d1-3B は 2 つのうちより製品化が進んでおり、そのツールとアートの識別は、どちらのカードが示す中でも最も強い要素だ。意思決定が長いステートにまたがるなら、収益条項のないライセンスが必要なら、あるいは再現できるキャリブレーション適合と、周辺コストがすでに計上されているハーネスが欲しいなら、実際に書類を確認できるのは Intern-Decision-4B のほうだ。

どちらについても気まずい点は同じだ。どちらのモデルも独立した第三者によって実行されたことはなく、カードを作成したベンダーが委託したものではないキャリブレーション比較も存在しない。回答の隣にある数値の意味こそが価値のすべてであるようなモデルクラスにとって、それは何かにしきい値を設ける前に埋める価値のあるギャップだ。
