
Intern-Decision-4B 対 Qwen 3.8:2.4兆パラメータに対する44ミリ秒のフォワードパス
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 592 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
InternLMは2026年9月26日の朝、Intern-Decision-4BをHugging Faceで公開した——ローンチ投稿もブログ記事もなく、自身のモデルカードにあるGitHubリンクは404を返し、デモSpaceは401を返す。重みは本物でダウンロード可能だが、発表はそこにない。そしてその下にあるモデルはQwen3.5-4Bのファインチューンであり、だからこそホスト型フラッグシップとの比較はスペックシート以上の価値を持つ。この二つはライバルではない。一つのパイプラインの両端であり、問題はその間の境界線がどこに落ちるかだ。根底にある中核は、ベンダーが8月に公開し、現在はQwen3.8-Maxとして提供されている2.4兆パラメータのモデルで、100万トークンあたり$2.00と$6.00で課金される。Intern-Decision-4Bは、その7か月前のベースモデルを45.4億パラメータに作り直したもので、トークンを一切出力せず、最大16個の型付き質問に単一のフォワードパスで答え、課金対象の出力が存在しないため呼び出しごとのコストはかからない。
一行で言うと:あなたのタスクが、答えが閉じた集合として決まっている意思決定であるなら、Intern-Decision-4B は意思決定あたりおよそ50倍速く、構造的にも安価であり、その狭い軸においては、どのフロンティアモデルもこれに勝てない。あなたのタスクがそれ以外——推論、長いコンテキスト、ツール使用、答えがプロンプト内にすでに列挙されていないあらゆるもの——であるなら、Qwen 3.8 は単により優れているだけでなく、この2つのうち、そもそもその仕事を遂行できる唯一のものである。以下はすべて、その境界線を正確に見極めることについてである。
実際に確認されていることと、そうでないこと
証拠から始めましょう。枠組みが重要だからです。Intern-Decision-4Bに関するベンダー発表はありません。プレスリリースも、論文も、読めるリポジトリの説明もありません。今日存在するのは、今朝公開されたHugging Faceリポジトリで、internlm組織 — Intern Large Models、Shanghai AI Laboratoryのグループ — の下にあり、Apache 2.0ライセンスを伴い、上流のQwenライセンスをLICENSE-QWENとしてその隣に保持しています。2つの兄弟チェックポイントが40秒差で現れました。Intern-Decision-0.8Bは8億5300万パラメータ、Intern-Decision-2Bは22億1000万パラメータです。3つすべてが同じタグ — 意思決定、マルチモーダル、構造化予測 — そして3つすべてが、まだ公開では解決しない1つのモデルコレクションの下にあります。
確認されていないのは、これが完成版リリースなのか、それとも早い段階のプッシュなのかという点だ。リポジトリは05:36 UTCに作成され、同じ日の08:00 UTC前に再び変更され、兄弟チェックポイントに関するさらなる公開活動は09:00を過ぎても続いた。InternLMは、意図されているデプロイの話がどのようなものかを述べておらず、リンクしているリポジトリを公開しておらず、ホスト型エンドポイントが来るのかどうかも述べていない。この記事のあらゆるベンチマーク数値は、ベンダー報告であり未再現のものとして扱ってほしい——本稿執筆時点で、このモデルについて他に書かれたものはどこにも文字通り何もないからだ。3つの別々の検索経路でも、この名前について何も返ってこない。

アーキテクチャ上の賭け:生成器ではなく、スコアラー
Intern-Decision-4B自身のドキュメントの中で最も重要な文は否定文である:推論パスは「generate()を呼び出したり、自由形式のテキストをサンプリングしたりすることはない」。これは実装の詳細ではなく、設計そのものであり、JSONスキーマを使ってQwen3.8-Maxを呼び出し、波括弧が閉じることを祈るのとは一線を画すものである。
カードに書かれているとおり、仕組みは次のとおりです。モデルに共有状態、名前付き質問のスキーマ、そして任意で最大8枚の画像を渡します。各質問は次の3つのタイプのいずれかです:choice(順序付けられた選択肢の中から1つ選ぶ)、score(順序尺度で評価し、確率で重み付けした期待値として返される)、またはnoul(二値の no/yes)。システムプロンプト、状態、スキーマ、および完全なアシスタントのJSONスケルトンは、各フィールドに1つのプレースホルダーを伴ってレンダリングされます。次に — これがトリックです — モデルは1回の因果的フォワードパスを実行し、各プレースホルダーの直前の位置でロジットが読み取られます。そのフィールドで許可された候補記号のみに対してソフトマックスが取られ、チェックポイントのキャリブレーションが適用され、記号は元の選択肢の値にマップし直されます。
その帰結は具体的だ。各フィールドの回答空間は語彙ヘッドに焼き込まれるのではなくリクエストごとに組み立てられるため、今日の午後に考案したスキーマでも再学習は不要だ — 質問を追加すれば、その選択肢がそのフィールドの候補シンボルになる。デコーディングループがなければ、出力トークンもなく、忘れる波括弧もなく、不正な JSON に対する再試行ロジックもない。そして、すべての質問が同じ状態の読み取りに基づいて採点されるため、16 個の質問は 16 回ではなく 1 回のフォワードパスで済む。
制限も同じくらい具体的で、カードにはためらいなく明記されている。質問は1〜16個、1質問あたり最大62個の選択肢、画像は最大8枚。デフォルトの上限は8,192トークンで、それを超える入力は切り捨てられることなく拒否される。この最後の条項は、じっくり考える価値のある設計上の決断だ。サイレントな切り捨ては、分類器が、あなたが尋ねたのとは別の質問に静かに答え始めてしまう仕組みであり、InternLMはそうする代わりに、あえて大きな音を立てて失敗することを選んだ。それは正しい判断であり、同時に運用上の罠でもある。なぜなら、長いチケットスレッドにスキーマ、さらには画像が加われば、思っているよりずっと早く8,192を超えてしまい、優雅な逃げ道はない——エラーになるだけだからだ。
Intern-Decision-4B が勝つ場面、しかも大差で
2つの軸があり、どちらも漸進的ではなく構造的なものだ。
• 意思決定あたりのレイテンシ — 平均44.16 ms、中央値44.03 ms、p95で44.60 ms。単一のRTX 4090上で、ローカルのHugging Faceパスを通して測定。Qwen3.8-Maxと比べると、私たち自身のプレイグラウンドにおけるライブの7日間ウィンドウでは、p50が2,474 ms、p95が9,789 msで、毎秒55.4出力トークン。これは中央値でおよそ56倍であり、この比較は不公平というより、むしろ2つの異なる処理の間の比較だ。一方のモデルは分類し、もう一方は推論してから書く。この差は実在し、その理由もまた実在する。
• 意思決定あたりのコスト — そしてこれは意見ではなく算数だ。現実的なサポートトリアージの呼び出しを例に取る:状態とスキーマの入力トークン800個、構造化JSONの出力トークン150個。Qwen3.8-Maxでは、800 × $2.00/M に 150 × $6.00/M を加えたもので、推論トークンを1つも使う前の時点で1回の意思決定あたり約$0.0025になる — しかもQwen3.8-Maxは推論モデルなので、出力側は楽観的に小さく見積もっている。100万回の意思決定にはおよそ$2,500かかる。同じ100万回の意思決定をIntern-Decision-4Bで行うと、トークン代はゼロで、RTX 4090の時間が約12.3時間。Intern-Decision-4Bには出力がないので、出力価格もない。
そのトレードオフは正直で明白だ。4Bは自分で所有するか借りるGPUを必要とし、そのGPUを占有し、できることと言えばただ一つのことだけだ。しかし、その一つのことがあなたの製品が1日に何百万回も行うことであるなら、前述の算術がビジネスケースのすべてであり、フロンティアモデルの能力がどれほど高かろうとそれは変わらない。
Qwen 3.8 が公表していない数値:キャリブレーション
これは地味な差別化要因であり、ベンチマークには見えないため、ほとんどの比較が見落としてしまう点でもある。
Intern-Decision-4Bは分布を、単なるラベルではなく、あなたの選択肢の各値に対して返します。さらに信頼度、そしてnoulの質問についてはキャリブレーション済みの「はい」の確率も返します。InternLMは自社のスイート全体でブライアスコア0.347、期待キャリブレーション誤差0.065を報告しており、フィット済みの温度をチェックポイントに同梱しています:1.99241824。これはこのサイズ向けに、1,728件の指定されたキャリブレーションケースと1,693件のホールドアウト検証ケースにおける負の対数尤度最小化によって個別にフィットされたものです。テストスイートのラベルはその選択には用いられていません。カードにはさらに、サンプリングされたラベルではなく正確な参照分布を用いた独立した96件の診断があり、全体的なBrier/ECEがキャリブレーション前の0.628 / 0.213から後の0.550 / 0.089へと変化したことを示しています — キャリブレーションの工程により、期待誤差は半分以上削減されています。
では、Qwen 3.8 側で同じ数値を探してみてください。それはありません。Alibaba は Artificial Analysis Index のスコア、GPQA Diamond、terminal-bench、SciCode、tau-banking、長文コンテキストの想起を公表しています——いずれも能力の指標です。Qwen 3.8 ファミリーのどのモデルについても、キャリブレーション指標は公表していません。なぜなら、生成モデルの確信度は、ベンダーが提供する量ではないからです。あなたのシステムが、信頼しなければならない答えではなく、しきい値を設けたりルーティングしたりできる確率を必要としているなら、その違いは程度の問題ではありません。一方のモデルは、文書化されたエラー率を伴う数値を与えます。もう一方はテキストを与え、あなたはそれを前提に自前の確信度推定を構築することになります。
Qwen 3.8が勝つ場面では、しかもその差は僅差ではない
二つを、それぞれ何を求められるかという点で並べて比べてみれば、その境界はもはや微妙なものではなくなる。
• コンテキスト — Qwen3.8-Maxは1,000,000トークンのウィンドウを備えている。Intern-Decision-4Bは8,192を超えるものを拒否する。それは122倍であり、回避策は存在しない。なぜなら、入力上限は切り詰められるのではなく強制されるからだ。
• 入力モダリティ — Qwen3.8-Max はテキスト、画像、動画を扱えます。Intern-Decision-4B はテキストと画像を扱い、画像は最大8枚までで、画像トークンは同じ8,192の予算に計上されます。
• 推論とツール — Qwen3.8-Maxは、公称能力にツール使用、JSONモード、推論を備えており、Artificial Analysis Intelligence Indexで45.4を記録し、インデックス対象145モデル中15位、AA Codingスコアは76.2で138中9位です。これらはArtificial Analysisが公表した独立の数値であり、ベンダーの主張ではありません。Intern-Decision-4BにはArtificial Analysisの掲載がなく、いかなる種類の独立スコアもなく、推論したり、計画を立てたり、何かを呼び出したりする能力もありません。
• オープンエンドな出力 — Qwen3.8-Max が書く。Intern-Decision-4B は段落も根拠も計画も生成できない。あなたがすでに列挙しようと考えた選択肢を採点することしかできない。
オープンウェイト側でも注目に値するのは次の点だ。Qwen 3.8 コアそのものが欲しく、ホスト型のルートを望まないなら、Qwen3.8-27B がデンス版の兄弟モデルだ — 278億パラメータ、Apache 2.0、262,144トークンのコンテキスト、そして提供されている場所では100万トークンあたり約$0.33 / $2.40。AA Intelligence Index では33.7を記録する。それでも Intern-Decision-4B より1桁大きく、依然として生成的であり、大量処理でのクローズドセット意思決定には依然として不適切なツールだ — しかし、それは正直な中間選択肢であり、3つの中で唯一、本当に安価で本当に高性能を同時に備えたものだ。

InternLM自身のベンチマーク表を正直に読む
Intern-Decision-4Bのカードには比較表が掲載されており、欠けているもののほうが、そこに載っているものより情報量が多い。行はJev、Laya、SemIf、Kev、JevK5、そしてInternLM自身の0.8Bと2Bだ。それらはすべて、別のSystem Oneまたは意思決定モデルのエントリである—TypeSafe AIのJev、Convai InnovationsのLaya、そして他に3つ。すべての数値はInternLM自身のハーネス上でベンダーによって報告されたものである。表にはフロンティアモデルがまったく存在しない。
それは見落としではない。主張の誠実な範囲である。Intern-Decision-4B の7つのスイートにわたる代表平均 90.02 —— Jevbench-Easy 100.00、Jevbench-Original 98.61、Jevbench-Hard 73.87、Typed Decision 80.55、ToolACE 96.45、AG News 90.82、WildJailBreak 89.86 —— は、意思決定モデルカテゴリをリードするという主張であり、この表では実際にそうしており、Jev の 88.74 と Laya の 57.77 を上回っている。それは Qwen 3.8 と競合するという主張ではなく、InternLM はどこでもそのような主張をしていない。モデルカードは自カテゴリに範囲を限定しており、カテゴリでの勝利を能力の勝利と読むことが、このセクションが防ぐために存在する誤りである。
さらに注意点が2つある。レイテンシの数値——4090での平均44 ms——はベンダーが測定したもので、ワークロードとハードウェアに依存するうえ、単一GPUでのフォワードパスは、ネットワークのラウンドトリップやキューイングを含むホスト型API呼び出しと同じ測定ではない。そしてキャリブレーションのパイロットは96ケースだ。これはベンチマークではなく診断であり、カードにもそう明記されている。
デプロイメントの問題、それこそが本当の分岐点
ベンチマークのことは一旦忘れて、それぞれが運用上あなたに何を求めているのかを問いかけてみてください。
Intern-Decision-4Bはbf16でディスク上およそ9.1 GB — 4.26 GBと4.15 GBの2つの言語シャード、612 MBのビジョンタワー、54 MBのプロジェクタで構成される。16 KBのinference.pyを通じて読み込まれ、これはリポジトリ自体に同梱されており、DecisionEngineクラスを一度インスタンス化して再利用する。入力はPythonのdict1つ、出力はレスポンスのdict1つで、Python 3.12以上が必要。4090では44 msで動作し、0.8Bの兄弟モデルは、はるかに少ないリソースでも検討できるほど小さい。しかし、モジュールそのものがインターフェースだ — サーバーも、OpenAI互換のエンドポイントも、ホスト型APIも存在しない。あなたはその周りにサービスを構築することになり、フェイルオーバー用に2つ必要なら、それも自分で構築することになる。
同じパイプラインの生成側はまったく別の判断であり、まさにルーターが本来存在する理由でもある。Qwen3.8-MaxとQwen3.8-27Bはどちらも、同じOpenAI互換キーの背後でOrcaRouter上で呼び出し可能で、プロバイダー定価を0%のマークアップでそのままパススルー——つまりAlibabaがQwenの価格を改定すれば、次の請求サイクルではなく当日中に当社側でも反映される。Intern-Decision-4Bは当社のルートの一つではなく、InternLMがどこかでホストするまではそうなることもない。そうでないふりをするつもりはない。当社がカバーするのは、このパイプラインのうちネットワーク呼び出しにあたる半分だ。200以上のモデルに1つのキー、Qwen3.8-Maxが劣化した場合の自動フェイルオーバー——直近7日間のエラー率は1.78%——そして、どちらかにコミットする前に同じリクエストパス上で2つのQwen 3.8ティアを相互にA/B比較できる機能である。
これが持ち帰る価値のあるパターンだ。スコアラーはローカルで実行する。安価で高速で、狭い一つのことをうまくこなすからだ。推論ステップは外部にルーティングする。ベンダーの入れ替わりも値下げも障害も、実際に起きるのはそこだからだ。

実際にどれを選ぶべきか
意思決定が閉集合で、回答がプロンプト内で列挙でき、同じ意思決定を大量に実行し、ラベルと同じくらい確率を気にするなら、Intern-Decision-4Bを選んでください。チケットルーティング、固定された分類体系に対するコンテンツモデレーション、自分で管理するスキーマへの構造化抽出、評価ルーブリック、二値ゲート——人間が事前に選択肢リストを書くことができたであろうあらゆるものです。45.4億のパラメータは上限について正直です。モデルカード自体が、4BはJevbench-Hardで73.87、Easyで100.00であることを示しているので、意思決定の形が難しいほど、この小型モデルはより多くを犠牲にします。
Qwen 3.8 を選べ — ホスト型の中核が欲しいなら Qwen3.8-Max、手元に置ける重みが欲しいなら Qwen3.8-27B という意味だ — 答えが事前に列挙できない場合、入力が 8,192 トークンより長い場合、人間に見せられる根拠が必要な場合、ツール呼び出しが必要な場合、あるいは動画が必要な場合。GPU を運用したくないだけなら、これも選べ:100万回の判断あたり 4090 の時間 12.3 時間は、すでに 4090 を持っていて、残りの 363 日はそれで別の何かをする当てがある場合にのみ安い。
あなたのパイプラインが、ほとんどのパイプラインが実際にそうであるような形——手前に安価な閉集合分類器、その背後に、分類器が不確かなケースのためのフロンティアモデル——であるなら、両方を選んでください。それは Intern-Decision-4B の校正済み信頼度が想定して作られた構成であり、上の ECE の数値が見出しの平均よりも重視される理由です。
何を見るべきか
3つの未解決の問いがあり、いずれも数日以内に答えが出る。InternLMは、自身のカードがリンクしているGitHubリポジトリ——現在は404——を公開するのか、そしてそれとともに学習の説明を公開するのか。重みに続いて発表があり、静かなプッシュが文書化されたリリースへと変わるのか。そして、InternLMのものではないハードウェア上で、90.02という平均値、あるいは0.347というBrierスコアを、独立に再現するものはあるのか。
待っている間に、一つだけ小さな不一致に触れておきます。デプロイの規模を見積もっているときには、こうしたことが重要になるからです。モデルの名前は4Bです。パラメータ数は4,539,265,536、つまり45.4億です。0.8Bの兄弟モデルは8億5,300万、2Bの兄弟モデルは22.1億で、どちらもごくわずかに切り上げまたは切り下げされています。4Bだけが5億を超えて切り下げられています。これは問題ではありません。未発表のリリースでは、ドキュメントが唯一の仕様であり、しかもそのドキュメントさえまだ編集途中なのだということを思い出させてくれます。
