比較記事のタイトルカードには「Intern-Decision-0.8B vs Qwen 3.8」と表示され、サブタイトルは「8億5,300万パラメータ、1.71 GB、閉じた回答セット」で、3枚のフラットなラインカードにはそれぞれ「Subject: Intern-Decision-0.8B は2026年9月26日に告知なしで公開」「Opponent: Qwen 3.8、2.4Tスパースコアで Qwen3.8-Max は $2.00 と $6.00」「Key finding: 2B の兄弟モデルはより高速でより高精度だが、フットプリントだけが 0.8B に有利」と書かれている。
Engineering & Research

Intern-Decision-0.8B vs Qwen 3.8:8億5,300万パラメータと閉じた回答セット

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Intern-Decision-0.8Bは、InternLMが2026年9月26日の朝にHugging Faceへ公開した3つの意思決定モデルのうち最小のものであり、最速でもない。まず知っておくべきはそこだ。ラボ自身の測定では、2Bの兄弟モデルのほうがわずかに速く — 33.28 ms 対 33.98 ms — 同じ7スイート平均で6ポイント高いスコアを出す。したがって、10億未満のチェックポイントに手を伸ばす通常の理由である純粋な速度は、ここでは当てはまらない。当てはまるのはサイズだ。852,985,920パラメータ、bf16重みで1.71 GB。常駐させておけるほど小さく、他にやることがあるマシンの余剰部分に収まる。これをQwen3.8-Max — ベンダーが8月に公開した2.4兆パラメータのスパースなMixture-of-Expertsコアのホステッド提供で、100万トークンあたり2.00ドルと6.00ドル — と比べると、両者は同じ仕事を競っているわけではない。一方は、事前に指定した選択肢に対する確率分布を返す。もう一方は文章を書く。

短く言うと、Intern-Decision-0.8B は、すでに手持ちのハードウェア上で閉集合の意思決定をスコアリングする必要があり、4.43 GB ではなく 1.71 GB であることが出荷できるかどうかを分けるなら、導入する価値がある。今週 InternLM がリリースした中で最も精度の高い小型スコアラーが欲しいなら——それは 4B だ——導入する価値はない。また、答えがプロンプト内にすでに列挙されていないなら、この2つはいずれも適切なツールではなく、このペアの中でそもそもその仕事をこなせるのは Qwen 3.8 だけだ。

リポジトリが語ること、そしてほかには何も語らないこと

まずは証拠から見ていこう。というのも、証拠がほとんどないからだ。InternLM はこのモデルについて何も発表していない。ローンチ記事も、論文も、リポジトリの説明もない。Hugging Face のカードはデモ用の Space と GitHub リポジトリにリンクしているが、本稿執筆時点で Space は 401 を返し、GitHub のリンクは 404 を返す——より詳しい情報を得るためにカードが示す2つの場所は閉ざされている。9月26日の協定世界時 05:36 ごろ、3つのチェックポイントが互いに40秒以内に現れた——Intern-Decision-0.8B、Intern-Decision-2B、Intern-Decision-4B で、いずれも同じタグ——意思決定、マルチモーダル、構造化予測——を付けており、すべて Qwen のチェックポイント、この場合は Qwen3.5-0.8B のファインチューンである。

リポジトリから判明することは、未発表のリリースとしては異例なほど precise で正確だ。というのも、ラボが重みとともに自前の推論モジュールを出荷しているからだ。0.8Bはモデルディレクトリ内の16 KBのinference.pyを通じて読み込まれ、Python 3.12以降と、transformers 5.14.1を伴うtorch 2.9.1を必要とし、一度インスタンス化して再利用するDecisionEngineクラスを公開している。入力はPythonのdictひとつ、出力はレスポンスdictひとつ。判明しないのは次の点だ。これが完成したリリースなのか早い段階のプッシュなのか、ホスト型エンドポイントが登場するのか、そしてそれが間に位置する2つのチェックポイントが、同じ製品の異なるサイズなのか、たまたま名前を共有している3つの異なる製品なのかということ。InternLMの外部でそれらのいずれかを実行した者はいない。

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

兄弟の問題:2Bはより速く、より優れている

以下は、InternLM自身が公開した表のうち、0.8Bの位置づけを難しくしている部分です。同じ7つのスイートで3つのサイズを縦に追うと:

• 速度 — 0.8B: 平均 33.98 ms、中央値 33.44 ms、p95 で 37.50 ms。2B: 33.28 ms、33.15 ms、33.55 ms。4B: 44.16 ms、44.03 ms、44.60 ms。すべて単一の RTX 4090 上で、ローカル Hugging Face 経路を通してクエリごとに測定。

• 7スイート平均 — 0.8B: 79.38、2B: 84.68、4B: 90.02。

• キャリブレーション — 0.8B:Brier 0.530、ECE 0.066。2B:Brier 0.437、ECE 0.100。4B:Brier 0.347、ECE 0.065。

• bf16 でのディスク上のフットプリント — 0.8B: 1.71 GB、2B: 4.43 GB、4B: 9.08 GB。

2Bは平均ではより速く、裾では劇的に引き締まっており、しかも同時により正確だ。つまり「小さいほど速い」はこのファミリー全体では誤りだ——しかも二重に。4Bは両方より遅いのだから。0.8Bが完全に勝る唯一の軸は、誰もベンチマークしない軸だ。1.71 GB 対 2Bの4.43 GB、4Bの9.08 GB。固定メモリ予算にスコアラーを配置するなら——常時稼働の小型ボックス、相乗りのGPU、カードの大部分をすでに言語モデルが占めているエッジノード——それが論拠のすべてであり、実際に有効な論拠だ。

残りの表は、小型モデルがどこで不均一に破綻するかを示す研究のようだ。0.8BのTyped Decisionスコアは77.35で、4Bの80.55に対して、パラメータ数が5分の1でありながら3点差しかない。しかしJevbench-Originalは98.61から80.56へ下落し、WildJailBreakは89.86から64.48へ崩壊する。それら2つのスイートが何を測っていようと——カードには書かれておらず、カードにはスイートの定義が一切ない——小さいチェックポイントを最も厳しく罰するのはそれらだ。一つの軸では持ちこたえ、他の2つでは崖から落ちるモデルは、一律に弱いモデルではない。それは特定の能力境界を持つモデルであり、フリートをそれにコミットする前に、自分のワークロードがどこに位置するのかを知りたくなるだろう。

キャリブレーション行について、もう1つ注意点があります。0.8BのECE 0.066は同モデルの最良値であり、同じスイート上でのJevの0.095よりも優れています。一方、そのBrierスコア0.530はJevの0.358より悪いです。較正誤差と確率の平均二乗誤差は同じ指標ではありません。一方が強く見え、他方が弱く見える表は、その分布が信頼度のピーク付近ではよく整った形をしており、その間では本来よりも厚くなっていることを示しています。システムが信頼度でしきい値を設けているなら、その区別は平均よりも重要です。

1.71 GBで実際に何が得られるのか

このモデルの推論経路は生成器ではなくスコアラーであり、そのコストの違いは増分的ではなく構造的なものです。これには共有状態、名前付き質問のスキーマ、および任意で最大8枚の画像を渡します。各質問は次の3種類のいずれかです:choice(順序付けられた選択肢集合の1つ)、score(順序尺度で、確率重み付き期待値として返されます)、またはnoul(no/yes の二値)。状態、スキーマ、および完全なアシスタントJSONスケルトンは、各フィールドに1つのプレースホルダーを付けてレンダリングされ、モデルは単一の因果フォワードパスを実行し、ロジットは各プレースホルダーの直前の位置で読み取られます。ソフトマックスはそのフィールドで許可された候補シンボルのみに対して取られ、チェックポイントの適合済みキャリブレーションが適用され、シンボルはあなたのオプション値にマッピングし直されます。

そこから3つの帰結が導かれる。出力トークンが存在しないため、出力価格も存在しない——100万件の決定でもトークンは一切かからない。デコードループも、忘れるべき波括弧もないので、不正なJSONは障害モードにならない。そして、各フィールドの回答空間はリクエストごとに組み立てられるため、今日の午後に考案したスキーマでも再学習は不要だ。質問を追加すれば、その選択肢がそのフィールドの候補シンボルになる。

制限も同じくらい簡潔に示されている。質問は1〜16問、各最大62個の選択肢、画像は最大8枚、そしてデフォルトで8,192トークンの上限——それを超える入力は切り詰められるのではなく拒否される。この最後の条項は、じっくり考える価値のある設計上の判断だ。というのも、黙って切り詰めることは、分類器があなたの尋ねた質問とは別の質問に静かに答え始めるやり方だからだ。InternLMはそうではなく、大きな音を立てて失敗する。それは正しく、同時に運用上の罠でもある。長いチケットのスレッドにスキーマ、さらに画像まで加われば、予想より早く8,192を超えてしまい、そうなったときに穏当な対処法はない。

そして1.71 GBは、掛け算で弾き出せる実行時の経済性をもたらす。1判断あたり33.98 msなら、100万回の判断はRTX 4090 1枚で9.44時間だ。4Bは同じ100万回に12.3時間を要し、持っていなかった7.37 GBと引き換えに精度を10.5ポイント諦める。どちらの数値もマシン本体のコストを含んでおらず、どちらも人が忘れがちな部分を含んでいない。つまり、あなたはサービスを運用しているのであり、リポジトリにはサーバーがない。

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 は単一のモデルではなく、注目すべきは低価格帯のものだ

Qwen 3.8 は、単独の名称として捉えるなら Qwen3.8-2.4T-A95B を指す。これは Alibaba が 2026年8月12日にオープンウェイトとして公開した 2.4兆パラメータのスパースな Mixture-of-Experts 中核であり、トークンあたり約950億パラメータがアクティブで、Apache 2.0 ではなく独自ライセンスを採用している。同じ中核のホスト型提供が Qwen3.8-Max で、8月3日から有料 API で一般提供されており、9月2日付のスナップショットとして更新されている。それらは一つの頭脳を二通りの方法で売っているもので、実際にほとんどの人が呼ぶのは2つ目の提供形態のほうだ。

独立系の指標において、Artificial AnalysisはQwen3.8-Maxの9月時点のスナップショットをIntelligence Index 45.4と測定しています。これはインデックス対象145モデル中15位で、AA Codingスコアは76.2で138モデル中9位、GPQA Diamondは92.8、Humanity's Last Examは43.1、長文コンテキスト想起スコアは80.3です。オープンなチェックポイントは、蒸留元であるAPIの39.9に後れを取っています。当社独自の7日間のプレイグラウンド計測枠では、Qwen3.8-Maxはp50が2,578 ms、p95が9,539 ms、出力は毎秒55.5トークンで、エラー率は1.57%です。Qwen3.8-MaxはOrcaRouter上でプロバイダーの定価に0%のマークアップを加えた価格で呼び出せるため、Alibaba側の価格変更は次の請求サイクルではなく当日中に当社側でも反映されます。

とはいえ、1.71 GBのローカルチェックポイントと比較検討すべきなのは、デンスな兄弟モデルの方だ。このファミリーで汎用的な能力を手に入れるための最も安価な方法だからである。Qwen3.8-27BはApache 2.0で、ネイティブの262,144トークンコンテキストを備え、当社のカタログでは100万トークンあたり$0.33と$2.40に設定されている。そのArtificial Analysis Intelligence Indexは33.7だ。これはIntern-Decision-0.8Bのパラメータ数のおおよそ32倍であり、依然として生成的であり、大量処理におけるクローズドセットの意思決定には依然として誤った道具である——しかし、正直な中間的選択肢であり、この比較の中で、真に安価でありながら真に汎用的でもある唯一のメンバーである。

スコアラー対ジェネレーター、平易に言えば

• コンテキスト — Qwen3.8-Max は 1,000,000 トークンのウィンドウを備えている。Intern-Decision-0.8B は 8,192 を超えるものを受け付けない。切り詰めるのではなく強制される、122 倍という差である。

• 入力 — Qwen3.8-Max はテキスト、画像、動画を受け付けます。Intern-Decision-0.8B はテキストと最大8枚の画像を受け付け、画像トークンは同じ8,192の予算に算入されます。

• 出力 — Qwen3.8-Max は文章を書き、推論し、ツールを呼び出し、要求に応じて JSON を出力する。Intern-Decision-0.8B は段落も、根拠も、計画も生成できない。できるのは、あなたがすでに列挙しようと考えた選択肢を採点することだけだ。

• 1回あたりのコスト — 入力800トークン、出力150トークンという現実的なトリアージ呼び出しは、Qwen3.8-Maxでは推論トークンを除いて約$0.0025かかり、推論モデルであるため出力側は楽観的に小さい。そのような呼び出し100万回でおよそ$2,500。Intern-Decision-0.8Bにはトークン価格がまったくない。100万件の意思決定は、所有またはレンタルの4090で9.44時間だ。

• 過去7日間の Qwen3.8-Max では、ネットワークとキューイングを含めた中央値が 2,578 ms です。Intern-Decision-0.8B の 33.98 ms はローカルカード上での単なるフォワードパスであり、同じ測定ではありません。誠実に比較すれば、その差は 80 倍ではなく 1 桁の違いです。

• 根拠 — ここにある Intern-Decision-0.8B の数値はすべて、InternLM 自身のハーネスによるベンダー報告であり、レイテンシを含め、誰によっても再現されていない。Qwen 3.8 の数値はすべて、Alibaba 自身のものか Artificial Analysis による測定のいずれかであり、上記で別々にラベル付けされている。

• 独立したスコア — Qwen3.8-Max にはある。Intern-Decision-0.8B にはいかなる種類のものもなく、それをデプロイする推論プロバイダーも存在しない。

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

このパイプラインを実行する2つの方法

運用上の分岐は、ベンチマーク上の分岐よりも鮮明である。Intern-Decision-0.8B はサービスではなくモジュールである。OpenAI 互換のエンドポイントも、バッチ処理サーバーも、ヘルスチェックも、再試行ポリシーも、自分で作らない限り 2 つ目のレプリカも存在しない。単一プロセスにロードされ、一度に 1 つの dict に応答し、フェイルオーバーが必要なら、あなた自身がフェイルオーバーになる。それは、ローンチノートなしで公開された 8 億 5,300 万パラメータの研究用チェックポイントの的確な説明であり、それに応じて意思決定に織り込むべきである。

同じパイプラインの生成側の半分はネットワーク呼び出しであり、ネットワーク呼び出しこそルーターの出番です。Qwen3.8-Max と Qwen3.8-27B はどちらも 1 つの OpenAI 互換キーの背後から到達でき、自動フェイルオーバーによって、上流の劣化があなたのインシデントになることはありません — ここで名指しする価値があるのは、当社側での Qwen3.8-Max の直近 7 日間のエラー率が 1.57% であり、それはあなたのリクエストになるまでは低いからです。理にかなったパターンは、この組み合わせがずっと静かに説明してきたものです。安価なクローズドセットのスコアラーは、高速で呼び出しごとのコストがかからないのでローカルで実行し、推論ステップはルーティングする。値下げ、モデルの入れ替わり、そして障害が実際に起こるのはそこだからです。

私たちが主張しないことが2つある。Intern-Decision-0.8Bは当社のルートの1つではなく、InternLMがどこかでそれをホストするまではそうなることもない——そうでないかのようにほのめかすつもりはない。また、当社は現在InternLMモデルを一切ホストしていない。したがって、この記事の中に、本題を当社経由で実行してもらうための売り込みは何もない。

何が答えを変えるだろうか

3つの未解決の問いがあり、いずれも数日以内に答えを出せる。InternLMは、自社のカードがリンクしているGitHubリポジトリを公開するのか、そしてそれとともに、これらの重みがどのように調整されたかの説明も公開するのか。チェックポイントに続いてローンチ投稿が出て、静かなプッシュを、明記されたデプロイの筋道を伴う文書化されたリリースへと変えるのか。そして、InternLM以外のハードウェア上で、79.38という平均や0.066というキャリブレーション誤差を、独立した誰かが再現するのか。

それらのどれかが登場するまで、Intern-Decision-0.8B について正直に読み取れるのは、狭く具体的なことだ。それは3つのファミリーの中で最も安価なクローズドセット・スコアラーであり、より高速でより高精度な兄弟モデルが収まらない場所に収まるフットプリントで、発表もなく、何向けに調整されたのかを教えてくれる唯一の成果物もなしに公開されている。あなたの意思決定がクローズドセットで、答えがプロンプト内で列挙可能で、1.71 GB があなたのデプロイを実際に左右する数値なら、それは正しい選択であり、そのサイズでは他に類を見ない。あなたの答えが事前に列挙できないなら、あるいはあなたの状態が 8,192 トークンを超えるなら、あるいは人間に見せられる根拠が必要なら、その比較はそもそも僅差ですらなかった——そしてあなたが求めるモデルは、8億5300万パラメータのものでは決してなかった。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新