
Intern-Decision-4B:InternLMが、トークンを1つも書かずに回答する意思決定モデルをリリース
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 592 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
2026年9月26日、InternLMのHugging Faceページに40秒足らずで3つのモデルリポジトリが現れた:Intern-Decision-0.8Bが協定世界時05:35:57、Intern-Decision-2Bが05:36:19、そしてinternlm/Intern-Decision-4Bが05:36:37。興味深いのは4Bの方だ。これはQwen3.5-4Bのファインチューニングであり、共有状態、名前付き質問のスキーマ、および任意の画像を受け取り、単一のフォワードパスで全質問に対する較正済みの回答分布を返す。テキストを生成することは決してない。リリースノートにもこう明記されている:「このAPIは構造化された候補スコアリングを行う。これはgenerate()を呼び出したり、自由形式テキストをサンプリングしたりしない。」40秒間のアップロード、そしてどこにも発表の一行もない——ブログ記事も、ツイートも、チェンジログも、ローンチページも。存在するのはモデルカード、inference.py、そして4つのsafetensorsシャードだけだ。

出荷されたものと、出荷されなかったもの
まず最初に押さえるべきはファミリーだ。なぜなら4Bのカードがそれをひっそりと内包しているからだ。そのベンチマーク表には、自身の行と並んでIntern-Decision-0.8BとIntern-Decision-2Bの行が掲載されており、3つのチェックポイントはすべて同じ1分のうちにハブへ公開された。2Bのリポジトリは4Bのカードからリンクされることは一切なく、組織のアップロードフィードを通じて見つけるしかない。
出荷されなかったものは、リリースが通常もたらすほぼすべてです:
• 発表なし — ウェブ上での報道は皆無、どの言語でもベンダーからの声明は確認できず。
• デモなし — このカードは次の Space にリンクしています:huggingface.co/spaces/internlm/intern-decisionこのエンドポイントは HTTP 401 を返します。これは壊れているという意味ではなく、公開されていないという意味です。
• コレクションがありません — 宣伝されているモデルコレクションhuggingface.co/collections/internlm/intern-decisionも401を返します。
• コードリポジトリなし — カードのGitHubリンク github.com/internlm/Intern-Decision は404であり、InternLM組織のリポジトリ一覧にそのようなプロジェクトは存在しません。
• 採用なし — 執筆時点で、4B はいいねが 1 件、ダウンロードが 0 件です。
それが、知り得る表面のすべてです。以下に示す数値はすべて、ベンダー自身のものとして扱ってください。他に誰も、これをまだ実行していないからです。

推論コントラクトこそが製品である
カードの大部分は5段階の手順に費やされており、エンジニアリングがどこに注がれたかを示している。質問と選択肢は順序を保つ。各質問の選択肢は単一トークンの記号に対応づけられる — AからZ、次にaからz、次に0から9。つまり62個の記号であり、まさにこれがカードが1つの質問の選択肢を62個に制限している理由である。プロンプトは、元のシステムプロンプト、状態、意思決定スキーマ、および各フィールドに1つの<decision>プレースホルダーを持つ完全なアシスタントJSONスケルトンからレンダリングされ、チェックポイントのチャットテンプレートと空のthinkingブロックを維持する。その後、1回の因果的フォワードパス。ロジットは各プレースホルダーの直前の位置で読み取られ、softmaxはそのフィールドで許可された候補記号のロジットのみに対して実行され、キャリブレーションが適用され、記号があなたの選択肢の値にマッピングし直される。
その結果として形は固定される。デコードループもサンプリングもパーサーもなく、ハルシネーションが入り込む余地もなく、1回のパスにつき質問1つに対して決定1つという厳格な上限がある。サポートされる質問タイプは3つ——choice順序付きクライテリアマップを持つもの、scoreリストまたは数値キーのマップを持つもの、そしてnoul二者択一の no/yes である。
最も重要な仕様書の詳細
モデルカードには、入力が「切り捨てずに拒否される」と明記されている。その上限はDecisionEngine(max_length=8192)。これを設定と並べて読むと、奇妙な点が浮かび上がる。基盤のテキストタワーはmax_position_embeddingsを262,144と宣言している。バックボーンは25万トークンを扱えるのに、公開されたラッパーは8,192を超えるものを一切拒否する。これは保守的なデフォルトを備えた長文コンテキストモデルではない——自身のハーネスが、あなたが渡せる証拠に上限を課している意思決定スコアリングモデルだ。あなたのルーティング上の問いが、およそ8千トークン分を超える状態に依存するなら、出荷されたままのこのチェックポイントはそれに答えず、入力を切り詰めるのではなく拒否するだろう。
画像は最大8枚まで使用でき、カードによれば画像トークンも同じ8,192の上限に含まれるとのことです。

重みの内部
4つのシャード、45.4億個のBF16パラメータ、そしてサイズ名の由来を説明する設定があります。テキストタワー、16ピクセルのパッチサイズを持つ約24層のビジョンタワー、その間にプロジェクタがあります。テキスト側は隠れサイズ2,560の32層で、16個のアテンションヘッドと4個のキー/バリューヘッド、248,320トークンの語彙、タイド埋め込みを備えています。層タイプは一定の間隔で交互に切り替わります — 3つの線形アテンション層、続いて1つのフルアテンション層、これを繰り返します。グローバルアテンションを持つのはフルアテンション層のみで、ロータリ埋め込みは係数0.25で部分的です。読み込むにはPython 3.12以降、PyTorch 2.9.1、Transformers 5.14.1が必要で、ファイル一覧にはハブ側のトークナイザーに頼るのではなく、依然としてトークナイザー、マージ、語彙ファイルが含まれています。
数字、そしてそれを生み出したのは誰か
このセクションの内容はすべてInternLMが測定し、モデルカードで公開したものです。そのいずれも第三者によって再現されておらず、Artificial Analysisの項目も、アリーナ評価も、このモデルのリーダーボード行もどこにもありません。
7つの評価セット全体で、4Bは平均90.02、ブライアスコアは0.347、期待キャリブレーション誤差は0.065です。同じ表にはIntern-Decision-0.8Bが79.38、Intern-Decision-2Bが84.68と記載されているため、このファミリーはサイズとともに上昇カーブを描きます — 0.8Bから2Bで4.7ポイント、さらに4Bまで5.3ポイントです。表にはさらに、ベンダーがトレーニングしていない5つの行も含まれています。Jevが88.74、JevK5が85.16、SemIfが84.23、Kevが79.56、Layaが57.77です。これらはInternLMがInternLMのハーネス上でInternLMのチェックポイントに対して実行したものです。これらはそれらのプロジェクト自身の数値ではなく、そう読んでしまうのがここで最も起こりやすい間違いです。
レイテンシは単一のRTX 4090上で、ローカルのHugging Face経路を介して測定されており、このカードは値がワークロードおよびハードウェアに依存するものであると明示している。4Bは平均44.16 ms、中央値44.03 ms、P95で44.60 msで実行される。中央値とテールの差は1ミリ秒をはるかに下回っており、これは固定形状のフォワードパスに典型的な挙動だ。より小さい2つのチェックポイントはいずれも約33 msで、2Bは平均と中央値において0.8Bをわずかに上回っている。これはならして覆い隠すのではなく、注目に値する。この2つは互いの測定ノイズの範囲内に収まるほど近い。
キャリブレーション、そしてそこに込められた正直な注意事項
チェックポイントにはデフォルト温度1.99241824が同梱されており、これはこのモデル向けに個別に、1,728件の指定キャリブレーションケースで負の対数尤度最小化によってフィッティングされ、1,693件が検証用にホールドアウトされた。カードには、それを選ぶためにテストスイートのラベルを使用していないと記載されている。実装はサンプリング温度ではなく候補確率のキャリブレーションであり、信頼度、二値確率、期待スコアを変化させるが、argmax決定には手を付けない。
別の96ケースの診断がその効果を報告している。InternLM自身の前後の列では、4Bの全体的なBrierとECEは0.628 / 0.213から0.550 / 0.089へと変化し、Jevの0.595 / 0.130と比較される。その表に対する2つの正直な解釈:キャリブレーションは明らかに機能しており、「前」の列は、出荷時のデフォルトがフィットされた温度であるため、どのユーザーも決して目にすることのないものである。また、指摘しておく価値がある — 6つの診断カテゴリのうち2つは、4BにとってJevよりも悪く、その中最悪のもの、日常的な証拠と観察バイアスは、0.575 / 0.210に改善するが、依然としてJevの0.603 / 0.114には及ばない。そのスライスでは、キャリブレーションはギャップを狭めるが、埋めることはない。
ルーターが適するところと、まだ適さないところ
このモデルを使ううえでの実務的な障壁は精度ではなく、パッケージングにあります。リリースされるのは、4つのシャードをダウンロードしたうえでインポートするPythonクラスであり、呼び出せるHTTPエンドポイントではありません。まさにそのギャップを埋めるためにルーティングレイヤーが存在します——200以上のモデルをまたぐ1つのキー、プロバイダーの定価を0%のマークアップでそのまま適用し、プロバイダーが不安定になったときの自動フェイルオーバー——ただし、OrcaRouterが現在Intern-Decision-4Bやその種のモデルを扱っていないことは率直に申し上げておくべきです。当社のカタログにそれは掲載されておらず、ここに書かれていることのいずれも、提供状況に関する主張として受け取られるべきではありません。当社がご提供できるのは、より安価な判断です。本番経路の手前に45億パラメーターの判断スコアラーを試したいのであれば、汎用モデルへのフォールバックを備えたルーターに組み込めば、キャリブレーションがうまくいかない日でも、障害ではなくリトライで済みます。
何が状況を変えるでしょうか
重要な順に3つ。InternLMの外部の誰かが、90.02という平均と0.065という期待キャリブレーション誤差を再現する必要がある——外部テストセットに一度も触れたことのないキャリブレーションの主張は、機械学習において最も転移しにくい数値だからだ。カード自身の足跡が示される必要がある:Space、コレクション、GitHubリポジトリ。そしてベンダーは、これが製品なのか論文の成果物なのかを言う必要がある。なぜなら、研究専用ライセンスとApache-2.0ライセンスは同じ約束事ではなく、4BはQwenライセンスを併存させたままApache-2.0を選んだからだ。それまでは、正しい捉え方はアップロード自体が示唆するものである:これは本物のチェックポイントであり、本物の推論契約と完全に未検証のスコアカードを伴って、誰にも告げられずに公開されたのだ。
現時点で、正直な要約は狭く、それでいて有用だ。あなたの問題が「5つのルーティングラベルのうち1つを選び、どれだけ確信があるかを教えてくれ」というものであるなら、62個のロジットを出力し、文章を一切出さない4.5Bモデルは、評価する対象として擁護できる形だ。あなたの問題が長い文書、8枚を超える画像、あるいは答えを言葉で説明する必要性を伴うなら、出荷時点のこのチェックポイントは間違ったツールであり、ベンダーのベンチマークをどれだけ磨き上げてもそれは変わらない。
