「Intern-Decision-4B vs ContextPilot-8B」と表示される生成済みのタイトルカードで、サブタイトルは「一方は長いコンテキストを拒み、もう一方はそれを管理する」、3つのチップは「どちらにも独立した評価はない」「どちらも告知なしで出荷された」「どちらも今日はルーティング可能ではない」。OrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

Intern-Decision-4B 対 ContextPilot-8B:コンテキストを縮小するモデルとコンテキストを管理するモデル

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

どちらの毒を選ぶか:internlm/Intern-Decision-4Bは8,192トークンを超えて読むことを拒み、tencent/ContextPilot-8Bは際限なく膨らむコンテキストに耐えるためだけに存在している。両者は同じサイズクラスで、どちらもQwenベースのファインチューンであり、そしてどちらもベンダーからの発表も、いかなる独立した評価もないままHubに登場した——ContextPilot-8Bは2026年8月27日に、Intern-Decision-4Bは2026年9月26日に——しかも両者は正反対の問題を解く。Intern-Decision-4Bは45億パラメータの構造化意思決定モデルで、1回のフォワードパスを実行し、ロジットを読み取り、あなたが尋ねたあらゆる質問に対して較正済みの確率を返す。トークンは一切書かない。ContextPilot-8Bは81.9億パラメータのテキスト生成器で、長時間のエージェント実行のあいだに自身のワーキングコンテキストを計画し、記憶し、オフロードするよう訓練されている。両者を比べることは、実のところベンチマークの問いではない。あなたの問題のどちらの半分をモデルに飲み込ませたいか、という問いなのだ。

まず、彼らが本当に共有しているもの

どちらのモデルにも、そのモデル自身のラボの外の誰かが検証した数値がただの一つもない。これは何よりも先に述べておくべきほど異例なことだ。というのも、このブログ上のほとんどの比較は、少なくとも片方については独立したリーダーボードに頼ることができるからだ。

Intern-Decision-4Bはカード上に完全な評価表を公開している——7つのセットにわたる平均90.02、Brierスコア0.347、期待校正誤差0.065——すべてInternLMがInternLMのハーネスで測定したものだ。ContextPilot-8Bは表を一切公開していない。そのカードには、このフレームワークが「さまざまなベースモデルとベンチマークにおいて既存のベースラインを一貫して上回る」と記されており、詳細については論文と評価パイプラインを参照するよう促している。したがって、この対決において正直な出典の説明は短い。一方はベンダー報告で未再現、他方はベンダー主張で未公開であり、このページに独立したものは何もない。

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

率直に言えば、二つの賭け

Intern-Decision-4Bの賭けは、意思決定の難しい部分は推論ではなく、コミットすることにあるというものだ。状態と、名前付き質問のスキーマと最大8枚の画像を与えると、あなた自身の選択肢文字列に対する分布を返す。推論手順は決定的かつ形状固定である。選択肢を単一トークン記号にマッピングし、各フィールドに1つのプレースホルダーを持つアシスタントのJSONスケルトンをレンダリングし、1回の因果フォワードパスを実行し、各プレースホルダーの直前のロジットを読み取り、そのフィールドの候補のみに対してsoftmaxを適用し、適合された温度を適用する。デコーディングループがないため、パーサーも自由テキストのハルシネーション面も存在しない。その賭けの代償は厳格な入力上限だ — カードには、DecisionEngine(max_length=8192)を超える入力は「切り捨てなしで拒否される」と書かれている。

ContextPilot-8B の賭けはその鏡像だ。エージェントにトークンを書き続けさせながら、それが保持しているものを編集することを教える。エージェントのツールセットに、計画、構造化された長期記憶、検索、ソフトなコンテキスト・オフロードを追加し、その後、重要なコンテキスト編集の決定を中心に分岐をサンプリングし、クレジットを軌跡レベルではなくアクション・レベルで割り当てる RL レシピでチェックポイントを訓練する。モデルカードはパッケージング上の帰結について率直だ。チェックポイントをロードしてもコンテキスト管理が得られるわけではない。ツール定義、エージェント・ランタイム、評価パイプラインは別の場所にあり、一緒に持ってくる必要がある。

スコアボード、ディメンションごとに

• 出力 — Intern-Decision-4B はテキストを一切出力せず、オプション値に対する確率のみを返します。ContextPilot-8B は通常どおり生成し、その回答は散文と、解析しなければならないツール呼び出しです。

• 入力上限 — Intern-Decision-4B は 8,192 トークンを超えるものを受け付けません。ContextPilot-8B は Qwen3-8B の 40,960 トークンの位置制限を継承し、実効コンテキストが拡大しても動作し続けるように設計されています。

• パラメータ — Intern-Decision-4B はテキストタワー、ビジョンタワー、プロジェクタにまたがる 4.54B BF16。ContextPilot-8B は 8.19B BF16 で、純粋な dense(稠密)Qwen3 因果言語モデルです。

• レイテンシ — Intern-Decision-4B は、自身のカードによれば、単一の RTX 4090 上で平均 44.16 ms、P95 で 44.60 ms で動作します。ContextPilot-8B はレイテンシの数値を公表しておらず、そのコストは根本的に異なります。なぜなら、トークンをスコアリングするのではなく生成しているからです。

• 画像 — Intern-Decision-4B は最大8枚まで扱え、画像トークンは 8,192 の上限に算入されます。ContextPilot-8B のカードには、マルチモーダル経路を持たないテキスト生成チェックポイントであると記載されています。

• ライセンス — Intern-Decision-4B は Apache-2.0 で、上流の Qwen ライセンスがその隣に保持されています。ContextPilot-8B のライセンスはセクション0から始まり、「もっぱら科学的研究および開発の目的のためにのみ提供される。それ以外のいかなる目的にも使用してはならない。」と述べています。

• 公開されたエビデンス — 一方にキャリブレーション診断を伴う7セットの表、他方に論文の要旨と評価リポジトリへのポインタ。

• 実績 — どちらも静かだ。Intern-Decision-4Bは2026年9月26日以降、いいね1件、ダウンロード0件。ContextPilot-8Bは2026年8月27日以降、いいね11件、約1000件のダウンロードがあり、より注目を集めているが、それでも第三者による評価はない。

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

それぞれが実際にどこで壊れるのか

Intern-Decision-4B の失敗モードは構造的なものであり、それについて具体的に述べる価値がある。ある判断の根拠が 8,192 トークンに収まらない場合、モデルは穏やかに劣化するのではなく、リクエストを拒否する。これは擁護できるエンジニアリング上の選択であり、ContextPilot-8B がまさにそのために作られたワークロードには最悪の適合だ。カード自体の設定が、その緊張をいっそう際立たせる。ラッパーの下にあるテキストタワーは 262,144 トークンの位置上限を宣言している。バックボーンは 25 万トークンを扱えるのに、リリースされたラッパーは 8 千を超えるトークンを受け付けない。

ContextPilot-8Bの失敗モードは、何かにそのまま差し込める代替品ではないという点にある。それはフレームワーク内部のチェックポイントであり、挙動が宿るのはフレームワークの方だ。ツール定義とエージェントランタイムなしで重みだけを取得しても、得られるのはQwen3-8Bのファインチューニングであり、その際立った能力は不活性のままだ。さらにライセンスの第0条が加わると、商用展開に関する実務的な答えは、出荷されたままではまったく使えないということになる――これは、今も近い将来も、我々にとって候補ルートではないことも意味する。

もしそれぞれをデプロイするつもりなら

Intern-Decision-4Bは小型GPUを必要とし、これといったサービングスタックは不要だ。Python 3.12上にPyTorch 2.9.1とTransformers 5.14.1をインストールし、4つのシャードを一度読み込み、エンジンを常駐させてスコアリングする。フォワードパスは固定形状であるため、P50とP95は互いに0.6ミリ秒以内に収まる。したがって、キャパシティプランニングで問題になるのはテールレイテンシではなく同時実行数だ。厄介なのは、これがHTTPサービスではなくインポート可能なPythonクラスとして提供される点で、本番の呼び出し元の前に置くには自分でラップしなければならない。

ContextPilot-8Bには逆の扱いが必要だ。実際のサービング経路、ツールエグゼキュータ、メモリストア、そして設計どおりに再トレーニングや評価を行うつもりなら、分岐可能なロールアウト環境である。これは午後のひとときで試すようなモデルではなく、採用すべき研究フレームワークだ。

ここでルーターは役に立ちますか?

一部はその通りですが、正直に言えば、その範囲は通常よりも狭いものです。OrcaRouterは、Intern-Decision-4B、ContextPilot-8B、あるいはそれに類する意思決定スコアリング用チェックポイントをカタログに掲載していません。当社のモデルページはどちらも404であり、本記事のいずれの記述も可用性の主張として読まれるべきものではありません。統合エンドポイントが実際にもたらすのは、失敗した実験をフォールバックの背後に置けることです:200以上のモデルを1つのキーで、プロバイダーの定価が0%のマークアップでそのまま適用され、まだ評価中のスコアラーが単一障害点になることのない自動フェイルオーバー。これはこの比較のIntern-Decision側にとって実際の利点であり、同モデルは実際に低コストでローカルに動作します。ContextPilot-8Bについては意味がありません。研究開発専用ライセンスが、どのルーターが対応しているかに関わらず商用ルートを排除するからです。

じゃあ、どれ?

あなたの問いが閉じた回答集合を持ち、証拠が添付された状態で届き、説明ではなく確率を必要とするなら、Intern-Decision-4B のほうがより興味深い対象だ——安価で、形状が固定され、構造上キャリブレーション済みで、受け付けない入力について正直である。あなたの問題が、証拠が絶え間なく届き続けることなら、どんな意思決定スコアラーも助けにはならず、ContextPilot-8B は正しい標的を狙っている。ただし、モデルではなくフレームワークと研究ライセンスを採用することになるという但し書き付きだ。

決着をつけるのは、どちらのベンダーも実施していないテストだ。両方に、状態から答えを計算できる同じ短い構造化された判断を渡し、スコアラーの90.02平均がそれ自身のハーネスの外でも通用するかどうかを確かめる。誰かがそうするまでは、この対決についての正しい解釈は、その2つのモデルはそもそも同じ枠を争っているわけではない、というものだ。

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.