生成されたタイトルカードは「FrogNano-4B-2609 vs Intern-Decision-4B」と表示し、サブタイトルは「同じQwen3.5-4Bの祖先、二つの正反対の出力」、三つのチップは「ツール呼び出しとパッチ」「フィールドごとに1つの記号」「どちらも独立して採点されていない」と表示し、フッターは「両方のスコアボードはベンダー報告であり、第三者がどちらも再現していない」と表示し、OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

FrogNano-4B-2609 対 Intern Decision 4B:1つのベースモデル、2つのまったく異なる賭け

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのラボは同じチェックポイント、Qwen3.5-4Bを手に取り、互いに似ても似つかない方向へと押し進めた。microsoft/FrogNano-4B-2609は、およそ1,500個の合成ソフトウェアエンジニアリング環境で強化学習によってポストトレーニングされ、5つのツールを備えたハーネスを通じて構造化されたツール呼び出しと複数ファイルのパッチを出力できるようになった。internlm/Intern-Decision-4Bは、テキストを一切出力しないようにファインチューニングされた——状態と、名前付きの質問のスキーマを受け取り、単一のフォワードパスで各選択肢について較正済みの確率を返す。一方はコードを書く。もう一方は何も書くことを拒み、分布を返す。両者を品質で比較するのは無意味だ。実行にかかるコストと、何を任せられるかで比較することこそが、誠実な取り組みである。

どちらも予告なしにリリースされた。これも両者に共通するもう一つの点だ。どちらにもArtificial Analysisのエントリーも、アリーナ評価も、単一の独立した評価さえ存在しない。以下のすべての数値——一方はSWE-benchのラダー、他方はBrierとECEのキャリブレーション行——は、モデルを訓練した当のラボによって、そのラボ自身のハーネス上で生成されたものであり、それが由来しないテストセットには一度も出会っていない。

そのフォークは、どちらのモデルも存在するよりも前に起きた。

ベースチェックポイントは、32層の密なハイブリッドGated DeltaNetおよびゲート付きアテンションモデルであり、両方の派生モデルはその骨格を継承している。その後、2つのポストトレーニングパイプラインには共通点がまったくない。

Microsoftのパイプラインは閉ループだ。TaskPilotは実際のスナップショットから候補となるリポジトリタスクを生成し、現在のチェックポイントからロールアウトを実行して、ポリシーが時々解けるタスクを見つけ、それらを保持して学習する。5回のイテレーションを行い、各回は前のイテレーションのポリシーに対してキャリブレーションされ、最終的にSWE-bench Verifiedで61.5%、SWE-bench Proで37.6%に達した。蒸留はなし — モデルカードには、より強力なモデルの軌跡、行動、推論トレースをターゲットとして使用していないと記載されている。

InternLMのパイプラインは、固定されたタスク形状に対する単一の教師あり目的関数です。モデルには、システムプロンプト、状態、意思決定スキーマ、および各フィールドに1つずつプレースホルダーを持つ完全なアシスタントのJSON骨組みが与えられます。モデルは因果的フォワードパスを1回実行し、各プレースホルダー位置のロジットを読み取り、そのフィールドで許可された候補記号のみに対してソフトマックスを計算します。InternLMのカードはそれを明言しています。このパスは「generate()を呼び出したり、自由形式のテキストをサンプリングしたりしない」と述べています。

その違いは規模の違いではない。そもそもその成果物が何であるかという違いだ。FrogNano-4B-2609 は、百通りもの興味深い間違い方をして、テストによって正されることのできるエージェントだ。Intern-Decision-4B は、失敗モードが自信満々の数値であるスコアラーだ。

二つの契約、そしてどちらも「プロンプトを送る」ではない

FrogNanoのコントラクトはループです。モデルはRead、Write、Edit、Glob、Bashへの呼び出しを出力し、Leafハーネスがそれらを隔離されたリポジトリサンドボックス内で実行して出力を返し、モデルが呼び出しをやめるまでループが続きます。評価は約131Kの合計トークン内で150ステップにわたって実行され、アシスタントの各ターンで最大8,192トークンが生成されました。サービングには、Qwen3推論パーサーとQwen3コーダーツール呼び出しパーサーを備えたSGLangが必要です。ここを間違えると、ハーネスがJSONを期待している場面でモデルが散文を生成し、外から見ると壊れたモデルとまったく同じに見えます。

Intern-Decision-4Bの契約はワンショットで、厳格な制約がある。質問と選択肢は順序を維持する。選択肢は単一トークン記号にマッピングされる — AからZ、次にaからz、次に0から9。これが、質問の選択肢が最大62個になる算術的な理由である。ラッパーの上限は8,192トークンで、InternLMのカードには、それより長い入力が切り捨てなしで拒否されることが明記されている。3つの質問タイプがサポートされている:choiceは順序付き基準マップを伴い、scoreはリストまたは数値キーのマップを伴い、またnoulはバイナリ。最大8枚の画像が許可され、そのトークンは同じ8,192にカウントされる。

• 出力形式 — FrogNano-4B-2609 はツール呼び出し、推論テキスト、パッチを出力します。Intern-Decision-4B は各フィールドにつき 1 つの記号のみを出力し、それ以外は何も出力しません。

• 決定性 — FrogNano は温度0.6で3つのシードにわたりサンプリングするため、設計上確率的である。Intern-Decision-4B の argmax はフォワードパスによって固定され、フィットされた温度はその信頼度だけを動かす。

• 故障面 — FrogNano は API をハルシネーションしたり、編集範囲を過度に広げたり、脆弱性を混入させながらテストを通したりする可能性があり、これらはすべてそのカードが挙げている。Intern-Decision-4B は回答をハルシネーションできない。なぜなら、あなたが用意した選択肢から選ぶことしかできず、起こり得るのはキャリブレーションのずれだけだからだ。

• 入力上限 — 評価構成における FrogNano では約 131K の合計トークンである一方、Intern-Decision-4B では厳格な 8,192 であり、これは 16 倍の差で、回避策はない。

• コスト構造 — FrogNanoはトラジェクトリ単位で課金し、トラジェクトリは長い。Intern-Decision-4Bには課金対象となる出力トークンが一切ない。

• パラメータ — FrogNano カードは「500M-5B」の範囲を示し、約4.66Bと記載しており、9.32 GBのBF16ダウンロードがあります。Intern-Decision-4Bは4.54Bとされており、その言語シャードに加えて612 MBのビジョンタワーと54 MBのプロジェクターがあります。

このペアリングを決める数字

InternLMのカードでは、単一のRTX 4090上で、ローカルのHugging Face経路を通した場合、Intern-Decision-4Bは平均レイテンシ44.16 ms、中央値44.03 ms、P95は44.60 msとされている。そのばらつきをもう一度見てほしい。中央値からテールまでが1ミリ秒をはるかに下回っている。固定形状のフォワードパスには、ほとんど変動する要素がないからだ。これがこのアーキテクチャを選ぶ理由のすべてである。

FrogNano の対応する数値はミリ秒では示されていません。その評価では、タスクごとにエージェント上限 10,800 秒、150 ステップの予算が認められていました。これらは比較できる単位ではなく、レイテンシーの主張と同じ文に入れるべきではありません——しかし、それでもトレードオフの形は教えてくれます。一方のモデルは 44 ミリ秒で判断を返し、もう一方はパッチを追い求めるツール呼び出しに数分を費やします。「このチケットを 6 つのキューのいずれかに振り分けて、どれほど確信があるか教えてほしい」という問題なら、前者は後者の安価版ではなく、別の機械です。

両研究室は自らを注意深く測定しており、どちらの測定値の組も結果ではなく意図として読むべきだ。InternLMは、1,728件の指定校正ケースで温度1.99241824に当てはめ、ブライアスコア0.347、期待校正誤差0.065で、7セット平均90.02を報告している。Microsoftは、SWE-bench Verifiedで39.4%から61.5%への5反復の上昇を報告しており、同論文の付録では同じ推移を48.2%、53.4%、58.3%、58.6%、61.6%として報告している——一つの研究室の内部でさえ、同じ事実を二通りに測ると二つの階段が生じることを思い出させる。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

見分ける手がかりは、それぞれのカードがあなたに何を警告しようとしているかにある

どちらのカードも珍しいほど正直で、その正直さは正反対の方向を指している——これがこの比較で最も役立つ点だ。

Microsoftの既知の制限事項セクションは、デプロイメント警告のように読める。英語とPythonのみ。パフォーマンスはハーネスとテスト品質に敏感。テストに合格していても、不正確または安全でない可能性があるパッチ。カード自身の一文は、FrogNanoは「無制限の自律的な展開に対して独立して安全アラインメントされているとは見なすべきではない」というものであり、具体的なギャップを明示している。エージェント固有のポストトレーニングでは、安全性選好、拒否、敵対的データが一切使われなかった。代わりに機能的正確さと回帰回避に最適化したからである。また、1.71%という並列ツール呼び出し率も自発的に開示している。これは、ハーネスが許可しているにもかかわらず、モデルが1ターンで2つのツールを呼び出すことがほとんどないことを意味する。チームが回復を試みるために統合ステージを追加した、ベースモデルからの実際の能力退行である。

InternLMのモデルカードは、逆の種類の事柄について警告している。幻覚について警告すべき表面は存在しないため、注意事項は入力に関するものだ。すなわち、8,192の拒否、62オプションの上限、基盤となるテキストタワーが262,144トークンの位置制限を宣言しているのに、リリースされたラッパーがそれを使うことを拒否しているという事実である。そのリスクは、自信のある数値が本来の価値以上に信頼されることだ。そしてモデルカードは、キャリブレーションがJevベースラインとのギャップを狭めるものの、すべてのスライスでそれを埋めるわけではないことを率直に述べている。

併せて読むと、これらは2つの異なる信頼の姿勢を表している。FrogNanoは行動するため、監督が必要だ。Intern-Decision-4Bはスコアを出すため、監査が必要だ — そして、本番の意思決定を動かす数値は、誰もテストしようと考えない種類の出力まさにそのものだ。

ルーターの位置づけと、両方についての正直な注記

どちらのモデルもホスト型エンドポイントではない。FrogNanoは重みとKubernetes評価ハーネスとして提供され、Intern-Decision-4Bは4つのシャードをダウンロードした後にインポートするPythonクラスとして提供される。実際の何かの手前でどちらかを試したいチームにとって、安全なパターンは両者で同じであり、華やかではない。それは、実験的コンポーネントをフォールバックの背後に置くことだ。そうすれば、悪い軌道やキャリブレーションがずれた日があっても、インシデントではなく再試行で済む。

そうしたパターンこそが、ルーティング層の役割だ。OrcaRouter は 200 以上のモデルを、1 つの OpenAI 互換キーの背後で動かすマークアップ 0% — プロバイダーの定価をそのまま透過、つまりベンダーの価格変更は当日のうちにこちら側へ反映される — そしてそのフェイルオーバーは、フォールバック先である汎用モデルの手前にあり、この 2 つの手前にはない。はっきり言えば、当社は FrogNano-4B-2609 も Intern-Decision-4B も扱っておらず、どちらについても提供時期は未定だ。単一エンドポイントがここでもたらすのは、比較そのものが安く済むということ — 1 つの資格情報、1 つの請求明細、そして専門特化モデルの比較対象としている汎用モデルを差し替えるたびに生じる 2 つ目の統合が不要になる。

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

どちらを、そしていつ

回答がすでにプロンプト内に存在し、それを信頼度付きで選ばせる必要があり、毎秒数千件のペースで処理したいなら、Intern-Decision-4Bを採用しよう。固定タクソノミーのルーティング、ルーブリック採点、スキーマ制約付き抽出、閉じたラベル集合に対するモデレーション。44ミリ秒のフォワードパスと出力トークン課金ゼロが製品であり、それを信頼する前に監査すべきなのはキャリブレーションだ。

答えがまだ存在せず、リポジトリを読んでそのテストを実行することで見つけ出さなければならないときは、FrogNano-4B-2609 を選ぼう。それは数分にわたる、サンドボックス化された、レビュー可能なプロセスであり、SWE-bench Verified における 61.5% — ベンダー報告で未再現 — は、4B チェックポイントがそもそもそれを実行できるという現時点で最良の証拠である。

どちらに転んでも許されるべきではないのは、両者のスコアを比べる癖そのものだ。90.02という7セット平均と、SWE-bench Verifiedの61.5%という達成率は、二つの異なる問いを測った結果であり、二つのラボが、二つの評価ハーネスで出したもので、どちらの数値も第三者の手を経ていない。両者に共通するのは一つの祖先だけであり、それ以外に何もない。

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

共通祖先から得られた、本当に有用な予測が一つある。両モデルは同じ4Bチェックポイントから出発しているため、両者の違いはほぼ完全にポストトレーニングにある。つまり、Qwen3.5-4Bを基盤に何かを作ろうとする人にとって興味深い問いは、この二つの報酬構造のうちどちらが自分の領域に転移するか、ということだ。自身の方策に照らして較正する合成タスクループか、それとも温度をフィッティングした固定形状のスコアリングヘッドか。どちらも公開済みの二つのレシピであり、どちらもまだ他者に実行させていないラボから出ている。これは珍しい状況であり、飛びつくよりも注視する価値がある。