生成されたタイトルカードは「FrogNano-4B-2609 vs Qwen 3.8」、サブタイトルは「自分のGPU上の4Bエージェントが、2.4Tのホスト型フラッグシップに挑む」、3つのチップは「9.32 GB ダウンロード」「100万あたり$2入力/$6出力」「タスクあたり最大150ステップ」、フッターは「FrogNanoの数値はMicrosoftによるもの、Qwen3.8-Maxの価格はAlibabaによるもの。ここにあるものは独立していない」、そして右下隅に合成されたOrcaRouterロゴ。
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8:重みが自分のものであるとき、コーディングエージェントにはいくらかかるのか

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

microsoft/FrogNano-4B-2609 は、Qwen3.5-4B から派生した 40 億クラスのリポジトリエージェントで、自分でダウンロードしてホストするものです。Qwen3.8-Max はホスト型のフラッグシップモデルで、2.4 兆パラメータのスパースな Mixture-of-Experts、トークンあたり 950 億パラメータが活性、100 万トークンのマルチモーダルウィンドウを備え、料金は入力 100 万トークンあたり $2.00、出力 100 万トークンあたり $6.00 で、2026 年 8 月 3 日から API キーで利用できます。片方は GPU 1 基と丸半日分のコストがかかる。もう片方は使うまで無料で、使い始めれば、よく使われる最長のトラジェクトリ上でトークン単位で課金される。本当の勝負を決めるのは、ベンチマークの表ではなく、このトレードオフなのです。

ここに記載されているFrogNanoの数値は、Microsoftのモデルカードおよび技術レポートに由来します。Qwen3.8-Maxの数値は、Alibabaが公開している価格と、当社自身のカタログにあるモデル記録に由来し、独立系スコアは、登場する箇所ではすべてArtificial Analysisの数値としてラベル付けされています。命名には十分注意してください。Qwen3.8というオープンウェイト版は発表されていますが、まだ出荷されていません。一方、Qwen3.8-Maxは現在稼働中で、本日時点で価格も設定されています。本記事で呼び出し可能なものはすべて後者です。

比較を決める計算

まず、1つのタスクにかかるコストから見ていきましょう。それは決して自明なものではなく、小さなものでもないからです。

FrogNanoの評価では、すべてのトラジェクトリを、およそ131Kの合計トークン以内、アシスタントの各ターンあたり最大8,192生成トークン、上限10,800秒という150ステップの予算で実行した。公表された2つの制限を掛け合わせると、最悪ケースの1トラジェクトリあたり約123万生成トークンという上限が得られる——これはQwen3.8-Maxの出力トークン100万あたり$6.00では、予算を使い切るまで実行された単一タスクでおよそ$7.38に相当する。これは公表された2つの数値に基づく算術であり、測定値ではない。実際のトラジェクトリは早期に停止し、平均は上限をはるかに下回り、ツール結果とシェル出力は出力レートではなく、より安い入力レートで課金される。しかし、それは事態の輪郭を明らかにする。コーディングエージェントは、ある質問に対して数百トークンを費やすのではない。自分自身との長く推論の多い会話に費やし、その会話のすべてのトークンが生成される。

では、その隣に帳簿のもう一方の側を置いてみよう。FrogNano-4B-2609 は、2つのシャードに分かれた 9.32 GB の BF16 重みで、ゲートなしでダウンロードできる。これをサービングするには、Qwen3 reasoning パーサーと Qwen3 coder tool-call パーサーを備えた SGLang に加えて、5つのツール用の分離されたサンドボックスが必要だ。その後は、1つのトラジェクトリの限界費用は電気代であり、それが占有するメモリは、重みの重さではなく、コンテキストがどこまで大きくなるかで決まる。

• コストモデル — {{1}}FrogNano-4B-2609{{/1}} はハードウェア費用が固定で、限界費用はほぼゼロ。{{2}}Qwen3.8-Max{{/2}} は固定費用がゼロでトークン単位の課金となり、$2.00 / $6.00 の区分は前倒しを一切行わず、出力レートで全額を後ろ倒しにする。

• その資金で手に入るもの — 自社のシリコン上で動く4Bクラスのエージェントと、キャパシティプランニングが一切不要なフロンティア規模のモデルとの対比。

• 損益分岐点 — これは、月間のトラジェクトリ量にトラジェクトリ1件あたりの平均トークン料金を掛けた額が、そうでなければレンタルすることになる GPU のコストを上回ったときに達成されます。1日にわずか数件のリポジトリタスクを実行するチームにとって、そのラインははるか遠くにあり、ホスト型モデルは利便性だけでも軍配が上がります。

同じ仕事をしない2つのモデル

コスト比較が公平と言えるのは、出力が比較可能な場合だけであり、ここではそうなっていない。そしてこの点こそ、ほとんどのスペックシートが埋もれさせている部分だ。

FrogNano-4B-2609は、リポジトリレベルのソフトウェアエンジニアリングのみを対象にポストトレーニングされています。そのインターフェース全体は、5つのツールによるループです — Read、Write、Edit、GlobとBash — これはLeafハーネスによって隔離されたサンドボックス内で実行され、モデルが呼び出しを停止するまで繰り返されます。Microsoftのカードには、サポート対象言語は英語、検証済みのプログラミング領域はPythonと記載されており、チェックポイント内の画像および動画コンポーネントはポストトレーニングされておらず、サポートされていないと明言されています。あなたのアーキテクチャについて推論したり、あなたのビジネスに関する質問に答えたり、スクリーンショットを読み取ったりすることはありません。

Qwen3.8-Maxは汎用モデルである。Alibabaのカタログ記録では、テキスト、画像、動画の入力とテキスト出力、および1,000,000トークンのコンテキストウィンドウを備えるとされている。推論し、文章を書き、文書を読み、会話を行う。その関数呼び出しは、チェックポイントの目的そのものではなく、汎用モデルの一機能である。2026年9月2日に記録から読み取ったArtificial Analysisの数値は、Intelligence Indexが45.4、Coding Indexが76.2である。

• 入力 — FrogNano-4B-2609はテキストのみ。Qwen3.8-Maxはテキスト、画像、動画に対応。

• コンテキスト — FrogNanoの評価済み構成では合計131Kトークン、それに対してQwen3.8-Maxは1,000,000。これは7.5倍であり、コーディングエージェントが受け取るリポジトリ規模の入力でこそ最も大きく響く。

• ターンあたりの出力 — FrogNanoの検証済み構成では、単一のアシスタントターンが8,192トークンに制限されます。Qwen3.8-Maxは、同等の応答あたりの上限を公表していません。

• 出力形式 — FrogNano は構造化された Leaf ツール呼び出しを出力するため、それらを実行するハーネスが必要です。Qwen3.8-Max は、すでにお持ちの任意のクライアントに、散文または関数呼び出しを返します。

• 独立したスコア — FrogNano-4B-2609 については、それ自身のカード以外にはありません。上記の Qwen3.8-Max の数値は、Artificial Analysis による第三者提供のものです。

• パラメータ — そのカード自体の説明によれば、FrogNanoは約4.66Bであるのに対し、Qwen3.8-Maxは合計2.4兆、アクティブは約95B。

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

{{1}}4B{{/1}}が本当にその存在価値を発揮する場面

4Bエージェントがフロンティアモデルを完全に打ち負かす軸が1つあり、それは精度ではない。

FrogNanoの論文はQwen3.5-4Bから出発している。このモデルは、素の汎用モデルとしてLeafハーネス経由でSWE-bench Verifiedにおいて39.4%を記録した。約1,500件の合成タスクに対する5回の強化学習イテレーションにより、スコアは61.5%まで向上し、同論文の付録では各イテレーションごとの進捗が48.2%、53.4%、58.3%、58.6%、61.6%と報告されている。この手法——より強力なモデルからの蒸留を一切行わず、現在のポリシーの学習可能性フロンティアに合わせて調整されたタスクを生成する——こそが貢献であり、フロンティアモデル並みの予算を持たない研究グループが注目する理由でもある。

それが比較にとって何を意味するかを読み取ってほしい。Microsoftのモデルカードは、FrogNanoがその由来元のモデルより一律に優れているわけではないことを率直に認めている。その並列ツール呼び出し率は1.71%だ。後のイテレーションで同時呼び出しを実行する能力が失われたためで、チームはそれを取り戻そうと統合ステージを追加した。より多くの問題を解決しながら、ある特定の振る舞いでは悪化するモデルは、目に見える継ぎ目を抱えた本物のエンジニアリング成果物であり、そのカードはそれを埋もれさせるどころか、そう明言している。

そして、SWE-benchの数値は閉じたループになっている。ベースモデルのベースライン、ハーネス、最終スコアはすべて同じラボから出ており、同じ論文の2つの表が、同じ実験に対して2つの異なるラダーを示している。対照的に、Qwen3.8-Maxのコーディング数値はAlibabaではなくArtificial Analysisによって生成された——証拠の種類が異なり、信頼の種類も異なり、この2つを互いに差し引くべきではない。

まだ完全には計画に織り込めない4B

FrogNano-4B-2609 と本番枠の間には 2 つの事柄が立ちはだかっており、そのどちらも、どのレビュアーの意見でもなく、それ自身のドキュメントの中にある。

最初はハードウェアだ。このカードは、BF16の重み要件を約9.3 GBと示し、さらに、結合コンテキストが約131Kトークンに近づくにつれてメモリが「大幅に増加する」と付け加えている。そのうえで、正確な最小GPUモデル、VRAM構成、ランタイムのバージョン、性能プロファイルは「リリース前に依然として検証する必要がある」と述べている——すでにダウンロード可能なモデルに載っている一文である。評価対象の構成についてVRAMの数値を公表した人は誰もおらず、このカードにもその数値は含まれていない。

第二点は安全態勢です。Microsoft自身のアラインメント注記は、エージェント固有のポストトレーニングでは安全性選好、拒否、有害コンテンツ、敵対的データセットを一切使用せず、代わりに機能的正確性と回帰回避に最適化したと述べており、またこのモデルは「無制限の自律展開に対して独立して安全アラインメントされているとは見なすべきではない」としています。カードは最後に、具体的なリスクを挙げて締めくくっています。パッチはテストに合格しても不正確または安全でない可能性があり、性能はそれらのテストの品質に敏感であり、すべての候補パッチは使用前に、資格を有する人間によるレビューと独立した回帰テストおよびセキュリティテストを必要とする、というものです。一般的なホスト型モデルには、これらの特定の注意事項はどれも当てはまりません。また、あなたのリポジトリでシェルコマンドを実行することもありません。

どちら側を選んでも鍵は1つ

実際にこの比較を回してみて役に立つのは、そのうち片方だけがダウンロードで済むという点です。Qwen3.8-Max や、セルフホスト型エージェントのベンチマーク比較対象になる汎用モデルは、いずれも OrcaRouter 上の OpenAI 互換エンドポイント1つを通じて{{2}}マークアップ0%で{{/2}}{{3}}—{{/3}}{{4}}プロバイダーの定価をそのままパススルー{{/4}}利用できますマークアップ0%で—プロバイダーの定価をそのままパススルー。そのためベンダーの価格変更は当日にこちら側へ反映されます。これは、コーディングエージェントの出力トークン請求額を抑えようとしているときに実際に動く数字です。同じことはフェイルオーバーの問題もシンプルにします。パイプラインのホスト側が劣化したとしても、再試行は自動で行われ、実験はそのまま続きます。

FrogNano-4B-2609 は当社のルートの一つではなく、その日付もありません。重みはあなたがサービングするものであり、カードはサービング構成が完全には検証されていないことを正直に示しています。当社にできるのは、比較のもう一方の側をセットアップするのにコストをかけないようにすることです。そうすれば、あなたが最終的に答える問いは本当の問いになります — あなた自身の GPU 上で、ベンダー報告の 61.5% の SWE-bench エージェントが、あなた自身のタスクで、あなた自身のボリュームで、従量制のフロンティアモデルを上回るかどうかという問いです。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

どちらを選ぶべきか

Qwen3.8-Max に頼るべきなのは、作業が汎用的なとき、他社の運用チームにキャパシティを担ってもらうべきとき、入力に画像や長い文書が含まれる可能性があるとき、あるいは金曜日までにサービングスタックを用意するのではなく今日中に回答が必要なときだ。サードパーティのスコアがあれば、何を購入するのかをおおよそ予測でき、トークンあたりの請求額は、契約を確定する前に確認できる変動費だ。月に控えめな数のリポジトリタスクを実行するチームにとって、その計算は比べ物にならない。

FrogNano-4B-2609 を選ぶべきなのは、長いトラジェクトリでのトークン単位課金が制約になるほど量が多く、データを自社インフラの外に出せない場合、あるいは「小さなエージェントを教師なしでリポジトリレベルの能力まで訓練できるか」という研究上の問いこそが、実際に検証したいものである場合だ。三つのことを承知の上で臨んでほしい。61.5% はラボ自身がラボ管理のハーネス上で測定した値であること、評価された構成の VRAM 数値は誰も公開していないこと、そしてカード自体に、サービング構成はまだ検証されていないと書かれていることだ。

この組み合わせが記事に書く価値があるのは、2世代前に共通の祖先を持つからだ。FrogNano は Qwen3.5-4B の子孫だ——同じ企業の汎用モデルで、その2.4兆パラメータの旗艦モデルはこのページの反対側にある。マイクロソフトは小さい方を取り、合成リポジトリで5回のRLイテレーションを行い、専門特化モデルを得た。アリババは逆の道を行き、スケールさせた。どちらの答えも公開されており、ダウンロードにかかるコストとAPIにかかるコストの差が、両者を選ぶための誠実な判断基準だ。

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新