
FrogNano-4B-2609 vs Qwen 3.8:重みが自分のものであるとき、コーディングエージェントにはいくらかかるのか
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
microsoft/FrogNano-4B-2609 は、Qwen3.5-4B から派生した 40 億クラスのリポジトリエージェントで、自分でダウンロードしてホストするものです。Qwen3.8-Max はホスト型のフラッグシップモデルで、2.4 兆パラメータのスパースな Mixture-of-Experts、トークンあたり 950 億パラメータが活性、100 万トークンのマルチモーダルウィンドウを備え、料金は入力 100 万トークンあたり $2.00、出力 100 万トークンあたり $6.00 で、2026 年 8 月 3 日から API キーで利用できます。片方は GPU 1 基と丸半日分のコストがかかる。もう片方は使うまで無料で、使い始めれば、よく使われる最長のトラジェクトリ上でトークン単位で課金される。本当の勝負を決めるのは、ベンチマークの表ではなく、このトレードオフなのです。
ここに記載されているFrogNanoの数値は、Microsoftのモデルカードおよび技術レポートに由来します。Qwen3.8-Maxの数値は、Alibabaが公開している価格と、当社自身のカタログにあるモデル記録に由来し、独立系スコアは、登場する箇所ではすべてArtificial Analysisの数値としてラベル付けされています。命名には十分注意してください。Qwen3.8というオープンウェイト版は発表されていますが、まだ出荷されていません。一方、Qwen3.8-Maxは現在稼働中で、本日時点で価格も設定されています。本記事で呼び出し可能なものはすべて後者です。
比較を決める計算
まず、1つのタスクにかかるコストから見ていきましょう。それは決して自明なものではなく、小さなものでもないからです。
FrogNanoの評価では、すべてのトラジェクトリを、およそ131Kの合計トークン以内、アシスタントの各ターンあたり最大8,192生成トークン、上限10,800秒という150ステップの予算で実行した。公表された2つの制限を掛け合わせると、最悪ケースの1トラジェクトリあたり約123万生成トークンという上限が得られる——これはQwen3.8-Maxの出力トークン100万あたり$6.00では、予算を使い切るまで実行された単一タスクでおよそ$7.38に相当する。これは公表された2つの数値に基づく算術であり、測定値ではない。実際のトラジェクトリは早期に停止し、平均は上限をはるかに下回り、ツール結果とシェル出力は出力レートではなく、より安い入力レートで課金される。しかし、それは事態の輪郭を明らかにする。コーディングエージェントは、ある質問に対して数百トークンを費やすのではない。自分自身との長く推論の多い会話に費やし、その会話のすべてのトークンが生成される。
では、その隣に帳簿のもう一方の側を置いてみよう。FrogNano-4B-2609 は、2つのシャードに分かれた 9.32 GB の BF16 重みで、ゲートなしでダウンロードできる。これをサービングするには、Qwen3 reasoning パーサーと Qwen3 coder tool-call パーサーを備えた SGLang に加えて、5つのツール用の分離されたサンドボックスが必要だ。その後は、1つのトラジェクトリの限界費用は電気代であり、それが占有するメモリは、重みの重さではなく、コンテキストがどこまで大きくなるかで決まる。
• コストモデル — {{1}}FrogNano-4B-2609{{/1}} はハードウェア費用が固定で、限界費用はほぼゼロ。{{2}}Qwen3.8-Max{{/2}} は固定費用がゼロでトークン単位の課金となり、$2.00 / $6.00 の区分は前倒しを一切行わず、出力レートで全額を後ろ倒しにする。
• その資金で手に入るもの — 自社のシリコン上で動く4Bクラスのエージェントと、キャパシティプランニングが一切不要なフロンティア規模のモデルとの対比。
• 損益分岐点 — これは、月間のトラジェクトリ量にトラジェクトリ1件あたりの平均トークン料金を掛けた額が、そうでなければレンタルすることになる GPU のコストを上回ったときに達成されます。1日にわずか数件のリポジトリタスクを実行するチームにとって、そのラインははるか遠くにあり、ホスト型モデルは利便性だけでも軍配が上がります。
同じ仕事をしない2つのモデル
コスト比較が公平と言えるのは、出力が比較可能な場合だけであり、ここではそうなっていない。そしてこの点こそ、ほとんどのスペックシートが埋もれさせている部分だ。
FrogNano-4B-2609は、リポジトリレベルのソフトウェアエンジニアリングのみを対象にポストトレーニングされています。そのインターフェース全体は、5つのツールによるループです — Read、Write、Edit、GlobとBash — これはLeafハーネスによって隔離されたサンドボックス内で実行され、モデルが呼び出しを停止するまで繰り返されます。Microsoftのカードには、サポート対象言語は英語、検証済みのプログラミング領域はPythonと記載されており、チェックポイント内の画像および動画コンポーネントはポストトレーニングされておらず、サポートされていないと明言されています。あなたのアーキテクチャについて推論したり、あなたのビジネスに関する質問に答えたり、スクリーンショットを読み取ったりすることはありません。
Qwen3.8-Maxは汎用モデルである。Alibabaのカタログ記録では、テキスト、画像、動画の入力とテキスト出力、および1,000,000トークンのコンテキストウィンドウを備えるとされている。推論し、文章を書き、文書を読み、会話を行う。その関数呼び出しは、チェックポイントの目的そのものではなく、汎用モデルの一機能である。2026年9月2日に記録から読み取ったArtificial Analysisの数値は、Intelligence Indexが45.4、Coding Indexが76.2である。
• 入力 — FrogNano-4B-2609はテキストのみ。Qwen3.8-Maxはテキスト、画像、動画に対応。
• コンテキスト — FrogNanoの評価済み構成では合計131Kトークン、それに対してQwen3.8-Maxは1,000,000。これは7.5倍であり、コーディングエージェントが受け取るリポジトリ規模の入力でこそ最も大きく響く。
• ターンあたりの出力 — FrogNanoの検証済み構成では、単一のアシスタントターンが8,192トークンに制限されます。Qwen3.8-Maxは、同等の応答あたりの上限を公表していません。
• 出力形式 — FrogNano は構造化された Leaf ツール呼び出しを出力するため、それらを実行するハーネスが必要です。Qwen3.8-Max は、すでにお持ちの任意のクライアントに、散文または関数呼び出しを返します。
• 独立したスコア — FrogNano-4B-2609 については、それ自身のカード以外にはありません。上記の Qwen3.8-Max の数値は、Artificial Analysis による第三者提供のものです。
• パラメータ — そのカード自体の説明によれば、FrogNanoは約4.66Bであるのに対し、Qwen3.8-Maxは合計2.4兆、アクティブは約95B。

{{1}}4B{{/1}}が本当にその存在価値を発揮する場面
4Bエージェントがフロンティアモデルを完全に打ち負かす軸が1つあり、それは精度ではない。
FrogNanoの論文はQwen3.5-4Bから出発している。このモデルは、素の汎用モデルとしてLeafハーネス経由でSWE-bench Verifiedにおいて39.4%を記録した。約1,500件の合成タスクに対する5回の強化学習イテレーションにより、スコアは61.5%まで向上し、同論文の付録では各イテレーションごとの進捗が48.2%、53.4%、58.3%、58.6%、61.6%と報告されている。この手法——より強力なモデルからの蒸留を一切行わず、現在のポリシーの学習可能性フロンティアに合わせて調整されたタスクを生成する——こそが貢献であり、フロンティアモデル並みの予算を持たない研究グループが注目する理由でもある。
それが比較にとって何を意味するかを読み取ってほしい。Microsoftのモデルカードは、FrogNanoがその由来元のモデルより一律に優れているわけではないことを率直に認めている。その並列ツール呼び出し率は1.71%だ。後のイテレーションで同時呼び出しを実行する能力が失われたためで、チームはそれを取り戻そうと統合ステージを追加した。より多くの問題を解決しながら、ある特定の振る舞いでは悪化するモデルは、目に見える継ぎ目を抱えた本物のエンジニアリング成果物であり、そのカードはそれを埋もれさせるどころか、そう明言している。
そして、SWE-benchの数値は閉じたループになっている。ベースモデルのベースライン、ハーネス、最終スコアはすべて同じラボから出ており、同じ論文の2つの表が、同じ実験に対して2つの異なるラダーを示している。対照的に、Qwen3.8-Maxのコーディング数値はAlibabaではなくArtificial Analysisによって生成された——証拠の種類が異なり、信頼の種類も異なり、この2つを互いに差し引くべきではない。
まだ完全には計画に織り込めない4B
FrogNano-4B-2609 と本番枠の間には 2 つの事柄が立ちはだかっており、そのどちらも、どのレビュアーの意見でもなく、それ自身のドキュメントの中にある。
最初はハードウェアだ。このカードは、BF16の重み要件を約9.3 GBと示し、さらに、結合コンテキストが約131Kトークンに近づくにつれてメモリが「大幅に増加する」と付け加えている。そのうえで、正確な最小GPUモデル、VRAM構成、ランタイムのバージョン、性能プロファイルは「リリース前に依然として検証する必要がある」と述べている——すでにダウンロード可能なモデルに載っている一文である。評価対象の構成についてVRAMの数値を公表した人は誰もおらず、このカードにもその数値は含まれていない。
第二点は安全態勢です。Microsoft自身のアラインメント注記は、エージェント固有のポストトレーニングでは安全性選好、拒否、有害コンテンツ、敵対的データセットを一切使用せず、代わりに機能的正確性と回帰回避に最適化したと述べており、またこのモデルは「無制限の自律展開に対して独立して安全アラインメントされているとは見なすべきではない」としています。カードは最後に、具体的なリスクを挙げて締めくくっています。パッチはテストに合格しても不正確または安全でない可能性があり、性能はそれらのテストの品質に敏感であり、すべての候補パッチは使用前に、資格を有する人間によるレビューと独立した回帰テストおよびセキュリティテストを必要とする、というものです。一般的なホスト型モデルには、これらの特定の注意事項はどれも当てはまりません。また、あなたのリポジトリでシェルコマンドを実行することもありません。
どちら側を選んでも鍵は1つ
実際にこの比較を回してみて役に立つのは、そのうち片方だけがダウンロードで済むという点です。Qwen3.8-Max や、セルフホスト型エージェントのベンチマーク比較対象になる汎用モデルは、いずれも OrcaRouter 上の OpenAI 互換エンドポイント1つを通じて{{2}}マークアップ0%で{{/2}}{{3}}—{{/3}}{{4}}プロバイダーの定価をそのままパススルー{{/4}}利用できますマークアップ0%で—プロバイダーの定価をそのままパススルー。そのためベンダーの価格変更は当日にこちら側へ反映されます。これは、コーディングエージェントの出力トークン請求額を抑えようとしているときに実際に動く数字です。同じことはフェイルオーバーの問題もシンプルにします。パイプラインのホスト側が劣化したとしても、再試行は自動で行われ、実験はそのまま続きます。
FrogNano-4B-2609 は当社のルートの一つではなく、その日付もありません。重みはあなたがサービングするものであり、カードはサービング構成が完全には検証されていないことを正直に示しています。当社にできるのは、比較のもう一方の側をセットアップするのにコストをかけないようにすることです。そうすれば、あなたが最終的に答える問いは本当の問いになります — あなた自身の GPU 上で、ベンダー報告の 61.5% の SWE-bench エージェントが、あなた自身のタスクで、あなた自身のボリュームで、従量制のフロンティアモデルを上回るかどうかという問いです。

どちらを選ぶべきか
Qwen3.8-Max に頼るべきなのは、作業が汎用的なとき、他社の運用チームにキャパシティを担ってもらうべきとき、入力に画像や長い文書が含まれる可能性があるとき、あるいは金曜日までにサービングスタックを用意するのではなく今日中に回答が必要なときだ。サードパーティのスコアがあれば、何を購入するのかをおおよそ予測でき、トークンあたりの請求額は、契約を確定する前に確認できる変動費だ。月に控えめな数のリポジトリタスクを実行するチームにとって、その計算は比べ物にならない。
FrogNano-4B-2609 を選ぶべきなのは、長いトラジェクトリでのトークン単位課金が制約になるほど量が多く、データを自社インフラの外に出せない場合、あるいは「小さなエージェントを教師なしでリポジトリレベルの能力まで訓練できるか」という研究上の問いこそが、実際に検証したいものである場合だ。三つのことを承知の上で臨んでほしい。61.5% はラボ自身がラボ管理のハーネス上で測定した値であること、評価された構成の VRAM 数値は誰も公開していないこと、そしてカード自体に、サービング構成はまだ検証されていないと書かれていることだ。
この組み合わせが記事に書く価値があるのは、2世代前に共通の祖先を持つからだ。FrogNano は Qwen3.5-4B の子孫だ——同じ企業の汎用モデルで、その2.4兆パラメータの旗艦モデルはこのページの反対側にある。マイクロソフトは小さい方を取り、合成リポジトリで5回のRLイテレーションを行い、専門特化モデルを得た。アリババは逆の道を行き、スケールさせた。どちらの答えも公開されており、ダウンロードにかかるコストとAPIにかかるコストの差が、両者を選ぶための誠実な判断基準だ。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
