
Sakana Fugu Max:機能する中で最も安価なモデルを選ぶ$2/$6のオーケストレーター
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
ほとんどのモデルは、どれだけ多くできるかを競っている。Sakana Fugu Max は、どれだけ少ない手間で済ませられるかを競っている。Sakana AI はSakana Fugu Maxを2026年9月11日に発表した。同時にSakana Fugu Ultra v2も — 単一のオーケストレーションアーキテクチャを、コストと性能の曲線の両極端に向けて調整した2つのチューニングである。Fugu Max は、あなたのリクエストに自分で答えるわけではない。タスクを読み、プールの中で妥当に処理できそうな最も安価なモデルを選び、そこへルーティングして、1つの回答を返す。Sakana の価格は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルである。
面白いのは、その価格が何と比較されているかだ。Sakanaは、Fugu Maxの出力単価がClaude Sonnet 5、GPT-5.6 Terra、Kimi K3を40~60%下回ると主張している。この主張は検証可能で、ローンチ当日のベンチマークにしては珍しく、計算も成り立つ。Sakanaが名指しした3モデルの現在の定価と照らし合わせると、出力100万あたり6ドルは、示された範囲のほぼ中央に収まる。はるかに検証しにくいのは性能面だ。なぜならSakanaはFugu Maxの結果を数値ではなく散布図として公開したからである。
Fugu Maxとは実際に何なのか
Fugu Maxはチェックポイントではありません。重みファイルも、パラメータ数も、ダウンロードするものもありません。Sakanaはそれを「単一のモデルではなく、アーキテクチャ」と説明しています——Fugu Ultra v2と同じ中核オーケストレーションエンジンであり、別の問いに合わせて調整されています。Ultra v2は、利用可能な最高の能力は何かを問います。Fugu Maxは、最低コストで最良の出力は何かを問います。
その区別は運用上重要だ。Fugu Max をファインチューニングしたり、セルフホストしたり、なぜあるモデルを別のモデルより選んだのかを調べたりすることはできない。また、それがルーティングする対象モデルの全リストを見ることもできない——Sakana によれば、そのプールは「これまでで最大の、オープンおよび専門特化モデルのプール」に拡大し、8月に Sakana が発表した NVIDIA との提携を通じて追加された NVIDIA の Nemotron ファミリーを明示的に挙げている。プールの残りは名称が明かされておらず、Sakana はリクエストごとのルーティングトレースを公開していない。
見えているのは、そのものの形だ。ベンダー自身の図では、Fugu Max がファンアウトの頂点に示されている。1つのオーケストレーター、その背後に並ぶ交換可能なモデルスロット、そしてターゲットの中には Sakana Namazu と Fugu Max 自体が含まれている。このプールは設計上交換可能だと説明されており、述べられている動機は経済的であると同じくらい政治的だ——Sakana はオーケストレーションを、ベンダーロックイン、API 失効、輸出管理に対する保護として位置づけている。供給元を交換できるシステムは、そのうちのどれか一つによって遮断されることはない、という主張に基づいている。
Sakana Fugu自体は新しいものではありません。2026年6月22日に一般提供され、ベンダー自身のタイムラインは4月(ベータ)、6月(GA+Fugu Ultra v1)、7月(Fugu-CyberとClaude Codeインターフェース)、8月(Sakana ChatとNVIDIA提携)、そして今回の9月と続いています。Fugu Maxは5回目の月次ステップであり、初登場ではありません。すでにFuguを運用している人なら誰でも、同じOpenAI互換エンドポイントに対して1行のパラメータ変更でアップグレードでき、移行は不要です。
価格に関する主張は、定価との接触に耐える
Sakanaの$2入力/$6出力という数字は、ローンチページにはっきり記載されています。二次報道では、100万トークンあたり$0.25のキャッシュ入力料金が追加されていますが、これはローンチページ自体には記載されていません。その点は確認済みではなく報道ベースとして扱ってください。比較すると、Fugu Ultra v2は入力$5、出力$30で、キャッシュ入力は$0.50です。
では40~60%という主張について。名前が挙げられている3つの比較対象は現在次のとおりです:
• GPT-5.6 Terra — 入力 $2 / 出力 $12(OpenAIが7月30日に実施した値下げにより、出力が$15から引き下げられた後の価格)
• Claude Sonnet 5 — ローンチプロモーション料金では出力$10、標準料金では$15。9月に予定されていた値上げが中止されたのか、それとも単に延期されただけなのかについて情報源の見解が分かれており、そのため価格幅が広くなっている。
• Kimi K3 — 入力 $3 / 出力 $15、キャッシュ済み入力は $0.30。
それらと比べると、$6の出力はTerraより50%低く、Sonnet 5のプロモーション料金より40%低く、Sonnet 5の標準料金より60%低く、Kimi K3より60%低い。この主張は正しく、内部コストモデルではなく公表されているリスト価格に照らして正しい——これはローンチ日のあらゆるパーセンテージについて言えることではない。
同じセクション内の一つの数字は、同じ扱いには耐えない。Sakanaはまた、Fugu Maxが「エリートモデルに肉薄する性能を、2~6倍低いコストで実現する」と述べている。40–60%という数字のために名指ししている3モデルと比べると、生の出力価格差は1.7×~2.5×に近い。より広いほうの倍率は、おそらく文中の3モデルと比べたものではなく、$12をはるかに超えるコストのモデルを含むフロンティア全体にわたって測定されたものだろう。それはパレート曲線についての主張としては擁護できるが、名指しされた競合についての主張としては擁護できない。そしてローンチページはその2つを区別していない。
ルーティング層が価格面で真価を発揮するのは、まさにここです。OrcaRouter はプロバイダーの定価をマークアップなしでパススルーするため、ベンダーが定価を動かせば、表示される数字もその日に動きます。これがここで重要なのは、Fugu Max の前提そのものが、プールのどこかにより安いモデルが存在し、それを意識せずに使えるべきだというものだからです。当社は Fugu Max をホストしていません。それは Sakana 自身の API 上で動作します。しかし、パススルーの原則は、$6 の出力レートを $12 の既存事業者と突き合わせて確認する価値があるものにしている原則と同じであり、どちらの数字も鵜呑みにするのではなく、そうするべきなのです。
Sakanaが打ち負かすと主張しているもの、そしてあなたに見せようとしないもの

ベンダーのベンチマークセクションでは、Fugu Max について3つの具体的な主張がなされている。6つのベンチマーク——Terminal Bench 2.1、GPQA-D、AA-LCR、GDP.pdf、AutomationBench、SWEFish——で総合スコア最高、10のベンチマークのうち7つでコストパフォーマンスのパレートフロンティアを拡大、そしてトークン消費のほんの一部で「エリートモデルに迫る」性能を発揮する、というものだ。
その証拠について、一部でも引用する前に心に留めておく価値のある三つのことがある。
第一に、Sakanaは数値を一切公表しなかった。Fugu Maxの結果は10枚の散布図として現れる——縦軸がスコア、横軸が100万トークンあたりのドル建て出力価格で、Fugu Maxは灰色の領域の北西に赤い点として描かれている。それが左上に位置していることはわかる。そこからスコアを読み取ることはできない。Terminal Bench 2.1、GPQA-D、AA-LCRはいずれも、数値なら直接比較できる公開リーダーボードを持っているが、数値は一つも示されなかった。
第二に、6つのベンチマークのうち1つはSakana自身のものである。SWEFishはローンチページで「Sakana AI自身のコーディング課題とユースケースを反映した、当社の社内ベンチマーク」と説明されている。それは自社製品への適合性を測る正当な方法ではあるが、競合他社と比較する方法ではない——ベンダーが設計したベンチマークで、ベンダーが選んだタスクにおけるスコアは、他社のモデルに関する証拠にはならない。
第三は、ページ上で最も強い数値はもう一方のモデルのものだという点だ。Fugu Maxがグラフを載せている箇所で、Fugu Ultra v2は数値を載せている。Chartographyは48.3で、Opus 5の27.3、Fable 5の29.5を相手にしている。DeepSWEは74.3。8つのベンチマークのうち5つで最高または同率最高、8つのうち7つでトップ2だ。Ultra v2はさらに、2026-08-28という公表されたトレーニングカットオフを持ち、それはローンチの2週間ちょっと前であり、しかも強調されているのは、Fable 5、Fable 5.1、GPT-6 Astraがそのプールに入っていないという明確な注記だ。Sakanaは、それらの特定のモデルを借りずにそこに到達したと主張している。これが、脚注一つに込められた主権論のすべてである。
これらはいずれも、Fugu Maxの主張を虚偽にするものではない。主張を未検証のものにし、6つのベンチマークという見出しは、ラベルを添付した場合にのみ安全に繰り返せるものにする。まったく新しいオーケストレーション・エンドポイントの独立した評価はまれであり、まだ何も公表されていない。
Fugu Max vs Fugu Ultra v2:あなたが実際に欲しいのはどっち?

これらは競合製品ではなく、数字を横に並べて見れば、どちらを選ぶかは明らかだ。Fugu Max は安価な方で、入力 $2、出力 $6。安いモデルで対応できるときは高価なモデルから遠ざけるようにルーティングする設計だ。Fugu Ultra v2 は強力な方で、入力 $5、出力 $30、キャッシュ $0.50。コストが高くついても、複雑な多段階作業では能力へ向けてルーティングする設計だ。
実用的な分かれ目は、予算ではなくタスクの形で決まる。あなたのトラフィックが主に検索、抽出、分類、短い生成、単純なツール呼び出しで構成されているなら、Fugu Max の設計全体はそれを見抜き、できるだけ少なく使うことに向いている——そして、10 のベンチマーク中 7 つでフロンティアを押し広げるという Sakana の主張は、少なくとも方向性としてはそこに関するものだ。あなたのトラフィックに、長いエージェント的実行、複数ファイルのリファクタリング、あるいは手順が一つ狂うと高くつく形で失敗する調査タスクが含まれるなら、Ultra v2 の出力単価 $30 は現実の何かを買っている。8 つのベンチマーク中 7 つで上位 2 位に入っている点こそ、ローンチページの中でもコストの主張というより能力の主張に最も近い部分だ。
どちらもSakanaのコンソールを通じて、同じOpenAI互換APIで利用できます。また、既存のFuguからのアップグレード経路はパラメータ変更です。利用可能性に関する注意点が2つあります。Fuguは、GDPR対応が完了するまでEUおよびEEAでは利用できないと報告されており、これが依然として当てはまる場合、どちらのモデルをどこにデプロイできるかが制限されます。さらに、どちらもクローズドシステムです。購入するのはエンドポイントであり、その背後にどのモデルを配置するかはベンダーが選択します。Fugu Maxの場合、完全には開示されていないラインナップも含まれます。
落とし穴:依然として自らのフロンティアを借りているオーケストレーター
Fuguに対する最も鋭い批判は、Sakanaがそれを主権インフラとして位置づけることで自ら招いている批判だ。サードパーティAPIをまたいでルーティングするオーケストレーション層は、それらのAPIが取り消されるのを防ぎはしない。単一障害点を分散した障害点に変えるもので、それは確かな改善ではあるが、基盤となるモデルは依然として他者のものであり、同じ輸出規制の対象となり得て、同じ突然のサービス打ち切りの影響も受ける。8月のNVIDIA提携とNemotronの追加は、これに対するこれまでで最も具体的な答えだ——プール内のオープンウェイトモデルは誰にもスイッチを切れないモデルである——しかしSakanaは、Fugu Maxのトラフィックのどれだけが実際にそれらに流れているのかは明言していない。
もう一つ、より静かなトレードオフがある。ルーティングの判断はレイテンシを増やし、決定性を奪う。今日は小さなモデルに振り分けられたリクエストでも、プールやコストの重みが変われば、明日には別のモデルに振り分けられるかもしれない。そのため振る舞いの回帰テストは難しくなり、システムを監査する誰かに説明するのも難しくなる。Sakanaの答えは、オーケストレーションは内部的なもので、APIは単一のモデルのように振る舞うというものだ。それはインターフェース上は真だが、その下では真ではない。厳密な再現性要件を抱えるチームは、それが不可欠な前提となる前に、よく検証すべきだ。
コスト上の利点を得ながら、そのプールを唯一の依存先にしたくないなら、同じパターンを自分で組み合わせて構築できる。当社のルーティングDSLを使えば、1つのエンドポイントの背後にモデルのパネルを定義し、どの種類のリクエストをどのモデルが処理するかを決められる。モデルフュージョンは同じプロンプトに対して複数のモデルを走らせ、価格よりも合意が重視される場面で回答を突き合わせる。プロバイダー間のフェイルオーバーとは、あるサプライヤーが劣化したり消えたりしたときに、コードを変更することなく、すでに信頼しているモデルへトラフィックを移すことだ。これは、Sakanaがあなたに丸ごと賭けるよう求めているものの、より保守的な版である。

ここで私たちが何を提供し、何を提供していないかを正確に述べておく価値があります。Sakana Fugu Maxは私たちのカタログにはありません — 私たちの側ではルーティング可能なモデルではなく、Sakana自身のAPIとコンソールで動作します。私たちのカタログは15のプロバイダーにまたがる196モデルを、1つのキーと1つの請求で、各カードに記載されたトークンあたりの料金で提供しており、それらに上乗せされるマークアップはありません。Fugu Maxとの関連で共通しているのは、品揃えではなく考え方です。どちらも、「どのモデルがこれを処理すべきか」という問いへの正しい答えは、通常、最も大きなモデルではない、という主張です。
誰が動くべきで、誰が待つべきか
Fugu Max は今月のリリースの中でも特に興味深いものの一つです。それはひとえに、モデルではないからです。すでに Sakana Fugu を使っているなら、アップグレードは1行の変更で済み、しかも価格は下がるので、迷う理由はありません。高ボリューム・低複雑度のトラフィックを中位モデルで処理し、そのために出力トークン100万個あたり$10–$15を支払っているなら、Sakana が提示している算段は、自分でベンチマークを取ってみる価値があります——実際のリクエストを1週間分取り、それを Fugu Max に通し、散布図ではなく現在のモデルと品質を比較してください。
導入を決める前に公表されたベンチマーク数値が必要なら、待ったほうがいい。Fugu Max についてはまだ独立したものは何もなく、ベンダー自身の根拠は表ではなくグラフであり、主要6ベンチマークのうち1つは Sakana のものだ。それは見送る理由にはならない — 自分のトラフィックで試す理由になる。それがあなたの結果を予測できたはずの唯一のベンチマークなのだから。そして、あなたのワークロードがエージェント的で、長期的な視野を要し、間違えると高くつくなら、このペアで見るべきモデルは Fugu Max ではなく Fugu Ultra v2 だ。数値が伴っているのはそちらだから。
当社のルーティングDSLを使えば、1つのエンドポイントの背後にモデルのパネルを定義し、どのモデルがどのクラスのリクエストを処理するかを決められます。また、モデルフュージョンは同じプロンプトで複数のモデルを実行し、価格よりも合意が重視される場面で回答をすり合わせます。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
