「Fugu Max vs Claude Opus 5」のヒーロータイトルカード。サブタイトルは「4倍安い、そして誰も公表しなかった数字」、3つのピルバッジは「$6.00 vs $25.00 出力」「6勝、スコア0」「$2.00 vs $5.00 入力」、フッター行は「Sakana AI vs Anthropic - 2026年9月」、右下隅にOrcaRouterのロゴ。
Guides & Insights

Fugu Max vs Claude Opus 5:4倍安く、そして誰も公表しなかった数字

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Fugu Maxは、100万トークンの出力を生成するのに6.00ドルかかる。Claude Opus 5は25.00ドルかかる。Sakana AIは2026年9月11日、各タスクを自社プール内の最も軽量なモデルにルーティングするコーディネーターとしてFugu Maxをリリースし、Anthropicのフラッグシップに対する4倍の出力ギャップがこのリリースの見出し的事実となるほど、積極的な価格設定にした。このリリースに含まれていないのは、Fugu Maxが実際にどれだけ性能を発揮するかを示す単一の数値だ。Sakanaは、6つのベンチマークで「総合最高スコア」を獲得し、10のうち7つでコスト性能のフロンティアを拡大すると述べている——軸上の値ではなく、チャート上の位置についての主張だ。対照的に、Claude Opus 5は、ほぼすべての動作について公開されたスコアを伴って登場する。したがって、この比較の誠実な形は、安い対高いではない。測定済み対主張済みであり、そのトレードオフを議論に値するものにしているのは価格差だ。

そのギャップ、そしてSakanaがあえてしなかった比較

Sakanaのリリースページは、Fugu Maxの出力レートを他のモデルと比較することで正当化している。名指ししている3つはClaude Sonnet 5GPT-5.6 TerraKimi K3で、Fugu Maxの出力価格はそれらより40~60パーセント低いという主張だ。ここで誰が欠けているかに注目してほしい。Claude Opus 5はそのリストに含まれていない。理由は算数にある。6.00ドル対25.00ドルでは、Fugu MaxはOpus 5より40パーセント安いのではなく、76パーセント安い。Opus 5を名指しすれば、その主張は競争力があるどころか信じがたいものに見えたはずなので、比較対象は旗艦の下の階層に対して引かれている。

それは価格設定への批判ではない。実際、価格は本当に低い。それは、その周囲の文が何をしているかについての指摘だ。Sakana自身の言い回し——性能は「2~6倍低いコストでエリートモデルに肉薄する」——は、同社が名指ししたモデルに合わせて調整されている。Claude Opus 5と比べれば、倍率は2~6倍ではなく、出力では4倍を超える。そして、その文の基準から見てOpus 5が依然として「エリートモデル」なのかは明言されていない。これは、フロンティアでのコスト性能効率を全面的に売り込むリリースとしては、奇妙な省略だ。

• 入力価格 — Fugu Max は100万トークンあたり$2.00、Claude Opus 5 は100万トークンあたり$5.00

• 出力価格 — Fugu Max は100万トークンあたり $6.00、Claude Opus 5 は100万トークンあたり $25.00

• キャッシュ入力 — Fugu Max は100万トークンあたり$0.25、一方 Claude Opus 5 のキャッシュはキャッシュ入力に対して最大90%の割引として価格設定

• ベンチマークスコア — Fugu Max は一切未公開で、数値の裏付けなしに6つのベンチマークでの勝利を主張しているのに対し、Claude Opus 5 は Anthropic の報告で SWE-bench Verified 96.0%、SWE-bench Pro 79.2%、ARC-AGI 3 では約30.2%

• アーキテクチャ — Fugu Max は非公開のプール上で訓練されたコーディネーター、対する Claude Opus 5 はバージョン単位で固定できる単一モデル

• 背景 — Fugu Max は未公開、対する Claude Opus 5 は100万トークン、出力上限は128K

• 独立評価 — Fugu Max:どのFuguモデルにも存在しない。一方、Claude Opusには第三者リーダーボードでの5か月にわたる掲載実績がある

スコアが伴わない6つの勝利

6つのベンチマークは、Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench、SWEFishです。そのうち5つは、広く知られた公開評価です。6つ目のSWEFishはSakana自身のコーディングベンチマークであり、つまり6つの勝利のうち1つは、ベンダーが作成し、まだ公開していないテストでスコア付けされているということです。

残りの5つについては、この発表はFugu Maxが総合最高スコアを達成したと述べているが、そのスコアがいくつなのか、競合他社が何点だったのかは示していない。これはモデル発表としては異例の形だ。ベンダーは日常的に誇張するが、たいていは数字を伴って誇張する。数字こそが広まるものだからだ。6勝を主張しながらその数字を一つも載せない発表は、主張の強さだけを頼りに受け入れられることを求めているようなものだ。

好意的に読む余地はあり、それははっきり述べておく価値がある。Fugu Max は能力向上を狙ったものではなく、コスト最適化されたコーディネーターだ。Sakana は Fugu Ultra v2 と同じ日にこれを出荷した。Fugu Ultra v2 のほうは、入力 $5.00、出力 $30.00 で最大能力を狙うバージョンである。Max の役割は、出力 $6.00 で許容できる品質に到達することであり、オーケストレーターの看板スコアは、そのスコア・パー・ドルよりも意味が薄い。そして、まさにそれを示すのがパレート図だ。Sakana のこのリリースにおける視覚的コミュニケーションはパレート図である。もし主張が「頂点ではなく曲線を見よ」だというなら、生のベンチマーク数値は的外れである。

意地の悪い読み方をすれば、数字を出せばベンダーができれば避けたい比較を招くことになる、というものだ。どちらの読み方も証拠と整合しており、現時点で公開記録の中に両者を区別するものは何もない。確かに言えるのは、どのFuguモデルも独立した第三者によって評価されておらず、Fugu Maxやその兄弟モデルについてArtificial Analysisの項目も存在しないということだ。リリース内のあらゆる数値は、6勝を含め、Sakanaに由来する。

A two-column scoreboard titled "Fugu Max vs Claude Opus 5 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Benchmarks six wins with no figures, Context not published, Evidence vendor-reported only. Right column Claude Opus 5: Output price $25.00 / 1M, Input price $5.00 / 1M, Cached input up to 90% discount, Benchmarks 96.0% SWE-bench Verified, Context 1M with a 128K output ceiling, Evidence independent evals. Footer reading "Fugu Max figures vendor-reported by Sakana AI; Opus 5 rows Anthropic-reported. No independent Fugu Max evaluation exists.", with the OrcaRouter logo bottom-right.

実際にあなたが行っている購入

単一モデルのベンダーがベンチマークを公表するとき、あなたが買っているのはモデルに関する主張だ。オーケストレーターが公表するときは、プールに関する主張を買っている——ベンダーが訓練していないモデルが、ルーティングの決定が意図的に公開されていないコーディネーターの下で動作している。ここでのプールは、Fuguがこれまでに使用した中で最大と説明され、NVIDIAとの協業を通じてNVIDIA Nemotronファミリーを含むオープンウェイトおよび特化型モデルで拡張されている。メンバーはそれ以外は非公開だ。

実際上の帰結は、Fugu Max の挙動がそのバージョンを変えずに変化し得るということだ。フロンティアラボによる非推奨化、価格変更、あるいはモデルがある地域から撤退することは、コーディネーターが呼び出せるものを変える。そして Sakana は、この回復力こそが要点だと明言している——ベンダーロックインと API 失効に対する保護を売っているのだ。それは現実の利点であり、無料ではない。また、これが、もし Fugu Max のベンチマークが公表されたとして、Claude Opus 5 のベンチマークが持たない有効期限を帯びる理由でもある。

Claude Opus 5 の価値提案はその逆で、価格設定もより容易だ。単一モデル・単一バージョンであり、デフォルトで適応的思考を実行し、low から max までの明示的なエフォートダイヤルを備え、100万トークンのコンテキストウィンドウと128Kの出力上限を持ち、ビジョン、ツール使用、JSONモードに対応する。Anthropic は SWE-bench Verified で 96.0%、SWE-bench Pro で 79.2% を報告しており、これらの数値は、エンドポイントを呼び出したときに得られるものに対して測定されたもので、構成が足元で変わり得るアンサンブルに対してではない。本番環境で実行されレビューされるワークロードにとって、その安定性は、100万出力トークンあたり $19.00 を支払って得られる機能だ。

完了したタスクごとのコスト、トークンごとではない

Fugu Maxの$6.00という出力レートは本当に魅力的で、それを試す方法はトークン価格を比較するのをやめることだ。オーケストレーターがエージェントを起動し、各エージェントが推論トークンと出力トークンを書き出し、コーディネーターが統合文を書く。SakanaのFuguライン向け価格FAQは、参加する最上位モデルに基づく単一のブレンドレートを約束しており、マルチエージェント実行でも請求が積み上がらない。これにより、素朴なマルチエージェントシステムを支払い不能にする最悪ケースのファンアウト乗算が取り除かれる。ただし、量は取り除かれない。請求対象となる出力トークン数は、実行されたエージェント数によって決まり、100万あたり$6.00では、その量こそが価格ページでは教えてくれない変数なのだ。

Claude Opus 5のコスト構造は、1回の呼び出し、1つのモデル、自分で調整できるエフォートダイヤル、そして待てる作業なら半額で使えるバッチ処理です。実行する前に見積もれます。1万回を超える実行では、見積もり可能性は、誰も公表していないベンチマークの優劣よりはるかに大きな価値を持ちます。

ここが、ルーティングの問いがモデルの問いと分かれるところです。Claude Opus 5 は OrcaRouter 上で Anth​ropic の定価、マークアップ 0% で — プロバイダーの料金がそのまま透過されるため、Anth​ropic の価格改定は同じキーで当日に反映され、いずれかの経路がレート制限や利用不可になればプロバイダー経路間で自動フェイルオーバーが働きます。Fugu Max は当社のカタログにはなく、Sakana 自身の OpenAI 互換 API および複数のサードパーティプラットフォームを通じて利用でき、以前の Fugu からの移行は 1 行のパラメータ変更で済みます。Opus 5 のエビデンス基盤と予測できる請求を求めるなら、ルーターのほうが近道です。難しい問題で自らファンアウトを組み立てるシステムを求めるなら、それを実現するのが Fugu Max です — そして最初のリクエストからトークン計測を有効にしてパイロットすべきです。

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Fugu Maxがおそらく正解となる場面

設計を正当に評価すべきだ。あなたの仕事が大量処理で検証可能であり、単一呼び出しのピーク性能よりも完了したタスクの中央値コストを重視するなら、リクエストごとに十分な性能を持つ最も安価なモデルを選ぶオーケストレーターは、固定されたフラッグシップにはできないことを実現している。Fugu Max はまさにそのワークロードを狙っており、入力$2.00、キャッシュ入力$0.25という料金は、そうしたワークロードが生み出す長く反復的なコンテキスト向けに設定されている。NVIDIAとの協業も見た目以上に重要だ。Nemotronモデルはオープンウェイトなので、プールの最安層が別のラボの価格決定にさらされない。

しかし、それによってあなたが得られないのは、Opus 5 の公表された数値が最も強いタスク——リポジトリ規模のソフトウェアエンジニアリングと難度の高い推論——において、Fugu Max が Claude Opus 5 に匹敵するだろうと信じる根拠である。それこそまさに、Sakana の6つのベンチマークを並べたボードが数値を一切示していない行にあたる。もしあなたの問題が、安さよりも最高であることが重要なものであるなら、$25.00 の出力レートは、あなたが本当に必要としているものを買うことになる。

結論

Claude Opus 5は、より証拠に基づいた購入であり、より安全な本番環境のデフォルトです:公開されたベンダーのベンチマーク、固定できるバージョン、変動しないコンテキストウィンドウ、128Kの出力上限、元が取れるときだけ推論を購入できるエフォートダイヤル、そしてその背後にある数か月にわたるサードパーティの結果。Fugu Maxはより興味深い賭けであり、本当に安価な選択肢です——入力で約60パーセント、出力で約76パーセント安く、キャッシュレートはOpus 5の基本入力価格より一桁低いです。

検証可能で反復的、大量処理のワークロードを実行していて、EU/EEA 域外にいるなら、Fugu Max は範囲を限定したパイロットを試す価値があります。開始前に出力トークンの上限を設定し、呼び出しあたりではなく完了したタスクあたりのトークン数を測定してください。今四半期に他者へ説明できる本番導入の判断が必要なら、答えは依然として Claude Opus 5 です。そしてそれは OrcaRouter で Anth​ropic の定価、プロバイダーのレートをそのまま適用した価格で利用できます。

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the anthropic/claude-opus-5 model ID, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24, the /v1/chat/completions and /v1/messages endpoints, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the 1M token context with 128K max output and text + image + file input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.