
Fugu Ultra v2 対 Claude Opus 5:同じ入力価格、異なる2つの賭け
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anthropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.
すべてを形作る偶然
まず、2つの製品が一致している点から始めましょう。それはヘッドライン価格以上のものだからです。
• 入力価格 — Fugu Ultra v2 は100万トークンあたり$5.00、Claude Opus 5 は100万トークンあたり$5.00
• 出力価格 — Fugu Ultra v2 は100万トークンあたり $30.00、Claude Opus 5 は100万トークンあたり $25.00
• キャッシュ済み入力 — Fugu Ultra v2 は基本料金に対して100万あたり $0.50 の上乗せとなる一方、Claude Opus 5 はキャッシュをキャッシュ済み入力の最大90%割引として価格設定している
• コンテキスト — Fugu Ultra v2 は100万トークンで、272Kを超えると料金が2倍になるのに対し、Claude Opus 5 は100万トークンで一律
• 出力上限 — Fugu Ultra v2は単一の数値として公開されておらず、Claude Opus 5の128Kトークンとは対照的
• 提供状況 — Fugu Ultra v2 は EU/EEA で販売されていないのに対し、Claude Opus 5 は標準 API 条件のもとで一般提供されています
• 根拠 — Fugu Ultra v2 はベンダー報告のベンチマークのみで、独立した評価はまだ存在しない。これに対し Claude Opus 5 はベンダーのベンチマークに加え、数か月にわたる第三者リーダーボードでの順位を有する
その最後の行こそ、実際に勝敗が分かれるところだ。同じ入力価格なら、スコアを鵜呑みにするしかないシステムと、他の誰かが再現したスコアを持つモデル、どちらを選ぶかということになる。272Kの崖がさらに事態を悪化させる。そのしきい値を超えると、Fugu Ultra v2の入力レートは2倍の$10に、出力は$45になり、一方でClaude Opus 5のレートは動かない。長文コンテキストのエージェント実行——まさにFugu Ultra v2が作られた用途——では、安いという見出し価格の優位は、このシステムが本来輝くはずのまさにその場面で消えてしまう。

それぞれが実際に何なのか
Claude Opus 5 is Anthropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anthropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.
Fugu Ultra v2はそういうものではなく、その違いは見た目だけのものではない。これはコーディネーターだ——約7Bパラメータと報じられている小さな学習済みモデルで、あなたのリクエストを読み取り、エージェントチームを編成し、SakanaのTRINITYの取り組みに基づくThinker、Worker、Verifierの役割を割り当て、最終回答を統合する。基盤モデルは公開されておらず、ルーティングの決定は設計上公開されず、Ultraティアではプールは固定されている。ベンダーを外すことはできない。Sakana自身によるバージョン2の説明では、学習カットオフが2026年8月28日に移り、プール構成が変わった——具体的にはClaude Fable 5、Claude Fable 5.1、GPT-6 Astraを除外するためだ、というものだ。
その除外こそ、このリリースで最も多くを物語る詳細だ。Fugu Ultra v2 は、利用可能な最強の3モデルに対するベンチマークでの勝利を主張しながら、それらのどれも呼び出していないことを認めている。そのプールに何が含まれていようと、Sakana 自身の集計によれば、それは市場のトップではない。売り文句は、協調が能力に勝るというものだ。それは本物のテーゼであり、安価なチェッカーを使った検証可能なタスクにおいては、裏付けとなる証拠を伴うテーゼでもある。それは「このシステムは Claude Opus 5 より賢い」という主張と同じではない。しかもスコアボードは、その二つを混同しやすくなるように整えられている。
Sakanaが選んだスコアボード
以下のすべての数値は、Sakana自身によるFugu Ultra v2の評価に基づくものです。Claude Opus 5の数値は、特に断りのない限り、同じ比較においてSakanaが測定したものです。Fuguの列を独立した第三者機関が再現した例はなく、本稿執筆時点で、いかなるFuguモデルについてもArtificial Analysisの項目は存在しません。
• Chartography — Fugu Ultra v2 48.3 対 Claude Opus 5 27.3 — ベンダー報告による、21ポイントの差
• DeepSWE — Fugu Ultra v2 74.3 対 同じ表には Claude Opus 5 の公表数値なし — ベンダー報告
• ベンチマークでの位置づけ — Fugu Ultra v2 は8項目中5項目で最高または同率最高、8項目中7項目で上位2位 — ベンダー報告による
• SWE-bench Verified — Fugu Ultra v2 の数値はなく、Claude Opus 5 は 96.0% — Anthropic 報告
• SWE-bench Pro — Fugu Ultra v2の数値はなし、Claude Opus 5の79.2%との比較 — Anthropicによる報告
• ARC-AGI 3 — Fugu Ultra v2 の数値なし、Claude Opus 5 は約30.2% — Anthropic 報告
それをランキングではなく、形として読んでください。Sakanaは8つのベンチマークからなるボードを公開し、そのうち5つで勝利しています。そして、Claude Opus 5の公表されている中で最も強い結果——SWE-benchの行、ARC-AGI 3——は、そこには単に載っていません。それは不誠実だという非難ではありません。ベンダーのスコアボードとはそういうもので、どのベンダーのものでも同じです。しかし、それはこのリリースからFugu Ultra v2がソフトウェアエンジニアリングでClaude Opus 5を上回ると結論づけられないという意味です。なぜなら、両システムは同じ行で、そう言えるほど十分に頻繁に測定されていないからです。両方が登場し、双方の数値が公開されている唯一の行——Chartography——では、Fugu Ultra v2が大きな勝利を主張しています。最も広範な推論とコーディングの行では、片側しか公表していません。

タスクごとのコスト、トークンごとのコストではない
オーケストレーターのトークン請求額は、そのトークン単価ではない。Fugu Ultra v2 はエージェントを起動し、各エージェントが推論トークンと出力トークンを生み出し、コーディネーター自身も統合テキストを生成する。Sakana の料金 FAQ はここで本当に有用な約束をしている — 関係する最上位モデルに基づく単一の混合レートで請求され、エージェントを追加しても請求額は何倍にもならない — これにより、素朴なマルチエージェント構成を高コストにする最悪のファンアウト乗算が取り除かれる。しかし、量は取り除かれない。課金される出力トークンの量は依然として、何個のエージェントが実行され、どれだけ書いたかの関数であり、100万トークンあたり$30では、その量こそ料金ページから予測できない変数である。
Claude Opus 5のコスト構造はその逆だ。1回の呼び出し、1つのモデル、自分で調整できるエフォートダイヤル、そして$25の出力レート。非リアルタイムの作業なら50%オフでバッチ処理も利用できる。予測可能なのだ。1日に1万回実行するワークロードにとって、予測可能性は、グラフ読み取りタスクでのベンチマークの優位性よりもはるかに価値がある。
This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anthropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.
Fugu Ultra v2が本当に優れている点
システムを正当に評価しよう。Chartography の結果がもし成り立つなら、それは単一モデルが偽装するのが難しい類の勝利だ。構造化文書に対する視覚的推論では、ある読み方を試し、文書と照合し、もう一度試すことが報われる。まさに Verifier の役割が存在する理由だ。同じ論理は Toolathon と DeepSWE にも当てはまり、そこでは答えは議論するのではなく検証できる。Sakana が公表したケーススタディも同じ方向を示している。1 台の H100 上で 14 時間にわたる 123 件の実験からなる AutoResearch 実行、2 つの匿名化されたフロンティア・ベースラインが完全にクラッシュするなかで 300 個のスクランブルされた立方体すべてを解き切った純 Python の Rubik's cube ソルバー、実際に開閉する機械 CAD のアイリス。これらは匿名化されたベースラインを伴うベンダー選定の事例なので、見かけほど多くを証明しているわけではない。しかしパターンは一貫しており、実際のカテゴリを指し示している。すなわち、正しさが検証可能で、難しい部分が粘り強さにあるタスクだ。
ベンチマークとは無関係な構造上の議論もある。Claude Opus 5はあるベンダーのモデルであり、そのベンダーの価格決定、廃止スケジュール、ポリシーに左右される。Fugu Ultra v2は、それらのいずれか一つが変わっても生き残るように設計されており、Sakanaはこれが要点だと明言している — ベンダーロックイン、APIの取り消し、輸出規制。モデルがほとんど予告なく地域から撤収される市場において、それは仮定の話ではない。それはヘッジであり、ヘッジにはコストがかかる:出力トークン百万あたり5ドル高いというのが、おおよそこのヘッジの値段である。
評決
Claude Opus 5 は、ほとんどのチームが実際に下している決断において勝利を収めます。その背景には数か月にわたる独立評価の裏付けがあり、書類の途中で価格が2倍にならない1Mトークンウィンドウ、128Kの出力上限、予測可能な公表価格、タスクがそれに見合うときだけ推論を購入できるエフォートダイヤル、そしてエージェント型チームとコーディングチームが最も重視するまさにそのベンチマーク——SWE-bench Verified、SWE-bench Pro、ARC-AGI 3——における第三者結果を備えています。Fugu Ultra v2 は、より狭く、より興味深い問いにおいて勝利を収めます。それは、より小さいプールを持つコーディネーターが、答えを検証できるタスクでフラッグシップを上回れるかどうかという問いです。Sakana 自身のスコアボードは8行のうち5行で「はい」としており、プールからの除外は、その勝利が世界で最も優れた3つのモデルなしで得られたことを示しています。
If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anthropic's list price with the provider's rate passed through untouched.

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
