
Fugu Ultra v2 対 Gemini 3.1 Pro:すでにマシンの中にいるかもしれない対戦相手
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 対 Gemini 3.1 Pro の比較には、ベンチマークがどう転んでも Gemini が勝つバージョンがある——なぜなら Gemini が作業の一部を担っている可能性があるからだ。2026年9月11日にリリースされた Sakana AI のオーケストレーションシステムは、どのモデルを統括しているのかを開示していない。6月の Fugu Ultra について報じられたモデルプールには、ほかのモデルとともに Gemini 3.1 Pro も含まれており、バージョン2.0が明かすのは除外したものだけだ——Claude Fable 5、Claude Fable 5.1、GPT-6 Astra が除外されたと名指ししている。Google の Gemini 3.1 Pro は、テキスト、画像、PDF、音声、動画を扱う100万トークンコンテキストの単一マルチモーダル・フロンティアモデルで、2026年5月から一般提供されており、入力100万トークンあたり2.00ドル、出力100万トークンあたり12.00ドルだ。このうち一方は、あなたが検証できるモデルである。もう一方は、ベンチマークでの勝利が最初のモデルを経由している可能性があるシステムであり、どちらのベンダーも、実際にそうしているかどうかを教えてくれない。
各システムの実態とは
Gemini 3.1 Pro は、フロンティアリリースの中では珍しくなったほど明快に読める。Google DeepMind によるスパースな Mixture-of-Experts トランスフォーマーで、2026年2月19日にプレビューとして初めて提供され、一般提供は2026年5月とする情報源も1つある — 当社の一覧ではプレビューモデルIDで掲載している。100万トークンの入力ウィンドウと65Kトークンの出力上限を持ち、テキスト、画像、PDF、音声、動画、コードを受け付け、3段階の推論コントロール — low、medium、high — を備え、high が API のデフォルトである。Google の報告では、ARC-AGI-2 で77.1%、前世代の31.1%の2倍以上。GPQA Diamond で94.3%、SWE-bench Verified で80.6%、Terminal-Bench 2.0 で68.5%、BrowseComp で85.9%、Humanity's Last Exam ではツールなしで44.4%、検索とコード実行ありで51.4%に上昇する。これらはベンダー公称値である。知識カットオフは2025年1月なので、最近の出来事に依存する作業なら留意する価値がある。
Fugu Ultra v2はコーディネーターである。これは学習済みモデルで、約7Bパラメータと報告されており、リクエストを読み取り、SakanaのTRINITY研究に由来するThinker、Worker、Verifierの役割を備えたエージェントチームを編成し、OpenAI互換エンドポイントの背後で回答を合成する。自身が公開しているモダリティ一覧はない——それが見えるものは何であれ、プール内のモデルが見えるから見えているのだ。コンテキストは1Mトークンで、272Kに急峻な価格の崖があり、そこでは料金が入力$10、出力$45に倍増する。出力上限は公開されていない。そのプールは非公開で、ルーティングの決定は「設計上公開されていない」、Ultraティアではプールが固定されているため、プロバイダーを除外することはできない。
その非対称性こそが、この対決のすべてだ。Gemini 3.1 Pro は直接購入でき、その中身について筋道立てて考えられる部品だ。Fugu Ultra v2 は、部品が見えず、最も強いベンチマークの主張が、一部には Gemini 自身の結果と他者の結果を組み合わせたものである可能性もある組み立て品だ。

二つが重なる部分の比較
公表されている証拠のうち、両システムを同じ行に並べているものはごくわずかだ。以下の Gemini 3.1 Pro の数値は Google 自身のものであり、Fugu Ultra v2 の数値は Sakana 自身のものである。第三者のアグリゲーターが共通の行を公表している場合は、その旨が明記され、決定的というよりは方向性を示すものだという注意書きが付く。
• マルチモーダル推論(CharXiv、共有行) — Fugu Ultra v2 86.6% 対 Gemini 3.1 Pro 80.2%(BenchLM調べ)。同サイトはこのカテゴリを方向性の参考値と位置づけ、勝者を明示していない
• TerminalBench 2.1 — Gemini 3.1 Pro に対する Fugu Ultra v2 v2.0 の数値はなく、比較可能な公開数値もない。6月の Fugu Ultra は、第三者集計で Gemini 3.1 Pro の 70.3% に対して 82.1% を報告した
• SWE-Bench Pro — Fugu Ultra v2 v2.0 の数値はなく、Gemini 3.1 Pro にも比較可能な公表値はない。6月の Fugu Ultra は 73.7% を報告しており、Gemini 3.1 Pro の 54.2% と対比される
• ARC-AGI-2 — Fugu Ultra v2の数値はなし、Gemini 3.1 Proは77.1%(ベンダー報告)
• Humanity's Last Exam — Fugu Ultra v2 v2.0の数値はなし、それに対し Gemini 3.1 Pro はツールなしで44.4%、ツールありで51.4%、ベンダー報告
• モダリティ対応範囲 — Fugu Ultra v2 はプールが対応するものをそのまま継承、非公開。対して Gemini 3.1 Pro はテキスト、画像、PDF、音声、動画、コードに対応、文書化済み。
• 入力/出力価格 — Fugu Ultra v2 は100万トークンあたり $5.00/$30.00、272Kを超えると倍額。一方 Gemini 3.1 Pro は20万トークンまで100万トークンあたり $2.00/$12.00、それを超えると $4.00/$18.00、キャッシュ入力は $0.20/$0.40
• コンテキストと出力 — Fugu Ultra v2 は1Mコンテキスト、出力上限は非公開 対 Gemini 3.1 Pro は1M入力、65K出力
• 重みとアクセス — Fugu Ultra v2 は非公開、EU/EEA は除外。一方 Gemini 3.1 Pro はプロプライエタリだが、Google の各サーフェスで広く利用可能
マルチモーダル行は注意深く扱うべきものだ。なぜなら、それは最も引用が多く、最も根拠が薄いからだ。BenchLMのCharXiv集計では、Fugu Ultra v2が6.4正規化ポイント上回っている。そして同じページは、方向性のある行には決して勝者が与えられないこと、Geminiはエージェント、コーディング、知識、多言語の各カテゴリで測定結果がなかったこと、Fuguは数学と多言語で測定結果がなかったことを明言している。ほとんどの行で片側しか測定されていないカテゴリでは、判定は下せない。この比較から他に何も得られなくても、これだけは覚えておいてほしい。特にマルチモーダル作業について言えば、公表された証拠はどちらかの結論を支持しておらず、存在する唯一の行は、明示的に確定した結果ではないのだ。
枠組みを変える可能性
Sakanaはプールに何が入っているかを明言しない。これは見落としではなく、文書化された設計上の選択だ——FAQには、ルーティング情報は設計上公開されず、それを検査する仕組みもないと記されている。6月の世代についてわかっているのは、報告されたプールのメンバーに、他のフロンティアモデルと並んでGemini 3.1 Proが含まれていたということだ。バージョン2.0でプールは変更され、Sakanaはその変更を除外という形でのみ説明した。Claude Fable 5、Claude Fable 5.1、GPT-6 Astraは外れた。リリースには、Geminiがまだ中にいると述べている箇所はない。
もしGemini 3.1 Proがプールに入っているなら、三つの帰結が生じる。そしてその三つはすべて、哲学的というより実務的だ。第一に、Fugu Ultra v2のマルチモーダル性能の一部はGeminiの性能であり、他のモデルたちの性能と組み合わさっている——つまり、直接支払うこともできたトークン単位の料金に加えて、調整プレミアムを支払っていることになる。第二に、出力100万トークンあたり$30のFugu Ultra v2は、$12のGemini 3.1 Proと比べて、生の能力ではなく組み立てに対するプレミアムだ。もしあなたのタスクが単一のマルチモーダル質問なら、Geminiのほうが安く答え、しかもどのモデルが答えたかを正確に見て取れる。第三に、そして最も有用なことに、オーケストレーターの誠実なベンチマークは「構成要素に勝るか」ではなく、「単独で使ったときの最良の構成要素に勝るか」だ。Sakanaのアーキテクチャは、検証可能なタスクでそれが勝つという主張の上に築かれている。その主張は、チャート読み取りのベンチマークで受け入れる前に、自分のワークロードで試す価値がある。
答えが「ノー」であっても、オーケストレーターが依然としてその存在価値を示すという見方もある。もし Gemini がプールに含まれ、Fugu Ultra v2 の Chartography スコア 48.3 対 Claude Opus 5 の 27.3 が維持されるなら、Sakana が作ったのは、同じモデルを一度呼び出すよりも確実により多くを引き出す調整レイヤーだ。それは実在する製品であり、未解決の問いは、その利幅が価格をカバーするかどうかにすぎない。その実験を公表した人は誰もいない。

正直な境界線がある場所
Gemini 3.1 Proの優位性は具体的だ。入力も出力もFugu Ultra v2のおよそ5分の2の価格で、Fuguと違ってコンテキストの閾値を超えても料金が2倍にはならない——200Kでの段差は272Kの崖よりも緩やかだ。モダリティを継承するのではなく自ら文書化しているため、音声と動画の作業は期待ではなくサポートされた機能だ。公開された出力上限もある。Google自身のサーフェスから利用でき、Fugu Ultra v2が比較される他のモデルと同様、OrcaRouter上で呼び出せる——google/gemini-3.1-pro-previewとして、Googleの定価、マークアップ0%でという形であり、したがってGoogleの価格変更は、発表されたその日に同じキーに反映される。
Fugu Ultra v2の利点はより限定的だが、本物だ。それは難しい問題に複数回取り組み、Verifierの役割が作業をチェックする。だからこそ、その最も強力な主張は、知識の想起ではなく、正しさが検証可能なベンチマーク——Chartography、DeepSWE、Toolathon——に基づいている。Sakanaが公開したケーススタディも同じ方向性を示している。他のモデルが隙間や弱いリンクを残した箇所で正しく開閉する機械式CADアイリス、そして2つの匿名化されたフロンティアベースラインが完全にクラッシュしたのに対し、300個のスクランブルされたキューブすべてを解き切った純Pythonのルービックキューブソルバーだ。これらのベースラインは匿名化されており、ベンダーが選択したものなので、証拠ではなく例証として扱うべきだ。しかし、そのパターンはリリース全体を通じて一貫しており、単一のモデル呼び出しにはない真の能力を描写している。つまり、答えがチェックを通過するまで問題に粘り強く取り組むことだ。
制約についても検討しよう。Fugu Ultra v2はEUやEEAでは販売されておらず、SakanaはGDPR準拠に向けて取り組んでいると明言している。Gemini 3.1 Proにはそのような制限はなく、その背後にははるかに長い独立した評価の実績がある。

評決
ほとんどのマルチモーダル作業では、Gemini 3.1 Pro が正解であり、その差は歴然としています。トークンあたりでもドキュメントあたりでも安く、音声と動画に対応することが明記されており、実行途中で請求額が2倍にならないコンテキスト閾値で上限が設けられ、そして——ここで最も重要な点ですが——自分に答えたのが何なのかを確認できます。1つのモデルにPDFを読ませ、クリップを視聴させ、質問に答えさせたいなら、それを非公開のプールに出力価格の2.5倍で回すべきだという根拠はありません。
Fugu Ultra v2 は、特定の、そしてはるかに狭い形の作業にこそ適した選択です。検証可能な答えが得られる長期的なタスクで、問題を3通りに試して結果を検証することが1回試すよりも優れ、品質の限界的な差がその何倍ものコストに見合う場合です。EUまたはEEAのユーザーが対象範囲に含まれる場合は、完全に検討対象外です。
この対決が未解決のまま残す居心地の悪い問いは、誰も測定していない問いだ。もしGemini 3.1 Proがそのプールの中にいるなら——そして今日時点で唯一正直に言える答えは、Sakanaが「いない」とは言っていないということだが——Fugu Ultra v2で購入しているものの一部は、上に調整層を載せたGemini 3.1 Proであり、その価格は、その層がモデルの約2.5倍の価値があることを示唆している。それは本当かもしれない。Sakanaのアーキテクチャは、それを真実にするために作られた。しかしそれは、背後にベンダーの成績表があり、独立したテストがない仮説だ。そして誰かがそれを実行するまで、あなたに見えるモデルこそが、あなたが擁護できるモデルなのだ。
