
Fugu Ultra v2 対 Qwen3.8-Max:なぜ値札は的外れな数字なのか
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2は出力トークン100万個あたり30.00ドルかかる。Qwen3.8-Maxは6.00ドルだ。これは5対1の差であり、この比率でこれら2つのエージェント型システムのどちらかを選ぶなら、選び方を間違える——どちらも実際には、価格表が示唆するようには課金されないからだ。Artificial Analysis自身の測定では、Qwen3.8-MaxはIntelligence Indexを完了するために1億8000万個の出力トークンを生成しており、これは中央値モデルの8900万個の2倍超で、タスクあたり2.67ドルのコストだった。トークン単位では倹約的なモデルであり、回答単位ではぜいたくなモデルだ。2026年9月11日に提供開始されたSakana AIのFugu Ultra v2は、逆の形をしている。リクエストごとに起動して調整する、非公開の他社ラボモデル群を抱えており、Sakanaによればエージェントを追加しても倍々にはならない単一の混合料金で課金される。一方は、長時間かけて考えを声に出す単一の2.4兆パラメータモデルだ。もう一方は、助っ人を雇う小さなコーディネーターだ。両者のトークン価格を比較しても、どちらが安く運用できるかはほとんど分からない。
高額になる正反対の2つの方法
まず仕組みから始めましょう。それがこの比較における他のすべての違いを説明してくれるからです。
Qwen3.8-MaxはスパースなMixture-of-Expertsモデルだ — 総パラメータ数2.4兆、トークンあたりのアクティブはおよそ950億 — そして、より大きくなることではなく、より長く動作することでフロンティアに迫る結果に到達する。Artificial Analysisによる計測では毎秒37.8出力トークン、速度で200モデル中154位、Intelligence Index全体で1億8,000万出力トークンを放出している(冗長性では200中70位)。Intelligence Indexタスクあたりのコストは$2.67で、キャッシュ割引は88%と異例に深く、これこそがここでの請求額を実際に左右するレバーだ。同じコンテキストを繰り返し読み続ける長いエージェント実行は安くつき、絶えず新しいテキストを生成し続ける実行はそうではない。
Fugu Ultra v2 は同じ問題に反対側から取り組む。これはオーケストレーターだ——報告では約70億パラメータの小さな学習済みコーディネーターで、リクエストを読み取り、SakanaのTRINITYの取り組みにおけるThinker、Worker、Verifierの役割に沿ってエージェントチームを編成し、その後、回答を統合する。そのトークン請求額は、サブエージェントが生成した分にコーディネーター自身の統合テキストを加えた合計だ。Sakanaは料金FAQで、関与する最上位モデルに連動した単一のブレンド料率で請求され、エージェントを追加しても請求額は倍増しないと明言しており、これにより、ファンアウトがコストを倍増させる古典的なマルチエージェントのコスト爆発を排除している。それが排除しないのは量だ。出力トークン100万あたり30.00ドルでは、重要な数値は何体のエージェントが実行され、どれだけ書いたかであり、それはあなたにもSakanaにも料金ページから予測できない数値だ。
これが価格差についての誠実な捉え方だ。それは総額ではなく単価である。出力量を予測できないワークロードに5倍の単価を適用しても、コストが5倍になるわけではない——下限は予測できても、倍率に上限はない。

仕様表、そしてそれを決める一行
• 価格 — Fugu Ultra v2 は100万トークンあたり入力$5.00/出力$30.00、Qwen3.8-Max は入力$2.00/出力$6.00
• キャッシュ済み入力 — Fugu Ultra v2 は100万あたり$0.50、Qwen3.8-Max は読み取り100万あたり$0.25、さらに Artificial Analysis が測定した88%のキャッシュ割引
• 長コンテキスト割増 — Fugu Ultra v2 は272Kトークンを超えると入力が$10.00、出力が$45.00へ倍増するのに対し、Qwen3.8-Max は長文プロンプト割増なしで、ウィンドウまで定額
• コンテキストウィンドウ — Fugu Ultra v2 1Mトークン vs Qwen3.8-Max 1Mトークン
• 出力上限 — Fugu Ultra v2 は単一の数値として公表されていないのに対し、Qwen3.8-Max は約128Kトークン
• 入力モダリティ — Fugu Ultra v2 はテキスト(その背後にプール自身の能力を備える)に対し、Qwen3.8-Max はテキスト、画像、動画、PDF
• 重み — Fugu Ultra v2 はクローズド、プールのメンバーシップは設計上非開示 対して Qwen3.8-Max はオープンウェイトを公開、Max クラスのチェックポイントをカスタムライセンスの下で
• 地域別の提供状況 — Fugu Ultra v2はEU/EEAでは販売されていないのに対し、Qwen3.8-Maxは地域制限なしで利用可能
• 独立評価 — Fugu Ultra v2 については何も公開されておらず、どの Fugu モデルにも Artificial Analysis のページは存在しません。一方、Qwen3.8-Max は Artificial Analysis に掲載されている実際のエントリであり、速度、冗長性、タスクあたりのコストの数値が公開されています
最後の2行をまとめて読むと、対決の構図が鮮明になる。Qwen3.8-Maxは、バージョンで固定でき、ライセンスを確認でき、チェックポイントをダウンロードでき、第三者のスコアボードと突き合わせられるモデルだ。Fugu Ultra v2は、中身を検査できず、セルフホストできず、ヨーロッパでは購入できず、Sakana以外の誰かに対して検証できないシステムである。272Kの追加料金がさらに追い打ちをかける。そのしきい値を超えると、Fugu Ultra v2の入力レートは2倍になり、出力レートは5割上昇するが、Qwen3.8-Maxのレートは動かない。両システムが想定する長期的な文書・リポジトリ作業においては、見出し価格が安い側のほうが、料金曲線もより平坦なのだ。
誰もが引用しているQwen3.8-Maxの数字はもう古い
このモデルについてここ2週間のうちにどこかで読んだことがあるなら、おそらくArtificial Analysis Intelligence Indexの58、58.1、あるいは58.4という数値を見たはずだ。これらの数字は実際に存在したものだが、もはや最新ではない。Artificial Analysisは2026年9月7日にインデックスをv4.3へ再調整し、スコアを全体的に圧縮した。そして現在のQwen3.8-Maxのページには40と表示され、200モデル中30位に位置している——スコアが再表示されたことを示す「Updated」バッジ付きで。以前の記事には、旧スケールで測定されたエフォート税も記載されていた。1タスクあたり64ターン(前世代のQwenでは14ターン)、そしてIntelligence Indexタスクあたりおよそ1.14ドルである。現在のページでは1タスクあたり2.67ドル、毎秒37.8出力トークン、インデックス上の出力トークン数は1億8,000万となっている。
続いて2つのことが言える。第一に、再調整されたスケールでは、Qwen3.8-Maxはフロンティアの第2層のほかのモデルと同じ帯域に位置しており、それらと同水準にあるわけではない。そして、58というスコアでClaude Opus 5やKimi K3と比較して順位づけている記事を読んだなら、それは異なるスケールのスナップショットを比較していることになる。第二に、この対決にとってより有用なのは、この修正が一方向だという点だ。Qwen3.8-Maxには、誤っている可能性があり、その後修正されうる数値がある。Fugu Ultra v2には数値がない。この記事に出てくるFuguに関するあらゆる数値は、Sakana自身の評価に由来しており、9月11日時点でFugu Ultra v2やその他のFuguモデルのArtificial Analysisページは存在しない。URLは404になる。ベンダーがスコアボードを公開し、独立した第三者がモデルを実行していない場合、そのスコアボードが記録のすべてである。
実際に重なっている箇所と、そうでない箇所
Sakanaは、Fugu Ultra v2が8つのベンチマークのうち5つ — GDP.pdf、Chartography、SWEFish、DeepSWE、Toolathon — で最高または同率最高であり、8つのうち7つでトップ2に入ると報告している。リリースに記載された具体的な数値は2つ。同じ表でChartographyが48.3(Claude Opus 5は27.3、Claude Fable 5は29.5)で、DeepSWEが74.3である。Alibabaが自ら公開したQwen3.8-Maxの行には、Terminal-Bench 2.1が86.6、OSWorld-Verifiedが86.1、GPQA Diamondが92.6、SWE-bench Proが67.7といった数値が含まれている。
これら2つのリストに共通しているものに気づくだろう。何もない。両方のベンダー表に登場するベンチマークは1つもない。Sakanaの数値とAlibabaの数値を横に並べて、勝者を読み取れる行は存在しない。つまり「コーディングエージェントではどちらが優れているか」に対する正直な答えは、公表された証拠ではそれに答えられない、ということだ。存在するのは、ベンダーが選んだ8つの行だけがあり外部検証のない一方のシステムと、ベンダーの行に加えて、能力を直接比較するのではなくコストと速度を測る独立した項目があるもう一方のシステムだ。それは証拠における欠落であって、モデルにおける欠落ではない。そして、それは購入の仕方を変えるはずだ。ベンチマークではこれらを選び分けられないのだから、実際に検証できる特性で選ぶべきだ。

オープンウェイト 対 非公開のプール
ここで通常のロックイン論が逆転する。そしてこれが、この組み合わせについて最も興味深い点だ。
Sakana が Fugu Ultra v2 で訴えているのは主権性だ。オープンおよび特化型モデルの交換可能なプールがあれば、単一ベンダーの価格決定、廃止スケジュール、方針転換によってあなたの製品が停止に追い込まれることはない。そしてこのリリースは、プールの構成が v2 で変わったことに言及することで、その点を明示している。同社はまた、Fugu Ultra v2 のスコアがエージェントプールに Claude Fable 5、Claude Fable 5.1、GPT-6 Astra を含めずに達成されたと明言している——利用可能な最強の3モデルに対する勝利を主張しつつ、そのいずれも呼び出していないことを確認している。プールに何が含まれていようと、Sakana 自身の説明によれば、それは市場のトップではない。
しかし、そのヘッジには価格表に載っていないコストがある。プールを見ることはできず、メンバーをUltraティアにオプトインさせることもオプトアウトさせることもできず、そのいずれもセルフホストできず、EU/EEAではまったく実行できない——他社ラボの重みをシンガポール拠点でオーケストレーションするのは、重みを所有するのとは異なるリスクプロファイルだ。Qwen3.8-Maxはそれをまさに逆転させる。単一ベンダーのモデルであるため、単一ベンダーの決定にさらされる。しかしAlibabaは、MaxクラスのQwen3.8-2.4T-A95Bチェックポイントのオープンウェイトをカスタムライセンスの下で公開した。つまり、逃げ道は修辞ではなく現実である。価格や条件が変われば、そのモデルは自社インフラから提供できる。実際の恐れがベンダーに足元をすくわれることにあるチームにとって、ダウンロード可能なチェックポイントは、検査を許されていないプールに関する約束よりも強い保証だ。
両方をまたいでエージェントを運用している人にとって、これは二次的なポイントです。Qwen3.8-Max は当社のカタログに掲載されており、入力 $2.00/出力 $6.00、これはアリババの定価に0% のマークアップをそのまま乗せたものです——ベンダーの価格改定は同じ日に同じキーへ反映され、自動フェイルオーバーがレート制限中または性能低下したプロバイダ経路をカバーします。Fugu Ultra v2 は OrcaRouter には掲載されていません。Sakana 自身の OpenAI 互換 API と複数のサードパーティプラットフォームを通じて利用でき、以前の Fugu からの移行は1行のパラメータ変更で済みます。ルーターはコーディネーターの代わりにはならず、コーディネーターはフェイルオーバー能力の代わりにはなりません。両方の特性を求めるなら、2社のベンダーのシステムを運用することになるため、2つの請求を見込んでおくべきです。
どちらを選ぶべきか
予測でき、検証でき、そして逃げ出せるモデルが必要なら、Qwen3.8-Maxを選べ。定価での出力レートはFugu Ultra v2の3分の1で、ロングコンテキストの崖がなく、画像、動画、PDFを受け付ける。一方、Fuguプールのモダリティは基盤となるエージェントがたまたま対応しているもの次第だ。フォールバックできるチェックポイントを公開し、どこでも販売されており、実際にあなたの請求額を左右するものを測定するライブの独立したエントリがある — 毎秒37.8トークンと、コミットする前にモデル化できるタスクあたりコストの数値だ。弱点も同じくらい具体的で、挙げる価値がある。遅く、速度では200中154位、インデックス上では1億8000万トークンと極端に冗長で、さらにArtificial Analysisは前世代比でハルシネーション率が23%から40%に上昇したと別途測定している。これは、まさに宣伝されている自律的なマルチステップ作業にとって深刻な懸念だ。検証役の予算を確保し、ディープキャッシュ割引を積極的に使え。
長期的かつ検証可能な作業で、予算が本番用ではなく探索用で、EU/EEA 圏外なら、Fugu Ultra v2 を選べ。コーディネーターを置く構造的な根拠は実在し、ベンダー自身の例も一貫してそれを指し示している — 単一の H100 上で 14 時間にわたる 123 実験の自動研究実行、300 個のスクランブルされたキューブすべてを解き切った純 Python のルービックキューブソルバー(2 つの匿名化されたフロンティアベースラインは完全にクラッシュした)。これらは匿名化されたベースラインを伴うベンダー選定の例であり、見た目ほどには証明していない。しかしパターンは一貫している。正しさが検証可能で、難しい部分が持続性にあるタスクでは、検証器を起動するほうが、1 つのモデルにより強く問い合わせるよりも勝る。あなたが買っているのはその持続性であり、Qwen3.8-Max の 5 倍の料金で、品質を監査できず、プールを固定できないシステムにおいてだ。範囲を限定してパイロットし、トークンあたりではなく完了したタスクあたりの出力トークンを計測し、最初の実行の前に上限を設定せよ。

値札の数字が的を外しているのは、これらの製品がどちらも、答えのコストをトークンのコストから切り離してしまったからだ。Fugu Ultra v2は、名前を明かさないモデル群にファンアウトすることでそれを実現している。Qwen3.8-Maxは、1億8000万トークンにわたって考えることでそれを実現している。タスクごとのトークン量をすでに把握しているなら、計算は簡単なので、そうすべきだ。ほとんどのチームはその数字を知らず、彼らにとって決定はより単純なものに帰着する:Qwen3.8-Maxは、監査し、値付けし、見限ることのできる選択肢であり、Fugu Ultra v2は、協調が能力に勝つことに賭ける選択肢だ。どちらも擁護できる。だが、証拠が付いてくるのは片方だけだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
