
Gemini 4 Argon 対 Claude Opus 5.5:誰も予想しなかったベンチマークの分裂
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Gemini 4 Argon と Claude Opus 5.5 はどちらが優れているかをめぐって意見が分かれており、その不一致はノイズではない。Artificial Analysis の Intelligence Index では、両者は Opus 5.5 に有利な5点差で並んでいる。Vals Index ——GDP加重の経済影響ボード—— では、Gemini 4 Argon が1位、Claude Opus 5.5 が3位で、Argon と Claude Sonnet 5.5 の両方の後塵を拝している。どちらのボードも、同じ週に同じ2モデルを測定した。それがこの記事のすべてだ。どちらを選ぶべきかは、あなたの仕事が試験問題に近いか、法律事務所の火曜日に近いか、そして今日時点でほとんど誰も持っていない Argon への API アクセスをあなたが持っているかどうかによる。
Googleは2026年9月30日、DeepMindの投稿でGemini 4 Argonを発表した。その投稿は、Google DeepMindのSVP兼チーフAIアーキテクトであるKoray Kavukcuogluの名義とされている。Anthropicは8日前の2026年9月22日にClaude Opus 5.5をリリースした。そのうちの一方は、今日の午後には呼び出せるGAリリースだ。もう一方は、名前を挙げられたサイバー防衛担当者の集団とGoogle自身のエンジニアを対象とする段階的ロールアウトであり、ガードレールの準備が整い次第「有料API顧客とGoogle AI Ultra購読者」に到達させるという明言された意図があるものの、それに日付は付されていない。
詳細の前に、一行の答え
今日時点で測定上最高の汎用推論が必要で、しかもそれを本番キーで使う必要があるなら、Claude Opus 5.5 は今すぐ OrcaRouter で利用でき、Gemini 4 Argon はどの公開 API にもありません。金融、法務、税務、コーディングのエージェント向けに構築していて、それらが1ドル当たりの経済的成果で評価されるなら、Argon の数値はより良く、まさにそれを測定している唯一のボード上では、タスク当たりの価格は Opus 5.5 の5分の1です。重要インフラのサイバーセキュリティ防御に携わっているなら、Argon には応募できるプログラムがあり、答えはイエスかもしれません。
それぞれの数字が実際にどこから来るのか
2つのインデックスボード、2つの方法論。どちらがどちらなのかを正確に押さえておく価値がある。なぜなら、2つの陣営は何カ月にもわたって、互いに引用し合いながらすれ違い続けるからだ。
• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 が 57.6、Gemini 4 Argon が 52.6。いずれも 2026-09-30 に Artificial Analysis から読み取った値。これは10種類の評価を合成したもので、意図的にタスク汎用に設計されており、多くの人が「これが」ランキングだと引用するボードである。
• Vals Index、2026-09-29更新 — Gemini 4 Argonが68.90%(±0.97)で1位、Claude Sonnet 5.5が67.04%(±0.92)で2位、Claude Opus 5.5が66.97%(±0.89)で3位。Valsは、金融、コーディング、法務、税務のタスクを各セクターの米国GDPに占める割合で重み付けしている。そのため、パズルは並でも契約レビューやスプレッドシート作業に優れたモデルは、ここで高いスコアを獲得する。
AAの5ポイント差は実在するし、小さいわけでもない。Valsの2ポイント差も同様に実在し、リーダーボードに記載された信頼区間を使うと、Argonの68.90 ±0.97 対 Opus 5.5の66.97 ±0.89 はおよそ1.5標準誤差の隔たりだ。コイントスよりはましだが、圧倒的とまではいかない。どちらのボードも間違ってはいない。両者は異なる仕事を測っているのだ。

設定上の注意点がひとつあり、これはAAの差を純粋なモデル比較として読むことには水を差す。Artificial AnalysisはGemini 4 Argonを高エフォート設定で、Claude Opus 5.5を「Adaptive Reasoning, Max Effort, Default Fallback」でグラフ化している。これらは2つのエフォートのはしご上で同じ地点ではないため、57.6対52.6という見出しの数字は、推論予算を揃えた同一条件どうしの比較ではない。これは両ページが公開している数字であり、Anthropicに対して公平を期すなら引用すべき数字だが、対照実験ではない。
タスクあたりのコストこそ、その差が気まずくなるポイントだ
Artificial Analysisは、自社のインデックススイートを実行するのにかかったコストの内訳も公開しており、この点において両モデルには大きな差がある。
• インデックスタスクあたりのコスト — Gemini 4 Argon $1.99 対 Claude Opus 5.5 $5.98
• インデックススイート全体を実行するコスト — Gemini 4 Argon $2,407 対 Claude Opus 5.5 $8,708。
• 100万トークンあたりの定価 — Gemini 4 Argon は入力 $2 / 出力 $10(Google が公表している導入価格で、キャッシュ入力は 95% オフのため $0.10)に対し、Claude Opus 5.5 は入力 $4 / 出力 $20。
• スループット — Gemini 4 Argonは毎秒48.9出力トークン、最初のトークンは2.79秒後。一方Claude Opus 5.5は毎秒92.2出力トークンながら、同じハーネスでの初回トークン遅延は702秒であり、これは拡張思考のコストが露わになったものだ。
• 実行あたりのコスト比較 — 同じGDP加重タスクセットにおいて、Gemini 4 Argon は $15.68、Claude Opus 5.5 は $32.14。
丸く収めるのではなく、指摘しておく価値のある齟齬が1つある。Valsのリーダーボードには、Argonの料金が入力$4 / 出力$20と記載されている一方、Googleの発表では導入期間中は入力$2 / 出力$10とされている。最もありそうな解釈は、Valsが通常の定価レートを示しており、Googleがプロモーション価格を示しているというものだが、それは推測であり、どちらかが公表した声明ではない。予算がこの数字に依存するなら、Googleに問い合わせてください。
Argonが主張していることと、確認されていること

Googleの投稿は数字がぎっしり詰まっており、その一つ残らずがベンダーによる申告値だ。私が探した限り、独立に再現されたものは一つもない。しかも上記の独立系ベンチマークは、Googleが前面に押し出したものとは別のものを測定している。あくまでGoogle自身の主張として述べれば、以下のとおりだ。
• DeepSWE v1.1 — 77.9%、実世界の長期的ソフトウェアエンジニアリングにおける新たな最高水準(state of the art)と評されている。
• LVBench 長時間動画理解 — 91.7%、最先端と評されている。
• AutomationBench(エンドツーエンドのビジネスタスクを対象としたZapierのベンチマーク)— 51.3%で第1位。
• CWE-bench v1 の脆弱性修正 — 68%で同率首位、v0ボードでの Gemini 3.8 Flash Cyber の結果を基にしている。
• Gray Swan 間接プロンプトインジェクション — 首位と説明されているが、投稿内に数値は公表されていない。
• Vals Finance Agent v2 と Harvey の Legal Agent Benchmark — 最先端と説明されており、同様に発表文には数字が明記されていない。
独立した裏付けを実際に持つ2つの主張群こそ、最も信頼する価値がある。Valsは数値と区間を示してインデックス上の位置を確認しており、Artificial Analysisは52.6という指数と価格を確認している。社内生産性にまつわる逸話——量子サブルーチンにおける公開ベースラインに対する40%の改善や、ArgonエージェントによってGoogleのフリート全体で解放された300 TiB超のメモリ——は、外部テストのない社内結果であり、そのように読むべきである。
Opus 5.5とは何か——世間知らずもいいところなあなたのために
Claude Opus 5.5はAnthropicのフラッグシップです。100万トークンのコンテキスト、最大128Kの出力、テキスト・画像・ファイルにわたるマルチモーダル入力、拡張思考、ツール使用、構造化出力を備えています。2026年9月22日にClaude Opus 5の後継として登場し、そのリリースの最大の話題は間違いなく価格の引き下げでした。価格は上がるどころか下がり、$4/$20、キャッシュ読み取りは$0.20となっています。現在、OrcaRouterでまさにそのレートでルーティング可能で、プロバイダーの定価をマークアップゼロでそのまま適用しており、ベンダーの価格変更は先方に反映されたその日に当社側にも反映されます。
両モデルが持つタスクレベルのスコアでは、その状況は一方的な圧勝というよりも、本当にシーソーのようなものだ:
• Terminal-Bench 4.0 — Claude Opus 5.5 が 59.6%、対する Gemini 4 Argon は 57.1%。
• SciCode — Claude Opus 5.5 66.9% 対 Gemini 4 Argon 61.8%。
• Humanity's Last Exam — Claude Opus 5.5 61.4% 対 Gemini 4 Argon 57.1%。
• 長文脈推論 — Claude Opus 5.5 84.7% 対 Gemini 4 Argon 79.7%。
• CritPt — Claude Opus 5.5 31.7% 対 Gemini 4 Argon 27.1%。
• 全知 — Claude Opus 5.5 の 46.4 対 Gemini 4 Argon の 42.4。
• GDPval — Claude Opus 5.5 1,846 対 Gemini 4 Argon 1,611。
• AutomationBench-AA — Gemini 4 Argon 77.5% 対 Claude Opus 5.5 69.5%。これは、Argon が明確に勝利している唯一の直接対決タスクスコアであり、Vals Index が評価するものに最も近いタスクファミリーでもある。
つまり、パターンは一貫している。学術寄りの推論ラダーでは Opus 5.5 が先行し、エンドツーエンドのタスク実行では Argon が先行している。これはもはや、2つのボード間の矛盾ではない。同じ発見が2回表現されているだけだ。
誰も比較軸にしていない能力
Gemini 4 Argon の出力上限は、単一のトラジェクトリで 1,000,000 トークンであり、前世代の 64K から引き上げられている。Claude Opus 5.5 の出力上限は 128K だ。両者とも 1Mトークンのコンテキストウィンドウを備えているが、コンテキストと出力は別々の予算であり、これは今回の発表における単一仕様として最大の飛躍である。
それが重要かどうかは、何を実行するかによって完全に決まります。128Kの出力上限は、チャット、コードレビュー、構造化抽出、エージェントのステップにとっては十分に余裕があります。しかし、移行パッチセット全体、完全な監査レポート、長文ドキュメントを一度に生成する場合には厳しい壁となります——Googleが今回のローンチの説明に選んだワークフローがまさにそれです。パイプラインが上限内に収めるために20回の呼び出しを連鎖させているなら、Argonの上限はレイテンシとオーケストレーションのコードを節約します。そうでなければ、使うことのない余裕分にコストを払っていることになります。
決め手となる変数は品質ではなく、可用性である。
これは、比較の中でもベンチマークが付いていない部分であり、それらすべてよりも重要です。
Gemini 4 Argon は一般提供されていません。Google の投稿によると、Fairwind Program を通じて信頼されたサイバー防衛関係者に展開中であり、同社は米国政府の任意のリリース前モデルアクセスプロセスに関与しており、開発者、企業、消費者へのより広範なアクセスは「可能な限り早く」提供され、まず有料 API 顧客と Google AI Ultra 加入者から開始されるとのことです。モデル識別子も、エンドポイントも、公開されたクォータも、日付もありません。当社のカタログにはなく、他のどこかの公開 API にも存在しないため、Argon の価格ページはまだ存在しません。
Claude Opus 5.5が本日提供を開始します。OrcaRouterではanthropic/claude-opus-5.5として、カタログにある他の200以上のモデルと同じOpenAI互換エンドポイントから利用でき、プロバイダー間の自動フェイルオーバーを備えています。あるルートが劣化した場合には自動的に切り替わります。また、同じキーで一部のトラフィックをOpus 5.5へ、残りを別の宛先へ送りたいケース向けのルーティングDSLも用意されています。2つ目の契約も、2つ目のSDKも不要です。

来月に向けた実践的な推奨は、地味なものだ。Opus 5.5 を基盤とし、モデル名は文字列リテラルではなく設定値に置き、リトライ経路の背後には安価なモデルを据える——そうすれば、702秒かかる初回トークン実行でのレイテンシ急増に、プロダクトまで巻き添えで落ちることはない。この最後の点は理論上の話ではない。AA のハーネスにおける Opus 5.5 の初回トークンレイテンシは11分であり、それがハーネス由来のアーティファクトなのか、それともこのモデルがこれまでのどのモデルよりも本当に長く考えているからなのかに関わらず、タイムアウトの予算はマーケティングではなく、この数値によって決めるべきだ。
何がこの評決を変えるでしょうか
可能性の高い順に3つ。価格が公表されたArgonの一般提供。これによりコスト論が即座に実行可能になり、$2/$10が実際のトラフィックに触れて持ちこたえるかどうかを試すことになる。Googleの外部で行われるDeepSWE v1.1とCWE-bench v1の独立した再現可能な実行。これはベンダーの主張を裏付けるか、あるいは打ち砕くかのどちらかになる。または、Argonを最高エフォート設定で構成したArtificial Analysis。これなら、5ポイントの指数差が能力差なのか、エフォート設定による人為的な産物なのかが決着する。
それらのどれかが実現するまでは、正直にまとめれば、Opus 5.5 のほうがより検証が進んだモデルであり、Argon のほうがより価格に優れた主張だ。そのどちらを今日実際に使えるかは、僅差の話ではない。
Claude Opus 5.5は、ベンダーの定価のまま(マークアップなし)で、カタログの他のモデルと並んでOrcaRouter上で利用可能です。リーダーボードではなく自分のワークロードでベンチマークしたいなら、anthropic/claude-opus-5.5が呼び出すIDで、後から別のモデルに差し替えるのも同じキーで1行変更するだけです。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
