
Gemini 4 LadderにおけるGemini 4 Argonの段 — そしてG4 Ultraが存在しない理由
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
この記事を書き始めるきっかけとなった問いに対する短い答えは、Gemini 4 Argon は Google の最上位モデルではあるが最上位ティアではない、ということだ。なぜなら、その上のティアはまだ存在しないからであり、おそらく誰も予想していない形でしか存在しないだろう。Google が公開した Gemini 4 モデルは Argon ただ一つであり、自社ドメイン上のパス /models/gemini/ultra/ にある唯一のファーストパーティのページは、モデルのページですらない。それは Google AI のサブスクリプションプランへリダイレクトされる。このリダイレクトはこの記事で最も有用な唯一の事実であり、ターミナルから一行で確認できる。ここから先の話はすべて、Argon の価格をティアのラベルとしてではなく、一つの数値として読んだときに、Argon が実際どこに位置するのかについてだ。
同時に成り立つ2つの事実があり、それらは混同しやすい。Argonは現存する中で最も能力の高いGeminiであり、同時にArgonはフロンティア級のモデルではない。Argonは出荷済みのすべてのGoogleモデルを、もはや比較が比較にならないほどの大差で上回り、Artificial AnalysisのIntelligence Indexでは、現在のリーダーに丸々5ポイント後れを取っている2つの競合フラッグシップと、1ポイントの何分の一という僅差の位置にいる。Googleは、あたかもフロンティアの一段下に位置するかのように価格を付けた。そして独立した測定も同じことを示している。したがって、この価格はモデルを過小評価するマーケティング上の決定ではない。それはモデルについての正確な陈述である。
これは現時点で分かっていることをまとめた記事です。Gemini 4 Argonは2026-09-30に、Koray Kavukcuoglu氏の名義でGoogle DeepMindの投稿で発表され、GoogleのFairwind Programを通じて、名前を明かされたサイバー防御担当者の集団に最初に展開されています——開発者向けでも、企業向けでも、消費者向けでもなく、クレジットカードを持っている人なら誰でも使えるものでもありません。Gemini APIにはモデルIDもエンドポイントもなく、請求の基準となる公開されたトークンあたり価格もありません。これに関するモデル識別子、実トラフィックで測定されたスループットと信頼性は存在しないため、以下の測定は1つのラボによるベンチマーク実行にすぎません。数値がGoogleによるものであればGoogleのものと表示し、Artificial AnalysisによるものであればArtificial Analysisのものと表示しています。ここにある内容は、Argonが購入可能な製品であるという主張として読まれるべきではありません。
Googleが実際に導入したラダーを、自社のページから読み解く
「ArgonはGemini 4のラインナップの中でどこに位置するのか」に答える最速の方法は、ラインナップについて尋ねるのをやめ、Googleがページを公開しているモデルを列挙し始めることだ。ラインナップはマーケティング上の概念であり、ページは事実である。以下は、2026年10月1日時点でファーストパーティのパスが解決する先である。
• deepmind.google/models/gemini/pro/ は 200 を返し、そのタイトルは「Gemini 3.1 Pro — Google DeepMind」です。Google 自身のサイトの Pro 枠は、依然として 3.1 世代のモデルです。
• deepmind.google/models/gemini/flash/ は 200 を返し、そのタイトルは「Gemini 3.8 Flash — Google DeepMind」です。Flash スロットは 3.5、3.6、3.7、3.8 と3回移り変わりましたが、Pro スロットはまったく動いていません。
• deepmind.google/models/gemini/argon/ は404を返します。Argonにはモデル個別のパスはありません。その本拠地はファミリーページ deepmind.google/models/gemini/ で、Googleが現在主力として推しているモデルを配置している場所です。
• deepmind.google/models/gemini/ultra/ は 302 を返し、次に示す場所に着地します: one.google.com/about/google-ai-plans/、これは消費者向けサブスクリプションのページです。同じことは古いパス deepmind.google/technologies/gemini/ultra/ にも当てはまります。Google のモデルパスにおける「Ultra」は課金階層であり、チェックポイントではありません。
• deepmind.google/models/gemini/nano/はGeminiファミリーページへ301リダイレクトされます。単独のモデルページとしてのNanoスロットも存在しません。
• deepmind.google/models/gemini/model-cards/ — Googleが維持している、公開済みのすべてのモデルカードの索引 — には、Argonのエントリも、名前に“Gemini 4”を含むエントリもありません。その索引にある最新のGeminiの行は、3.8 Flash、3.8 Audio、3.7 Flash、3.6 Flash、3.5 Flash、3.5 Flash-Lite、3.1 Proです。カード索引はこのセットの中で最も動きの遅い文書なので、その沈黙は、Argonがカードを持つことは決してないという証拠ではありません。それは、事務処理が発表に追いついていないという証拠です。
• deepmind.google/models/のモデルインデックスには、「Gemini 4 Argon」が「私たちの次なるフロンティア知能の時代」というキャッチコピー付きのフラッグシップカードとして掲載されており、そのすぐ下に「Gemini 3.8 Flash — 複雑なエージェントタスクを大規模に処理するのに最適」とあります。2つのGeminiカードが、1世代違いで、この順に並んでいます。
これらを合わせると、このラダーの形は曖昧ではない。Google が公開しているモデル体系には現在、Gemini 4 の段に1件、Gemini 3.8 の段に1件、3.5世代前の古びた Pro の段が1つあり、そのどれよりも上には何もない。Google のドメイン上で「Ultra」という語はサブスクリプションに解決される。Gemini 4 Pro のページも、Gemini 4 Flash のページも、Gemini 4 Ultra のページも、Gemini 4 のモデルカードも存在しない。Google が発表したのは1つのモデルであり、ファミリーではない。
Gemini 4 Ultraは存在するのか?その根拠と、何がそれを反証するか
これは独立したセクションを設けるに値する。というのも、質問の中でも1週間後には違う答えが出ている可能性が最も高い部分であり、正直な答えには賞味期限があるからだ。
否定的な根拠は曖昧ではなく具体的だ。Ultra パスからサブスクリプションのプランページへの302は、弱いシグナルではない。それは Google 自身のウェブチームが設定したリダイレクトである。複数のblog.google URL パターンが Gemini 4 Ultra の投稿に対して404を返す——products パス、innovation-and-ai の models-and-research パス、そして通常の announcement パスだ。Ultra という命名にはここに前例があり、その前例は Gemini 4 Ultra に不利に働く。Google の最初の Gemini 発表では、Gemini 1.0 が「Ultra、Pro、Nano という3つの異なるサイズ向けに最適化」として登場し、Gemini Ultra は「当社で最大かつ最も高性能なモデル」と説明されていた。3つのサイズを挙げるローンチ投稿こそが、ファミリー発表の姿である。Argon の投稿は1つのモデルだけを挙げ、兄弟モデルには一切触れていない。Google は後に Ultra というモデル名を廃止して数値の階層を採用し、その語を事業のサブスクリプション側へ移した。現在ではそれが最上位のコンシューマー向けプランの名称になっている。モデルのページがプランのページへリダイレクトされるのは、周囲のマーケティングサイトが整理された結果として、廃止されたモデル名が示す姿である。
発表の中にも、より大きな兄弟モデルを約束する内容は一切ない。Argonのローンチ投稿は、Argonを「私たちの新しいフロンティアモデル」と説明し、段階的な展開、セーフガードの取り組み、社内展開について述べて、そこで終わっている。そこには「Gemini 4ファミリーの最初のモデル」とは書かれておらず、ProやUltraを予告することもなく、後継モデルの名前も挙げていない。Google自身の位置づけでは、Argonは小型のものではなく、本命として扱われている。
その結論を反証することになるものは、挙げるのは簡単で、注意して見守る価値がある。これらのどれか一つでも、一日のうちにその結論を覆してしまうだろうから。
• deepmind.google/models/gemini/ultra/ への 200 応答が、プラン ページではなくモデル ページをレンダリングする場合、または新しい models/gemini/ の子パスが pro と flash。
• モデルカード索引に Gemini 4 Ultra の行が現れること。これは、Google が歴史的に、あるモデルが文書化された成果物として存在することを確認する方法である。
• Gemini API における 2 つ目のモデル ID で、gemini-4-*名前空間に属するもの。Argon には現在これが存在しないため、Pro または Ultra の ID があれば、このファミリーが実在する最初の証拠となるでしょう。
• Artificial Analysis のモデル一覧のエントリ、またはファミリーページにある4列目のベンチマーク表。どちらも、早期に把握できるほど Google のリリースを密接に追跡している。
• Google I/O、Cloud Next、または DeepMind の発表投稿で、Gemini 4 について「family」という言葉を使っているもの。Argon の投稿は使っていない。
それらのうち少なくとも一つが実現するまでは、Gemini 4 Ultra が登場するという主張をする記事は、報道の衣をまとった予測にすぎない。私たちのものも含め、そのように扱ってください。

価格ラダーをティアの表明として読む
価格設定は、この件でGoogleが意図的に公表した唯一の部分であり、脚注付きで、ローンチ全体の中で階層の意図を最も明確に示すものだ。Argonの導入価格は、入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで、キャッシュ済み入力は95%オフだ。そしてGoogle自身の脚注1には、Googleが定義できなかった導入期間の後には「入力トークン1Mあたり4ドル、出力トークン1Mあたり20ドルの価格が適用されます」と述べられている。
その2組をフィールド全体と照らし合わせて読めば、ティアの主張は自ずと書けてしまう。
• $4 / $20 は Claude Opus 5.5 の定価です。Google の Argon の導入期間終了後の料金は、現在のフロンティアのトップの料金表にぴたりと重なります——しかもそのモデルは、トップに5ポイント及ばないのです。
• $2 / $10 は、GPT-6 Sol と Claude Sonnet 5.5 の両方が属するプロモーション価格帯です。Argon の導入価格も同じ $2 / $10 で、そのため Argon の発売価格は、フロンティア帯ではなく、ミッドティアの Sol と同じ価格帯に位置します。
• $10 / $50 というのは、Claude Fable 5.1 と GPT-6 Astra がともに位置する価格帯だ。Argon は入力価格も出力価格も Fable 5.1 の5分の1で、しかもスコアは Fable 5.1 と0.8以内の差に収まっている。
• $0.75 / $3.75 は Gemini 3.8 Flash です。Argon は入力でその 2.7 倍、出力で 2.7 倍 — 崖ではなく、クリーンなステップアップです。
GoogleはArgonを、$10/$50未満かつ$0.75/$3.75超に属し、最終的な落ち着き先が$4/$20となるモデルとして価格設定した。その価格ラダーには「フロンティア」などという要素はどこにもない。あるのは「ミッドバンドの最上位で、見出し価格は、リーダーが今日請求しているのと同じ水準に落ち着くのに、能力はより低い」ということだ。それは擁護可能な商業上の選択である。あらゆるものより2段階先に位置づけられたモデルの価格設定ではない。
持ち帰る価値のある構造上のポイントが1つある。Argonの価格ステップはれっきとしたステップであり、脚注で定義され、日付は明記されていない。Sonnet 5.5とGPT-6ファミリーは長文コンテキストの階層で似たようなことをしており、Solは272Kを超えると$4/$15にステップする。Argonのステップはコンテキスト長ではなく時間に基づく——同じ$2/$10が1Mウィンドウ全体に適用され、レートを変えるのはカレンダーだけだ。それは珍しい形であり、Argonとのコスト比較を2列の作業にする:どの期間か、そしてどの使用量か。
Argonはライバルと比べてどこに位置するのか、存在する数字で見る
Artificial AnalysisはGemini 4 Argonの測定結果を十分に早く公開したため、それが利用可能な唯一の独立した評価となっている。10月1日時点のリビジョン——v4.3.2——では、Argonは推論エフォートを高に設定した構成で、Intelligence Indexで52.56を記録している。その周辺に並ぶモデルは、この分野の無作為なサンプルではない。
• Claude Opus 5.5は57.62で、最大エフォートとフォールバックを用いた計測値です。これはArgonを5ポイント強上回っており、現在のボード首位です。
Claude Fable 5.1は53.35で、最大エフォートかつフォールバックありの条件で測定されたものです。Argonはそこから0.79差で続いています。
• GPT-6 Astraは最大時で測定して52.67。Argonはそれに0.11差で続いている。
• Claude Sonnet 5.5は55.98に位置し、フォールバック併用時も最大だ。これはミッドティアのモデルがArgonを3.4ポイント上回っているということであり、「Gemini 4 Argonは世界で2番目に優れたモデルだ」と主張しようとする誰もが警戒すべき数字だ。
• GPT-6 Solは、872Kのコンテキストウィンドウで最大時に測定して47.63に位置している。Argonはそれより4.9先行している。
Gemini 3.8 Flashは高エフォートで40.93。Argonはそれより11.6先行している。
• Gemini 3.1 Pro Previewは29.72に位置している。Argonはそれより22.8上回っており、この事実こそ、Googleの出荷済みProティアが自社の研究にどれほど後れを取っているかを最も明快に示している。
そのリストからは3つのことが浮かび上がる。第一に、ArgonはFable 5.1とAstraという2つの挑戦者と同水準にあり、2つのAnthropicモデル——Opus 5.5、そしてさらに気まずいことにSonnet 5.5——には明確に後れを取っている。第二に、ArgonとGoogle自身の最高の出荷済みモデルとの差は、現行ラインナップにおける最大の世代間ジャンプであり、しかも大差でそうだ。第三に、シグナルが「フロンティアは少なくとも2段階先を行っている」と捉えているのは、実質的には正しいが、幾何学的には少しずれている。Argonより明確に先を行くモデル層が1つあり(Opus 5.5、57.6)、さらに安価な層にある2つ目のモデルもArgonを上回っている(Sonnet 5.5、56.0)。これは、Argonが実際に乗っているはしごの2段下にいることよりも、より深刻な問題である。
元の質問における価格比較の枠組み——「価格を見る限り、これは彼らの Sol/Sonnet 相当だ」——は、ローンチ価格についてはおおむね正しく、最終的な価格については間違っていることが分かる。Argon は Sol と Sonnet 5.5 の料金で登場し、Opus 5.5 の料金に落ち着く。中位モデルとして価格付けされ、フロンティア価格のモデルになることを意図しているが、測定値はどちらの水準にも当てはまらない。
タスクあたりのコストという観点は、Argon が最も強みを発揮する場面であり、ティアの話に第二の次元が加わる場面でもある。Index タスクでは、Argon のコストは $1.99 で、出力トークン数は 142,374 だ。Opus 5.5 は $5.98 で 338,099 を出力する。Sonnet 5.5 は $7.62 で 599,849。Fable 5.1 は $7.63 で 187,455。Astra は $3.26 で 68,691。Gemini 3.8 Flash は $1.24 で 154,230。Argon はフロンティアに近いスコアを買うための最も安い方法であり、スコアで上回る Flash モデルよりも、タスクあたり 1 ドル未満しか高くない。
エフォート設定は上記すべてに付く但し書きであり、この分野ではそれらが一律に報告されていない。Argonはhighで測定されている。Opus 5.5、Fable 5.1、Sonnet 5.5はフォールバック付きのmaxで、AstraとSolはmaxで測定されている。highエフォートの実行とmaxエフォートの実行は同じ測定ではなく、Anthropic自身のエフォートラダーは設定間でモデルを数ポイント動かす。Argonをmaxエフォートで測定したスコアが52.6を有意に上回るなら、ティアの議論は変わる。誰もその実行をまだ公表していない。
Google自身の表が主張している内容と、それが独立系のものとどう異なるか
Geminiファミリーのページには、Googleが作成した4列のパフォーマンス表——Gemini 4 Argon、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5——と19行のベンチマーク行が掲載されている。これはGoogleがこのモデルについて公表した中で最も詳細な主張群であり、全体を通じてベンダー報告である。独立系のIndexと照らし合わせて読むと、両者がこの分野の形について一致していないまさにその点で、示唆に富む。
• Googleの表では、Argonは19行のうち13行で単独1位または同率1位となり、Vals Index Knowledge workの68.9、AutomationBenchの51.3、HarveyのLegal Agent Benchmarkの19.6、DeepSWE v1.1の77.9、LABBench 2の88.8、GraphWalksの≤128K帯で99.7および256K–1M帯で84.2、Agent’s Last Examの39.5、LVBenchの91.7、Chartographyの71.6を含む。
• 持続的なエンジニアリングを思わせる行では、Claude Opus 5.5 が勝利している。FrontierSWE v2 は 62.3 対 Argon の 55.0、Terminal-bench 4.0 は 66.4 対 57.4、Terminal-Bench Science 0.1 は 63.3 対 57.6、PostTrainBench は 49.3 対 45.3。
• GPT-6 AstraはTerminal-Bench Science 0.1で68.1、OSWorld-2.0オフラインサブセットで72.6を獲得し、CWE-bench v1では68.0でArgonと同点となる。Claude Fable 5.1はVibe Code Benchでの共有同点を除き、すべての行で敗北する。
• 独立系のIndexでは、順序はOpus 5.5が最初で、次にSonnet 5.5、次にFable 5.1、そしてArgonとAstraは実質同等だ。Googleの表にはSonnet 5.5の列がまったくなく、これは同表で最も重大な欠落である:表の4つの列は選ばれたものであり、Index上でArgonをより低い価格で上回るモデルがそれらの中に含まれていない。
だからといって、Googleの表が不誠実になるわけではない。ベンダーのベンチマーク表は抽出されたものではなく選別されたものであり、どのラボの表もそうだ。それは測定ではなく主張にするものであり、ティアの問いはそれからでは決着できないことを意味する。この記事でこの表が本当に効いている唯一の箇所は、否定的な点だ。19行、4列、そしてUltra用の5列目はない。

Argonについて、ティアの話ではまったくない唯一の点
上記のどのティアに関する議論も、Argonがいずれ呼び出せるようになるモデルであることを前提としている。ただ、それとポジショニングの問いは切り分けて考える価値がある。両者は答えが異なり、能力に関わるのはそのうちの一方だけだからだ。
Argonの出力トークン上限は100万トークンで、64Kから引き上げられたものであり、Googleはそう明言している。これは出力の天井であり、コンテキストウィンドウではない。この区別は重要だ。なぜなら、今回のローンチに関する報道では両者が絶えず混同されているからであり、また100万の出力上限は100万のコンテキストウィンドウとは別のエンジニアリング上の主張だからだ。前者は単一の軌跡をどれだけ長く走らせられるかに関わり、後者は一度にモデルへどれだけ渡せるかに関わる。Googleは出力上限については明言しているが、コンテキストウィンドウについては沈黙している。Artificial AnalysisはArgonのコンテキストについても1,000,000トークンと記録しているが、それはトラッカーのフィールドであり、Googleの声明ではない。したがって、同じ数字に見えても、この2つの数値は別の部屋から来たものとして扱うべきだ。
明確に利用できないのは、アクセスだ。Argon は一般提供されておらず、どの識別子であれ Gemini API には含まれておらず、サードパーティのカタログにも存在しない。Fairwind Program を通じて審査済みのサイバー防御担当者と、Google 自身のエンジニアには利用可能であり、Google が挙げる次の段階——「有料 API 顧客と Google AI Ultra サブスクライバーから開始」——には日付が付されていない。自分のワークロードでベンチマークすることはできない。したがって、この記事のすべての数値は、あなたが利用できないモデルを他の誰かが測定したものだ。
何がArgonを一段上に押し上げるのか
ティア判定はスナップショットであり、これを変える要因は、おおよそ影響の大きさの順に並べると五つほどある。
• 独立に測定された最大エフォート実行。Argon は現在、高エフォート測定で 52.56 である。Anthropic 自身のエフォートラダーは、設定を変えるとモデルを数ポイント動かす。もし Google のモデルが最大エフォートで同様に振る舞うなら、Fable 5.1 と Astra に対する Argon の実際の位置づけは、この記事が述べているより良い。これが最も可能性の高い、唯一の変更である。
• 第二の測定ソース。1つのトラッカーは1つの測定にすぎない。第二の独立したラボが独自のハーネスでArgonを評価すれば、Googleによる追加のベンチマーク行よりも、そのティアの主張にとって大きな意味を持つだろう。
• Gemini 4 Pro。もしGoogleが、Argonより下位に第4世代のPro階層を設けるなら、ラインナップは形を持ったファミリーになり、Argonの位置づけは「唯一」ではなくなり、「3つのうちの最上位」になり、この記事における不在のファミリーをめぐるあらゆる論証は書き直しが必要になる。注目に値するし、Ultraの問いより差し迫っている。
• 段階的に上がらない価格。導入期間が単に終了しない場合——Google はそれがいつ終わるかを定義していない——Argon の実効的な定常価格は $4/$20 ではなく $2/$10 となり、Opus 5.5 に対するタスクあたりコストの優位性は約3倍から約6倍に広がる。これは能力上の出来事ではなく商業上の出来事だが、調達判断の見え方を変える。
• Argonのモデルカード、システムカード、または評価方法論ページ。パフォーマンス表はGoogleのドメイン上の方法論ページにリンクしている。完全なモデルカードであれば、コンテキストウィンドウ、デプロイ構成、安全性の許容範囲を記録に残し、Fairwindコホート外の人物がGoogleの数値を読むだけでなく検証できるようにする最初の成果物となるだろう。
逆に、Argonを最も下げそうなものは、ベンチマークでは全くない。それは9月30日のBloombergの報道であり、モデルにアクセスできるGoogle社員が、実際の作業ではスコアが示すほどにはうまくいかないと述べたと引用している。その主張はモデル外部の誰によっても検証されておらず、測定値でもないが、第二の独立したベンチマークが確認するか否定するかのどちらかになる類の主張である。それまでは、それは名指しの媒体と匿名の情報源による主張として記録に残り、ベンチマークと現場のギャップが議論されているモデルはベンチマークだけでは昇格できないため、ティアの議論に含まれるべきである。
今月モデルを選ぶなら、これが意味すること
ポジショニングの議論を取り除けば、実用的な全体像は1段落で十分に説明できるほど単純だ。Gemini 4 ArgonはGoogleがこれまでに築いた中で最高のGeminiであり、あなたはそれを利用できない。したがって、今日実際に選択できるGoogleのモデルは、すでに出荷済みのもの、つまりIndexで40.93を記録し、$0.75/$3.75のGemini 3.8 Flashと、Indexで29.72を記録し、$2/$12のGemini 3.1 Pro Previewだ。今すぐGeminiが必要なら、それが実際の選択肢であり、Argonはそこには含まれない。
Google内で選ぶのではなく、ベンダーをまたいで選んでいるなら、Argonの発表によって今日の判断が変わることは何もない。Indexの首位は57.62のClaude Opus 5.5で、55.98のClaude Sonnet 5.5が、入力では5分の1、出力では半分の料金ですぐ後ろに続いている。52.56のGemini 4 Argonはあなたのアプリケーションへの経路がないため、最終的にスコアがどれほど良くても候補にはならない。

OrcaRouterは、200以上ものモデルの前面に立つ単一のAPIで、プロバイダーの定価はマークアップゼロでそのまま通され、プロバイダーをまたぐ自動フェイルオーバーも備えています。つまり、モデルを切り替えるかどうかの判断に配線をやり直す必要はなく、リクエストボディのidを変えることが変更のすべてです。本日時点で当社のカタログに載っているGoogleのモデルは、Googleが実際に出荷したものだけです — google/gemini-3.8-flash、google/gemini-3.6-flash、google/gemini-3.5-flash、そしてgoogle/gemini-3.1-pro-previewです。Gemini 4 Argonはそのどれでもなく、公開されたモデル識別子も公表された料金表もない間は、そうなることはありません。したがって、上記のいずれかにルーティングの主張を読み取るべきではありません。GoogleがArgonをID付きのAPIで提供するようになれば、それはルーティングの問いになります。それまでは、OrcaRouterの答えとして正直なのは「まだ当てはまらない」ということであり、この特定の判断に対してカタログが果たせる有用な役割は、実際に呼び出し可能なモデルを、4つのアカウントを開かなくても並べて価格を比較できるようにしてくれることです。
結論
Gemini 4 ArgonはGoogleのフラッグシップであり、そのフロンティアモデルではない。high effortでArtificial Analysisのv4.3.2 Indexにおいて52.56を記録し、Claude Fable 5.1とGPT-6 Astraと同水準、Claude Opus 5.5には5ポイント及ばず、競合ラボのより安価なモデルであるClaude Sonnet 5.5にも後れを取る。Googleは導入価格を$2/$10に設定し、その後$4/$20へ引き上げる。これにより最終的な料金はClaude Opus 5.5とちょうど同じになるが、能力は測定可能なほど低い。Gemini 3.8 Flashに対する11.6ポイントのリードは、Google自身のラインナップにおいて最も広い世代間ギャップであり、Gemini 4世代が単なるリバッジではなく、本当の進歩であることを示す最強の証拠だ。
これ一連の話のきっかけとなった問いについて言えば、Gemini 4 Ultra は存在しない。Google の自社ドメイン上の Ultra パスはサブスクリプション プランのページへリダイレクトし、モデルカードのインデックスには Gemini 4 の項目がまったくなく、Gemini 4 Ultra の投稿に向けたあらゆる発表 URL パターンは 404 になり、ローンチ投稿はファミリーを約束せずに 1 つのモデルを発表している。これは実際に見つかったことであり、推論ではなく一次情報による証拠だが、半減期の短い事実でもある。1 つのパスで 200 が 1 回返るだけで覆り、Gemini 4 世代の Pro の段階のほうが先に現れる可能性が高い。
この記事から持ち帰るべき注意点が2つある。ここにあるArgonの数値はすべて、審査済みのサイバー防御者コホートの外部の誰も呼び出せないモデルについて、他の誰かが行った測定である。そして、Google自身の19行の表は測定ではなく主張であり、それがそうであるものとしては有用だが、独立したIndexの代わりにはならない。また、ティアに関する公正な判定は暫定的である。Argonは最大ではなく高エフォートで測定されており、最大エフォートでの実行は、この記事が誤っていると判明する最も安価な方法だからだ。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
