ヒーロータイトルカードの表記は「Gemini 4 Argon vs GPT-6 Astra」、チップの表記は「インデックス 52.6 vs 52.7」、チップの表記は「インデックスタスクあたりのコスト $1.99 vs $3.26」、フッター行の表記は「Argonの数値はベンダー報告。インデックスとコストの数値はArtificial Analysisによる、2026-09-30」。
Guides & Insights

Gemini 4 Argon対GPT-6 Astra:指数では互角、価格は3分の2下がる

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

最先端モデル2つが、Artificial AnalysisのIntelligence Indexで0.11ポイント差。Gemini 4 Argonは52.56。GPT-6 Astraは52.67。測定された汎用能力でどちらかを選ばなければならないなら、コインを投げるようなもので、両スコアの差はどちらの信頼区間よりも小さい。これは、トップ10モデル全体が合計で約15ポイントの幅に収まる市場では、本当に珍しい状況だ。そしてこのことが、Gemini 4 Argonの対戦の中でも最も判断しやすいものにしている。なぜなら、能力の議論は始まる前に終わっており、残るのは経済性とアクセスだけだからだ。

とはいえ、この2つは双子ではない。Argonは2026-09-30にGoogle DeepMindによって発表され、段階的に展開中で、まずFairwind Programの信頼されたサイバー防御担当者から始まる。GPT-6 Astraは9月上旬に出荷された——当社のカタログカードでは2026-09-04、Artificial Analysisでは2026-09-03と記載されている——そして今日の午後に呼び出せるライブ経路であり、100万トークンあたり入力$10、出力$50、1,050,000トークンのコンテキストウィンドウと128,000トークンの出力上限を備えている。このモデルのうち1つには、今日実際に課金対象にできる価格がある。

0.11ポイントの差が本物である場合と、それがノイズである場合

指数は合成物であるため、合成値で同点となる2つのモデルでも、その構成要素では意味のある差があり得る。ここでは構成要素は概ね一致しているが、挙げておく価値のある例外が3つある。

• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 対 Gemini 4 Argon 57.1%。Astra が僅差でリード。

• 長文脈推論 — GPT-6 Astra 80.7% 対 Gemini 4 Argon 79.7%。

• GPQA Diamond — GPT-6 Astra 96.1%。Argon はこのボードについて数値を公表していない。

• CritPt — GPT-6 Astra 31.7% 対 Gemini 4 Argon 27.1%。

• SciCode — Gemini 2 Ar 61.8% 対 GPT-6 Astra 56.5%。

• 人類最後の試験 — Gemini 4 Argon 57.1% 対 GPT-6 Astra 54.7%。

• AutomationBench-AA — Gemini 4 Argon 77.5% 対 GPT-6 Astra 68.5%。

• GDPval — Gemini 4 Argon 1,611 対 GPT-6 Astra 1,542。

全知 — GPT-6 Astra 43.4 対 Gemini 4 Argon 42.4。

• ITBench-SRE — GPT-6 Astra は48.6%、Argon の公開値はなし。

• 出力速度 — GPT-6 Astra は毎秒51.2トークン、Gemini 4 Argon は48.9トークン。実質同等。

• インデックスハーネスにおける初回トークン・レイテンシ — Gemini 4 Argon は2.8秒、GPT-6 Astra は320.2秒。

Astraは科学的な多肢選択推論、臨界点の物理学問題、SREベンチマークで優位に立つ。Argonは科学的コーディング、より難しいエンドツーエンドのタスクセット、GDP価値のある作業で優位に立つ。どちらの優位も、単独で移行の根拠とするには十分な大きさではない。

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

レイテンシの項目はまた別の話だ。最初のトークンまでの320秒は、何かが出力されるまでの5分半の沈黙であり、Argonの3秒未満と対照的だ。どちらも同じもの——Artificial Analysisのインデックス実行における最初のチャンクまでの時間——を測定しているので、比較可能だ。Astraの推論は常にオンで、低エフォートから最大エフォートまで設定できる。難しいタスクでの最大エフォート実行は、話し出すまでに文字通り数分間考える。それが欠陥かどうかは、完全にインターフェース次第だ。バッチジョブなら何のコストもかからない。スピナーを見つめるユーザーがいるものなら何であれ、これはこれら2つのモデル間で最もユーザーに見える違いであり、ページ上のどのベンチマークの差よりも大きい。

本当の主題である価格ステップ

ここで優劣が決まり、しかもその決まり方は、Astra の料金表に似通った3つの階層があるせいで、誤ってモデル化しやすい形になっている。

• 標準、最大272,000入力トークン — GPT-6 Astra 入力 $10.00 / 出力 $50.00、キャッシュ読み取り $1.00、キャッシュ書き込み $12.50。

• 長いコンテキスト、272,000入力トークン超 — GPT-6 Astra 入力$20.00 / 出力$75.00、キャッシュ読み取りは$2.00。リクエスト全体が上位ティアで再価格設定され、あふれた分だけではない:入力2倍、出力1.5倍。

• 高速モード — 適用される標準料金の2倍、つまり入力$20.00 / 出力$100.00。これは長文コンテキスト料金であるかのように引用される$100という数字だが、そうではない。

• Gemini 4 Argon — 導入ベースで入力$2.00 / 出力$10.00のフラット、キャッシュ入力は$0.10、公開された段階制なし、公開された高速ティアなし。

つまり、ArgonはAstraの標準ティアより入力で5倍安く、出力でも5倍安く、272Kを超える入力では10倍安い。2つの独立したコスト測定が、別の方向から同じ点を示している:Artificial Analysisは、インデックスタスクあたりArgonを$1.99、Astraを$3.26とし、インデックス全体の実行ではArgonを$2,407、Astraを$5,324としている。タスクあたりの比率は、DeepSeekに対する場合と同じ理由でトークンあたりの比率より小さい——Argonは完了までにより少ないトークンで済む——が、それでも依然として1.6倍である。

ValsのGDP加重ボードは、同じ話の第3のバージョンを示している。Argonが1位で68.90%、実行あたり15.68ドル、Astraが6位で63.13%、18.46ドルだ。そこではAstraの方が高価で、スコアも低い。Googleの資料は、価格設定が導入価格であると明言しており、それは変動し得るという意味の言葉であり、正直に解釈すれば、Argonの価格優位性は本物だが、それが永続する保証はない。

ベンチマーク以上に多くのことを決める2つのアーキテクチャ上の事実

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

まず出力上限から。Gemini 4 Argonは1回のトラジェクトリで最大1,000,000トークンを生成する——Googleの発表では、これを前世代の64Kからの拡大として特に挙げている。GPT-6 Astraは128,000が上限だ。どちらもコンテキストウィンドウは約100万トークンなので、これは純粋に、モデルが一度にどれだけ書けるかという話だ。長文生成、フルパッチのコード変更、一括での文書ドラフトといった用途では、1回の呼び出しで生成できる量に8倍の差がある。チャット、抽出、短いエージェントステップでは、どちらの上限も事実上無限であり、その差は何のコストにもならない。

次にモダリティですが、ここではある点で優位性は逆方向に働きます。GPT-6 Astraはテキスト、画像、ファイルを受け付けます。Gemini 4 Argonはテキスト、画像、動画、ファイルを受け付け、Googleの発表資料は特に長尺動画の理解を強調しています——ベンダー報告によるLVBenchスコア91.7%です。パイプラインが動画を取り込むなら、Astraは代替にはなりません。Argonの公開モダリティ一覧に音声も記載されていないため、アップグレードが音声に対応するものと想定しないでください。

実際に何をすべきか

Astra は利用可能で Argon は利用不可であり、このことが今後1か月のほとんどの判断を決める。無駄な作業を生まない具体的な道筋はこうだ。ワークロードに、常時稼働の推論モデルで、高い科学的精度と実証済みのエージェント実績が求められるなら、GPT-6 Astra 上に構築し、モデル名は設定に保持し、クライアントのタイムアウトは楽観ではなく Astra の実測挙動に基づいて設定する — 最初のトークンまで5分かかる実行はデフォルトの60秒タイムアウトに引っかかるし、300秒で切れるストリームは障害のように見える。272K入力トークンを超える領域でコストに敏感なら、コミットする前に価格改定を明示的にモデル化せよ。なぜなら、その段階では1つの境界で入力が2倍になり、出力が5割増しになるからだ。

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

興味深い中間策は、単一のデフォルトを選ぶ必要がないことです。AstraとArgonは — Argonがリリースされるとき — 同じ種類の作業を対象とした同型のモデルであり、そのため同じ枠を争う競合相手ではなく、自然なフェイルオーバーパートナーになります。OrcaRouterでは、openai/gpt-6-astraと同じOpenAI互換エンドポイント上で、プロバイダーの定価でマークアップなしで利用可能です。ほか200以上のモデルまた、プロバイダー間の自動フェイルオーバーと、1つのキーでプライマリとバックアップの構成を表現するためのルーティングDSLを備えています。ArgonがGoogleの公開する任意のIDでカタログに加われば、切り替えは文字列1つ — 2つ目の契約も、統合作業も、その間にAstraを中心に構築したものを再構築する必要もありません。

何がその同点を恒久的に解消するのだろうか

導入期間終了後に公表されるArgonの価格、そしてGoogleのエージェント性能に関する主張の独立した再現——77.9%というDeepSWE v1.1の数値と、68%というCWE-bench v1の結果はどちらもベンダー報告であり、そのどちらも外部による実行に裏づけられていない。どちらもArgonを大きく押し上げたり押し下げたりし得る。なぜなら、0.11ポイントの指数リードは、コスト優位が一時的なものにすぎないと判明した場合には1.6倍のコスト劣位に対する緩衝にはならず、Googleが導入価格を維持し、Astraの長コンテキスト・ティアが本番環境で予想以上に効いてくるなら、それは不足にはならないからだ。

今のところ:測定された汎用能力では、この2つは2つのラッパーに入った同じモデルだ。Astra は、稼働中のルート、既知の価格ステップ、5分間の思考ポーズを備えた方だ。Argon は、より安いカードを持ち、エンドポイントがない方だ。この互角さは本物で、その一方は購入できる。