
Gemini 4 Argon対GPT-6 Astra:指数では互角、価格は3分の2下がる
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 144 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
最先端モデル2つが、Artificial AnalysisのIntelligence Indexで0.11ポイント差。Gemini 4 Argonは52.56。GPT-6 Astraは52.67。測定された汎用能力でどちらかを選ばなければならないなら、コインを投げるようなもので、両スコアの差はどちらの信頼区間よりも小さい。これは、トップ10モデル全体が合計で約15ポイントの幅に収まる市場では、本当に珍しい状況だ。そしてこのことが、Gemini 4 Argonの対戦の中でも最も判断しやすいものにしている。なぜなら、能力の議論は始まる前に終わっており、残るのは経済性とアクセスだけだからだ。
とはいえ、この2つは双子ではない。Argonは2026-09-30にGoogle DeepMindによって発表され、段階的に展開中で、まずFairwind Programの信頼されたサイバー防御担当者から始まる。GPT-6 Astraは9月上旬に出荷された——当社のカタログカードでは2026-09-04、Artificial Analysisでは2026-09-03と記載されている——そして今日の午後に呼び出せるライブ経路であり、100万トークンあたり入力$10、出力$50、1,050,000トークンのコンテキストウィンドウと128,000トークンの出力上限を備えている。このモデルのうち1つには、今日実際に課金対象にできる価格がある。
0.11ポイントの差が本物である場合と、それがノイズである場合
指数は合成物であるため、合成値で同点となる2つのモデルでも、その構成要素では意味のある差があり得る。ここでは構成要素は概ね一致しているが、挙げておく価値のある例外が3つある。
• Terminal-Bench 4.0 — GPT-6 Astra 59.1% 対 Gemini 4 Argon 57.1%。Astra が僅差でリード。
• 長文脈推論 — GPT-6 Astra 80.7% 対 Gemini 4 Argon 79.7%。
• GPQA Diamond — GPT-6 Astra 96.1%。Argon はこのボードについて数値を公表していない。
• CritPt — GPT-6 Astra 31.7% 対 Gemini 4 Argon 27.1%。
• SciCode — Gemini 2 Ar 61.8% 対 GPT-6 Astra 56.5%。
• 人類最後の試験 — Gemini 4 Argon 57.1% 対 GPT-6 Astra 54.7%。
• AutomationBench-AA — Gemini 4 Argon 77.5% 対 GPT-6 Astra 68.5%。
• GDPval — Gemini 4 Argon 1,611 対 GPT-6 Astra 1,542。
全知 — GPT-6 Astra 43.4 対 Gemini 4 Argon 42.4。
• ITBench-SRE — GPT-6 Astra は48.6%、Argon の公開値はなし。
• 出力速度 — GPT-6 Astra は毎秒51.2トークン、Gemini 4 Argon は48.9トークン。実質同等。
• インデックスハーネスにおける初回トークン・レイテンシ — Gemini 4 Argon は2.8秒、GPT-6 Astra は320.2秒。
Astraは科学的な多肢選択推論、臨界点の物理学問題、SREベンチマークで優位に立つ。Argonは科学的コーディング、より難しいエンドツーエンドのタスクセット、GDP価値のある作業で優位に立つ。どちらの優位も、単独で移行の根拠とするには十分な大きさではない。

レイテンシの項目はまた別の話だ。最初のトークンまでの320秒は、何かが出力されるまでの5分半の沈黙であり、Argonの3秒未満と対照的だ。どちらも同じもの——Artificial Analysisのインデックス実行における最初のチャンクまでの時間——を測定しているので、比較可能だ。Astraの推論は常にオンで、低エフォートから最大エフォートまで設定できる。難しいタスクでの最大エフォート実行は、話し出すまでに文字通り数分間考える。それが欠陥かどうかは、完全にインターフェース次第だ。バッチジョブなら何のコストもかからない。スピナーを見つめるユーザーがいるものなら何であれ、これはこれら2つのモデル間で最もユーザーに見える違いであり、ページ上のどのベンチマークの差よりも大きい。
本当の主題である価格ステップ
ここで優劣が決まり、しかもその決まり方は、Astra の料金表に似通った3つの階層があるせいで、誤ってモデル化しやすい形になっている。
• 標準、最大272,000入力トークン — GPT-6 Astra 入力 $10.00 / 出力 $50.00、キャッシュ読み取り $1.00、キャッシュ書き込み $12.50。
• 長いコンテキスト、272,000入力トークン超 — GPT-6 Astra 入力$20.00 / 出力$75.00、キャッシュ読み取りは$2.00。リクエスト全体が上位ティアで再価格設定され、あふれた分だけではない:入力2倍、出力1.5倍。
• 高速モード — 適用される標準料金の2倍、つまり入力$20.00 / 出力$100.00。これは長文コンテキスト料金であるかのように引用される$100という数字だが、そうではない。
• Gemini 4 Argon — 導入ベースで入力$2.00 / 出力$10.00のフラット、キャッシュ入力は$0.10、公開された段階制なし、公開された高速ティアなし。
つまり、ArgonはAstraの標準ティアより入力で5倍安く、出力でも5倍安く、272Kを超える入力では10倍安い。2つの独立したコスト測定が、別の方向から同じ点を示している:Artificial Analysisは、インデックスタスクあたりArgonを$1.99、Astraを$3.26とし、インデックス全体の実行ではArgonを$2,407、Astraを$5,324としている。タスクあたりの比率は、DeepSeekに対する場合と同じ理由でトークンあたりの比率より小さい——Argonは完了までにより少ないトークンで済む——が、それでも依然として1.6倍である。
ValsのGDP加重ボードは、同じ話の第3のバージョンを示している。Argonが1位で68.90%、実行あたり15.68ドル、Astraが6位で63.13%、18.46ドルだ。そこではAstraの方が高価で、スコアも低い。Googleの資料は、価格設定が導入価格であると明言しており、それは変動し得るという意味の言葉であり、正直に解釈すれば、Argonの価格優位性は本物だが、それが永続する保証はない。
ベンチマーク以上に多くのことを決める2つのアーキテクチャ上の事実

まず出力上限から。Gemini 4 Argonは1回のトラジェクトリで最大1,000,000トークンを生成する——Googleの発表では、これを前世代の64Kからの拡大として特に挙げている。GPT-6 Astraは128,000が上限だ。どちらもコンテキストウィンドウは約100万トークンなので、これは純粋に、モデルが一度にどれだけ書けるかという話だ。長文生成、フルパッチのコード変更、一括での文書ドラフトといった用途では、1回の呼び出しで生成できる量に8倍の差がある。チャット、抽出、短いエージェントステップでは、どちらの上限も事実上無限であり、その差は何のコストにもならない。
次にモダリティですが、ここではある点で優位性は逆方向に働きます。GPT-6 Astraはテキスト、画像、ファイルを受け付けます。Gemini 4 Argonはテキスト、画像、動画、ファイルを受け付け、Googleの発表資料は特に長尺動画の理解を強調しています——ベンダー報告によるLVBenchスコア91.7%です。パイプラインが動画を取り込むなら、Astraは代替にはなりません。Argonの公開モダリティ一覧に音声も記載されていないため、アップグレードが音声に対応するものと想定しないでください。
実際に何をすべきか
Astra は利用可能で Argon は利用不可であり、このことが今後1か月のほとんどの判断を決める。無駄な作業を生まない具体的な道筋はこうだ。ワークロードに、常時稼働の推論モデルで、高い科学的精度と実証済みのエージェント実績が求められるなら、GPT-6 Astra 上に構築し、モデル名は設定に保持し、クライアントのタイムアウトは楽観ではなく Astra の実測挙動に基づいて設定する — 最初のトークンまで5分かかる実行はデフォルトの60秒タイムアウトに引っかかるし、300秒で切れるストリームは障害のように見える。272K入力トークンを超える領域でコストに敏感なら、コミットする前に価格改定を明示的にモデル化せよ。なぜなら、その段階では1つの境界で入力が2倍になり、出力が5割増しになるからだ。

興味深い中間策は、単一のデフォルトを選ぶ必要がないことです。AstraとArgonは — Argonがリリースされるとき — 同じ種類の作業を対象とした同型のモデルであり、そのため同じ枠を争う競合相手ではなく、自然なフェイルオーバーパートナーになります。OrcaRouterでは、openai/gpt-6-astraと同じOpenAI互換エンドポイント上で、プロバイダーの定価でマークアップなしで利用可能です。ほか200以上のモデルまた、プロバイダー間の自動フェイルオーバーと、1つのキーでプライマリとバックアップの構成を表現するためのルーティングDSLを備えています。ArgonがGoogleの公開する任意のIDでカタログに加われば、切り替えは文字列1つ — 2つ目の契約も、統合作業も、その間にAstraを中心に構築したものを再構築する必要もありません。
何がその同点を恒久的に解消するのだろうか
導入期間終了後に公表されるArgonの価格、そしてGoogleのエージェント性能に関する主張の独立した再現——77.9%というDeepSWE v1.1の数値と、68%というCWE-bench v1の結果はどちらもベンダー報告であり、そのどちらも外部による実行に裏づけられていない。どちらもArgonを大きく押し上げたり押し下げたりし得る。なぜなら、0.11ポイントの指数リードは、コスト優位が一時的なものにすぎないと判明した場合には1.6倍のコスト劣位に対する緩衝にはならず、Googleが導入価格を維持し、Astraの長コンテキスト・ティアが本番環境で予想以上に効いてくるなら、それは不足にはならないからだ。
今のところ:測定された汎用能力では、この2つは2つのラッパーに入った同じモデルだ。Astra は、稼働中のルート、既知の価格ステップ、5分間の思考ポーズを備えた方だ。Argon は、より安いカードを持ち、エンドポイントがない方だ。この互角さは本物で、その一方は購入できる。
