
Gemini 4 Argon vs GPT-6 Sol:価格は5分の1、請求額は4倍
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Artificial Analysis のインデックススイートを Gemini 4 Argon で実行すると、請求額は $2,407 になる。同じスイートを GPT-6 Sol で実行すると、請求額は $1,546 になる。同じインデックス、同じタスク、同じ週だ。この2つのモデルの定価は同一で、入力100万トークンあたり $2.00、出力100万トークンあたり $10.00 だ。Argon は Google が提示した導入価格で、Sol は OpenAI の通常価格だ。それなのに、同一の作業を行った場合の最終コストは56%異なり、しかも5点低いモデルのほうが有利だ。この差こそ、この比較を書く価値がある理由そのものであり、料金表とは何の関係もない。
Googleは2026年9月30日にGemini 4 Argonを発表し、それをフロンティア知能の次なる時代と呼び、価格は入力$2、出力$10で、キャッシュ入力は95%オフ、Fairwindプログラムを通じて信頼されたサイバー防御者に順次提供されるとした。GPT-6 Solは2026年9月22日から一般提供されており、その際OpenAIはGPT-6シリーズの中間層を入力$2、出力$10、キャッシュ割引90%で提供開始した。一方は今日、OpenAI互換エンドポイントで購入可能で、もう一方は名前を挙げられた集団以外の誰も購入できない。これが本記事における実用的な分岐点だ。しかし、可用性を完全に脇に置いても、上記のコスト逆転は依然として成り立つ。そしてその理由を理解することが役に立つ部分だ。
逆転、率直に言えば
Artificial Analysisは、Intelligence Indexと、そのインデックスの実行にいくらかかったかの会計の両方を公表している。両者を合わせて読むと、こういうことになる:
• インテリジェンス指数 — Gemini 4 Argon が 52.6、GPT-6 Sol が 47.5。この5ポイントの差は、Argon をその高エフォート設定、Sol を最大で測定したものであるため、この比較は Argon よりも Sol に有利だ。
• 100万トークンあたりの定価 — 同一。どちらも入力 $2.00 / 出力 $10.00。キャッシュ読み取りだけが唯一の違い:Argon は $0.10、Sol は $0.20。
• インデックスタスクあたりのコスト — Gemini 4 Argon は $1.99、GPT-6 Sol は $1.05。Argon はトークンあたりのコストが同じであるにもかかわらず、タスクあたりでは約2倍のコストがかかる。
• フルスイート実行のコスト — Gemini 4 Argon の $2,407 に対し、GPT-6 Sol は $1,546。
• 実測の出力速度 — GPT-6 Sol は毎秒77.0トークン、Gemini 4 Argon は48.9トークンで、その1.6倍の差はレイテンシにもコストにも表れます。
そのリストには、ほかのすべてを説明する一行がある。それは価格ではない。トークン数だ。そのインデックス自体のタスクでは、Gemini 4 Argon は1タスクあたりおよそ561,000の出力トークンを生成し、GPT-6 Sol はおよそ282,000を生成した。Argon は同じ質問に答えるのに2倍長く思考し、同一のトークン単価では、それはちょうど2倍の請求額になる。

なぜトークンが価格なのか
これは、誰かが移行の予算を組む前に内面化しておく価値のある訂正だ。なぜなら、直感は逆方向に働くからだ。あるモデルが競合と同じ価格に設定されていて、完了までに2倍の出力トークンを消費する場合、トークンあたりの価格は価格ではない。価格とは、トークンあたりの価格に、そのモデルが費やすと決めるトークンの数を掛けたものであり、その2つ目の要素はモデルの特性であって、料金表のものではない。
タスクごとのマージンは大きく変動し、それが事態をさらに厄介にする。一律の倍率を当てはめて先に進む、というわけにはいかない:
• Terminal-Bench 4.0 — Argonはタスクあたり165,330出力トークンで、Solの97,372と対照的だ。ここではArgonは1タスクあたり$6.78かかり、Solの$4.00に対して割高だが、Argonは57.1%対Solの43.9%とスコアで上回っている。
• CritPt — Argon 109,533トークン 対 Solの31,848。Solが実際に、より高いスコア(30.9% 対 27.1%)を出すタスクでの3.4倍のトークン比。
• GDPval — Argonは74,571トークンでSolの41,567トークンに対し、1タスクあたり$1.82で$1.32。
• Omniscience — Argon が有利な 938 対 2,662 のトークン比、タスクあたり $0.010 で Sol の $0.027 に対して。方向が反転する唯一のタスクファミリー。
• 長文コンテキスト推論 — Argonは2,197トークンで、Solの954トークンに対してであり、このスイートでSolがスコアで明確に勝つ唯一のタスクで、83.7%対79.7%です。
CritPtこそが示唆的だ。同じ質問に対して、わずかに劣る回答を出すために3.5倍のトークンを消費するモデルは、能力の話ではない。支出習慣の話だ。Argonの推論は長くなりがちで、タスクの形によってはその長さがスコアに変わり、そうでない場合には単にドルに変わる。指標の52.6とSolの47.5は集計値であり、集計値はまさにこうしたものを隠してしまう。
5つのポイントは実際どこから来ているのか
インデックスのギャップとコストのギャップは逆方向を指しているため、それぞれを左右しているのがどのタスクなのかを知っておく価値がある。
• Terminal-Bench 4.0 — Gemini 4 Argon 57.1% 対 GPT-6 Sol 43.9%。Argon にとって最大の単独勝利であり、長期的なエージェント型コーディングに最も近いタスクファミリーです。
• 全知性 — Gemini 4 Argon 42.4 対 GPT-6 Sol 27.1。事実カバレッジにおける15ポイント差は、このスイート内で最大の相対差です。
• AutomationBench-AA — Gemini 4 Argon 77.5% 対 GPT-6 Sol 61.
• SciCode — Gemini 4 Argon 61.8% 対 GPT-6 Sol 57.6%。
• 人類最後の試験 — Gemini 4 Argon 57.1% 対 GPT-6 Sol 47.9%。
• GDPval — Gemini 4 Argon 1,611 対 GPT-6 Sol 1,487。
• ApexAgents / AA-Briefcase — GPT-6 Sol の 1,482.78 Elo 対 Argon の 1,493.84。その 11 ポイント差は公表された信頼区間内に収まっており、引き分けと見なすべきである。
• 長文脈推論 — GPT-6 Sol 83.7% 対 Gemini 4 Argon 79.7%。Solの唯一の明確な勝利。
• CritPt — GPT-6 Sol 30.9% 対 Gemini 4 Argon 27.1%。Solが再び僅差で勝利。
つまり構図は「Argonのほうが優れている」ではない。Argonは、その発表資料が最初に打ち出した2つの点、すなわちエンドツーエンドの業務タスク実行と長期的なソフトウェアエンジニアリングで優れている。そしてSolは、学術寄りの推論ラダーでは同等かリードしており、長いコンテキストを通じて一貫性を保つことでも同等以上だ。ワークロードが400Kトークンのプロンプトを使う検索パイプラインである読者にとって、Solはより優れたモデルであると同時により安価なモデルでもあり、これは珍しく心地よい立場だ。
ベンチマークの議論を超えてなお残る仕様の違い
• 最大出力 — Gemini 4 Argon は単一のトラジェクトリで1,000,000トークン。Googleはこれを業界最大であり、前世代の64K上限からの増加だと説明している。GPT-6 Sol は128,000トークン。
• コンテキストウィンドウ — GPT-6 Sol のベンダーカードには約 1,050,000 トークンと記載されています。Argon は 1,000,000 です。Artificial Analysis は自身のハーネスを通じて Sol を 872,000 トークンと測定しましたが、これはハーネスによる測定値であり、カードの数値ではありません — カードを仕様として扱い、ハーネスの数値は評価者が実際に試したものとして扱ってください。
• 入力モダリティ — どちらもテキスト、画像、ファイルを受け付けます。Argonの発表資料は長尺動画の理解にも力を入れており、GoogleはLVBenchで91.7%を主張し、これを最先端と表現しています。ただしこれはベンダーが報告した数値であり、それを再現した独立系の評価はまだありません。
• 動画入力 — ソフト。Artificial AnalysisのチャートではArgonは動画入力が無効になっており、ローンチ時に動画を明示的に挙げている一方、Solのカードには動画がまったく記載されていない。動画があなたのパイプラインで重要な役割を果たすなら、どちらのカードもそれを決着させないので、設計する前にテストすべきだ。
• 推論エフォート — Sol は API で設定可能なエフォート(none から max まで、デフォルトは medium)を公開しており、maxでチャート化されました。Argon はhighでチャート化されましたが、その最高設定で同じスイートを公開した者は誰もいません。
1Mトークンの出力上限は、予算ではなくアーキテクチャを本当に変えうるものだ。現在128Kの上限内に収めるために十数回の連鎖呼び出しに分割しているもの——複数ファイルのパッチセット、完全な監査レポート、長い文書の一括処理——は、1回の呼び出しになり、エージェントループが状態を失う箇所が減る。それがタスクあたり2倍のコストに見合うかどうかは、完全にそのワークロードがあるかどうかによる。あるなら、おそらく見合う。呼び出しが分類して返すだけなら、誰も使わない余裕に金を払うことになる。
誰も到達しなかったエフォート設定、そしてそれが重要な理由
一つの注意点は、5ポイントの指数差を純粋な能力差とみなす読み方に待ったをかけるため、それだけで一段落を割く価値がある。Artificial Analysis は Gemini 4 Argon を high 推論エフォート設定で、GPT-6 Sol を maxでグラフ化している。これらは二つのはしごの同じ段ではないし、不一致の向きは興味深い。Sol は最も高コストな設定で実行され、Argon は中程度の設定だった。
二つの解釈が成り立つが、データではそれらを区別できない。Argon を max に設定すると、52.6 より高いスコアを出す——ただしタスクあたり 561,000 トークンより多く消費し、$1.99 より高くつく——か、あるいはスコアはほぼ同じで、その場合はこのスイートではエフォートダイヤルがほとんど効いていないことになる。これを決着させる公開実行は存在しない。52.6 を Argon の上限として引用する人は、モデルではなく構成を引用しているのであり、その構成はベンダーが最初に公開することを選んだものである。
同じ論理はSolの47.5にも当てはまるが、方向は逆だ:maxはそのはしごの最上位なので、この数字は床というより天井に近い。同じ努力で公平に戦えば差は縮まる可能性があり、コスト比較も逆転しうる。なぜならmaxが消費するトークンは、100万あたり$10かかるトークンだからだ。
実際の答えを決める可用性の分岐点
Gemini 4 Argon は一般提供されていません。Google の発表によると、Fairwind Program を通じて信頼されたサイバー防衛担当者の一群に順次展開しており、同社は米国政府の任意のリリース前モデルアクセスプロセスに関与しており、開発者、企業、消費者への一般アクセスは「できるだけ早く」実現し、まず有料 API 顧客と Google AI Ultra 加入者から開始するとしています。モデル識別子も、エンドポイントも、クォータも、日付もありません。当社のものも含め、どの公開 API にも存在しません — カタログを確認すると 404 になります。まだそこに存在しないからです。
GPT-6 Solは呼び出し可能な製品です。OrcaRouterではopenai/gpt-6-solとして提供されており、他の200以上モデルと同じOpenAI互換エンドポイント上にあり、カタログのOpenAI定価がゼロマークアップでそのまま適用されるため、上記の$2/$10、および272,000トークンのロングコンテキスト利用時の$4/$15への段階が、料金表がうたう価格ではなく実際に支払う金額になります。プロバイダーをまたぐ自動フェイルオーバーは、実行の途中でルートが劣化するケースに対応し、またルーティングDSLを使えば、単一のアプリケーションが、安価な分類トラフィックをより小さなモデルへ、高度な推論トラフィックをSolへと、2つ目のSDKなしで振り分けられます。

その最後の構成こそ、ほとんどのチームにとってこの比較に対する正直な答えだ。Argonを支持するコスト論は本物だが、長期的なエージェント作業が支配するワークロードであることが条件であり、反対するコスト論はそれ以外のあらゆるワークロードで本物だ。しかも、今月はどのみちそれを購入することはできない。安上がりな手は、今すぐ評価ハーネスを構築することだ — 自前のプロンプト、自前のスコアリングで、いくつかのeffort設定でSolに対して実行する — そうすれば、Argonが有料API顧客に届く頃には、他の全員がリーダーボードから答えるであろう問いに対して、あなたは測定済みの答えを持っている。
それを解決するものは何だろう
判断をどれだけ左右するかの順に、3つのこと。実際の、導入価格ではない価格でのArgonの一般提供——「導入」という言葉は、$2/$10が動き得ることを意味しており、Google自身の順序では有料API顧客が最初に来るので、ローンチ後に最初に公表される料金が注目すべきものだ。Argonを最高エフォート設定で実行したArtificial Analysisの公開結果——これなら52.6が天井なのか、天井からごくわずかしか離れていないのかが分かるだろう。そしてDeepSWE v1.1の数値の独立した再現が1つ——Googleは77.9%と主張し、新たな最先端(state of the art)と呼んでいるが、今日時点ではベンダー報告であり、Googleの外部では再現されていない。
それまでは、この分かれ方は明確で、少し皮肉めいている。GPT-6 Sol はより検証が進んだモデルで、より速く、完了したタスクあたりではより安く、しかも今日の午後には呼び出せる。Gemini 4 Argon は、提供元が公表を選んだリーダーボード上ではより高スコアのモデルで、実際に使うにはおよそ2倍の費用がかかり、まだ販売されていない。両者から選ぶことは、能力についての判断ではない。それは、その2つの文のどちらがあなたの今月を言い表しているかについての判断だ。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
