
GPT-6.1 Sol 対 Gemini 4 Argon:わずか0.5点差、そして販売されているのは片方だけ
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
の間で比較できるものはすべてGPT-6.1 SolとGemini 4 Argon測定可能だが、そのどれも実行に移せるものではない。なぜなら、2つのモデルのうち購入できるのは1つだけだからだ。Gemini 4 Argon は2026年9月30日、Koray Kavukcuoglu に帰属される DeepMind の投稿で発表され、入力100万トークンあたり2.00ドル、出力100万トークンあたり10.00ドルという表示価格が付けられ、Fairwind Program を通じて名指しされたサイバー防御担当者の集団にまず展開されている。モデル識別子も、APIエンドポイントも、請求対象となる公表済みのトークン単価も、顧客としてアクセスできるページもない。GPT-6.1 Sol は2026年9月29日に2.00ドルと10.00ドルで提供開始され、現在利用可能だ。Artificial Analysis Index では両者は0.8ポイント差 — Argon 52.6、Sol 51.8 — であり、これはこのバッチで最も差が小さい組み合わせで、指数だけを見れば互角の勝負だ。実際の導入を決める尺度では、これらのモデルのうち一方は候補にすらならない。
その非対称性は技術的な些末事ではないし、スクープでもない。それは、この比較をどう読むべきかを規定すべき事実だ。Argonの数値は、1つのコホートに対する管理された展開段階にあるモデルを表しており、GPT-6.1 Solの数値は、価格表に載っている製品を表している。両者を比較する価値は依然としてある——Argonはベンダーが現在前面に押し出しているものであり、その測定値はGeminiラインの最上位がどこに位置するかについて実質的なことを語っている——が、あらゆる結論には「もし購入可能なら」という一言を伴わせなければならず、どの結論にも「乗り換えるべきか」という一言は伴わない。
その指標では比較がちょうど1回だけ可能で、しかもそれはほぼ互角だ

両モデルはArtificial Analysisに掲載されており、どちらもスコアと、そのスコアを生み出すのに要したコストの内訳を伴っている。
• Intelligence Index v4.3.2 — Gemini 4 Argon 52.6 対 GPT-6.1 Sol 51.8、0.8ポイント差
• インデックスタスクあたりのコスト — Gemini 4 Argon $1.99 対 GPT-6.1 Sol $0.72、その0.8ポイントに対して2.8倍の差
• フルスイートを実行するコスト — Gemini 4 Argon $2,407 対 GPT-6.1 Sol $1,082
• そのスイートで出力されたトークン数 — Gemini 4 Argon 110M 対 GPT-6.1 Sol 67M、1.6倍の冗長性の差
• 発表された導入価格 — 両方とも100万トークンあたり入力$2.00、出力$10.00、Argonではキャッシュ済み入力が95%オフ
• コンテキストウィンドウ — GPT-6.1 Sol 1,050,000トークン;Argonは未公開
4行目は2行目を説明している。見出し上の料金がほぼ同じでもタスクあたり2.8倍のコスト差が出るのは、同程度の出力価格で1.6倍のトークンを書き出すこと、さらにその背後にある推論量にかかるコストによるものだ。Argonは料金表の上では高価なモデルではない。評価では饒舌なモデルであり、その勘定は出力で精算される。
構成が異なり、その違いの方向性は安価なモデルに有利に働く。Artificial Analysisは、Gemini 4 Argonをその高エフォート設定で、GPT-6.1 Solを最大設定でグラフ化している——つまり、Solは最も高価な設定で測定され、Argonはその上限を下回る設定で測定されている。したがって、0.8ポイントの差は、Solにとって寛大な比較バージョンである:Argonに最高設定を与えれば差はおそらく広がり、Solにより低い設定を与えればコストはさらに下がる。どちらの動きも可用性ラインを変えることはない。それだけがデプロイ判断を終わらせる唯一のラインである。
そもそも0.8ポイントの差を読み取ること
10項目の評価を合成したスコアにおける1点未満の差は、順位づけではない。それは同じ帯域に属する2つのモデルだ。
インデックスが Argon について公表していないのは、そのスコア帯を読み取れるようにする構成要素の詳細だ——どの評価で勝ち、どこが弱く、総合スコアを構成するサブスコア全体でどのように振る舞うのか。GPT-6.1 Sol のページにはそうした行が並んでいるが、Argon のページには見出しとコストしかない。見出しだけに基づいて組まれた比較は、両者が互角だと言うことしかできず、0.8ポイント差から勝者をでっち上げるのではなく、まさにそう言うべきだ。
付け加える価値のある外部データ点が一つあり、それは逆方向を指している。発表後に出回った第三者によるコーディング評価では、ArgonはGPT-6 AstraとClaude Opus 5.5に次ぐ3位だった——管理された段階的展開にあるモデルとしては強い結果であり、複合スコア52.6とも整合する。ただしそれは単一の評価による単一の観測であり、発表から最初の数日で公表されたものだ。つまり実績ではなく証拠である。そのようにラベル付けして、先へ進めばよい。
2つの価格カードは実際には何のためのものか
Argonの表示レートには2つの数値が含まれているため、インデックス行よりも注意が必要です。
導入価格は入力$2.00、出力$10.00で、キャッシュ入力は95%オフです。これはカード上では、ArgonがGPT-6.1 Solと同等条件で価格一致することを意味します。ベンダー自身の脚注には、定義されていない導入期間の後、料金は入力100万トークンあたり$4.00、出力100万トークンあたり$20.00になると記載されています。この2番目の料金ペアは仮定の数字ではなく、モデルが落ち着くことが見込まれている公表数字であり、現在のフロンティア定価を下回るのではなく、ちょうどそこに一致します。導入時の料金ペアだけを引用する比較は、まだ一般提供されていないモデルの販促価格を引用していることになり、これは一行の中で二重に暫定的です。
GPT-6.1 Sol のカードは、正反対の種類のものだ。$2.00 と $10.00 はプロモーションではなく通常料金である。272,000 プロンプトトークンを超えると $4.00 / $15.00 になるロングコンテキストの段階的料金は公表されており、定義された境界に適用される。$0.10 のキャッシュ済み入力は本日から利用可能で、課金対象である。そこには、ベンダーが定義することを拒む期間についての脚注を必要とするものは何もない。
それが、入手性に関するあの一行の背後にある本質だ。Argon がより劣るモデルだという話ではない——指標では両者は互角だとされている——そうではなく、この2つのカードのうち、一方は確約であり、もう一方は意図にすぎない、ということだ。
ロールアウト自体が比較です

Fairwind Programは、Argonの発表のうち、技術的な比較ではとかく飛ばされがちな部分であり、ここで最も重要な部分です。
ベンダーはこのモデルを、まず名前の公表されたサイバー防御者の集団の手に、他の誰よりも先に渡している。一般開放の日付は発表されておらず、開発者向けのウェイトリストもなく、顧客が固定できる公開識別子もない。これはフロンティアモデルをリリースする正当な方法であり、このクラスの能力を持つモデルとしては珍しいことではない。またこれは、Argonのコスト、レイテンシ、スループット、実トラフィックでの信頼性に関するあらゆる主張が、現時点では測定されていないことも意味する。測定すべき本番トラフィックが存在しないからだ。ベンダー自身のベンチマーク実行は存在し、Artificial Analysisの総合スコアも存在するが、両者を合わせても、1つのラボによる評価と1つの評価者によるスイートにすぎない。それが記録のすべてだ。
GPT-6.1 Solの記録は8日しか経っておらず、別の形で薄い。独立した構成が1つ、実務家のコーパスはなく、障害モードがまだどこにも書き留められていない提供中の製品がある。どちらのモデルも十分に証拠づけられていない。しかし、そのうちの一方には請求書がある。
それで、この比較は何のためですか
3つの用途があり、そのいずれも購入の決断ではない。
まずは、キャリブレーションからです。Argon が GPT-6.1 Sol と比べてどこに位置するかを追っているなら、タスクあたり 2.8× のコスト差で 52.6 対 51.8 というのが現時点の答えです。そしてこれは、Gemini 4 ラインが能力面では競争力がある一方、商業条件をまだ固めている途中であることを示しています。導入価格が $4.00 / $20.00 のペアに置き換わるかに注意してください。そうなれば、能力が変わらないまま、プライスマッチが価格プレミアムに変わります。
第二に、保留の立場です。発表され、測定され、しかもルーティングできないモデルは、アプリケーションとモデル選択の間に抽象化を挟んでおくべき最も明白な事例です。本稿の両モデルは、私たちの側から同じ方法で到達できます:GPT-6.1 Sol は OrcaRouter 上にあり、独自の $2.00 / $10.00、キャッシュ入力は $0.10 で上乗せは一切ありません。したがって、今日でもプロバイダーの定価でそれ向けのワークロードを構築できます。Argon が識別子と料金表を手にした暁には、その評価は書き直しではなく設定変更であるべきです——そしてそれまでは、Argon に費やすべきエンジニアリングの量とは、その状態を保つための量なのです。
第三に、反証可能なウォッチリストだ。次のいずれかが実現すれば、これは「現時点でわかっていること」をまとめた記事から、実際に購入を検討できる比較へと変わる。開発者ドキュメント内のモデル識別子、モデルカード索引への掲載、トークン単価が公開された一般提供の投稿、またはArtificial Analysisが異なるエフォートレベルで第2の構成を公開することだ。それらのどれかが実現するまで、Argonが本番環境でGPT-6.1 Solより安価、高速、または優れていると主張する記事は、1つのコホートの外では誰も実行したことのないモデルについて述べているにすぎない。

正直な締めくくりはたった一文で、それはスコアではなく問いの形についてのものだ。Gemini 4 Argon と GPT-6.1 Sol は、両方が載っている唯一の独立系ボード上では、インデックスがどちらかを選べないほど拮抗している。両者を選び分けるのは、一方が利用可能で、もう一方が約束だという点だ。そして約束は、本番トラフィックを流す先ではない。Argon を追い、価格とモダリティが自分の仕事に合うなら Sol を採用し、抽象化は十分に薄く保っておけ。そうすれば Argon が現実になる日、それはプロジェクトではなく設定の1行で済む。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
