生成されたヒーローカードは「GPT-6 Sol vs DeepSeek V4 Pro」というタイトルで、見出しは「12インデックスポイント」、2行で「1Mあたり$2.00/$10.00のクローズドAPI」と「1Mあたり$1.32/$3.96のMITオープンウェイト」を対比し、右下にOrcaRouterのロゴを配置している。
Guides & Insights

GPT-6 Sol 対 DeepSeek V4 Pro:4倍の価格で12ポイントのインデックス差

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これが、誰もローンチページには載せない算術だ。DeepSeek V4 ProはArtificial AnalysisのIntelligence Indexで36点。GPT-6 Solは48点。GPT-6 Solは入力100万トークンあたり$2.00、出力100万トークンあたり$10.00かかる。DeepSeek V4 Proは同じボードで$1.32と$3.96——そして自社が公開している料金表を換算すると、およそ$0.42と$0.87になる。つまり、GPT-6 SolとDeepSeek V4 Proの間にある12点の差は、どちらの料金表を見るかによって1.5倍から4倍の価格で買われることになり、安い側のモデルこそ、自分でダウンロードして実行できるモデルなのだ。

それが判断のすべてであり、実際のところ、スコアボードが示すよりずっと僅差だ。DeepSeek V4 Pro は2026年8月13日に、総パラメータ数1.6兆、トークンあたり490億のアクティブパラメータを持つ、MITライセンスの混合エキスパートモデルとしてリリースされた。GPT-6 Sol は2026年9月22日に、自らの前世代の半額となるクローズドウェイトのフロンティアモデルとしてリリースされた。一方は自分でホストできるコモディティであり、もう一方はレンタルする能力だ。どちらも100万トークンのコンテキストウィンドウを備えている。どちらも推論モデルだ。どちらも明らかに間違った買い物ではない。

これを決める数字

まずは両ベンダーが一致している点、つまりコンテキストから始めましょう。DeepSeek V4 Proは1Mのコンテキストウィンドウを備え、最大出力は384Kです。GPT-6 SolはArtificial Analysisによって872,000トークンと記載されており、上限は1.05Mですが、OpenAIの他の資料では出力上限が128Kとされています。DeepSeekは3倍の出力余裕と、同等の入力ウィンドウを提供します。

次に、両者のうち一方だけが持つもの:長コンテキストでの再価格設定クリフだ。GPT-6 Solの$2/$10は、入力トークン272,000未満では維持される。それを超えると、リクエスト全体の価格が再設定され、入力は約2倍の$4になり、出力は5割増の約$15になる。DeepSeek V4 Proにはそれに相当するステップはない。その公表料金はコンテキストウィンドウ全体に適用され、8月17日に導入されたピーク・オフピーク制では、価格がコンテキスト長ではなく時間帯によって変わる。

これらを合わせて考えると、上位帯では比較が逆転する。40万トークンのコンテキストを伴う DeepSeek V4 Pro のリクエストは、通常料金で済む。同じリクエストを GPT-6 Sol で行うと、表示価格のおよそ2倍かかる。あなたのワークロードが本質的に長コンテキスト型であれば——文書分析、大規模リポジトリのエージェント、長時間の文字起こし推論——これら2モデル間の実効価格差は、$2 対 $1.32 が示唆するよりもはるかに大きい。

A generated two-column scoreboard titled 'GPT-6 Sol vs DeepSeek V4 Pro — the scoreboard'. Left column GPT-6 Sol: Price $2.00/$10.00, AA Index 48, Weights 'closed', Max output 128K, Terminal-Bench 2.1 'n/a', Context 872K. Right column DeepSeek V4 Pro: Price $1.32/$3.96, AA Index 36, Weights 'MIT', Max output 384K, Terminal-Bench 2.1 87.9, Context 1M. Footer: 'DeepSeek figures per DeepSeek and Artificial Analysis.'

DeepSeek V4 Proが真に競争力を持つのはどこか

DeepSeekのエージェント性能とコーディング性能の結果は、低予算ゆえの妥協ではない。ベンダーが公開した数値を見れば:

• Terminal-Bench 2.1 — DeepSeek V4 Pro 87.9

• Toolathlon-Verified — DeepSeek V4 Pro 74.1

• DeepSWE — DeepSeek V4 Pro 62.7

• SWE-bench Verified — DeepSeek V4 Pro 80.6

• AA Intelligence Index — DeepSeek V4 Pro 36、計測済み114モデル中8位

• 出力速度 — DeepSeek V4 Pro 67.8 トークン/秒

• ライセンス — MIT、オープンウェイト、セルフホスト可能

Indexランキングは再評価に値する。36点で、DeepSeek V4 Proはボード上の114モデル中8位につけており、ダウンロード可能な重みとMITライセンスを持つモデルにとっては強い位置づけだ。GPT-6 Solとの差は確かに存在するが、それは「非常に優れた」と「フロンティア」の間の差であり、「使える」と「使えない」の間の差ではない。

MITライセンスは、GPT-6 Solに相当するものがない部分です。あなたの制約がデータレジデンシー、エアギャップ展開、高稼働率でゼロに近づくトークンあたりのコスト、あるいは単にベンダーによる非推奨化を移行イベントにしたくないことであるなら、この2つのうちその問いに答えるのはDeepSeek V4 Proだけです。GPT-6 SolはAPI専用であり、今後もそうあり続けます。

GPT-6 Solが独走する場面

この順位表のこのあたりでは、Index の12ポイントは大差だ。GPT-6 Sol は212の測定対象モデル中18位、これに対して DeepSeek は114モデル中8位であり、GPT-6 Sol は DeepSeek が異を唱えていない一連のベンダー公開エージェント結果によってその位置に到達している:

• AutomationBench — GPT-6 Sol 33.2%、タスクあたり$0.27

• Agents' Last Exam — GPT-6 Sol 56.4%

• DeepSWE v1.1 — GPT-6 Sol 68.8%

• OSWorld 2.0 — GPT-6 Sol 60.5%

• 出力速度 — GPT-6 Sol は 104.4 トークン/秒、DeepSeek V4 Pro の 67.8 に対して

これらはベンダーによる報告であり、OpenAIが独自のハーネスを実行したものなので、測定値ではなく主張として扱うべきだ。引き継いでおく価値のある注意点が2つある。OpenAIはいくつかの行で競合モデルを再実行せず、公表されている競合スコアを使用しており、またClaude Fable 5.1に関するAgents' Last Examのチャート上の点は、タスクのおよそ40%で発動したOpus 5のフォールバックを除外している。どちらの注意点もDeepSeekとの比較に直接関わるものではないが、表全体を大まかにしか受け止めないほうがよい理由はそこにある。

独立系の評価は、どちらのベンダーの主張よりも慎重だ。Artificial Analysisによると、GPT-6 SolはGPT-5.6 Solと比べてタスクあたりのコストをほぼ半減させる一方で、改善と後退が入り混じった結果をもたらしている——GDPval-AA v2.1での後退も含まれる。一部の領域で能力を犠牲にして大幅なコスト削減を実現するモデルとは、どこでも上限を引き上げるモデルではなく、実行できる範囲を変えるモデルである。

そして GPT-6 Sol のレイテンシ特性は、紛れもない弱点だ。初回トークンまでの時間は 107.18 秒で、ボード中央値の 3.87 秒に対する値である。これはボード上で最も遅い初回トークンであり、大差をつけている。DeepSeek V4 Pro も高速なモデルではないが、その領域には達していない。そして、あらゆるインタラクティブな接点において、この差は片方向にしか失格要因にならない。

オープンウェイト 対 レンタルされるフロンティア

これは、2つのモデルが実際には競合していない次元です。DeepSeek V4 Proは、49Bのアクティブパラメータを持つ1.6TパラメータのMoEで、MITライセンスで提供され、ダウンロード可能です。つまり、大量導入時には実質ゼロに償却される固定費、自分で制御できるデプロイ、そしてあなたの与り知らないうちに非推奨にされることのないモデルを意味します。また、サービングスタック、GPUの請求書、そしてあらゆるリグレッションを自分で負うことも意味します。

GPT-6 Solは逆の取引だ。永久にトークン単位で支払い続ける代わりに、ハードウェアを所有することなく最先端の能力を得られるが、OpenAIはブログ投稿ひとつで価格、料金表、可用性を変えられる——9月22日に自社のフラッグシップの価格を半額にしたように。固定できるGPT-6 Solのバージョンは存在しない。

正しい考え方は「どちらが優れているか」ではなく「どちらのリスクを選ぶか」です。ベンダーリスクか、運用リスクか。インフラチームがなく、トラフィックが不安定なスタートアップにとっては、APIが明らかに正解です。既存のGPUキャパシティ、コンプライアンス境界、あるいはトークン単位の課金が馬鹿げているほどの規模のワークロードを抱える組織にとっては、オープンウェイトは経済性だけで勝っており、Indexポイント12点は支払う価値のある代償です。

選ぶのをやめたいなら

この決定には、コミットを必要としないバージョンもあります。DeepSeek V4 ProはOrcaRouter上でDeepSeekの定価で提供されています。パススルーモデルを採用しているため、DeepSeekの料金改定は——ピーク・オフピークのスケジュールも含めて——リセラーが再交渉した後ではなく、当日中に当社側へ反映されます。GPT-6 Solは本稿執筆時点で当社のカタログにはありません。OpenAI自身のAPIを通じて利用できるため、両方をカバーするルートとなると、DeepSeek V4 Pro用の1つのキーと、OpenAIへの直接統合が必要になります。

その分割には、明確な理由があって価値がある。この2つのモデルは失敗の仕方が異なる。オープンウェイトのデプロイは自分のハードウェアが故障したときに失敗し、APIはベンダーが故障したときに失敗する。プロバイダー間の自動フェイルオーバーは、それらを性能が低下した午後へと変え、停止ではなく、そして、コードパスではなく設定を編集するだけで、安価で高スループットのモデルと高価で慎重なモデルの間でルートを移せることは、価格曲線に賭けるのではなく、それに追随できるようにしてくれる。

A screenshot of the Artificial Analysis page for GPT-6 Sol (max), showing an Intelligence rank of 18th of 212 models, a Cost rank of 49th and a Verbosity rank of 43rd, input pricing of $2.00 and output of $10.00 per 1M tokens with a 90% cache discount, a cost per Intelligence Index task of $1.06, an 872k-token context window, 77M tokens generated during the index run, and a total of $1,550.08 spent evaluating the model on the Intelligence Index.

誰がどれを選ぶべきか

インフラ、コンプライアンス境界、またはボリューム問題があるなら、DeepSeek V4 Proを選べ。MITライセンスで、独立系インデックスでは114中8位、384Kの出力枠を備え、料金表にはコンテキストの崖がない。大規模運用時のコスト、またはデプロイの制御が縛り条件となる人にとって、これが正解であり、GPT-6 Solとの12ポイント差はその代償だ。

最先端が必要で、コンテキストが272Kトークン未満に収まるなら、GPT-6 Solを選べ。48対36でスコアを上回り、トークン生成は約50%高速で、$2/$10という価格は、OpenAIがこれまで自社のトップモデルに設定した中で最安だ。ただし、何を買うのかは理解しておこう。最初のトークンまで100秒待つこと、レートが2倍になる長コンテキストの料金ティア、そして独立した評価が、きれいな一段の進歩ではなく、改善と後退が混在したものになっているモデルだ。

そして、答えが「リクエスト次第で両方」だとしても、それは優柔不断ではない。2社のベンダーが6週間の間にそれぞれのフラッグシップ価格を半額にし、しかもどちらも動きを止めていない——そんな市場にとって、それは正しいアーキテクチャなのだ。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the Tools, JSON and Reasoning badges, a 1M-token context with 384K maximum output and text-only input, a 3.56s p50 time to first token, and the description of DeepSeek V4 Pro as a flagship MoE with 1.6T total / 49B active parameters built for top-tier reasoning and agentic tool use.

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新