ヒーローのタイトルカードには「GPT-6 vs DeepSeek V4 Pro」と表示され、チップには「GPT-6 in ChatGPT for everyone 2026-10-07」、2行の価格表記には「GPT-6 Sol $2 / $10」と「DeepSeek V4 Pro $0.66 / $1.98 peak」、チップには「DeepSeek: MIT weights, 384K max output」、フッターには「Vendor-reported items labelled in text; index figures per Artificial Analysis.」と表示されている。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

GPT-6 対 DeepSeek V4 Pro:誰からでも借りられるものと、家に持ち帰れるもの

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4 ProでできるのにGPT-6 Solではできないことは、ただ一つだけある。それは家に持ち帰ることだ。DeepSeek V4 ProはMITライセンスのMixture-of-Experts(専門家混合)方式の旗艦モデルで、総パラメータ数は1.6兆、トークンあたり490億がアクティブ。2026年8月13日にリリースされ、チェックポイントはダウンロードできる。GPT-6 Solはクローズドウェイトで、Ope​nAIが2026年9月22日に提供を開始した。そして2026年10月7日時点では、週間12億人以上へのChatGPTのグローバル展開において、有料プラン群を支えるモデルでもある。

この比較におけるその他の点はすべて、どの物差しを読むかという問題だ。料金表では、両者は4倍離れている。独立系スイートで最終回答を生成するのに実際にかかったコストで見ると、両者は1.55倍の差がある。Intelligence Indexでは、その行は16ポイント離れて見えるが、評価者自身が文書化した方法論によれば、まったく減算できない。これら3つの数字のうち、どれが意思決定を導くべきかを見極めることが仕事のすべてであり、その答えは、ベンダーを選んでいるのかファイルを選んでいるのかによって異なる。

各モデルとは何か、それぞれ1段落で

GPT-6 Solは、OpenAIのGPT-6ラインナップにおける中間ティアです — GPT-6 Astraフラッグシップの下、低価格版GPT-6 Lunaの上に位置し — 1,050,000トークンのコンテキストウィンドウ、128,000トークンの出力上限、テキスト、画像、ファイル入力、ネイティブのツール呼び出し、構造化出力、そしてlowからmaxまでの5段階で選択可能な推論エフォートを備えています。これはOpenAIがChatGPT Plus、Pro、Business、Enterpriseをルーティングするティアであり、価格は入力100万トークンあたり$2.00、出力100万トークンあたり$10.00で、プロンプトが272,000入力トークンを超えるとリクエスト全体が$4.00と$15.00に再価格設定されるロングコンテキストティアがあります。

DeepSeek V4 Proはテキスト専用のフラッグシップで、1,048,576トークンのウィンドウと最大384,000トークンの出力を備え、これはGPT-6 Solの上限の3倍であり、どの価格でもビジョン機能はありません。DeepSeek自身のAPIドキュメントによると、ピーク時間帯は入力100万トークンあたり$0.66、出力100万トークンあたり$1.98で、オフピーク時には半額の$0.33と$0.99になり、キャッシュヒットはオフピーク時$0.022です。ピーク時間帯は平日のUTC 01:00~04:00および06:00~10:00です。それ以外はすべて、週末や中国の祝日を含め、オフピークです。

3つのメートル

最も引用されるものから始めよう。なぜなら、それは文脈を欠いたまま最も頻繁に引用されるものだからだ。Artificial AnalysisはIntelligence Index v4.3.2でDeepSeek V4 Proを36.0、GPT-6 Solを47.6と評価している。11.5ポイントは、比較に終止符を打つ類の差だ。

そうすべきではないし、評価者自身もそう言っている。Artificial Analysisは、オープンウェイトモデルを同じサイズクラスの他のオープンウェイトモデルとのみ比較し、その境界は1500億パラメータに置き、プロプライエタリモデルは入力対出力のブレンド比率3:1で価格帯を横断して比較している。これらは2つの異なるピアグループであり、2つの異なる尺度を生み出している。同じ表の隣り合う行に36と47.6が並んでいても、それは直接対決ではなく、一方から他方を引いてそれを能力と呼ぶのではなく、そう言うのが誠実な対応だ。

A screenshot of the Artificial Analysis leaderboard showing the rows around DeepSeek V4 Pro, with MiMo-V2.6-Flash at 38 and $0.06 per index task, Claude Haiku 5.5 (high) at 38 and $0.08, and DeepSeek V4 Pro 0813 (max) at 36 and $0.67, each row carrying its creator, index, cost per task, output speed and latency columns.

比較可能な2つのメーターは、より有益なことを示している:

• 3:1のブレンド価格 — GPT-6 Sol は100万トークンあたり$4.00、DeepSeek V4 Pro はピーク料金で$0.99、オフピークなら$0.50。実行する時間帯によって4倍から8倍の差
• 完了したインデックスタスクあたりのコスト — GPT-6 Sol $1.04 対 DeepSeek V4 Pro $0.67、1.55倍の差
• スイート全体で生成された出力トークン — GPT-6 Sol 7680万 対 DeepSeek V4 Pro 1億6290万。つまり、安価なモデルは同じ作業を終えるために2.1倍多く書き込む
• 最大出力 — DeepSeek V4 Pro 384,000トークン 対 GPT-6 Sol 128,000、3倍の上限
• マルチモーダル入力 — GPT-6 Sol はテキスト、画像、ファイルを受け付けるのに対し、DeepSeek V4 Pro はテキストのみ
• 重み — DeepSeek V4 Pro はMITライセンスでダウンロード可能、GPT-6 Sol は非公開

A two-column comparison scoreboard for GPT-6 Sol and DeepSeek V4 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against DeepSeek V4 Pro at 36.0, $0.67 and 384,000 tokens, with input and output prices of $2.00/$10.00 against $0.66/$1.98 and an MIT-weights row. A footer reads "Index figures per Artificial Analysis v4.3.2; row scored in different peer groups, not subtractable."

4行目と5行目は2行目を説明している。見出しでは4倍の開きが実作業では1.55倍に縮まるというのは、安価なモデルが同時により冗長なモデルでもあるときに起こることだ。DeepSeek V4 Proは、同じ評価セット全体でGPT-6 Solの2.1倍の出力トークンを生成した。冗長性は価格ページには決して現れないコスト乗数であり、この対決で最も見落とされている数字である。

オープンモデルが真に勝る場面

2か所、しかもどちらも周辺的というより構造的だ。

出力上限が第一だ。384,000 トークン対 128,000 トークンは 3 倍の差であり、これは作業のカテゴリ全体を左右する。1 回の呼び出しで大規模な構造化成果物を生成すること、連結せずに長い文書を書くこと、大きなリファクタリングを単一の応答として生成することだ。GPT-6 Sol は、どんな価格でもそれらはできない。なぜなら、その制限は課金階層ではなく、モデルの最大値だからだ。

エージェント型ツール使用は、ある特定の測定では2番目だ。DeepSeek V4 Proは、エージェント型ツール使用の評価であるτ²-Benchで96.2%を記録しており、それこそがDeepSeekが自社のカードの先頭に掲げている数値だ。それはまた、このモデルのOrcaRouterカタログ項目が繰り返している数値でもあり、私たち自身の読者が目にする主張のバージョンでもある。GPT-6 Solの比較可能なτ²-Benchの数値は同じボードには公表されていないので、この比較は方向性を示すものとして扱ってほしい。DeepSeekが看板として選んだその唯一のベンチマークでは、オープンモデルがこの分野のトップにあり、クローズドモデルは同じ列に数値を置いていない。

そして所有権の話だが、これはベンチマークですらない。ダウンロード可能な MIT チェックポイントがあれば、モデルを自分のハードウェアで実行でき、リクエストを誰のネットワークにも送らずに済み、微調整もでき、バージョンを固定して、3年後もまだそこにあると分かる。どのベンダーもそれを非推奨にしたり、価格を変更したり、料金表から外したりできない。ある種の購入者——規制産業、データレジデンシー制約のある人、モデルの廃止で痛い目に遭った人——にとって、それはインデックスの11ポイント分よりも価値がある。

GPT-6 Solが優位に立つ場面——それは単なる指標にとどまらない

Terminal-Bench 4.0は、DeepSeek V4 Proの成績表で最も見栄えのしない項目だ。14.1%対GPT-6 Solの43.9%。これは誤差の違いではなく、実際のプロファイルを示している。このオープンモデルはマルチターンのツールオーケストレーションは得意だが、現代のコーディングエージェントを成り立たせている長期的なターミナル作業は苦手だ。もしあなたのワークロードが、シェルセッションを20分間維持しなければならないエージェントなら、この単一の評価は、総合インデックスよりもあなたの体験をより正確に予測する。

マルチモーダル対応は2つ目の理由です。DeepSeek V4 Proはテキスト入力・テキスト出力です。GPT-6 Solは画像とファイルを受け取り、それは単なる機能のチェック項目ではありません。文書の多いプロフェッショナルな業務では、スクリーンショット、スキャンしたページ、図表、PDFが当たり前であり、テキスト専用モデルはそもそもそのカテゴリーに足を踏み入れられません。

3つ目は今週起きたことだ。GPT-6は10月7日、ChatGPTのチャットタブでPlus、Pro、Business、Enterprise向けに登場し、FreeとGoが10月8日から続いた。Ope​nAIがIntelligent UIと呼ぶ機能を備えている——質問ごとにテキスト、グラフィック、チャート、フォーム、タップ可能なコントロールを組み合わせた回答を生成し、散文にデフォルトするのではなく、というものだ。それはサーフェスであり、APIの機能ではない。そしてあなたの統合コードを一行も変えるものではない。変わるのは周囲のデフォルトだ。あなたのチームがすでにブラウザタブで開いているモデルは今やGPT-6であり、プロトタイプ作業はキーなしで到達できるモデルへと流れていく。ベンダー報告であり未再現だが、Ope​nAIはさらに、Extra HighのGPT-6がMediumのGPT-5.6と同じ速さで回答を開始し、GPT-6 Instantは検索に基づく質問で44%早く回答を開始すると主張している。

片方を実行するか、両方を実行するか

この組み合わせが他のほとんどの組み合わせよりヘッジしやすいのは、両方のモデルが同じカタログ上にあるからです。OrcaRouter は GPT-6 Sol と DeepSeek V4 Pro を — ほか200以上のモデルとともに — 単一のキーで OpenAI 互換の1つのエンドポイントを通じ、プロバイダーの定価に対して0%のマークアップでルーティングします。このパススルーがあるからこそ、ピーク/オフピークの仕組みは謎めいたものではなく読み取れるものになります。DeepSeek のオフピーク時の半額はベンダー側のものであり、当社はそれに一切手を加えていません。ベンダーが価格を改定すれば、その変更は当日中にここへ反映されます。

ここはまた、ピーク時間帯の判断がルーティングの判断に変わる場面でもあります。DeepSeek V4 Proのオフピーク料金はピーク料金の半額で、ピーク時間帯はUTCの固定された時間です。移動できるバッチジョブはそれを避けてスケジュールする価値があり、レイテンシに敏感な経路はそれを外しておく価値があります。両方のモデルを1つのキーの背後に置けば、この振り分けは2つ目のベンダー契約ではなく設定次第になります。大量処理や長い出力を伴う作業はオフピークのDeepSeek V4 Proへルーティングし、マルチモーダルおよび推論負荷の高いトラフィックはGPT-6 Solへルーティングし、どちらか一方でレート制限が発生しても本番環境で気づくのではなく、自動フェイルオーバーに任せましょう。

A screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 release date, a 1.05M-token context window, a 128K-token maximum output, text, image and file input and tool calling, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

私が実際にやるなら

画像やファイル、あるいはフロンティア推論スコアが必要で、APIを購入するのであれば、答えはGPT-6 Solであり、11のインデックスポイントはほとんど的外れだ——マルチモーダルという関門が、ベンチマークが票を投じる前に決着をつける。384,000トークンの出力、保持できるライセンス、オンプレミス展開、あるいは盤上で最も低い完成タスクあたりのコストが必要なら、DeepSeek V4 Proが勝ち、インデックスの差は他人のピアグループの問題だ。

私が決してしないのは、36 対 47.6 を能力ギャップと読み取って、それに乗じて買うことだ。比較できる指標 —— タスクあたり $0.67 対 $1.04、そして 4× という見出しの開きの内側に潜む 2.1× の冗長性の差 —— は、インデックスの行よりもずっと実態に即した話を語っており、そして請求書に現れるのはそちらの方なのだ。

次に注目すべきは、DeepSeekがV4 Proの刷新でTerminal-Benchの差を埋めるかどうかだ。というのも、オープンモデルが単に別の採点をされているのではなく、本当に後れを取っているように見える唯一の測定項目がこれだからだ。GPT-6のほうは、もはや選択肢ではなくなり、デフォルトになった。そしてデフォルトは、ベンチマークがそうではないと言っていても、異を唱えるのが難しい。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新