GPT-6.1 Sol vs DeepSeek V4 Pro の生成ヒーローカード。見出しは「3つの指標、3つの異なる答え」、3枚の指標カードは「ブレンド価格 4x」「インデックスタスクあたりのコスト 1.07x」「インテリジェンス指数 16ポイント」、一文は「一方はプロプライエタリで画像を見ることができる。もう一方はMITライセンスのオープンウェイトでテキストのみ。」、フッターは「価格はOpenAIとDeepSeekによる。指数とタスクあたりコストの数値はArtificial Analysisによるもので、同社はオープンウェイトモデルとプロプライエタリモデルを異なるピアグループで比較している。」、右下隅にOrcaRouterのロゴ。
Guides & Insights

GPT-6.1 Sol vs DeepSeek V4 Pro:3つの指標、3つの異なる答え

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

どれだけ隔たっているかを尋ねるGPT-6.1 SolとDeepSeek V4 Pro正直な答えは、どのメーターを読むかによる。そして、その3つのメーターは、ほとんどのモデル比較がすべてについて意見を異にするよりも大きく食い違っている。100万トークンあたりの価格を、入力対出力3:1の比率でブレンドすると、$4.00 対 $0.99 — 4倍だ。同じ評価スイートを実行するのに実際にかかったコストでは、タスクあたり $0.72 対 $0.67 — 7パーセントだ。Artificial Analysis Intelligence Index では 51.8 対 36 — 16ポイントで、決定的に聞こえるが、それぞれの数値が何と比較されたのかを見るまではそうではない。なぜなら、その評価者自身の方法論が、この2つのモデルを異なるリーグに置いているからだ。GPT-6.1 Sol は2026年9月29日にリリースされ、入力 $2.00、出力 $10.00、1,050,000トークンのウィンドウを備えている。DeepSeek V4 Pro は MIT ライセンスの mixture-of-experts 旗艦モデルで、1.6兆パラメータ、うち490億が有効。2026年8月13日にリリースされ、入力 $0.66、出力 $1.98、1,048,576トークンのウィンドウを備えている。片方はダウンロードできるテキストモデルだ。もう片方は画像を認識する。この3つのメーターのうち、実際にどれを指針にすべきかを見極めることが、すべてだ。

インデックス行は、見た目に思えるような比較ではありません

最もよく引用される数字から始めよう。なぜなら、それは最も頻繁に誤って引用される数字だからだ。

Artificial Analysisはリーダーボードと併せて手法を公開しており、その中でここでは2つの文が重要になる。オープンウェイトモデルは、同じサイズクラス(tiny、small、medium、large、境界は1500億パラメータ)の他のオープンウェイトモデルとのみ比較される、と述べている。プロプライエタリモデルは代わりに価格帯をまたいで、入力対出力を3:1で混合した比率で比較される。これらは2つの異なるピアグループである。DeepSeek V4 Pro 0813はオープンウェイトだ。評価者自身のFAQがそう述べており、公開された重みを示している。そして総パラメータ1.6兆で、オープンウェイトのlargeクラスに位置する。GPT-6.1 Solはプロプライエタリで、自身の価格帯にあるモデルに対して採点される。

同じ表の隣り合う行に51.8と36が並んでいても、それは直接対決ではない。一方はある比較対象群に対するスコアであり、もう一方は別の比較対象群に対するスコアであって、まさにそれが、タスクごとのコスト数値は比較可能で、生のインデックス数値は比較できない理由である。DeepSeek V4 Proがダウンロード可能なモデルとして優れているかどうかを知りたいなら、36がそれに答える数値だ。ホスト型の最先端モデルに対してどうなのかを知りたいなら、インデックスの列は教えてくれない。そしてこれは、51.8から36を引いてそれを差と呼ぶよりも、そう正直に言うべき場面である。

クリーンに比較できるもの:料金表、コンテキストと出力の上限、モダリティの一覧、そして同じ評価スイートを実行するコスト——最後の数値は同一の作業の会計であって、スコアではないからだ。

生のメーターが示すもの

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• 入力価格 — GPT-6.1 Sol $2.00 対 DeepSeek V4 Pro $0.66(100万トークンあたり)

• 出力価格 — GPT-6.1 Sol $10.00 対 DeepSeek V4 Pro $1.98、平日の2つの4時間UTCウィンドウ内で$1.32と$3.96へ段階的に変化

• キャッシュ読み取り — GPT-6.1 Sol $0.10 対 DeepSeek V4 Pro $0.022(100万トークンあたり);どちらもキャッシュに対応し、安い側はさらに4.5倍安い

• インデックスタスクあたりのコスト — GPT-6.1 Sol $0.72 対 DeepSeek V4 Pro $0.67

• インデックススイートで出力されたトークン数 — GPT-6.1 Sol 67M 対 DeepSeek V4 Pro 160M

• 最大出力 — DeepSeek V4 Pro 384,000トークン vs GPT-6.1 Sol 128,000トークン

• モダリティ — GPT-6.1 Sol はテキスト、画像、ファイルに対応。DeepSeek V4 Pro はテキストのみに対応

4行目と5行目が興味深いペアだ。DeepSeek V4 Pro は同じスイートで2.4倍のトークンを出力しながら、タスクあたりではなお7%安く完了する。その出力レートが GPT-6.1 Sol の5分の1だからだ。これが、レートではなく出力で測ったときの価格主導型モデルの姿である。冗長さは確かに存在するが、それによって優位性が消えるわけではない。タイミングの時間帯が唯一の但し書きだ。平日の4時間のブロックが2つ——週168時間のうち40時間——により、表示レートは2倍の $1.32 と $3.96 になり、その追加料金は、そうでなければどちらのカードでも最も安くなるはずの同じトークンに適用される。

より安価なモデルが行わないこと

三つのこと、そしてそれぞれはトレードオフではなく厳格な限界だ。

視覚は備わっていません。DeepSeek V4 Proはテキスト入力・テキスト出力です。スクリーンショットなし、スキャンしたPDFなし、チャートの読み取りなし、チケット内の図の理解なし。コンピュータ操作やドキュメント中心のワークフロー — GPT-6.1 Solが想定しているまさにそのワークロード — は、どんな価格でも選択肢になりません。あなたのパイプラインがすでに画像をビジョンモデルにルーティングしているなら、これは問題ありません。そうでなければ、これが決定的な制約となります。

予測して計画を立てられるようなリリースケイデンスはない。「deepseek-v4-pro」という名前は8月以降、0813ビルドを指すようになっており、そこに至る経緯は穏やかなものではなかった。ベンダーは9月14日付でのこのビルドの廃止を告知し、その期日の2日前に告知を撤回し、課金を変えずにAPIを提供し続けた。当社のカタログでも今なお、同じコンテキスト、出力上限、同時実行数上限を備えたフラッグシップとして掲載されている。2日で非推奨の告知を撤回できるベンダーは、撤回しないことも選べる。運用上の教訓は、モデルが不安定だということではなく、名前はあくまでポインタにすぎないということだ。そして、動作をルート名ではなくビルド識別子に固定することが、安価な保険になる。

それは周辺知識を伴わない。GPT-6.1 Solは登場から8日しか経っていないが、すでに独立した構成が1件公開されている。DeepSeek V4 Proにはより長い評価履歴とはるかに大きな実務者ベースがあり、公開されたサービングスタックやサードパーティによるスループット検証も含まれている。セルフホストでのデプロイでは、そうした資料群はインデックスの行よりも価値がある。なぜなら、モデルがベンチマーク上ではなく自分のハードウェア上で奇妙な挙動を示すときに参照するのは、それだからだ。

4倍安いメーターが誤った選択となる場合

もし安価なモデルがあらゆる点で単純に劣っているなら、これは短い記事で済んだでしょう。厄介な事実は、両者は同一の作業でタスクあたり7%しか違わず、そこに至るまでに書き出す量では2.4倍違うということです。つまり、4×と言うブレンドトークン・メーターは、あなたがほとんど支払わない差を測っているのです。なぜなら、あなたが送ることはないかもしれないトークン構成に価格を付けているからです。そして、16ポイントと言うインデックス・メーターは、2つのピアグループをまたいで測っており、引き算することはできません。

つまり、実用的な使い分けは「難しい作業にはフロンティアモデル、簡単な作業には安価なモデル」ではない。モダリティによる使い分けであり、量による使い分けだ。画像が含まれるものはすべて GPT-6.1 Sol に回す。答えが短く、推論こそがコストの大部分を占めるものも同様だ。5段階のエフォートレベル(low から max まで、デフォルトは medium)を使えば、文章を買わずに推論だけを買うことができ、$0.10 のキャッシュ済み入力のおかげで長い繰り返しプロンプトも安く済む。テキストのみで、大量処理が前提で、長めの回答を許容できるもの——分類、抽出、要約、384,000トークンの出力予算に対する一括生成——は DeepSeek V4 Pro に回す。できれば2つの UTC 時間帯の外で。

両方とも1つのキーにあり、分割は設定の1行です

両モデルは OrcaRouter 上で各プロバイダー自身が公表している料金のまま提供され、一切上乗せはありません。GPT-6.1 Sol は $2.00 / $10.00、272,000 プロンプトトークンを超えると $4.00 / $15.00 に上がり、DeepSeek V4 Pro は $0.66 / $1.98 で、記載されている 2 つの時間制ウィンドウがそのまま適用されます。キーは 1 つ、請求は 1 つ、両方に 1 つの OpenAI 互換エンドポイントです。

それが、上記の分割を議論するよりも書き留めておく価値がある理由です。モダリティ分割はルーティングルールとして表現できるので、画像を含むリクエストは視覚モデルへ、大量のテキストは安価なモデルへ、アプリケーションを変更することなく送られます。ルートが劣化した場合、フェイルオーバーは呼び出しを失敗させるのではなく移動させます。そして両方が同じエンドポイント上にあるため、本当に重要な価格比較——あなたのトラフィックにおける、あなたのトークン構成での、あなた自身の比較——は、ベンチマークスイートの平均からではなく、あなた自身の請求書から作成できます。

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

一行で言えば、結論はこうだ。4倍安いという解釈こそ疑うべきもので、7パーセントという解釈こそ確認すべきものだ。4倍とは、送るとは限らないトークン構成について、ブレンドされたメーターが示す値だ。7パーセントとは、同じ評価を両方で行ったときのコストであり、そこには2.4倍の冗長性の差があらかじめ織り込まれている。16ポイントは実在するが、それは2つのピアグループにまたがってもいる。そして、このペアのほとんどの導入を実際に左右する制約は、数字ですらない。これらのモデルの一方はスクリーンショットを読めるが、もう一方は読めない。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新