
OpenAI o3 vs DeepSeek V4 Pro:プレミアム推論の時代が終わり、価格差が開く
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
OpenAI o3とDeepSeek V4 Proの対決は、実に2つの数字が衝突するようなものだ。2025年4月16日にリリースされたOpenAI o3は、プレミアム推論の基準点だった。誤った回答のコストがトークンのコストよりも高い場合に、割増料金を払ってでも使うモデルだ。DeepSeek V4 Proは、2026年8月13日にビルド0813としてGA(一般提供)を開始した。静かな夜のリリースと、撤回された発表と再アップロードされた重みを含む展開を経て登場したこのモデルは、そのプレミアムをカテゴリーミスのように見せた。つまり、o3の指標を上回る独立した指標を持ち、価格はおよそ5分の1で、さらにオープンウェイトを備えている。そして、この衝突にはタイムスタンプが刻まれている。なぜなら、OpenAI o3は2026年8月26日にChatGPTでの提供を終了し、APIスナップショットも12月11日に終了するからだ。比較のどの週をとっても、どこにも消え去らないモデルに軍配が上がる。
哲学的に1年違いで発売された2つのモデル
o3は純粋な推論に特化した旗艦モデルである。回答する前に長い時間考えるよう訓練されたクローズドモデルで、200Kのコンテキストウィンドウ、最大100Kの出力を備え、画像入力は思考の連鎖に組み込まれている。OpenAI自身の公表数値によれば、2025年の基準を打ち立てた。AIME 2024で96.7%、GPQA Diamondで87.7%、スキャフォールディングなしのSWE-bench Verifiedで69.1%、Codeforces Elo 2727という成績である。そしてOpenAIはその後、価格を100万トークンあたり$10/$40から$2/$8へと引き下げ、その価格は今も維持されている。 DeepSeek V4 Proは、経済性がまったく異なる。1.6兆パラメータのMixture-of-Experts(MoE)モデルで、トークンあたり約490億のパラメータがアクティブになり、100万トークンのコンテキストウィンドウ、最大384Kの出力、テキストのみの入力を持つ。また、0813 GAビルドで新たに加わった再構築済みのポストトレーニングスタックと、Responses-API・Codexのネイティブ統合により、DeepSWEでのエージェントスコアはプレビュー版の12.8から62.7へと跳ね上がった。さらに、オープンウェイトでもある。DeepSeek-V4-Pro-0813チェックポイントは、MITライセンスの下でHugging Faceからダウンロード可能だ。ただし、最初の24時間は混乱した。リリースバナーが削除され、ウェイトが一時的に404エラーとなり、その後、修正された設定で再掲載されるという経緯があった。
実数で見るコスト格差
レートカードは、ほとんどの説得をそれだけで済ませてくれる:
• OpenAI o3 — 入力100万トークンあたり2.00ドル、出力100万トークンあたり8.00ドル、キャッシュ済み入力は100万トークンあたり0.50ドル。推論トークンは出力として課金されるため、難しい質問は回答前に思考トークンを消費します。
• DeepSeek V4 Pro — 入力(キャッシュミス)は100万トークンあたり$0.435、キャッシュヒットは$0.003625、出力は本日100万トークンあたり$0.87。出力はo3の約4.6分の1のコストで、キャッシュヒット時の入力は事実上無料です。
• 日付付きの注意点——DeepSeekが8月17日に実施予定の値上げにより、V4 Proの出力はピーク時間帯に100万トークンあたり6元から27元(オフピーク時は13.5元)、キャッシュミス入力は3元から9元へ引き上げられる。新しいピーク時料金でも、出力価格はo3の8ドルのごく一部に過ぎない。現在の料金を前提に構築できる猶予は数日単位でしかなく、それ自体が移行の計算要素の一部となっている。
正解あたりの経済性は、その点をより際立たせる。o3の非表示の推論トークンは、難しい問題1問あたりの実質コストが出力レートの数倍になることを意味する。DeepSeek V4 Proも推論を行い、その思考も出力として課金されるが、$0.87という絶対的な支出は、1分半も思考するo3セッションと比べれば誤差程度だ。DeepSeekが発表時に用いたエージェントコストの枠組み——クローズドな最前線モデルに対してタスクあたり約45倍の価格差——は、o3に限定すれば誇張だが、方向性に異論はない:ワークロードにもよるが、実効コストで4〜10倍の格差がある。
品質ギャップの実際の状況
最も重要視すべきスコアは、独立したスコアだ。Artificial AnalysisのIntelligence Indexでは、DeepSeek V4 Proは53を記録し、同インデックスが現在リストアップする104モデル中2位となっている。一方、o3はおよそ30で、同じハーネス上で20ポイント以上の差がある。これは、2年間の進歩がプレミアム推論フラッグシップをどこに置き去りにしたかを最も簡潔に要約している。すなわち、もはや価格で単に下回られるだけではなく、独立した総合指標でも敗北しているのだ。
ベンチマークごとの状況はさらに複雑で、正直な評価が必要だ。DeepSeek V4 Proの目玉となるエージェント数値(Terminal-Bench 2.1で87.9、CyberGymで83.3、DeepSWEで62.7、そしてクローズドなフロンティアモデルを上回るAutomationBench)は、DeepSeek自身が0813のローンチで発表した主張であり、本稿執筆時点では独立に再現されていない。さらに、ロールアウト時の設定ミスという一件により、初期に第三者が収集した数値の時点でAPIが最終修正版の重みを提供していたかどうかは、誰にも確信が持てない。o3のローンチ時ベンチマークも同様にベンダー報告だが、2025年の独立した再テストにより部分的に検証されており、その当時は実際に推論チャートをリードしていた。数学と純粋な推論に関しては、o3の公表実績は依然としてDeepSeek V4 Proのものより優れているように見える。DeepSeekの強みはエージェント型のツール使用、コーディング、長期的なタスクにあり、これはo3が圧倒した数学オリンピアードとは異なるテストスイートなのだ。

o3がまだ優れている点
比較を経てもそのまま残るものが2つある。第一に、数学と丁寧な推論だ。{{1}}o3のAIME 96.7%とGPQA 87.7%は、DeepSeek V4 Proが公表しているあらゆる数値より高い{{/1}}。そして、あなたのタスクが難しい証明や競技問題なら、o3は——まだ動作している間は——より安全な答えだ。第二に、画像推論だ。o3は思考の連鎖の中でスクリーンショットや図について考えることができる。そして{{2}}DeepSeek V4 Proはテキストのみ対応で、0813ビルドではビジョンエンコーダーは追加されなかった{{/2}}。タスクがモデルに画像の読み取りを必要とする場合、DeepSeek V4 Proはその点でo3の代わりにはならない。どちらの利点も、退役が近いモデルに留まる理由にはならない。しかし、両方とも、移行が純粋なアップグレードではないと正直に認める理由となる。
もう一つ注目すべき点は、オープンウェイトの違いであり、これはまったくベンチマークではありません。o3はクローズドであり、今まさに統合されて消えつつあります。自分のハードウェアで稼働し続けることはできません。DeepSeek V4 Proの0813チェックポイントは、恒久的にあなたのものです。MITライセンスで、同じ重み、同じ1.6兆パラメータのモデルであり、約1.5テラバイトのハードウェアがあればセルフホストできます。クローズドモデルに依存して、ベンダーが廃止するという痛手を負ったチームにとって、これはo3の廃止がもたらすまさにその問題に対する構造的な答えです。
ワークロードの移行
o3から移行するAPIチームにとって、DeepSeek V4 Proは最も低コストで着地できる選択肢であり、実際のAPI利用の大半を占めるエージェント型やコーディングの作業では、ダウングレードと感じることはほとんどありません。本当の注意点は品質ではなく運用面にあります。V4 Proは公式APIで同時リクエスト数が500件に制限されており、エージェントの集団を運用しているとこの上限に達します。さらに、価格は8月17日に変更されます。これらはいずれも、まさにルーティングレイヤーが解決するべき問題です。
OrcaRouterでは、DeepSeek V4 Proはプロバイダーのリスト価格を0%マークアップでそのまま適用して提供されます。つまり、本日の$0.44/$0.87はDeepSeekで有効になった当日にこちらでも有効になり、8月17日のピーク/オフピークスケジュールが導入された場合も、その価格は同日にこちらへ反映されます。さらに、1つのキーでこのo3代替モデル群の残りすべてにもアクセスでき、自動フェイルオーバーは500同時接続数の上限に対する明快な解決策です。本番パスをV4 Proと同一キー上のセカンドモデルに向け、ルーターに上限を吸収させるのです。OpenAI o3自体はそのキーでは利用できず、12月11日のスナップショット提供終了まで、OpenAI自身のAPIおよび複数のサードパーティプラットフォームを通じて引き続き利用可能です。

数学が味方するのは誰か
「o3のワークロードがコーディング、エージェントループ、または長文脈処理に該当する人にとって、その計算結果は比べるまでもありません。DeepSeek V4 Proは独立した指標でo3を上回り、コストはほんの一部で済み、さらにオープンウェイトであるため、この特定の依存関係があなたの背後で突然廃止されることはありません。今のところo3を維持する正当な理由があるチームは、ごく限られたものだけです——高度な純粋数学の推論と、o3の画像思考を基盤に構築されたもの——そしてそれらでさえ、12月までに実際のワークロードで代替品をテストすべきです。なぜなら、期限はあなたの特殊なケースを考慮しないからです。o3が定義したプレミアム推論の時代は、その廃止発表とともに終わりました。DeepSeek V4 Proは、たまたま次の時代で最も安い席が用意されている場所なのです。」

この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
