DeepSeek V4 ProとQwen3.8 Maxの比較用ヒーロータイトルカード。サブタイトル:「推論スペシャリスト vs 中国のオールラウンダー」
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max:推論スペシャリスト対中国のオールラウンダー

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

わずか10日の間隔で、中国で最も注目された2つのモデルがリリースされた。AlibabaQwen3.8 Maxを2026年8月3日に公開——エージェント、オフィスワーク、マルチモーダル理解のオールラウンダーとして売り出す2.4兆パラメータのスパースMoEフラッグシップだ——そしてD​eepSeekはDeepSeek V4 Proの正式版を8月12日にリリースした。これは推論とコーディングに特化したモデルで、総パラメータ数は1.6兆、出力トークン価格はQ​wenの約7分の1だ。この2つは同じ開発者層をターゲットにしているが、フラッグシップの役割については考え方が異なる。Qwen3.8 Maxはあらゆる処理をルーティングする1つのモデルを目指し、DeepSeek V4 Proは難しい処理をエスカレーションする先となる1つのモデルを目指している。

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

重要なポイント

• Qwen3.8 Maxは、中国の汎用リーダーボード(SuperCLUE #1、7月)においてより高い生の性能を誇るモデルであり、かつ、より強力なマルチモーダル/エンタープライズ向けパッケージです — 動画入力、組み込みツール、構造化出力を、すべて1つのAPIで実現します。

• DeepSeek V4 Proは劇的に安価で(出力は約7分の1)、すでにオープンウェイトであり、現在はより高いコーディング/エージェント性能を主張しています — Terminal-Bench 2.1で87.9を記録し、Qwenのベンダー報告値86.6に対抗しています。

• コストの増大に注意:独立したテストでは、Qwen3.8 Maxはエージェント型タスク1件あたり平均約64ターン、約1.14ドルを消費しており、これはスペックシートでは隠されている実効コストの問題です。

• 正直な見出し:Qwen3.8 Maxは米国のクローズドモデル価格に匹敵する「能力戦」の旗艦であり、DeepSeek V4 Proはコストパフォーマンスによる反論である。

1つの仕様表に2つの哲学

• 総パラメータ数 — Qwen3.8 Max 2.4T(スパースMoE、アクティブ約95B)vs DeepSeek V4 Pro 1.6T(MoE、アクティブ約49B)

• コンテキスト / 最大出力 — 両方とも1Mコンテキスト。Q​wenは出力が約128〜131Kで頭打ちとなるのに対し、D​eepSeekは384K

• 入力 — Qwenはテキスト、画像、動画に対応。DeepSeek V4 Proはテキストと画像に対応し、公式ビルドでは新しいネイティブ画像推論を搭載

• オープンウェイト — DeepSeek V4 Pro: リリース済み(MIT); Qwen3.8 Max: 8月10日の週に提供予定、オープンソース化される史上初のMaxクラスのQwen

• API エクストラ — Q​wen には、組み込みツールと構造化出力が標準で搭載されています。DeepSeek V4 Pro には、思考トグル、構造化 JSON、Responses API、Codex 互換性が搭載されています。

• 価格 — Qwen3.8 Max:100万トークンあたり $2.00 / $6.00(キャッシュ時 $0.25) vs DeepSeek V4 Pro:約 $0.42 / $0.87(キャッシュ時 $0.0035)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Qwen3.8 Max が勝る点

{{1}}汎用性の軸では、Qwen3.8 Maxがリードしており、独立したデータも一致しています。{{/1}} {{2}}Artificial Analysisは、Intelligence Index 58、Coding Index 71.8、Agentic Index 58と評価しています——これは中国のラボがそのエージェンティック・リーダーボードのトップに最も近づいた記録です。{{/2}} {{3}}SuperCLUEの7月の中国語ランキングでは、Qwen3.8 Maxは71.48で第1位、DeepSeek-V4-Proは64.4で第5位となっています。{{/3}} {{4}}Alibabaの発表デモ——16日間の自律型コーディング実行、元の論文のAIME24結果を上回った論文再現——は、リリースサイクル全体で、これが真に有能な長期的エージェントであることを示す最も強力な証拠です。{{/4}}

ビルダーにとって、実用的な利点は統合という形をしている:ビデオ入力、組み込みツール呼び出し、設定不要の構造化出力、そしてD​eepSeekが対抗しようとしないエコシステム(Model Studio、Q​wenツールチェーン)だ。ワークロードがドキュメント中心、マルチモーダル、またはエンタープライズ統合のストーリーを必要とする場合、Qwen3.8 Maxは中国市場が現在デフォルトで採用しているモデルである。

DeepSeek V4 Proの強み

コーディングとコストに関しては、公式のV4 Proが反論となる。DeepSeekは、公式ビルドがTerminal-Bench 2.1で87.9(プレビュー版の72.1から上昇)、DeepSWEで62.7だったと報告している。一方、Qwenがベンダーとして報告したTerminal-Benchは86.6である。プレビュー版はすでにSWE-bench Verified 80.6、GPQA Diamond 90.1、LiveCodeBench 93.5を記録しており、これはオープンモデルの競技プログラミングスコアで第1位である。そして公式ビルドの変更点は、まさにこれらの数値が関連するエージェント的タスクと推論タスクに集中している。

次に価格です。DeepSeek V4 Proは100万トークンあたり$0.42/$0.87で、Qwen3.8 Maxの$2/$6に比べて、入力が約4.8倍、出力が約6.9倍安価です。またDeepSeekは8月6日に値上げが予定されていることを示唆しており、今日の料金は約束ではなく一時的な窓口に過ぎません。詳細は後述します。

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

実際のエージェント的タスクについて計算してみる

自律型エージェントの実行では、{{1}}Qwen{{/1}}の表示価格は実際の価格ではなくなります。Artificial Analysisのエージェントタスクでは、{{2}}Qwen3.8 Max{{/2}}はタスクあたり平均約64ターン、コストはタスクあたり約1.14ドルで、前世代の約0.53ドルと比較すると、このモデルは冗長でプランニングを多用することがわかります。同じタスク構成を出力100万トークンあたり0.87ドルの{{3}}DeepSeek V4 Pro{{/3}}で実行すれば、タスクあたりのコストはおよそ一桁低くなります。あなたのプロダクトが1ユーザーにつき1日100回モデルを呼び出すループなら、その差がそのままマージンになります。

双方の信頼性に関する注意事項

情報源の正直さは、ここでは諸刃の剣である。独立したテストでは、Qwen3.8 Maxの幻覚率が23%から40%に上昇し、AA-Omniscienceのスコアが10ポイント低下したことが指摘された。つまり、このモデルは同じリリースでより高性能になった一方、信頼性は低下したのである。D​eepSeekのプレビューでは、AA-Omniscienceにおいて文書化された94%の常時回答率が示されており、これは知っているかどうかにかかわらず回答を生成する傾向があることを意味する。これらのフラグはどちらも本番運用にとって重要であり、これらのモデルが対象とするワークロードにとって、どちらも失格となるものではない。

オープンウェイトのタイミングが価格計算を変える理由

Qwen3.8 Maxのオープンウェイト公開は、{{1}}それが実現したとき{{/1}}、この対決の経済性を1週間以内に変えるだろう — {{2}}セルフホスティング利用者は2.4Tのフラッグシップを手に入れ{{/2}}、{{3}}API価格への圧力は本物になる{{/3}}。これはまさに、{{4}}パススルー価格モデルが誠実さを保つシナリオ{{/4}}である。OrcaRouterはプロバイダーのリスト価格を{{5}}マークアップなしで{{/5}}そのまま通すため、AlibabaやDeepSeekが価格を動かした瞬間 — {{6}}上がっても下がっても{{/6}} — {{7}}その変更は同日にワンキーで反映され{{/7}}、{{8}}再交渉も追加の契約書を読む必要もない{{/8}}。Qwen3.8 MaxとDeepSeek V4 Proのどちらにルーティングするかは{{9}}現在の評価が優先するまま{{/9}}、{{10}}価格はベンダーが実際に請求する金額のまま{{/10}}である。

APIビルダー選定にはどれを選びますか?

ジョブが全体的な対応を必要とする場合、つまりマルチモーダル入力、構造化出力、組み込みツール、現在のランキングで最上位の中国語品質が求められ、かつコストモデルが冗長なエージェント実行を許容できる場合は、Qwen3.8 Maxを選択してください。タスクが推論またはコーディング中心の場合、トークン量が多い場合、コンプライアンスやセルフホスティングの観点でオープンウェイトが重要になる場合、または予算が制約条件となる場合は、DeepSeek V4 Proを選択してください。この対決の最も明確な読み方は、両社自身が示しているものです。Qwen3.8 Maxはあらゆる評価の基準となるフラッグシップであり、DeepSeek V4 Proはベンチマークを高価に見せる存在なのです。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube