タイトルカードには「Grok 4.7 vs DeepSeek V4 Pro」、サブ見出しには「一方は新しい。もう一方は、あなたの足元で差し替えられている」、さらに3枚のカード:AA Index v4.3.2 46 vs 36、100万トークンあたりのオフピーク価格 $2/$6 vs $0.66/$1.98、コンテキスト 500k vs 1M。
Guides & Insights

Grok 4.7 対 DeepSeek V4 Pro:一方は新登場、もう一方はあなたの知らぬ間にすり替えられている

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月10日に公開された注記は、この比較の論点を変える。「当社はV4-Proを段階的に廃止する」とあり、2026年9月14日04:00 UTC以降、deepseek-v4-proモデル文字列へのすべてのリクエストは、V4.1-Flashの料金でDeepSeek-V4.1-Flashにルーティングされる——投稿によれば、この状況は「V4.1-Proがローンチするまで」続くという。モデル文字列は依然として応答する。その背後にあるモデルは、あなたがベンチマークしたものではない。そのため、ベンダーが2026年9月21日、つまりこれが書かれる前日にリリースしたGrok 4.7との直接対決は、片側に有効期限がある比較になる。存在する数値で見れば、Grok 4.7がより強力なモデルであり、DeepSeek V4 Proがより安価なほうだ。統合を実際に決める問いにおいては、そのうち片方だけが、依然として名乗っているとおりのものである。

スコアの前に、各モデルとは何か

DeepSeek V4 Proは、4月24日のプレビューを経て、2026年8月13日にDeepSeek-V4-Pro-0813チェックポイントとして一般提供に到達した。MITライセンスの下でのオープンウェイトであり、このライセンスは商用利用、改変、再配布を、収益の閾値や地域的な除外規定なしに許可している。GAのモデルカードには総パラメータ数1.7兆、コンテキストウィンドウ100万トークン、最大出力384Kが記載されており、これは今回の比較において最大の出力上限である。テキスト専用であり、DeepSeek自身の料金ページにはv4-proではvisionがサポートされないと明記されている。これはスクリーンショットやPDFを入力する人にとっては実際の制約である。推論努力のダイヤルをlow、high、maxで公開しており、アカウントあたり500件の同時リクエストが上限で、リクエストに応じて拡張可能である。

Grok 4.7はクローズドウェイトで、登場から1日です。50万トークンのコンテキストを搭載し(DeepSeekの半分)、テキストと画像を入力でき、独自のエフォートダイヤルを動作させます。その定価は、プロンプトトークンが20万未満の場合、100万入力トークンあたり$2.00、100万出力トークンあたり$6.00で、その閾値以上では$4.00と$12.00に倍増し、キャッシュ読み取りは$0.50と$1.00です。xAIはまた、出力速度が約2倍で価格が2倍のより高速なバリアントを掲載しています。ここで確認したドキュメントでは、どちらのベンダーもGrok 4.7の最大出力数値を公表していないため、その項目は同等とみなすのではなく不明として扱ってください。

共有インデックスでは、そのギャップは一方向に偏っています

両モデルは、2026年9月19日に公開された改訂版である Artificial Analysis Intelligence Index v4.3.2 でスコアリングされている。Grok 4.7 の列は xhigh effort で測定されており、DeepSeek の列は max effort の 0813 チェックポイントである。両者を併せて読むと、総合スコアの差は、これら2つのモデルがどれほど異なる形で作られているかを過小評価している。

総合 — Grok 4.7: Artificial Analysis Intelligence Index v4.3.2 で 46。DeepSeek V4 Pro 0813: 同じリビジョンで 36。

ターミナルエージェント — Grok 4.7:Terminal-Bench 4.0 で 26。DeepSeek V4 Pro:14。自律的なソフトウェア作業に最も近い評価において、ほぼ 2 倍。

自動化 — Grok 4.7:AutomationBench-AA 66%。DeepSeek V4 Pro:57%。どちらも信頼に足る結果であり、Grokが9ポイントリードしている。

知識とハルシネーション — Grok 4.7:AA-Omniscience 32。DeepSeek V4 Pro:1。これはボード上の外れ値であり、四捨五入の誤差ではありません。この指標は、モデルが何を知っているかと、知らないときにどれだけ頻繁に答えをでっち上げるかの両方を評価します。

ロングコンテキスト — Grok 4.7:AA-LCR v1.1 77%、ウィンドウ500k。DeepSeek V4 Pro:80%、ウィンドウ1M。DeepSeekが明確に勝利した唯一の点であり、その1Mウィンドウがまさにこのために作られた軸である。

高度な推論 — Grok 4.7:HLE 43、CritPt 18。DeepSeek V4 Pro:HLE 41、CritPt 18。物理ベンチマークでは互角、HLEではGrokが2ポイント上回る。

冗長性 — Grok 4.7:インデックスの実行に2億4000万出力トークンを消費し、異常に冗長であると指摘された。DeepSeek V4 Pro:1億6300万。どちらもおしゃべりだが、Grokのほうがより饒舌だ。

OrcaRouter model page for DeepSeek V4 Pro showing the deepseek/deepseek-v4-pro identifier, a 1M-token context window, 384K maximum output, text-only input, off-peak list rates of $0.66 per 1M input and $1.98 per 1M output, and 3818.2M tokens of traffic over seven days.

価格の話は一つの数字ではなく、スケジュールなのです

DeepSeekの価格設定は、同社について最も攻撃的な点であり、同時に引用するには最も不安定な点でもある。deepseek-v4-proのリスト料率は、キャッシュミス時に入力トークン100万個あたり0.66ドル、出力トークン100万個あたり1.98ドル——オフピーク時間帯の場合。ピーク時間帯にはこれが倍の1.32ドルと3.96ドルになる。DeepSeek自身のドキュメントによれば、ピークはUTCの月曜日から金曜日の01:00~04:00および06:00~10:00で、中国の祝日を除く。それ以外はすべて、週末全体を含め、ちょうど半額のオフピークとなる。キャッシュされた入力の読み取りこそが本当の目玉で、オフピーク0.022ドル、ピーク0.044ドルと、キャッシュミスより30倍安く、これによりキャッシュがよく効いたDeepSeekワークロードは、料金表が示唆するよりも劇的に安くなる。

それに対して、Grok 4.7の$2.00と$6.00は高く見える——DeepSeekのオフピーク入力の約3倍、オフピーク出力の約3倍だ。両者の差は、知っておく価値のあるいくつかの点で縮まる。Grok 4.7の価格は時間帯に依存せず、その帯域内では一定なので、09:00 UTCの本番スパイクも日曜夜のバッチも同じコストになる。DeepSeekはそうではない。そしてプロンプトトークンが200kを超えるとGrok 4.7は倍額になり、その時点ではDeepSeekのオフピーク料金の3倍ではなく4〜6倍になる。明快に言えば、DeepSeek V4 Proはいずれの軸でもより安価なモデルであり、そして割引の大きさは、いつ実行するか、どれだけうまくキャッシュするかによって決まる

9月14日が変えたもの

これが、価格をめぐる議論を拠り所にしにくくしている部分だ。2026年9月14日から、DeepSeekは deepseek-v4-pro のリクエストを DeepSeek-V4.1-Flash にルーティングし、Flash の料金で請求する。しかもその料金はさらに低い。DeepSeek の変更ログと料金ページは、9月10日のニュース投稿とは少し異なる話をしている。料金表には依然として deepseek-v4-pro が独自の料金を持つ現行の行として掲載されており、廃止タグもない。また、変更ログの項目には、V4 Pro の API サービスは9月14日以降も課金を変更せずに継続すると書かれている。争いがないのは進む方向性だ。V4.1-Pro は開発中であることが確認されているが、日付は発表されていない。そして、9月10日にリリースされた V4.1-Flash について、DeepSeek 自身の発表は「性能、コスト、速度、総実行時間」で V4 Pro を上回ると述べている。これは、その広範さにおいて独立に再現されていないベンダーの主張である。

したがって、実務上の問いは「Grok 4.7 か DeepSeek V4 Pro か」ではなく、「Grok 4.7 か、来四半期にその文字列が解決される先の DeepSeek モデルのどれか」である。8月に V4 Pro をベンチマークし、1M ウィンドウと 384K の出力上限を前提にコンテキスト予算を組んでいたなら、11月に呼び出すモデルは、自分が測定したモデルとは限らない。そして、後継モデルのコンテキストと出力上限は、自分が想定して設計したものではない。Grok 4.7 は正反対のリスクプロファイルを備えている。生まれて一日しか経っていないモデルで、数値はベンダー報告であり、大半は再現されていない。しかし、その同一性は疑われていない。

Two-column scoreboard titled “Grok 4.7 vs DeepSeek V4 Pro - the scoreboard”: AA Index 46 vs 36, Terminal-Bench 4.0 26 vs 14, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $0.66/$1.98 off-peak, and open weights “no” vs “MIT”.

ルーターが適する場合と、適さない場合

OrcaRouterはDeepSeek V4 Proを取り扱っており、モデルページにはプロバイダー自身の料金が表示されています — 入力$0.66、出力$1.98、コンテキストウィンドウ1M、最大出力384k — 当社はプロバイダーの定価を0%のマークアップでそのまま渡しているからです。これは、料金がピーク/オフピークのスケジュールで変動し、しかも9月10日の発表で値下げを行ったベンダーにとっては、いつも以上に重要なことです。DeepSeekの価格変更は同じキーに当日そのまま反映され、価格改定のタイムラグも追加契約もありません。ベンダーが自社側でモデル文字列の経路を変更した場合、その変更は同じエンドポイントを通じて届くため、お客様側で再統合を行う必要はありません。また、自動フェイルオーバーにより、レート制限やプロバイダー側の容量イベントが停止障害に発展するのを防ぎます — スタックの片側が同時リクエスト500件に制限されている場合に役立ちます。本稿執筆時点で、Grok 4.7はOrcaRouterのカタログには含まれていません。呼び出すには、xAI自身のAPIと、それを提供しているサードパーティプラットフォームを経由する必要があります。

これが示唆する分け方は地味だが擁護できる。キャッシュヒットの価格設定と100万トークンのウィンドウが効いているワークロードにはDeepSeek V4 Proを残し、期待は8月のチェックポイントではなくV4.1-Flashに固定すべきだ。モデルが自分が知らないことを知っていなければならないタスクにはGrok 4.7を充てよ——AA-Omniscience指数1は、モデルが自信たっぷりに誤答する傾向についての強いシグナルであり、下流の利用者が捏造された回答を信じてしまえば、価格上の優位など何も残らない。

電話

Grok 4.7 はここではより優れたモデルであり、その差は特に僅差ではない。複合スコアで10ポイントのリード、Terminal-Bench スコアは2倍、自動化での優位、そして知識の正直さの差はカテゴリーの違いと言えるほど広い。DeepSeek V4 Pro はオフピーク時に約3分の1の価格で、コンテキストウィンドウは2倍であり、これは維持する現実的で擁護可能な理由だ。しかし、あなたが買っているのはベンチマークしたモデルではなく、DeepSeek がすでに参照先を切り替えると発表したモデル文字列であり、しかも時間ごとに変わる料金で、セルフホスティングを真の第三の選択肢にするライセンスと重みセットの上で、ということだ。ワークロードが長コンテキストで大容量かつキャッシュ可能なら、DeepSeek の経済性は覆しがたく、チェックポイントではなく後継モデルを前提に設計すべきだ。間違えることの代償が大きい用途なら、3倍の価格を払い、不確実性を認めるモデルを選べ。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新