記事「Grok 4.7 vs Qwen 3.8 Max — 紙の上ではコイントス」用に生成されたヒーロータイトルカード。サブタイトルは「同じ価格、インデックス1ポイント差、正反対の形」、統計チップはAAインデックス46対45、価格は両方とも$2/$6、コンテキストは500K対984K。
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max:同じ価格、1ポイント差、正反対の形

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのクローズドな旗艦モデル。どちらも入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、同じ独立系ベンチマークで1ポイント以内の差しかなく、リリースは19日違い。Grok 4.7は2026年9月21日にSpaceXAIから登場し、Qwen 3.8 Maxは2026年8月3日にベンダーからリリースされ、2026年9月2日に更新された。現在のArtificial Analysis Intelligence Index、バージョンv4.3.2では、Grok 4.7が46、Qwen 3.8 Maxが45を記録している。価格と測定された能力において、この2つのモデルは同じ買い物だ。しかしそれ以外のすべて——コンテキスト、モダリティ、提供速度、オープン性、そして各ベンダーが何を最適化しようと選んだか——において、両者はこれ以上ないほど異なっており、だからこそこの比較は飛ばさずに実行する価値があるのだ。

まずタイムラインの話ですが、Qwen 3.8 Maxには2つの日付があるからです

これは多くの報道を混乱させるので、冒頭で明確にしておく価値があります。Qwen 3.8 Max は2026年8月3日に、Alibaba の最大かつ最も高性能なモデルとしてローンチされました。Qwen 3.5 の視覚言語アーキテクチャを基に、スパースな mixture-of-experts 設計で構築されており、報告では総パラメータ数2.4兆、トークンあたり950億がアクティブとされています。2026年9月2日、Alibaba は刷新されたビルド——0902リビジョン——を出荷しました。これが現在のモデルIDを備えたバージョンであり、Artificial Analysis がそのページの日付を合わせているバージョンです。Qwen 3.8 Max について8月と9月の両方の日付を見かけたなら、理由はこれです。一方はローンチで、もう一方は今日ほとんどの人が実際に呼んでいるリビジョンです。

Grok 4.7はよりクリーンな歴史を持ち、その背後にはより混沌とした歴史がある。SpaceXAIは、度重なる延期を経て、2026年9月21日にこれをリリースした——モデルが実際に出荷されるまで、マスク氏は8月下旬、9月上旬、9月中旬のリリース時期を示していた。リリース自体は限定的だった。Grok 4.6より大きなベースモデル、数時間にわたるタスクを狙ったより長い強化学習の実行、そしてGrok 4.6が8月12日以降適用してきた$2/$6の料金表に変更はなかった。

各ベンダーが最適化した対象

2つのローンチ発表を対で読むと、それぞれの設計上の賭けはほぼ完璧に正反対だ。

SpaceXAIはエージェント実行に最適化されている。Grok 4.7のベンダー報告値は、ターミナルとリポジトリ作業に集中している。Terminal-Bench 4.0は38.0%で、Grok 4.6の20.3%に対する結果であり、CursorBench 4.0は46.3%、DeepSWE v1.1は高推論エフォートで71.0%、EEBenchは64.0%だ。同社自身のリリース説明では、Grok Bot環境内での自己検証と長文脈処理を目標として挙げている。Grok 4.7は500,000トークンのウィンドウに対応し、テキストと画像を入力として受け取り、テキストを返し、lowからxhighまでの推論エフォートを公開している。仕事を完遂するために作られたモデルである。

アリババは到達範囲の広さを最適化した。Qwen 3.8 Maxは約984,000トークン——実質100万——のコンテキストウィンドウを備え、公表されている強みは、単一分野における深さよりも広範さにある。Terminal Bench 2.1スコアは86.6、SWE-bench Proは67.7、PaperBenchは93.0、GPQA Diamondは92.6、MMMU-Proは82.3、OSWorld-Verifiedは86.1。テキスト、画像、動画の入力を受け付けてテキストを返し、推論エフォートレベルをサポートし、デフォルトはxhighで、公表されている中で弱い点はHumanity's Last Examの43.6。これは、渡されたものは何でも処理できるように作られたモデルだ。

その段落内の数値はすべてベンダーによる報告値です。どちらのセットも独立に再現されておらず、そもそも両者を直接比較することはできません — Terminal-Bench 2.1 と Terminal-Bench 4.0 は別のベンチマークなので、Qwen の 86.6 と Grok の 38.0 を並べて示しては決してなりません。

• 独立系の総合スコア — Grok 4.7はAA Intelligence Index v4.3.2で46、Qwen 3.8 Maxは同じバージョンで45。統計的には互角。

• 100万トークンあたりの価格 — 両方とも入力$2.00 / 出力$6.00。Qwenのキャッシュ割引は88%と記載されており、100万トークンあたり$1.18の実効レートになる。Grok 4.7のキャッシュ条件は同じ基準では公開されていない。

• コンテキストウィンドウ — Grok 4.7 は500,000トークン、Qwen 3.8 Max は約984,000トークン。Qwen がほぼ2倍で上回っており、これは両者間における唯一最大のスペック差である。

• 入力モダリティ — Grok 4.7はテキストと画像、Qwen 3.8 Maxはテキスト、画像、動画。

• 重み — どちらもプロプライエタリ。どちらのモデルもダウンロードできないため、この比較からは通常のオープンウェイトという論点が完全に排除される。

• パラメータ — Grok 4.7はSpaceXAIのどの仕様書にも非開示(約2.1Tという数字はマスク氏の主張)であるのに対し、Qwen 3.8 Maxは総計2.4T、アクティブ95Bと報告されているが、これもアリババは仕様書で確認していない。

• 提供速度 — Artificial Analysisによると、Qwen 3.8 Maxは毎秒38.8出力トークン、最初のトークンまで3.08秒。Grok 4.7はSpaceXAIにより、同等のモデルの約2倍の速度と位置付けられているが、これはベンダー報告であり、独立したスループット数値はまだ公表されていない。

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

コンテキストの違いこそが本当の決め手だ

価格と能力が同じなら、判断は他の違いに委ねられる。ここでは、それがコンテキストだ。ウィンドウを50万からおよそ98万4000トークンへ倍増させることは、仕様表を飾るだけの話ではない。リポジトリを分割して扱うか、丸ごと抱えられるかの違いなのだ。

Qwen 3.8 Max のより長いコンテキストウィンドウには、購入者にとって重要な、文書化された注意点があります。アリババが2026年8月10日の週に発表したオープンウェイト版はテキスト専用で、100万トークンのフルコンテキストは含まれていませんでした。これは、この比較が対象としているホスト型エンドポイントには影響しませんが、オープン版のリリースを前提に計画していたのであれば、知っておく価値があります。

Grok側にはもう一つ考慮事項があります。Grok系はこれまで、入力200,000トークンで料金の崖を適用しており、しきい値を超えるリクエストはリクエスト全体が2倍の料金で再計算されました — 入力$4、出力$12です。500,000トークンのウィンドウでは、そのしきい値はモデルの動作範囲のかなり内側に位置します。ロングコンテキストの処理をGrok 4.7にルーティングする前に、デプロイ済みモデルの現在の料金表を確認してください。大きなウィンドウと再計算の崖の相互作用こそ、ロングコンテキストの請求がおかしくなるところだからです。

それぞれで1か月の作業にかかる費用

見出し料金が同一である以上、コスト比較は料金表からではなくトークンの挙動から組み立てるほかなく、そこでは両モデルが測定可能な形で分岐する。

Artificial Analysisは、Intelligence Indexの実行中にGrok 4.7が2億4,000万の出力トークンを生成したと測定しました。これは、ボード上のモデル全体の中央値である9,200万に対するものです——Grok 4.7は冗長な推論モデルです。Qwen 3.8 Maxは同じインデックスで1億9,000万の出力トークンを生成し、評価総コストは$4,934.79、測定された速度は毎秒38.8トークンでした。どちらも冗長性の中央値を大きく上回っており、Grok 4.7の方がより冗長です。

つまり、100万出力トークンあたり同一の$6であれば、タスクごとにより多くのトークンを出力するモデルのほうが、タスクあたりのコストは高くなります。公表されている冗長性の数値は、Grok 4.7が同等のインデックス作業に対してより多くの出力トークンを消費することを示唆しており、これは価格での引き分けが、タスクあたりコストでは実質的にQwen 3.8 Maxの小さな勝利であることを意味します — ただしそれは、Grok 4.7がうたう速度優位によって相殺されます。速度優位は実時間を短縮し、ひいてはエージェント実行を待つ人的コストを減らすからです。これらの相殺要因はいずれも料金表には表れず、どちらも想定するのではなく、自社のトラフィックで測定する価値があります。

争点になっていない唯一の非対称性はキャッシュです。Qwen 3.8 Maxは88%のキャッシュ割引と、7:2:1のキャッシュヒット/入力/出力の混合における$1.18のブレンドレートを公表しています。大規模で安定したプレフィックスを持つワークロード——システムプロンプト、コードベースのヘッダー、文書セット——では、その割引こそが本当の節約が生まれるところであり、大量利用を確定する前にGrok 4.7のキャッシュ条件がどう比較されるかを確認する価値があります。

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

数字があなたの代わりに選ぶことを拒むとき、選ぶということ

同じ指標で46と45、しかも同じ価格となれば、このブログが公表するであろうもののなかでは、ほぼ真の引き分けと言っていい。つまり、判断は2つのモデルが実際に異なる軸で下されるべきであり、その軸は4つある。

エージェント型コーディングとターミナル実行が仕事で、長時間実行での実時間速度がコンテキストの余裕よりも重要で、リクエストごとの推論ダイヤルで軽いトラフィックを安く抑えたいなら、Grok 4.7を選びましょう。50万トークンを超える入力を日常的に扱うなら、動画入力がロードマップにあるなら、プレフィックスが多いワークロード向けの88%キャッシュ割引を利用したいなら、あるいは単一領域に集中したものではなく広範な評価マトリクスをベンダーが公開しているモデルを求めるなら、Qwen 3.8 Maxを選びましょう。

正直な答えが「どちらも少しずつ」だというなら、それはごく普通の答えであり、まさにこの組み合わせが想定しているケースです。Qwen 3.8 Max は OrcaRouter でアリババの定価で提供されており、OrcaRouter はプロバイダーの定価を 0% のマークアップでそのまま通すため、上記の $2/$6 が実際に支払う金額であり、ベンダーの料金改定も更新時ではなく同じ日にここへ反映されます。1 つの API キーで Qwen 3.8 Max に加えて200 以上もの他のモデルをカバーできるため、コンテキストの判断はプラットフォームへのコミットではなく、リクエスト単位のルーティングルールになります。巨大な入力を 984k ウィンドウへ送り、それ以外はそのタスクにとって最速かつ最安のエンドポイントに載せ、プロバイダーが劣化した場合には自動フェイルオーバーが働きます。タスクが両方の形態を本当に必要とする場合 — 長いコンテキストの読み取りに続くエージェント的な実行パス — ルーティング DSL はどちらかを選ばせるのではなく、モデルを 1 回の呼び出しに組み合わせます。

一つ明確にしておきたい点があります。どちらのモデルもオープンではないため、この比較にはダウンロード可能な重みは一切含まれていません。どちらもホスト型エンドポイントであり、どちらもセルフホスティングは選択肢にありません。

追い続けるべきたった1つの数字

46 対 45 はモデルを選ぶ理由にはならないし、そうあるべきでもない。この比較を決めるのはコンテキストウィンドウ——500,000 トークン 対 およそ 984,000——と、各ベンダーが選んだ形だ。Grok 4.7 は困難なエージェント作業を素早く終わらせることに最適化され、Qwen 3.8 Max は渡されたものを何でも処理することに最適化されている。価格は同じ、測定された能力も同じ、仕事は異なる。それはルーティングの判断であり、調達に四半期をかけるのではなく、テストに午後をかけるべき種類の判断だ。

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新