「Qwen3.8-Max vs Qwen3.7-Max」のヒーロータイトルカード。サブタイトルは「2つのMaxティア、16インデックスポイント、そして価格を逆転させるプロモ」で、フッターには、Qwen3.8-Maxの数値はAlibabaによる2026年9月22日の開示とArtificial Analysisに由来し、Qwen3.7-Maxの数値はArtificial Analysisに由来することが記されている。
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max:2つのMaxティア、16インデックスポイント、そして価格を逆転させるプロモ

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

4日前、ベンダーは私たちにこう伝えた。Qwen3.8-Maxは、ベンダーが8月に出荷したモデルではない。{{4}}2026年9月22日{{/4}}付のプレスリリースで、2026年9月22日杭州のApsara Conferenceにて、同社は明らかにした。そのフラッグシップが33回の反復サイクルからなる、1か月以上にわたる完全自動トレーニングとポストトレーニング作業を完了し、その結果得られたビルドがArtificial Analysis Intelligence Indexを押し上げ、その結果は40から45になった。モデルIDは一切変わらなかった。その背後にある数字は変わった。

の比較こそが、一つの特定の場面で最も重要となる。Qwen3.8-MaxとQwen3.7-MaxQwen3.7-Maxとは、Qwen3.8-Maxが置き換えたMaxティアのことだ。Qwen3.8-Maxが一般提供を開始したのは2026年8月3日で、Qwen3.7-Maxの提供開始は5月だった。紙の上では、これは簡単な世代交代の判断に見える——新しいフラッグシップ、より高いスコア、はい次。ところが数字は、もっと気まずいことを示している。古いティアのほうが3~4倍速く、完了したタスクあたりのコストはおよそ5分の1で、純粋な知識ベンチマークでは新しいティアとまったく同じだ。新しいティアはマルチモーダルで、エージェント的な作業では劇的に優れ、国際料金表ではより安い。どちらを呼び出すべきかは、ほとんどの比較が飛ばしてしまうある問いにかかっている。知識を買うのか、それともツール呼び出しを買うのか、ということだ。

Apsaraの開示が実際に主張している内容

この開示はベンダーによる声明であり、アリババが自社のプレスサイトで公開したもので、そのように読まれるべきだ。そこに書かれていることは具体的だ。パイプライン設計、データ検証、反復的な実験、エラー診断にまたがる丸一か月以上の完全自動実行において、Qwen3.8-Maxは33サイクルを完了し、自律的なトレーニング最適化とポストトレーニング技術がスコアの変化を生み出した。アリババはチップ設計における第2の実験についても述べており、そこではモデルが設計ライフサイクル全体にわたって60時間以上の自己改善を実行し、10,000回を超えるEDAツール呼び出しを行い、性能上の妥協は示されていないままチップ面積を42%削減しつつ、実運用グレードのチップバスモジュールを生成した。これらはすべて、アリババによる自社モデルについての説明であり、同社外部の誰によっても再現されていない。

しかし、スコアの変動そのものはベンダーの主張ではない。この Index は Artificial Analysis のものであり、45 という数値はその第三者の Qwen3.8 Max(0902)のページに載っている。そこから移動してきた元の 40 は、同じ組織の 8月3日ビルドのページにあり、それは現在 deprecated(非推奨)とされて、現行版へと前方参照されている。つまりこの差分は、ベンダーが報告した原因が、独立にスコアリングされた結果に紐づいたものであり、どちらか片方だけよりも強い立場にある。そして本稿執筆時点では、フロンティアラボが新たなバージョン番号を出すことなく、そのフラッグシップの測定された能力を動かしたことを示す、最も具体的な公開証拠でもある。

このリリースについてのもう2つの点は見落とされやすく、どちらも要となる。第一に、AlibabaはQwen 4が訓練中であることを確認した。Qwen 4.5およびQwen 5シリーズは5~10兆パラメータまでスケールすると見込まれている。第二に、刷新されたモデルの日付付きスナップショットがある。Alibabaはポストトレーニング済みビルドをqwen3.8-max-0902として9月2日に固定した。また、これは別途ルーティング可能である。この固定は、RSI開示が示唆するすべてに対する実用的な答えであり、これについては後で戻ってくる。

スコアボード

6つの次元、両側とも、出典の規律を明示したままにする。2つの列は等しく検証されているわけではないからだ。

• コンテキストウィンドウ — Qwen3.8-Max 1,000,000トークン 対 Qwen3-Max 1,000,000トークン(同一)

• 最大出力 — Alibaba自身のモデルページによれば131,072トークン 対 131,072トークン(同一。なお、Qwen3.7-Maxに関する当社のカタログページには64,000と記載されており、この不一致は覆い隠さず指摘します)

• 入力モダリティ — テキスト、画像、動画 対 テキストのみ

• 100万トークンあたりの国際定価 — 入力 $2.00 / 出力 $6.00 対 入力 $2.50 / 出力 $7.50。同じ料金表では、北京、フランクフルト、バージニアにおいて両モデルにすでに $1.65 / $4.951 を請求しています

• Artificial Analysis Intelligence Index — 45 対 29

• 独立した出力速度 — 39.7トークン/秒 対 211.3トークン/秒(同一の211モデル比較クラスに対して測定)。そこではArtificial Analysisが、より新しいティアを顕著に遅いと、古い方を顕著に速いと評価している

最後の2行が記事の全体です。同じインデックスファミリーでは、新しいティアが16ポイント先行しています。速度では、5倍以上後れを取っています。

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

16ポイントがどこから来るのか — そしてどこから来ないのか

Indexをその構成要素に分解すれば、アップグレードの姿は明らかになる。そしてそれは、マーケティングが示唆するような姿ではない。

知識と推論に関しては、両モデルは実質的に互角です。GPQA Diamond:92.8 対 92.3。Humanity's Last Exam:43.1 対 40.5。長文脈リコール:80.33 対 79。SciCode:52.1 対 49.5。大規模コーパスに対する質問応答がワークロードなら、世代間の飛躍は丸め誤差です。そのために何倍ものコストを払うのは正当化しにくいでしょう。

エージェント的作業とコーディング作業では、その差は大きく開く。Terminal-Bench 2.1: 88.76 対 74.53。Artificial Analysisのコーディング指数: 76.2 対 66。そして、このセットで最も大きな乖離は銀行業務のツール使用タスクで、そこではQwen3.8-Maxが47.84を記録し、Qwen3.7-Maxの11.75 — 4倍の差は、まさにRSIの説明が自動サイクルが最適化していたと述べている能力にある。パイプライン設計、データ検証、反復的な実験、エラー診断。自分のトレーニングループの改善に1か月を費やすモデルは、ループが上達したモデルである。

これらの個別行については、正直に一点注意しておきたい。両モデルのページは同じ Intelligence Index リビジョン系列(v4.3 と v4.3.2)に属しているため、見出しの45対29という比較は公平だ。ベンチマークごとの行は同一コホートではない。Qwen3.7-Max のタスクレベル数値は5月の評価ウィンドウ時点のもので、Qwen3.8-Max のものは9月シリーズのものである。第3有効数字ではなく、方向性を読んでほしい。

価格の問いは2つの問いである

アリババの国際価格表では、新しいMaxはそれが置き換えたものよりも安い:$2.00 / $6.00のQwen3.8-Maxに対し、$2.50 / $7.50のQwen3.7-Max(100万トークンあたり)。世代が進むにつれて双方向で20%の値下げが行われるのは異例であり、それ自体特筆に値する。キャッシュの経済性も新しい階層に有利だ — 暗黙キャッシュは$0.50に対して$0.25、明示キャッシュ読み取りは$0.25に対して$0.17。

それが最初の問いであり、それにはほとんどの報道が平板化してしまう地域ごとの答えがある。アリババは両モデルに入力 $1.65 / 出力 $4.951を、北京、フランクフルト、バージニアで請求している。20%の差はシンガポールの国際カードにのみ存在する。あなたのトラフィックが他の3つの地域に着地するなら、今日、入力トークンと出力トークンのコストは両方のMaxティアで同じであり、判断は純粋な能力だけに帰着する——その時点で、新しいモデルはスループット以外のすべてで勝ち、もう計算すべきものは何も残らない。

2番目の問いこそが罠である。Qwen3.7-Max は現時点で $2.50 / $7.50 のコストはかからない。提供価格は$1.25 / $3.75——リストの半額にあたるプロモーション価格だ。これにより、今日においては前世代のティアのほうがはるかに安い選択肢となる。また、今週測定できる価格は、あなたが実際にコミットすることになる価格ではないということも意味する。Alibaba 自身のモデルページには、公開されている表は「期間限定のプロモーションを除く」元の価格を示すものであると明記され、最新の提供内容についてはコンソールを参照するよう案内されている。プロモーションとは、その性質上、終了しうる料率のことである。もし終了すれば、Qwen3.7-Max は単に今日より高くなるだけでなく、同モデルを上回るモデルよりも25%高くなる。

当社はプロバイダーの料金を0%のマークアップでそのまま渡しているため、定価とプロモーションの両方が、変更された当日に当社側でも反映されます。これは比較するには便利ですが、予算を立てようとしている場合には役に立ちません。モデルは定価のカードを基準に組み立て、プロモーション料金は上振れ分として扱ってください。

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

コスト論を覆す数字

トークン価格は、タスクにかかるコストとは異なる。Artificial Analysisは、キャッシュの経済性、推論量、回答の長さを織り込んだタスクあたりコストの数値を公表しており、その尺度では順位が完全に逆転する:Qwen3.8-MaxではIntelligence Indexタスクあたり5.41ドルに対し、Qwen3.7-Maxでは1.15ドル。4.7倍の割高で、トークン料金は地域によって20%安いか、あるいは同じであるにもかかわらず。

差は主に冗長さにある。同じ評価で、新しいモデルが生成したのは1億9,000万出力トークンで、古いモデルの1億2,000万に対してであり、答えに到達するまで長々と推論する。大量かつ中程度の難易度のワークロードで出力トークン単位で課金される場合、新しいMaxは、どちらの料金表のどのトークン単価においても安いモデルではない。むしろ高価なほうであり、トークンのリスト価格はそれを判断するための誤った尺度だ。

スピード、そして自社トラフィックが示すもの

スループットの差は、アーキテクチャを変えるのに十分なほど大きい。Artificial AnalysisはQwen3.8-Maxを毎秒39.7トークンと位置づけており、その要約ではこのモデルを著しく遅いと評している。一方、Qwen3.7-Maxは211.3で、著しく速いと評している。これは、インタラクティブな画面の背後に置くモデルと、キューの背後に置くモデルとの違いだ。そしてQwen3.8-Maxそれは、私たち自身の統計パネルが最初にあなたに見せるものです。

9月25日までの7日間における当社独自のプレイグラウンドのテレメトリは、レイテンシについてやや微妙に異なる事情を示しており、1つ注意点があります。これは当社のルーティング上で当社が測定したものであり、制御されたベンチマークではありません。Qwen3.8-Maxは、最初の応答までの中央値が2,611ミリ秒で、毎秒54.7トークン、エラー率2.45%でした。固定された0902ビルドは、中央値3,360ミリ秒で、毎秒46.2トークン、エラー率は明らかによりクリーンな0.66%でした。Qwen3.7-Maxは中央値4,509ミリ秒でしたが、毎秒169.8トークンで、エラー率は3.80%でした。つまり、古い方のティアは最初の応答がより遅く、その後は3倍速くストリーミングする一方で、失敗する頻度がより高くなっています。ワークロードがバースト的なものであるなら、そのエラー率の差は中央値よりも注目に値します。

両方のティアは、固定されたスナップショットと並んで1つのOrcaRouterキー上で稼働しており、プロバイダー間の自動フェイルオーバーも備えています。このような比較で実用的なポイントはそこにあります。自分のプロンプトを両方のMax世代に対して測定することは、設定の変更であって、2つ目の契約ではないのです。

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

再現性が今や決め手となっている

これが、Apsara の開示のうち、誰も価格に織り込んでいない部分だ。測定された能力が1か月で40から45へ動いたのに、バージョン変更も当時の告知もなかったライブモデルIDは、再現性の危険要因である。あなたの製品の挙動が動くIDの関数であるなら、凍結された評価スイート、キャッシュされたプロンプトライブラリ、または承認済みの回帰セットの下で、改善したり——あるいはずれたり——し得るモデルを抱えていることになる。

どちらの世代も日付付きスナップショットを提供しており、それが緩和策となっている。Qwen3.7-Max は qwen3.7-max-2026-05-20と機能的に同等であると Alibaba によって文書化されており、さらに 2026-05-17 と 2026-06-08 の日付付きビルドも存在する。Qwen3.8-Max には qwen3.8-max-0902があり、これはポストトレーニング後の9月ビルドで、45 が指しているのはこれだ。再現性が必要なものを出荷するなら、日付付き ID をピン留めし、フローティングのほうはステージング対象として扱うこと。RSI サイクルはフローティング ID の仕様であり、ピン留めこそがそこからオプトアウトする手段である。

カタログを誤読しないために知っておきたい命名の細かい点が1つあります。Alibabaは3つ目の日付付き形式、qwen3.8-max-2026-09-02を0902エイリアスと併せて掲載していますが、これらは同じビルドを指します。当初の8月3日リリースは弊社側ではもうルーティングできません。提供しているのはQwen3.8-Max、その0902ピン、そしてQwen3.7-Maxです。

誰がどれを選ぶべきか

その判断は、どちらのモデルが優れているかで分かれるのではない。何を買うかで分かれるのだ。

Qwen3.7-Max を使い続けよう:ワークロードがテキストのみで、ツール中心ではなく知識中心で、スループット重視の場合——大量分類、抽出、長文コンテキスト検索、バッチ要約。GPQA Diamond と長文コンテキスト想起では、新しいモデルと1ポイント以内の差で、ストリーミングは3~4倍速く、タスクあたりのコストは5.41ドルに対して1.15ドルだ。また、フュージョンやルーティング構成で安価なセカンドオピニオンを求める人にとっても正解だ。というのも、そのプロモーション料金では、まったく別の価格帯になるからだ。2つ注意点がある。プロモーションはあくまでプロモーションであり、Artificial Analysis はすでにこのモデルを非推奨、Qwen3.8-Max に取って代わられたものとして指摘している。これに複数年にわたるコミットメントを始めないこと。

Qwen3.8-Max へ移行すべきなのは、次のいずれかに当てはまる場合です。画像または動画の入力が必要なとき——Qwen3.7-Max はそれを一切受け付けません。ワークロードがエージェント型で、長いツール呼び出しチェーンや複数ステップのコーディングループを伴うとき——Terminal-Bench 2.1 における 88.76 対 74.53、そしてツール使用量の 4 倍差が、出荷できるか否かの分かれ目になります。あるいは、シンガポール国際レートカードで課金しているとき——新しいモデルのほうが単純に 20% 安く、天秤にかけるものは何もありません。ピン留めするqwen3.8-max-0902のは、挙動を一定に保たせたい場合です。

北京、フランクフルト、またはバージニアにいるなら、その選択はどんな比較から示唆されるよりも明快だ。両方のMaxティアのコストは$1.65 / $4.951、100万トークンあたりで同一。まったく同じだ。この料金なら、マルチモーダル入力に追加費用を払わずに、16ポイント高いIndexと4倍優れたツール使用スコアが得られるのは、判断ですらなく無料だ — そしてQwen3.7-Maxにとどまる唯一の理由は、生のスループットだけになる。

直接答える価値のある2つの質問

33サイクルのトレーニング実行は、既存のAPIトラフィックのもとでモデルが変わったということを意味するのでしょうか? 開示内容が示唆しているのはそういうことであり、日付付きピンが存在する理由もそこにあります。Alibabaは改良されたモデルを「the updated Qwen3.8-Max」と表現していますが、これは新しいIDではなく、フローティングIDです。9月を通じてフローティングIDでワークロードを運用していた場合、その期間中に測定された能力が変化したモデルによって処理されていたことになります。Alibabaはその間のビルドについて変更履歴を公開していないため、自分がどの挙動のモデルを使っているかを知る唯一信頼できる方法は、ピン留めすることです。

RSIの主張は独立に検証されているのか? それが生み出したスコアは検証されている——IndexはArtificial Analysisのもので、45は彼らのページに載っている。その背後にある仕組みは、Alibaba自身による自社のトレーニング過程の説明であり、外部による再現も、公表された評価プロトコルも、33サイクルを観察する第三者も存在しない。「33回の反復サイクル」はベンダーの主張として、「40の後で45」は測定されたペアとして扱うべきだ。両者は同じ種類の記述ではない。そしてこの違いこそ、見出しを繰り返すのではなく注意深く読む価値がある理由である。

次に注目すべきはQwen 4ではない。Qwen3.7-Maxの半額プロモーションが、それに取って代わるはずのモデルの登場を乗り越えて生き残るかどうかだ。もし生き残らなければ、非常に多くのチームが、自分たちは定価と割引価格を比べていたのだと気づくことになる——そして二人きょうだいのうち年上のほうが、ずっと高くつくほうだったのだと。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新