
Qwen3.8 Max Prime:アリババは旗艦モデルの隣に二流のカードを並べた
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
2026年9月22日、杭州の雲栖大会(Yunqi Conference)で、アリババのMaaS事業部門は、Primeモード(优速模式)と呼ぶ提供ティアを発表し、その料金表に新しいモデルIDを追加しました:qwen3.8-max-prime。このIDは新しいモデルではありません。これはQwen3.8-Max、すなわち2.4兆パラメータのスパースMixture-of-Expertsフラッグシップモデルであり、一般提供が開始されたのは2026年8月3日で、それをより高速なレーンで提供したものです。Qwen3.8 Max Primeは、ベースモデルと同じ重み、同じコンテキストウィンドウ、同じツール群、同じ利用上限を備えています。異なるのはスループットと価格であり、価格はおよそ2倍になります。
アリババがQwen3.8-Maxの中身は変えずに販売方法だけを変えたのは、これで7週間のうち2度目だ。9月2日、同社はポストトレーニングを施したリフレッシュ版をQwen3.8-Max-0902として提供した。コーディングとエージェント作業に焦点を当てたもので、API専用だ。9月22日にはスピードティアが追加された。どちらも新規ローンチではなく、どちらかをそう読むと損をすることになる。

Primeモードとは実際に何なのか
Alibaba自身のドキュメントは、Prime modeを「出力速度に敏感なシナリオ」向けのチャネルとして説明しています — AIコーディングアシスタント、マルチステップのエージェント推論、リアルタイム会話 — そしてその利点を明言しています。TPSは標準APIの1.5~2倍に引き上げられます。設定すべき新しいパラメータはありません。modelの値をPrime IDに切り替えれば、高速レーンに乗れます。
ドキュメントは、変わらない点についても同じくらい明確です。「モデルがサポートする機能と利用制限は、元のモデルと同じです」。つまり、より大きなコンテキストも、より優れた推論モードも、追加のツールサーフェスもありません。背後の余力が増えた、同じサービングスタックなのです。
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
料金表をよくお読みください。
アリババの国際価格ページでは2つのIDが並べて掲載されているため、比較が異例なほど明確になっている。100万トークンあたり:
• 入力 — qwen3.8-max-prime $3.301 対 qwen3.8-max $1.65
• 出力 — qwen3.8-max-prime $9.902 対 qwen3.8-max $4.951
• キャッシュヒット — qwen3.8-max-prime $0.413 対、同じページが割引行として掲載している標準IDのキャッシュ読み取りレート
• 比率 — 入力と出力の両方で2.0倍、概数ではなく公表された数値の正確な計算によるもの
中国の料金表でも同じ2倍の関係が人民元でも成り立ちます。Prime IDは100万トークンあたり入力¥24、出力¥72であるのに対し、標準は¥12と¥36で、キャッシュヒットは¥3です。
Qwen3.8-Maxについて広く引用されているローンチ時の数字は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。これは8月の報道が見出しにした数字であり、今日の国際料金表に載っている数字ではありません。支出を試算する場合は、ローンチ時の見出し数字ではなく、あなたの地域の料金表を使用し、契約する前に再確認してください — Alibabaは9月2日以降、このページを2回改訂しています。

スロットリングルールこそが真の機能だ
ほとんどの人が流し読みしてしまう行こそ、本番環境で最も重要な行です。AlibabaのPrimeドキュメントには、使用量がレート制限に達したとき、プラットフォームにまだ予備リソースがあれば、スロットリングされることはありません、したがって実際に利用可能なスループットは記載された制限を下回ることはありません。
それは、ハードな下限を伴うソフトな上限であり、標準的なティア制限とは形が異なる。つまり、1.5~2×という数字は下限に関する約束であって、上限を抑えるキャップではない。競合時にはその制限値が得られ、アイドル状態のキャパシティではさらに多くを得られる。数十回の逐次呼び出しを発行するエージェントループにとって、この非対称性はTPS倍率という生の数値よりも価値がある。なぜなら、ワークフローが完了するかどうかを決めるのは、最も遅い呼び出しのテールレイテンシーだからだ。
標準モデルの動的 TPM 制限は、月々の Model Studio 利用額に応じて段階化されている。同じドキュメント群では、ベースの qwen3.8-max ID が各階層で 5,000,000、10,000,000、20,000,000 TPM と示されており、毎月更新される。Prime はその構造を撤廃するのではなく、その効き方を変える。

まだ誰も測定していないもの
正直に言うと、ここにギャップがあります。1.5~2倍という数字はベンダー公称です。独自に確認できるPrimeモードのスループット測定は存在せず、これは重要な点です。なぜなら、標準ビルド自体の独立した数値も速度の面で芳しくないからです。
独自のハーネスでモデルを測定するArtificial Analysisは現在、0902ビルドのQwen3.8-Maxについて、インテリジェンス指数を45と採点しており、GPQA Diamondは92.8%、Terminal-Bench Hardは38.9%、Humanity's Last Examは43.1%となっています。また、測定されたタスクあたりコストを$5.41としています。これらは標準SKUにおける独立した数値で、2026-09-24に取得されたものです。また、この指数は8月のローンチ報道以降に改訂されているという注意喚起でもあります。したがって、古い指数値と現在の値を並べて、それを傾向と呼んではいけません。
AAに欠けているのはPrime行だ。誰かが測定するまでは、その速度の主張はAlibabaだけのものであり、正しい姿勢は、最高水準を前提とするのではなく、自分のワークロードでテストすることだ。
これでルーティングの判断がどうなるか
PrimeはAlibabaが自社APIのみで販売しているティアであり、入手できるのはそこだけです。当社はここでqwen3.8-max-primeをホストしていません。OrcaRouterがルーティングするのは、標準のQwen3.8-Maxとその日付固定版Qwen3.8-Max-0902で、どちらもQwen3.8ファミリーの他のモデル — Qwen3.8、Qwen3.8-Flash、Qwen3.8-27B — と同じキー上にあり、さらに200以上の他のモデルと並んで、プロバイダの定価を0%のマークアップでそのまま提供しています。後半の点こそが、9月2日の更新や将来のMaxの料金変更が、Alibaba側で反映されたその日に当社側でも反映される理由です。
実用的な切り分けはこうなります。デフォルトのトラフィックは標準のID上でルーター経由で流し、単一のプロバイダーパスが劣化した場合にはフェイルオーバーがあなたを守ります。実時間レイテンシーが製品価値の核心となる特定の呼び出し——インタラクティブな完了、厳しいエージェントのステップ——はPrimeへ移し、その判断は1.5倍ではなく2倍を基準にコストを見積もってください。
誰が切り替えるべきか、誰が待つべきか
ユーザーがトークンを待っているなら切り替えましょう:オートコンプリート、チャットのターン、人間が監視しているコード編集ループなどです。速度範囲の上限では、Prime は削減されたレイテンシ1秒あたりのコストが中立です — ちょうど2倍の支払いで、ちょうど半分の時間になります。範囲の下限では、1.5×のために2×を支払うことになり、節約された1秒あたり33%の割増料金になります。ワークロードが夜間に実行されるバッチジョブなら、その割増料金はあなたが必要としていたものを何ももたらしません。
待って。あなたのコストモデルが$2/$6というローンチ時の見出し価格に基づいて組み立てられているなら、あるいはリクエストが入力ヘビーなら、そこは注意点だ。ベンダーの速度に関する主張はTPS——1秒あたりの出力トークン数——の話であり、プリフィルは別のパイプライン段階だ。長コンテキストのリクエストは、出力がどれだけ速く届こうと、入力トークンで2倍のコストを払うことになる。移行する前に、そのケースを測定しよう。
そして、自分のレートカードの日付を確認してほしい。Qwen3.8-Max は8月3日から市場に出ており、一度リフレッシュされ、一度再パッケージ化もされたが、それでもまだ7週間しか経っていない。ニュースなのはティアであって、モデルのほうではない。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
