「Qwen 4.5とQwen 5:5兆〜10兆パラメータ」と題された生成タイトルカード。サブヘッドは「ロードマップ上の幅であり、仕様ではない」で、3枚のカードには「ロードマップ目標 / 5〜10兆パラメータ」「出荷中のフラッグシップ / Qwen3.8-Max 2.4兆」「リリース日 / 未発表」と記されている。フッターには「Alibabaの2026年9月22日のプレスリリースによる。モデルカードは未公開。」とある。白背景にブルーからシアンへのグラデーションウォッシュを重ねたフラットベクターのエディトリアルスタイルで、OrcaRouterのロゴが右下に合成されている。
Guides & Insights

Qwen 4.5とQwen 5は5兆~10兆パラメータを目標:Alibabaが語ったことと、語らなかったこと

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月22日、杭州で開催されたApsara Conferenceで、同社は次々世代の規模を数字で示した。Qwen 4.5Qwen 5シリーズは「5兆~10兆パラメータまでスケールアップする見込み」と、同社の英語版プレスリリースの文言にある。これはロードマップ上の一行であり、仕様ではない。どちらのモデルにもリリース日も、モデルカードも、API識別子も、価格も、公開されたベンチマークスコアもなく、つまり現時点でどちらも呼び出せるものは何もない。実際に購入できるフラッグシップはQwen3.8-Maxで、2026年8月3日から一般提供されており、2.4兆パラメータだ。会議以降の数日間で、そのロードマップの一文は多くの報道の中で、10兆パラメータのモデルが登場するという主張へと平板化された。それは同社が述べたものよりも強く、より単純な主張だ。この2つの文の隔たりは、およそ1年分の計画に相当する。

その主張と、広まったその版

ステージでは2つのことが語られ、それらは情報量が大きく異なるため、分けて考える価値がある。1つ目は状況報告だ。Qwen 4は新しいアーキテクチャで学習中である。2つ目はロードマップだ。Qwen 4.5とQwen 5シリーズは、5兆から10兆のパラメータ帯に到達すると見込まれている。

アリババの英語版プレスリリースでは、そのどちらもが特定の幹部ではなく会社に帰属するものとされている。より踏み込んだカンファレンスの報道では、このロードマップはアリババのToken HubでQwen大規模言語モデルプロジェクトを率いる劉大一恒によるものとされ、スケーリングが人工超知能へ向かう重要な道筋であるという彼の位置づけが報じられている。この位置づけこそが、そのパラメータ数が示された文脈であり、その数が目標値ではなく幅である理由を説明している。

次に広まったのは、そのレンジの上限だった。その後を追った英語の見出しには、少なくとも1つ、予告された10兆パラメータモデルを伝えるものがあり、いくつかは5兆~10兆パラメータのモデル計画を伝えていた。どちらも、あるスライドの解釈として十分に成り立つ。どちらも仕様ではなく、その違いは、それを前提に計画しなければならない人にとって重要だ。

5兆はある世代の目標であり、10兆は別の世代の目標である

この発表について最も役立つ正しい理解は、5兆から10兆というのは、幅広い許容範囲を持つ1つのモデルではなく、2世代にまたがる範囲であるということだ。アリババ自身の文は、その範囲を「今後のQwen 4.5およびQwen 5モデルシリーズ」に結び付けている — そのシリーズ、複数形、まとめて。

同じ会議に関する中国語報道は、今回もまた別の方向に正確で、見出しではQwen 4.5以降のモデルが5兆~10兆の範囲へ拡大すると説明している。その解釈では、10兆の端はQwen 4.5をも超えることになる。すべての情報源が一致する唯一の記述は、その帯域がQwen 4.5からQwen 5までの幅をカバーするというものだ。10兆を特にQwen 5に割り当てるのは、引用ではなく、見出しになった推論である。

規模を示すために言うと、そしてこれらはこの話の中で推計ではなく公表されている唯一の数字だ:

• 5〜10兆 — アリババのプレスリリースが Qwen 4.5 および Qwen 5 シリーズに付与しているパラメータ帯域

• 2.4兆 — 出荷中のフラッグシップモデルQwen3.8-Maxの総パラメータ数(公式モデルカードによる)

• 950億 — Qwen3.8-Maxのトークンあたりアクティブパラメータ数。トークンの提供コストを左右する数値

• 10兆 — その範囲の上限であり、ほとんどの英語の見出しに登場した唯一の部分

• 0 — Qwen 4.5 または Qwen 5 について公開されている仕様、リリース日、価格、コンテキストウィンドウ、ベンチマークスコアの数

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

重要なパラメータ番号とは、誰も公表しなかったそれである

総パラメータ数とは、ラボがそう言うと決めた数字にすぎない。アクティブパラメータ数こそが購入者に必要な数字であり、そのロードマップにはそれが含まれていない。

Qwen3.8-Maxは、総パラメータ数2.4兆、トークンあたり950億個が活性化するMixture-of-Expertsモデルです。活性化率はおよそ4%で、モデルは任意のトークンでは読み出さない重みに大量の知識を保持し、そのごく一部に計算コストを支払っています。総パラメータ数は、そのモデルがどれだけのメモリを占め、どれだけ大きな箱が必要かを示します。活性パラメータ数は、応答するたびに何を支払うかを示します。

その比率を先へ当てはめてみると、問題の輪郭が見えてくる。同じ4パーセントの活性化率で作られた10兆パラメータのモデルなら、トークンあたりおよそ4000億パラメータを活性化することになる——これはQwen3.8-Maxが現在活性化している量の4倍以上だ。これは明示された前提に基づく算術であって、Qwen 5についての主張ではない。スパース性を高めれば活性化数は減り、低めれば増える。だが、10兆パラメータのモデルが提供される製品なのか研究用の産物なのかを決めるのはこの算術であり、5兆から10兆という見出しが誘っておきながら、結局やり残している計算でもある。

ここでもまた、ルーティングの経済性は抽象論ではなくなります。OrcaRouter では、プロバイダーの定価がマークアップ 0%でそのまま適用されるため、Qwen の階層でベンダーが値下げすれば、それは更新時ではなく同じ日のうちにあなたのキーに反映されます。サービングコストが真に不確実な生成モデルこそ、誰も公表していない数字を前提に事前交渉した割引よりも、このパススルーが価値を持つまさにそのケースです。

チップの発表こそが実際のタイムラインだ

アリババは同じプレスリリースの中でモデルのロードマップと新しいアクセラレーターを発表したが、この二つはリリースが述べている以上に密接に関連している。

T-HeadのZhenwu V900は、216GBのメモリと1,200GB/sのチップ間帯域幅を備え、FP8とFP4をネイティブサポートする訓練・推論プロセッサであり、5月に発表された前世代のZhenwu M890の3倍の性能をうたっている。量産と商用リリースは2027年第1四半期に予定されている。コンパニオンのスーパーノードサーバーは最大50万枚のカードのクラスタをサポートし、T-HeadによるとZhenwuシリーズは650社以上の顧客に提供されてきた。

二つの発表を一緒に読むと、その順序は読み取れる。10兆規模のmixture-of-expertsモデルを学習し提供することは、計算問題である前に相互接続の問題である。なぜなら、エキスパート並列とはチップ間でアクティベーションを絶えず移動させることを意味し、チップ間帯域幅1,200 GB/sが、それが実行可能かどうかを決める数字だからだ。そのスケジュールでシリコンが登場するなら、この種のフロンティア規模の実行が実現可能になる最も早い見込みの時期は2027年のかなり先になる――そしてその場合でも、チップが出荷されることは、トレーニング実行が完了することについて何も語らない。Alibabaは二つの主題を一つのリリースにまとめることで結びつけた。その結びつき自体は我々の読みであり、そのように明示されている。

同社自身の時間軸は、それと一致している。最高経営責任者(CEO)のエディ・ウー氏は、2032年までにAlibaba Cloudの世界データセンター容量を20ギガワット超にする目標を掲げた——これは容量の目標であり、稼働済み容量ではなく、来四半期ではなく5年以上の時間軸である。

ロードマップを支えている自己改善の主張

5兆~10兆規模の計画が、単に高価なだけでなく、そもそも議論の余地がある理由は、再帰的自己改善にある。訓練パイプラインが自己改善すれば、世代ごとに必要な計算量は減り、フロンティアは手が届く価格に近づく。それがこのロードマップの根幹をなす主張であり、同時にAlibabaが述べた中で最も検証しにくいことでもある。

企業が報告した内容:Qwen3.8-Maxは、パイプライン設計、データ検証、エラー診断に及ぶ約1か月にわたる完全自動化された作業で33回の反復サイクルを完了し、Artificial Analysisスコアを40から45に引き上げた。チップ設計の実験では、このモデルは設計ライフサイクル全体にわたり60時間以上の自己改善に費やし、10,000回を超える電子設計自動化ツール呼び出しを行い、性能を損なうことなくチップ面積を42パーセント削減した。会議からの報告の1つは、新しいT-Head GPUを自律的に調整することによる96パーセントの推論スループット改善も示している。

これらはベンダーによる報告であり、独立して再現されたものではない。これは技術的な細かい話ではない——自らの実験を自ら採点する自律ループは、自分自身の採点基準に対して自分自身を測っているのであり、外部の世界がその評価基準を検証する術はない。この会議に関する報道は概ねその旨を伝えており、読者もそう前提とすべきである。

同じ主張にはもう一つ罠があり、それは誠実さではなくラベルに関するものだ。Alibabaは、その40から45への動きがArtificial Analysis Intelligence Indexのどの改訂版に対して測定されているのかを明言していない。そしてこの指標は、このモデルが登場して以降、作り直されている。Qwen3.8 Max (0902) の現在のArtificial Analysisページには45と表示されている——今日有効な改訂版に基づく、独立した数値だ。同じモデルについて8月中旬に、当時有効だった改訂版の下で記録された数値は56だった。45と56は同じ単位での同じ測定ではなく、一方から他方を引いても意味のない数字が生まれるだけだ。ページに載っていないのは、Alibabaが改善前の値だと述べている40だ。その差分の出発点は同社自身のもので、終点だけがたまたま、独立した数値が今あるところに位置している。この動きは、測定値ではなく方向性として読むべきだ。

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

同じカンファレンスでアリババが実際に出荷したもの

ロードマップを除いても、カンファレンスには依然として実際のリリースが含まれており、そのすべてがマルチモーダルだった:

• Qwen3.8-LiveTranslate — 同時通訳。レイテンシー(LAAL)を約20パーセント削減し、2.8秒から2.3秒に短縮

• Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-Realtime — 刷新された音声スイート

• Qwen-Audio-3.1-TTS-Next — テキストスクリプトから台詞と環境音を融合させるシネマティックなサウンドスケープ。オーディオブック、映画・テレビ、ポッドキャスト、ゲーム向け

• Qwen-Image 3.1 — クリエイティブデザインとEコマースマーケティング向けに調整された画像生成。今年後半に登場予定で、ネイティブの透明背景生成に対応

• Qwen Intelligence — スマートフォンメーカー向けのフルスタック・エージェント型プラットフォーム

そのリストのどの項目も、提供時期が定まった製品だ。フロンティア規模の主張は、議題のなかで日付が付いていない唯一の項目であり、この対比は偶然ではない。マルチモーダル・ティアを出荷することがロードマップの一年分を賄い、そしてロードマップがあるからこそ、次の資金調達ラウンドや次のクラウド契約が表計算ではなく物語になる。どちらも現実だ。だが、呼び出せるのはそのうちの片方だけだ。

現在呼び出し可能なものは何か、そしてそれが変わるためには何が変わらなければならないのか

Qwen 3.8世代は、購入可能なラインナップのすべてを占め続けている。Qwen3.8-Maxは2026年8月3日から一般提供されており、価格は入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル。100万トークンのコンテキスト全体を通じて定額で、長いプロンプトへの追加料金はない。その重みは2026年8月12日にQwen3.8-2.4T-A95BとしてBF16とFP8で公開され、独自のQwenライセンスの下にある。ベンダーのベンチマーク表は強力だが未監査だ——Terminal-Bench 2.1が86.6、GPQA Diamondが92.6、OSWorld-Verifiedが86.1で、いずれもAlibaba自身の数値である——第三者の見方はベンダーのものほど好意的ではない。Artificial AnalysisはQwen3.8 Max(0902)のIntelligence Indexを45、212モデル中24位とし、Intelligence Indexタスクあたりの実測コスト5.41ドル、出力毎秒39.2トークン——212モデル中159位で、集団のかなり遅い側に位置する。同じページではコンテキストウィンドウが984kとされており、当社のモデルページにある1,000,000とは異なる。長いコンテキストのジョブを設計する前に知っておく価値のある差だ。フロンティア級のスコア、中位の速度——これが出荷中のフラッグシップの正直な要約であり、Qwen 4.5が同時に両方の軸で打ち負かさなければならない基準である。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouterはQwen 3.8ファミリーを搭載しています — qwen/qwen3.8-max、qwen3.8-flash、qwen3.8-27b — を、OpenAI互換の単一エンドポイント上で他200以上ものモデルと並べて提供しています。つまり、Qwen 4.5のティアが登場したとしても、それは新しいベンダー契約や新しい請求、新しいSDKではなく、既存のキーでのモデルIDの変更で済むということです。いざ登場したとき、それが現れるのはこのカタログです。現時点では、Qwen 4.5もQwen 5もこのカタログにはありません。どちらもまだリリースされていないからです — そして、ロードマップに関するプレスリリースがどれだけ出ても、その事実は変わりません。

このようなロードマップの実用的な使い方は、移行計画とは正反対です。Qwen 4.5クラスが最終的にあなたのワークロードに適していそうに見えたとしても、それを安く確かめる方法は、自動フォールバックの背後で実トラフィックの一部をそのモデルに振り向けることです。そうすれば、遅い、高価、あるいは現行モデルより劣ることが判明したモデルのせいで失うのは、ワークロード全体の4分の1ではなく、1つのワークロードの数パーセントで済みます。フェイルオーバーはまさにそのためにあり、実績がなく登場から数日しか経っていないフロンティアモデルは、それを使うべき最も明確なケースです。

注目すべきこと、そしてまだ信じるべきでないこと

ロードマップ上の一行は、少数の具体的な要素が揃ったときにリリースとなる。総パラメータ数、アクティブパラメータ数、コンテキストウィンドウを記載したモデルカード。リクエストで渡せるAPI識別子。モデルハブ上の重み。日付が付いた独立系リーダーボードのエントリ。価格。これらのうちどれか一つはシグナルであり、ほとんどが揃えばローンチである。

リリースではないもの——どんなに技術的に見えても:カンファレンスでの言及;実験的な Qwen ビルド向けのアーキテクチャ分岐を追加するサービングフレームワークのプルリクエスト(これは、呼び出せるモデルというより、誰かの推論スタックにおけるエンジン作業である);すでに出荷済みの世代向けの日付付きスナップショット ID;そしてステージ上の発言を言い換えたソーシャル投稿。この記事を生んだシグナルは、それらの中で最後のものだった。そして、それを記事として書く価値があった理由は、根底にある主張が Alibaba 自身のプレスリリースと突き合わせて確認できることにある——5兆〜10兆のレンジ、Qwen 4 のステータス、RSI の数値は、すべてそこから来ている。そのシグナルはストーリーを指し示していたのであって、ストーリーそのものではない。

短期的な問いは、見出しが示唆するよりも狭い。アリババはQwen 4が学習中だと述べている。これは系列上でQwen 4を4.5と5の両方より先に置く。したがって次に注視すべきは、10兆パラメータのモデルではなく、Qwen 4がモデルカード、価格、エンドポイントを伴って登場するかどうか、そしていつ登場するかだ。その連鎖のどこかが実現するまでは、5兆から10兆パラメータの帯域についての誠実な立場はこうだ。それは進むべき方向性であり、公式に開示されてはいるが、仕様も日付も添えられていない。Qwen3.8-Maxを想定して計画せよ、4.5と5の帯域は製品ではなくスケーリング仮説として注視せよ、そしてモデルカードのないモデルについて目にするあらゆるパラメータ数は予測として扱え。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新