記事『Qwen3.8-Flash-Next — リークレポート』のヒーロータイトルカード。「未確認 — QWEN4 アーキテクチャ プレビュー」バッジ、サブタイトル「Alibaba がモデルに先駆けて Qwen4 アーキテクチャを出荷」、3つのチップ「出典: @kimmonismus」「2026年8月25日」「リリース: 2026年8月26日 23:00 UTC+08」が付属する。左のカードは「主張: Qwen4 アーキテクチャをプレビューするオープンウェイトのマルチモーダル MoE」、右のカードは「ステータス: ウェイト未公開、公開まで約24時間」。OrcaRouter のロゴは右下隅に合成されている。
Guides & Insights

Qwen3.8-Flash-Next:Alibaba、Qwen4登場前にQwen4アーキテクチャをプレビュー

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

アリババは、Qwen4モデルを公開する前に、Qwen4アーキテクチャを公開しようとしている。Qwen3.8-Flash-Nextは、Qwen4ファミリーを支える次世代アーキテクチャに基づいて構築されたオープンウェイトのマルチモーダル混合専門家(MoE)モデルで、2026年8月26日北京時間23:00にModelScopeで公開される予定だ。アリババは今回の公開をテクノロジープレビューとして位置づけており、開発者にはアーキテクチャが早期に提供され、完全なQwen4ファミリーは後日提供される。本稿執筆時点では、パラメータ数、ライセンス、価格は未確認のため、これは現時点で判明している情報をまとめた記事であり、以下の各詳細には確実性の度合いが明記されている。

今月のAlibabaのリリースペースを追っていないなら、起点となるのはQwen3.8-Max——8月3日にリリースされ、2週間足らずでQwen3.8-2.4T-A95Bとしてオープンソース化された、2.4兆パラメータのフラッグシップモデルだ。Qwen3.8-Flash-Nextはその1ヶ月足らず後に登場する。2.4兆パラメータのオープンウェイトモデルを世に送り出した同じ研究所が、その次世代のアーキテクチャを、その世代のフラッグシップが名前すら決まらないうちに公開しているのだ。

何が発表されたのか

そのシグナルはいつもの経路でアリーナに届いた。Qwen3.8-Flash-NextのModelScopeティーザーページが8月25日に公開され、"Upcoming Open-Release"バッジ、タグライン{{1}}「次世代へ前進——電光石火」、{{/1}}そして2026-08-26 23:00 (UTC+08:00)を指すリリースタイマーを備えていた。アリババのQw​enチームは同日、X上で{{2}}「次のQw​enの波が来る。」{{/2}}と投稿した。@kimmonismusがXでこの記事を私たちに転送してくれた投稿は、同じことを少し異なる言葉で説明していた:{{3}}次世代アーキテクチャを採用したオープンウェイトのマルチモーダルMoEであり、コミュニティがQwen4ファミリーに備えられるようにするための早期アクセスだ。{{/3}}

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

読み返す価値があるのは、Alibaba自身のフレーミングだ。このモデルは、「今度のQwen4ファミリーを支える」次世代アーキテクチャに基づいて構築されたと説明されており、Qwen4そのものではないと明示されている。Alibabaが述べる理由は、アーキテクチャの変更がファミリーの登場前にコミュニティの手に渡り、実際の製品がリリースされる時点でランタイム、量子化、アプリケーションが準備万端であるようにするためだ。それはマーケティング上の立場だが、技術的なコミットメントでもある。難しい部分を先にプレビューし、コミュニティを巻き込んでいくということだ。

今日確認されていること、そして確認されていないことは何か:

• ティーザーとQw​enの声明によると、Qwen3.8-Flash-Nextはオープンウェイトで、マルチモーダルであり、Qwen4アーキテクチャ上のMoEモデルであることが確認されました。

Qwenの声明により確認済み:GDNハイブリッドアーキテクチャとQwen Sparse Attention(QSA)という2つの主要なアーキテクチャ変更が導入されます。

• ティーザーによると、確認済み: リリース時刻は2026-08-26 23:00 (UTC+08:00)、ModelScopeにて。

未確認: 総パラメータ数またはアクティブパラメータ数、ライセンス条件、コンテキスト長、APIの提供有無または価格、そしてすべてのベンチマークスコア。重みがまだ公開されていないため、独立した評価はまだ存在しない。

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Qwen4アーキテクチャとは実際に何か

この物語を支えるのは2つのメカニズムである。最初のものは、Alibabaの線形アテンション層であるGDN(Gated Delta Network)だ。標準的なTransformerはシーケンス長に応じて増大するキー・バリューキャッシュを保持するのに対し、GDN層は固定サイズのリカレント状態を維持し、学習されたゲーティング規則でそれを更新する。その系譜はDeltaNetとMamba-2に遡る。その恩恵は、Qwen3-Next以来Qw​enシリーズを静かに支えてきたものだ。状態が増えないため長いコンテキストが低コストで維持され、一方で少数の完全アテンション層が混在して、線形アテンションが苦手とする正確な検索を担う。現在の世代では、その混合比は完全アテンション層1つに対しておよそGDN層3つとなっている。Qwen3.8-2.4T-A95Bチェックポイントのコミュニティ分析では、69のGDN層と23のアテンション層が数えられている。Qwen3.8-Flash-Nextは、まさにその系譜上で「GDNハイブリッドアーキテクチャ」と説明されている。

2つ目、QSA — Qw​en Sparse Attention — が真に新しい部分であり、これに関する公開技術説明はまだ存在しない。名前と、プレビューの2大変更点の1つとして位置づけられているだけである。その詳細の欠如自体が、パターンの一部である。2025年後半のQwen3-Nextプレビューでは、Gated DeltaNetが同じように文書化の乏しい状態で紹介され、そのアーキテクチャが完全に仕様化されたのは、Qw​en3.5シリーズが採用してからだった。読者にとっての実用的な教訓は、両方の場合で同じだ。アーキテクチャのカナリアが先に現れ、文書と本番モデルは後から現れる。

かつて一度成功したプレイブック

Alibabaはこれとまったく同じ手を以前にも打ったことがあり、それは功を奏した。2025年後半、Qwen3-NextはGated DeltaNetと、線形注意と完全注意のハイブリッドをプレビューした。Qw​en3.5シリーズが出荷されたとき、それはその設計図を大規模に採用した。そしてそのハイブリッドは、2.4Tフラッグシップを含め、それ以来Qw​en3.8世代を通じて引き継がれている。この前例がここで重要となる理由は、それが示唆するタイミングにある。完全なQwen4ファミリーは、このプレビューの中でではなく、そのかなり先に来ると見込むべきだ。Qwen3-Nextの間隔が何かの指針になるなら、「これがアーキテクチャです」と「これがファミリーです」の間の距離は、月単位で測られる。ティーザーにはそれを裏付けるものは何もない。それは、Alibabaが今や二度実行したパターンからの推論にすぎない。

私たちがまだ知らないこと

未知の要素こそがプレビューの本質であり、それらは現実なのだ:

• パラメータ。ティーザーは何も開示していない。XとRedditでのコミュニティの憶測(公式の裏付けはない)は、大きなn-gram埋め込みルックアップテーブルを持つ、合計約125B / アクティブ6Bの構成を指している。噂として扱うこと。

「「Flash」ティア。Qw​en3.5世代では、クラウド専用のQwen3.5-Flashは、オープンウェイトのQwen3.5-35B-A3Bの強化版でした。Qwen3.8-Flash-Nextが、同様のサイズのQw​en3.8モデルのオープンウェイト版に相当するかどうかは不明です。代わりに125B-A6Bクラスのモデルかもしれません。どちらの解釈も推測に過ぎません。

• ライセンス。Alibabaの最近のQw​enリリースは、Apache-2.0(Qw​en3.8-27B)から収益ゲート付きのQwen3.8-Maxライセンスまで多岐にわたります。Flash-Nextがどこに位置づけられるかによって、商用利用が可能かどうか、またどのような形で利用できるかが決まります。

• ベンチマーク。Qwenの声明はエージェンティックコーディング、長期的なタスク、マルチモーダル知能を強調しているが、数値は添付されておらず、重みが公開されるまで独立した評価はない。

2週間周期でイテレーションする家族

この発表のリズム自体がひとつの物語を語っている。2.4兆パラメータのフラグシップであるQwen3.8-Maxは8月3日にリリースされ、オープンウェイトのQwen3.8-2.4T-A95Bが8月12〜13日に続き、その数日後には無料のApache-2.0ライセンスのQw​en3.8-27Bが登場した。そして今、今月が終わる前に、次世代のアーキテクチャがプレビューされている。現在、このペースでイテレーションを繰り返している他のラボはない。モデルを選ぶ読者にとって、現実的な帰結は、『最高のQw​en』が移ろいゆく標的だということだ。そして世代間の差は、周囲のエコシステムが通常適応するよりも速い速度で訪れている。モデルではなく判断を買うことが、ますます理にかなった選択になりつつある。

今、開発者がすべきこと

計画すべきはアーキテクチャであって、モデルだけではない。Qwen3.8-Flash-Nextは、初日時点では未検証のプレビュー版となるだろう。独立したベンチマークはなく、ランタイムエコシステムもまだ追いついておらず、エージェント型やロングホライズンタスクでの強みについては、それを利用するワークロードにとって極めて重要であるにもかかわらず、ベンダーの主張しかない。安全な評価方法は、本番経路に組み込むことではない。リスクの低いワークロードのコピーをそのモデルに流し、出力を既存モデルと比較し、登場したばかりのオープンウェイトモデルを提供するプロバイダーが不具合を起こした瞬間を、自動フェイルオーバーに吸収させることだ。OrcaRouterでは、それはあなたがすでに使っているのと同じエンドポイントであり、同じキーである。Qwen3.8-Flash-Nextと現在のモデルは1つのAPIの背後に配置され、ルーティングDSLは、何かをコミットする前に、同じプロンプトでプレビュー版と既存モデルをA/B比較できる。

価格も、存在する場合は同じように解釈すべきです。AlibabaはFlash-NextのAPI価格を発表しておらず、未リリースのウェイトはどこにもルーティングできません。プロバイダーが価格を公開した場合、OrcaRouterはプロバイダーのリスト価格を0%マークアップでそのまま透過するため、Alibabaの数字がどうであれ、それが同じ日にそのまま表示されます。今日実際に利用できる最も近いベースラインはQwen3.8-Max(qwen/qwen3.8-max)です。これは、このアーキテクチャが最終的にその下に位置するフラッグシップで、100万トークンのコンテキストウィンドウ、入力トークン100万あたり2.00ドル、出力トークン100万あたり6.00ドル、リスト価格のまま提供されます。Flash-Nextの価格が下がったときは、その数字を頭に入れておいてください。次世代が超えるべきコストはそれです。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

今すぐ観るべきもの

リリースタイマーが切れた瞬間に重要なのは、4つのことです:

• パラメータ数とアクティブパラメータのティア — 噂にある125B-A6Bクラスのモデルなのか、それともより小規模なモデルなのか。

• ライセンス — Qwen3.8-27Bのように寛容なもの、またはMaxライセンスのように制限的なもの。

• 最初の独立した評価が、ベンダーのエージェントコーディングおよび長期タスクに関する主張を再現するかどうか — 信頼すべきはマーケティングの宣伝文句ではなく、数字である。

アリババは、完全なQwen4ファミリーがプレビューに続くまでにどれくらい待つのか。

それらのいずれもここからは知り得ない。今日知り得るのは、Alibaba が下した決断の形だ。すなわち、次世代アーキテクチャを旗艦に先立って公開する価値がある、という賭けである。その賭けこそがストーリーであり、重み(ウェイト)は明日公開される。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube