記事『Qwen3.8-Flash-Next — リークレポート』のヒーロータイトルカード。「未確認 — QWEN4 アーキテクチャ プレビュー」バッジ、サブタイトル「Alibaba がモデルに先駆けて Qwen4 アーキテクチャを出荷」、3つのチップ「出典: @kimmonismus」「2026年8月25日」「リリース: 2026年8月26日 23:00 UTC+08」が付属する。左のカードは「主張: Qwen4 アーキテクチャをプレビューするオープンウェイトのマルチモーダル MoE」、右のカードは「ステータス: ウェイト未公開、公開まで約24時間」。OrcaRouter のロゴは右下隅に合成されている。
Guides & Insights

Qwen3.8-Flash-Next 登場:Alibaba が Qwen4 が存在する前に Qwen4 アーキテクチャを出荷

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Qwen3.8-Flash-Nextはついに、Alibabaが算出していない数値を手に入れた——しかもそれは、この話の最も声高なバージョンが語る内容とは一致しない。9月7日にv4.3へ改訂されたArtificial Analysis Intelligence Indexでは、Alibabaのオープンウェイト・プレビューは40点で、比較クラス内の113モデル中5位にランクされている。常に比較対象にされているモデル、DeepSeek V4 Flash 0731(Reasoning、Max Effort)は35点で9位だ。それは互角ではない。より小規模なモデルが5ポイントリードしているのだ。またこれは、今月まで公表された数値がベンダー自身のものしかなかったモデルに到達した、最初の広範で独立したスコアボードでもある。モデル自体は新しくない。重みは8月24日にHugging Faceで公開され、正式なModelScopeリリースは8月26日に登場した。今月変わったのは、読者がその主張を鵜呑みにするのではなく、検証できるようになったことだ。

この投稿を見直すきっかけを与えたのは、Xの@teortaxesTex氏による問いかけだった。そのプレビューは静かに過小評価されているのではないか——伝えられるところでは、DeepSeek V4 Flash 0731と同じArtificial Analysisのティアにあり、「ほぼ4分の1のサイズ」で、「アクティブパラメータがほぼ3分の1」だという。しかし、これら3つの主張のうち2つは、公表データと突き合わせると成り立たない。そしてこの訂正はモデルにとって有利に働く。なぜなら、重要な数値では、このプレビューは比較対象と同等ではなく、それを上回っているからだ。

まずはサイズから見ていきましょう。ここでは数字は明確です。Qwen3.8-Flash-Next はおよそ180Bのパラメータを保存しており——125Bのmixture-of-experts本体、独立した51Bのn-gram埋め込みテーブル、そして約4Bのマルチトークン予測層——、トークンごとにそのうち6Bをアクティブ化します。DeepSeek V4 Flash 0731 は284Bを保存し、13Bをアクティブ化します。これらはQwenのモデルカードとDeepSeekのドキュメントに記載されている数値であり、Artificial Analysisが両方のモデルページに掲載している数値でもあります。そこから導き出される比率は1.6x(保存パラメータ数)と、2.2x(アクティブパラメータ数)です。これは紛れもない効率化の話であり、このアーキテクチャが重要である理由でもあります——しかし4倍ではなく、3倍でもありません。より大きな倍率を裏付ける公表された数値は、どこを探しても見つかりませんでした。意図していたのがパラメータ数ではなく提供時のメモリフットプリントだったとしても、その数値もまた公表されていません。

何が発表されたのか

Aliba​baはQwen4モデルを公開する前にQwen4アーキテクチャを公開した。Qwen3.8-Flash-Next — 次世代アーキテクチャ上に構築され、Qwen4ファミリーを支えるオープンウェイトのマルチモーダルMoEモデル — は2段階で登場した。公式のQw​en/Qwen3.8-Flash-Nextリポジトリは8月24日にHugging Faceで公開され、ティーザータイマーが指し示していたModelScopeリリースの2日前だった。正式なModelScopeでの公開は8月26日23:00 UTC+08:00に行われ、提供されるQwen3.8-Flashバリアントの価格も同時に発表された。モデルカードの見出しの主張は、それ以来広まっているが、トークンあたり6Bパラメータを活性化するモデルが、Aliba​ba自身の表で比較可能な9つのベンチマークのうち8つでClaude Opus 4.6 Maxを上回るというものだ。完全なQwen4ファミリーは後で登場すると、Aliba​baは繰り返し述べている。

今月のAlibabaのリリースペースを追っていないなら、基準となるのはQwen3.8-Maxだ。8月3日にリリースされ、それから2週間も経たずにQwen3.8-2.4T-A95Bとしてオープンソース化された、2.4兆パラメータのフラッグシップモデルである。Qwen3.8-Flash-Nextの重みが公開されたのは、さらにその1か月も経たないうちだ。2.4兆パラメータのオープンウェイトモデルを世に送り出した同じラボが、今度はその次の世代のアーキテクチャを配っている——その世代のフラッグシップに名前すら付く前に。

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

読み返す価値があるのは、Alibaba自身の位置づけだ。このモデルは、「今後のQwen4ファミリーを支える」次世代アーキテクチャ上に構築されたものと説明されており、Qwen4そのものではないと明言されている。Alibabaが示した理由は、ファミリーが登場する前にアーキテクチャの変更をコミュニティの手に委ねておくことで、本物が出荷されたときにランタイム、量子化、アプリケーションが整っているようにするためだ。これはマーケティング上の立場だが、技術的なコミットメントでもある。つまり、難しい部分を先にプレビューし、コミュニティを巻き込んでいく、ということだ。

モデルカードが解決するものと、解決しないもの:

公式モデルカードで確認済み:Qwen3.8-Flash-Nextは、Qwen4アーキテクチャに基づくオープンウェイトのマルチモーダル混合エキスパートモデルであり、カードには「Qwen4の基盤となるアーキテクチャの実験的プレビュー」と記載されている。

• モデルカードと設定によると、確認済み: 2つの主要なアーキテクチャ変更 — Gated Delta Network (GDN) と Qw​en Sparse Attention (QSA) — が48層のハイブリッド内にあり、36の線形アテンション層と12のフルアテンション層で構成されています。

• リポジトリで確認済み:総パラメータ数は125Bで、トークンあたり6Bを活性化(512エキスパート、ルーティング10+共有1)— 別個の51B n-gram埋め込みテーブルとMTP層を数えると、Artificial Analysisは180Bと記載 — ネイティブコンテキストは262,144トークンで、Qwen Community License 1.0の下、1,000,000まで拡張可能。

• もはや未確認ではない。このモデルは今や二度にわたり独立して評価されている。Alibabaの表は依然としてベンダー自身によるもので、依然として再現されていないが、もはや場にある唯一の証拠ではない。

最初の独立したスコアが出ました——そしてそれは「互角」ではなく「リード」を示しています

Artificial Analysis は9月7日に Intelligence Index v4.3 を公開した。そして、これらがそもそも比較可能なのは、この再スコアリングがあるからだ。v4.3 のアップデートでは、Terminal-Bench v2.1 がはるかに難易度の高い Terminal-Bench v4.0 に置き換えられ、τ³-Banking は、657 のタスクからなる非公開のホールドアウトテストセット上で Zapier とともに構築されたエージェント型ワークフロー・ベンチマーク AutomationBench-AA に差し替えられた。非公開ホールドアウトの重み付けは45%に上昇した。公表された目的は、フロンティアがインデックスをゲーム化するのを防ぐことだったが、スコアへの影響は大きかった。首位の2モデルである GPT-6 Astra と Claude Fable 5.1 は、旧スケールでは60台のスコアが付けられていたが、どちらも53に落ち着いた。

コミュニティの数値を見るときには、この点が重要になる。9月上旬に Qwen3.8-Flash-Next と DeepSeek V4 Flash 0731 について出回った「56 対 52」という数字は、v4.3 より前のインデックスで算出されたものだ。v4.3 では、このペアは 40 と 35 になる。どちらか一方の数値をもう一方と並べて引用するのは、異なる二つの試験を比べているにすぎない。

現在のインデックスにおいて、Artificial Analysis自身の評価で2つのモデルが実際にどう比較されるかは以下のとおりです:

• インテリジェンス指数 — Qwen3.8-Flash-Next 40(同クラス113件中5位)対 DeepSeek V4 Flash 0731(推論、最大エフォート)35(113件中9位)。

• エージェント型ナレッジワーク — AA-Briefcase 1587 対 1259、GDPval-AA v2 1647 対 1468、AutomationBench-AA 56% 対 54%。

• ターミナルとコーディング — Terminal-Bench v4.0 25% 対 12%、SciCode 51% 対 50%。

• 一般的および科学的推論 — Humanity's Last Exam 38% 対 39%、CritPt 11% 対 17%、GDP.pdf 16% 対 11%、AA-LCR v1.1 80% 対 80%。

• 事実の想起 対 作話 — AA-Omniscience −10 対 −14、Qwen preview に4ポイントの優位。

• 価格 — 入力100万あたり$0.15 / 出力100万あたり$0.47 対 $0.44 / $1.32、ブレンド $0.0882/100万トークン 対 $0.2298。Intelligence Indexタスクあたりのコスト: $0.37 対 $0.22。

• 速度とレイテンシ — 毎秒53出力トークン 対 210;初回トークンまでの時間 2.80秒 対 0.98秒;エンドツーエンド応答 49.76秒 対 12.88秒;タスクあたりの時間 1,572.60秒 対 221.65秒。

• トークン使用量 — タスクあたりの出力トークンは62kに対し108k、うち推論トークンは45kに対し72k。Artificial Analysisはこのプレビューを「非常に冗長」で「平均より遅い」と評している。

• コンテキストとサイズ — 256kトークン 対 1,000k、合計180B / アクティブ6B 対 284B / 13B。

合わせて読めば、それは「同じティア」よりも鋭い答えになる。Qwen3.8-Flash-Next は、Artificial Analysis が測定するほぼすべての軸において、精度と効率の議論で勝っている。より高スコアのモデルであり、より小さく、トークンあたりのコストは約3分の1だ。DeepSeek V4 Flash 0731 は、本番運用の議論では完全に勝っている。スループットは4倍、エンドツーエンドのレイテンシは4分の1、完了タスクあたりの実時間は7分の1、そしてコンテキストウィンドウは4倍である。そして完了タスクあたりのコスト——トークンの冗長さを経てもなお残る数字——では、表示価格が高いにもかかわらず、DeepSeek のほうが $0.22 対 $0.37 で安い。もし「過小評価」が「パラメータあたりの品質が評判以上に優れている」という意味なら、そのレッテルは妥当だ。もし「代わりにこれを使うべきだ」という意味なら、速度とレイテンシの列がそうではないと告げている。

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysisの外部にも独立した証拠がある。サードパーティ製ハーネスsmf-benchは9月5日に「Official A」の実行を公開した。単一のDGX Spark上で、NVIDIAのNVFP4量子化によるQwen3.8-Flash-Nextをthinking offで走らせ、157点中137点(87.3%)を獲得し、コーディングセクションでは30点中30点をクリーンに記録した。一方、同じ157テストのハーネス上での2台のSparkによるDeepSeek V4 Flash Vision-Exp実行は157点中117点だった。これは1つのマシンクラス上の1つのハーネスにすぎず、広範な評価の代替にはならない — しかし、同じ方向を指す2つ目のデータ点であり、どちらのベンダーにも利害関係のない人物から届いたものである。

Qwen4アーキテクチャとは実際に何か

物語を担う仕組みは2つある。1つ目、GDN — Gated Delta Network — はAlibabaの線形アテンション層だ。標準的なトランスフォーマーが系列長に応じて成長するキーバリューキャッシュを保持するのに対し、GDN層は固定サイズの再帰状態を維持し、学習されたゲーティング規則で更新する。その系譜はDeltaNetとMamba-2に連なる。その見返りは、Qwen3-Next以降Qwenラインを静かに支えてきたものだ。状態が成長しないため長いコンテキストは低コストなままで、一方で少数のフルアテンション層が混在し続け、線形アテンションが苦手とする精密な検索を担う。現行世代では、その混合比はフルアテンション層1層につきおよそGDN層3層だ — Qwen3.8-2.4T-A95Bチェックポイントのコミュニティ分析では、GDN層69層対アテンション層23層と数えられている。Qwen3.8-Flash-Nextも同じ3対1の分割を示す。線形アテンション層36層対フルアテンション層12層だ。

2つ目、QSA — Qwen Sparse Attention — は真に新しい部分であり、その公開説明は依然として薄い。モデルカードには、512ブロック/2048トークンのバジェットでマイクロブロックレベルで動作すると追記されているが、完全な技術解説はまだ存在しない。この詳細の乏しさ自体がパターンの一部だ。2025年後半のQwen3-Nextのプレビューでは、同じく薄い文書とともにGated DeltaNetが導入され、そのアーキテクチャが完全に仕様化されたのはQwen3.5シリーズがそれを採用してからだった。読者にとっての実用的な結論はどちらの時も同じだ。アーキテクチャのカナリアが最初に現れ、文書と実運用モデルは後から現れる。

かつて一度成功したプレイブック

Aliba​baは以前にもこのまったく同じ手を打ったことがあり、それはうまくいった。2025年後半、Qwen3-NextはGated DeltaNetと、線形アテンションとフルアテンションのハイブリッドをプレビューした。Qwe​n3.5シリーズが登場すると、それはその設計図を大規模に採用した——そしてそれ以来、そのハイブリッドは2.4Tフラッグシップを含むQwen3.8世代まで引き継がれている。ここでこの前例が重要なのは、それが示唆するタイミングのためだ。Qwen4ファミリー全体は、このプレビューの向こう側に期待されるべきであり、その内側ではない。Qwen3-Nextの間隔が何らかの手がかりになるなら、「これがアーキテクチャだ」と「これがファミリーだ」の間の距離は数か月単位で測られる。モデルカードにはそれを裏付けるものは何もない——それは、Aliba​baが今や二度実行したパターンからの推測である。

私たちがまだ知らないこと

未知の部分は縮小したが、消え去ったわけではない:

• ベンダーのベンチマーク表は依然としてベンダー自身のものである。Artificial Analysis が今回このモデルを独自に採点したことで、ローンチ報道における最大のギャップは解消された——しかし、Aliba​ba 自身の看板主張、すなわちこのモデルが比較可能な9つのベンチマークのうち8つで Claude Opus 4.6 Max を上回るという主張は、Aliba​ba 独自の社内評価(CoWorkBench、JobBench、AndroidWorld)と公開ベンチマークに依拠しており、それらのいずれも第三者によって再現されていない。

• プレビューが提供されているモデルと同じモデルかどうか。モデルカードは Qwen3.8-Flash-Next をオープンウェイトの実験的プレビューとして位置づけている一方、本番で提供されるバリアント — Qwen Cloud の Qwen3.8-Flash — はデフォルトで 1,000,000 トークンのコンテキストと組み込みツールを追加する。その提供モデルがより大きなコンテキストウィンドウの下で同じアーキテクチャなのかはまだ明記されておらず、上記の独立したスコアは提供されている API モデルではなく、オープンウェイトのプレビューに対するものである。

• ライセンスは既知であり、実在するライセンスです: Qw​en Community License 1.0 は商用利用を許可し、派生作品の販売も含みますが、Model-as-a-Service または AI ワークアシスタント事業を、定義された売上高および月間アクティブユーザー数のしきい値を超えて運営する場合は、Aliba​ba との別途商用契約が必要です。これは収益で制限された Qwen3.8-Max ライセンスとは異なりますが、重みの上に構築する前に読む価値があります。

• 注目に値する現場報告が1件ある:9月6日のコミュニティNVFP4ビルドに関する記事は、thinkingとマルチトークン予測の両方が有効なときに、文法制約付きツール呼び出しの失敗を記録しており、原因はxgrammarの制約付きデコーディング経路に特定されている。これはモデルの特性ではなく、量子化されたコミュニティビルドにおけるランタイムバグだ——とはいえ、評価ハーネスが文法制約付きツール呼び出しに依存しているなら、それが最初にテストすべきものだ。

2週間周期でイテレーションする家族

周囲のリリース・ペースそのものが一つの物語になっている。2.4兆パラメータの旗艦Qwen3.8-Maxは8月3日に公開され、オープンウェイトのQwen3.8-2.4T-A95Bが8月12~13日に続き、無償のApache-2.0 Qwen3.8-27Bが数日後に登場した。そして今、今月が終わる前に、次世代のアーキテクチャが予告され、その1週間後に独立したベンチマークが行われている。現在、この時計で反復開発を進めているラボは他にない。モデルを選ぶ読者にとっての実用的な帰結は、「最高のQwen」が動く標的だということだ。そして世代間の差分は、周囲のエコシステムが通常適応するよりも速く到来している。モデルではなく意思決定を買うことが、ますます擁護可能な一手になっている。

今、開発者がすべきこと

効率の数値は、ローンチ自体よりも、ローカルで提供する際の判断を大きく変える。現行インデックスで40を記録する6Bアクティブモデルは圧縮可能だ。NVIDIA公式のNVFP4量子化は、9月5日のsmf-bench実行で使われたものであり、それ以外にもコミュニティによるNVFP4およびFP8ビルドがすでに出回っている。これにより、180Bで保存されたモデルの単一GPUクラスでのデプロイがそもそももっともらしくなる。注意点は変わらない。これは実証されていないプレビューであり、ベンダー表は再現されておらず、独立系スコアの形状(ナレッジワークとターミナルタスクでは強く、長期的なリポジトリ生成とワンショットのエージェント合格率では弱い)は、モデルの弱点がまさに本番コードの変更が存在する場所で現れることを意味する。重要なものに触れる前に、実際のワークロードの低リスクなコピーをそれに対して実行し、プレビューが不具合を起こす瞬間は自動フェイルオーバーに吸収させよう。

価格について言えば、ローンチ時に不透明だった全体像が今や具体的になっている。Artificial Analysisは、プレビューの提供レートを入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドルと記載しており、DeepSeek V4 Flash 0731の0.44ドルと1.32ドルと対比している — 提供中のQwen3.8-Flashバリアントと同じ桁であり、Qwen Cloudはそれを¥1と¥3(およそ$0.16と$0.47)と記載している。プロダクションバリアントは、今日実際に呼び出せるものだ。ここでは次のようにルーティングされている:qwen/qwen3.8-flash、そしてOrcaRouterはベンダーの定価を0%のマークアップでそのまま通しているため、Alibabaがその数字を動かせば、エンドポイントも同じ日にそれに追随する。この記事の比較モデルも同様だ — DeepSeek V4 Flash 0731は次のようにルーティングされている:deepseek/deepseek-v4-flash-0731、プロバイダーの定価で、これにより上記の対決のトークンあたりコストの部分は、ベンチマークのトークン数ではなく、自分のトラフィックに対して検証可能になる。ここでルーティングされていないのは、オープンウェイトのFlash-Nextプレビューそのものです:今日それを使うには、重みを取得して自分で提供する必要があり、まさにそれが、上記の量子化の話が定価よりも重要である理由だ。この世代が超えなければならない天井は、同じエンドポイント上で依然として見える:Qwen3.8-Max(qwen/qwen3.8-max)は入力100万トークンあたり$2.00、出力100万トークンあたり$6.00で、これもベンダーの定価でそのまま通されている。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

実務上の順序はほとんど変わっていないが、その背後にある確信は変わった。100GBの重みを引っ張ってくることなく提供済みの本番向けバリアントを使いたいなら、Qwen3.8-Flashはすでに定価で呼び出せる。アーキテクチャ——GDN、QSA、n-gramテーブル、オフロードの仕掛け——が欲しいなら、重みはダウンロード可能で、ランタイムも準備できている。vLLMは初日から、51Bパラメータのn-gram埋め込みテーブルを恒久的なVRAMではなくホストメモリに保持するオフロード経路でこれを提供し、SGLangとTensorRT-LLMはNVIDIAのDay 0リストに入っており、OllamaのライブラリにはApple Siliconで取得できるMLXビルドが用意されている。やめるべき唯一のことは、このモデルの品質を未知数扱いすることだ。今や測定済みであり、その測定結果は良好だった。

次に見るもの

• インデックスが成熟するにつれて、独立した数値が維持されるかどうか。Qwen3.8-Flash-Nextの40は、異常に高いトークン消費を伴う——インデックス実行で2億4500万トークンを消費し、中央値の1億4000万トークンに対してだった——そしてArtificial Analysis自身の注記はそれを「非常に冗長」と呼んでいる。より長く推論して生み出されたスコアもスコアではあるが、評価が変われば動く類のものだ。次回のインデックス改訂こそ、40が水準だったのか局所的最大値だったのかを試す真の試練である。

• 提供されるQwen3.8-Flashが別途スコア評価されるかどうか。本記事中の独立した数値はすべて、オープンウェイトのプレビュー版に関するものである。1Mコンテキストと組み込みツールを備えた製品版には、それ独自の独立したスコアは存在せず、もし longer context の下で同一アーキテクチャであるなら、それは誰かが公表すべき安価な評価である。

• Day-0 サービング対応は実運用でどこまで持ちこたえるのか — ベンダー公称の GB300 スループット値は依然としてベンダー公称にすぎず、TP4 の expert-parallel および KV-offload 構成は、まだ新しく脆弱と言える段階にある。

• 完全なQwen4ファミリーがプレビューに続くまで、Aliba​baはどれだけ待つのか。

この話の「これまでにわかっていること」の部分は、今やほぼ決着した。仕様表は公開され、重みはダウンロード可能で、アーキテクチャは確認済み、提供されている Qwen3.8-Flash バリアントはホスト型 API 上で定価により稼働しており、モデルは2つの別々の主体によって独立に評価されている——小さい方のモデルが品質の議論で勝ち、大きい方のモデルがスループットの議論で勝った。未解決なのは、6B アクティブのプレビューが、チューニング対象としたベンチマークを超えて汎化するかどうか、そして完全な Qwen4 ファミリーが続くまでに Alibaba がどれだけ待つかだ。その最後の問いは、今回のリリースが依然として答えを出していないものであり、依然として最も重要になるものである。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新