Qwen3.8-Flash-Next リリース — AlibabaのQwen4アーキテクチャプレビューの内部:再生成されたイラスト。
Guides & Insights

Qwen3.8-Flash-Next リリース:Alibaba の Qwen4 アーキテクチャプレビューの内部

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月26日にAli​babaが公開した最も有用な文書はプレスキットではなかった。技術レポートだったのだ。その日にリリースされたオープンウェイトのマルチモーダルMixture-of-ExpertsモデルであるQwen3.8-Flash-Nextは、「On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability」という論文とともに登場した。そして、そのレポートこそが本題である。それは、ベンダーのローンチイベントがほとんど決してやらないことをやっている。つまり、アブレーション研究、ネガティブな結果、トレーニングレシピの実験を公開し、それぞれの知見から、このモデルがプレビューすることを意図しているQwen4ファミリーのアーキテクチャへと線を引いているのだ。

8月26日に実際に出荷されたもの

モデル自体は、Qwenの2026年の水準からすれば控えめであり、それは意図的なものです。{{1}}Qwen3.8-Flash-Nextは、125Bのメインモデルパラメータに加え、別途51Bのn-gram埋め込みテーブルを保持しており、4Bのマルチトークン予測モジュールを含める前の段階で約176Bになりますが、トークンあたりにアクティブ化されるのはわずか6Bです。{{/1}} {{2}}これは512エキスパートの混合専門家(MoE)モデルで、トップ10ルーティングと48層を備え、ネイティブで262,144トークンのコンテキストを持ち、YaRNにより100万トークンまで拡張可能です。{{/2}} テキスト、画像、動画の入力を受け付け、テキストを出力します。ウェイトはHugging FaceとModelScopeでqwen-community-1.0ライセンスの下で公開されており、Alibaba自身のブログではこれを{{3}}「Qwen4を支えるアーキテクチャの実験的プレビュー」{{/3}}と呼んでいます——これは{{4}}Qwen3-NextがQwen3.5シリーズに対して果たした役割と同じであり、旗艦モデルに先立って飛ぶカナリアのような存在です。{{/4}}

同じ日、Ali​babaは商用版となるものを発表した。QwenCloud API上で提供されるビルド「Qwen3.8-Flash」で、入力トークン100万件あたり$0.16、出力トークン100万件あたり$0.47である。この2つは混同しやすいので、区別を明確にしておく価値がある。Qwen3.8-Flash-Nextは技術レポートが詳述するオープンウェイトのプレビュー版であり、Qwen3.8-Flashは価格設定された本番APIビルドで、デフォルトのコンテキストは100万トークン、Open​AI互換およびAnthropic互換のリクエスト形式を備える。価格もベンチマークもアーキテクチャの議論も、すべて同じエンジニアリングから派生している。

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

技術レポートにおける4つのアーキテクチャ賭け

この論文の背骨は、長文脈・低コストのフロンティアモデルがどうあるべきかについての4つの賭けであり、それぞれに実験的な裏付けが添えられている。

• Attention — GDN + QSAハイブリッド。4層のうち3層はGated DeltaNetを使用する。これは線形アテンション層であり、シーケンス長に応じて増大するKVキャッシュの代わりに、履歴を固定サイズのリカレント状態へと圧縮する。残りの層はQw​en Sparse Attentionであり、シーケンスをマイクロブロックに集約して低コストでスコアリングし、重要な領域にのみフルアテンションを実行する。Ali​babaは1Mコンテキストにおいて最大7.6倍のプリフィル高速化と4.9倍のデコード高速化を報告している。SGLang自身の初日ベンチマークではさらに高い数値が測定され、10.2倍と6.6倍に達した。90%のプレフィックスキャッシュヒット率では、プリフィルスループットはQwen3.7-Plusの8.6倍に達する。これらはベンダーおよびパートナーによる報告値であり、独立して監査されたものではない。

• 残差ストリーム — ゲート付き残差。単一の残差経路は、要素ごとの動的ゲーティングを備えた4つの並列ブランチに拡張される。Hyper-Connectionスタイルのマルチブランチ設計であり、GatedNormスタイルの制御を採用する。ゲートはブランチごとの読み出しと書き込みを調整し、論文によれば活性化の外れ値を抑制し、実用上は残差状態をFP8で保存できるようにする。

• エンベディング — 51Bのn-gramテーブル。トークンごとに1つのエンベディングを持つ代わりに、モデルは現在のトークンとそれ以前のトークンをキーとしてルックアップテーブルを引き、フレーズ全体や局所パターンを格納する。トークンあたりのコストはほぼゼロで、ルックアップアドレスは事前に分かっているため、ホストメモリに置いて非同期にプリフェッチでき、GPUメモリをまったく使用しない。これが、176Bの保存済みチェックポイントを75GBクラスのマシンで実行可能にする仕掛けであり、その起源はGemma 3nのレイヤーごとのエンベディングとDeep​SeekのEngramに遡る。

• 最適化 — Muon、チューニング済み。トレーニングでは、直交化ベースのモーメンタム手法であるMuonオプティマイザーを2次元線形マップ(アテンション、GDN、MoEエキスパート重み)に適用し、埋め込み、ルーター、低ランクパラメータにはAdamWを使用します。論文ではまた、読む価値のある否定的な結果も報告されています。バッチサイズのウォームアップは、何も改善せずにオプティマイザーのステップが18.8%多くかかることが判明したため、廃止されました。

ベンチマーク表を注意深く読んでください。

ここにある主要な数字はすべてQw​en自身のもので、モデルカードとレポートに公開されています。また、そのどれもが独立に再現されたわけではなく、このモデルは発表されたばかりで、まだ第三者による監査も受けていません。そう考えても、依然として印象的です。なぜならQwen3.8-Flash-Nextは、はるかに大規模で実績のあるDeepSeek-V4-Flash-0731と、60億のアクティブパラメータで互角に渡り合っているからです。

• DeepSWE 1.1 — 58.7 vs 54.4(ベンダー報告値)

• SWE-bench Pro — 62.5 vs 56.0(ベンダー報告)。

• Toolathlon 検証済み — 73.5 対 70.3(ベンダー報告値)

• LiveCodeBench v6 — 91.9 対 90.6(ベンダー報告値)。

• GPQA Diamond — 91.7 vs 90.8(ベンダー報告による)

• IFBench — 81.3 対 79.2(ベンダー報告値)

そして、レポートが公開しているミス: NL2Repo-Benchでは48.1に対しDeepSeek-V4-Flash-0731は54.2 — これはリポジトリレベルのコード生成における真の欠陥であり、小型モデルが及ばない唯一のエージェント型コーディングの側面です。Agents' Last Examは24.3対25.2で互角です。オフィス自動化については、Qw​enはCoWorkBench 73.9を報告している — しかし、それは社内ベンチマークであり、Ali​babaはそれを主要チャートから外している。

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

視覚に関しては、自己報告の表によると、AndroidWorldではQwenが84.5に対しClaude Opus 4.6 Maxが62.0、RealWorldQAではQwenが88.5に対しClaude Opus 4.6 Maxが73.9となっている。Humanity's Last Examは、QwenがClaude Opus 4.6 Maxに明確に敗北する唯一の主要指標だが、そのスコアの判定自体もGPT-4oによって行われたため、その比較もクリーンとは言えない。

価格:フラッグシップの12分の1。

そして、予算に響く数字がこれだ。QwenCloudでの{{1}}Qwen3.8-Flash{{/1}}提供版は、入力100万トークンあたり0.16ドル、出力100万トークンあたり0.47ドル。これは、Alibabaの旗艦モデルであるQwen3.8-Max(入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル)のおよそ12分の1の価格だ。しかも、このモデルはレポートによれば、Qwen3.7-Plusの約9分の1の計算量で訓練されたという。中国のモデルベンダー各社はこの夏、フラッシュ層の価格引き下げに注力してきたが、今回のリリースは、そのキャンペーンのQwen側が、単なる値引きではなくアーキテクチャ上の正当性を伴って着地したものだ。

カテゴリ全体を比較する人にとっては、すべてのプロバイダーが同じ数字を表示している方が計算が簡単です。OrcaRouterは、Qw​enファミリーの残り(Qwen3.8-Max、Qwen3.8-27B、Qwen3.8)を、プロバイダーのリスト価格で0%マークアップでルーティングします。そのため、ベンダーによる値下げは発表当日に当社側でも反映されます。Qwen3.8-Flash-Nextはまだ当社のカタログに載っていません。当社がルーティングするランタイムに到達した時点で、追加契約なしで同じワンキー・リスト価格の仕組みに組み込まれます。

今日、これでできること

初日からのサービングサポートは異例に幅広い。SGLangはクックブックページと専用イメージ(lmsysorg/sglang:qwen38flashnext)を提供している。vLLMにはvllm/vllm-openai:qwen38-flash-nextがある。NVIDIAはGB300 NVL72ラック上で両方のフレームワークに加えてTensorRT LLMを検証しており、FP8でGPUあたり毎秒16,000トークン以上を記録している。また、NeMoはファインチューニングにも対応している。データセンター規模より小さい環境では、このモデルはDGX Sparkクラスタと4×RTX PRO 6000ワークステーションで動作する。さらに、同じ日にリリースされたコミュニティ量子化トレイン(UnslothのGGUFと、RAM 75GBに収まりフル精度の約80%で動作する1ビットビルド)により、176Bストアドチェックポイントは小規模チームが所有するハードウェアでも実際に実行可能だ。実行するよりもAPIで呼び出したいチームは、アリババ自身のQwenCloudおよびいくつかのサードパーティプラットフォームを通じてQwen3.8-Flash APIにアクセスできる。ただし、大多数のアーリーアダプターが最初に手にするのはオープンウェイトだ。

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

そのリストの背後にあるVRAM計算の正体は{{1}}n-gramテーブル{{/1}}であり、サービングスタックが次に収束しつつあるのもそこです。{{2}}テクニカルレポートがGPUメモリ外に置く{{/2}}レイヤーごとの埋め込みは純粋なルックアップ構造であり、生成トークンごとにモデルが取得するのは{{3}}その3億2000万行のうち約16行{{/3}}だけで、それが{{4}}オフロードを安価にする{{/4}}理由です。vLLMは、{{6}}アーキテクチャ対応のプルリクエストがまだオープンである{{/6}}間、Qwen3.8-Flash-Nextを{{5}}専用の開発イメージから{{/5}}提供しています。そして、その作業の最新部分である{{7}}同じvLLM作者によるドラフトPR(vllm-project/vllm#54371、未マージ){{/7}}は、{{11}}VRAMを確保する代わりに{{/11}}{{9}}テーブルをホストメモリに保持し{{/9}}、{{10}}CUDAユニファイド仮想アドレッシング経由で読み取る{{/10}}、{{8}}PLE-Offloadサービングパスを追加します{{/8}}。FP8では、テーブルは{{12}}約173GBのチェックポイントのうちおよそ48GB{{/12}}を占めるため、オフロードするかどうかが{{13}}データセンターGPUと96GBカード1枚の違い{{/13}}を生みます——{{14}}RTX PRO 6000、またはDGX Spark 1台のユニファイドメモリプール{{/14}}です。これはまだ{{15}}初期段階{{/15}}なので、{{16}}現時点でサポートされているオプションというより方向性{{/16}}として扱ってください。しかし、これは{{17}}テクニカルレポートがすでに主張していたことに、ランタイムが追いついてきたもの{{/17}}であり、{{18}}VRAMの数値が足かせになっていたなら注目すべきもの{{/18}}です。

再現されていない数値しかない公開1日目のプレビューは、本番パスをそれに賭けるべきでない教科書的なケースであり、まさにそのためにフェイルオーバーがあります。ランタイムがQwen3.8-Flash-Nextを搭載し、すでに信頼しているモデルへの自動フェイルオーバー付きで1つのエンドポイントをそこに向けると、非クリティカルなトラフィックでは新しいアーキテクチャのメリットを得られ、苦戦する場面ではクリーンなフォールバックが得られます。配線のやり直しは不要です。なぜなら、それはコードの変更ではなくルーティングルールだからです。

このプレビューがQwen4について示すもの

アリババは以前にもこの手を使ったことがある。Qwen3-Next は2025年末に Gated DeltaNet を文書の薄い状態でプレビューし、アーキテクチャが完全に仕様化されたのは Qwen3.5 シリーズがそれを本格採用した後だった。そのパターンが繰り返されている。Qwen3.8-Flash-Next はカナリアであり、このレポートは実験による仕様化である。注目すべき具体的な点は、Qwen4 のフラッグシップが GDN と QSA の3対1分割を採用するかどうか、n-gram 埋め込みがフラッグシップ規模の本番サービスに耐えられるかどうか、そして最も重要なのは、独立した評価が6Bアクティブの優位性をより大きなモデルに対して確認するかどうかである。効率性のテーゼが正しければ、Qwen4 のフラッグシップは前世代よりも劇的に低いサービスコストで出荷される可能性がある。

よくある質問

Qwen3.8-Flash-Next と Qwen3.8-Flash は同じモデルですか?

いいえ、その区別が重要なのです。{{1}}Qwen3.8-Flash-Next{{/1}}は、技術レポートが分析対象とするオープンウェイトのアーキテクチャプレビューです。{{2}}Qwen3.8-Flash{{/2}}は、AlibabaがQwenCloud上で提供する本番APIビルドであり、100万トークンあたり$0.16/$0.47、デフォルトのコンテキスト長は1Mです。同じエンジニアリング系統に由来しますが、成果物は異なります。前者はセルフホスティングと検証用、後者は有料のマネージドサービスです。

本番環境のワークロードを今日移行すべきでしょうか?

セカンドオピニオンなしでは進めない。すべてのベンチマークはベンダー報告で未再現であり、アーキテクチャが新しいため、サービングスタックはまだ収束途上にある — vLLM自身のサポートもまだオープンプルリクエスト経由で取り込まれている最中だ — そして、エージェントコーディングのギャップの1つ(NL2Repo)は、まさに本番の開発者が直面する種類のタスクだ。オープンウェイトにより自己評価は安価にでき、day-0のSGLangとvLLMサポートで今週中のパイロットも可能だ。しかし、カットオーバーではなく、フェイルオーバーの背後でのパイロットこそが誠実な始め方だ。

実際のQwen4はいつ出荷されますか?

Ali​babaは何も発表していない。このリリースにおける唯一のタイミングシグナルは歴史的なものだ。最後のカナリア版であるQwen3-Nextは、Qw​en3.5シリーズがそのアーキテクチャを採用するおよそ1シーズン前にリリースされた。その周期に従えば、Qwen4のフラッグシップは見た目よりも近い——しかし、このレポートは明確にアーキテクチャに関するものであり、ロードマップではない。

結論

Qwen3.8-Flash-Nextは、論文そのものがプロダクトである稀有なリリースだ。モデル自体の正直なスコアカードはこう読める:ほとんどの共通ベンチマークで遙かに大規模なモデルに匹敵する6Bのアクティブパラメータ、リポジトリレベルのコードにおける名指しされたギャップ、フラッグシップの12分の1という提供価格、そしてフロンティアモデルがいかにして安価になるかに対するQw​enの回答であるアーキテクチャ。テックレポートはQwen3.8-Flash-Nextが何のためにあるのかを語っている——それはモデルそのものではない。それはQwen4となるアーキテクチャの証拠であり、Qwen4のリリース前に読む価値がある。なぜなら、それが変える決断とは、Qwen4が到来したときにあなたが下す決断だからだ。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube