Qwen3.8-Flash をご紹介 — Qwen4 アーキテクチャを先取りするオープンウェイトのマルチモーダル MoE。再生成されたイラスト。
Guides & Insights

Qwen3.8-Flashのご紹介:Qwen4アーキテクチャを先取りしたオープンウェイトのマルチモーダルMoE — QwenCloudでは100万トークンあたり$0.15/$0.47

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月26日、QwenチームはQwen3.8-Flashの基となる重みをオープンソース化しました。これはHugging FaceとModelScopeで「Qwen3.8-Flash-Next」という名前でリリースされ、またQwenCloud API上でQwen3.8-Flashの名称を持つ本番モデルをローンチし、翌日に正式な価格を確認しました。見出しとなる数字は、8月28日のAlibaba自身の発表で公式に確認されたもので、1,250億パラメータのマルチモーダル混合エキスパート(MoE)モデルであり、トークンあたり約60億パラメータのみを活性化し、約95%のスパーシティを実現しています。このモデルは、Alibabaが明示的にQwen4世代の初期プレビューと説明するアーキテクチャに基づいています。本番APIはQwenCloudで稼働中で、入力トークン100万件あたり0.15ドル、出力トークン100万件あたり0.47ドル、キャッシュヒット時は100万件あたり0.016ドルです。これはAlibabaの次期フラッグシップから構造的に派生したものを実行する最も安価な方法であり、完全なモデルファミリーが存在する前に、研究室がアーキテクチャプレビューを公開オープンウェイトとして出荷した初めてのケースでもあります。

スペックシートの中で、たったひとつの数字が他すべてより重い意味を持つ——それが6Bだ。Qwen3.8-Flashの能力は、むやみなサイズから来ているわけではない。計算をどこに注ぎ込むか、その設計から来ているのだ。125BのMoE本体、51BのNグラム埋め込みテーブル、そして小さなマルチトークン予測モジュール——これらはディスク上に約180Bのパラメータを蓄えているが、各トークンが実際に通るのはそのうちわずか6Bだけだ。それこそが、今回のリリース全体が賭けている点であり、訓練コストをここまで引き下げられた理由でもある。

実際に出荷されたもの

Qwen3.8-Flash(サフィックスなし)は、本番環境向けに製品化されたモデルで、現在QwenCloud APIとAlibabaのQwen Office製品内で稼働しています。デフォルトで100万トークンのコンテキストと組み込みツールを備え、100万トークンあたり$0.15/$0.47、キャッシュヒット時は$0.016です。8月28日には利用可能な範囲が拡大し、Alibabaの発表によると、Qwen3.8-FlashはオープンソースのターミナルコーディングエージェントであるOpenCode Goの定額制サブスクリプションを通じても利用できるようになりました。OpenCode自身のモデルリストには、qwen3.8-flashとして同じ$0.15/$0.47(100万トークンあたり)の料金で掲載されています。

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

公式のQw​en Studio発表では、オープンウェイトのリリースをエコシステムへの招待として位置づけている。完全なQwen4ラインナップが構築される前に、コミュニティと推論スタックが適応できるよう、構造的な変更を早期に送り出すというものだ。その効果が表れた最初の兆候は、LMSYSが支援する推論エンジンSGLangが、発表当日にQwen3.8-Flash-Nextのデイゼロサポートを公開したことだ。このモデルはTransformers、vLLM、TokenSpeedにも対応するよう設定されている。

建築は物語である

これはQwen 3.8世代モデルを縮小したものではありません。Qwen3.8-Flashは、チームがQwen4ファミリーが受け継ぐと述べる4つの変更を導入しており、それぞれが異なるボトルネックを対象としています。

• アテンション — Gated DeltaNet と Qwen Sparse Attention。Gated DeltaNet(GDN)は、4層のうち3層で履歴を固定サイズの状態に圧縮するため、モデルは各ステップで全てを読み直す必要がありません。QSAは長いコンテキストを検索問題として扱います。軽量なインデクサーがシーケンスをマイクロブロックに集約し、ブロックレベルの重要度をスコアリングして、最も関連性の高い領域へ注意を向けます。Alibabaの測定によると、QSAアテンションカーネルは1Mトークンのコンテキストにおいて、プリフィルで最大7.6倍、デコードで最大4.9倍高速になります(ベンダー報告)。

• 残差 — ゲート付き残差。単一の残差ストリームは、要素単位のゲーティングを備えた4つの並列ブランチになり、ネットワークがトークンごとに各ブランチの読み書き量を決定できるようにする。1つのブランチは、初期のアテンション層を深い層に接続する長距離チャネルとして機能する。残差状態はFP8で保存され、メモリ帯域幅を削減する。

• 埋め込み — N-gram埋め込み。現在のトークンとその前のいくつかのトークンをキーとする51Bパラメータのルックアップテーブル。これはトークンごとの計算を増やさずに容量を追加し、テーブルはホストメモリに置いて非同期にプリフェッチできるため、GPUメモリを恒久的に占有しません。

オプティマイザ — Muon。大きな2D線形パラメータ(アテンション、GDN、MoEエキスパート)はMuonで学習し、埋め込み、ルーター、Gated Residualの低ランク部分はAdamWを維持する。チームはこの構成に合わせて、新しいアーキテクチャのスケーリング則を再適合させた。

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

開発者にとって、このうち2つはすぐに重要です。アテンションスタックは、100万トークンのコンテキストが挑戦目標ではなくデフォルトになり得る理由であり、N-gramテーブルは、125Bモデルが軽量なまま提供できる理由です。残りはQwen4のプレビュー素材であり、Alibabaはまさにそのように位置づけています。

正直に表示されたベンチマークシート

{{1}}このセクションの数値はすべてAlibaba自身の評価であり、本稿執筆時点で公開から1日しか経過しておらず、独立した研究機関による再現はまだ行われていません。これらは確定スコアではなく、方向性を示す参考値としてご覧ください。{{/1}}{{2}}Alibabaのスイートでは、Qwen3.8-Flash-Next(6B active)がSWE-bench Pro 62.5、DeepSWE 1.1 58.7、CoWorkBench 73.9、AndroidWorld 84.5、MathVision 95.7を記録し、JobBenchスコアは55.7です。{{/2}}{{3}}また、ベースモデルのQwen3.8-Flash-Next-Baseは、MMLU-Pro、SuperGPQA、BBH、MMMUを含む14ベンチマーク中8つで、直接比較で最良のオープンモデルとして報告されています。{{/3}}

アリババのファミリープレースメントに関する主張は、それが何であるか——つまり主張であると、明確にラベル付けされるべきだ。同社は、Qwen3.8-Flash が SWE-bench Pro で Claude Opus 4.6 を9.1ポイント上回り、JobBench ではおよそ20ポイント上回り、Claude Opus 4.8 に肉薄すると述べている。すべてベンダーによる報告であり、すべて未再現だ。現在独立に検証可能なことはより限定的だ:ウェイトは公開され、推論スタックはすでにそれを実行でき、SGLang は同日にサポートをリリースした。ベンチマーク結果の独立した再現は、数週間ではなく数日で実現できるだろう。

料金

価格設定は検証するのが最も簡単な部分です。なぜなら、それはベンチマークではなく公開された価格だからです。そして8月27日、Alibabaは本番QwenCloudのレートを正式に確認しました: 入力トークン100万件あたり$0.15、出力トークン100万件あたり$0.47、キャッシュヒット100万件あたり$0.016、中国国内レートは¥0.8/¥2.7/¥0.1です。キャッシュヒットの数値はエージェント型ワークロードにとって重要です。毎ターン大きな履歴を読み直す長文脈エージェントは、繰り返し読み取りでわずかなコストしか支払いません。これはまさにQwen4-previewのアテンションスタックがターゲットとするワークロードです。中国の報道機関は直ちにヘッドライン価格を同業他社と比較しました—DeepSeek-V4-Flashの請求額のおよそ3分の1であり、フロンティアのクローズドモデルと比較すると誤差のようなものです。Alibaba自身の会計では、トレーニング実行のコストはQwen3.7-Plusの約9分の1であり、その構造的レバレッジがAPI価格を現在の水準に位置づけているのです。

Qw​en 3.8ファミリーの他のモデルと並べると、その差は歴然としている。フラッグシップのQwen3.8-Maxはトークン100万件あたり$2.00/$6.00で課金され、OrcaRouterではすでにプロバイダー定価のまま、マークアップゼロで利用可能だ。本番向けQwen3.8-Flash APIが公開された今、同じパススルーが公式の$0.15/$0.47レートと$0.016のキャッシュヒットレートにも適用される。ルーティングレイヤーがあるかどうかで、値下げについて読むだけか、それを設定に反映できるかが変わる。両モデルを1つのキーで利用でき、それらの間のフェイルオーバーも可能で、追加契約も不要だ。

「Qwen4のプレビュー」とはどういう意味か

発表を文字通りに読めば、賭けられているものは明らかだ。これはQw​en 3.8の新しいティアではなく、Qwen4のアーキテクチャを早期にリリースしたものであり、より小型で安価なモデルという保護的なブランドを冠している。そうする理由は理にかなっている。フレームワーク、量子化、デプロイパターンには成熟のための時間が必要であり、6Bアクティブモデルは、Alibabaがその上に高価なものを構築する前に、コミュニティがGDN + QSAを大規模にストレステストするための安価な手段だからだ。裏を返せば、本番のQwen3.8-Flashは、より広いエコシステムがまだ監査中のアーキテクチャ上に構築されたAPIである。アーリーアダプターは、構造上、テストセットなのである。

試すための最短ルート

現在、現実的な選択肢は4つあります。vLLM、SGLang、Transformers、またはTokenSpeedでオープンウェイトをセルフホストする — FP8ビルドは、フルノードに満たない環境では最初に試すべき賢明な選択肢です。QwenCloud APIを呼び出す — 公式の$0.15/$0.47レートで現在提供中で、キャッシュヒット時は$0.016です。OpenCode Go内で使用する — オープンソースのターミナルコーディングエージェントの定額サブスクリプションで、今週Qwen3.8-Flashが追加されました(8月28日にAlibabaが発表し、OpenCode自身のモデルリストでも確認済み)。または、既にQwen3.8-Maxを呼び出しているのと同じ方法で、ルーター経由で本番版Flashを呼び出す — 公式レートをマークアップなしでそのまま適用するため、専用の統合を維持する必要はありません。

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

率直な問いこそが本質的な問いである。60億のパラメータを活性化するモデルは、多様なワークロードにおいて本番環境で耐えられるのか。それとも、今日は出来立てに見えるベンチマークシートが、一ヶ月後も同じように見えるのだろうか。それは待つ理由にはならない。スタック全体の前面に置くのではなく、フェイルオーバーの背後に配置する理由である。ウェイトは公開され、価格も設定され、アーキテクチャはAlibabaが表明した方向性である。次の数週間で、6Bで十分だったかが決まる。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube