Qwen3.8-Flash-Next vs Qwen3.8-27B — Qwen4-preview MoEとオープンウェイトの主力モデルの比較。再生成されたイラスト。
Guides & Insights

Qwen3.8-Flash-Next 対 Qwen3.8-27B:オープンウェイトの主力モデルに挑む Qwen4-preview MoE

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Qwen3.8-Flash-Nextについて驚くべき点は、Alibabaがトークンあたりわずか60億パラメータしか活性化しないモデルでオープン系モデルの大半を凌駕すると主張していることではない。その推論(サービング)に、比較対象である270億パラメータのdenseモデルよりも多くのメモリが必要だということだ。2026年8月26日にQwen4アーキテクチャのプレビューとしてオープンソース化されたQwen3.8-Flash-Nextは、VRAMではなくシステムRAM上に510億パラメータのN-gramルックアップテーブルを保持する。8月中旬にリリースされたApache-2.0ライセンスのマルチモーダルdenseモデルであるQw​en3.8-27Bは、現行のQw​en 3.8世代におけるオープンウェイトの主力モデルであり、4ビットなら単一の24GBグラフィックカードに収まる。Alibaba自身のベンチマークシートでは、新しいMoEは比較された22件のベンチマークのうち21件で27Bを上回っている。しかし独立したエビデンス(アリーナ順位、法務エージェントの研究、第三者によるスループット測定)を見れば、そうした実績があるのは2つのうち27Bだけだ。この組み合わせこそが、判断のすべてである。

1行で表す対決:同じ世代に属するオープンウェイトのテキスト+ビジョン対応モデル2つ。ネイティブコンテキストはどちらも262K、どちらもデータセンター外での実行を想定して設計されている。しかし、アーキテクチャ、ライセンス、価格、そして検証された実績の度合いで両者は分かれる。Qwen3.8-Flash-Nextは、Qwen4が受け継ぐと期待されるすべてを先取りするスパースMoEだ。Qw​en3.8-27Bは、Alibabaが2.4Tのフラッグシップを構築して得た知見を、単一GPUで実行可能なサイズに凝縮したデンスモデルである。この2つからの選択は、能力の問題ではない——Alibabaによれば先行しているのはプレビュー版の方だ——むしろ、コミュニティがすでに徹底的に分析したモデルと、公開から1日しか経っていないベンダー資料のどちらを信頼するかという問題である。

スコアボード

ソーシングの話を先に:以下のQwen3.8-Flash-Nextの数値はすべてAlibaba自身のもので、1日前のものであり、まだ再現されていません。Qw​en3.8-27Bの主要ベンチマークの主張もAlibabaの報告ですが、27Bには独立した結果——人間の好みによるアリーナ順位、法務領域の研究、AMDスループット測定——があり、プレビューはそれに及びません。

総パラメータ数 — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP(保存時 ~180B)、アクティブ 6B。Qw​en3.8-27B: ~27B dense(ビジョンエンコーダ込みで 28B)、すべてアクティブ。

アーキテクチャ — Qwen3.8-Flash-Next: Qwen4プレビュー — Qwen Sparse AttentionとGated DeltaNetの交互配置、ゲート付き残差接続、N-gram埋め込み、Muon学習。Qwen3.8-27B: GDN線形アテンションレイヤー48層+フルアテンションレイヤー16層(3:1)、高密度。

• コンテキスト — ネイティブで262,144トークン、YaRN経由で1Mまで拡張可能。

• モダリティ — 両方ともテキスト、画像、動画の入力を受け付け、テキストを返します。

• ライセンス — Qwen3.8-Flash-Next: qwen-community-1.0。Qw​en3.8-27B: Apache 2.0。

• 価格 — Qwen3.8-Flash-Next: 1Mあたり $0.16 / $0.47(発表済み。本番APIは未公開)。Qw​en3.8-27B: 1Mあたり $0.33 / $2.40、本日より利用可能。

• 実行フットプリント — Qwen3.8-Flash-Next: ホストRAMに51Bテーブル、約96GBのシステムメモリ+GPU分。FP8は約186GB、Q4 GGUFは約82GB。Qw​en3.8-27B: BF16は約55.6GB、4ビットなら24GBのカードに収まる。

• 独立したエビデンス — Qwen3.8-Flash-Next: まだなし。Qwen3.8-27B: Arena.ai Image-to-WebDev でオープンモデル第1位、Code Arena WebDev で総合第9位、Harvey's Legal Agent ベンチマークでオープンウェイト第1位、AMD測定のスループット。

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

アリババ自身の数字によれば、プレビューはほぼすべてにおいて勝っている。

Alibabaが公表した比較では、Qwen3.8-Flash-Nextは、言語・視覚の22ベンチマーク中21でQw​en3.8-27Bに対して同等以上のスコアを記録しており、その勝利は表面的なものではありません。SWE-bench Proは62.5対61.7と僅差ですが、DeepSWEは58.7対42.2、JobBenchは55.7対33.4、CoWorkBenchは73.9対70.7であり、これらはフラッシュ層が対象とするエージェント型・オフィス系ワークロードにおいて、まさに実質的な差です。プレビューの主要数値——LiveCodeBench v6 91.9、GPQA Diamond 91.7、MathVision 95.7——も、Alibabaの表における27Bの対応行を上回っています。これが本リリースの主張をデータとして示したものです。すなわち、大型のQw​en 3.8シリーズの推論およびコーディング能力の大部分を、アクティブな計算量のごく一部で実現している、ということです。

その文にはラベルを付けたままにしてください。これらはAlibaba自身の評価であり、Alibaba自身のハーネスによるもので、プレビューの場合は1日前のものであり、両方とも再現されていません。この対戦で上位にランクされるKGP Talkieアーキテクチャの解体分析も同じ形の結論に達していますが、それも同じベンダーシートに基づいています。ベンダーの表は約束であり、この段落の内容は独立に確認されたものは何もありません。

27Bが持っていてFlash-Nextにはないもの:証拠

ここから先は、このマッチアップはもはや一方的ではない。Qw​en3.8-27Bは公開から2週間が経過し、コミュニティは3つの独立したデータポイントを生み出した。Arena.aiのImage-to-WebDevリーダーボード——2つの匿名化された出力のうち、どちらを出荷したいかを閲覧者が盲目的に投票する——では、27Bはオープンモデル中1位、全体でも7位で、報告スコアは1,574である。姉妹版のCode Arena WebDevボードでは全体9位(1,595)に位置し、トップ10に入った同サイズクラス唯一のモデルである。リーガルAI企業のHarveyとEngramは、合成法律事務所の研究を実施し、適応させた27Bを自社のリーガルエージェントベンチマークのトップに据えた。ただし、そのモデルは事前にテストコーパスを学習していたという注記付きであり、これはストックウェイトのスコアというよりも、ファインチューニングの伸びしろを示す実証である。AMDはDay-0のスループット測定値を公開した:Ryzen AI Max+ 395で24.5トークン/秒、Radeon AI PRO R9700で51.8トークン/秒である。これらのいずれも汎用品質スコアではない——27Bに対するArtificial Analysisのインデックスはまだ存在しない——しかし、それぞれが実際にモデルを実行した第三者によるものだ。

Qwen3.8-Flash-Nextには、そのようなものは何もない。そのベンチマーク表はすべてAlibabaのもので、執筆時点では数時間前のものに過ぎず、独立した研究機関が1行でも再現したことはない。これは非難ではない。これは、リリースから1日も経っていない定義そのものだ。しかし、まさにこの非対称性こそが選択を左右すべきものだ。プレビュー版は、存在する唯一の数値で先行しており、そしてその数値はすべて、それを信じてほしいと思っているベンダーによって書かれたものなのだ。

デプロイメントフォーク

{{1}}この2つのモデルの実際的な違いは、パラメータがどこに存在するかという点にあり、それが必要なハードウェアを決定します。{{/1}} {{2}}Qwen3.8-Flash-Nextは、51BのN-gram埋め込みテーブルを意図的にホストメモリへオフロードし、そこで非同期にプリフェッチできるようにしています——これが、トークンごとの計算量を増やさずに51Bパラメータ分の容量を追加できる理由です。{{/2}} {{3}}その結果、このモデルは、これまでローカルのQw​enが収まっていたような24GBのコンシューマー向けGPUカードには収まりません。{{/3}} {{4}}コミュニティの見積もりでは、Q4 GGUFは合計で約82GB(メインの重み約58GB+ルックアップテーブル24GB)、FP8ビルドは約186GB、BF16は約360GBとされています。実用的な構成としては、約96GBのシステムRAMと、アクティブな6Bを実行できる任意のGPUを備えたマシンが推奨されます。{{/4}} {{5}}その見返りとして、トークンごとの計算量が安価になること——これがこのアーキテクチャのすべてを賭けた狙いです——そして、GDNレイヤーがKVキャッシュを増やす代わりに履歴を圧縮するため、長い1Mトークンのコンテキストも手頃なコストで維持できます。{{/5}}

Qw​en3.8-27Bは、その逆のモデルです。Denseモデルなので、すべてのトークンが27Bすべてのパラメータを実行しますが、既存のハードウェアに全体が収まるほど小さいです。BF16の重みは約55.6GBあります。4ビットならRTX 3090や4090などの24GBカードで動作し、AMDの計測ではAI MaxクラスおよびRadeon PROハードウェア上で24.5〜51.8トークン/秒を記録しています。制約が単一のワークステーションであれば、実際に収まるのは27Bの方です。制約がスケール時のトークンあたりコストであれば、机上ではFlash-Nextの方が勝っています。

価格の分岐点

API価格もまた、同じことを反対側から物語っています。Qw​en3.8-27Bは本日よりOrcaRouterで利用可能で、入力トークン100万件あたり$0.33、出力トークン100万件あたり$2.40です。プロバイダーのリストプライスがマークアップなしでそのままパススルーされ、セルフホストオプションも呼び出し可能になりました。GPUを購入する必要はありません。Qwen3.8-Flash-Nextは今のところどこにもルーティングされていません。本番向けのQwen3.8-Flashが発表済みの$0.16/$0.47でQwenCloud APIに登場するまでは、オープンウェイトが唯一の手段です。そのAPIが公開されれば、同じパススルー方式により、$0.16/$0.47という価格が同じ日にこちら側でも適用され、27Bと同じキーで利用でき、両者の間で自動フェイルオーバーが働きます。つまり、登場したばかりのアーキテクチャを採用する方法は、本番環境をそれに賭けることではなく、実績のあるモデルをフォールバックに据え、トラフィックの一部をそこに向けることです。ルーティングレイヤーは自前で運用しているモデルの前面にも配置できるため、別途統合を必要とせずに、今日からFlash-Nextのオープンウェイトを評価する現実的な道となります。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

どれを実行しますか?

Qwen4の方向性を今すぐ試したいなら、処理量が十分に多くて$0.16/$0.47と$0.33/$2.40の差が現実的な数字になるなら、あるいはセルフホストできるRAMとベンダーのスペックシートへの信頼があるなら、Qwen3.8-Flash-Nextを選びましょう。Apache-2.0の条件が必要なら、24GBカード1枚で動くモデルが必要なら、今日すぐ利用できるモデルが必要なら、あるいは少しでも独立した裏付けが欲しいなら、Qwen3.8-27Bを選びましょう——この2つのうち、Alibaba以外の誰かが実際に動かした実績があるのはこちらだけです。

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

上記の2つのキャプチャは、それぞれの半分の公開面です:OrcaRouterのリスト(Qw​en3.8-27Bが現在$0.33/$2.40で呼び出し可能)と、Hugging Face上のQwen/Qwen3.8-Flash-Nextモデルカードです。

そして、誠実な締めくくりは問いかけだ。なぜなら、エビデンスの基盤はまだ1日分しかないからだ:60億のパラメータを活性化するモデルは、独立した再現テストで21/22のスイープを維持できるのか、それとも、軽量なサービス提供を可能にするN-gramテーブルこそが、実際のワークロードで失敗する要因なのか?27Bはすでに2週間のコミュニティによる精査を耐え抜いている。Flash-Nextは、27Bが2週間前いた場所にある——つまり、どちらかを選ぶのではなく、並べて実行するのが最良の論拠だ。