
Qwen3.8-Flash-Next 対 Qwen3.8-27B:オープンウェイトの主力モデルに挑む Qwen4-preview MoE
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 578 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
Qwen3.8-Flash-Nextについて驚くべき点は、Alibabaがトークンあたりわずか60億パラメータしか活性化しないモデルでオープン系モデルの大半を凌駕すると主張していることではない。その推論(サービング)に、比較対象である270億パラメータのdenseモデルよりも多くのメモリが必要だということだ。2026年8月26日にQwen4アーキテクチャのプレビューとしてオープンソース化されたQwen3.8-Flash-Nextは、VRAMではなくシステムRAM上に510億パラメータのN-gramルックアップテーブルを保持する。8月中旬にリリースされたApache-2.0ライセンスのマルチモーダルdenseモデルであるQwen3.8-27Bは、現行のQwen 3.8世代におけるオープンウェイトの主力モデルであり、4ビットなら単一の24GBグラフィックカードに収まる。Alibaba自身のベンチマークシートでは、新しいMoEは比較された22件のベンチマークのうち21件で27Bを上回っている。しかし独立したエビデンス(アリーナ順位、法務エージェントの研究、第三者によるスループット測定)を見れば、そうした実績があるのは2つのうち27Bだけだ。この組み合わせこそが、判断のすべてである。
1行で表す対決:同じ世代に属するオープンウェイトのテキスト+ビジョン対応モデル2つ。ネイティブコンテキストはどちらも262K、どちらもデータセンター外での実行を想定して設計されている。しかし、アーキテクチャ、ライセンス、価格、そして検証された実績の度合いで両者は分かれる。Qwen3.8-Flash-Nextは、Qwen4が受け継ぐと期待されるすべてを先取りするスパースMoEだ。Qwen3.8-27Bは、Alibabaが2.4Tのフラッグシップを構築して得た知見を、単一GPUで実行可能なサイズに凝縮したデンスモデルである。この2つからの選択は、能力の問題ではない——Alibabaによれば先行しているのはプレビュー版の方だ——むしろ、コミュニティがすでに徹底的に分析したモデルと、公開から1日しか経っていないベンダー資料のどちらを信頼するかという問題である。
スコアボード
ソーシングの話を先に:以下のQwen3.8-Flash-Nextの数値はすべてAlibaba自身のもので、1日前のものであり、まだ再現されていません。Qwen3.8-27Bの主要ベンチマークの主張もAlibabaの報告ですが、27Bには独立した結果——人間の好みによるアリーナ順位、法務領域の研究、AMDスループット測定——があり、プレビューはそれに及びません。
総パラメータ数 — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP(保存時 ~180B)、アクティブ 6B。Qwen3.8-27B: ~27B dense(ビジョンエンコーダ込みで 28B)、すべてアクティブ。
アーキテクチャ — Qwen3.8-Flash-Next: Qwen4プレビュー — Qwen Sparse AttentionとGated DeltaNetの交互配置、ゲート付き残差接続、N-gram埋め込み、Muon学習。Qwen3.8-27B: GDN線形アテンションレイヤー48層+フルアテンションレイヤー16層(3:1)、高密度。
• コンテキスト — ネイティブで262,144トークン、YaRN経由で1Mまで拡張可能。
• モダリティ — 両方ともテキスト、画像、動画の入力を受け付け、テキストを返します。
• ライセンス — Qwen3.8-Flash-Next: qwen-community-1.0。Qwen3.8-27B: Apache 2.0。
• 価格 — Qwen3.8-Flash-Next: 1Mあたり $0.16 / $0.47(発表済み。本番APIは未公開)。Qwen3.8-27B: 1Mあたり $0.33 / $2.40、本日より利用可能。
• 実行フットプリント — Qwen3.8-Flash-Next: ホストRAMに51Bテーブル、約96GBのシステムメモリ+GPU分。FP8は約186GB、Q4 GGUFは約82GB。Qwen3.8-27B: BF16は約55.6GB、4ビットなら24GBのカードに収まる。
• 独立したエビデンス — Qwen3.8-Flash-Next: まだなし。Qwen3.8-27B: Arena.ai Image-to-WebDev でオープンモデル第1位、Code Arena WebDev で総合第9位、Harvey's Legal Agent ベンチマークでオープンウェイト第1位、AMD測定のスループット。

アリババ自身の数字によれば、プレビューはほぼすべてにおいて勝っている。
Alibabaが公表した比較では、Qwen3.8-Flash-Nextは、言語・視覚の22ベンチマーク中21でQwen3.8-27Bに対して同等以上のスコアを記録しており、その勝利は表面的なものではありません。SWE-bench Proは62.5対61.7と僅差ですが、DeepSWEは58.7対42.2、JobBenchは55.7対33.4、CoWorkBenchは73.9対70.7であり、これらはフラッシュ層が対象とするエージェント型・オフィス系ワークロードにおいて、まさに実質的な差です。プレビューの主要数値——LiveCodeBench v6 91.9、GPQA Diamond 91.7、MathVision 95.7——も、Alibabaの表における27Bの対応行を上回っています。これが本リリースの主張をデータとして示したものです。すなわち、大型のQwen 3.8シリーズの推論およびコーディング能力の大部分を、アクティブな計算量のごく一部で実現している、ということです。
その文にはラベルを付けたままにしてください。これらはAlibaba自身の評価であり、Alibaba自身のハーネスによるもので、プレビューの場合は1日前のものであり、両方とも再現されていません。この対戦で上位にランクされるKGP Talkieアーキテクチャの解体分析も同じ形の結論に達していますが、それも同じベンダーシートに基づいています。ベンダーの表は約束であり、この段落の内容は独立に確認されたものは何もありません。
27Bが持っていてFlash-Nextにはないもの:証拠
ここから先は、このマッチアップはもはや一方的ではない。Qwen3.8-27Bは公開から2週間が経過し、コミュニティは3つの独立したデータポイントを生み出した。Arena.aiのImage-to-WebDevリーダーボード——2つの匿名化された出力のうち、どちらを出荷したいかを閲覧者が盲目的に投票する——では、27Bはオープンモデル中1位、全体でも7位で、報告スコアは1,574である。姉妹版のCode Arena WebDevボードでは全体9位(1,595)に位置し、トップ10に入った同サイズクラス唯一のモデルである。リーガルAI企業のHarveyとEngramは、合成法律事務所の研究を実施し、適応させた27Bを自社のリーガルエージェントベンチマークのトップに据えた。ただし、そのモデルは事前にテストコーパスを学習していたという注記付きであり、これはストックウェイトのスコアというよりも、ファインチューニングの伸びしろを示す実証である。AMDはDay-0のスループット測定値を公開した:Ryzen AI Max+ 395で24.5トークン/秒、Radeon AI PRO R9700で51.8トークン/秒である。これらのいずれも汎用品質スコアではない——27Bに対するArtificial Analysisのインデックスはまだ存在しない——しかし、それぞれが実際にモデルを実行した第三者によるものだ。
Qwen3.8-Flash-Nextには、そのようなものは何もない。そのベンチマーク表はすべてAlibabaのもので、執筆時点では数時間前のものに過ぎず、独立した研究機関が1行でも再現したことはない。これは非難ではない。これは、リリースから1日も経っていない定義そのものだ。しかし、まさにこの非対称性こそが選択を左右すべきものだ。プレビュー版は、存在する唯一の数値で先行しており、そしてその数値はすべて、それを信じてほしいと思っているベンダーによって書かれたものなのだ。
デプロイメントフォーク
{{1}}この2つのモデルの実際的な違いは、パラメータがどこに存在するかという点にあり、それが必要なハードウェアを決定します。{{/1}} {{2}}Qwen3.8-Flash-Nextは、51BのN-gram埋め込みテーブルを意図的にホストメモリへオフロードし、そこで非同期にプリフェッチできるようにしています——これが、トークンごとの計算量を増やさずに51Bパラメータ分の容量を追加できる理由です。{{/2}} {{3}}その結果、このモデルは、これまでローカルのQwenが収まっていたような24GBのコンシューマー向けGPUカードには収まりません。{{/3}} {{4}}コミュニティの見積もりでは、Q4 GGUFは合計で約82GB(メインの重み約58GB+ルックアップテーブル24GB)、FP8ビルドは約186GB、BF16は約360GBとされています。実用的な構成としては、約96GBのシステムRAMと、アクティブな6Bを実行できる任意のGPUを備えたマシンが推奨されます。{{/4}} {{5}}その見返りとして、トークンごとの計算量が安価になること——これがこのアーキテクチャのすべてを賭けた狙いです——そして、GDNレイヤーがKVキャッシュを増やす代わりに履歴を圧縮するため、長い1Mトークンのコンテキストも手頃なコストで維持できます。{{/5}}
Qwen3.8-27Bは、その逆のモデルです。Denseモデルなので、すべてのトークンが27Bすべてのパラメータを実行しますが、既存のハードウェアに全体が収まるほど小さいです。BF16の重みは約55.6GBあります。4ビットならRTX 3090や4090などの24GBカードで動作し、AMDの計測ではAI MaxクラスおよびRadeon PROハードウェア上で24.5〜51.8トークン/秒を記録しています。制約が単一のワークステーションであれば、実際に収まるのは27Bの方です。制約がスケール時のトークンあたりコストであれば、机上ではFlash-Nextの方が勝っています。
価格の分岐点
API価格もまた、同じことを反対側から物語っています。Qwen3.8-27Bは本日よりOrcaRouterで利用可能で、入力トークン100万件あたり$0.33、出力トークン100万件あたり$2.40です。プロバイダーのリストプライスがマークアップなしでそのままパススルーされ、セルフホストオプションも呼び出し可能になりました。GPUを購入する必要はありません。Qwen3.8-Flash-Nextは今のところどこにもルーティングされていません。本番向けのQwen3.8-Flashが発表済みの$0.16/$0.47でQwenCloud APIに登場するまでは、オープンウェイトが唯一の手段です。そのAPIが公開されれば、同じパススルー方式により、$0.16/$0.47という価格が同じ日にこちら側でも適用され、27Bと同じキーで利用でき、両者の間で自動フェイルオーバーが働きます。つまり、登場したばかりのアーキテクチャを採用する方法は、本番環境をそれに賭けることではなく、実績のあるモデルをフォールバックに据え、トラフィックの一部をそこに向けることです。ルーティングレイヤーは自前で運用しているモデルの前面にも配置できるため、別途統合を必要とせずに、今日からFlash-Nextのオープンウェイトを評価する現実的な道となります。

どれを実行しますか?
Qwen4の方向性を今すぐ試したいなら、処理量が十分に多くて$0.16/$0.47と$0.33/$2.40の差が現実的な数字になるなら、あるいはセルフホストできるRAMとベンダーのスペックシートへの信頼があるなら、Qwen3.8-Flash-Nextを選びましょう。Apache-2.0の条件が必要なら、24GBカード1枚で動くモデルが必要なら、今日すぐ利用できるモデルが必要なら、あるいは少しでも独立した裏付けが欲しいなら、Qwen3.8-27Bを選びましょう——この2つのうち、Alibaba以外の誰かが実際に動かした実績があるのはこちらだけです。

上記の2つのキャプチャは、それぞれの半分の公開面です:OrcaRouterのリスト(Qwen3.8-27Bが現在$0.33/$2.40で呼び出し可能)と、Hugging Face上のQwen/Qwen3.8-Flash-Nextモデルカードです。
そして、誠実な締めくくりは問いかけだ。なぜなら、エビデンスの基盤はまだ1日分しかないからだ:60億のパラメータを活性化するモデルは、独立した再現テストで21/22のスイープを維持できるのか、それとも、軽量なサービス提供を可能にするN-gramテーブルこそが、実際のワークロードで失敗する要因なのか?27Bはすでに2週間のコミュニティによる精査を耐え抜いている。Flash-Nextは、27Bが2週間前いた場所にある——つまり、どちらかを選ぶのではなく、並べて実行するのが最良の論拠だ。
