Qwen3.8-Max レビュー:Alibaba の 2.4T フラッグシップ、$2/$6 — 0902 ビルドが Code Arena WebDev で首位に
Guides & Insights

Qwen3.8-Max レビュー:Alibaba の 2.4T フラッグシップ、$2/$6 — 0902 ビルドが Code Arena WebDev で首位に

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Alibaba QwenQwen3.8-Maxを、2026年7月19日に上海で開催されたWorld AI Conferenceでプレビューした。その後2週間、それは誰も実際に価格を設定できないモデルとして最も話題になった。料金表も、ベンチマーク表も、モデルカードも、ライセンスも、アクティブパラメータ数も存在せず、ただ2.4兆パラメータという見出しと、このモデルは「Claude Fable 5に次ぐ」という主張だけがあった。

2026年8月3日、それは変わった。Qwen3.8-Maxが一般提供開始となった。公開された料金表は、入力トークン100万件あたり2ドル、出力トークン100万件あたり6ドル。OpenAIおよびDashScope互換のエンドポイント、完全なベンチマーク表、そして8月12日に公開されたオープンウェイトを備えている。その1週間後の8月14日には、Alibabaの「Day 0ローンチパートナー」であるDigitalOcean Serverless Inference上で稼働開始した。これはQwen3.8-Maxを提供する最初の主要な西側クラウドとなった。9月2日には、Alibabaが命名付きリフレッシュ版「Qwen3.8-Max-0902」をリリースした。これは「Coding」と「Cowork」でさらにポストトレーニングされており、Qwenによれば複雑なエンタープライズ業務や科学業務での性能を強化するという。本レビューは、GA(一般提供)時点の事実に基づき、そのデイゼロローンチと0902ビルドを織り込んで執筆されている。そして、モデルが購入可能になった今、各チームが実際に抱く問いに答える。すなわち、Qwen3.8-Maxは本番トラフィックを受け止める準備ができているのか、それとも依然としてウォッチリスト入りのモデルなのか、という問いだ。

端的に言えば、それは多くの人が予想した以上に先へ進んだ。特に価格設定は攻撃的で、最先端の価格水準を塗り替えるほどだ。そして9月2日のアップデートは、このモデルがもともと得意としていたコーディングと共同作業という2つの点をさらに強化している。その後発表された独立した評価結果は確かに良好だが、トラフィックを送る前に読んでおくべき注意点も含まれている。

TL;DR(要約)。Qwen3.8-Maxが正式リリース(GA)となり、価格は100万トークンあたり$2/$6。100万トークンのコンテキスト全体でフラットな料金設定で、長いプロンプトによる追加料金はなく、出力料金(推論系作業のコストの主因)でKimi K3($3/$15)やClaude Opus 5($5/$25)を下回る。Alibabaは強力なベンチマーク表(Terminal-Bench 2.1:86.6、GPQA Diamond:92.6、OSWorld-Verified:86.1)を公表しており、前世代からのコーディング性能の飛躍は劇的で、FrontierSWEは40.7から73.5へと向上した。ただし、この品質表はAlibaba自身によるものであり、最初の独立した評価機関であるArtificial Analysis Intelligence Indexは今回、次のような判定を下している。Qwen3.8-Maxはタスクあたり$1.14でスコア56。これはClaude Opus 4.8(56)と同等で、オープンウェイトのリーダーであるKimi K3(57)には1ポイント及ばず、しかもタスクあたりのコストは25%高い。アクティブパラメータ数はもはや疑問符付きではない。公式モデルカードで確認されたところによると、総パラメータ2.4Tのうちアクティブは95Bで、これにより外部の関係者はようやくサービングの経済性を推測できるようになった。本レビューの初出以降、2番目のマネージド提供経路も開設されている。Qwen3.8-Maxは、AlibabaのDay 0パートナーであるDigitalOcean Serverless Inference上で8月14日に稼働を開始。DigitalOceanが公表したサービング性能——256同時リクエスト時にプレフィルが約16,000トークン/秒、出力が約1,937トークン/秒へスケールし、エラーはゼロ——は、Alibaba以外のプロバイダーによる初の確かなレイテンシデータである。9月2日には、AlibabaがフラッグシップをQwen3.8-Max-0902として更新し、CodingとCoworkでさらなるポストトレーニングを実施。Qwenによれば、この新しいスナップショットは複雑なエンタープライズ/科学系ワークロードでより強力だというが、これはベンダーの主張であり、エンタープライズ/科学系の業務に関する独立した数値はまだない。0902ビルドのコーディング面には、今回独自の独立したアリーナ結果もある。Alibabaがライブの第三者アリーナ掲載を引用して発表したところによると、Qwen3.8-Max-0902はCode Arena:WebDevのボードで1,691ポイントを記録し、初登場で#1を獲得。前ビルドから22ポイント増で、Claude Opus 5とKimi K3を上回った。同じ週に、エージェント型コマースの分野にもスコアボードが加わった。AlibabaのAccioチームが実在のコマースソフトウェアのステートフルレプリカ上に構築した新しいベンチマークであるCommerceAgentBenchでは、Qwen3.8-Maxがオープンウェイトとして最強の結果——3つのハーネス合計で156パス、DeepSeek V4 Proを2つ上回る——を記録した。ただしこれもベンダー運営の表であり、独立した審判によるものではない。結論:Qwen3.8-Maxは今や本当に購入可能な製品であり、実地評価を行う価値を正当化できるほどに安価だ。ただし、無差別に全面的に切り替えるのではなく、意図的にルーティングすること。

重要なポイント

2026年8月3日よりGA。プレビューとクレジットキャンペーンの時代は終わりました。実際のレートカードと実際のエンドポイントがあります。

$2 / $6(100万トークンあたり)、100万コンテキストにわたる単一のフラットティア。 多くの競合他社は長いプロンプトに追加料金を課します。Alibabaはそうではないため、長文ドキュメントや大規模リポジトリの作業にとって極めて重要です。

Alibabaのベンチマーク表は優秀だが未監査:Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、PaperBench 93.0、IFBench 82.8、OSWorld-Verified 86.1、OmniDocBench 1.5 92.1。

コーディングの世代的な飛躍こそが本当の見どころだ:FrontierSWEは73.5(40.7から)、DeepSWE 1.1は56.6(21.6から)——両方ともほぼ倍増だ。

最初の独立したスコアが発表されました:Qwen3.8-Max のスコアは、AA Intelligence Index(タスクあたり$1.14)で56点です。これは Qwen3.7-Max (46) より10ポイント高く、Claude Opus 4.8 (56) と同等、Kimi K3 (57) より1ポイント低い結果です。LMArena の総合リーダーボードにはまだ公開スコアはありません。

アクティブパラメータが95Bで確定 — 公式モデルカードには合計2.4T、アクティブ95Bと記載されており、推論コスト計算における最大の未解決問題が解決された。

• オープンウェイトが公開されました — Qwen3.8-2.4T-A95B(BF16)とQwen3.8-2.4T-A95B-FP8は、Apache 2.0ではなくカスタムのQwen3.8-Maxライセンスの下で、8月12日にHugging Faceで公開されました。Qwen3.8-27Bのオンプレミス版は、Apache 2.0の下で8月14日にリリースされました。

2つ目のマネージドパスが8月14日に開設されました。 Qwen3.8-Max は、Alibaba の「初日ローンチパートナー」として DigitalOcean Serverless Inference で稼働しています。— NVIDIA HGX B300 上の NVFP4、$2/$6、キャッシュ入力は $0.20、オープンチェックポイントのネイティブ 262K コンテキストで提供されています。DigitalOcean が測定した数値(プレフィル約 16K トークン/秒、256 並列でエラーゼロ)は、Alibaba 以外のマネージドプラットフォームにおける初のサービングパフォーマンスデータです。

9月2日更新: Qwen3.8-Max-0902。AlibabaはフラッグシップモデルをCodingとCoworkでさらにポストトレーニングし、QwenCloud上で同じ$2/$6・1Mコンテキストで提供している。エンタープライズおよび科学分野のパフォーマンスはより強力になったとQwenは述べているが、それは依然としてベンダー側の主張にすぎない。一方、コーディング面では同日に独立したアリーナでの結果も出た。このビルドはCode Arena: WebDevで1,691を記録し、初登場で1位を獲得した(Code Arenaの箇条書きは後述)。

CommerceAgentBench:オープンウェイトのリーダー、ベンダー運営。AlibabaのAccioチームは今週、CommerceAgentBenchをリリースしました。これは、実在のコマース/ビジネスソフトウェアのステートフルレプリカ内に用意された107の長期タスクを、Accio・OpenClaw・Piの各ハーネスでステートベースに採点するものです。Qwen3.8-Maxは合計156パスでオープンウェイトモデルをリードし、DeepSeek V4 Proに2つ差をつけています。クローズドモデルのClaude Opus 5は191パスで全体首位ですが、このランキング表はAlibaba自身によるもので、独立した評価者によるものではありません。

Code Arena: WebDev #1 — 0902ビルドの独立アリーナでの結果。 Qwen3.8-Max-0902は、Code Arena: WebDev リーダーボードで1,691ポイントを獲得し、首位でデビューしました。前ビルドから22ポイント増となり、Claude Opus 5とKimi K3を上回ります。また、同モデルは、そのボードのコストパフォーマンスのパレート最前線を、Claude Opus 5のブレンド価格の約4分の1にあたる、約5ドル/MTokというブレンド価格でリードしています。Qwenの公式QwenCloudアカウントはこの順位を確認しました。CommerceAgentBenchとは異なり、このボードは第三者によるものです。ブラインド形式の人間投票アリーナであり、Alibabaが作成した表ではありません。ただし、「#1でのデビュー」は、Alibabaによる一時点の順位発表にすぎません。

正確性に関する注記:本レビューのQwen3.8-Maxベンチマーク表はAlibabaが報告したものであり、第三者による独立した再現は行われていない。Artificial Analysis Intelligence Indexスコア(タスクあたり$1.14で56)は、AAがAlibabaの公式API上で独立に測定したものであり、このモデルにとって初の独立した審判役となる。料金はAlibaba Model StudioのGA(一般提供)レートカードに基づく。オープンウェイトのリポジトリ(Qwen3.8-2.4T-A95BおよびQwen3.8-2.4T-A95B-FP8)、95Bアクティブという数値、ライセンス文面はすべてファーストパーティ由来であり、Qwen自身のHugging Face組織から提供されている(2026年8月13日検証済み)。DigitalOceanでの提供状況、同社のレートカード、サービング性能の測定値、量子化ビルドに対するGPQAスポットチェック(88)は、8月14日の発表と併せて公開されたDigitalOcean自身のドキュメントとコミュニティチュートリアルに由来する。「Day 0ローンチパートナー」という位置づけはAlibabaの発表における表現である。競合他社の数値を引用している箇所は、Artificial Analysisまたはその場で明記したベンダーに由来する。9月2日に発表されたQwen3.8-Max-0902リフレッシュ版は、全体がベンダー申告である。その仕様、Coding-and-Coworkのポストトレーニングに関する説明、主張されているエンタープライズ/科学分野の向上はすべてQwen自身の発表とQwenCloudのモデルページに由来しており、いずれの数値も独立に再現されていない。ベンチマークの節で取り上げたCode Arena: WebDevの順位は唯一の例外である。このボードはAlibabaの表ではなく、第三者のブラインド投票型アリーナである。ただし「スコア1,691で初登場にして#1」はAlibabaが一時点のリストとして発表したものであり、アリーナのスコアは投票が積み上がるにつれて変動し続ける。後述するCommerceAgentBenchの結果も同じカテゴリに属する。このベンチマークはAlibaba InternationalのチームであるAccioが構築・公開したものであり、その表はAlibaba報告である。オープンソースのベンチマークではあるが、Artificial Analysisのような独立した審判ではない。ベンダーのベンチマーク表は原則として楽観的な数字になりがちである。それらは確定したランキングとしてではなく、自身のワークロードで検証すべき仮説として扱ってください。

Qwen3.8-Maxとは何ですか?

Qwen3.8-Maxは、AlibabaのQwenファミリーのフラッグシップです。総パラメータ数2.4兆のスパースMixture-of-Expertsモデルで、1Mトークンのコンテキストウィンドウを備え、標準でマルチモーダル入力に対応しています。テキスト、画像、動画を入力として受け付け、テキストを返します。思考モード、関数呼び出し、組み込みツール、構造化出力に対応し、OpenAI互換の/v1/chat/completionsエンドポイントで提供されます。つまり、既存のインテグレーションのほとんどは、書き換えではなくベースURLの変更だけで対応できます。現在の本番スナップショットは、9月2日にリリースされたQwen3.8-Max-0902で、CodingおよびCowork向けにさらにポストトレーニングされています。

実際のコンテキストサイズは、マーケティング上の「1M」よりもう少し具体的です。Alibabaのクラウドメタデータには、983,616トークンのウィンドウが思考有効時に記載されており、最大入力は約991Kトークン、最大出力は131,072トークンです。この出力上限は異例に寛大で、ファイル全体のコード生成や長文レポートの作成など、上限が低いとチャンク化してつなぎ合わせる必要があるタスクに重要です。DigitalOceanが現在提供しているオープンチェックポイントは構成が異なり、モデルカードにはネイティブで262,144トークン、約1,010,000まで拡張可能と記載されています。したがって、オープンベースを実行するサードパーティのサービスは通常、より小さいネイティブ数値になります。

アクティブパラメータ数が公開され、リポジトリ名にもそれが反映されています。A95Bは950億のアクティブパラメータを意味します。Qwen3.8-2.4T-A95Bの公式モデルカードには「全体で2.4T、アクティブは95B」と記載されており、512エキスパートからなる細粒度のMixture-of-Expertsで、トークンごとに10個のルーティング先エキスパートと1個の共有エキスパートがアクティブになります。この数値は、2.4Tという見出しよりも重要です。高密度(dense)モデルでは、総パラメータ数が推論コストの概算を示しますが、MoEモデルではほぼ何も示しません。実際にトークンごとに実行されるのはアクティブ数だけだからです。2.4Tモデルでも、30Bをアクティブにする場合と200Bをアクティブにする場合では、レイテンシとサービス提供の経済性の面でまったく挙動が異なります。アクティブ95Bの場合、トークンあたりの計算量は約90B規模の高密度モデルと同程度になります。これは、高密度2.4Tが必要とする計算量の一部にすぎず、以下のセルフホスティングに関する問いに最終的に答えを出せる数値です。

9月2日更新版:Qwen3.8-Max-0902

2026年9月2日、Qwenは最初の名称付き本番リフレッシュ版をリリースしました。Qwen3.8-Max-0902は、同じ2.4TパラメータのスパースMoEアーキテクチャ、同じ95Bのアクティブパラメータ、同じ1Mトークンのコンテキストウィンドウを維持していますが、CodingとCoworkという2つの機能についてさらにポストトレーニングが施され、QwenCloudのAPIでqwen3.8-max-0902として稼働しています(qwen3.8-max-2026-09-02としてもリストされています)。これはサイドブランチではなく、現在推奨されるビルドです。Alibabaの日付なしのqwen3.8-maxエンドポイントは現在0902スナップショットを提供しているため、標準のモデル名を呼び出すとこのリフレッシュ版に到達します。一方、日付入りのIDは、正確なビルドを固定したいチーム向けに用意されています。9月3日から、このスナップショットはサードパーティのマネージドAPI上でも独自のルーティング可能なモデルIDとしてリストされています。料金体系に変更はありません。入力100万トークンにつき2ドル、出力100万トークンにつき6ドル、キャッシュレートも同じです。

性能に関する主張はQwenによるものです。発表資料とQwenCloudモデルページでは、エンジニアリング規模のプロジェクトと長期的な自律開発で「新境地を切り開く」コーディング能力、マルチツールオーケストレーションとエンドツーエンドのタスク遂行にわたる「大幅に強化された」コラボレーティブエージェント体験、そして同社の表現を借りれば、複雑なエンタープライズタスク・科学研究・長期サイクルのワークフローにおけるより強力な性能が説明されています。最初の独立した検証は同じ日に実現しました。Qwen3.8-Max-0902は、Code Arena: WebDevボード(エージェント型Web開発のための第三者運営・ブラインド投票方式のアリーナで、旧称はWebDev Arena)で1,691ポイントを獲得し、初登場1位となりました。これは前回のビルドから22ポイント増で、Alibabaがライブボードを引用したところによると、Claude Opus 5とKimi K3を上回ります。この順位は、Qwenの公式アカウントが同日、QwenCloud APIを提示して確認したものです。その結果が何を証明し、何を証明しないかは、下のベンチマークセクションで詳しく説明します。今回のリフレッシュの残りの主張(エンタープライズ推論、科学業務、一般的な長期的自律性)は、依然としてベンダーによる表明にすぎません。そのため、8月の表に適用したのと同じ規律を守ってください。Artificial Analysisによる評価や実際のワークロードで確認されるまでは、それらを仮説として扱うことです。

「Cowork」が実際には何を意味するのか、という点こそが今回のリフレッシュの興味深いところだ。GA期のQwen3.8-Maxはすでに長期的自律性(long-horizon autonomy)に重きを置いていた——16日間に及ぶoh-my-cli構築、2,000ラウンド超の仮想ビジネスがその例だ——そして0902ビルドは、Alibabaがその軸にさらに注力したものだ。すなわち、単発の回答ではなく、複数のツールを調整してタスクをエンドツーエンドで完遂するエージェントである。同じ週に、AlibabaのAccioチームはCommerceAgentBenchを発表した。これはその軸を直接測定するために構築されたベンチマークで、実際のコマース・ビジネスソフトウェアのステートフルなレプリカ内で107件の長期的タスクを実行する。この分野ではQwen3.8-Maxがオープンウェイトモデルの中でトップに立っている——詳細は後述のベンチマークセクションを参照されたい。エンタープライズ業務でこのモデルを評価するチームにとって、最初に検証すべきはこの主張である。なぜなら、これはベンチマークの表だけから検証するのが最も難しい性質の主張でもあるからだ。

価格設定:今回のローンチで最も攻撃的な点

Alibaba Model Studio は Qwen3.8-Max を次の価格でリストしています:1M入力トークンあたり$2.00、1M出力トークンあたり$6.00。出力には思考トークンが含まれており、これは重要です。なぜなら、推論を多用する構成では、内部の検討が出力レートで課金されるからです。キャッシュの経済性: キャッシュ入力ヒットは$0.25/1M、明示的キャッシュ作成は$2.50、明示的キャッシュリードは$0.17

構造的に興味深いのは、見出しの数字ではなく、フラットな料金体系です。アリババは、プロンプトが5,000トークンであろうと900,000トークンであろうと、同じ$2/$6を請求します。ほとんどの競合他社は、100万トークン近いプロンプトの処理にコストがかかるからこそ、長いコンテキストの追加料金を適用しています。アリババがそのコストを負担するのは、長いコンテキストが本質であるワークロード、すなわちリポジトリ全体のコードレビュー、契約書や提出書類の分析、複数ドキュメントにわたるリサーチ統合を正確に狙った意図的な市場獲得戦略です。

具体例。リポジトリ分析エージェントを実行するとします。1回の呼び出しにつき、コードコンテキストとして入力トークンが200,000、出力トークンが8,000あります。

1コールあたり:入力 0.2M × $2 = $0.40、さらに出力 0.008M × $6 = $0.048。≈ 1コールあたり $0.45。

1日1,000コールの場合: ≈ $448/日、つまり月額約$13,400です。

Claude Opus 5($5/$25)に対する同じ呼び出し: $1.00 + $0.20 = $1.20 — 約2.7倍です。

安定したコードコンテキストでのプロンプトキャッシングにより、キャッシュされた入力が$0.25の場合、入力側のコストが$0.40から$0.05に下がり、呼び出し全体のコストは ≈ $0.10 — リピートトラフィックでは約4.5倍の削減となります。

そのキャッシュ差分こそが、実際の予算の大部分を占めるポイントです。エージェントが毎ターン、ほぼ変更されていないコンテキストを読み直す場合——これはほとんどのコーディングエージェントとサポートエージェントに当てはまります——実効価格は$2/$6よりも$0.25/$6にずっと近くなります。キャッシュ設定をスキップするチームは、このモデルでは日常的に3〜4倍の支払い超過が発生します。

参考までに定価での比較: Qwen3.8-Maxは$2/$6、その前身のQwen3.7-Maxは$2.50/$7.50、Kimi K3は$3/$15、GPT-5.6 Terraは$2/$12、Claude Opus 5は$5/$25。入力ではQwenは競争力があるにすぎない。一方、出力では — 推論やエージェント業務で支出の大半を占める側面 — そのリストの中で最も安いフロンティア級モデルである。

Artificial Analysisの独立した測定は、それらの安価なトークンの裏側を明らかにしている。そのIntelligence Indexでは、Qwen3.8-Maxのコストはタスクあたり$1.14 — 前モデルの$0.53の2倍以上であり、Kimi K3の$0.86より25%高いが、Kimi K3はトークンあたり$3/$15でリストされている。その差は行動に起因するものであり、値上げではない。モデルは平均してGDPval-AAタスクあたり64ステップ、Qwen3.7-Maxでは14ステップ、そしてハーネスが各ステップで会話全体を再送信するため、入力トークンは約15倍、出力は約45%増加した。安価なトークンは安価なエージェントを意味しない。プレビューテスターが指摘した冗長さには、今や測定されたコストが伴う。OrcaRouterがOpenAI互換の単一エンドポイントでリスト価格をマークアップ0%のまま提供しているため、その$1.14対$0.86の問いは、追加の契約なしに同一プロンプトで測定できるものである。

ベンチマーク表、そして各数値が実際に何を測定しているのか

GAで、Alibabaはプレビュー時に伏せていた表を公開した。報告されたスコア:

Terminal-Bench 2.1 — 86.6.モデルが実際のシェルを操作して完了まで到達できるかどうかを測定します。具体的には、コマンドの実行、出力の読み取り、エラーからの回復です。これは「コード提案ツールではなく、コーディングエージェントとして機能できるかどうか」の最も近い代理指標です。

GPQA Diamond — 92.6.検索では解答にたどり着けないよう設計された大学院レベルの物理・化学・生物学の問題。高スコアは暗記ではなく真の科学的推論を示します。92.6は現在の分野の最高水準です。

PaperBench — 93.0.研究論文の結果を再現する — 方法論を読み、それを再実装する。持続的な多段階の理解を評価する。

IFBench — 82.8.制約下での指示追従: 形式、長さ、否定的な指示。特筆すべきは、Alibaba自身の表で最低スコアであることであり、これはプレビュー時代に「モデルが範囲制限を無視するほど徹底している」という批判があったことと一致する。

OSWorld-Verified — 86.1.コンピュータ操作: 実際のデスクトップGUIを操作してタスクを完了します。ここでの強みはエージェント的な位置付けを支えています。

OmniDocBench 1.5 — 92.1. 文書解析 — テーブル、レイアウト、テキストと図の混在。1Mのフラットレート・コンテキストと組み合わせることで、文書パイプラインの真価を発揮します。

FrontierSWE — 73.5、前身の40.7から上昇。DeepSWE 1.1 — 56.6、21.6から上昇。

Those last two deserve emphasis. Near-doublings on hard software-engineering benchmarks in one generation are not normal incremental gains, and they are consistent with Alibaba's decision to market this model at developers rather than chat users. If the FrontierSWE figure survives independent replication, Qwen3.8-Max is a serious coding model and not just a large one.

プレビュー時点の注意点は縮小したが、消えてはいない。上の表は、Alibabaが自社のテストハーネス上で、他の誰も検証できない条件下で作成したものだ。ベンダーの表は、サンプリングではなく選ばれたものだ。ラボは自分たちが良い結果を出せたベンチマークしか公表しない。しかし8月6日時点で、真に独立した審判役が登場している。Artificial AnalysisがQwen3.8-Maxに付けたスコアはインテリジェンス指数56(タスクあたり1.14ドル)であり、Alibaba公式APIで測定された結果だ。これは前モデルの46から10ポイントの上昇で、Claude Opus 4.8(56)と同等、Kimi K3(57)にわずか1ポイント及ばない。AAのエージェント型GDPval-AAリーダーボードでは、このモデルのスコアはElo 1,739で、Kimi K3(1,685)とGPT-5.6 Sol(1,730)を上回り、上位に位置するのはClaude Opus 5(1,852)のみ。AA自身が挙げる注意点にも同じ重みを与えるべきだ。初期の実行は、エンドポイントの問題が解決される前に53を記録したが、公式APIでの再テストでは56を記録した。AA-Omniscienceは、幻覚率が23%から40%に上昇したことで10ポイント低下した。さらに、タスクあたりのコストが高いのは、まさにこのモデルがはるかに多くのステップを処理するからだ。LMArenaの一般リーダーボードには、まだ公開スコアがない。

DigitalOceanのローンチにより、3つ目のデータポイントが追加された。今回はフラッグシップではなく量子化ビルドに関するものだ。DigitalOcean自身が提供するNVFP4ウェイトに対する内部スポットチェックでのスコアは、GPQA Diamondで88点であり、Alibabaが非量子化フラッグシップについて公表した92.6と比較される。DigitalOcean自身はこの比較を「管理された比較ではなく参考データポイント」と位置づけている。その違いは3つの軸にわたる(ホスト型フラッグシップではなくオープンウェイトベース、BF16ではなくNVFP4、そして異なる評価スタック)——しかし、これはこれらのウェイトの実際のサービングデプロイメントに対する初めての独立した検証であり、オープンチェックポイントがAlibabaの表にある数値とバイト単位で同一ではないことを示す注意喚起でもある。

CommerceAgentBench: エージェント型コマースのスコアボード

リフレッシュに合わせて、Alibaba InternationalのAccioチームはCommerceAgentBenchをリリースした。これは、Qwenが宣伝し続けている長期的な作業を正確に評価するために構築されたベンチマークである。エージェントは、実際のコマースおよびビジネスソフトウェアの14のオフライン複製環境(商品公開、貨物予約、ストアフロント管理、決済業務、サプライヤー分析など)のうちの1つにある新しいコンテナ内で各タスクを開始する。評価は状態ベースであり、基盤となるモックサービスと生成されたファイルが実際に変更された場合のみタスクが成功となる。つまり、もっともらしいワークフローを説明するだけで状態を変更しないエージェントは、スコアを獲得できない。このスイートは、CLI、ブラウザ、ファイル/ドキュメント、API/MCPの各サーフェスにわたる107のタスクを、3つのハーネス(Accio、OpenClaw、Pi)を通じて実行する。ハーネスコード(Apache 2.0)とタスクデータ(CC BY 4.0)は、検査や再実行のために公開されている。

公開されたテーブルでは、Qwen3.8-Max がオープンウェイトモデルとして最強の結果を記録している。Accio ハーネスでは107タスク中56、OpenClaw では47、Pi では53を達成し、合計156パス。DeepSeek V4 Pro の154を2つ上回る。オープンウェイト勢の優位はすべて Accio ハーネスに由来しており、OpenClaw と Pi では両モデルは互角だ。オープンウェイトの首位は総合首位を意味しない。クローズドモデルの Claude Opus 5 は合計191パスで35差をつけ、他を大きく引き離している。しかも、このテーブルは Alibaba 自身が作成したものだ。Accio は Alibaba のチームであり、リポジトリ自体も監査上の制約を明示している。Accio ハーネスは参照専用で、チェックアウトから再現することはできない(再実行可能な経路は OpenClaw である)。タスクレベルの結果には不変の公開チェックサムがなく、Qwen の行は比較可能性を維持するために推論内容のリプレイプロトコルに依存していた。これは、OSWorld-Verified や AA の GDPval-AA アプローチが異なる角度から測定しているのと同じエージェント軸に関する、ベンダー公称のデータポイントとして扱うべきものだ。自社のワークフローと照らして検証する価値はあるが、確定したランキングではない。

Code Arena WebDev: 0902ビルドの独立審判

Code Arenaは、今回のリフレッシュに欠けていた独立した裏付けとなるものです。これは、かつてWebDev Arenaとして知られていたプロジェクト、すなわちエージェント型ウェブ開発のためのサードパーティ製リーダーボードであり、ユーザーがどのモデルの出力を出荷したいと思うかについての盲検方式のペアワイズ人間投票を、Elo式レーティングに変換したものです。そのWebDevボードでは、Qwen3.8-Max-0902が1,691ポイントでトップデビューし、前回ビルドから22ポイント増加、Claude Opus 5とKimi K3を上回りました。この順位にはコスト効率の面での強みもあります。100万トークンあたりのブレンド価格が約5ドル(ウェブアプリ生成が実際に生み出す出力中心の構成に重み付けした$2/$6のリスト価格)である0902ビルドは、ボードのパレートフロンティア上で最高スコアのモデルです。そのコストは、Claude Opus 5の100万トークンあたり約20ドルのブレンド価格の約4分の1であり、Kimi K3の約12ドル/Mを大幅に下回ります。そのため、この2つはスコアで2位と3位にランクインしているにもかかわらず、フロンティア上には位置していません。Alibabaは9月2日にこの順位を発表し、Qwenの公式アカウントもこれを確認してユーザーをQwenCloudに案内しました。この測定はAlibabaによるものではありません。上記のベンチマーク表や、その直前のCommerceAgentBenchの実行とは異なり、このスコアはサードパーティのアリーナが人間の好み投票に基づいて生成したものです。

正直さを保つための注意点が2つある。第一に、アリーナのレーティングは時点評価である。1,691というのは、Alibabaがデビューを発表した時点でボードが示していた数字であり、投票が積み重なるにつれて変動する。したがって、これは恒久的な王冠ではなく、Web開発コーディングにおける強いシグナルとして読むべきだ。第二に、これはその1つの軸だけをカバーしている。今回のリフレッシュのエンタープライズ、科学、および一般的な長期タスクに関する主張には、依然として独立した審判がいない。そのため、エージェント型フロントエンド作業以外のすべてについては、ベンダーテーブルとベースモデルのAA Index 56が参照点であり続ける。第三に、フロンティア価格はモデリング上の選択であり、新しい料金表ではない。約5ドル/MTokenという数字は、変更されていない2ドル/6ドルのリストを、出力重視の使用想定で合成したものである。したがって、これはAlibabaによる価格改定ではなく、アリーナ自身の条件によるコスト効率ランキングとして扱うべきだ。

オープンウェイト、Qwen3.8-27B、そしてオンプレミスの問題

アリババのオープンウェイトの約束は今、果たされた。2026年8月12日、QwenはHugging Face上に2つのリポジトリを公開した — BF16形式のQwen3.8-2.4T-A95BとQwen3.8-2.4T-A95B-FP8である。それぞれに213個の重みファイルが含まれている。ライセンスはApache 2.0ではなく、カスタムのQwen3.8-Maxライセンスであり、Hugging Faceのライセンス欄には「other」と表示されている。条件は、帰属表示を条件として、商用利用を含む使用・改変・再配布・ファインチューニングを許可する。さらに、規模に基づく2つのゲートが設けられている:月間アクティブユーザーが1億人超、または月間売上が2,000万ドル超の製品は、モデル名を目立つように表示しなければならない。また、Model-as-a-ServiceまたはAI-Work-Assistantのビジネスで、直近12か月の総収益が5,000万ドルを超える場合は、Qwenから別途ライセンスを取得する必要がある。ほとんどのチームはこれらのゲート内に収まるだろう。もしあなたのビジネスがこれらの閾値を超えるなら、その上に構築する前にライセンス文書を読んでほしい。ダウンロード数もこの新しさを裏付けている — 本稿執筆時点でBF16リポジトリは978、FP8リポジトリは3,851である。フロンティアリリースとしては低い数字であり、8月8日に作成され、8月12日にようやく公開されたリポジトリと整合的で、1週間も公開されたままになっていたものではない。もう1つ正直な注意点を述べる:公開されたチェックポイントはベースモデルであり、テキストのみで思考(thinking)が常にオンになっている。一方、ホスト型のQwen3.8-Max APIは、視覚入力、オプションの非思考(non-thinking)モード、完全な1Mコンテキストを追加している。重みをダウンロードすればモデルは手に入るが、すべてのAPI機能が手に入るわけではない。

フラッグシップのセルフホスティングは、ほとんどのチームにとって依然として手の届かないものですが、今やその手の届かなさには明確な計算があります。完全な2.4Tパラメータの重みセットは、BF16でおよそ4.9TB、FP8で約2.4TBです。トークンごとに活性化されるのは95Bだけですが、すべてのエキスパートをメモリ上に常駐させる必要があるためです。4ビット量子化では約1.2TBとなり、H200あたり約141GBに対して、1トークンを処理する前から8基以上のハイエンドアクセラレータが必要になります。今回公開された活性化数が加えるのはスループット面の情報です。トークンあたり95Bが活性化される場合、トークンあたりの計算量は約90Bクラスのデンスモデルに相当し、2.4Tのデンスモデルが課すコストのほんの一部にすぎません。つまり、重みがメモリに常駐してしまえば、トークンあたりのコストは総パラメータ数が示唆するような悪夢ではありません。大きなメモリフットプリントと控えめなトークンあたりの計算量の組み合わせこそが、アリババが出力を100万トークンあたり6ドルで価格設定できる理由であり、セルフホスティングを検討するチームには、シングルGPUでの運用ではなく、FP8チェックポイントを実行するマルチGPUノードを指し示しています。

DigitalOceanのサービング選択は、その計算が本番環境で機能している実例です。具体的には、2.4Tの重みが単一ノードに収まり、ノード間のエキスパートルーティングを回避できるよう、NVIDIA HGX B300 GPU上でNVFP4量子化されたモデルを実行しています——これは、本セクションで紙面上で検討してきた4ビット経済性の本番導入です。そのトレードオフは、まさに上記のGPQAスポットチェックが定量化しているもの、すなわち、非量子化フラッグシップと比較してフットプリントは小さくなる一方で、品質には測定可能なコストがかかる、という点です。

まさにそれが、Qwen3.8-27Bをほとんどの読者にとってより重要なリリースにしている理由だ。そしてフラッグシップとは異なり、そのウェイトは予定どおりに公開された。2026年8月14日、QwenはApache 2.0の下でQwen/Qwen3.8-27BをHugging FaceとModelScopeに公開した。これはdense構成の27Bモデルで、ネイティブにマルチモーダル対応し、262Kトークンのネイティブコンテキスト(1Mまで拡張可能)と、設定可能なreasoning_effortモードを備える。UnslothのDaniel Han氏は、これがおよそ17GBのVRAM、つまりプロシューマー向けカード1枚で動作すると見積もっていたが、その推定は今やテスト可能になっている。公式リポジトリはBF16 safetensors(18シャード、約55.6GB)を提供し、GGUF量子化版はコミュニティのリポジトリで提供されている。こうして、この世代のリリースパターンは完結した。2.4Tのフラッグシップのウェイトは8月12日に先に公開され、オンプレミス向けの小型モデルはその2日後に登場した。私たちは、Qwen3.8-27Bのリリース日に関する記事で、このリリースを追跡した。

Qwen3.8-Maxが活躍する場面:4つのシナリオ

1. 長文書および契約分析。 これが最も適しています。100万トークンにわたる定額料金とOmniDocBench 92.1により、400ページの書類を追加料金なしで、チャンク分割も不要で1回の呼び出しで処理できます。長文脈プレミアムを請求する競合他社では、同じ作業がはるかに高額になります。DigitalOceanパスでは、そのパスが262Kコンテキストのオープンベースを提供していることに注意してください。それでも大規模な書類には対応できますが、完全な100万トークンには及びません。

2. リポジトリ規模のコーディングエージェント。Terminal-Bench 86.6とFrontierSWE 73.5はこれを裏付けており、キャッシュの価格設定により、安定したコードベースでの反復作業が安価になります。最初にテストすべきは、自分の同時実行環境でのレイテンシです。プレビュー時代のレビュアーは、長いエージェント実行においてモデルが丁寧だが遅いと指摘しており、またGA提供はプレビュー提供とは別物だからです。AAのGDPval-AAの結果は、タスクあたり64ステップというコストでトップクラスの1739 Eloを達成したもので、このトレードオフの両面を独立に裏付けています。DigitalOceanの8月12日の測定値は、256の同時リクエストで総スループットがほぼ線形にスケールして約1,937出力トークン/秒に達し、エラーゼロで飽和も見られなかったというもので、この問題に関する最初のマネージドプラットフォームのデータポイントです。ただし、これらはDigitalOcean自身のサービスでの独自の数値であり、Alibabaとの直接比較ではありません。

3. ドキュメントおよびスクリーンショットのパイプライン。ビデオおよび画像入力に加えてOSWorld-Verified 86.1により、スクリーンを読み取るワークフローにとって信頼できるものになります。— QA自動化、スクリーンショットからのサポートトリアージ、RPA関連タスクなど。繰り返しになりますが、マルチモーダル入力はホステッドAPI機能であり、DigitalOceanのオープンベースパスはテキストのみです。

4. まだ導入しない場面。レイテンシが重要なインタラクティブUXと、再現可能な評価を必要とする規制対象ワークロードがこれにあたります。前者には、制御可能な実測スループットが必要です。後者には、再現性のためにモデルカードと引用ライセンスが用意されていますが、Alibabaのベンチマーク表はまだ再現されておらず、AAのOmniscienceのリグレッション(ハルシネーション率が最大40%)は、独立したスコアが諸刃の剣であることを思い出させます。

Qwen3.8-Maxにアクセスする方法

実用的な経路はいくつかあります。Alibaba Model Studio / DashScope、またはQwen独自のQwenCloud APIを直接使う方法では、上記の料金表を入手でき、新しい日付入りスナップショットへ最も早くアクセスできます(9月2日付のQwen3.8-Max-0902ビルドも、他のエンドポイントへの展開に先立って、まずここに登場しました)。その代わり、新しいベンダーの導入と追加のAPIキー管理というコストがかかります。Qwen ChatとQwen Appは、コードを書く前に動作をざっと確認するのに最速の方法です。Hugging Faceからオープンウェイトをダウンロードするのは、自前のインフラを運用したいチームにとって4つ目の選択肢ですが、前述のサイズとライセンスに関する注意点が伴います。ルーター経由は、ほとんどの本番運用チームが検討すべき選択肢です。モデルの評価判断から移行判断を切り離せるためです。

2026年8月14日以降、真に新しい選択肢が登場しました: Qwen3.8-MaxがDigitalOcean Serverless Inferenceで利用可能になりました。これはAlibabaが「Day 0」ローンチパートナーとして発表したものです — Alibaba自身の位置づけですが、掲載はDigitalOceanのものであり、単独で成立しています。DigitalOceanはオープンウェイトのチェックポイント(プラットフォームモデルID qwen3.8-max)を、Inferactとの技術協力によりNVIDIA HGX B300 GPU上でNVFP4量子化し、完全マネージドのサーバーレスAPIとして提供します: 単一エンドポイント、使用量ベースの料金、管理するインフラは不要です。その料金表はAlibabaのリストと一致しています — $2.00入力 / $6.00出力(100万トークンあたり)、キャッシュ入力は$0.20 — そしてオープンベースがネイティブに備える262Kコンテキストを、思考モードを常時オンにして提供します。これは、ホスト型フラッグシップの約100万トークンのマルチモーダルモードとは異なります。このコンテキスト上限は、ワークロードが長文に依存する場合に重要です: 完全な100万トークンモードはAlibaba APIでのみ利用可能です。

地理に加えてDigitalOceanパスがもたらすのは、Alibaba以外のプロバイダーからの初の確固たるサービングデータです。DigitalOcean自身の本番エンドポイントに対する測定(8月12日実施)では、prefillは約16,000 tokens/secで線形にスケーリングし、経験則としてTTFT ≈ (input ÷ 16,000) + 0.7s、つまり約1,080トークンで約1.1秒、約254Kで約15.8秒、そして総スループットは同時256リクエストで約1,937出力トークン/秒に達し、エラーゼロ、飽和点も見つかりませんでした。これらはDigitalOceanが自社デプロイメントで測定した数値であり、管理された比較試験ではありませんが、このモデルについてAlibabaのクラウド以外で得られた初のレイテンシーと並行性のデータであり、プレビュー時代の「徹底しているが遅い」という懸念に直接答えるものです。

Qwen3.8-Max は OrcaRouter 上で qwen/qwen3.8-max として利用可能になりました。また、9月2日のリフレッシュ版は、独自の日付IDである qwen/qwen3.8-max-0902 でルーティングできます。どちらも同じ $2.00 / $6.00 のリストレートです。OrcaRouter はマークアップ0%を適用し、プロバイダー料金をそのまま通すため、どちらのルートでも直接利用する場合と同じコストになります。当社のサービングテレメトリによれば、直近7日間の p50 の Time-to-First-Token は1.64秒です。これはベンダーの主張ではなく、ファーストパーティによるレイテンシ計測値であり、プレビュー時代にあった「使った中で最も遅いモデル」という報告と比較検討する価値があります。その報告は、プレビューインフラ上で1時間に及ぶエージェント型ビルドを実行した一人のレビュアーによるものであり、現在の事実として繰り返されるのではなく、GAサービングに対して再テストされるべきです。

ルーターパスの実用的な価値は、Qwen3.8-Maxが、あなたがすでに実行しているモデルと同じOpenAI互換エンドポイントの背後にあることです。つまり、評価はモデル文字列の変更で済みます。本番トラフィックの5%をそこに送り、同一のプロンプトで既存モデルと比較し、フォールバックを維持できます。これはまさに、複製されていないベンダーテーブルを持つモデルにふさわしい姿勢です。その同じ姿勢が、DigitalOceanデプロイをテストする正しい方法でもあります。フォールバックを配置した上でトラフィックの一部を流すのであって、2週間前のサービングスタックに本番パスを賭けるのではありません。

制限事項と正直なリスク

ベンダーテーブルはまだ監査されていない。独立スコアは判明している(AAインデックス56)。しかし、Alibaba自身のベンチマークテーブルは未再現のままであり、AAの測定は幻覚率が最大40%に達するOmniscienceのリグレッションを指摘している。独立スコアリングは役立つものの、ベンダーテーブルを監査可能にするわけではない。

DigitalOceanのパスはオープンベースであり、フラッグシップではありません。これは、262Kコンテキスト、テキストのみ、思考は常時オン、NVFP4量子化のチェックポイントを提供します。そして、DigitalOcean自身のスポットチェックのスコアは、Alibabaが公表した92.6に対して、GPQA Diamondで88を記録しています。DigitalOceanはその差を、統制された比較ではなく参考的なものと呼んでいます。完全な100万トークンのマルチモーダルAPIが必要な場合は、それは依然としてAlibabaがホストしています。

Qwen3.8-27Bはリリースされたが、ベンダー独自の型番が付けられている。 27Bのウェイトは8月14日にApache 2.0ライセンスで公開され、オンプレミス展開のギャップを解消した。ただし、ベンチマークの主張はAlibaba社による報告のみで再現されておらず、コミュニティによる量子化版も本更新時点ではまだ展開中だった。

• Apache 2.0ではなく、カスタムライセンスです。Qwen3.8-Maxライセンスは、帰属表示を条件に商用利用を許可しますが、2つのスケールゲートがあります。月間アクティブユーザー数(MAU)1億超または月間売上高2,000万米ドル超の場合はモデル名の目立つ表示が必要となり、直近12か月の売上高が5,000万米ドルを超えるMaaS/AI-Work-Assistant事業には別途ライセンスが適用されます。しきい値を超えて規模を拡大する前に、必ずライセンスをお読みください。

冗長性と指示の逸脱。 IFBench 82.8 は、Alibaba 自身の表では最も低い数値であり、プレビューテスターは、モデルが範囲を超えて、要求されていない機能を追加するのを繰り返し目撃した。AA 自身の数字が今やそれを数値化している: GDPval-AA タスクあたり 64 ステップがコストを $1.14 に押し上げ、Kimi K3 より 25% 高い。デモでは魅力的だが、出力が $6/1M で課金されると高価になり、正確な形式が必要な場合は不安定になる。

コンテンツのガードレール。 他の中国でホストされているフロンティアモデルと同様に、政治的に敏感なトピックに関する応答は制約されます。製品がオープンエンドのクエリを扱う場合に関連します。

思考トークンは出力として課金されます。推論を有効にすると、実際のコストは単純な見積もりを上回ります。実際に本番で使う設定で推論を構成し、測定してください。

よくある質問

Qwen3.8-Maxは今利用可能ですか?

はい。2026年8月3日に一般提供(GA)が開始され、公開された料金表と、OpenAIおよびDashScope互換のAPIが提供されています。現在の本番スナップショットであるQwen3.8-Max-0902(9月2日リリース)はQwenCloudのAPI上で稼働しており、標準のqwen3.8-maxエンドポイントが現在提供しているのはこのバージョンです。これは7月19日のプレビュー段階からの変更であり、当時はアクセスがQwen Chat、Qwen App、およびQoderのクレジットキャンペーンに限定されていました。

Qwen3.8-Max-0902とは何ですか?

Qwen3.8-Max-0902は、Qwen3.8-Maxの2026年9月2日付プロダクションリフレッシュ版です。2.4TパラメータのスパースMoEフラッグシップと1Mトークンのコンテキストはそのままに、「Coding」と「Cowork」向けに追加のポストトレーニングを施し、同じ$2/$6の価格でQwenCloudのAPI上で稼働しています。Qwenによると、新しいスナップショットは複雑なエンタープライズ/科学タスクでより強力になっています(ベンダーの主張であり、独立したベンチマークはまだ実施されていません)。一方、コーディング面ではすでに独立した結果を残しています。Code Arena: WebDevのリーダーボードで1,691ポイントを獲得して第1位、そして平均で約$5/MTokenというコストパフォーマンスのパレートフロンティアの最上位です。これはAlibabaによるライブアリーナ掲載の発表に基づくもので、Qwen自身のQwenCloudアカウントでも確認されています。

Qwen3.8-Maxの料金はいくらですか?

入力トークン100万件あたり2.00ドル、出力トークン100万件あたり6.00ドルで、100万トークンのコンテキスト全体でフラットな料金となり、長いプロンプトに対する追加料金はありません。キャッシュされた入力へのヒットは100万件あたり0.25ドル、明示的なキャッシュ作成は2.50ドル、キャッシュ読み取りは0.17ドルです。推論トークンは出力レートで課金されます。Artificial Analysisのインテリジェンスインデックスでは、このモデルの測定コストはタスクあたり1.14ドルです。この数字がトークン計算を上回る理由については、価格設定セクションを参照してください。DigitalOceanのサーバーレスパスでも同じ2ドル/6ドルで、キャッシュされた入力は0.20ドルです。

Qwen3.8-Maxのパラメータ数はいくつですか?

合計2.4兆パラメータで、スパースなMixture-of-Experts構成です。実際にサービングのコストとレイテンシを決定するアクティブパラメータ数は、Qwen3.8-2.4T-A95Bの公式モデルカードによると、活性化される950億と確認されています(512エキスパート。各トークンにつき10個がルーティングされ、1個の共有エキスパートがアクティブ)。

Qwen3.8-Maxの重みは公開されていますか?

はい — 2026年8月12日からです。QwenはHugging Face上でQwen3.8-2.4T-A95B(BF16)とQwen3.8-2.4T-A95B-FP8を公開しました。それぞれ213個の重みファイルが含まれています。ライセンスはApache 2.0ではなく、カスタムのQwen3.8-Maxライセンス(Hugging Faceでは「other」と記載)です。商用利用は帰属表示を条件に許可され、規模に基づく2つのゲートが設けられています。オープン版チェックポイントはテキストのみで、思考(thinking)モードが常時有効です。ホステッドAPIでは、ビジョン対応、非思考モードのオプション、フル1Mコンテキストが追加されています。

Qwen3.8-Maxは独立してベンチマークされていますか?

はい——2026年8月6日時点での話です。Artificial Analysisは、アリババ公式APIでの測定に基づき、Intelligence Indexで56点、タスクあたり1.14ドルと評価しています。これはQwen3.7-Max(46点)より10ポイント上回り、Claude Opus 4.8(56点)と同等、Kimi K3(57点)に1ポイント及ばない水準です。ただし、上記のベンチマーク表は依然としてアリババの自己報告であり、第三者による再現は行われていません。LMArenaの一般リーダーボードにも、いまだ公開スコアはありません。独立系アリーナの状況は9月2日に変わりました。0902リフレッシュ版は、同じプラットフォーム内のCode Arena: WebDevボードで1,691ポイントを獲得し、1位でデビューしました。これはアリババ作成の表ではなく、第三者によるブラインド投票の結果です。また、Code Arenaのコストパフォーマンス・フロンティアでは、複合で約5ドル/MTokenという、同ボードで最もスコアの高いコスパ枠としてリストアップされています。DigitalOceanによる量子化ビルドのスポットチェック(GPQA Diamondで88点)は、サービングデプロイに対する初の第三者チェックであり、統制された評価ではなく参考値であることが明示されています。「独立」の欄について注意点が一つあります。Qwen3.8-MaxがオープンウェイトモデルをリードするCommerceAgentBenchは、第二の独立した評価者ではありません。それを構築・公開したAccioは、アリババ自身のチームだからです。

Qwen3.8-MaxはQwen3.7-Maxより優れていますか?

Alibaba自身の数字によれば、実質的に──{{1}}FrontierSWE 73.5 versus 40.7{{/1}}と{{2}}DeepSWE 1.1 56.6 versus 21.6{{/2}}は、困難なソフトウェアエンジニアリングタスクでのほぼ倍増です。また、前世代モデルの$2.50/$7.50よりも安価です。AAは独自に、そのIntelligence Indexで世代間の飛躍を10ポイント(56対46)としています。両方の主張は、お客様のワークロードで検証すべきです。

Qwen3.8-Maxをセルフホストすることはできますか?

現実的にはそうではありません。2.4Tの完全なウェイトセットは、BF16でおよそ4.9TB、FP8で約2.4TB、4ビットで約1.2TBになり、H200あたり約141GBと比べると、8台以上のトップエンドGPUに相当します。1トークンあたり95Bのアクティブパラメータであれば、トークンあたりの計算量は比較的控えめですが、メモリフットプリントが制約要因です。DigitalOceanのB300でのNVFP4サービングは、4ビットならモデルが単一ノードに収まるという実際の証明です。Qwen3.8-27B(VRAM約17GBと報告)は、現実的なオンプレミス向けの選択肢であり、そのウェイトは2026年8月14日にApache 2.0で公開され、もはや約束ではなく、ダウンロード可能になっています。

Qwen3.8-27Bとは何ですか?

この小規模モデルは、フラッグシップモデルと同時に発表され、実用的なオンプレミス展開の選択肢として位置づけられています。高密度の27Bモデルで、ネイティブにマルチモーダル対応、ネイティブのコンテキスト長は262Kトークンで100万トークンまで拡張可能、Apache 2.0ライセンスで提供されます。そのウェイトは2026年8月14日にHugging FaceとModelScopeで公開されました。UnslothのDaniel Han氏によると、約17GBのVRAM — ハイエンドのコンシューマー向けGPU一枚 — で動作するとのことです。ベンチマークの主張はAlibabaによる報告であり、第三者による独立した再現は行われていません。

Qwen3.8-Maxはマルチモーダルですか?

はい — テキスト、画像、動画の入力を受け付け、テキストを返します。また、思考モード、関数呼び出し、組み込みツール、構造化出力にも対応しています。オープンウェイトのチェックポイントはテキストのみです。マルチモーダル入力はホスト型APIの機能であり、DigitalOceanパスには含まれていません。

Qwen3.8-MaxはDigitalOceanで利用できますか?

はい — 2026年8月14日以降です。DigitalOcean Serverless Inferenceは、オープンウェイトのチェックポイント(NVIDIA HGX B300上のNVFP4)を、1Mあたり$2.00/$6.00、キャッシュ入力は$0.20、262Kトークンのコンテキスト、テキストのみ、思考は常時オンで提供します。AlibabaはDigitalOceanを「Day 0ローンチパートナー」と呼んでいます。リスト自体はDigitalOceanのものであり、その表現からは独立しています。DigitalOceanの測定値: プレフィルは毎秒約16Kトークン、256の同時リクエスト時には毎秒約1,937出力トークン、エラーはゼロです。

Qwen3.8-MaxをOrcaRouter経由で使用できますか?

はい。qwen/qwen3.8-max として稼働中で、9月2日時点のスナップショットは独自の日付入りID — qwen/qwen3.8-max-0902 — として、同じ $2.00/$6.00 のリスト価格、マークアップ0%で提供されています。ルーティングのコストは直接接続と同じで、すでにご利用の OpenAI 互換エンドポイントの背後にあります。当社の7日間テレメトリによると、p50 の最初のトークンまでの時間は1.64秒です。

今日、本番トラフィックをそれに移すべきですか?

全面的な移行ではありません。価格設定と最初の独立スコアにより、本格的な評価は今なら安価で実施する価値があります。ただし、タスクあたりのコストがKimi K3より25%高いため、規律ある行動は、既存システムに対して同一のプロンプトでトラフィックを分割し、フォールバックを用意することであり、移行ではありません。DigitalOceanのパスは、テスト対象となる2つ目のマネージドデプロイを追加するため、評価はさらに安価になります。

結論

Qwen3.8-Maxは、2週間にわたり「誰も買えない最も興味深いモデル」であり続けた。GA(一般提供)の時点では、それはまったく別の価値提案となる。100万トークンあたり一律$2/$6というのは攻撃的な価格設定であり、キャッシュレートによって反復的なエージェント作業は安価になり、FrontierSWEとDeepSWEにおける世代的な飛躍—それが再現されるならば—は、このモデルをスケールの誇示ではなく、本物のコーディングモデルにする。8月12日に正式なライセンスの下でオープンウェイトが提供されたことで、「オープンウェイトは近日公開」という約束は事実になった。さらに、8月14日に発表された発売初日からのDigitalOcean提供(実測の提供数値と$0.20のキャッシュ読み取りを伴う)は、「安く試せる」という選択肢をより強力にし、チームにAlibaba自身のAPIと比較できるマネージドなサードパーティ製デプロイを与える。9月2日のQwen3.8-Max-0902リフレッシュも、その主張を維持している。価格は同じ$2/$6、コンテキストは100万トークンのままで、モデルがもともと対象としていたコーディングと共同作業に、より多くのポストトレーニングが施されている。さらに、このリフレッシュでは、コーディングの売り込みに向けた独立した人間の選好スコアボードも追加された。Qwen3.8-Max-0902は、Code ArenaのWebDevボードで1,691ポイントを記録して初登場第1位となり、Claude Opus 5とKimi K3を上回った。ブレンドで約$5/MTokenという価格でありながら、同ボードのコストパフォーマンスに関するパレートフロンティア上では最高スコアのモデルである。同じ週にAlibabaのAccioチームが公開したCommerceAgentBenchの結果(実際のコマースワークフローから構築されたベンチマークでQwen3.8-Maxがオープンウェイト分野をリードしている)は、その共同作業に関する主張に、ベンダー運営ではあるものの、独自の具体的なスコアボードを与えている。

変わったのは、判定役(レフェリー)とウェイトの両方が着地したことだ。そして評決は、確かな但し書き付きで概ね良好である。AAはQwen3.8-Maxをインテリジェンス指数で56と評価しており、これは真の世代ジャンプであり、Claude Opus 4.8と同水準に並ぶ。もっとも、同じスコアカードが示すところでは、Kimi K3が1ポイント先行し、タスクあたりコストは25%低い。さらに同カードは、幻覚率の上昇に伴うOmniscienceの10ポイント低下も警告している。アクティブパラメータの論点は決着した。モデルカードで確認されたとおり、95Bがアクティブ化されている。ライセンスも公開され、Apache 2.0ではなくカスタムライセンスである。変わっていない点もある。Alibaba自社のベンチマーク表は依然として第三者による再現がなされておらず、モデルがタスクごとに膨大なステップを踏むためタスクあたりコストは依然として高く、DigitalOcean上で提供されるオープンベースモデルはフラッグシップの公称値(262Kコンテキスト、NVFP4、GPQAスポットチェック88対92.6)とはやや異なるモデルであり、Qwen3.8-27Bのベンチマーク主張は、ウェイトが公開済みであるにもかかわらず、ベンダー報告のままである。こうした組み合わせは、Qwen3.8-Maxが悪い賭けであることを意味しない。この価格であれば、ほぼ必須の実験と言える。しかし適切な姿勢とは、積極的に評価し、意図的にルーティングし、フォールバックを確保しておくことだという意味だ。今後注視すべきは、1タスクあたり1.14ドルのコストの背後にあるエージェント的ステップ数を自社のワークロードが吸収できるかどうか、0902ビルドのCode Arena: WebDevでのリードが投票の蓄積とともに維持されるかどうか、CodingとCoworkでの向上が実際のワークロードで再現されるかどうか、CommerceAgentBenchのオープンウェイトリード——Alibaba自社のハーネスでの2回の集計パス——が独立した実行に耐えるかどうか、27Bのベンチマーク主張が持ちこたえるかどうか、そしてDigitalOceanデプロイメントの測定済みスループットが実際のトラフィック下で維持されるかどうかだ。その答えによって、「Fable 5に次ぐ」がポジショニングだったのか、予言だったのかが決定づけられるだろう。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新