生成されたタイトルカードには「AREX-2 vs Qwen3.8-Max — 基盤とその上で動くもの」と表示され、2つのパネルがある。左のパネルは「Qwen3.8-Max」という見出しで、以下を列挙している:2026年8月3日から稼働中、100万トークンのコンテキスト、マルチモーダル、100万トークンあたり入力$2/出力$6、今日から呼び出し可能。右のパネルは「AREX-2」という見出しで、以下を列挙している:リポジトリは2026年9月29日に作成、重みなし、モデルカードなし、料金表はどこにもなし、どこからも呼び出し不可。フッターには「最初のAREX世代はQwenバックボーンで事後学習された」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

AREX-2 vs Qwen 3.8:一方は基盤であり、もう一方はおそらくその上に構築されている

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

の対決はAREX-2とQwen3.8-Max、中国の2つのラボのフラッグシップシステム同士の真っ向勝負に見えるが、そうではない——AREX-2が未実証だからではなく(もっとも実際に未実証ではあるのだが)、両者が同じスタックの異なる層に位置しているからだ。Qwen3.8-Maxは2026年8月3日から稼働しており、100万トークンのコンテキストウィンドウで入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。そのオープンウェイトの兄弟モデルであるQwen3.8-27BとQwen3.8-Flashは、8月13日と8月26日にベンチマークと価格を公開して出荷された。AREX-2は、BAAIが2026年9月29日17:56 UTCにHugging Face上に作成したリポジトリであり、中身は.gitattributesだけで、他には何もない。そして両者がライバルではない理由は、どちらのベンダーも大々的には宣伝していない根底の事実にある。すなわち、BAAIがこれまでにリリースしたAREXモデルはすべてQwe​nのバックボーン上に構築されているのだ。

それはAREX-2に関する憶測ではない。実在する世代について文書化されている。AREX-BaseはQwen3.5-122B-A10B上に構築された、1220億パラメータのMixture-of-Expertsで、活性パラメータは100億。AREX-TurboはQwen3.5-4B上に構築されたdenseな4B。両方とも2026年7月23日にApache 2.0でリリースされた。したがって、この比較の正直な形は、エージェント対フラッグシップではない。それはこうだ。Alibabaの基盤は今日あなたに何をもたらすのか、BAAIのエージェント層はその上に何を加えるのか、そしてBAAIがファイルをアップロードする前に、2番目の問いのどれだけに答えられるのか。

Qwen側では何が稼働していて、そのコストはいくらなのか

Qwen3.8世代は、三つの異なる階層で仕様と価格が完全に公開されているため、驚くほど考察しやすい。

• Qwen3.8-Max — 2026年8月3日リリース。100万トークンのコンテキストウィンドウ、ネイティブのテキスト・画像・動画入力、思考モード、関数呼び出しと構造化出力、そして5つのリージョンにわたる3つのワイヤーフォーマット(OpenAI互換、Anthropic互換、ネイティブのDashScope)。入力100万トークンあたり$2.00、出力100万トークンあたり$6.00、キャッシュ読み取りは$0.25。

• Qwen3.8-27B — 2026年8月13日リリース。Dense、27Bパラメータ、256Kコンテキスト(262,144ポジション)、テキスト・画像・動画入力、Apache 2.0 ウェイト。Qwen自身のモデルカードで公開されている数値は、LiveCodeBench v6で90.3、GPQA Diamondで89.2、OSWorld-Verifiedで84.3、QwenSWEBenchで79.0 — ベンダー報告であり、独立に再現されたものではない。独立した測定では、Artificial Analysis Intelligence Indexが33.7、AA Coding indexが68.1。

• Qwen3.8-Flash — 2026年8月26日リリース。同じ100万トークンのコンテキストウィンドウと同じマルチモーダル入力に対応し、入力100万トークンあたり0.15ドル、出力は0.47ドル。このファミリーの低価格帯モデルであり、大量のエージェントトラフィックを手頃なコストで処理できるモデルです。

タグが付いていないQwen3.8の項目もあります。これは2.4兆パラメータのフラッグシップモデルで、アリババは重みを公開予定だと述べていますが、まだどこからも呼び出せません。「Qwen 3.8」を検索して1つのモデルを期待しているなら、答えが1つではなく4つのファミリーになるのはそのためです。

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

それらすべてとは対照的に、AREX-2の仕様はたった1行だ。リポジトリ、タイムスタンプ、そしてBAAIがすでに一度構築した何かの第2世代を暗示する名前。

比較全体の枠組みを変えるその詳細

AREXはQwe​nの競合相手ではなく、その利用者である。第1世代のAREXモデルはいずれもQwen3.5のバックボーン上でポストトレーニングされ、その後、チャットモデルではなくエージェントにするフレームワークで包まれている。すなわち、検索し、ブラウズし、証拠を統合して、信頼度の数値を伴う候補回答を組み立てる内側のループと、その回答を元の制約と照合し、受け入れるか、改善するか、その軌跡を破棄してやり直す外側のループである。AREXで興味深いエンジニアリングは、ネットワークではない。ループであり、検証済みの知見、未確定の候補、未解決の制約を長いホライズンにわたって正確に保つコンテキスト更新メカニズムであり、検索とブラウジングをモデルにとって第一級のアクションとして公開するツールインターフェースである。

だからこそ、このファミリー自身が公表した数値 —— 122B Base の BrowseComp 82.5、GAIA 85.4、xbench-2510 71.0、DeepSearch QA 89.9、WideSearch-en 82.0、および 4B Turbo の 70.7 / 81.6 / 57.0 / 78.5 / 68.5 —— は、Qwen3.8-27B のコーディングおよびエージェントのスコアとは比較できない。たとえ両者がアーキテクチャ上の系統を共有していても。両者は別のものを測っている。QwenSWEBench は、モデルがリポジトリの issue を解決できるかを問う。BrowseComp は、エージェントが、多数の検索を通じて、意図的に見つけにくくされた事実を見つけ出せるか、しかも問いを失わずに、を問う。生の Qwen3.5 チェックポイントは、2つ目では悪いスコアを、1つ目では良いスコアを出す。まさにこれが、BAAI のポストトレーニングとハーネスが埋めるために存在するギャップである。

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

第二世代が最もありそうな形でどのようなものになるか

AREX-2がこのパターンを踏襲するなら、最も可能性の高い読み解きは——推論であり、事実ではない——現在のAREXモデルが使っている3.5世代よりも新しいQwenバックボーンで事後学習された第二世代のリサーチエージェントだというものです。Qwen3.8-27Bはdenseで、マルチモーダルかつApache 2.0ライセンスなので、品質ティアのエージェントにとって自然な候補になります。Qwen3.8-Flashはトークン単価が安く、エージェントがクエリごとに何十回も呼び出し、各ステップで増えていくコンテキストを読み直す場合には、この点が極めて重要になります。

それはどれも確認されていない。この名前にはサイズもバックボーンも日付もなく、製品ラインにおける「2」は仕様ではなく命名規則にすぎない。確認されていることははるかに限定的であり、そう述べるべきだ。BAAIが2026年9月29日にリポジトリを作成し、中には何も入れず、何も発表していない。重みも、モデルカードも、パラメータ数も、ライセンスタグも、ベンチマークも、それを提供するプロバイダーもない。今週どこかでAREX-2の数値が引用されているのを見かけても、それらは測定値ではない。

今日の午後に実際に買えるもの

この二者の間にある実務上の非対称性は、品質の違いではない。一方には料金表があり、他方にはディレクトリの掲載がある、ということだ。

あなたの仕事がエージェント的で、AREXファミリーがその上に構築された基盤を求めるなら、その正確なバックボーンは呼び出せます:Qwen3.5-122B-A10B はOrcaRouterのカタログにあり、128Kトークンまで入力100万トークンあたり$0.115、出力100万トークンあたり$0.917、それを超えると$0.287 / $2.294に上がり、ビジョン、ツール使用、推論が有効です。それはAREX-Baseが事後学習するモデルで、何も待たずに利用できます。

最新世代をお求めなら、オープンなQwen3.8の両ティアがカタログに揃っています:Qwen3.8-27B 入力100万トークンあたり$0.33、出力$2.40で、当社独自のインフラ上で稼働。ウェイトがオープンで、通過させるべきベンダーのトークン単位コストが存在しないためです。さらにQwen3.8-Flashはボリュームティアで$0.15 / $0.47。1つのAPIが両方をカバーし、プロバイダーの定価をそのまま通してトークンあたり何も上乗せしないので、Alibabaが価格を動かせばここの数字も同じ日に動きます。

また、AREX-2が実際にリリースされるようになれば、それがその同じレイヤーの背後に置かれるべき理由は、宣伝上のものではなく構造上のものだ。クエリごとに20回の呼び出しを行うエージェントループは、あらゆるプロバイダーの障害率を20倍にする。実行時に判断する自動フェイルオーバーを備えたルーティングルールは、タイムアウトが再試行になるのか、それとも自信たっぷりの誤答になるのかの違いを生む。この論拠はあらゆるリサーチエージェントに当てはまり、ルーティングすべきAREX-2が存在するようになれば、AREX-2にも当てはまるだろう。

誰が、何について行動すべきか

今日、リサーチエージェントが必要なら、AREX-Base が実在する AREX モデルです。7月に Apache 2.0 のもとで提供開始され、そのエージェントベンチマークはベンダー自身によるものですが、少なくともダウンロード可能なモデルに紐づいています。今日、フロンティアなマルチモーダル推論や大量のエージェントトラフィックが必要なら、Qwen3.8 の各ティアは稼働中で、価格も設定され、一部は独立に評価されており、AREX-2 の存在がその判断を変えることはありません。

AREX-2が今週あなたが下す判断に関わる唯一のシナリオは、ファインチューニング用のバックボーンを選んでいるときだ。そしてそこでは、答えはすでにカタログにはっきり見えている。AREXが使った3.5バックボーンは今なお安価で入手可能であり、3.8世代はより優れていて同様に入手可能であり、第二世代AREXは——いつ登場するにせよ——BAAIがどのQwenベースを土台に築く価値があると考えているかの証拠になる可能性がほぼ確実で、その置き換えではない。

三つ揃えば残りは片づく。ツリー内のファイル、パラメータ数とベースモデル欄を備えたカード、そしてライセンスタグだ。そのうち肝心なのは最初のもので、それが実現するまでは、この比較は価格が付いたファミリーとプレースホルダーの比較でしかない。