
AREX-2 vs Qwen 3.8:一方は基盤であり、もう一方はおそらくその上に構築されている
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
の対決はAREX-2とQwen3.8-Max、中国の2つのラボのフラッグシップシステム同士の真っ向勝負に見えるが、そうではない——AREX-2が未実証だからではなく(もっとも実際に未実証ではあるのだが)、両者が同じスタックの異なる層に位置しているからだ。Qwen3.8-Maxは2026年8月3日から稼働しており、100万トークンのコンテキストウィンドウで入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。そのオープンウェイトの兄弟モデルであるQwen3.8-27BとQwen3.8-Flashは、8月13日と8月26日にベンチマークと価格を公開して出荷された。AREX-2は、BAAIが2026年9月29日17:56 UTCにHugging Face上に作成したリポジトリであり、中身は.gitattributesだけで、他には何もない。そして両者がライバルではない理由は、どちらのベンダーも大々的には宣伝していない根底の事実にある。すなわち、BAAIがこれまでにリリースしたAREXモデルはすべてQwenのバックボーン上に構築されているのだ。
それはAREX-2に関する憶測ではない。実在する世代について文書化されている。AREX-BaseはQwen3.5-122B-A10B上に構築された、1220億パラメータのMixture-of-Expertsで、活性パラメータは100億。AREX-TurboはQwen3.5-4B上に構築されたdenseな4B。両方とも2026年7月23日にApache 2.0でリリースされた。したがって、この比較の正直な形は、エージェント対フラッグシップではない。それはこうだ。Alibabaの基盤は今日あなたに何をもたらすのか、BAAIのエージェント層はその上に何を加えるのか、そしてBAAIがファイルをアップロードする前に、2番目の問いのどれだけに答えられるのか。
Qwen側では何が稼働していて、そのコストはいくらなのか
Qwen3.8世代は、三つの異なる階層で仕様と価格が完全に公開されているため、驚くほど考察しやすい。
• Qwen3.8-Max — 2026年8月3日リリース。100万トークンのコンテキストウィンドウ、ネイティブのテキスト・画像・動画入力、思考モード、関数呼び出しと構造化出力、そして5つのリージョンにわたる3つのワイヤーフォーマット(OpenAI互換、Anthropic互換、ネイティブのDashScope)。入力100万トークンあたり$2.00、出力100万トークンあたり$6.00、キャッシュ読み取りは$0.25。
• Qwen3.8-27B — 2026年8月13日リリース。Dense、27Bパラメータ、256Kコンテキスト(262,144ポジション)、テキスト・画像・動画入力、Apache 2.0 ウェイト。Qwen自身のモデルカードで公開されている数値は、LiveCodeBench v6で90.3、GPQA Diamondで89.2、OSWorld-Verifiedで84.3、QwenSWEBenchで79.0 — ベンダー報告であり、独立に再現されたものではない。独立した測定では、Artificial Analysis Intelligence Indexが33.7、AA Coding indexが68.1。
• Qwen3.8-Flash — 2026年8月26日リリース。同じ100万トークンのコンテキストウィンドウと同じマルチモーダル入力に対応し、入力100万トークンあたり0.15ドル、出力は0.47ドル。このファミリーの低価格帯モデルであり、大量のエージェントトラフィックを手頃なコストで処理できるモデルです。
タグが付いていないQwen3.8の項目もあります。これは2.4兆パラメータのフラッグシップモデルで、アリババは重みを公開予定だと述べていますが、まだどこからも呼び出せません。「Qwen 3.8」を検索して1つのモデルを期待しているなら、答えが1つではなく4つのファミリーになるのはそのためです。

それらすべてとは対照的に、AREX-2の仕様はたった1行だ。リポジトリ、タイムスタンプ、そしてBAAIがすでに一度構築した何かの第2世代を暗示する名前。
比較全体の枠組みを変えるその詳細
AREXはQwenの競合相手ではなく、その利用者である。第1世代のAREXモデルはいずれもQwen3.5のバックボーン上でポストトレーニングされ、その後、チャットモデルではなくエージェントにするフレームワークで包まれている。すなわち、検索し、ブラウズし、証拠を統合して、信頼度の数値を伴う候補回答を組み立てる内側のループと、その回答を元の制約と照合し、受け入れるか、改善するか、その軌跡を破棄してやり直す外側のループである。AREXで興味深いエンジニアリングは、ネットワークではない。ループであり、検証済みの知見、未確定の候補、未解決の制約を長いホライズンにわたって正確に保つコンテキスト更新メカニズムであり、検索とブラウジングをモデルにとって第一級のアクションとして公開するツールインターフェースである。
だからこそ、このファミリー自身が公表した数値 —— 122B Base の BrowseComp 82.5、GAIA 85.4、xbench-2510 71.0、DeepSearch QA 89.9、WideSearch-en 82.0、および 4B Turbo の 70.7 / 81.6 / 57.0 / 78.5 / 68.5 —— は、Qwen3.8-27B のコーディングおよびエージェントのスコアとは比較できない。たとえ両者がアーキテクチャ上の系統を共有していても。両者は別のものを測っている。QwenSWEBench は、モデルがリポジトリの issue を解決できるかを問う。BrowseComp は、エージェントが、多数の検索を通じて、意図的に見つけにくくされた事実を見つけ出せるか、しかも問いを失わずに、を問う。生の Qwen3.5 チェックポイントは、2つ目では悪いスコアを、1つ目では良いスコアを出す。まさにこれが、BAAI のポストトレーニングとハーネスが埋めるために存在するギャップである。

第二世代が最もありそうな形でどのようなものになるか
AREX-2がこのパターンを踏襲するなら、最も可能性の高い読み解きは——推論であり、事実ではない——現在のAREXモデルが使っている3.5世代よりも新しいQwenバックボーンで事後学習された第二世代のリサーチエージェントだというものです。Qwen3.8-27Bはdenseで、マルチモーダルかつApache 2.0ライセンスなので、品質ティアのエージェントにとって自然な候補になります。Qwen3.8-Flashはトークン単価が安く、エージェントがクエリごとに何十回も呼び出し、各ステップで増えていくコンテキストを読み直す場合には、この点が極めて重要になります。
それはどれも確認されていない。この名前にはサイズもバックボーンも日付もなく、製品ラインにおける「2」は仕様ではなく命名規則にすぎない。確認されていることははるかに限定的であり、そう述べるべきだ。BAAIが2026年9月29日にリポジトリを作成し、中には何も入れず、何も発表していない。重みも、モデルカードも、パラメータ数も、ライセンスタグも、ベンチマークも、それを提供するプロバイダーもない。今週どこかでAREX-2の数値が引用されているのを見かけても、それらは測定値ではない。
今日の午後に実際に買えるもの
この二者の間にある実務上の非対称性は、品質の違いではない。一方には料金表があり、他方にはディレクトリの掲載がある、ということだ。
あなたの仕事がエージェント的で、AREXファミリーがその上に構築された基盤を求めるなら、その正確なバックボーンは呼び出せます:Qwen3.5-122B-A10B はOrcaRouterのカタログにあり、128Kトークンまで入力100万トークンあたり$0.115、出力100万トークンあたり$0.917、それを超えると$0.287 / $2.294に上がり、ビジョン、ツール使用、推論が有効です。それはAREX-Baseが事後学習するモデルで、何も待たずに利用できます。
最新世代をお求めなら、オープンなQwen3.8の両ティアがカタログに揃っています:Qwen3.8-27B 入力100万トークンあたり$0.33、出力$2.40で、当社独自のインフラ上で稼働。ウェイトがオープンで、通過させるべきベンダーのトークン単位コストが存在しないためです。さらにQwen3.8-Flashはボリュームティアで$0.15 / $0.47。1つのAPIが両方をカバーし、プロバイダーの定価をそのまま通してトークンあたり何も上乗せしないので、Alibabaが価格を動かせばここの数字も同じ日に動きます。
また、AREX-2が実際にリリースされるようになれば、それがその同じレイヤーの背後に置かれるべき理由は、宣伝上のものではなく構造上のものだ。クエリごとに20回の呼び出しを行うエージェントループは、あらゆるプロバイダーの障害率を20倍にする。実行時に判断する自動フェイルオーバーを備えたルーティングルールは、タイムアウトが再試行になるのか、それとも自信たっぷりの誤答になるのかの違いを生む。この論拠はあらゆるリサーチエージェントに当てはまり、ルーティングすべきAREX-2が存在するようになれば、AREX-2にも当てはまるだろう。
誰が、何について行動すべきか
今日、リサーチエージェントが必要なら、AREX-Base が実在する AREX モデルです。7月に Apache 2.0 のもとで提供開始され、そのエージェントベンチマークはベンダー自身によるものですが、少なくともダウンロード可能なモデルに紐づいています。今日、フロンティアなマルチモーダル推論や大量のエージェントトラフィックが必要なら、Qwen3.8 の各ティアは稼働中で、価格も設定され、一部は独立に評価されており、AREX-2 の存在がその判断を変えることはありません。
AREX-2が今週あなたが下す判断に関わる唯一のシナリオは、ファインチューニング用のバックボーンを選んでいるときだ。そしてそこでは、答えはすでにカタログにはっきり見えている。AREXが使った3.5バックボーンは今なお安価で入手可能であり、3.8世代はより優れていて同様に入手可能であり、第二世代AREXは——いつ登場するにせよ——BAAIがどのQwenベースを土台に築く価値があると考えているかの証拠になる可能性がほぼ確実で、その置き換えではない。
三つ揃えば残りは片づく。ツリー内のファイル、パラメータ数とベースモデル欄を備えたカード、そしてライセンスタグだ。そのうち肝心なのは最初のもので、それが実現するまでは、この比較は価格が付いたファミリーとプレースホルダーの比較でしかない。
