一張生成的標題卡寫著「AREX-2 vs Qwen3.8-Max - 一個基座以及其上運行的東西」,並有兩個面板。左側面板標題為 Qwen3.8-Max,列出:自 2026 年 8 月 3 日起上線;100 萬詞元上下文,多模態;每 100 萬詞元 $2 輸入/$6 輸出;今日即可呼叫。右側面板標題為 AREX-2,列出:儲存庫建立於 2026 年 9 月 29 日;沒有權重,沒有模型卡;任何地方都找不到價目表;任何地方都無法呼叫。頁腳寫著「第一代 AREX 是在 Qwen 骨幹上進行後訓練的。」OrcaRouter 標誌合成於右下角。
Guides & Insights

AREX-2 對上 Qwen 3.8:一個是基底,另一個很可能就建構於其上

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決的雙方是 AREX-2與Qwen3.8-Max,看起來像是兩家中國實驗室各自旗艦系統之間的正面對決,但其實並非如此——不是因為 AREX-2 未經證實(儘管它確實如此),而是因為兩者位於同一技術堆疊的不同層級。Qwen3.8-Max 自 2026 年 8 月 3 日起已上線,每百萬輸入 token 收費 2 美元、每百萬輸出 token 收費 6 美元,並具備 100 萬 token 的上下文視窗;其開放權重的同系列模型,Qwen3.8-27B 與 Qwen3.8-Flash,於 8 月 13 日和 8 月 26 日推出,並公布了基準測試結果與價格。AREX-2 是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 在 Hugging Face 上建立的儲存庫,裡面有一個 .gitattributes,別無其他。而兩者之所以不是競爭對手,原因在於一個雙方廠商都不會大張旗鼓宣傳的根本事實:BAAI 迄今推出的每一個 AREX 模型,都建立在 Qwe​n 骨幹之上。

那不是對 AREX-2 的臆測。那是針對已存在的世代所記載的。AREX-Base 是建構於 Qwen3.5-122B-A10B 之上、具有 100 億活躍參數的 1220 億參數混合專家模型,而 AREX-Turbo 則是建構於 Qwen3.5-4B 之上的 40 億參數稠密模型;兩者皆於 2026 年 7 月 23 日以 Apache 2.0 授權發布。因此,這項比較真正誠實的樣貌並不是代理對旗艦。而是:Alibaba 的基底今天能為你帶來什麼、BAAI 的代理層在其上又增添了什麼,以及在 BAAI 上傳檔案之前,第二個問題能回答到什麼程度?

Qwen 這邊目前有什麼已經上線,以及它的費用是多少?

Qwen3.8 這一代異常容易理解,因為它的規格與定價都完全公開,且分為三個截然不同的層級。

• Qwen3.8-Max — 於 2026 年 8 月 3 日發布。具備 100 萬 token 的上下文視窗、原生文字、圖像與影片輸入、思考模式、函式呼叫與結構化輸出,以及三種傳輸格式(相容 OpenAI、相容 Anthropic 與原生 DashScope),橫跨五個區域。每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 6.00 美元,快取讀取則為 0.25 美元。

• Qwen3.8-27B — 於 2026 年 8 月 13 日發布。稠密模型,270 億參數,256K 上下文(262,144 個位置),可輸入文字、圖像與影片,Apache 2.0 授權權重。在 Qwen 自家模型卡上公布的成績為 LiveCodeBench v6 90.3、GPQA Diamond 89.2、OSWorld-Verified 84.3,以及 QwenSWEBench 79.0 —— 皆為廠商自行提報,未經獨立重現。獨立評測則顯示其 Artificial Analysis Intelligence Index 為 33.7,AA Coding index 為 68.1。

• Qwen3.8-Flash — 於 2026 年 8 月 26 日發布。同樣具備 1M token 的上下文視窗與相同的多模態輸入,每百萬輸入 token 收費 $0.15,輸出則為 $0.47。這是該系列中的低價層級,也是讓高流量的代理式流量變得可負擔的關鍵。

另外還有一個未加標籤的 Qwen3.8 項目:這款 2.4 兆參數的旗艦模型,阿里巴巴表示其權重即將釋出,但目前在任何地方都還無法呼叫。如果你搜尋的是「Qwen 3.8」並期待只有一個模型,這就是為什麼答案是四個模型的家族,而不是單一模型。

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

相較於這一切,AREX-2 的規格只有一行:一個儲存庫、一個時間戳,以及一個名稱,暗示這是 BAAI 曾經打造過之某物的第二代。

重新定義整個比較的細節

AREX 並非 Qwen 的競爭者,而是它的消費者。兩款第一代 AREX 模型都是在 Qwen3.5 骨幹上進行後訓練,再被封裝進一套框架,使它們成為代理,而非聊天模型:一個內迴圈會搜尋、瀏覽,並將證據整合進帶有信賴度數值的候選答案;一個外迴圈則會對照原始限制條件檢查該答案,然後接受它、修正它,或捨棄整條軌跡並重新開始。AREX 中有趣的工程不在於網路本身,而在於迴圈、能在長遠時間跨度中清楚維持已驗證發現、待定候選與未解決限制條件的脈絡更新機制,以及將搜尋與瀏覽以第一級動作形式暴露給模型的工具介面。

這就是為什麼該系列自己公佈的數字——122B Base 在 BrowseComp 上為 82.5、在 GAIA 上為 85.4、在 xbench-2510 上為 71.0、在 DeepSearch QA 上為 89.9,以及在 WideSearch-en 上為 82.0,而 4B Turbo 則為 70.7 / 81.6 / 57.0 / 78.5 / 68.5——無法與 Qwen3.8-27B 的程式設計與代理能力分數相提並論,即使兩者共享架構淵源。它們衡量的是不同的事情。QwenSWEBench 問的是模型能否解決一個儲存庫問題。BrowseComp 問的是代理能否在多次搜尋中,找到一個刻意難以找到的事實,同時不丟失問題本身。原始的 Qwen3.5 檢查點在第二項上得分很差,在第一項上則表現良好,而這正是 BAAI 的後訓練與測試框架存在的目的:彌合這道落差。

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

第二代最有可能會是什麼

若 AREX-2 延續這個模式,最可能的解讀——這是推論,而非事實——是第二代研究型代理,其後訓練所依據的 Qwen 主幹比現行 AREX 模型所用的 3.5 世代更新。Qwen3.8-27B 是稠密模型、多模態,且採 Apache 2.0 授權,這使它自然成為品質層級代理的候選者;Qwen3.8-Flash 的每 token 成本低廉,而當你的代理每次查詢要發出數十次呼叫,並在每一步都重新讀取持續增長的上下文時,這一點至關重要。

那些全都未經證實。這個名稱既沒有帶出規模、沒有骨幹架構,也沒有日期,而產品線中的「2」是命名慣例,而非規格。已確認的內容狹窄得多,而且就該這樣陳述:BAAI 於 2026 年 9 月 29 日建立了該儲存庫,裡面什麼都沒放,也沒有發布任何公告。沒有權重、沒有模型卡、沒有參數數量、沒有授權標籤、沒有基準測試,也沒有任何供應商提供服務。如果你這週在任何地方看到有人引用 AREX-2 的數字,那些都不是實測數據。

你今天下午實際上能買到的東西

這兩者在實務上的不對稱並非品質問題,而在於一方握有價目表,另一方卻只有一筆名錄登錄。

如果你的工作屬於代理式(agentic),而你想要的是 AREX 系列所建構其上的底層基礎,那麼那條確切的骨幹是可呼叫的:Qwen3.5-122B-A10B 已收錄於 OrcaRouter 的目錄中,每百萬輸入 token 為 0.115 美元,每百萬輸出 token 為 0.917 美元,最高支援 128K token,超過之後則升至 0.287 美元 / 2.294 美元,並已啟用視覺、工具使用與推理功能。那就是 AREX-Base 進行後訓練的模型,無需等待任何事物即可取得。

若你想要的是當前世代,兩款開放的 Qwen3.8 等級都在目錄上:Qwen3.8-27B 每百萬輸入 $0.33、輸出 $2.40,運行於我們自家的基礎設施上這是因為權重是開放的,沒有供應商每 token 成本需要轉嫁,而 Qwen3.8-Flash則為用量級距的 $0.15 / $0.47。一組 API 就能涵蓋兩者,供應商定價原樣轉嫁,每 token 不加收任何費用,因此當阿里巴巴調整價格時,這裡的數字當天就會跟著變動。

而當 AREX-2 真的推出時,它之所以應該位於同一層之後,理由是結構性的,而非宣傳性的。一個每次查詢會發出二十次呼叫的代理迴圈,會把每個供應商的失敗率乘以二十;具備自動容錯移轉、能在執行階段做出決定的路由規則,正是逾時會變成重試,還是逾時會變成自信滿滿的錯誤答案之間的差別。這個論點適用於任何研究代理,而每當有 AREX-2 可供路由時,它也會適用於 AREX-2。

誰應該採取行動,以及針對什麼

如果你今天需要研究代理,AREX-Base 是實際存在的 AREX 模型,它已於七月在 Apache 2.0 授權下推出,而它的代理基準測試是供應商自家的,但至少它們附屬於一個可下載的模型。如果你今天需要前沿多模態推理或大量代理式流量,Qwen3.8 各層級已上線、已定價,且部分經獨立評分,而 AREX-2 的存在完全不會改變這項決定。

AREX-2 對你這週正在做的決定唯一有影響的情境,就是你正在為微調挑選骨幹模型的情境。而在那裡,答案早已在目錄中顯而易見:AREX 所使用的 3.5 骨幹仍然便宜且可得,3.8 世代更好且同樣可得,而第二代 AREX——無論何時問世——幾乎肯定會是關於 BAAI 認為哪個 Qwe​n 基礎值得在其上建構的證據,而不是它的替代品。

有三件事就能搞定其餘部分:檔案樹裡的檔案、一張附有參數量與基礎模型欄位的卡片,以及一個授權標籤。其中第一項才是關鍵,因為在它到位之前,這個比較就只是在拿一個已有定價的系列跟一個佔位符相比。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新