
AREX-2 對上 Qwen 3.8:一個是基底,另一個很可能就建構於其上
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
這場對決的雙方是 AREX-2與Qwen3.8-Max,看起來像是兩家中國實驗室各自旗艦系統之間的正面對決,但其實並非如此——不是因為 AREX-2 未經證實(儘管它確實如此),而是因為兩者位於同一技術堆疊的不同層級。Qwen3.8-Max 自 2026 年 8 月 3 日起已上線,每百萬輸入 token 收費 2 美元、每百萬輸出 token 收費 6 美元,並具備 100 萬 token 的上下文視窗;其開放權重的同系列模型,Qwen3.8-27B 與 Qwen3.8-Flash,於 8 月 13 日和 8 月 26 日推出,並公布了基準測試結果與價格。AREX-2 是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 在 Hugging Face 上建立的儲存庫,裡面有一個 .gitattributes,別無其他。而兩者之所以不是競爭對手,原因在於一個雙方廠商都不會大張旗鼓宣傳的根本事實:BAAI 迄今推出的每一個 AREX 模型,都建立在 Qwen 骨幹之上。
那不是對 AREX-2 的臆測。那是針對已存在的世代所記載的。AREX-Base 是建構於 Qwen3.5-122B-A10B 之上、具有 100 億活躍參數的 1220 億參數混合專家模型,而 AREX-Turbo 則是建構於 Qwen3.5-4B 之上的 40 億參數稠密模型;兩者皆於 2026 年 7 月 23 日以 Apache 2.0 授權發布。因此,這項比較真正誠實的樣貌並不是代理對旗艦。而是:Alibaba 的基底今天能為你帶來什麼、BAAI 的代理層在其上又增添了什麼,以及在 BAAI 上傳檔案之前,第二個問題能回答到什麼程度?
Qwen 這邊目前有什麼已經上線,以及它的費用是多少?
Qwen3.8 這一代異常容易理解,因為它的規格與定價都完全公開,且分為三個截然不同的層級。
• Qwen3.8-Max — 於 2026 年 8 月 3 日發布。具備 100 萬 token 的上下文視窗、原生文字、圖像與影片輸入、思考模式、函式呼叫與結構化輸出,以及三種傳輸格式(相容 OpenAI、相容 Anthropic 與原生 DashScope),橫跨五個區域。每百萬輸入 token 為 2.00 美元,每百萬輸出 token 為 6.00 美元,快取讀取則為 0.25 美元。
• Qwen3.8-27B — 於 2026 年 8 月 13 日發布。稠密模型,270 億參數,256K 上下文(262,144 個位置),可輸入文字、圖像與影片,Apache 2.0 授權權重。在 Qwen 自家模型卡上公布的成績為 LiveCodeBench v6 90.3、GPQA Diamond 89.2、OSWorld-Verified 84.3,以及 QwenSWEBench 79.0 —— 皆為廠商自行提報,未經獨立重現。獨立評測則顯示其 Artificial Analysis Intelligence Index 為 33.7,AA Coding index 為 68.1。
• Qwen3.8-Flash — 於 2026 年 8 月 26 日發布。同樣具備 1M token 的上下文視窗與相同的多模態輸入,每百萬輸入 token 收費 $0.15,輸出則為 $0.47。這是該系列中的低價層級,也是讓高流量的代理式流量變得可負擔的關鍵。
另外還有一個未加標籤的 Qwen3.8 項目:這款 2.4 兆參數的旗艦模型,阿里巴巴表示其權重即將釋出,但目前在任何地方都還無法呼叫。如果你搜尋的是「Qwen 3.8」並期待只有一個模型,這就是為什麼答案是四個模型的家族,而不是單一模型。

相較於這一切,AREX-2 的規格只有一行:一個儲存庫、一個時間戳,以及一個名稱,暗示這是 BAAI 曾經打造過之某物的第二代。
重新定義整個比較的細節
AREX 並非 Qwen 的競爭者,而是它的消費者。兩款第一代 AREX 模型都是在 Qwen3.5 骨幹上進行後訓練,再被封裝進一套框架,使它們成為代理,而非聊天模型:一個內迴圈會搜尋、瀏覽,並將證據整合進帶有信賴度數值的候選答案;一個外迴圈則會對照原始限制條件檢查該答案,然後接受它、修正它,或捨棄整條軌跡並重新開始。AREX 中有趣的工程不在於網路本身,而在於迴圈、能在長遠時間跨度中清楚維持已驗證發現、待定候選與未解決限制條件的脈絡更新機制,以及將搜尋與瀏覽以第一級動作形式暴露給模型的工具介面。
這就是為什麼該系列自己公佈的數字——122B Base 在 BrowseComp 上為 82.5、在 GAIA 上為 85.4、在 xbench-2510 上為 71.0、在 DeepSearch QA 上為 89.9,以及在 WideSearch-en 上為 82.0,而 4B Turbo 則為 70.7 / 81.6 / 57.0 / 78.5 / 68.5——無法與 Qwen3.8-27B 的程式設計與代理能力分數相提並論,即使兩者共享架構淵源。它們衡量的是不同的事情。QwenSWEBench 問的是模型能否解決一個儲存庫問題。BrowseComp 問的是代理能否在多次搜尋中,找到一個刻意難以找到的事實,同時不丟失問題本身。原始的 Qwen3.5 檢查點在第二項上得分很差,在第一項上則表現良好,而這正是 BAAI 的後訓練與測試框架存在的目的:彌合這道落差。

第二代最有可能會是什麼
若 AREX-2 延續這個模式,最可能的解讀——這是推論,而非事實——是第二代研究型代理,其後訓練所依據的 Qwen 主幹比現行 AREX 模型所用的 3.5 世代更新。Qwen3.8-27B 是稠密模型、多模態,且採 Apache 2.0 授權,這使它自然成為品質層級代理的候選者;Qwen3.8-Flash 的每 token 成本低廉,而當你的代理每次查詢要發出數十次呼叫,並在每一步都重新讀取持續增長的上下文時,這一點至關重要。
那些全都未經證實。這個名稱既沒有帶出規模、沒有骨幹架構,也沒有日期,而產品線中的「2」是命名慣例,而非規格。已確認的內容狹窄得多,而且就該這樣陳述:BAAI 於 2026 年 9 月 29 日建立了該儲存庫,裡面什麼都沒放,也沒有發布任何公告。沒有權重、沒有模型卡、沒有參數數量、沒有授權標籤、沒有基準測試,也沒有任何供應商提供服務。如果你這週在任何地方看到有人引用 AREX-2 的數字,那些都不是實測數據。
你今天下午實際上能買到的東西
這兩者在實務上的不對稱並非品質問題,而在於一方握有價目表,另一方卻只有一筆名錄登錄。
如果你的工作屬於代理式(agentic),而你想要的是 AREX 系列所建構其上的底層基礎,那麼那條確切的骨幹是可呼叫的:Qwen3.5-122B-A10B 已收錄於 OrcaRouter 的目錄中,每百萬輸入 token 為 0.115 美元,每百萬輸出 token 為 0.917 美元,最高支援 128K token,超過之後則升至 0.287 美元 / 2.294 美元,並已啟用視覺、工具使用與推理功能。那就是 AREX-Base 進行後訓練的模型,無需等待任何事物即可取得。
若你想要的是當前世代,兩款開放的 Qwen3.8 等級都在目錄上:Qwen3.8-27B 每百萬輸入 $0.33、輸出 $2.40,運行於我們自家的基礎設施上這是因為權重是開放的,沒有供應商每 token 成本需要轉嫁,而 Qwen3.8-Flash則為用量級距的 $0.15 / $0.47。一組 API 就能涵蓋兩者,供應商定價原樣轉嫁,每 token 不加收任何費用,因此當阿里巴巴調整價格時,這裡的數字當天就會跟著變動。
而當 AREX-2 真的推出時,它之所以應該位於同一層之後,理由是結構性的,而非宣傳性的。一個每次查詢會發出二十次呼叫的代理迴圈,會把每個供應商的失敗率乘以二十;具備自動容錯移轉、能在執行階段做出決定的路由規則,正是逾時會變成重試,還是逾時會變成自信滿滿的錯誤答案之間的差別。這個論點適用於任何研究代理,而每當有 AREX-2 可供路由時,它也會適用於 AREX-2。
誰應該採取行動,以及針對什麼
如果你今天需要研究代理,AREX-Base 是實際存在的 AREX 模型,它已於七月在 Apache 2.0 授權下推出,而它的代理基準測試是供應商自家的,但至少它們附屬於一個可下載的模型。如果你今天需要前沿多模態推理或大量代理式流量,Qwen3.8 各層級已上線、已定價,且部分經獨立評分,而 AREX-2 的存在完全不會改變這項決定。
AREX-2 對你這週正在做的決定唯一有影響的情境,就是你正在為微調挑選骨幹模型的情境。而在那裡,答案早已在目錄中顯而易見:AREX 所使用的 3.5 骨幹仍然便宜且可得,3.8 世代更好且同樣可得,而第二代 AREX——無論何時問世——幾乎肯定會是關於 BAAI 認為哪個 Qwen 基礎值得在其上建構的證據,而不是它的替代品。
有三件事就能搞定其餘部分:檔案樹裡的檔案、一張附有參數量與基礎模型欄位的卡片,以及一個授權標籤。其中第一項才是關鍵,因為在它到位之前,這個比較就只是在拿一個已有定價的系列跟一個佔位符相比。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
