
AREX-2 對比 Gemma 4 12B:其中一個是模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
在這篇文章中,Gemma 4 12B與AREX-2之間的比較,具有一項本站其他任何對決都沒有的特性:兩欄之中有一欄是空的,因為那一側的模型還不存在。Gemma 4 12B 是已發布的成品——Google DeepMind 於 2026 年 6 月 3 日發布,是一款 119.5 億參數的稠密開放權重模型,採用 Apache 2.0 授權,附有完整的模型卡、256K token 的上下文視窗、原生音訊與圖像輸入,並已歷經三個半月的獨立測試。AREX-2 則是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 在 Hugging Face 上建立的儲存庫,至今尚未放入任何內容:沒有權重、沒有模型卡、沒有授權標籤、沒有評估、也沒有發布公告。
那種不對稱並不是跳過比較的理由。它本身就是比較。值得回答的問題不是這兩者哪個更好——在 AREX-2 裡有檔案之前,沒有什麼能回答這點——而是第二代 BAAI 研究代理究竟是否會與 12B 邊緣模型競爭,或者這兩者是否佔據同一個堆疊中永遠不會相觸的位置。搞錯這一點就是代價高昂的錯誤,因為正是這種錯誤會讓團隊為錯誤的東西編列預算。
已出貨的一方,以它自身的方式
Gemma 4 12B 是 Google 第四代開放模型家族中的小型成員,其決定性的設計選擇在於架構:它完全捨棄了獨立的視覺編碼器,將原始影像區塊與音訊波形直接饋入 Transformer。這不是基準測試的取巧手法。這正是讓該模型真正具備可攜性的關鍵——約 27 GB 的 BF16 權重,量化後可低於 7 GB,而模型卡上將 16 GB VRAM 列為部署目標。在筆電或單張中階顯卡上,這是一款你真正駕馭得了的模型。
能力概況便由此而來。Google 自家的模型卡——由廠商自行報告,值得如此標註——列出文件理解方面的 DocVQA 94.9 與 InfoVQA 88.4、MMLU-Pro 77.2、GPQA Diamond 78.8、AIME 2026 77.5,以及思考模式下的 LiveCodeBench v6 72.0。獨立的 Artificial Analysis 將該推理配置的智慧指數評為 14,測得每秒 114 個詞元,並將典型服務呼叫的價格定為每百萬輸入詞元 0.10 美元、每百萬輸出詞元 0.30 美元。我們自家目錄中較大型號 Gemma 4 31B 的條目,在 GPQA Diamond 上則有 85.7。這呈現出的輪廓是:一個小型通用模型,在文件和圖像上異常強勁,在推理上表現合理,而在困難的多步驟工作上則遠不及前沿模型。
因此,它的職責描述很具體:本機或單租戶推論、文件與螢幕截圖理解、適度的代理式迴圈,以及任何資料不得離開所在場所的用途。它不是深度研究引擎,Google 也沒有把它當成深度研究引擎來販售。

另一個是一個名字和一個
本週關於 AREX-2 所有可確認的資訊,用一句話就能說完。它是 Hugging Face 上 BAAI 組織底下的一個儲存庫,建立於 2026 年 9 月 29 日,裡面只有一個 .gitattributes 檔案,別無其他——零位元組的模型資料、零次下載、沒有模型卡、沒有授權宣告、沒有任何供應商部署。BAAI 本身則什麼也沒宣布。
真正讓它值得寫下來的是它以之命名的家族。BAAI 的 AREX 系列於 2026 年 7 月 23 日推出,共有兩個模型:AREX-Base,一個以 Qwen3.5-122B-A10B 為基礎、擁有 1,220 億參數與 100 億活躍參數的混合專家模型;以及 AREX-Turbo,一個以 Qwen3.5-4B 為基礎打造的稠密 40 億參數模型。兩者皆採用 Apache 2.0 授權。兩者都是深度研究代理,而非聊天模型——內迴圈負責蒐集證據並產出帶有信賴度數值的候選答案,外迴圈則對照原始限制條件檢查該答案,並可精煉或重新啟動整條軌跡。根據 BAAI 公布的數據,AREX-Base 在 BrowseComp 上達到 82.5、在 GAIA 上達到 85.4、在 DeepSearch QA 上達到 89.9;AREX-Turbo 在相同三項上則分別達到 70.7、81.6 與 78.5。
那些數字全都是廠商自己提供的,且沒有一項經過獨立重現。它們所描述的還是另一個模型。AREX-2 沒有任何數字,而「2」完全無法說明規模、主幹或架構——這條產品線的第二代,可能是更大的代理、更小的蒸餾模型,或是主幹被替換後重新訓練的框架。
這兩者到底有沒有交集?
這裡就是這項比較比表面上看起來更有用的地方。就拿關於 AREX-2 會變成什麼的兩種合理解讀來說。
如果它是第二代研究代理,規模達到任何接近 Base 的程度,那麼它和 Gemma 4 12B 根本不會互相競爭。一個驅動多來源搜尋的 122B 專家混合模型,是一項託管、按 token 計費、受網路限制的服務;Gemma 4 12B 則是你自行下載並執行的檢查點。兩者之間的抉擇並非品質比較,而是關於你的工作負載是研究迴圈還是推論端點的決定。
如果 AREX-2 最終證實是小型等級——是 4B Turbo 的後繼者,而非 122B Base——那麼這兩者確實同佔一個層級,比較也就變得名符其實。那個版本的 AREX-2,參數量約為 Gemma 4 12B 的三分之一,專精於工具驅動的搜尋,而非多模態的廣度,並且會在 BrowseComp 和 GAIA 上衡量,而不是在 DocVQA 上。兩個小型模型,一個為維持長時間的研究軌跡而最佳化,另一個則為在一般硬體上觀看與閱讀而最佳化。打造文件處理流程的團隊不該在意前者;打造研究代理的團隊不該在意後者。
• 已存在的部分—— Gemma 4 12B 今天即可下載,並附有完整的模型卡。AREX-2 則是一個裡面沒有任何檔案的儲存庫。
• 參數 — Gemma 4 12B 為 11.95B 稠密模型。AREX-2 未說明,僅能從產品名稱推斷。
• 上下文 — Gemma 4 12B 為 256K 個 token(262,144 個位置)。AREX-2 則未知。
• 模態 — 文字、圖像與音訊輸入,適用於 Gemma 4 12B。AREX-2 未知;第一代 AREX 為文字加工具使用。
• 授權條款 — Gemma 4 12B 採用 Apache 2.0,已於模型卡上註明。AREX-2 則未註明;AREX-Base 與 AREX-Turbo 皆為 Apache 2.0。
• 用途 — 可在自有硬體上部署的多模態推論,對比於根據該系列證據、針對託管端點進行的長程搜尋與證據彙整。

真正可比較的部分:每一個各自在哪裡執行
既然無法進行能力比較,那麼部署比較就是唯一誠實可做的比較,而兩者差距極為懸殊。
Gemma 4 12B 會在你部署的地方運行。沒有價目表、沒有按 token 計量的收費表,你和模型之間也沒有供應商——成本在於硬體與電力,而失效模式則是你自己的容量規劃。相較之下,AREX-Base 於七月推出時,是 122B 的混合專家模型:這種模型你要在叢集上自行部署,或按 token 租用;而該系列自家會有 4B Turbo,正是因為那樣的選擇是有代價的。如果第二代沿用相同的形態,AREX-2 的經濟效益將取決於每次查詢所消耗的 token 數,乘上一條軌跡所採取的搜尋步驟數——這個數字對深度研究型代理而言,遠比文件閱讀模型大得多,因為代理在每一次迭代中都會重新讀取不斷成長的上下文。
那就是路由層不再只是抽象概念,而開始成為一筆具體費用項目的地方。如果你最後是拿研究代理去跑託管模型,同時保留本機的 Gemma 4 12B 來處理文件工作,一般情況下這就是兩套整合。透過一個串接 200 多個模型的 API——供應商牌價原樣轉嫁,不額外加價,所以廠商調價當天就反映出來——它們就變成一把金鑰、一張帳單和一個用戶端,而容錯移轉規則可以把請求從正逢狀況不佳的供應商移開,你的代理迴圈卻毫不知情。我們目前有將 Gemma 4 26B-A4B 和 Gemma 4 31B 納入路由;我們沒有路由 12B,AREX 系列也沒有任何型號在我們的目錄上,所以如果這兩者之一是你要的模型,它得來自其供應商自家的發行管道。
本週該做什麼
如果你需要一個能自己執行的輕巧多模態模型,這個決定從來就不必等 AREX-2。Gemma 4 12B 已經推出、有文件記載、經過獨立評分,而且可以部署,另一邊的比較欄位卻是空的。別憑一個預留名稱就購買任何東西。
如果你正在打造深度研究代理,而 AREX 系列正是你真正想要的,那要留意的不是名稱,而是檔案樹:該儲存庫裡是否出現 safetensors、模型卡上寫的參數數量是多少,以及它掛上哪個授權標籤。第一代以 Apache 2.0 發布;如果第二代也一樣,問題就會變成託管問題,而不是授權問題。在那之前,AREX-Base 是你實際能跑的 AREX 模型,而且它自七月起就已可用。
這篇文章名義上要談的比較,有一件事值得直說:一個一邊是儲存庫提交、另一邊是已推出模型的 VS 頁面,並不是一場對決,而是一份時程表。這份時程表說的是:Gemma 4 12B 現在已可用,而 AREX-2 則完全不可用。
