一張生成的標題卡,寫著「AREX-2 vs Gemma 4 12B - 其中一個是模型」,配有兩個面板。左側面板標題為 Gemma 4 12B,列出:2026 年 6 月 3 日發布;11.95B 參數,稠密;256K 上下文,Apache 2.0;今天就能下載。右側面板標題為 AREX-2,列出:儲存庫建立於 2026 年 9 月 29 日;未上傳權重;沒有模型卡,沒有授權標籤;無法下載。頁尾寫著「其中一欄是模型。另一欄是時間戳記。」OrcaRouter 標誌合成於右下角。
Guides & Insights

AREX-2 對比 Gemma 4 12B:其中一個是模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在這篇文章中,Gemma 4 12B與AREX-2之間的比較,具有一項本站其他任何對決都沒有的特性:兩欄之中有一欄是空的,因為那一側的模型還不存在。Gemma 4 12B 是已發布的成品——Goog​le DeepMind 於 2026 年 6 月 3 日發布,是一款 119.5 億參數的稠密開放權重模型,採用 Apache 2.0 授權,附有完整的模型卡、256K token 的上下文視窗、原生音訊與圖像輸入,並已歷經三個半月的獨立測試。AREX-2 則是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 在 Hugging Face 上建立的儲存庫,至今尚未放入任何內容:沒有權重、沒有模型卡、沒有授權標籤、沒有評估、也沒有發布公告。

那種不對稱並不是跳過比較的理由。它本身就是比較。值得回答的問題不是這兩者哪個更好——在 AREX-2 裡有檔案之前,沒有什麼能回答這點——而是第二代 BAAI 研究代理究竟是否會與 12B 邊緣模型競爭,或者這兩者是否佔據同一個堆疊中永遠不會相觸的位置。搞錯這一點就是代價高昂的錯誤,因為正是這種錯誤會讓團隊為錯誤的東西編列預算。

已出貨的一方,以它自身的方式

Gemma 4 12B 是 Google 第四代開放模型家族中的小型成員,其決定性的設計選擇在於架構:它完全捨棄了獨立的視覺編碼器,將原始影像區塊與音訊波形直接饋入 Transformer。這不是基準測試的取巧手法。這正是讓該模型真正具備可攜性的關鍵——約 27 GB 的 BF16 權重,量化後可低於 7 GB,而模型卡上將 16 GB VRAM 列為部署目標。在筆電或單張中階顯卡上,這是一款你真正駕馭得了的模型。

能力概況便由此而來。Google 自家的模型卡——由廠商自行報告,值得如此標註——列出文件理解方面的 DocVQA 94.9 與 InfoVQA 88.4、MMLU-Pro 77.2、GPQA Diamond 78.8、AIME 2026 77.5,以及思考模式下的 LiveCodeBench v6 72.0。獨立的 Artificial Analysis 將該推理配置的智慧指數評為 14,測得每秒 114 個詞元,並將典型服務呼叫的價格定為每百萬輸入詞元 0.10 美元、每百萬輸出詞元 0.30 美元。我們自家目錄中較大型號 Gemma 4 31B 的條目,在 GPQA Diamond 上則有 85.7。這呈現出的輪廓是:一個小型通用模型,在文件和圖像上異常強勁,在推理上表現合理,而在困難的多步驟工作上則遠不及前沿模型。

因此,它的職責描述很具體:本機或單租戶推論、文件與螢幕截圖理解、適度的代理式迴圈,以及任何資料不得離開所在場所的用途。它不是深度研究引擎,Google 也沒有把它當成深度研究引擎來販售。

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

另一個是一個名字和一個

本週關於 AREX-2 所有可確認的資訊,用一句話就能說完。它是 Hugging Face 上 BAAI 組織底下的一個儲存庫,建立於 2026 年 9 月 29 日,裡面只有一個 .gitattributes 檔案,別無其他——零位元組的模型資料、零次下載、沒有模型卡、沒有授權宣告、沒有任何供應商部署。BAAI 本身則什麼也沒宣布。

真正讓它值得寫下來的是它以之命名的家族。BAAI 的 AREX 系列於 2026 年 7 月 23 日推出,共有兩個模型:AREX-Base,一個以 Qwen3.5-122B-A10B 為基礎、擁有 1,220 億參數與 100 億活躍參數的混合專家模型;以及 AREX-Turbo,一個以 Qwen3.5-4B 為基礎打造的稠密 40 億參數模型。兩者皆採用 Apache 2.0 授權。兩者都是深度研究代理,而非聊天模型——內迴圈負責蒐集證據並產出帶有信賴度數值的候選答案,外迴圈則對照原始限制條件檢查該答案,並可精煉或重新啟動整條軌跡。根據 BAAI 公布的數據,AREX-Base 在 BrowseComp 上達到 82.5、在 GAIA 上達到 85.4、在 DeepSearch QA 上達到 89.9;AREX-Turbo 在相同三項上則分別達到 70.7、81.6 與 78.5。

那些數字全都是廠商自己提供的,且沒有一項經過獨立重現。它們所描述的還是另一個模型。AREX-2 沒有任何數字,而「2」完全無法說明規模、主幹或架構——這條產品線的第二代,可能是更大的代理、更小的蒸餾模型,或是主幹被替換後重新訓練的框架。

這兩者到底有沒有交集?

這裡就是這項比較比表面上看起來更有用的地方。就拿關於 AREX-2 會變成什麼的兩種合理解讀來說。

如果它是第二代研究代理,規模達到任何接近 Base 的程度,那麼它和 Gemma 4 12B 根本不會互相競爭。一個驅動多來源搜尋的 122B 專家混合模型,是一項託管、按 token 計費、受網路限制的服務;Gemma 4 12B 則是你自行下載並執行的檢查點。兩者之間的抉擇並非品質比較,而是關於你的工作負載是研究迴圈還是推論端點的決定。

如果 AREX-2 最終證實是小型等級——是 4B Turbo 的後繼者,而非 122B Base——那麼這兩者確實同佔一個層級,比較也就變得名符其實。那個版本的 AREX-2,參數量約為 Gemma 4 12B 的三分之一,專精於工具驅動的搜尋,而非多模態的廣度,並且會在 BrowseComp 和 GAIA 上衡量,而不是在 DocVQA 上。兩個小型模型,一個為維持長時間的研究軌跡而最佳化,另一個則為在一般硬體上觀看與閱讀而最佳化。打造文件處理流程的團隊不該在意前者;打造研究代理的團隊不該在意後者。

• 已存在的部分—— Gemma 4 12B 今天即可下載,並附有完整的模型卡。AREX-2 則是一個裡面沒有任何檔案的儲存庫。

• 參數 — Gemma 4 12B 為 11.95B 稠密模型。AREX-2 未說明,僅能從產品名稱推斷。

• 上下文 — Gemma 4 12B 為 256K 個 token(262,144 個位置)。AREX-2 則未知。

• 模態 — 文字、圖像與音訊輸入,適用於 Gemma 4 12B。AREX-2 未知;第一代 AREX 為文字加工具使用。

• 授權條款 — Gemma 4 12B 採用 Apache 2.0,已於模型卡上註明。AREX-2 則未註明;AREX-Base 與 AREX-Turbo 皆為 Apache 2.0。

• 用途 — 可在自有硬體上部署的多模態推論,對比於根據該系列證據、針對託管端點進行的長程搜尋與證據彙整。

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

真正可比較的部分:每一個各自在哪裡執行

既然無法進行能力比較,那麼部署比較就是唯一誠實可做的比較,而兩者差距極為懸殊。

Gemma 4 12B 會在你部署的地方運行。沒有價目表、沒有按 token 計量的收費表,你和模型之間也沒有供應商——成本在於硬體與電力,而失效模式則是你自己的容量規劃。相較之下,AREX-Base 於七月推出時,是 122B 的混合專家模型:這種模型你要在叢集上自行部署,或按 token 租用;而該系列自家會有 4B Turbo,正是因為那樣的選擇是有代價的。如果第二代沿用相同的形態,AREX-2 的經濟效益將取決於每次查詢所消耗的 token 數,乘上一條軌跡所採取的搜尋步驟數——這個數字對深度研究型代理而言,遠比文件閱讀模型大得多,因為代理在每一次迭代中都會重新讀取不斷成長的上下文。

那就是路由層不再只是抽象概念,而開始成為一筆具體費用項目的地方。如果你最後是拿研究代理去跑託管模型,同時保留本機的 Gemma 4 12B 來處理文件工作,一般情況下這就是兩套整合。透過一個串接 200 多個模型的 API——供應商牌價原樣轉嫁,不額外加價,所以廠商調價當天就反映出來——它們就變成一把金鑰、一張帳單和一個用戶端,而容錯移轉規則可以把請求從正逢狀況不佳的供應商移開,你的代理迴圈卻毫不知情。我們目前有將 Gemma 4 26B-A4B 和 Gemma 4 31B 納入路由;我們沒有路由 12B,AREX 系列也沒有任何型號在我們的目錄上,所以如果這兩者之一是你要的模型,它得來自其供應商自家的發行管道。

本週該做什麼

如果你需要一個能自己執行的輕巧多模態模型,這個決定從來就不必等 AREX-2。Gemma 4 12B 已經推出、有文件記載、經過獨立評分,而且可以部署,另一邊的比較欄位卻是空的。別憑一個預留名稱就購買任何東西。

如果你正在打造深度研究代理,而 AREX 系列正是你真正想要的,那要留意的不是名稱,而是檔案樹:該儲存庫裡是否出現 safetensors、模型卡上寫的參數數量是多少,以及它掛上哪個授權標籤。第一代以 Apache 2.0 發布;如果第二代也一樣,問題就會變成託管問題,而不是授權問題。在那之前,AREX-Base 是你實際能跑的 AREX 模型,而且它自七月起就已可用。

這篇文章名義上要談的比較,有一件事值得直說:一個一邊是儲存庫提交、另一邊是已推出模型的 VS 頁面,並不是一場對決,而是一份時程表。這份時程表說的是:Gemma 4 12B 現在已可用,而 AREX-2 則完全不可用。