
AREX-2 對比 LFM2.5 2.6B Base:一個空的儲存庫,以及一個沒有指令的檢查點
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
將 AREX-2與 LFM2.5 2.6B Base擺在一起,它們的第一個共通點是:兩者都不是你今天能用的產品——而原因彼此毫無關聯。AREX-2 是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 建立的 Hugging Face 儲存庫;它包含一個 .gitattributes 檔案、存放零位元組的模型資料,而且沒有模型卡、沒有授權標籤,也沒有任何形式的公告。LFM2.5 2.6B Base 由 Liquid AI 於 2026 年 8 月發布,則是另一種形式的未完成:一個完整、可下載的 26.9 億參數純文字檢查點,採用 LFM Open License(lfm1.0),刻意不隨附指令微調,因為它的用途是被微調,而不是被拿來問問題。
一個是產物的不存在。另一個是少了它本不該有的一個步驟的產物。只有在你走馬看花時,這兩者才會被歸為同一類;而把它們當成同一類,正是一個團隊最後空等錯誤東西的原因。這兩者之間有用的比較不是能力——沒有 AREX-2 可供衡量——而是每一者作為原料是為了什麼,以及弄清楚它到底好不好得付出什麼代價。
種類上的差異,首先陳述
LFM2.5 2.6B Base 是一種素材。它是 Liquid AI 的 LFM2.5 混合式家族的預訓練檢查點:30 層,其中 22 層是雙閘控短卷積區塊,8 層是分組查詢注意力,在 16 種語言、約 34 兆個 token 上訓練而成,具備 131,072 個 token 的上下文視窗,以及一個在 Q4_K_M 下約為 1.67 GB 的量化版本。它沒有經過指令微調。餵給它一個問題,它會接續文字;它不會回答。Liquid AI 自家的模型卡指出,重度微調才是預期用途,而對於想要一個能回應提示的模型的人,另有一個經過後訓練的姊妹模型。它就是一種基底,而它在提示遵循基準測試上表現不佳這件事並非缺陷——那正是這種東西的定義。
AREX-2 不是一種物質或產品;它是一個命名空間。目前唯一可得的事實是所屬組織(BAAI)、建立時間戳記(2026年9月29日)以及名稱。沒有任何東西被上傳,也沒有任何說明。這個名稱本身屬於一個確實存在的系列:2026年7月23日,BAAI 發布了 AREX-Base,這是一個建構於 Qwen3.5-122B-A10B 之上、擁有 1,220 億參數與 100 億活躍參數的混合專家模型,以及 AREX-Turbo,一個建構於 Qwen3.5-4B 之上的稠密 4B 模型——兩者皆為 Apache 2.0,皆為深度研究代理,採用雙迴圈設計,會蒐集證據、產出附有置信度數值的候選答案,然後根據原始限制條件驗證該答案,並加以精煉或重新開始。其公布的數字由廠商報告,未經獨立重現,Base 在 BrowseComp 上達到 82.5、在 GAIA 上達到 85.4,而 Turbo 則為 70.7 / 81.6。
• 供應情況 — LFM2.5 2.6B Base 現已可下載。AREX-2 的儲存庫中沒有任何檔案。
• 大小 — Liquid 模型的 2.69B 稠密參數,全都可在檢查點中看到。AREX-2 則未知;該系列涵蓋一個 122B MoE 和一個稠密 4B,所以「2」沒有任何預示意義。
• 上下文 — LFM2.5 2.6B Base 為 131,072 個 token。AREX-2 則尚未公布任何資訊。
• LFM Open License v1.0{{3}}——年營收未達 1,000 萬美元可免費使用,達 1,000 萬美元或以上則須另行取得授權。AREX-2 目前尚無授權標籤;初代 AREX 採用 Apache 2.0。{{/3}}——年營收未達 1,000 萬美元可免費使用,達 1,000 萬美元或以上則須另行取得授權。AREX-2 目前尚無授權標籤;初代 AREX 採用 Apache 2.0。
• 這是什麼 —— 是微調的基底,而若從這個家族系列來看,則是一個託管式代理,其價值在於搜尋與驗證的循環,而非其權重。

意思相反的空白計分卡
這兩個模型都沒有你應該據以規劃的基準,而且原因截然不同。
Liquid AI 讓其 Base 保持未評分,並不是在隱瞞什麼。拿預訓練檢查點去跑指令遵循基準,衡量到的會是缺少微調,而不是基底的品質——這就是為什麼該公司只對後訓練的同系列模型做基準測試,卻讓 Base 保持未評估。那個空白可以從你這邊驗證,而這正是重點:你可以下載 1.67 GB,在你自己的任務上跑你自己的評估,並且在推論服務上花任何錢之前就知道答案。
AREX-2 的空白不是一項設計決策,而是一個「尚未」。沒有東西可下載,所以沒有東西可測試,而本週你能跑的任何評估都不會告訴你任何關於它的事。任何在接下來幾天內發布 AREX-2 基準測試數據的人,發布的都是他們不可能測量到的東西。

兩個不同的微調問題
因為這兩者都是起點,而不是已完成的服務,所以值得精確說明各自會是什麼的起點,因為那正是它們真正不再彼此相似的地方。
一個 2.69B 的混合式檢查點,是打造小型、廉價、專用模型的工具。真正有意思的用途都是些不起眼的:在受監管的工作流程中判讀文件類型的分類器、把表單轉成結構化 JSON 的抽取模型、在貼近資料的單張顯卡上執行的特定領域改寫器。其價值來自於你之後擁有這個產物,而每次呼叫的邊際成本就是電力。訓練迴圈才是真正的工作,而這是你今天就能開始做的工作。
AREX-2 指向另一個方向。AREX 系列並非為了微調成產品而設計;它的設計是要被稱為一個能執行搜尋、整合證據,並對照限制條件驗證自身答案的代理。如果第二代延續這一點,你要評估的會是一條軌跡——它需要多少步驟、它是否注意到矛盾、它候選答案上的信心數值是否有意義。那不是微調問題,也不是權重問題。那是推論服務的問題,而且始於有人公開權重與模型卡。
這些在任何規模下都不是替代品。一個需要自己能擁有並重新訓練的模型的團隊,不會等待 AREX-2。一個需要研究代理的團隊,也不會把一個 2.6B 混合模型微調成那樣。
路由層適合放在哪裡,分別就它們每一個而言
這兩者的實際差異,會在模型進入應用程式的那一刻顯現,因為這兩者與代管(hosting)之間的關係正好相反。
LFM2.5 2.6B Base 不在 OrcaRouter 的目錄上,任何 LFM2.5 變體也都不在,因此它來自 Liquid AI 自家的發行版本與常見的第三方主機——是本地產物,而非經路由的端點。AREX-Base 與 AREX-Turbo 也都不在我們的目錄上。在這種情況下,路由層真正要發揮的作用在於架構的另一端:當你拿自己的微調模型與它必須擊敗的模型相比較的那一天,你會希望那場比較的代價是一次設定變更,而不是一整個採購週期。一個 API 統管 200 多個模型,以供應商標價原樣傳遞、每個 token 不加收任何費用,整組模型共用一把金鑰,還有容錯移轉,讓供應商某個糟糕的下午不會變成你評估工作的糟糕下午。這些就是讓針對未經證實模型的 A/B 測試便宜到真正跑得起來的條件。
這也是對 AREX-2 本身最誠實的定位。當它發布時——假設它和前兩代一樣以開放權重發布——要在真實工作負載上試用一個全新代理,明智的做法是放在旁支路徑上、置於容錯移轉之後,而不是把它當成你生產迴圈所依賴的唯一供應者。
一個理性的人這週對每個會怎麼做
如果你有一個規模小、範圍狹窄的任務,而且資料不能離開你的基礎設施,Liquid 檢查點已經推出、體積小、在營收門檻以下採用寬鬆授權,而且今天下午就能測試。下載它,在你自己的評估集上執行,讓結果決定一切。AREX-2 的任何資訊都不會改變這個計畫。
若你今日需要的是長時程的研究行為,該伸手去取的模型,是那個早已存在的:七月推出的 AREX-Base,附有已發表的代理基準測試,至少還能拿論文來對照。AREX-2 則是一個帶著時間戳的名字,而能改變其地位的兩件事,從外部就看得出來——檔案是否出現在檔案樹中,以及伴隨這些檔案是否出現一張載有參數數量與授權條款的卡。
這篇文章存在的目的,是要防止一種失敗模式:某個保留名稱被當成路線圖項目來看待。它不是。它是 BAAI 昨天建立的一個儲存庫,而現在針對它該做的規劃,正確的數量是零。
