一張生成的標題卡,寫著「AREX-2 vs LFM2.5 2.6B Base — 兩種未完成」,並有兩個面板。左側面板標題為 LFM2.5 2.6B Base,列出:2026 年 8 月發布;2.69B 參數,稠密模型;131,072 個 token 的上下文;可下載,未經指令微調。右側面板標題為 AREX-2,列出:儲存庫建立於 2026 年 9 月 29 日;儲存了零位元組;完全沒有模型卡;沒有任何東西可下載。頁尾寫著「一個是沒有指令的檢查點。另一個是沒有檢查點的名字。」OrcaRouter 標誌合成於右下角。
Guides & Insights

AREX-2 對比 LFM2.5 2.6B Base:一個空的儲存庫,以及一個沒有指令的檢查點

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

將 AREX-2與 LFM2.5 2.6B Base擺在一起,它們的第一個共通點是:兩者都不是你今天能用的產品——而原因彼此毫無關聯。AREX-2 是 BAAI 於 2026 年 9 月 29 日 17:56 UTC 建立的 Hugging Face 儲存庫;它包含一個 .gitattributes 檔案、存放零位元組的模型資料,而且沒有模型卡、沒有授權標籤,也沒有任何形式的公告。LFM2.5 2.6B Base 由 Liquid AI 於 2026 年 8 月發布,則是另一種形式的未完成:一個完整、可下載的 26.9 億參數純文字檢查點,採用 LFM Open License(lfm1.0),刻意不隨附指令微調,因為它的用途是被微調,而不是被拿來問問題。

一個是產物的不存在。另一個是少了它本不該有的一個步驟的產物。只有在你走馬看花時,這兩者才會被歸為同一類;而把它們當成同一類,正是一個團隊最後空等錯誤東西的原因。這兩者之間有用的比較不是能力——沒有 AREX-2 可供衡量——而是每一者作為原料是為了什麼,以及弄清楚它到底好不好得付出什麼代價。

種類上的差異,首先陳述

LFM2.5 2.6B Base 是一種素材。它是 Liquid AI 的 LFM2.5 混合式家族的預訓練檢查點:30 層,其中 22 層是雙閘控短卷積區塊,8 層是分組查詢注意力,在 16 種語言、約 34 兆個 token 上訓練而成,具備 131,072 個 token 的上下文視窗,以及一個在 Q4_K_M 下約為 1.67 GB 的量化版本。它沒有經過指令微調。餵給它一個問題,它會接續文字;它不會回答。Liquid AI 自家的模型卡指出,重度微調才是預期用途,而對於想要一個能回應提示的模型的人,另有一個經過後訓練的姊妹模型。它就是一種基底,而它在提示遵循基準測試上表現不佳這件事並非缺陷——那正是這種東西的定義。

AREX-2 不是一種物質或產品;它是一個命名空間。目前唯一可得的事實是所屬組織(BAAI)、建立時間戳記(2026年9月29日)以及名稱。沒有任何東西被上傳,也沒有任何說明。這個名稱本身屬於一個確實存在的系列:2026年7月23日,BAAI 發布了 AREX-Base,這是一個建構於 Qwen3.5-122B-A10B 之上、擁有 1,220 億參數與 100 億活躍參數的混合專家模型,以及 AREX-Turbo,一個建構於 Qwen3.5-4B 之上的稠密 4B 模型——兩者皆為 Apache 2.0,皆為深度研究代理,採用雙迴圈設計,會蒐集證據、產出附有置信度數值的候選答案,然後根據原始限制條件驗證該答案,並加以精煉或重新開始。其公布的數字由廠商報告,未經獨立重現,Base 在 BrowseComp 上達到 82.5、在 GAIA 上達到 85.4,而 Turbo 則為 70.7 / 81.6。

• 供應情況 — LFM2.5 2.6B Base 現已可下載。AREX-2 的儲存庫中沒有任何檔案。

• 大小 — Liquid 模型的 2.69B 稠密參數,全都可在檢查點中看到。AREX-2 則未知;該系列涵蓋一個 122B MoE 和一個稠密 4B,所以「2」沒有任何預示意義。

• 上下文 — LFM2.5 2.6B Base 為 131,072 個 token。AREX-2 則尚未公布任何資訊。

• LFM Open License v1.0{{3}}——年營收未達 1,000 萬美元可免費使用,達 1,000 萬美元或以上則須另行取得授權。AREX-2 目前尚無授權標籤;初代 AREX 採用 Apache 2.0。{{/3}}——年營收未達 1,000 萬美元可免費使用,達 1,000 萬美元或以上則須另行取得授權。AREX-2 目前尚無授權標籤;初代 AREX 採用 Apache 2.0。

• 這是什麼 —— 是微調的基底,而若從這個家族系列來看,則是一個託管式代理,其價值在於搜尋與驗證的循環,而非其權重。

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

意思相反的空白計分卡

這兩個模型都沒有你應該據以規劃的基準,而且原因截然不同。

Liquid AI 讓其 Base 保持未評分,並不是在隱瞞什麼。拿預訓練檢查點去跑指令遵循基準,衡量到的會是缺少微調,而不是基底的品質——這就是為什麼該公司只對後訓練的同系列模型做基準測試,卻讓 Base 保持未評估。那個空白可以從你這邊驗證,而這正是重點:你可以下載 1.67 GB,在你自己的任務上跑你自己的評估,並且在推論服務上花任何錢之前就知道答案。

AREX-2 的空白不是一項設計決策,而是一個「尚未」。沒有東西可下載,所以沒有東西可測試,而本週你能跑的任何評估都不會告訴你任何關於它的事。任何在接下來幾天內發布 AREX-2 基準測試數據的人,發布的都是他們不可能測量到的東西。

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

兩個不同的微調問題

因為這兩者都是起點,而不是已完成的服務,所以值得精確說明各自會是什麼的起點,因為那正是它們真正不再彼此相似的地方。

一個 2.69B 的混合式檢查點,是打造小型、廉價、專用模型的工具。真正有意思的用途都是些不起眼的:在受監管的工作流程中判讀文件類型的分類器、把表單轉成結構化 JSON 的抽取模型、在貼近資料的單張顯卡上執行的特定領域改寫器。其價值來自於你之後擁有這個產物,而每次呼叫的邊際成本就是電力。訓練迴圈才是真正的工作,而這是你今天就能開始做的工作。

AREX-2 指向另一個方向。AREX 系列並非為了微調成產品而設計;它的設計是要被稱為一個能執行搜尋、整合證據,並對照限制條件驗證自身答案的代理。如果第二代延續這一點,你要評估的會是一條軌跡——它需要多少步驟、它是否注意到矛盾、它候選答案上的信心數值是否有意義。那不是微調問題,也不是權重問題。那是推論服務的問題,而且始於有人公開權重與模型卡。

這些在任何規模下都不是替代品。一個需要自己能擁有並重新訓練的模型的團隊,不會等待 AREX-2。一個需要研究代理的團隊,也不會把一個 2.6B 混合模型微調成那樣。

路由層適合放在哪裡,分別就它們每一個而言

這兩者的實際差異,會在模型進入應用程式的那一刻顯現,因為這兩者與代管(hosting)之間的關係正好相反。

LFM2.5 2.6B Base 不在 OrcaRouter 的目錄上,任何 LFM2.5 變體也都不在,因此它來自 Liquid AI 自家的發行版本與常見的第三方主機——是本地產物,而非經路由的端點。AREX-Base 與 AREX-Turbo 也都不在我們的目錄上。在這種情況下,路由層真正要發揮的作用在於架構的另一端:當你拿自己的微調模型與它必須擊敗的模型相比較的那一天,你會希望那場比較的代價是一次設定變更,而不是一整個採購週期。一個 API 統管 200 多個模型,以供應商標價原樣傳遞、每個 token 不加收任何費用,整組模型共用一把金鑰,還有容錯移轉,讓供應商某個糟糕的下午不會變成你評估工作的糟糕下午。這些就是讓針對未經證實模型的 A/B 測試便宜到真正跑得起來的條件。

這也是對 AREX-2 本身最誠實的定位。當它發布時——假設它和前兩代一樣以開放權重發布——要在真實工作負載上試用一個全新代理,明智的做法是放在旁支路徑上、置於容錯移轉之後,而不是把它當成你生產迴圈所依賴的唯一供應者。

一個理性的人這週對每個會怎麼做

如果你有一個規模小、範圍狹窄的任務,而且資料不能離開你的基礎設施,Liquid 檢查點已經推出、體積小、在營收門檻以下採用寬鬆授權,而且今天下午就能測試。下載它,在你自己的評估集上執行,讓結果決定一切。AREX-2 的任何資訊都不會改變這個計畫。

若你今日需要的是長時程的研究行為,該伸手去取的模型,是那個早已存在的:七月推出的 AREX-Base,附有已發表的代理基準測試,至少還能拿論文來對照。AREX-2 則是一個帶著時間戳的名字,而能改變其地位的兩件事,從外部就看得出來——檔案是否出現在檔案樹中,以及伴隨這些檔案是否出現一張載有參數數量與授權條款的卡。

這篇文章存在的目的,是要防止一種失敗模式:某個保留名稱被當成路線圖項目來看待。它不是。它是 BAAI 昨天建立的一個儲存庫,而現在針對它該做的規劃,正確的數量是零。