
Kolibri 對上 LFM2.5 2.6B Base:以 78B 主權級部署迎戰手機大小的檢查點
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把 Kolibri放在 LFM2.5 2.6B Base 旁邊,最直觀的解讀就是大衛與歌利亞:781 億個參數對上 26.9 億個參數,兩張 GPU 的部署門檻對上 Liquid AI 聲稱能在手機上執行的模型。這種最直觀的解讀是錯的,而且錯的方向和你預期的相反。這兩者都不是你今天能直接拿來處理某項任務的模型。Kolibri 由 Aleph Alpha 於 2026 年 10 月 3 日發布,是一個完整、經後訓練、可呼叫工具的德英助理,附有 serving plugin 與建議的取樣設定。LFM2.5 2.6B Base 由 Liquid AI 於 2026 年 8 月初發布,是一個完全未經指令微調的預訓練檢查點,專門為了微調而釋出。一個是你部署的產品。另一個是原料。比較它們的品質是範疇錯誤,而有趣的問題是:你的專案實際上需要哪一種原料。
在大多數實際採購中,決定這兩者高下的關鍵差距不在參數,而是授權條款。Kolibri 以 Apache 2.0 發布。LFM2.5 2.6B Base 則以 LFM Open License v1.0 發布,這是一份量身打造的授權條款(模型卡將其歸類為「license: other」),而正是這項差異,會被交給法務團隊,而非工程團隊。
「開放權重」的兩種不同含義
這兩個模型都讓你下載權重並執行它們。之後允許你做什麼,就是它們分道揚鑣的地方。
• Kolibri — Apache 2.0,沒有可接受使用附加條款,沒有使用者數量門檻,也沒有另訂的商業條款。Aleph Alpha 的卡片僅註明,該實驗室是歐盟 GPAI 行為準則的簽署方。
• LFM2.5 2.6B Base — 採用 LFM Open License v1.0,這是 Liquid AI 自家的授權條款,而非 OSI 標準授權條款。它與規範後訓練 LFM2.5 2.6B 及該系列其餘成員的授權條款相同。
對研究團隊來說,兩者都沒問題。對必須在採購文件中表明其授權立場的企業而言,一個是已知量,另一個則是一份得有人去閱讀的文件。那是實實在在的成本,在生成任何一個 token 之前就已付出,而且在任何基準測試表中都看不見。
同一類別中還有第二個區別,而這正是 Liquid AI 自家模型卡極力想闡明的一點。Base 不是助理。它不帶指令微調,這意味著它不會遵循提示、不會拒答、不會發出工具呼叫,也不會維持切題——不是因為它能力弱,而是因為它從未被訓練成如此。模型卡直言,它僅建議用於需要大量微調的任務:特定語言或特定領域的助理、以專有資料進行訓練,或實驗新穎的後訓練方法。基礎檢查點下游的一切——監督式微調、教師專業化、同策略蒸餾、代理式強化學習——都是買家的問題。Kolibri 送達時所有這些都已完成,具備四種推理努力等級,並隨權重附上 Hermes 風格的工具呼叫解析器。
尺寸實際上換來什麼
剝除框架後,這兩個模型是為了彼此相反的約束條件而最佳化的。
• 參數 — 在 Kolibri 上總計 78,103,074,560,每個 token 有 3,457,573,120 個活躍參數;相較之下,LFM2.5 Base 總計 26.9 億,其採用由 22 個雙閘控短卷積區塊與 8 個分組查詢注意力層組成的混合堆疊,而非由均勻區塊構成的 Transformer。
• 上下文 — 在 LFM2.5 Base 上為 131,072 個 token,相較於 Kolibri 上 262,144 個 token 的原生視窗,以及在其之上經驗證可達的 1,048,576 個 token。
• 訓練資料 —— LFM2.5 Base 使用了 34 兆個詞元,而 Kolibri 則使用了 20 兆個詞元,這些資料來自經過篩選與去重後超過 200 兆的原始資料池,其中 13.6% 是程式碼。
• 語言 — LFM2.5 Base 上有十六種,包括阿拉伯語、中文、日語、韓語、泰語和越南語,而 Kolibri 上恰好只有兩種,德語和英語,這是明確設計。
• 記憶體 — LFM2.5 Base 隨附發佈 GGUF、ONNX 與 MLX 組建版本,且專為邊緣部署而打造;Kolibri 的 FP8 權重佔用約 78 GB,最低需要兩張 A100 80 GB 顯示卡、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300。
把這五行放在一起讀,整體圖像就不再失衡。Liquid AI 的模型以規模小上三個數量級的硬體,涵蓋了十倍數量的語言。Aleph Alpha 的模型涵蓋兩種語言,上下文視窗長達八倍,且其專業化深度只在其自家的垂直領域評估中才會顯現。兩者都不是另一者的較差版本;它們是對不同問題的回答,而那些問題是「這能否在沒有伺服器的情況下運行」以及「這能否推理一份德國監管申報文件」。

其中只有一個有實測分數,而且那不是 Base
這正是配對所隱藏的部分。Artificial Analysis 確實有 LFM2.5-2.6B 的模型頁面——但那是針對後訓練模型,而非 Base。該頁面回報 Intelligence Index 為 8,在其同類 49 個模型中排名第 9,具備 128,000 個 token 的上下文、27 億個參數,以及 LFM Open License v1.0。這是個不算高卻誠實的分數:這個模型經過實測、定價實際上為零,並依其真實面貌——一個小型推理模型——受到評估。
Base 檢查點沒有分數,而且它也不可能擁有分數。Intelligence Index 是透過讓模型接受推理與知識任務來計算的;尚未經過指令微調的檢查點,在那些任務上並沒有有意義的表現。Liquid AI 並未為它發布任何評估表,而這種缺席是對該產物本身的一項陳述,並非此次發布的缺口。
Kolibri 的情況又有所不同,而且值得精確說明,因為很容易被誤讀。Kolibri 同樣沒有 Artificial Analysis 頁面——我們查過了,該模型完全不在那份比較之中。存在的是 Aleph Alpha 自家的訓練後表格,在其測試工具組中,Kolibri 的英文平均得分為 75.5、德文平均得分為 70.8,相較之下,自家的前代 Kolibri Origin 則為 54.1 與 46.4。那些是廠商自行執行、在廠商自建評估套件上得到的數字,無法轉換成 Intelligence Index。因此,在這則標題的兩個模型中,一個有同系列版本的獨立分數,另一個有廠商表格,而兩者被比較的確切版本本身,都完全沒有獨立量測。

那個改變推薦的手足
單獨評價 LFM2.5 2.6B Base 並不是評估 Liquid AI 這次發布的正確方式,因為 Base 存在的目的是為了服務後訓練的 LFM2.5 2.6B,而兩者是綁在一起推出的。如果你無意撰寫微調流程,Base 就不是你的模型——後訓練的同系列版本才是,而且當你自行託管時,它才是擁有公開分數、以及每 token 公開定價幾乎為零的那一個。
那與 Kolibri 和 Kolibri Origin 之間的關係相同,而這個比較值得做,因為 Aleph Alpha 公開了時間表。Origin 於 2026 年 6 月 11 日完成預訓練,規模為 306 億參數、32.7 億活躍參數,且從未發布;Kolibri 於 2026 年 9 月 11 日完成,規模為 781 億參數,並於 10 月 3 日發布。兩個模型,相隔三個月,其中一款僅限內部。Liquid AI 的對應拆分則是兩邊都公開:Base 與後訓練版本並列,並隨原生檢查點一同發布針對 llama.cpp、ONNX Runtime 和 Apple 的 MLX 的量化版本。如果你打算進行微調,那些周邊工具比基準測試中的一行成績更有價值,因為它決定了有多少工作必須由你自己完成。
依需求決定要部署什麼
這一個歸結為一份簡短的決策清單,而不是一個贏家。
• 如果模型必須在沒有伺服器的情況下運行——在手機、筆記型電腦、工廠裡的設備上——LFM2.5 2.6B Base 是兩者中唯一勉強稱得上候選的模型,而經過後訓練的 LFM2.5 2.6B 才是你實際上會用來起步的那一個。Kolibri 無論採用哪種量化,都無法在這些環境中運行。
如果你的工作負載是在你自己的邊界內進行德語或英語文件推理,帶有受監管資料的限制,並且需要拒答行為,那麼 LFM2.5 Base 並不是合適的產物形態,而 Kolibri 正是為此而設——前提是你能提供兩張 80 GB 加速器,並接受一個你能用一行說明的授權立場。
• 如果你需要的不只是德語和英語,Liquid AI 的系列在 2.6B 下涵蓋十六種語言,而語言覆蓋率的論點在那個規模下會逆轉。
• 如果你本季度需要一個已部署的助理,而且不想執行後訓練流程,那麼 Kolibri 已經過後訓練;LFM2.5 Base 則沒有,而 LFM2.5 後訓練模型是比 Kolibri 小得多的助理,而不是它的便宜版本。
對於工作負載真正落在中間地帶的團隊——每月數十億個 token、中等上下文長度、沒有必須自擁硬體的監管要求——這兩者都不是首選。4B 以下的模型自架成本低廉,但要在規模化下路由卻很棘手,因為部署的營運成本可能超過 token 帳單;78B 模型則是反過來的問題。真正會被路由的其實是介於兩者之間的那一層,而這一層就在今日的 OrcaRouter上:Qwen3.5 35B-A3B 每百萬輸入 token $0.057、輸出 $0.459,Qwen3.8-Flash 為 $0.15 與 $0.47,具備 1M token 上下文,或混合專家模型的 Gemma 4 26B-A4B IT 為 $0.06 與 $0.33。這些都是供應商定價原樣轉嫁、每個 token 不額外加收費用,只需一組 OpenAI 相容金鑰即可使用並具備容錯移轉,而對於想在投入微調專案或購置機架之前,先衡量自身真實 token 用量的團隊來說,這才是誠實的答案。
說清楚一點,我們不提供什麼:目前 Kolibri 和 LFM2.5 2.6B Base 都無法在 OrcaRouter 上進行路由。我們以各種廠商與模型拼寫方式在目錄中搜尋過這兩者,兩者都不在其中。Kolibri 僅限自架,而 LFM2.5 Base 是微調產物,從來就不是為了置於 API 之後而設計的。

一句話的選擇
Kolibri 是一個已完成、已取得授權、有完整文件說明的 780 億參數德英推理模型,執行起來需要兩張加速器。LFM2.5 2.6B Base 則是一個尚未完成、2.69 億參數的多語言起始模型,需要一套微調流程,而且能放進你的口袋。兩者之間的參數比例是 29 比 1,而這是本文中最沒有資訊價值的數字。
