
Solar Mini 4 對比 LFM2.5 2.6B Base:指數的三倍,以及一份根本不存在的成本比較
- openai新OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 每百萬 tokens
- anthropic新Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 每百萬 tokens · 159 tok/s
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
誠實比較 Solar Mini 4 與 LFM2.5 2.6B Base 的方式,是一開始就承認它們並不在同一個市場。Solar Mini 4 是 Upstage 的 350 億參數稀疏混合專家模型,於 2026 年 9 月 22 日發布,每個 token 啟動約 30 億參數,屬專有模型,計費為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.40 美元。LFM2.5 2.6B Base 則是 Liquid AI 的 26.9 億參數預訓練檢查點,於 2026 年 8 月初以 LFM Open License v1.0 發布至 Hugging Face,小到足以放在手機的記憶體中。一個是端點。另一個是權重檔案,而如果你讀到這裡,是因為你想執行一個模型,而不是呼叫一個模型,那麼比較早已結束。
無論如何,這組配對之所以值得寫成一篇文章,關鍵在於它們真正重疊的那一個面向:兩者都是被放在同一把獨立尺規前衡量,而那項比較所呈現的樣貌,並不是參數量所能預測的。Artificial Analysis 在 Intelligence Index v4.3.2 上給 Solar Mini 4 打了 24 分,並將 LFM2.5 2.6B 這一代評為 8.4 分——但第二個數字只是估計值,而且它衡量的並不是本文標題中的那個檢查點。這兩點但書都很重要,而它們正是首先要釐清的事。
並排的規格表
• 參數 — Solar Mini 4 總參數量為 35B,其中 3B 為活躍參數;LFM2.5 2.6B Base 是稠密模型,參數為 2.69B,毫無保留。在每 token 運算預算大致相同的情況下,Upstage 這邊的權重多達十三倍。
• 架構——Solar Mini 4 是稀疏的專家混合模型。LFM2.5 2.6B Base 有 30 層,其中 22 層是雙閘控短卷積區塊,8 層是分組查詢注意力,這是 Liquid 為 CPU 與邊緣推論打造的混合式設計。
• 訓練 — Upstage 並未公布詞元預算。Liquid 的模型卡記錄了 34 兆個詞元,以及涵蓋 16 種語言、包含韓語和日語在內的 128,000 個詞元詞彙表。
• 授權 — Solar Mini 4 為專有軟體。LFM2.5 2.6B Base 依 LFM 開放授權條款 v1.0 發布——允許商業使用但附帶條件,且可進行微調。
• 上下文 — Upstage 的文件記載為 512K tokens,而 Artificial Analysis 針對同一模型列出 1.05M,因此可將上限視為尚未定論。LFM2.5 2.6B Base 則為 131,072。
• 模態——兩者皆為文字輸入、文字輸出,皆不接受圖像或音訊。
• 價格 — Solar Mini 4 每百萬個 token 為 $0.10/快取 $0.01/$0.40,目前至 2026 年 10 月 22 日前享 50% 折扣。LFM2.5 2.6B Base 完全沒有價目表;主辦方 Artificial Analysis 將 LFM2.5 2.6B 此一代的價格列為 $0.00。
「8.4,估計」衡量與不衡量什麼

Artificial Analysis 對 LFM2.5 2.6B 世代所收錄的條目——指的是後訓練模型,而非預訓練 Base——帶有 8.4 的指數,並標示為估計值,其大多數組成評測也同樣被如此標註。那是排行榜上的一個位置,不是可供依循建構的規格,也絕不該被引用得像是有人把 Base 檢查點跑過整套評測一樣。沒有人做過這件事。Liquid 自家的模型卡完全沒有公布 LFM2.5 2.6B Base 的基準測試表:它是一個預訓練的文字補全檢查點,而模型卡明白表示,它僅建議用於重度微調。
受評分的同門模型是另一項產物。Liquid 針對後訓練 LFM2.5 2.6B 的基準測試表顯示,IFStruct 為 85.5、Multi-IF 為 80.1,AIME25 為 51.9、LiveCodeBench v6 為 59.4、BFCLv4 為 56.9,而 τ³-Banking 為 5.7——全部由廠商自行執行,全都出自指令微調版本,而 τ³ 那個數字讀起來像是一記警訊。
Solar Mini 4 的表現輪廓截然不同。它在長脈絡推理的 AA-LCR v1.1 上拿下 83.3%,在 SciCode 上取得 47.6%,在 AA-Omniscience 上則為 −10.8,準確率 18.4%、非幻覺率 64.2%。它在 Terminal-Bench 4.0 上得分 1%,在 AutomationBench-AA 上得分 22.3%。這兩個系列在代理式工作上都很弱;Upstage 的模型在代理式工作上很弱,同時還很昂貴,這比在代理式工作上很弱但免費還要糟糕。
Solar Mini 4 值回票價之處,在於輸出的規模。在每個索引任務 88,300 個輸出 token——其中 71,600 個是推理——的情況下,它耗費運算的方式,是 2.6B 稠密模型無法藉由獲得較長提示來模仿的。一個擁有 2.69B 參數的模型可以被要求逐步思考;但無法被要求擁有 35B 參數。那才是真正的產品。
指數的三倍,且沒有可比較的成本數字
Artificial Analysis 將 Solar Mini 4 定為每完成一項索引任務 $0.36,而 Granite 4.2 3B 為 $0.006,且 LFM2.5 2.6B 這一代的定價為零,因此不存在任何每任務成本數據能讓這成為公平的比例。因此,「Solar Mini 4 的成本遠高於 LFM2.5 2.6B Base」這個說法為真,卻有點不是重點。相關問題是:Solar Mini 4 所專為其打造的韓語、長文件、結構化擷取工作,究竟能否由一個 2.69B 預訓練檢查點完成。通常不能,而這時比較就變成 Solar Mini 4 對上前沿通用模型,而非 Solar Mini 4 對上手機模型。
LFM2.5 2.6B Base 勝出的情境,並不是它更便宜的情境,而是任務範圍窄到微調就能弭平差距的情境。從已知文件格式進行結構化欄位擷取、依固定分類體系進行分類、必須在無網路環境下運作的裝置端助理——這些任務正是 2.69B 檢查點加上你自己的訓練資料,勝過 35B 通用模型加上一張價目表的地方,而且成本是一台 GPU 執行個體,而不是按 token 計費的計量器。Liquid 透過 Unsloth 和 TRL 提供基礎檢查點,並隨附持續預訓練、LoRA SFT、DPO 與 GRPO 配方,正是為了這種做法。
該打哪一個
當輸入很長、輸出必須經過推論、語言組合包含韓語和日語,且每項困難任務可容忍七分鐘解碼時間時,就選用 Solar Mini 4。當權重必須屬於你自己、裝置沒有網路連線,且任務範圍狹窄到足以進行微調時,就選用 LFM2.5 2.6B Base。有趣的部署會兩者並用,因為它們並非替代方案:小型本地模型負責路由、遮蔽與擷取,而託管模型只會用於那一小部分實際上需要 35B 參數的請求。
Liquid 的模型不在 OrcaRouter 上,Upstage 的也不在,所以這兩條路由都不是我們能賣給你的。我們能做的是那個把這道比較從一項決策變成一份設定的部分:超過 200 個模型藏在同一把金鑰之後,且相對於供應商定價零加成,具備跨供應商的自動容錯移轉,以及一套路由 DSL,讓你把多個模型組成單一次呼叫。當正確答案會是「多數時候用便宜的那個,關鍵時刻用好的那個」時,這就是個路由問題,而這正是路由 DSL 存在的理由。

兩家廠商都不願放上投影片的那個數字
延遲。Solar Mini 4 在每個 Intelligence Index 任務中消耗 88,300 個輸出 token,實測速度為每秒 204 個 token,因此每個困難任務平均耗時 430 秒——略超過七分鐘。LFM2.5 2.6B 世代在 Artificial Analysis 測試的主機上,以每秒 45.7 個 token 的速度運行,首個 chunk 的等待時間為 2.8 秒,但那是資料中心主機在與一個通常會在你的桌上型電腦上運行的模型對話。Liquid 自家的測量顯示,相同架構在 M5 Max 上為每秒 220 個 token,在 Ryzen AI Max+ 395 上為 113,而在手機上約為每秒 30 個 token——這是在沒有網路的裝置上可用的代理迴圈。
如果你的工作負載是互動式的,優劣差距很明顯,任何基準測試分數都改變不了這點。如果你的工作負載是批次處理,而等待的是一項 cron 工作,七分鐘沒問題,換來推理深度是值得的。

兩點資料來源說明作為收尾。這裡每一項 Artificial Analysis 的數字,都是該機構在共用測試套件上所做的獨立測量;LFM2.5 2.6B 的指數明確標示為估計值,且涵蓋的是後訓練模型,而非上述的預訓練 Base 檢查點。每一項 Liquid AI 的數字,都是廠商以自家基準測試自行跑出的結果,未經重現;而 Base 檢查點本身完全沒有公佈任何分數,這是預訓練模型的通例,並非對這個模型的批評。
