
Ember-1 對 LFM2.5 2.6B Base:完備行為對抗原始基底
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Ember-1 和 LFM2.5 2.6B Base 都不是你能直接拿來使用的模型,而它們無法使用的原因正好相反。Ember-1 由 Fireworks Research 於 2026 年 9 月 23 日發布,是 Moonshot AI 的 Kimi K3 的一個專門衍生版本;該實驗室對它重新訓練,使其能以大約少 40% 的 token 達到 K3 的準確率——這是一種已完成的行為,僅以研究預覽的形式在供應商自家的無伺服器平台上提供,既沒有權重,也沒有公布價格。LFM2.5 2.6B Base 由 Liquid AI 於 2026 年 8 月 4 日發布,是一個 2.69B 參數的預訓練檢查點,採用 LFM Open License v1.0,完全未經指令微調,會接續你的文字而不是回答你的問題——一種原始基材,今天就能下載,刻意保持未完成。將兩者並列閱讀,是了解目前關於效率提升從何而來的兩種論點的好方法。
兩個模型都在回答的問題
兩項發布都基於相同前提:把模型做大所帶來的廉價成果大多已被取盡,而有趣的工作已轉向模型如何花用它既有的能力。兩個實驗室對此給出不同答案。Fireworks Research 拿了一個既有的前沿模型,改變其行為。Liquid AI 則從零打造一個小型模型,改變規模。兩者都不是新架構的故事,也無意登上排行榜榜首。
Ember-1 的答案:保留模型,重新訓練行為
Ember-1 不動 Kimi K3 的架構,而是針對某一項特定的效率不彰問題下手。推理模型可能把超過 90% 的生成 token 花在內部思辨上,而在多輪的 agent 迴圈中,那些軌跡會在後續每一輪被重新播放並重新計費——Fireworks Research 形容由此產生的上下文成長大致與輪數呈平方關係。該實驗室聲稱,K3 的推理比任務所需更長,而多出來的部分可以在不改變答案的情況下移除。他們報告在自己的無伺服器訓練堆疊上執行了 50 多組訓練實驗與 200 多項評估,並表示在七項基準測試與兩組客戶正式流量資料上,推理長度下降了 35–50%,且準確率毫無損失。這些全都是廠商自行報告、尚未被重現的結果。
結果參差不齊,而頭條數字掩蓋了這一點。Ember-1 的 token 縮減幅度從 Terminal Bench 2.1 上的 51.9%,到 τ-2 Bench Airline 上的 5.9% 不等。在某位客戶的正式環境程式碼 A/B 測試中,輸出 token 從 49.3K 降至 29.9K,而成績維持在 0.753 對 0.751——推理 token 減少了 71.3%。這對某一種工作負載型態是很大的效果,對另一種則幾乎看不見;這正是你對一個被訓練成停止過度思考、而非減少思考的模型所會預期的結果。

LFM2.5 2.6B Base 的答案:改變規模,保留配方
LFM2.5 2.6B Base 是一種不同的押注。它是 Liquid AI 的小規模混合架構:30 層,其中 22 層是雙閘控短卷積區塊,8 層是分組查詢注意力層,以約 34 兆個 token、涵蓋 16 種語言的資料訓練而成,並具備 131,072 個 token 的上下文視窗。整個檢查點是 2.69B 稠密參數——小到足以讓關於成本的討論不再聚焦於 token,而是開始聚焦於你手邊還空著哪一張 GPU。
它之所以不尋常,在於它刻意不做的事。它沒有指令微調,而這正是「Base」後綴的全部重點:把一個問題交給它,它會以該問題的風格續寫文字,而不是回答它。Liquid AI 自家的模型卡建議將它用於需要大量微調的任務。它也沒有已發布的評估,而這並非疏漏——在指令遵循基準上評估基礎檢查點根本測不出任何東西,因為正在被衡量的行為尚未被訓練進去。
對比,每個維度一行
• 它是什麼 — Ember-1:一個重新訓練的 Kimi K3 衍生模型,具有縮短的推理。 LFM2.5 2.6B Base:一個從零開始預訓練的檢查點,未經指令微調。
• 參數量 — Ember-1:未公開;繼承自 Kimi K3。LFM2.5 2.6B Base:2.69B 稠密。
• 權重 — Ember-1:未發布任何內容。LFM2.5 2.6B Base:依 LFM Open License v1.0 提供。
• 價格 — Ember-1:未公布;基準測試的美元計價採用 Kimi K3 的價目表。LFM2.5 2.6B Base:可免費下載;硬體由你自行提供。
• 上下文 — Ember-1:尚未在預覽版中發布。LFM2.5 2.6B Base:131,072 個詞元。
• 已發布的評估 — Ember-1:七項基準測試與兩項 A/B 測試,全由廠商執行。LFM2.5 2.6B Base:無,此為刻意設計。
• 最終你會得到的成果 —— Ember-1:一個能以 K3 等級準確度產生更精簡推理的端點。LFM2.5 2.6B Base:一個起點,其行為完全取決於你訓練它成為什麼樣子。
兩種不同的想念
這兩個版本中的落差看似對稱,實則不然。LFM2.5 2.6B Base 缺少的評估是其產物的固有性質:基礎檢查點沒有可供評分的行為,而缺少指令微調是有文件記載的特性,而非不足。這種缺少並不會造成商業上的不確定性,因為你購買的是一個附帶授權的檔案,而下載完成的那一刻,交付項目就已完整。
Ember-1 所缺的拼圖確實仍未解決。由於沒有公布價格,成本說法只是拿 Kimi K3 的價目表做算術,而不是你能據以編列預算的費率。由於沒有權重釋出,這個模型能否繼續存在,全看供應商是否決定繼續提供服務。而且存取窗口被描述為臨時性的:Fireworks Research 將其研究發布定位為為期兩週的無伺服器窗口,其能否永久存在取決於社群需求。一個下個月可能就不存在的預覽版,和一個只是尚未經過驗證的預覽版,是兩回事;而公告中的第二個客戶 A/B——每項任務約少 35% 的 token——告訴你的是該實驗室預期什麼,而不是到了十一月仍能觸及什麼。
那個不對稱性,正是「這兩個哪個更準備好了」這個問題的誠實答案。就作為可即插即用的生產環境依賴而言,兩者都還沒準備好。LFM2.5 2.6B Base 作為原料已經完成,作為模型則尚未完成。Ember-1 作為模型已經完成,作為服務則尚未完成。

本季度每一項要怎麼處理?
如果你已有微調流程,以及一個標籤乾淨的狹窄任務,LFM2.5 2.6B Base 是兩者中較可預測的選擇。該檢查點很小,授權條款寬鬆,其架構在推論時講求效率,而把它變成有用東西的工作——監督式微調、評估集、服務堆疊——是你從頭到尾本來就已掌握的工作。無論如何,你都會跑自己的評估,因為 Liquid AI 並未發布任何評估。
如果你的託管代理工作負載,帳單主要由推理 token 主導,Ember-1 針對的是你成本方程式中一個真實項目,而它值得花那兩週。正確的測試是對你的現行系統做影子流量:把一部分真實請求同時送給兩者,比較輸出,不要動線上結果。這也是獨立批判性報導在該版本發布時給出的建議,同時附帶一個公允的警告——壓縮深思熟慮有風險,可能失去模型需要的一步,而在代理中,這之後會以錯誤的工具呼叫而非錯誤的句子顯現出來。
這兩個模型都不在 OrcaRouter 上。如果你想測試的是這個模式,而不是這兩個特定成品——在同一條管線裡放一個小型可微調模型和一個大型託管推理模型——那正是路由 DSL 的用途:把多個模型組合成單一次呼叫,讓每個模型負責自己擅長的部分,一切都在一組金鑰與一份帳單之後運作。即使這兩個特定端點都仍搆不著,這裡的比較在架構層面上依然值得一做。
交易,一次說清楚
Ember-1 賣的是行為的確定性與供應的不確定性:一個品質經過審慎論證、可用性明確附帶條件的模型。LFM2.5 2.6B Base 賣的是供應的確定性與行為的不確定性:一個你永遠會擁有的檔案,而其能力完全取決於你投入其中的訓練。有推論服務問題卻沒有訓練能力的團隊,應該關注預覽版,並期盼它成為永久版本。有訓練能力且任務範疇狹窄的團隊,應該下載基礎版本,別再等待任何人的產品路線圖。

這組對照真正顯示的是,「效率」已經不再只代表一件事。對 Ember-1 而言,它指的是在別人的硬體上,以相同品質換得更少的 token。對 LFM2.5 2.6B Base 而言,它指的是模型小到足以讓硬體根本不再是別人的。這兩個都是好答案,而且它們不能互換。
