一張生成的標題卡寫著「Ember-1」,副標為「Kimi K3 的品質,推理 token 約減少 40%」,並有三張卡片:推理縮減 35-50%、Terminal Bench 2.1 82.0%、發布研究預覽版。頁腳一行寫著:Fireworks 報告的數字,未經重現;發布於 2026 年 9 月 23 日。
Guides & Insights

Ember-1 將 Kimi K3 的推理縮減 40%——而魔鬼藏在細節裡

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

會被引用的數字是 40%。Fireworks Research 於 2026 年 9 月 23 日發布 Ember-1,並將其描述為 Moonshot AI 的 Kimi K3 的專門衍生版本,能在維持 K3 準確度的同時,花費大約少 40% 的 token 來達到相同結果。這是一項真實且異常具體的主張,而且附帶了三件事:一份完整的基準測試表,其中包含 token 縮減欄位;兩項來自正式環境程式設計流量的客戶 A/B 測試;以及一個並非一般可用(GA)的發布狀態。Ember-1 以研究預覽形式推出,在廠商自家的無伺服器平台上,提供兩週的存取期,而是否永久保留則取決於需求。理解其中哪一部分是已出貨的產品、哪一部分是論證充分的研究成果,就是整件事的重點。

在開始任何其他事情之前,有一個名稱衝突值得先釐清。另一個名為 Ember 的獨立開放研究專案(v0.1.5,來自 Slow Lit Labs)在 2026 年期間持續發表長時程連貫性評估,而且它與這個模型毫無關聯。你讀到任何關於 Ember 在相同推論設定下未能勝過 Qwen3-8B 的內容,講的都是那個專案。這裡要談的 Ember-1,是 Fireworks Research 的 Kimi K3 衍生模型。

Ember-1 究竟是什麼

Ember-1 不是新架構,也不是新的基礎模型。它是 Kimi K3,經過重新訓練以更精簡地推理。Fireworks Research 在其自家無伺服器訓練堆疊上,進行了超過 50 項訓練實驗與逾 200 次評估,涵蓋數學、程式設計、指令遵循、對話、搜尋、工具使用與軟體工程,明確目標是移除不會改變答案的推理。該實驗室表示,在七項基準測試與兩組客戶正式流量資料集上,推理長度可縮減 35–50% 而不損失準確率。上述每一項數字皆由廠商自行報告,尚未經獨立重現;截至本文撰寫時,尚無第三方發表過 Ember-1 的執行結果。

這個論述框架之所以重要,是因為顯而易見的替代方案早已存在。Kimi K3 內建推理強度設定,而想少用一些 token 的便宜做法,就是把強度調低。Fireworks Research 表示它試過這種做法,而低強度設定犧牲了太多品質——對任何調整過推理模型強度等級的人來說,這都是熟悉的結果。Ember-1 的主張是:強度旋鈕很粗略,而重新訓練則很精細。

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

為什麼推理符元值得投入這麼多心力

推理模型的帳單並不是由它的回答所主導。Fireworks Research 指出,K3 在寫出任何使用者看得到的內容之前,可能把超過 90% 的生成 token 花在內部推理上。在單一請求中,這只是昂貴而已。但在多輪代理迴圈中,成本會複合累積,因為每一輪都會重播先前的對話,所以早先輪次的推理軌跡會在後續每一次呼叫中被重新讀取並重新計費。Fireworks Research 描述上下文會隨著輪次大致呈二次方成長。那才是這次發布真正針對的目標,也是為什麼頭條指標是 token 數大約減少 40%,而不是品質躍升。

這個機制也解釋了風險。移除多餘思辨的壓縮是免費的;移除模型所需步驟的壓縮則不然。過度激進的推理精簡,其廣為報導的失效模式,是模型跳過某個中間檢查、直接跳到結論,而在代理系統中,這會在很久之後以錯誤的工具呼叫浮現,而不是以錯誤的句子出現。Fireworks Research 反覆強調等效品質,讀起來像是對這項疑慮的回應,而 A/B 數據則是最接近證據的東西——但照例得附上這個但書:測試集、通過標準與樣本數,全都是由提出主張的一方所選定的。

基準表,並附上其來源出處

這些是 Fireworks Research 的數據,未經重製。右側欄位才是值得仔細閱讀的部分:它將每個分數與相對於 K3 Max 所花費的 token 數和美元金額配對起來。

• Terminal Bench 2.1(n=89)— Ember-1 82.0% 對比 K3 Max 80.9%、K3 High 77.6%、K3 Low 76.4%;token 用量減少 51.9%,每項任務節省 $23.10。

• SWE-bench Verified(n=500)——Ember-1 92.2% 對比 K3 Max 93.2%;token 數少 15.5%,每項任務少 $68.10。

• SWE-Interact(n=75)— Ember-1 20.0%,相較 K3 Max 21.3%、K3 High 13.3%、K3 Low 6.7%;token 數少 32.5%。

• DeepSWE 1.1(n=113)—— Ember-1 75.2% 對 K3 Max 66.4%;token 用量少 23.7%,每項任務節省 $126.90。

• τ-2 Bench Airline(n=50)——Ember-1 66% 對上 K3 Max 64%,K3 High 與 Low 皆為 64%;token 用量少 5.9%,每項任務少花 $0.30。

有兩點特別突出。第一,Ember-1 在 Terminal Bench 2.1 和 DeepSWE 1.1 上大獲全勝,卻在 SWE-bench Verified 和 SWE-Interact 上以些微差距落敗——這樣的分佈模式,符合一個並非能力衰退、而是改變了把思考推理花在哪些任務上的模型。第二,詞元節省幅度極不均勻:Terminal Bench 上是 51.9%,τ-2 Airline 上卻只有 5.9%。無論 Ember-1 學到了什麼,那都不是對思考一律砍掉 40% 的統一縮減。標題上說的「大約 40%」是涵蓋約 6% 到約 52% 這個區間的均值,而工作量長得像 τ-2 Airline 的團隊,不該預期能感受到這個效果。

正式生產環境的 A/B 測試是更具說服力的證據,正因為它們並非為了當作基準測試而設計。在某位客戶的程式編寫工作負載中,Ember-1 得分 0.753,K3 則為 0.751;Ember-1 用了 21.4 步,K3 為 23.8 步;Ember-1 輸出 29.9K 個詞元,K3 為 49.3K——推理詞元減少 71.3%,總詞元減少 39%,而品質大致相當。第二位客戶在品質相當的情況下,每項任務的詞元用量減少約 35%;Fireworks Research 表示,它先在自己的內部程式編寫與協作流量上進行切換,據報導結果是沒有人注意到。把這一切都視為供應商自行回報的數據,但把它視為供應商自行回報數據中最強的一種:A/B 偏好與任務完成資料比排行榜更難被操弄。

還有一項評估,是在 Doximity 的 Bedside Bench 上——涵蓋十個類別、500 個經醫師驗證的臨床案例——Fireworks Research 聲稱 Ember-1 在每項任務成本上開闢了新的帕雷托前沿,並將其與包括 GPT-5.6 SolGPT-6 AstraClaude Opus 5 在內的開源與閉源模型相比較。那是廠商對帕雷托位置的宣稱,而這是一種關於二維取捨、而非單一分數的宣稱,其可信度完全取決於背後的成本假設。那些假設來自 Kimi K3 的公開 API 價目表。這就帶我們來到這個故事中,讀者今天真正能夠查證的部分。

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

基礎模型是您已經可以路由的那個部分

Ember-1 的整套成本論點,都是以 Kimi K3 公布的費率來衡量。 Kimi K3 已在 OrcaRouter 上線,每百萬輸入 token 為 $3.00、每百萬快取輸入 token 為 $0.30、每百萬輸出 token 為 $15.00,並具備 1,048,576 token 的上下文視窗。這與 Fireworks Research 比較時所用的費率表相同,而且值得知道的是,那些 token 縮減欄位中的節省金額,是根據你自己看得到的數字計算,而不是根據供應商內部的成本模型。

Ember-1 本身不在 OrcaRouter 上。它僅透過供應商自家的無伺服器平台,以研究預覽形式提供,而 Fireworks Research 尚未公布其價格——因此基準測試表中的美元數字,是根據 K3 的費率與 token 數量推算而來,並非來自一份實際存在的 Ember-1 費率表。如果你感興趣的是其中的算術,誠實的作業順序是:先以 K3 目前的路由為這項工作負載定價,把 token 縮減百分比視為切換後可能換得的上限,並等到有公開費率之後,才把節省金額當作金錢來建模。

OrcaRouter 在這裡確實幫得上忙的地方,就在於這種對沖。只有兩週存取窗口的研究預覽版,正是那種你會想試用、卻不想把正式環境路徑押在它身上的模型;而要在不另外簽一份合約的情況下做到這點,方法就是把它放在跟你呼叫的其他所有服務相同的端點之後。OrcaRouter 提供 200 多個模型,全都藏在同一個 API 後面,並具備自動容錯移轉,因此某個下個月可能就無法使用的預覽模型,只是一次路由調整,而不是一場遷移。Ember-1 本身沒有任何地方要求這麼做——但兩週的窗口也沒有任何理由反對這樣做。

該如何處理這個版本

如果你已經在代理迴圈中執行 Kimi K3,Ember-1 的數字就是在描述你的帳單。多輪重放問題確實存在,它是長時間代理執行中的主要成本,而一個能在不改變答案的情況下縮短自身軌跡的模型,值得花時間評估。正確的測試不是基準測試表;而是你自己的流量,以影子模式運行——將一部分真實請求同時送給兩個模型,比較輸出,在改變任何事之前,先讓線上結果保持不變一到兩週。這也是該版本自身的批判性讀者群給出的建議,而且很合理。

如果你執行的是低深思量的工作負載,或是以短單輪呼叫為主的工作負載,省下的成本大致上就會消失,而 τ-2 Airline 那一列才是你實際可期待的數字。而如果你需要達到生產等級的承諾——一個價格、一個服務水準、一個保證端點在六個月後仍然存在——Ember-1 目前還沒有提供。它是一個研究預覽版,Fireworks Research 明確將其存續與需求綁在一起。接下來一個月值得關注的問題是:這個為期兩週的窗口是否會成為永久的服務選項,以及是否有第三方能重現其中任何一項數字。在這些事情之一發生之前,這是一個讀起來很亮眼的成果,卻不是一個適合用來編列預算的成果。

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

這一切都不應被解讀為貶低這項工作。在不犧牲準確度的前提下移除推理能力,比加入推理能力更難,而這項工作又是建立在別人的前沿模型之上、而非訓練自家的模型,這正是 2026 年許多能力研究工作所呈現的樣貌。Ember-1 是 Fireworks Research 所稱一系列持續推出作品中的首個發布,而這個範本——拿一個已經很優秀的模型,重新訓練其行為的某一個軸向,再把當中的差異以 token 形式出售——無論這次特定的預覽成果如何,都值得關注。