
Ember-1 對比 Qwen3.8-Max:節省 Token 的衍生模型對抗旗艦模型
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
這場對決中的兩個模型,在同一項基準測試上都有實測數字,卻仍然什麼也沒能決定。Ember-1 是 Fireworks Research 基於 Moonshot AI 的 Kimi K3 所推出的專門化衍生模型,於 2026 年 9 月 23 日發布,在 Terminal Bench 2.1 上回報 82.0%,而耗用的 token 數約為其基礎模型的一半。Qwen3.8-Max 則是阿里巴巴的旗艦模型——一個約 2.4 兆參數的稀疏專家混合模型,每個 token 約啟用 950 億參數——自 2026 年 8 月 3 日起全面供應,在同一項基準測試上回報 86.6%。這兩個數字都是廠商自行回報,兩家實驗室也都跑自家的測試框架,而兩套未公開的評測設定之間相差 4.6 個百分點,並不足以構成定論。真正可以比較的是錢,而這正是這場對決開始有意思的地方:其中一個模型的整套主張,就是你實在不該為自己不需要的 token 付費;另一個則是旗艦模型,定價為每百萬輸入 token 2 美元、每百萬輸出 token 6 美元。
每個模型實際上是什麼
Ember-1 在任何架構意義上都不是新模型。它是 Kimi K3 經過重新訓練以更精簡地推理,由 Fireworks Research 在其自家的無伺服器訓練堆疊上,透過超過 50 次訓練實驗與超過 200 次評估打造而成。該實驗室聲稱,K3 的推理長度超出任務所需,而多餘的部分可以在不改變答案的情況下移除——在七項基準測試與兩項客戶生產環境 A/B 測試中,推理長度下降了 35–50%,且準確率未受影響。它已以研究預覽版形式在供應商自家的無伺服器平台上提供,未公布權重,也未公布價格。
Qwen3.8-Max 完全是另一種不同的存在。它是阿里巴巴的前沿層級,原生支援文字、圖像與影片輸入的多模態模型,具備一百萬個詞元的上下文視窗,且自推出以來已更新兩次:一次是 2026 年 9 月 2 日針對程式設計與專業辦公室工作所做的後訓練更新,另一次是 2026 年 9 月 22 日宣布的更快速服務層級。阿里巴巴將其定位為與 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 競爭,而其公布的評估表也反映出這份企圖心——GPQA Diamond 92.6、OSWorld-Verified 86.1、SWE-bench Pro 67.7、PaperBench 93.0、IFBench 82.8,以及 Humanity's Last Exam 的 43.6,全數由廠商自行報告。

並排的費率表
其中一個有價格,另一個則沒有,這是第一個實際的不對稱。
• 輸入 — Ember-1:未公布;基準表依據 Kimi K3 的價目表計算出美元金額。Qwen3.8-Max:在 OrcaRouter 上每百萬個 token 為 $2.00。
• 輸出 — Ember-1:未公布。Qwen3.8-Max:每百萬個 token 6.00 美元。
• 快取輸入 —— Ember-1:不適用。Qwen3.8-Max:快取讀取每百萬個 token 收費 $0.25,是輸入費率的八分之一,而在代理迴圈中,每一輪都會重新傳送相同的上下文,這一點至關重要。
• 上下文視窗 — Ember-1:預覽版未公布;其基礎模型支援 1,048,576 個詞元。Qwen3.8-Max:1,000,000 個詞元。
• 多模態 — Ember-1:文字。Qwen3.8-Max:文字、圖像與影片輸入,文字輸出。
• 權重 — Ember-1:無。Qwen3.8-Max:雖有開放權重版本,但僅支援文字,且缺少所服務端點的完整上下文視窗與視覺輸入。
• 使用權 — Ember-1:研究預覽,為期兩週的無伺服器期間,是否永久提供取決於需求。Qwen3.8-Max:全面開放並已定價。
在建模之前,請先注意 Qwen3.8-Max 定價的一件事:Alibaba 自推出以來已多次修改這款模型的包裝方案,而國際費率表也不總是與八月的公告價格一致。請把 $2.00 和 $6.00 視為我們平台上目前的路由價格——我們平台會不加價地按供應商定價原價傳遞,因此供應商一有變動,當天就會反映出來——並在為它編列預算前先查看費率表。
為什麼基準測試比較無法運作
Ember-1 的 82.0% 與 Qwen3.8-Max 的 86.6% 都是 Terminal Bench 2.1 的結果,這讓它們看似可以互相比較,但實際上並不能相提並論。Ember-1 的報告將其數字與 Fireworks Research 所評估的 Kimi K3 變體進行對比,樣本數為 89,並附有 token 與成本差異。Qwen3.8-Max 的數字則來自 Alibaba 自家的評估報告。不同的實驗室、不同的測試框架、不同的代理鷹架,而在一個僅因鷹架選擇就會讓分數變動數分的基準測試中,4.6 分的差距仍落在方法論的雜訊底線之內。
從 Ember-1 的表格中,你能讀到的是 token 欄位,而那是模型唯一被訓練去改變的東西。相較於自身的基礎模型,Ember-1 在 Terminal Bench 2.1 上少用 51.9% 的 token,在 SWE-Interact 上少用 32.5%,在 DeepSWE 1.1 上少用 23.7%,而在 τ-2 Bench Airline 上只少用 5.9%。這個落差就是最誠實的重點。一個能減少推敲思量的模型,在基礎模型會過度思考的基準測試上價值極高,而在基礎模型不會過度思考的測試上幾乎毫無價值;而若不測量你自己的負載,你就無法知道自己面對的是哪一種。
每項已完成任務的成本,已核算完畢
以下是真正決定此事的計算,以 Kimi K3 公布的費率作為 Ember-1 成本的替代基準,因為 Ember-1 並沒有自己的費率。Kimi K3 每百萬輸入符元為 3.00 美元,快取為 0.30 美元,輸出為 15.00 美元——正是 Fireworks Research 在其自家比較中所用的價目表。Qwen3.8-Max 則是輸入 2.00 美元、輸出 6.00 美元,快取讀取為 0.25 美元。
在輸入端,Qwen3.8-Max 已經便宜三分之一。在輸出端,它每個 token 便宜 2.5 倍。這表示 Ember-1 的 token 縮減並不是在跟一份固定不變的帳單競爭——而是在跟一個在任何效率優化發生之前,每個 token 就已經更便宜的旗艦模型競爭。Fireworks Research 自家的正式環境 A/B 測試顯示,輸出 token 從 49.3K 降到 29.9K,總共減少 39%;把這套用到 Qwen3.8-Max 的輸出費率上,你會得到同樣的 39% 節省,但這會比把相同百分比套用到 K3 的 $15 費率上,帶來更小的絕對效益。
因此,Ember-1 的效率論據在與自家基礎模型相比時最為有力,而這正是該發布所提出的論點。相較於 Qwen3.8-Max,比較則轉向每美元所能換得的效能,其中該旗艦機型更大的上下文、多模態輸入以及已定價的可用性正是反駁論據——而在這一點上,沒有人發表過足以一決高下的正面對決。

我們自己的路徑規劃資料顯示了什麼
這裡涉及的三個模型中,有兩個是 OrcaRouter 上的實際運行路由,這提供了任何基準測試表都無法呈現的視角。Qwen3.8-Max 以 1,000,000 個 token 的上下文提供服務,過去七天內的首 token 延遲中位數約為 2.0 秒,輸出速度約為每秒 52.7 個 token,錯誤率約為 4.2%。Kimi K3——Ember-1 的基礎模型,也是 Ember-1 所宣稱每一項節省效果的參照基準——以 1,048,576 個 token 的上下文運行,延遲中位數接近 8.0 秒,輸出速度約為每秒 43.6 個 token,錯誤率約為 0.27%,且流量明顯更高。Ember-1 本身並不在 OrcaRouter 上。
這些數字重新定義了這項決策。Kimi K3 產生首個 token 的速度明顯較慢,且每輸出 token 的成本大約是 Qwen3.8-Max 的兩倍,但在負載重得多的情況下,錯誤率卻低得多。K3 的省 token 衍生版本縮小了成本差距,卻未縮小延遲差距,因為縮短推理只會縮短生成階段,而非佇列。如果你的工作負載重視延遲而非帳單,那麼旗艦模型是今日更好的選擇,而效率敘事則無關緊要。
要路由哪一個?
當你需要上下文視窗、多模態輸入、公開定價,以及可據以編列預算的服務時,就將請求路由至 Qwen3.8-Max。就結構而言,它是兩者中較安全的選擇:正式可用、已定價,且由一家有持續讓端點保持最新實績的供應商在兩個月內更新了兩次。
當你的帳單主要被長時間代理迴圈中的推理 token 占據,而且你跑的是託管模型而非自己的硬體時,就該試試 Ember-1。正確的測試方式是把握預覽給你的這兩週,以影子模式對照生產流量來跑,衡量每完成一項任務的 token 數,而不是每請求的 token 數。你不該做的,是僅憑一個會依工作負載不同而落在 6% 到 52% 之間的 40% 數字,就把它當成旗艦模型的同級替代品直接換上。
如果真正的問題是要不要繼續運行 Kimi K3,那你今天就能回答,完全不需要任何預覽:Kimi K3 和 Qwen3.8-Max 都在 OrcaRouter 上,共用同一把金鑰,按供應商定價收費、毫無加價,並在供應商之間自動容錯移轉。比較兩者在你工作負載上的成本,只是路由上的變更,而非採購專案 —— 而且它能給你一個基準線,讓任何關於 Ember-1 的效率主張,可以用你自己的數字來衡量,而不是實驗室的數字。

誠實的總結是,這兩個模型是針對不同的限制條件進行優化的。Qwen3.8-Max 的打造目標是成為市面上能力最強的模型,並據此定價;Ember-1 的打造目標則是讓一個本就昂貴的模型運行起來更便宜。兩者都合理,而這場對決之所以難以給出明確的結論,是因為衍生模型的節省是相對於一份費率表來定義的,而旗艦模型則大幅壓低了該費率表。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
