
Qwen 4 Max 對決 Kimi K3:開放權重的承諾,遇上開放權重的兌現
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Moonshot AI 於 2026 年 7 月 16 日發布 Kimi K3,接著做了大多數實驗室只會嘴上說說的事:它公開了權重。這個 2.8 兆參數的檢查點於 2026 年 7 月 27 日以 Modified MIT 授權條款上線,距離發布十一天。與此同時,2026 年 9 月 22 日的雲棲大會則被用來宣布 Qwen 4 Max 為四層級 Qwen 4 家族的旗艦,其中包含開源權重的 Qwen 4 27B——一個只被承諾、尚未交付的層級。這兩個事實就是比較。關於 Qwen 4 Max 的其他一切目前都未知,而承諾的開放層級與已交付層級之間的落差,正是這場對決真正有話可說的地方。
Kimi K3 在七月端出了什麼
Kimi K3 是一個擁有 2.8 兆參數的混合專家模型,每個 token 會啟動 896 個專家中的 16 個,因此在任一步驟中約有 1,040 億個參數投入運作。它在輸入與輸出端皆具備 1,048,576 個 token 的上下文視窗,並接受文字、圖像與影片輸入,輸出文字。其官方 API 定價為每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,以及每百萬快取輸入 token 0.30 美元,而第三方價格則低於此。
這套架構正是阿里巴巴自家預覽版本所呼應的部分。Kimi K3 建構於 Kimi Delta Attention 與 Attention Residuals 之上,Moonshot 宣稱這兩者相較於 Kimi K2 帶來約 2.5 倍的擴展效率提升,並在百萬 token 上下文下達到最多 6.3 倍的解碼速度。這正是 Qwen 的 QSA 所瞄準的同一道難題——讓注意力在極長長度下變得可負擔——這意味著這兩個系列與其說是在規模上競爭,不如說是在比誰的稀疏注意力設計更經得起時間考驗。
Moonshot 在推出時公布的成績,當時由廠商自行報告、未經複現:
• Artificial Analysis Intelligence Index — 57,當時排名第三,僅次於 Claude Fable 5 和 GPT-5.6 Sol。該數字是在較早的指數修訂版本下記錄的;此後該指數已重建兩次,因此這是歷史讀數,而非當前讀數
• Frontend Code Arena — 以 1,679 Elo 奪下第一,領先在一般指標上得分高於它的兩個模型
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42,領先 Opus 4.8 與 GPT-5.6 Sol
• DeepSearchQA — 0.95,第一名,以及 MATH-Vision 0.98,同樣第一
• GPQA-Diamond — 0.94
Moonshot 自家的發表資料承認,K3 在整體能力上仍落後於 Claude Fable 5 與 GPT-5.6 Sol,這句話比上述任何第一名的主張都更有用。這些數字的有趣之處在於,一個在通用指標上排名第三的模型,卻在前端程式碼拿下第一,也在長時程搜尋上排名第一——這樣的輪廓說明,綜合指標所隱藏的是一個專用工具,而非在描述一個通用模型。

阿里巴巴承諾了什麼,以及承諾究竟值多少
Qwen 4 的發表公告列出了四個層級。Qwen 4 Max 作為旗艦,Qwen 4 Flash 主打吞吐量,Qwen 4 Plus 是均衡的中階,Qwen 4 27B 則是開放權重的本機層級。Qwen LLM 負責人 Liu Da Yiheng 將該系列描述為採用新一代架構訓練,並表示很快就會推出。這四款都沒有日期、模型卡、API 識別碼、雲端上架資訊、價格,也沒有已公布的評分。
關於那則公告,有兩件具體的事常被錯誤報導,而對任何想據此規劃的人來說,這兩件事都很重要:
• 附在 Qwen 4 報導上的 5 兆至 10 兆參數數字,並非 Qwen 4 的規格。它屬於 Qwen 4.5 與 Qwen 5 的路線圖。Qwen 4 Max 尚未公布任何形式的參數量。
• 層級名稱的沿用,並不會讓規格也一併沿用。Qwen 4 Max 的上下文視窗、價格與授權仍屬未知;已推出的 Qwen3.8-Max 數據——1,000,000 個 token,以及每百萬 $2.00 和 $6.00——描述的是另一個模型
27B 這個層級之所以有趣,與基準測試無關。它是 Qwen 4 系列中歷來唯一以開放權重發布的層級,而 Qwen 3.8 世代展示了此舉能解鎖什麼:在 27B 權重落地後幾天內,社群就已產出 MLX 轉換、NVFP4 量化,以及各式各樣的微調。宣布推出 27B,就是對下游生態系的承諾,也是路線圖上最可預測的交付項目。
但可預測性並未兌現。Kimi K3 的權重是今天就能下載的檔案。Qwen 4 27B 的權重只是研討會演講中的一句話。
開放權重與可執行的權重是不同的主張
把 Kimi K3 當成開放權重的答案,這裡有個陷阱,值得直說,因為這是在報導中國前沿模型時最常見的過度宣稱。一個 2.8 兆參數的混合專家模型是資料中心等級的產物。公開權重意味著你被允許執行它、可以檢視它、可以微調它,也可以量化它。它們並不代表你能在工作站上執行它。要有效率地服務那麼大的檢查點,需要數十個加速器;而開放發布之後隨之而來的量化工作——幾週內就會流通的 NVFP4 和 REAP 風格變體——既是為了讓模型可供服務,也同樣是為了讓它更小。
所以,對 Kimi K3 授權條款的誠實解讀是:範圍更窄,但依然重要——它是一個可稽核、可修改、可自行託管的前沿模型,採用修改版 MIT 授權,適合擁有相應硬體來部署它的組織。那是一項真正的策略資產,但對任何把「開放權重」理解為「能在我的筆電上跑」的人來說,則不太合適。
同樣的但書也將適用於 Qwen 4 27B——如果它真的推出的话——而且適用程度會較為緩和,因為 27B 開放權重層級確實屬於地端規模,而 2.8T 旗艦則不然。這正是為什麼在此比較中,Qwen 4 27B 層級比 Max 層級更值得關注,即使當初發布時主打的是 Max 層級。

授權問題底下的商業問題
Kimi K3 的第一方費率為每百萬個 token 輸入 $3.00、輸出 $15.00,屬於高階定位,而 Moonshot 也已明確表示,其定價刻意高於中國市場的低價端。相較於 Qwen3.8-Max 的 $2.00 與 $6.00,這相當於輸入費率是其一倍半、輸出費率是其兩倍半——這個差距之大,意味著工作負載必須重視 Kimi K3 的特定強項,前端程式碼與長時程搜尋正是其中之二,才值得支付這樣的溢價。
OrcaRouter 在單一與 OpenAI 相容的端點上,以 0% 加價提供 kimi/kimi-k3 與 Qwen 3.8 系列,這表示你被計費的是供應商的定價表費率,而非加價後的等值費率。在輸出價格相差達 2.5 倍的比較中,平台沒有抽成並不是可忽略的尾數細節——在每百萬個 token 15.00 美元的輸出費率上多加一成,就是每百萬個 token 1.50 美元,這已超過這場對比中較便宜模型的全部輸入成本。同一個端點還提供自動容錯移轉,以及用來明確表達策略的路由 DSL,這正是讓你能在一小部分正式流量上試用具有 Kimi K3 特性的模型,而不必把整條路徑押在一個你從未運行過的供應商身上的方法。
OrcaRouter 不提供的是 Qwen 4 Max 或任何 Qwen 4 層級,因為它們目前都還不是產品。

該注意什麼,以及該忽略什麼
有三個訊號會改變這項比較,而且它們具體到值得密切留意:
• Qwen 4 27B 的權重。不是 Max 等級的基準測試表——是 27B 檢查點、它的授權條款和它的規模。那個發布版本才能告訴你,阿里巴巴在這一代的開放權重承諾,是否和上一代一樣真實。
• Qwen 4 Max 的授權條款(如果有的話)。如果 Alibaba 像對 Qwen3.8-Max 那樣公布其旗艦模型的權重,那麼在這場較量中,開放權重的論點就不再是 Kimi 的優勢,而會變成平手
• 一份針對 Kimi K3 的全新獨立解讀。Moonshot 的發布分數是自行通報的,而 Artificial Analysis 指數此後已重建兩次,因此 57 這個分數與 Frontend Code Arena Elo 都需要重新基準化,才能與任何現行數據相比較。
該忽略的是任何在阿里巴巴發布模型卡之前出現的 Qwen 4 Max 規格表,以及任何聲稱 Kimi K3 的開放權重讓它可在地端執行的說法。這兩個錯誤都已經在流傳。在此同時,你能據以行動的比較,是兩個確實存在的模型之間的比較:Kimi K3 以溢價費率提供已交付的權重,以及真正具差異化的程式撰寫特性;Qwen3.8-Max 則以不到一半的輸出價格,提供統一的一百萬字符視窗,而且也有自己的權重。那是個真實的選擇,兩邊都有標價,而且不需要等到某張會議簡報變成產品。
本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
