
Qwen 3.8 vs Kimi K3:兩大中國巨頭,現在其中一個更便宜了
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
這是2026年中國最具影響力的兩個前沿模型,而它們是近親:兩者都是規模龐大的稀疏混合專家系統,都支援100萬token的上下文,都具備多模態能力,也都承諾開放權重。Kimi K3來自Moonshot,實際上是兩者中較大的那一個:總參數量2.8T,而Qwen的為2.4T——這提醒我們,參數量並不代表排名。
直到2026年8月3日,這種比較在某個特定方面是失衡的:Kimi K3 擁有經審計的 Artificial Analysis Intelligence Index 分數 57.1、在 LMArena 前端代碼排名中名列第一、已公布定價、並發布了模型權重,而 Qwen3.8-Max只有 2.4T 的宣傳數字,其他一無所有。GA 徹底改變了成本結構。Qwen 現在公布每百萬 token 的價格為 $2 / $6,而 Kimi 為 $3 / $15——這使得更大、更充分驗證的模型反而貴出很多。
給開發者的一點提醒 —— 要解決這個問題,最快的方式就是用自己的提示詞把兩邊都跑一遍。OrcaRouter 在單一 OpenAI 相容端點背後代理了 200+ 個模型,所以你可以讓 Qwen 3.8 Max 與 Kimi K3 在同一任務上對決,完全不必分別接兩套 SDK。
TL;DR 結論。Kimi K3 仍然在實證上勝出:一個經過審計的AA Intelligence Index 57.1(第3名),LMArena frontend-code 排名第一(1679),以及真正可用的開放權重。Qwen3.8-Max 仍未獲得任何獨立評估機構的評分。但 GA 給了 Qwen 兩項實際優勢。在價格上,它現在大幅更便宜—$2/$6 對比 $3/$15,意味著輸出成本降低 2.5×。而在唯一現存的第三方直接對比測試中,Qwen 在頭條分數上以 80 對 83 落敗,但卻是明顯行為更佳的智能體:354 次 repo 引用對 274 次、22 次 gateway 請求對 53 次,以及 0 次失敗工具呼叫對 2 次。Kimi 勝在經過審計的品質;Qwen 勝在更便宜、更乾淨的智能體執行。
重點摘要
• Kimi K3 是更大的模型——相比 Qwen 的 2.4T,其 MoE 為 2.8T,大約多出 400B——這有力地反駁了將參數量視為能力代理指標的觀點。
• Qwen3.8-Max 自 2026 年 8 月 3 日起正式發布(GA),價格為$2 / $6 每百萬 tokens 的統一費率,而 Kimi K3 的 $3 / $15(AA 混合約 $2.31)。Qwen 現在 輸出便宜 2.5 倍。
• Kimi K3 的經審計成績為:AA Intelligence Index 57.1(#3),僅次於 Fable 5 和 GPT-5.6 Sol,再加上 LMArena 前端程式碼 #1(1679)。Qwen3.8-Max 仍然未評分。
• 在唯一的直接測試(Trilogy AI)中,Kimi 以 83 比 80 險勝 Qwen,整體而言—但 Qwen 有更多 repo 引用(354 對 274)、更少閘道請求(22 對 53),以及有零失敗工具呼叫(對比兩次),工具使用評分為 9/10,而 Kimi 為 8/10。
• Qwen 現在公佈了智能體(agentic)與編碼(coding)的數據:Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、FrontierSWE 73.5(相較於前代的 40.7)——皆為阿里巴巴所公佈。
• 就開放時機而言,Kimi 仍佔優勢:其權重基本上已準備就緒;Qwen 的權重則承諾在本週內釋出,但目前尚未提供授權或儲存庫。
準確性說明:所有 Qwen3.8-Max 的品質數據均由阿里巴巴自行公布,未經第三方驗證。Kimi K3 的數據來自 Artificial Analysis 和 LMArena。此次直接比較為 Trilogy AI 的單次測試,應僅視為單一數據點,而非整體排名。Qwen 的定價以 GA 費率表為準,取代 7 月的預覽版折扣。
規格與價格,並列呈現
以下是確切的數據,每一項數字皆註明其來源。
• 製造商/狀態 — Qwen3.8-Max:Alibaba;GA(2026年8月3日);Kimi K3:Moonshot;開放權重釋出
• 架構 — Qwen3.8-Max:總計約 2.4T,稀疏 MoE(活躍參數仍未公開);Kimi K3:2.8T MoE,原生視覺(Artificial Analysis)
• 上下文視窗 — Qwen3.8-Max:1M tokens(啟用思考模式時為 983,616;最大輸出 131,072);Kimi K3:1M tokens(Artificial Analysis)
• AA 智能指數 — Qwen3.8-Max:尚未評分;Kimi K3:57.1 — #3(Artificial Analysis)
• 競技場 / 排行榜 — Qwen3.8-Max:尚未公開評分;Kimi K3:前端程式碼 #1,1679(LMArena)
• 供應商回報的分數 — Qwen3.8-Max: Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、OSWorld-Verified 86.1(阿里巴巴回報);Kimi K3:排名為第三方測量
• 定價(輸入 / 輸出)— Qwen3.8-Max:$2.00 / $6.00 每 1M,固定;快取輸入 $0.25;Kimi K3:$3 / $15 每 1M(AA 混合約 $2.31),快取命中 $0.30
• 開放權重 — Qwen3.8-Max:承諾本週內釋出(尚無授權);Kimi K3:開放權重;權重已就緒
• 速度 — Qwen3.8-Max:p50 TTFT 1.64 秒(OrcaRouter 7 天遙測);Kimi K3:冗長且緩慢(約 34 秒 TTFT,根據 AA)
這個比較由兩件事所框定,其中一件在8月3日完全逆轉。
首先,價格關係反轉了。整個七月期間,Kimi K3 是採用實際價格的模型,而 Qwen 是採用折扣券的模型。現在兩者都公布了費率,而經更充分驗證、規模更大的模型反而定價較高:$3 / $15 對比 $2 / $6。在輸出方面——推理和程式碼生成最花錢的地方——Kimi 的費用是 Qwen 的 2.5 倍。Qwen 也對整個 1M token 上下文收取固定費率,其快取輸入 $0.25 略低於 Kimi 的 $0.30 快取命中費率。對任何高流量工作負載而言,Qwen 的成本效益現在明顯更佳。
第二,證明差距沒有改變,而這就是Kimi仍然勝出的原因。Kimi K3 的 57.1 智慧指數讓它整體排名第三,僅次於 Fable 5 和 GPT-5.6 Sol——這是中立評估者的判斷。它的 LMArena frontend-code 以 1679 分排名第一,是許多盲測比較的群眾外包結果。Qwen 的 Terminal-Bench 86.6 和 GPQA Diamond 92.6 是真實數字,但那是阿里巴巴自家跑出來的,使用的是沒有其他人跑過的測試框架。一個有用的錨點:前代 Qwen3.7-Max 得到 46,在 AA 指數上與 Kimi 的 57.1 相比,Qwen 需要一次巨大的世代躍升才能勉強打平。
還有一個值得注意的延遲問題,因為它與通常的說法相悖。Artificial Analysis 測得 Kimi K3 約為34 秒的首次 Token 生成時間——確實很慢。OrcaRouter 的 GA 遙測數據顯示,Qwen3.8-Max 的 p50 TTFT 為1.64 秒。這些測量結果來自不同來源,並非受控對比,但它們讓預覽時代「Qwen 是兩者中較慢的一個」的假設變得複雜。

唯一的正面對決測試,請仔細閱讀
這是該系列中唯一一場由第三方在相同任務上讓兩個模型相互對決的比賽,因此值得仔細閱讀,而不是簡單地總結出一個贏家。
Trilogy AI 執行了一項架構理解任務 —— 理解一個真實的程式碼庫並得出正確的架構結論 —— 並對結果進行了評分:
• 整體評分 — Qwen3.8-Max:80 / 100;Kimi K3:83 / 100
• 儲存庫引用 — Qwen3.8-Max:354;Kimi K3:274
• 閘道請求 — Qwen3.8-Max: 22;Kimi K3: 53
• 工具調用失敗 — Qwen3.8-Max: 0;Kimi K3: 2
• 工具使用評分 — Qwen3.8-Max:9 / 10;Kimi K3:8 / 10
• 快取命中率 — Qwen3.8-Max: >90%;Kimi K3: >90%
Kimi 以三分之差贏得頭條。但請看看流程欄位,因為對代理式工程而言,這些比分數更重要。Qwen 達成了相同的核心架構結論,使用不到一半的閘道請求,同時產出多出 29% 的接地引用,而且——這個細節應該會讓所有建構代理的人感興趣——工具呼叫零失敗,而 Kimi 則有兩次失敗。
失敗的工具呼叫才是真正會搞垮生產環境代理的東西。它們會產生連鎖反應:一個格式錯誤的呼叫會產生模型必須解讀的錯誤,這會消耗回合數,進而增加進一步出錯的風險。一個能發出 22 次乾淨請求的模型,相較於另一個發出 53 次請求卻發生兩次失敗的模型,營運起來更便宜、也更可預測,即使前者的答案分數低了三分。再加上 Qwen 的輸出費率便宜 2.5 倍,那次的營運經濟效益明顯更有利於 Qwen。
需要注意的是,這只是一個任務、一個評估者、一次運行。它不是一個基準測試套件,也不具泛化性。Kimi 的 57.1 指數和 #1 前端排名所依據的證據遠多於這單一測試。正確的結論很狹窄:至少在一個真實的智能體任務中,Qwen 是更有紀律的工具使用者,但在輸出品質上略遜一籌。

實際成本:代理型運行需要規模化
以一個儲存庫分析代理為例:每次運行可處理 250,000 個 token 的程式碼上下文,並輸出 12,000 個 token。
• Qwen3.8-Max:0.25M × $2 = $0.50,加上 0.012M × $6 = $0.072。每次運行 ≈ $0.57。
• Kimi K3: 0.25M × $3 = $0.75,加上 0.012M × $15 = $0.18。 ≈ $0.93 每次運行。
• 在每天1,500次執行時:Qwen ≈ $858/天;Kimi ≈ $1,395/天 — 大約每月相差 $16,000。
• 在穩定儲存庫上使用快取:Qwen 的快取輸入價格為 $0.25/1M,使運行成本降至 ≈ $0.14;Kimi 的 $0.30 快取命中率使其降至 ≈ $0.26。
兩端的差距都是真實的,而 Trilogy 的結果更加劇了這點:如果 Qwen 確實只需不到一半的閘道請求就能完成同等工作,那麼在代理型任務上的實際成本差異,比單看費率表所暗示的還要更大。
兩種模型都將思考 token 計為輸出,因此無論哪一方,推理密集型配置的成本都高於粗略估計——但 Qwen 的 $6 費率使該額外成本縮小 2.5 倍。
開放性:近乎對等,時機不同
這是兩者最為相似的層面,差異純粹在於就緒程度。Kimi K3 的權重已開放且基本上已可隨時使用。Qwen3.8-Max 的權重承諾在一週內發布,但目前尚無授權條款、模型卡或儲存庫——而授權條款正是決定你是否能將模型用於商業用途的關鍵。
實際上,這兩款旗艦模型都不是普通團隊能夠自行託管的。Qwen 的 2.4T 參數在 4-bit 量化下約需 1.2TB 記憶體,而每張 H200 僅有約 141GB;Kimi 的 2.8T 參數則更大。兩者都需要八張或以上的頂級加速器,而且阿里巴巴未公開的活化參數數量,意味著你甚至無法估算 Qwen 的吞吐量。
這就是為什麼同時發布的Qwen3.8-27B在這裡意義重大。同樣採用開放權重,且據報導僅需約17GB 的 VRAM即可運行,這為 Qwen 家族提供了真正的本地部署優勢,這是 2.4T 或 2.8T 旗艦都無法提供的。如果你選擇這兩者的真正理由是開放權重,那麼 27B 比任何一個巨頭都更能改變局面。
常見問題
Qwen 3.8 比 Kimi K3 更好嗎?
並非基於經審計的證據。Kimi K3 擁有獨立的 AA Intelligence Index 57.1(第 3 名),並在 LMArena 的前端程式碼項目中位居第一,而 Qwen3.8-Max 仍未獲得任何第三方評估機構的評分。在現有的唯一一次直接測試中,Kimi 以 83 比 80 獲勝。Qwen 的優勢在於價格(輸出便宜 2.5 倍),以及在同一次測試中更乾淨的工具使用。
哪個模型更大?
Kimi K3 的總參數為 2.8T,而 Qwen3.8-Max 則為 2.4T——大約多了 400B。不過,兩者都沒有公開足夠的資訊讓這個數字具有意義:阿里巴巴從未公布 Qwen 的活躍參數數量,而在混合專家(Mixture-of-Experts)模型中,活躍參數才是真正決定服務成本的因素。
哪個比較便宜?
Qwen3.8-Max,很明顯,自 GA 以來。它的價格為每 1M 個 token $2 / $6,而 Kimi K3 是 $3 / $15——輸入便宜 33%,輸出便宜 2.5 倍。Qwen 的費率在整個 1M 上下文中保持固定,而其快取輸入價格 $0.25 略低於 Kimi 的 $0.30 快取命中費率。
正面交鋒測試實際上顯示了什麼?
Trilogy AI 的架構理解任務中,Kimi 獲得 83 分,Qwen 獲得 80 分。但 Qwen 產出了 354 次 repo 引用(Kimi 為 274 次)、使用了 22 次 gateway 請求(Kimi 為 53 次)、記錄到零次失敗的工具呼叫(Kimi 有兩次),並在工具使用上獲得 9/10(Kimi 為 8/10)。Kimi 給出了更好的答案;Qwen 則是更有紀律的代理。這只是一項任務,因此請將其視為一個資料點,而非排名。
Qwen 3.8 Max 是否已退出預覽?
是的,於2026年8月3日,配有已發布的費率表,以及與OpenAI和DashScope相容的端點。七月的Qoder積分活動不再說明其銷售方式。
哪一個比較快?
現在可能輪到Qwen了,這推翻了預覽時代的假設。Artificial Analysis測得Kimi K3的首Token延遲約為34秒;OrcaRouter的7天GA遙測數據顯示Qwen3.8-Max的p50 TTFT為1.64秒。兩者來源不同,並非受控比較,但這兩個模型都以冗長著稱,而Kimi的實測TTFT確實偏慢。
我可以自行託管其中一個嗎?
在旗艦級規模下並不現實——2.4T 和 2.8T 模型需要八顆以上的 H200 等級 GPU。Kimi 的權重今天即可取得;Qwen 則承諾本週內釋出,但目前尚無授權。若要真正的本地部署方案,同期發布的 Qwen3.8-27B(據稱約需 17GB VRAM)是 Qwen 系列中的務實之選。
重點
Qwen 3.8 對決 Kimi K3是本系列中最勢均力敵的對決,而全面上市後,雙方清楚地在兩個面向上分出高下。Kimi K3 憑藉裁判實際量測的數據穩坐品質寶座:智能指數 57.1 分、整體排名第三,以及 LMArena 前端程式碼類別的榜首。這些不是誇口——而是實打實的結果,而 Qwen 完全沒有同等級的表現。
Qwen 在 8 月 3 日贏得的是經濟性,而且贏得壓倒性:以每百萬個 token 計,$2/$6 對上 $3/$15,價格均一,快取也更便宜。再加上 Trilogy 的發現——Qwen 以一半的閘道請求數和零失敗的工具呼叫完成同等的代理型任務——即便 Qwen 在準確度上較遜色,它仍像是營運上更有效率的模型。接下來留意兩件事:Qwen3.8-Max 的第一個獨立 Intelligence Index 評分,以及權重釋出並附帶授權。若 Qwen 的得分接近 Kimi 的 57.1,價格差距將讓 Kimi 在大量工作上極難被合理化採用。在那之前,Kimi 是你信賴的模型,Qwen 是你跑得起的模型——而誠實的選擇方式,就是拿你自己的儲存庫來實測。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
