
Qwen 3.8 對比 Kimi K3:兩大中國開源權重巨頭正面交鋒
- meta新Meta: Muse Spark 1.12026-07-1651智能71程式
- kimi新MoonshotAI: Kimi K32026-07-1557智能76程式
- openai新OpenAI: GPT-5.6 Luna2026-07-0951智能71程式
- openai新OpenAI: GPT-5.6 Terra2026-07-0955智能77程式
- openai新OpenAI: GPT-5.6 Sol2026-07-0959智能77程式
- grok新xAI: Grok 4.52026-07-0854智能72程式
- tencentTencent: Hy32026-07-0641智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1651智能69程式60數學
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61程式61數學
- anthropicAnthropic: Claude Fable 52026-06-0960智能77程式
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56程式59數學
- minimaxMiniMax: MiniMax M32026-05-3144智能59程式59數學
- AnthropicAnthropic: Claude Opus 4.82026-05-2856智能74程式68數學
- GoogleGemini 3.5 Flash2026-05-2350智能70程式51數學
- qwenQwen3.7 Max2026-05-2246智能66程式71數學
- qwenQwen3.7 Max (2026-05-20)2026-05-2046智能66程式73數學
在所有與Qwen 3.8 Max比較的模型中,Kimi K3來自Moonshot,是最自然的對手:兩者都是巨大的中國混合專家模型、都屬於開放權重類別、都以出了名的冗長、詳盡且緩慢著稱。它們實際上就是中國開放權重領域的兩大巨頭——而且不尋常的是,我們無需猜測它們的實力對比,因為有人讓它們在同一項任務上互相較量。這使得本次比較成為系列中最豐富的一次:不是廠商宣稱與審計數字之爭,而是貨真價實的正面對決。
在詳細說明之前,給建置者一個提示——要解決如此接近的競爭,最誠實的方式是使用自己的工作負載來運行兩者,並觀察全面性與速度之間的權衡。OrcaRouter 提供 200 多個模型,背後由一個相容 OpenAI 的端點支持,因此您可以將 Qwen 3.8與 Kimi K3 進行比較,使用相同的提示,無需配置兩個 SDK。
TL;DR 結論。在我們擁有的唯一一場直接對決中(Trilogy AI,一項架構理解任務),Kimi K3 得分 83/100,Qwen 3.8 Max 得分 80/100——Kimi 以微弱 3 分之差領先。但 Qwen 是更 *詳盡* 的那一個:354 次程式庫引用 vs 274,22 次閘道請求 vs 53,以及零次工具呼叫失敗 vs 兩次,但代價是較高的延遲和更多 tokens。兩者都達到了 90% 的快取命中率,並做出了相同的核心架構決策。如今,Kimi K3 是更安全的開放權重選擇——它有經審計的分數(57.1,#3 on Artificial Analysis)、Arena 前端桂冠,以及基本上已可取得的權重。Qwen 3.8 則是值得關注的對象:野心更大,探索更全面,但在公開排行榜上無分數,權重僅「即將推出」。
關鍵要點
• Qwen 3.8 Max是一個2.4T-parameter MoE預覽版;Kimi K3是一個2.8T MoE,具有1M上下文和原生視覺——意味著Qwen大致少了400B參數,這提醒我們更大的參數數量並不代表更好。
• 在唯一直接测试(Trilogy AI)中,Kimi K3 以 80 比 83 险胜 Qwen總體而言——但 Qwen 做出了更多倉庫引用(354 對 274),更少的網關請求(22 對 53),零次失敗的工具呼叫(對比兩次)。
• Kimi K3 有一個 經過審計的 AA Intelligence Index 為 57.1(#3) —— 落後於 Fable 5 和 GPT-5.6 Sol,領先於其他所有模型。 Qwen 3.8 有 完全沒有任何獨立的基準測試。
• Kimi K3 也佔據了LMArena frontend-code 第1名位置 (1679);Qwen 3.8 尚未在公開排行榜上獲得評分。
• 開放程度接近但時機不同:Kimi K3的權重已公開/承諾且基本上準備就緒;Qwen 3.8的權重「即將推出」,但尚無日期、授權或儲存庫。
Qwen 3.8 的數據是廠商宣稱或早期未經控制的上手印象 — 未經獨立審計。Kimi K3 的指數和價格數據歸屬於 Artificial Analysis,可能與 Moonshot 自身的報告有所不同。Trilogy AI 的對比測試是單一任務,而非完整的基準測試套件。Qwen 3.8 的預覽定價是臨時折扣;請在預算規劃前確認費率。
規格與價格,並列呈現
以下是確鑿的數據,每個競爭對手的數字均附有來源。
• 製造商 / 狀態 — Qwen 3.8 Max: Alibaba; 預覽(2026年7月19日);Kimi K3: Moonshot;開放權重發布
• 架构 — Qwen 3.8 Max: 约2.4T总量,稀疏MoE(活跃参数未公开);Kimi K3: 2.8T MoE,原生视觉(来源:Artificial Analysis)
• 上下文窗口 — Qwen 3.8 Max:報導約 100 萬 token(未正式確認);Kimi K3:100 萬個 token(來源:Artificial Analysis)
• AA Intelligence Index — Qwen 3.8 Max: 尚无 — 未评分; Kimi K3: 57.1 — #3 (Artificial Analysis)
• 競技場 / 排行榜 — Qwen 3.8 Max: 未公開評分;Kimi K3: 前端代碼 #1, 1679 (LMArena)
• 定价(输入/输出)— Qwen 3.8 Max:仅预览(约90%折扣;每token API未公布);Kimi K3:$3 / $15每1M(AA混合约$2.31)
• 開源權重 — Qwen 3.8 Max:承諾「即將推出」(尚未發布);Kimi K3:開源權重;權重已就緒/接近
• 速度 — Qwen 3.8 Max:測試中最慢的模型 (實測);Kimi K3:冗長且緩慢(約34秒 TTFT,根據AA)
有兩件事構成了整個比較。首先,Qwen 3.8 的「AA Intelligence Index」空格就是故事的重點:Kimi K3 的 57.1 分是中立的裁判判決,使其排名世界第三,僅次於 Fable 5 和 GPT-5.6 Sol;Qwen 3.8 的地位則取決於供應商的框架和少數的實機測試。其次,注意大小的反轉——Qwen 3.8(2.4T)實際上小了約 400B 個參數,與 Kimi K3(2.8T)相比。阿里的模型被人形容為「野心更大」,但從原始參數數量來看,Kimi 才是更大的巨人,而且它擁有經審計的分數作為後盾。兩者都以冗長和緩慢聞名,所以延遲方面打成平手;真正的區別在於證據和權重可用性,而今天這兩點都對 Kimi 有利。

我們唯一真正的正面交鋒
這是一場罕見的對決,我們無需推測。Trilogy AI 在單一架構理解任務(閱讀並推理真實程式碼庫)上運行了兩個模型,並公布了並排比較結果。Kimi K3 在頭條分數上勝出,但底層行為卻講述了一個更有趣的故事。
• 總體得分 — Qwen 3.8 Max:80 / 100;Kimi K3:83 / 100
• 倉庫引用 — Qwen 3.8 Max:354;Kimi K3:274
• 网关请求 — Qwen 3.8 Max: 22; Kimi K3: 53
• 工具調用失敗 — Qwen 3.8 Max: 0; Kimi K3: 2
• 工具使用評分 — Qwen 3.8 Max: 9 / 10;Kimi K3: 8 / 10
• 快取命中率 — Qwen 3.8 Max: >90%; Kimi K3: >90%
閱讀各欄,而不僅僅是第一行。Kimi K3 以三分之差獲勝,但 Qwen 3.8 是更細心的工作者:它引用了儲存庫中多 80 個位置(354 比 274),以更少的網關請求(22 次對 53 次),提出了零次失敗的工具調用,而 Kimi 有兩次,並在工具使用評分上略勝 Kimi(9 比 8)。這種取捨完全符合 Qwen 在其他方面的特性——它會窮盡探索,這導致更高的延遲和更多總 token。關鍵是,兩個模型都達成了相同的核心架構決策,所以這不是一個對一個錯;而是 Kimi 更快地得到了評分稍高的答案,而 Qwen 以更多證據和更清晰的工具紀律到達那裡。如果你的工作獎勵詳盡、引用充分的探索,Qwen 的形象很有吸引力;如果你想要經過驗證、更快得到答案的選項,Kimi 贏得了這一輪。

常見問題
Qwen 3.8 比 Kimi K3 更好嗎?
根據現有的證據,並非如此。在一次直接的正面對決(Trilogy AI)中,Kimi K3 以 83/100 分勝過 Qwen 的 80/100 分,而 Kimi 擁有經審計的 Artificial Analysis Index 57.1(排名第3),再加上 Arena 前端程式碼桂冠,而 Qwen 3.8 則完全沒有任何獨立評分。Qwen 的優勢在於全面性——更多的程式碼引用(354 對 274)、更少的閘道請求,以及零次失敗的工具呼叫——但這只是風格上的優勢,而非經證實的能力領先。
Qwen 3.8 更大——這是否代表它更好?
不,實際上在大小上是相反的:Qwen 3.8 有大約 2.4T 參數,而 Kimi K3 有大約 2.8T 參數,所以 Kimi 比另一個大約大 400B。更大的參數量並不代表更好——Kimi 既更大又得分更高,這清楚地提醒我們,架構、訓練和調校比原始參數總數更重要。
價格比較如何?
Kimi K3 是一款已發佈且耐用的$3 / $15每100萬個token(Artificial Analysis將其混合至約2.31美元)。Qwen 3.8的預覽版大幅折扣(約90% off),但沒有已發佈的每token API價格,且折扣是暫時的,因此目前無法進行穩定的價格比較。就目前的預算而言,Kimi是唯一有實際數字可參考的。
哪個是更好的開放權重選擇?
兩者都是開源權重等級,但時間點不同。Kimi K3 的權重已開放且基本就緒;Qwen 3.8 的權重則承諾「即將推出」,但未公布日期、授權或儲存庫。如果開放權重是你選擇的原因,Kimi 是現在就能實際採用的選擇。
我今天該用哪一個?
Kimi K3 是更安全的預設選擇——它已獲得評分(第3名),權重已準備好,並且在直接對決中勝出。若您重視詳盡、引用充分的探索以及乾淨的工具使用勝於速度,請選擇 Qwen 3.8;並將其視為值得關注的對象,等待其權重發布及獨立評分到來。
底線
Qwen 3.8 vs Kimi K3是這個系列中最接近公平對決的場次:兩家中國開放權重巨頭,同樣話多、同樣詳盡、同樣緩慢。Kimi K3 今日勝出,因為它贏得了決定採用的因素——經審計的第3名排名、Arena 前端桂冠、公布的價格,以及已就緒的權重——而且在唯一一次直接對決中以80比83略勝 Qwen。但那次直接對決也顯示了為何 Qwen 3.8 值得關注:它是更嚴謹的模型,引用更多程式碼庫,使用更少請求,並且零次失敗的工具呼叫。如果你的工作獎勵詳盡探索,而且阿里巴巴發布權重後獨立評分名列前茅,這場競爭可能翻轉。在那之前,Kimi K3 是更安全的開放權重選擇,而 Qwen 3.8 則是值得用你自己的提示來測試的挑戰者。

