
Qwen 3.8 vs Kimi K3: 两大中国开源权重巨头正面交锋
- meta新Meta: Muse Spark 1.12026-07-1651智能71代码
- kimi新MoonshotAI: Kimi K32026-07-1557智能76代码
- openai新OpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openai新OpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openai新OpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grok新xAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56代码59数学
- minimaxMiniMax: MiniMax M32026-05-3144智能59代码59数学
- AnthropicAnthropic: Claude Opus 4.82026-05-2856智能74代码68数学
- GoogleGemini 3.5 Flash2026-05-2350智能70代码51数学
- qwenQwen3.7 Max2026-05-2246智能66代码71数学
- qwenQwen3.7 Max (2026-05-20)2026-05-2046智能66代码73数学
在所有与Qwen 3.8 Max比较的模型中,Kimi K3,来自Moonshot,是最自然的对手:两者都是巨大的中国混合专家模型,都是开放权重级别,都以啰嗦、详尽和缓慢著称。实际上,它们是中国开放权重世界的两个最大巨头——而且不同寻常的是,我们不需要猜测它们之间的对比,因为有人让它们在同一个任务上互相对抗。这使得它成为本系列中最丰富的比较:不是供应商声明与审计数字的对比,而是真正的正面交锋。
在详细说明之前,给构建者一个小提示——要解决如此接近的竞争,诚实的方法是让两者都在你自己的工作负载上运行,观察全面性和速度之间的权衡。OrcaRouter 在一个兼容 OpenAI 的端点后面提供了 200 多个模型,因此你可以让Qwen 3.8与Kimi K3在相同提示下进行对比,而无需连接两个SDK。
概括性结论。在我们进行的唯一直接对比(Trilogy AI 的架构理解任务)中,Kimi K3 得到 83/100,Qwen 3.8 Max 得到 80/100——Kimi 以微弱 3 分领先。但 Qwen 更加*全面*:引用仓库数 354 对 274,网关请求 22 对 53,工具调用失败 0 对 2,代价是更高的延迟和更多 token。两者都达到了 90% 的缓存命中率,并得出了相同的核心架构决策。如今,Kimi K3 是更安全的开放权重选择——它有一个经过审计的分数(57.1,在 Artificial Analysis 上排名第 3),拥有 Arena 前端王冠,且权重基本已可用。Qwen 3.8 则值得关注:野心更大,探索更彻底,但在公开榜单上尚无评分,权重仅“即将推出”。
关键要点
• Qwen 3.8 Max是一个2.4T参数的MoE预览;Kimi K3是一个2.8T的MoE具有1M上下文和原生视觉——意味着Qwen大约少了400B参数,这提醒我们更大的参数数量并不等于更好。
• 在唯一的一次直接测试中(Trilogy AI),Kimi K3以80比83险胜Qwen总体而言——但Qwen获得了更多的仓库引用(354对274),更少的网关请求(22对53),并且有零次失败的工具调用(对比两次)。
• Kimi K3 拥有一个经过审计的 AA 智能指数为 57.1(排名第三)——落后于 Fable 5 和 GPT-5.6 Sol,领先于其他所有模型。Qwen 3.8 拥有没有任何独立的基准测试。
• Kimi K3 还保持着 LMArena frontend-code #1 位置(1679); Qwen 3.8 尚未在公开排行榜上获得评分。
• 开源程度接近,但发布时间不同:Kimi K3的权重已开放或承诺提供,且基本就绪;Qwen 3.8的权重“即将推出”,尚无具体日期、许可证或仓库。
Qwen 3.8 的数据是供应商声称或早期未受控的亲身试用印象 — 未经独立审计。Kimi K3 的指数和价格数据归因于 Artificial Analysis,可能与 Moonshot 自己的报告不同。Trilogy AI 的正面比较是单个任务,不是完整的基准测试套件。Qwen 3.8 的预览定价是临时折扣;在预算前请核实费率。
规格与价格,并列对比
以下是硬数据,每个竞争对手的数据都标注了来源。
• 制造商/状态 — Qwen 3.8 Max:阿里巴巴;预览(2026年7月19日);Kimi K3:Moonshot;开放权重发布
• 架构 — Qwen 3.8 Max: 约2.4T总参数,稀疏MoE(活跃参数未公开);Kimi K3: 2.8T MoE,原生视觉(来源:Artificial Analysis)
• 上下文窗口 — Qwen 3.8 Max: 据报道约1M tokens (未经正式确认); Kimi K3: 1M tokens (来源:Artificial Analysis)
• AA Intelligence Index — Qwen 3.8 Max:尚无数据 — 未评分;Kimi K3:57.1 — 排名第3(Artificial Analysis)
• Arena / leaderboard — Qwen 3.8 Max: 未公开评分; Kimi K3: Frontend-code #1, 1679 (LMArena)
• 价格(输入/输出)—— Qwen 3.8 Max:仅预览(约优惠90%;每token API未公布);Kimi K3:$3 / $15每100万(AA混合约$2.31)
• 开放权重 — Qwen 3.8 Max: 承诺“很快”(尚未发布);Kimi K3: 开放权重;权重已就绪/接近
• 速度 — Qwen 3.8 Max: 测试中最慢的模型(实际体验);Kimi K3:冗长且慢(约34秒TTFT,据AA)
两件事构成了整个比较的背景。首先,Qwen 3.8 在"AA Intelligence Index"中的空白单元格就是关键:Kimi K3 的 57.1 分是中立裁判的裁定,使其位列全球第三,仅次于 Fable 5 和 GPT-5.6 Sol;Qwen 3.8 的地位则依赖于供应商的宣传和少数亲手试用的结果。其次,注意规模的反转——Qwen 3.8(2.4T)实际上大约少 400B 个参数比 Kimi K3(2.8T)。阿里巴巴的模型被描述为"野心更大",但在原始参数数量上,Kimi 才是更大的巨人,并且它拥有经过审计的分数作为支撑。两者都以冗长和缓慢著称,因此延迟方面不相上下;真正的区分在于验证和权重可用性,而目前这两点都有利于 Kimi。

我们唯一一次真正的正面交锋
这是一场罕见的对决,我们无需推断。Trilogy AI 让两个模型完成了一项单一的架构理解任务——阅读并推理一个真实的代码库——并发布了并列结果。Kimi K3 在标题分数上胜出,但底层行为却讲述了一个更有趣的故事。
• 总体评分 — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100
• 仓库引用次数 — Qwen 3.8 Max:354;Kimi K3:274
• 网关请求 — Qwen 3.8 Max: 22; Kimi K3: 53
• 失败的工具调用 — Qwen 3.8 Max: 0; Kimi K3: 2
• 工具使用评分 — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10
• 缓存命中率 — Qwen 3.8 Max:>90%;Kimi K3:>90%
不要只看最上面一行,要阅读各列。Kimi K3以3分优势获胜,但Qwen 3.8是更细致的工作者:它引用了仓库中多出80处引用(354对比274),得出结论用时远更少的网关请求(22对比53),出现了零次失败工具调用,而Kimi有两次,并在工具使用评分上略胜Kimi(9对8)。这种权衡完全符合Qwen在其他方面的特点——它会彻底探索,这导致更高的延迟和更多的总令牌数。关键的是,两个模型得出了相同的核心架构决策,所以这并非一个正确一个错误;而是Kimi更快地得到了评分稍高的答案,而Qwen以更多证据和更干净的工具纪律达到了目标。如果你的工作看重详尽、有充分引用的探索,Qwen的形象很有吸引力;如果你想要一个经过验证、更快得到答案的选择,Kimi赢得了这一轮。

常见问题
Qwen 3.8 比 Kimi K3 更好吗?
据现有证据来看,并非如此。在一场直接对决(Trilogy AI)中,Kimi K3 得分 83/100,高于 Qwen 的 80/100,且 Kimi 拥有经审核的人工智能分析指数 57.1(排名第三)以及 Arena 前端代码桂冠,而 Qwen 3.8 根本没有独立评分。Qwen 的优势在于全面性——更多仓库引用(354 对 274)、更少网关请求、零工具调用失败——但这只是风格优势,并非已被证实的领先能力。
Qwen 3.8 更大——这会让它更好吗?
不,实际上在规模上恰恰相反:Qwen 3.8 参数约为 2.4T,而 Kimi K3 约为 2.8T,因此 Kimi 是两者中较大的一个,大约多出 400B。参数数量更大并不一定更好——Kimi 既更大又得分更高,这清楚地提醒我们,架构、训练和调优比原始参数总量更重要。
定价比较如何?
Kimi K3 是一个已发布、持久的$3 / $15每百万token(Artificial Analysis 将其混合后约为$2.31)。Qwen 3.8 的预览版大幅打折(约90% off)但没有公布每token的API价格,且折扣是暂时的,因此目前无法进行稳定的价格比较。按今天的预算,Kimi 是拥有真实价格的那个。
哪个是更好的开放权重选择?
两者都属于开放权重类别,但时间点不同。Kimi K3 的权重已经开放且基本就绪;而 Qwen 3.8 的权重承诺"即将推出",但未公布具体日期、许可证或代码库。如果开放权重是你选择的关键因素,那么 Kimi 是现在就能入手的选择。
我今天应该用哪一个?
Kimi K3 是更安全的默认选择——它已获得评分 (#3),权重文件已就绪,并且在直接对比中胜出。当你更看重详尽且引用充分的探索、清晰的工具使用,而非速度时,可以选择 Qwen 3.8,并将其视为一个值得关注的选项——等待其权重文件发布以及独立的评分结果。
底线
Qwen 3.8 对比 Kimi K3是本系列中最接近于公平较量的一次对决:两个中国开源权重巨头,同样话多、同样全面、同样缓慢。Kimi K3 今天赢得了这一轮,因为它赢得了决定采用的关键因素——经过审计的第3名排名、Arena 前端桂冠、公开的价格以及准备就绪的权重——并且在唯一一次真正直接对比中以 83 比 80 小胜 Qwen。但那次直接对比也揭示了为什么 Qwen 3.8 值得关注:它是更细致入微的模型,引用了更多代码库,使用了更少的请求,并且零次工具调用失败。如果你的工作奖励穷尽式探索,并且如果阿里巴巴发布了权重且独立得分接近榜首,那么这场竞争可能会逆转。在那之前,Kimi K3 是更安全的开源权重选择,而 Qwen 3.8 则是需要你用自己的提示去测试的挑战者。

