Qwen 3.8 vs Kimi K3: 两大中国开源权重巨头正面交锋
Guides & Insights

Qwen 3.8 vs Kimi K3: 两大中国开源权重巨头正面交锋

作者

jinhao song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在所有与Qwen 3.8 Max比较的模型中,Kimi K3,来自Moonshot,是最自然的对手:两者都是巨大的中国混合专家模型,都是开放权重级别,都以啰嗦、详尽和缓慢著称。实际上,它们是中国开放权重世界的两个最大巨头——而且不同寻常的是,我们不需要猜测它们之间的对比,因为有人让它们在同一个任务上互相对抗。这使得它成为本系列中最丰富的比较:不是供应商声明与审计数字的对比,而是真正的正面交锋。

在详细说明之前,给构建者一个小提示——要解决如此接近的竞争,诚实的方法是让两者都在你自己的工作负载上运行,观察全面性和速度之间的权衡。OrcaRouter 在一个兼容 OpenAI 的端点后面提供了 200 多个模型,因此你可以让Qwen 3.8与Kimi K3在相同提示下进行对比,而无需连接两个SDK。

概括性结论。在我们进行的唯一直接对比(Trilogy AI 的架构理解任务)中,Kimi K3 得到 83/100,Qwen 3.8 Max 得到 80/100——Kimi 以微弱 3 分领先。但 Qwen 更加*全面*:引用仓库数 354 对 274,网关请求 22 对 53,工具调用失败 0 对 2,代价是更高的延迟和更多 token。两者都达到了 90% 的缓存命中率,并得出了相同的核心架构决策。如今,Kimi K3 是更安全的开放权重选择——它有一个经过审计的分数(57.1,在 Artificial Analysis 上排名第 3),拥有 Arena 前端王冠,且权重基本已可用。Qwen 3.8 则值得关注:野心更大,探索更彻底,但在公开榜单上尚无评分,权重仅“即将推出”。

关键要点

Qwen 3.8 Max是一个2.4T参数的MoE预览;Kimi K3是一个2.8T的MoE具有1M上下文和原生视觉——意味着Qwen大约少了400B参数,这提醒我们更大的参数数量并不等于更好。

• 在唯一的一次直接测试中(Trilogy AI),Kimi K3以80比83险胜Qwen总体而言——但Qwen获得了更多的仓库引用(354对274)更少的网关请求(22对53),并且有零次失败的工具调用(对比两次)

• Kimi K3 拥有一个经过审计的 AA 智能指数为 57.1(排名第三)——落后于 Fable 5 和 GPT-5.6 Sol,领先于其他所有模型。Qwen 3.8 拥有没有任何独立的基准测试

• Kimi K3 还保持着 LMArena frontend-code #1 位置(1679); Qwen 3.8 尚未在公开排行榜上获得评分。

• 开源程度接近,但发布时间不同:Kimi K3的权重已开放或承诺提供,且基本就绪;Qwen 3.8的权重“即将推出”,尚无具体日期、许可证或仓库。

Qwen 3.8 的数据是供应商声称或早期未受控的亲身试用印象 — 未经独立审计。Kimi K3 的指数和价格数据归因于 Artificial Analysis,可能与 Moonshot 自己的报告不同。Trilogy AI 的正面比较是单个任务,不是完整的基准测试套件。Qwen 3.8 的预览定价是临时折扣;在预算前请核实费率。

规格与价格,并列对比

以下是硬数据,每个竞争对手的数据都标注了来源。

• 制造商/状态 — Qwen 3.8 Max:阿里巴巴;预览(2026年7月19日);Kimi K3:Moonshot;开放权重发布

• 架构 — Qwen 3.8 Max: 约2.4T总参数,稀疏MoE(活跃参数未公开);Kimi K3: 2.8T MoE,原生视觉(来源:Artificial Analysis)

• 上下文窗口 — Qwen 3.8 Max: 据报道约1M tokens (未经正式确认); Kimi K3: 1M tokens (来源:Artificial Analysis)

• AA Intelligence Index — Qwen 3.8 Max:尚无数据 — 未评分;Kimi K3:57.1 — 排名第3(Artificial Analysis)

• Arena / leaderboard — Qwen 3.8 Max: 未公开评分; Kimi K3: Frontend-code #1, 1679 (LMArena)

• 价格(输入/输出)—— Qwen 3.8 Max:仅预览(约优惠90%;每token API未公布);Kimi K3:$3 / $15每100万(AA混合约$2.31)

• 开放权重 — Qwen 3.8 Max: 承诺“很快”(尚未发布);Kimi K3: 开放权重;权重已就绪/接近

• 速度 — Qwen 3.8 Max: 测试中最慢的模型(实际体验);Kimi K3:冗长且慢(约34秒TTFT,据AA)

两件事构成了整个比较的背景。首先,Qwen 3.8 在"AA Intelligence Index"中的空白单元格就是关键:Kimi K3 的 57.1 分是中立裁判的裁定,使其位列全球第三,仅次于 Fable 5 和 GPT-5.6 Sol;Qwen 3.8 的地位则依赖于供应商的宣传和少数亲手试用的结果。其次,注意规模的反转——Qwen 3.8(2.4T)实际上大约少 400B 个参数比 Kimi K3(2.8T)。阿里巴巴的模型被描述为"野心更大",但在原始参数数量上,Kimi 才是更大的巨人,并且它拥有经过审计的分数作为支撑。两者都以冗长和缓慢著称,因此延迟方面不相上下;真正的区分在于验证和权重可用性,而目前这两点都有利于 Kimi。

我们唯一一次真正的正面交锋

这是一场罕见的对决,我们无需推断。Trilogy AI 让两个模型完成了一项单一的架构理解任务——阅读并推理一个真实的代码库——并发布了并列结果。Kimi K3 在标题分数上胜出,但底层行为却讲述了一个更有趣的故事。

• 总体评分 — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100

• 仓库引用次数 — Qwen 3.8 Max:354;Kimi K3:274

• 网关请求 — Qwen 3.8 Max: 22; Kimi K3: 53

• 失败的工具调用 — Qwen 3.8 Max: 0; Kimi K3: 2

• 工具使用评分 — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10

• 缓存命中率 — Qwen 3.8 Max:>90%;Kimi K3:>90%

不要只看最上面一行,要阅读各列。Kimi K3以3分优势获胜,但Qwen 3.8是更细致的工作者:它引用了仓库中多出80处引用(354对比274),得出结论用时远更少的网关请求(22对比53),出现了零次失败工具调用,而Kimi有两次,并在工具使用评分上略胜Kimi(9对8)。这种权衡完全符合Qwen在其他方面的特点——它会彻底探索,这导致更高的延迟和更多的总令牌数。关键的是,两个模型得出了相同的核心架构决策,所以这并非一个正确一个错误;而是Kimi更快地得到了评分稍高的答案,而Qwen以更多证据和更干净的工具纪律达到了目标。如果你的工作看重详尽、有充分引用的探索,Qwen的形象很有吸引力;如果你想要一个经过验证、更快得到答案的选择,Kimi赢得了这一轮。

常见问题

Qwen 3.8 比 Kimi K3 更好吗?

据现有证据来看,并非如此。在一场直接对决(Trilogy AI)中,Kimi K3 得分 83/100,高于 Qwen 的 80/100,且 Kimi 拥有经审核的人工智能分析指数 57.1(排名第三)以及 Arena 前端代码桂冠,而 Qwen 3.8 根本没有独立评分。Qwen 的优势在于全面性——更多仓库引用(354 对 274)、更少网关请求、零工具调用失败——但这只是风格优势,并非已被证实的领先能力。

Qwen 3.8 更大——这会让它更好吗?

不,实际上在规模上恰恰相反:Qwen 3.8 参数约为 2.4T,而 Kimi K3 约为 2.8T,因此 Kimi 是两者中较大的一个,大约多出 400B。参数数量更大并不一定更好——Kimi 既更大又得分更高,这清楚地提醒我们,架构、训练和调优比原始参数总量更重要。

定价比较如何?

Kimi K3 是一个已发布、持久的$3 / $15每百万token(Artificial Analysis 将其混合后约为$2.31)。Qwen 3.8 的预览版大幅打折(约90% off)但没有公布每token的API价格,且折扣是暂时的,因此目前无法进行稳定的价格比较。按今天的预算,Kimi 是拥有真实价格的那个。

哪个是更好的开放权重选择?

两者都属于开放权重类别,但时间点不同。Kimi K3 的权重已经开放且基本就绪;而 Qwen 3.8 的权重承诺"即将推出",但未公布具体日期、许可证或代码库。如果开放权重是你选择的关键因素,那么 Kimi 是现在就能入手的选择。

我今天应该用哪一个?

Kimi K3 是更安全的默认选择——它已获得评分 (#3),权重文件已就绪,并且在直接对比中胜出。当你更看重详尽且引用充分的探索、清晰的工具使用,而非速度时,可以选择 Qwen 3.8,并将其视为一个值得关注的选项——等待其权重文件发布以及独立的评分结果。

底线

Qwen 3.8 对比 Kimi K3是本系列中最接近于公平较量的一次对决:两个中国开源权重巨头,同样话多、同样全面、同样缓慢。Kimi K3 今天赢得了这一轮,因为它赢得了决定采用的关键因素——经过审计的第3名排名、Arena 前端桂冠、公开的价格以及准备就绪的权重——并且在唯一一次真正直接对比中以 83 比 80 小胜 Qwen。但那次直接对比也揭示了为什么 Qwen 3.8 值得关注:它是更细致入微的模型,引用了更多代码库,使用了更少的请求,并且零次工具调用失败。如果你的工作奖励穷尽式探索,并且如果阿里巴巴发布了权重且独立得分接近榜首,那么这场竞争可能会逆转。在那之前,Kimi K3 是更安全的开源权重选择,而 Qwen 3.8 则是需要你用自己的提示去测试的挑战者。


© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube