
Qwen 3.8 vs Kimi K3:两大中国巨头,如今一家更便宜
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这是 2026 年最具影响力的两款中国前沿模型,它们是近亲:都是规模巨大的稀疏混合专家系统,都支持 1M token 的上下文,都是多模态,都承诺开放权重。Kimi K3来自 Moonshot,实际上是那个更大的(两者中),总参数 2.8T,而 Qwen 为 2.4T——这提醒我们,参数数量并不代表排名。
直至2026年8月3日,这一对比在某个特定方面是失衡的:Kimi K3拥有经审计的Artificial Analysis智能指数57.1、LMArena前端代码排名第一、已公布的定价和已发布的权重,而Qwen3.8-Max只有2.4T的噱头,别无其他。GA彻底改变了其中的经济性。Qwen现在的定价为每百万token 2美元/6美元,而Kimi为3美元/15美元——这使得更大、更经过验证的模型反而价格高出不少。
给开发者的一条提示——最快了结这件事的办法,就是用自己的提示词把两者各跑一遍。OrcaRouter 将 200 多个模型统一放在一个兼容 OpenAI 的端点后面,这样你就能在同一个任务上让 Qwen 3.8 Max 与 Kimi K3 正面交锋,而无需接入两套 SDK。
TL;DR 结论。Kimi K3 在实证上仍然胜出:经过审计的AA 智能指数 57.1(第 3 名),LMArena 前端代码榜第一名(1679 分),以及真正可用的开放权重。Qwen3.8-Max 尚未被任何独立评估机构评分。但 GA 给了 Qwen 两项实实在在的优势。在价格上,它现在大幅更便宜——$2 / $6 对比 $3 / $15,这意味着输出成本低 2.5 倍。而在唯一一场已有的第三方正面交锋测试中,Qwen 在主指标上以 80 比 83 落败,但却是明显更守规矩的智能体:354 次仓库引用对 274 次、22 次网关请求对 53 次、0 次失败工具调用对 2 次。Kimi 是经审计品质之选;Qwen 是更便宜、更干净的智能体执行之选。
关键要点
• Kimi K3 是更大的模型——MoE 达 2.8T,对比 Qwen 的 2.4T,大约多出 400B——这很好地说明了不应将参数数量视为能力的代表。
• Qwen3.8-Max 自2026年8月3日起正式发布,定价为$2 / $6每100万token(统一单价),而Kimi K3的$3 / $15(AA混合价约$2.31)。Qwen现在输出便宜2.5倍。
• Kimi K3 的经审计排名为:AA 智能指数 57.1(第 3 名),仅次于 Fable 5 和 GPT-5.6 Sol,外加 LMArena 前端代码第 1 名(1679)。Qwen3.8-Max 仍未评分。
• 在唯一一次直接测试(Trilogy AI)中,Kimi 以 83 比 80 险胜 Qwen,总体而言,但 Qwen 获得了更多的代码库引用(354 对 274)、更少的网关请求(22 对 53),并且工具调用失败次数为零(对比两次),工具使用评分为 9/10,而 Kimi 为 8/10。
• Qwen 现在报告智能体和编码数字:Terminal-Bench 2.1 86.6,OSWorld-Verified 86.1,FrontierSWE 73.5(从前代产品的 40.7 提升而来)——全部由阿里巴巴报告。
• 开放时机上Kimi仍占优:其权重基本就绪;Qwen的权重承诺本周内发布,但尚无许可证或代码仓库。
准确性说明:所有Qwen3.8-Max的质量数据均由阿里巴巴自行报告,未经第三方验证。Kimi K3的数据来自Artificial Analysis和LMArena。直接对比结果是Trilogy AI进行的单次测试,应仅视为一个数据点,而非普遍排名。Qwen的定价采用正式发布(GA)费率表,取代了7月份的预览折扣。
规格与价格,并列对比
以下是硬数据,每项数据均注明其来源。
• 厂商 / 状态 — Qwen3.8-Max:Alibaba;GA(2026年8月3日);Kimi K3:Moonshot;开放权重发布
• 架构 — Qwen3.8-Max:总参数约2.4T,稀疏MoE(活跃参数仍未公开);Kimi K3:2.8T MoE,原生视觉(Artificial Analysis)
• 上下文窗口 — Qwen3.8-Max: 1M tokens(983,616 带思考;最大输出 131,072);Kimi K3: 1M tokens(Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max:尚未评分;Kimi K3:57.1 — #3(Artificial Analysis)
• 竞技场 / 排行榜 — Qwen3.8-Max:未公开评分;Kimi K3:前端代码 #1,1679(LMArena)
• 厂商报告的分数 — Qwen3.8-Max:Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1(阿里巴巴报告);Kimi K3:成绩由第三方测定
• 定价(输入 / 输出)— Qwen3.8-Max:$2.00 / $6.00每 1M,固定;缓存输入$0.25;Kimi K3:$3 / $15每 1M(AA 混合约 $2.31),缓存命中 $0.30
• 开放权重 — Qwen3.8-Max:承诺本周内发布(暂无许可证);Kimi K3:开放权重;权重已就绪
• 速度 — Qwen3.8-Max:p50 TTFT 1.64秒(OrcaRouter 7天遥测);Kimi K3:冗长且慢(约34秒 TTFT,据 AA)
两个因素框定了这次比较,其中之一在8月3日完全逆转。
首先,价格关系发生了逆转。 到七月为止,Kimi K3 是按实价销售的模型,而 Qwen 是带折扣券的模型。现在两者都公布了费率,经过更充分验证的、更大的模型反而更贵:$3 / $15 对比 $2 / $6。在输出方面——推理和代码生成的主要开销所在——Kimi 的费率高 2.5 倍。Qwen 还在其整个 100 万 token 上下文范围内统一收费,其 $0.25 的缓存输入价格略低于 Kimi 的 $0.30 缓存命中费率。对于任何高吞吐量的工作负载,Qwen 的成本效益现在明显更优。
其次,证据差距没有变化,这正是Kimi仍然胜出的原因。Kimi K3的57.1 Intelligence Index使其总体排名第三,仅次于Fable 5和GPT-5.6 Sol——这是中立评测者的结论。其LMArena前端代码以1679分排名第一,是来自大量盲测的众包结果。Qwen的Terminal-Bench 86.6和GPQA Diamond 92.6是真实数字,但属于阿里巴巴自家,且运行在一个没有其他人跑过的测试框架上。一个有用的参照:前代Qwen3.7-Max在AA指数上得46分,而Kimi为57.1,因此Qwen需要一次巨大的代际跃升才能勉强持平。
还有一个值得注意的延迟细节,因为它与通常的说法相悖。Artificial Analysis测得Kimi K3的首字延迟约为34秒——确实很慢。OrcaRouter的GA遥测数据显示,Qwen3.8-Max的p50首字延迟为1.64秒。这些测量结果来自不同来源,并非受控对比,但它们让预览期间“Qwen是两者中较慢的那个”的假设变得复杂起来。

唯一一次正面交锋测试,请仔细阅读
这是本系列中唯一一次由第三方让两个模型在同一任务上相互比拼的较量,因此值得仔细阅读,而不宜草率判定谁胜谁负。
Trilogy AI 执行了一项架构理解任务——理解真实代码仓库并得出正确的架构结论——并对结果进行了评分:
• 总分 — Qwen3.8-Max: 80 / 100;Kimi K3: 83 / 100
• 仓库引用 — Qwen3.8-Max:354;Kimi K3:274
• 网关请求 — Qwen3.8-Max: 22;Kimi K3: 53
• 失败的工具调用 — Qwen3.8-Max: 0; Kimi K3: 2
• 工具使用评分 — Qwen3.8-Max:9 / 10;Kimi K3:8 / 10
• 缓存命中率 — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi以三分优势赢得头条。但看看过程栏,因为对于智能体工程来说,它们比分数更重要。Qwen得出了相同的核心架构结论,使用不到一半的网关请求,同时产生了29%更多的接地引用,以及——这个细节应该会吸引任何构建智能体的人——零次失败的工具调用,而Kimi有两次。
工具调用失败才是真正导致生产环境智能体崩溃的原因。它们会级联放大:一次格式错误的调用会产生一个模型必须解读的错误,这会消耗多轮对话,并可能引发更多错误。一个模型能用22次干净请求完成任务,而另一个模型用53次请求却出现两次失败——前者在运营上更便宜、更可预测,即使它的答案得分低3分。再结合Qwen的输出价格便宜2.5倍,那轮运行的经济账明显更偏向Qwen。
需要注意的是,这只是一项任务、一个评估器、一次运行。它不是基准测试套件,也不能一概而论。Kimi 的 57.1 指数和前端排名第一所依据的证据远不止这一项测试。正确的结论范围很窄:至少在一个现实的智能体任务上,Qwen 是更自律的工具使用者,但在输出质量上略逊一筹。

实际成本:智能体运行量大
以一个仓库分析代理为例:每次运行的代码上下文包含 250,000 个 token,并输出 12,000 个 token。
• Qwen3.8-Max:0.25M × $2 = $0.50,加上 0.012M × $6 = $0.072。≈ 每次运行 $0.57。
• Kimi K3:0.25M × $3 = $0.75,加上 0.012M × $15 = $0.18。≈ $0.93 每次运行。
• 按每天1,500次运行计算:Qwen ≈ $858/天;Kimi ≈ $1,395/天——两者每月相差约$16,000。
• 在稳定仓库上启用缓存时:Qwen 的缓存输入按 $0.25/1M 计算,使运行成本约为 ≈ $0.14;Kimi 的 $0.30 缓存命中费率则使其约为 ≈ $0.26。
差距在两端都是真实存在的,而 Trilogy 的结果进一步放大了这一点:如果 Qwen 确实用不到一半的网关请求就能完成同等工作,那么在智能体任务上的实际成本差异比单纯看价目表所显示的还要大。
两个模型都将思考令牌作为输出计费,因此无论哪一方,推理密集型配置的成本都高于粗略估算——但 Qwen 的 $6 费率使这一额外成本缩小了 2.5 倍。
开放性:近乎持平,时机不同
这是两者最相似的一个轴,差异纯粹在于就绪程度。Kimi K3 的权重是开放的,基本上已经就绪。Qwen3.8-Max 承诺本周内发布,但目前还没有许可证文本、模型卡或代码库——而许可证恰恰决定了你是否能将该模型用于商业用途。
实际上,这两款旗舰模型都不是普通团队能够自行部署的。Qwen 拥有2.4T参数,以4比特量化后大约占用1.2TB存储,而每块H200仅有约141GB显存;Kimi的2.8T参数规模则更大。两者都需要八块或更多顶级加速器,而且阿里巴巴未公开其激活参数数量,这意味着你甚至无法对Qwen的吞吐量进行建模估算。
这正是同期发布的Qwen3.8-27B在此具有重要意义。同样采用开放权重,据报道仅需约17GB显存即可运行,这为Qwen系列带来了真正的本地部署能力,而2.4T和2.8T旗舰模型都无法提供这一点。如果开放权重是你选择这两者的真正原因,那么27B比任何一个巨头都更能改变局面。
常见问题
Qwen 3.8 比 Kimi K3 更好吗?
并非基于经审计的证据。Kimi K3 持有独立的 AA 智能指数 57.1(第 3 名),并占据 LMArena 前端代码榜单第一的位置,而 Qwen3.8-Max 尚未被任何第三方评估机构评分。在唯一可用的直接对比测试中,Kimi 以 83 比 80 获胜。Qwen 的优势在于价格(输出成本低 2.5 倍),以及在同一测试中更干净的工具调用。
哪个模型更大?
Kimi K3 总参数量为 2.8T,而 Qwen3.8-Max 为 2.4T——大约多出 400B。不过,两者披露的信息都不足以让这一对比具有实际参考意义:阿里从未公布 Qwen 的激活参数量,而在混合专家(Mixture-of-Experts)模型中,激活参数量才是真正决定服务成本的指标。
哪个更便宜?
自正式发布(GA)以来,Qwen3.8-Max显然是明智之选。其每100万token定价为2美元/6美元,而Kimi K3为3美元/15美元——输入费用低33%,输出费用低2.5倍。Qwen的价格在整个100万上下文窗口内保持平稳,其0.25美元的缓存输入价格也略低于Kimi的0.30美元缓存命中价格。
这场正面对比测试实际上显示了什么?
在 Trilogy AI 的架构理解任务中,Kimi 得 83 分,Qwen 得 80 分。但 Qwen 生成了 354 条仓库引用,而 Kimi 有 274 条;Qwen 使用了 22 次网关请求,而 Kimi 用了 53 次;Qwen 记录到零次失败的工具调用,而 Kimi 有两次;在工具使用方面,Qwen 获得 9/10,Kimi 为 8/10。Kimi 给出了更好的答案;Qwen 则是更自律的智能体。这只是一个任务,因此应将其视为一个数据点,而非排名。
Qwen 3.8 Max 退出预览了吗?
是的,2026年8月3日,配有已发布的价目表,以及兼容OpenAI和DashScope的端点。7月份的Qoder积分活动不再说明其销售方式。
哪个更快?
现在可能是Qwen了,这推翻了预览时代的假设。Artificial Analysis测得Kimi K3的首token时间(TTFT)约为34秒;OrcaRouter的7天GA遥测数据显示Qwen3.8-Max的p50 TTFT为1.64秒。虽然来源不同,并非受控对比,但这两款模型都以冗长著称,而Kimi测得的TTFT确实很慢。
我可以自托管其中任何一个吗?
在旗舰规模下并不现实——2.4T和2.8T模型需要八块或更多H200级GPU。Kimi的权重今天已经就绪;Qwen的权重承诺本周内发布,但尚无许可证。对于真正的本地部署选项,同期发布的Qwen3.8-27B(据称约17GB显存)是Qwen系列中的实用选择。
底线
Qwen 3.8 对比 Kimi K3是本系列中差距最小的一组对决,正式全面发布后,两者沿着两条轴线清晰地分出高下。Kimi K3 凭借可实测的成绩守住了质量桂冠:智能指数 57.1 分,综合排名第三,同时位居 LMArena 前端代码榜榜首。这些不是口头宣称,而是实打实的测试结果——Qwen 没有任何一项能与之相提并论。
Qwen在8月3日赢下的是经济性,而且赢得毫不含糊:每百万token的定价为$2/$6,对比$3/$15,价格平坦,缓存还略便宜。再加上Trilogy的发现——Qwen以一半的网关请求和零失败的工具调用完成了一项同等的智能体任务——Qwen即使在准确度稍逊的方面,也显得是运营效率更高的模型。关注两件事:Qwen3.8-Max的首个独立Intelligence Index评分,以及权重带着许可证落地。如果Qwen的得分接近Kimi的57.1,价格差距将使Kimi在大批量工作中很难被证明是合理之选。在那之前,Kimi是你信任的模型,Qwen是你跑得起的模型——而诚实的抉择方式,是在你自己的代码库上验证。

本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
