
DeepSeek V4 Pro 对比 Kimi K3:面对 44 分推理上限的速度与价格
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
DeepSeek V4 Pro 和 Kimi K3是两款拥有百万 token 上下文窗口的开放权重推理旗舰模型,而它们之间的竞争在一个月前就已稳定成形:Kimi K3(Moonshot AI 的 2.8 万亿参数模型,2026 年 7 月 16 日发布)是智能水平的领先者,DeepSeek V4 Pro(2026 年 8 月 13 日发布)则是速度与价格上的领先者。新变化在于,这一组合中便宜的那一半在 9 月上半月几乎被取消——DeepSeek 于 8 日将 V4 Pro 列入 9 月 14 日的退役计划,随后推迟,接着又在 11 日彻底取消了退役,并承诺在计费标准不变的情况下继续提供该模型。对这场对决而言,这一点比大多数情况都更为重要,因为"便宜、快速、100 万上下文、开放权重"这一组合很难被取代,而替代方案的成本要高出五倍。
独立数据来自 Artificial Analysis 的测量。DeepSeek 和 Moonshot 自家发布的基准测试标注为厂商报告,因为两者均未经过独立复现。
Kimi K3 赢在榜单;V4 Pro 赢在账单
独立排行榜在谁更聪明这个问题上毫不含糊。Kimi K3 在最大努力档位下,于 Artificial Analysis Intelligence Index 上得分 44,在同类可比模型中排名第 2。DeepSeek V4 Pro 得分 36,在其所属类别中排名第 7。这 9 分的差距,正是人们愿意支付 Kimi K3 价格的唯一原因。而价格也正是这场对比无法仅凭该指数一锤定音的原因:Kimi K3 标价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,而 V4 Pro 非高峰时段标价为 0.66/1.98 美元(高峰时段为 1.32/3.96 美元)。就输出而言,这大约是 7.5 倍——而且还没算上缓存折扣。V4 Pro 的缓存读取在非高峰时段约为每百万 token 0.02 美元,相当于 97% 的折扣;Kimi K3 的 90% 缓存折扣则从一个高得多的基数起步。对于 token 消耗量大的工作负载,实际差距会扩大到接近十倍。
• 智能指数 — Kimi K3 44(#2/113)对比 V4 Pro 36(#7/113)
• 价格 — Kimi K3 每 1M 为 $3.00/$15.00,而 V4 Pro 非高峰时段为 $0.66/$1.98(高峰时段 $1.32/$3.96)
• 速度 — V4 Pro 约 81 tokens/秒,对比 Kimi K3 约 35 tokens/秒
• 上下文 — 两者均为 1M tokens
• 参数 — Kimi K3 总参数 2.8T / 激活参数 104B,对比 V4 Pro 总参数 1.6T / 激活参数 49B
• 权重 — 均为开放(Kimi K3 开放权重,V4 Pro MIT)
• 输入 — Kimi K3 文本和图像 vs V4 Pro 仅文本
速度是所有人都低估的那一环。
没人谈论的那个差距在于吞吐量。独立测得 V4 Pro 的输出速度约为每秒 81 个 token;Kimi K3 则约为 35 个。在模型每步要写出数千个 token 的智能体循环中,这决定了任务是在几分钟内完成,还是会拖上一整个下午——而成本差异又让问题雪上加霜,因为你以大约一半的速度,却要为每百万个输出 token 支付 15 美元。对于交互式编程助手、批量文档处理,以及任何把实际耗时视为预算项的工作负载,V4 Pro 以七分之一的输出价格提供 2.3 倍速度,这一组合就是决定性的答案。
当这九点值得时
支持 Kimi K3 的实在理由在于其推理能力上限。它在 Intelligence Index 上的评估成本约为单次运行 3,658 美元——这反映的是真正漫长且昂贵的推理链,而非定价机制造成的偶然现象。如果你的工作负载属于高难度推理——深度数学证明、长时程规划、长达数小时的智能体任务,此时多出的九个指数点会体现为更少的失败——那么 Kimi K3 值这个溢价。反对它的实在理由则是其他一切:吞吐量、缓存经济性,以及纯粹的每 token 价格。
九月逆转在此处之所以重要的另一个原因:一个月前,明智的建议还是“如果你打算标准化采用那个便宜又快的开放模型,就要做好对冲——它可能会被停用。”截至9月15日,这种对冲已经过时。DeepSeek已公开承诺将V4 Pro保留在API上,并承诺如有任何变化会提前通知;而MIT许可证意味着,无论DeepSeek对其API作何处理,该模型仍可部署在你自己的硬件上。Kimi K3的开放权重在另一边提供了同样的自由,这正是让这成为一场真正的两个开放权重模型之间的对比,而非服务与产品之争的原因。

两个模型都在 OrcaRouter 上——DeepSeek V4 Pro 和 Kimi K3 都通过该平台路由,使用同一个密钥,供应商目录价零加价透传——而路由 DSL 是拆分这场对决的自然方式:把长程推理任务路由到 Kimi K3,那里这九个百分点的优势能真正发挥作用;把 token 密集型的吞吐工作路由到 DeepSeek V4 Pro,那里 7.5 倍的价格差距和 2.3 倍的速度差距会替你完成工作。这两者既是竞争者,也同样常常是互补者,而该平台让同时运行两者与运行一个的工作量完全相同。


底线
Kimi K3 是更聪明的开放权重模型,领先九个指数点,而它的溢价——输出 token 上贵 7.5 倍,速度大约只有一半——是实打实的成本,不是可以忽略的零头。DeepSeek V4 Pro 是快速、便宜、耐用的主力,而且在 9 月 11 日之后,它不再有“跑路”风险。实际的答案正是两栏价格都指向的那个:如果你的任务是高难度推理,就买 Kimi K3;如果是 token 消耗大且时间敏感,就买 DeepSeek V4 Pro;如果两种任务都有,就两个都跑,按任务来路由。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
