
Kimi K3 vs DeepSeek V4:两个开放权重巨头的对比
- meta新Meta: Muse Spark 1.12026-07-1651智能71代码
- kimi新MoonshotAI: Kimi K32026-07-1557智能76代码
- openai新OpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openai新OpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openai新OpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grok新xAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
- anthropicAnthropic: Claude Fable 52026-06-0960智能77代码
- qwenQwen: Qwen3.7 Plus2026-06-0139智能56代码59数学
- minimaxMiniMax: MiniMax M32026-05-3144智能59代码59数学
- AnthropicAnthropic: Claude Opus 4.82026-05-2856智能74代码68数学
- GoogleGemini 3.5 Flash2026-05-2350智能70代码51数学
- qwenQwen3.7 Max2026-05-2246智能66代码71数学
- qwenQwen3.7 Max (2026-05-20)2026-05-2046智能66代码73数学
这是2026年顶级开源权重模型的较量。Kimi K3和DeepSeek V4都是大型混合专家模型,具有开源权重、约100万token的上下文窗口以及激进定价,两者均来自中国实验室。如果你已决定要一个开源、可自托管的前沿级模型,那么这两个就是你的最终候选。
差异确实存在但很具体:DeepSeek V4 仅支持文本,且定价处于绝对最低点(大多数人忽略了其高峰时段附加费);Kimi 增加了原生视觉能力,并在独立指数上,在整体智能方面略胜 DeepSeek。许可协议也不同:DeepSeek 完全采用 MIT 许可,Kimi 采用修改版 MIT。以下是选择方法。
先坦诚说明一点:截至2026年7月15日,Moonshot尚未公布任何K3的官方规格或基准测试结果。泄露的发布宣传材料是真实的,但其中的数字尚未得到确认。因此,在比较能力时,我们以Kimi当前产品线(K2.6和K2.7 Code)作为K3预期在此基础上构建的下限基准,并且在每次比较中都会明确说明。在模型卡正式上线之前,请将所有K3数据视为传闻。
快速裁决
- 开放性:两者都是开放权重且可自托管。DeepSeek V4 完全使用 MIT 许可;Kimi 使用修改版 MIT(在非常大规模下增加品牌要求)。DeepSeek 的许可更为宽松。
- 价格:DeepSeek V4-Pro 在非高峰时段最便宜,输入约$0.435/百万Token,输出约$0.87/百万Token,但高峰时段需加收约2倍附加费。Kimi 的价格范围约为$0.60-$0.95/$2.80-$4.00。DeepSeek 在基础价格上胜出;需留意其高峰定价。
- 智力(独立):Kimi K2.6 在人工智能分析智力指数(54)上领先于开放权重模型,略高于 DeepSeek V4-Pro(52)。
- 模态:Kimi具有原生视觉;DeepSeek V4仅支持文本。如果你在开源模型中需要图像输入,Kimi胜出。
- 编程方面:非常接近,DeepSeek V4-Pro 报告 SWE-Bench Verified 为 80.6,LiveCodeBench 为 93.5;Kimi K2.6 报告 SWE-Bench Verified 为 80.2,并以开源领先的 SWE-Bench Pro 58.6(对比 DeepSeek 的 55.4)表现突出。
- 结论:选择DeepSeek V4可获得绝对最低的纯文本成本和最宽松的许可;选择Kimi K3可获得原生视觉、在独立智能上的轻微优势以及(据传)更长的上下文。许多团队应该同时保留两者并路由。
概览
- Kimi K3(预期,基于K2.6/K2.7):开放权重MoE,Modified MIT;传闻2.5T-4T参数;传闻1M上下文;原生视觉;价格未公布(约$0.60-$0.95 / $2.80-$4.00)。
- DeepSeek V4-Pro:开放权重的混合专家(MoE)模型,采用MIT许可;总参数量1.6万亿,激活参数量490亿;上下文窗口100万,最高输出384K token;纯文本模型;非高峰时段输入约0.435美元,输出约0.87美元(缓存命中约0.0036美元),高峰时段价格大约翻倍;于2026年4月24日发布。(轻量版V4-Flash,参数量2840亿/130亿,运行成本约0.14美元/0.28美元。)
- 注意:DeepSeek 的旧版 API 名称(deepseek-chat / deepseek-reasoner)将于 2026 年 7 月 24 日弃用,如果您正在使用它们,请规划迁移。
价格与高峰时段捕获量
从纸面上看,DeepSeek V4-Pro 是目前性价比最高的开源模型,输入每百万 tokens 约0.435美元,输出约0.87美元,缓存命中几乎免费。Kimi 的价格略高,输入0.60-0.95美元,输出2.80-4.00美元。在纯文本处理量方面,DeepSeek 赢得了价格战。
竞争对手很少提及的陷阱:DeepSeek将原有的非高峰折扣转变为高峰附加费,因此在中国工作日时段(大约09:00-12:00和14:00-18:00)的价格几乎翻倍。如果你的流量具有突发性且与中国的日间时段重合,那么你的实际DeepSeek账单会更接近Kimi的价格,而非其标称价格。这正是那种只有按小时计费(而非按token计费)时才会显现的实际成本细节。
基准测试:真正的平局
这两者在系列中比其他任何一对都更接近。在编程方面,DeepSeek V4-Pro 报告 SWE-Bench Verified 为 80.6,LiveCodeBench 为 93.5,以及 Remarkable Codeforces 评分 3206;Kimi K2.6 报告 SWE-Bench Verified 为 80.2,LiveCodeBench v6 为 89.6,以及开源领先的 SWE-Bench Pro 为 58.6,而 DeepSeek 为 55.4。在科学和数学方面,它们互有胜负(GPQA Diamond 各自约 90;AIME 2026 中 Kimi 为 96.4,DeepSeek 为 94.3)。
决胜规则是独立且结构化的。在Artificial Analysis Intelligence Index上,Kimi K2.6(54分)以微弱优势领先DeepSeek V4-Pro(52分),成为顶级开放权重模型。但DeepSeek仅支持文本,而Kimi的原生视觉能力和传闻中更长的Kimi K3上下文扩展了其功能。两个供应商的第一方编码数据值得您自行验证。

许可、模式与自托管
在选择开源模型时,三个实际要点决定最终决策。许可证:DeepSeek 的纯 MIT 许可证最为宽松,Kimi 的修改版 MIT 仅在极大规模(1亿+用户或月收入2000万美元以上)时才增加可见品牌要求,这对大多数团队无关紧要,但值得注意。模态:Kimi 原生支持图像处理;DeepSeek 仅支持文本。自托管:两者都很重,DeepSeek V4-Pro 和全质量版 Kimi 各需约 8 块高端 GPU,因此许多团队将通过中立司法辖区的主机(OpenRouter、DeepInfra)而非本地运行。两者的第一方 API 均受中国司法管辖,若数据驻留重要,请据此选择路由。

你应该使用哪一个?
当您追求最低的纯文本成本和最宽松的许可协议,且您的流量不集中在中国高峰时段时,请选择 DeepSeek V4。当您需要原生视觉功能、想要轻微的独立智能优势,或预计使用传闻中更长的上下文时,请选择 Kimi K3。对许多团队来说,正确的答案是两者皆用——它们足够便宜,可以保留为冗余的开源权重选项。
这种冗余是一种特性,当两者都位于同一个 OrcaRouter 端点之后时即可实现。你可以将纯文本批量任务路由到当前小时更便宜的那个(自动避开 DeepSeek 的峰值附加费),将图像任务发送给 Kimi,并在任一提供商限流时在它们之间进行故障转移,所有数据都通过一个仪表盘按模型成本和延迟进行展示。两个开放模型、一次集成,且更便宜的那个始终在前。

常见问题
Kimi K3和DeepSeek V4哪个更便宜?
DeepSeek V4-Pro 在纸面上更便宜(非高峰时段约$0.435/$0.87,而Kimi约$0.60-$0.95/$2.80-$4.00),但其约2倍的高峰时段附加费可能会缩小与中国白天流量对齐的差距。
哪个更有能力?
非常接近。Kimi K2.6 在独立的人工分析智能指数(54 vs 52)和 SWE-Bench Pro 上略胜 DeepSeek V4-Pro;DeepSeek 在 Codeforces 评分和 LiveCodeBench 上领先。预计 K3 将提升 Kimi 的成绩,请发布时核实。
两者都支持图片吗?
不。Kimi拥有原生视觉能力;DeepSeek V4仅支持文本。如果你需要在开放模型中输入图像,选择Kimi。
我可以同时运行两者并自动切换吗?
是的,这是一个很强的模式。像OrcaRouter这样的网关可以根据任务路由到更便宜或更适合的开放模型,并在它们之间进行故障切换,而所有这些都隐藏在一个端点后面。
Kimi K3还没有官方基准测试成绩,我能相信这个对比吗?
问得好。截至{{1}}2026年7月15日{{/1}},K3尚未确认,因此本对比将Kimi已发布的K2.6/K2.7系列作为基准线,并将所有K3数据标注为传闻。社区共识是“激动人心,但需等待真实数据”,独立排行榜通常会在发布后三到六周内公布。低风险做法:将结论视为方向性指引,现在设置基于任务的路线规划,并在Moonshot官方K3数据落地之日重新进行基准测试。
底线
Kimi K3 和 DeepSeek V4 是 2026 年最好的两个开源权重模型,它们性能相近,你可以合理地同时运行两者。选择 DeepSeek 可获得极低的纯文本成本和更清晰的许可证,选择 Kimi 可获得原生视觉功能和轻微的能力优势,如果你不确定,可以在两者之间路由,让更便宜、更合适的模型赢得每个请求。
