一张生成的主视觉卡片,标题为“Qwen 4 Max vs Kimi K3”,副标题为“开放权重的承诺遇上开放权重的交付”,并带有三枚胶囊徽章,分别写着“承诺开放权重,却未发布”“K3 权重将于 2026 年 7 月 27 日发布”和“修改版 MIT 许可证”。页脚一行写着“阿里巴巴云栖大会,杭州”。白色背景上的扁平化矢量编辑风格,带有蓝到青的渐变底色,OrcaRouter 标志合成于右下角。
Engineering & Research

Qwen 4 Max 对决 Kimi K3:开源权重的承诺遇上开源权重的兑现

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Moonshot AI 于 2026 年 7 月 16 日发布了 Kimi K3,随后做了大多数实验室只会嘴上说说的事:它公开了模型权重。这个 2.8 万亿参数的检查点于 2026 年 7 月 27 日以 Modified MIT 许可证落地,距离发布仅十一天。与此同时,2026 年 9 月 22 日的云栖大会则被用来宣布 Qwen 4 Max 作为四档 Qwen 4 家族的旗舰,该家族包含一个开放权重的 Qwen 4 27B——而这一档只是承诺,尚未交付。这两个事实本身就是这场对比。关于 Qwen 4 Max 的其他一切目前都还是未知数,而一个被承诺的开放档位与一个已交付的开放档位之间的差距,正是这场对决真正有话可说的地方。

Kimi K3在七月拿出了什么

Kimi K3 是一个拥有 2.8 万亿参数的混合专家模型,每个 token 会激活 896 个专家中的 16 个,因此在任意一步中大约有 1040 亿个参数参与运算。它的输入端和输出端都具备 1,048,576 token 的上下文窗口,可接受文本、图像和视频输入,并输出文本。其第一方 API 标价为每百万输入 token 3.00 美元、每百万输出 token 15.00 美元、每百万缓存输入 token 0.30 美元,而第三方价格则低于这一水平。

这一架构正是阿里巴巴自家预览所呼应的部分。Kimi K3 建立在 Kimi Delta Attention 和 Attention Residuals 之上,Moonshot 声称,相比 Kimi K2,其扩展效率提升了约 2.5 倍,在百万 token 上下文下解码速度最高可快 6.3 倍。这正是 Qwen 的 QSA 所瞄准的同一个问题——让注意力在极端长度下变得可负担——这意味着这两个系列与其说是在规模上竞争,不如说是在比拼谁的稀疏注意力设计更经得起时间考验。

Moonshot 在发布时公布的得分,由厂商报告,且当时未复现:

• Artificial Analysis Intelligence Index — 57,当时位列第三,仅次于 Claude Fable 5GPT-5.6 Sol。该数值是在较早版本的指数修订下记录的;此后该指数已两次重建,因此这是一个历史读数,而非当前读数。

• 前端代码竞技场——以1679 Elo位居第一,领先于在通用指数上得分均高于它的两个模型

• Terminal-Bench 2.1 — 88.3

• SWE-Marathon — 42,领先于 Opus 4.8 和 GPT-5.6 Sol

• DeepSearchQA — 0.95,第一名,以及 MATH-Vision 0.98,同样第一

• GPQA-Diamond — 0.94

Moonshot 自家的发布材料承认,K3 在整体能力上仍落后于 Claude Fable 5 和 GPT-5.6 Sol,这句话比上文任何一项第一名宣称都更有用。这些数字中有趣的形态在于:一个在通用指数上排第三的模型,却在前端代码上排第一,在长时程搜索上排第一——这种画像说明,综合指数掩盖的是一个专用工具,而不是在描述一个通用工具。

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

阿里巴巴承诺了什么,以及承诺价值几何

Qwen 4 发布公告列出了四个层级。Qwen 4 Max 为旗舰,Qwen 4 Flash 面向吞吐量,Qwen 4 Plus 为均衡的中间档,Qwen 4 27B 则是开放权重的本地部署层级。Qwen LLM 负责人刘大一恒称该系列基于新一代架构训练,并表示很快就会推出。这四个模型都没有日期、没有模型卡、没有 API 标识符、没有云端上架信息、没有价格,也没有公布任何分数。

关于那则公告,有两个具体细节常被误报,而这两个细节对任何想据此做规划的人都至关重要:

• 与Qwen 4报道相关联的5万亿至10万亿参数数字并非Qwen 4的规格。它属于Qwen 4.5和Qwen 5的路线图。目前尚未公布Qwen 4 Max的任何参数数量。

• 层级名称的延续并不能让规格也随之延续。Qwen 4 Max 的上下文窗口、价格和许可证均属未知;已发布的 Qwen3.8-Max 数据——1,000,000 个 token,每百万 $2.00 和 $6.00——描述的是另一款模型

27B 档位之所以有意思,与基准测试毫无关系。它是 Qwen 4 系列中唯一历来以开放权重形式发布的档位,而 Qwen 3.8 一代展示了这能释放出什么:在 27B 权重落地后的几天内,社区就产出了 MLX 转换、NVFP4 量化以及各式各样的微调。一个已宣布的 27B 是对下游生态系统的承诺,也是路线图上最可预测的交付。

但可预测性并未兑现。Kimi K3 的权重是你今天就能下载的文件。Qwen 4 27B 的权重只是会议演讲里的一句话。

开放权重和可运行权重是不同的主张

把 Kimi K3 当作开放权重方案的答案,这里有个陷阱,而它值得直截了当地说明,因为它是对中国前沿模型报道中最常见的过度宣称。一个 2.8 万亿参数的混合专家模型是数据中心规模的产物。权重公开发布意味着你被允许运行它、可以检视它、可以微调它、也可以量化它。但它们并不意味着你能在工作站上运行它。对那种规模的检查点进行高效服务需要数十个加速器,而开放发布之后随之而来的量化工作——数周内就会流传开来的 NVFP4 和 REAP 式变体——既关乎让模型可服务,也关乎让它更小。

因此,对 Kimi K3 许可证的诚实解读是:范围更窄,但依然意义重大——它是一个可审计、可修改、可自托管的前沿模型,采用修改版 MIT 许可证,面向拥有足以部署它的硬件的组织。这是一项真正的战略资产,但对于任何把“开放权重”理解为“能在我的笔记本电脑上运行”的人来说,它并不合适。

同样的注意事项也将适用于 Qwen 4 27B——如果它发布的话;而且这一注意事项的适用程度会没那么尖锐,因为 27B 开放权重层级真正属于本地规模,而 2.8T 旗舰级则不然。这正是为什么在此次比较中,Qwen 4 27B 层级比 Max 层级更值得关注,尽管发布会首先主打的是 Max 层级。

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

许可问题背后的商业问题

Kimi K3 的第一方定价为每百万 token 输入 3.00 美元、输出 15.00 美元,处于高端定位,而 Moonshot 已明确表示,这一定价是刻意高于中国市场低价区间的。对比 Qwen3.8-Max 的输入 2.00 美元、输出 6.00 美元,Kimi K3 的输入价格是其 1.5 倍,输出价格是其 2.5 倍——差距之大,意味着只有当工作负载确实看重 Kimi K3 的特定优势(前端代码与长程搜索等)时,这一溢价才值得支付。

OrcaRouter 在同一个兼容 OpenAI 的端点上,以 0% 加价同时提供 kimi/kimi-k3 与 Qwen 3.8 系列,这意味着你按供应商的标价计费,而不是某个加价后的等价价格。在输出价格相差 2.5 倍的对比中,平台不抽成并不是可以忽略的零头——在每百万 token 15.00 美元的输出价格上,百分之十的加价就是 1.50 美元,这比本组对比中较便宜模型的全部输入成本还要高。同一个端点还提供自动故障转移,以及用于显式表达策略的路由 DSL,这正是你在一小部分生产流量上试用具备 Kimi K3 这般规格的模型的方式,而不必把整条路径押注在一个你此前从未运行过的供应商身上。

OrcaRouter 不提供的是 Qwen 4 Max 或任何 Qwen 4 层级的产品,因为它们目前都还不存在。

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

该关注什么,该忽略什么

三个信号会改变这一比较,而且它们足够具体,值得关注:

• Qwen 4 27B 的权重。不是 Max 档的基准测试表——是 27B 检查点,它的许可证和它的规模。正是这次发布,将告诉你阿里巴巴在这一代对开放权重的承诺,是否像上一代一样真实。

• Qwen 4 Max 的许可证(如果有的话)。如果阿里巴巴像为 Qwen3.8-Max 所做的那样发布其旗舰模型的权重,那么这场对比中关于开放权重的论据就不再是 Kimi 的优势,而会变成平局。

• 对 Kimi K3 的一项全新独立评测。Moonshot 的发布分数是自报的,而 Artificial Analysis 指数此后已被重建两次,因此 57 分和 Frontend Code Arena Elo 都需要先重新确定基准,才能与当前任何数据进行比较。

需要忽略的是任何在阿里巴巴发布模型卡之前出现的 Qwen 4 Max 规格表,以及任何声称 Kimi K3 的开放权重使其可在本地运行的言论。这两种错误都已经在流传。与此同时,你可以据以行动的比较,是两个已经存在的模型之间的比较:Kimi K3 以更高的费率提供已交付的权重和真正差异化的编程表现;以及 Qwen3.8-Max,输出费率不到一半,却提供统一的一百万 token 窗口,并且也有自己的权重。这是一个真实的选择,双方都有定价,而且不需要等一场会议幻灯片变成产品。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新