
Claude Fable 5.1 vs Kimi K3:推理天花板 vs 你可拥有的天花板
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49代码
Claude Fable 5.1 和 Kimi K3 瞄准的是同一类买家——在大型代码库和文档集上运行长时间、使用工具的智能体的团队——并且它们来自市场的两端。Claude Fable 5.1 是 Anthropic 的闭源旗舰模型,于 2026 年 9 月 1 日发布,定价为每百万输入 token 10.00 美元,每百万输出 token 50.00 美元,在 Artificial Analysis 当前的智能指数中测得 53 分:在该指数追踪的 201 个模型中排名第一。Kimi K3 是 Moonshot AI 的 2.8 万亿参数混合专家模型,于 7 月 27 日开放权重,在同一指数中得分为 44——在其同类 112 个开放权重模型中排名第二。显而易见的解读是九分的智能差距对应约三倍的价格差距。更有用的解读是,这两个模型有不同的上限,而其中只有一个上限能被使用它的人提高。
关于来源:Artificial Analysis 在九月份重新发布了其智能指数(Intelligence Index),因此这里的分数、排名、速度和每任务成本数据均来自当前版本,采集于2026年9月10日,与两个模型发布时公布的数字不可比。Moonshot 自己的基准测试结果和 Anthropic 的结果在出现处均有标注,且两者均未得到对方实验室的复现。Claude Fable 5.1 发布至今仅九天,因此其供应商声明几乎没有经过外部测试;Kimi K3 则已接受六周的测试。
同一窗口,不同最大值
这两款模型均提供 1,048,576 个 token 的上下文窗口,并且都不对填满该窗口收取额外费用——Moonshot 将 Kimi K3 的定价定为每百万 token 3.00 美元 / 缓存 0.30 美元 / 15.00 美元,而 Claude Fable 5.1 的窗口定价为每百万 token 10.00 美元 / 缓存 0.25 美元 / 50.00 美元。正是这个共享窗口,使得这两者被放在一起比较:它们是为相同形态的工作而构建的,在这种工作中,单个任务会积累起一个代码库、一个数据室,或一整周的工具输出。
差异出在管道的另一端。Kimi K3 一次响应最多可输出 1,048,576 个 token——服务商通常默认设为 131,072,但上限是整整一百万,Moonshot 将其宣传为“一次调用即可输出整个代码库”。Claude Fable 5.1 将响应输出上限限制为 128K token。对于聊天轮次来说,这个限制无关紧要。但对于整个代码库的生成、批量迁移或长文档集来说,这就是一次调用与一个你必须构建、监督并逐轮付费的代理循环之间的区别。
数字,逐维度地
• 每 1M tokens 价格 — Claude Fable 5.1:输入 $10.00 / 输出 $50.00,对比 Kimi K3:输入 $3.00 / 输出 $15.00。
• 缓存输入 — Claude Fable 5.1 每 1M 的价格为 $0.25,而 Kimi K3 为 $0.30,Artificial Analysis 将其换算为有效缓存折扣:98% 对比 90%。
• 独立评分、速度和成本 — Claude Fable 5.1 在当前智能指数中得分为 53(在 201 个模型中位列第 1),每秒输出 67.2 个 token,每项指数任务成本 7.63 美元;Kimi K3 得分为 44(在 112 个开放权重模型中位列第 2),每秒输出 35.5 个 token,每项任务成本 2.00 美元;指数还指出它明显较慢且有些冗长——每次指数运行输出 1.6 亿个 token,而 Claude 模型为 1.9 亿。
• 上下文及输出上限 — 输入1M tokens,最多128K tokens输出,对比输入1M tokens,最多1M tokens输出。
权重 — 封闭式、仅限 API,与开放且可自行托管;由 Moonshot 以 Kimi K3 许可证发布,该许可证是 MIT 的修改变体,包含面向超大型经销商的商业条款,权重托管在 Hugging Face 上。
• 视觉 — Claude Fable 5.1 在 API 上接受文本、图像和文件输入;Kimi K3 在 API 上接受文本和图像,但原生视觉是服务层功能,不包含在已发布的权重中。
• 推理可见性 — Kimi K3 在 API 中流式输出其推理轨迹;Claude Fable 5.1 返回思考块,其显示方式由你选择,可摘要或省略,原始思维链永不公开。
• {{1}}架构{{/1}} — {{2}}Claude Fable 5.1 的参数量未公开{{/2}};{{3}}Kimi K3 是一种稀疏混合专家模型,总参数 2.8T,激活参数约 104B。{{/3}}
• 已发布 — Claude Fable 5.1 于 2026 年 9 月 1 日推出;Kimi K3 的 API 于 2026 年 7 月 16 日上线,开放权重于 7 月 27 日发布。

九分差距是什么,以及不是什么
在当前指数中,Claude Fable 5.1以53分领先,Kimi K3以44分在开放权重领域中位居第二。九分的差距是实打实的,并非噪声,但该指数是一个综合指标——对智能体工作、编码、科学推理和通用能力进行加权——单一数字掩盖了开放模型真正擅长的方面。在九月初的独立评测中,Kimi K3在长周期智能体工作上处于开放模型领域的顶部或接近顶部:在AutomationBench上排名第一,在Artificial Analysis的智能体Briefcase套件中排名第二,在已测模型中于GDPval-AA v2上排名第三。独立竞技场数据将其网页开发能力定在Code Arena的Web Dev排行榜上约1,679 Elo,截至九月初在该领域名列前茅。在这些工作负载上,开放模型并没有落后九分。
Claude Fable 5.1 真正拉开差距的地方是硬推理的上限。Anthropic 报告称,它在 Terminal-Bench-Science 0.1 上取得 52.6% 的成绩,是上一代 Claude 的 24.7% 的两倍多;在 Terminal-Bench 4.0 上则为 55.8%——这两项均为厂商自报数据,尚未经独立复现。这些数字支撑了这样的说法:9 月份的这次发布为科学研究和长周期工作设定了新的基准。客观地总结:Kimi K3 在智能体广度与 Web 开发上具备竞争力,而闭源模型在最深层的推理上领先;一个 9 分的指数差距就把这两项事实压缩成了一行数字。
有一个数据点值得一提,因为它不同寻常:Moonshot 自己给出的 Kimi K3 在 Terminal-Bench 2.1 上的成绩是 88.3%,而独立评测结果为 85.0%。厂商数据能在中立测量下几乎原样保留下来的情况很少见,而且如此小的差距——还是偏向厂商的差距——比任何单项指标分数都更能说明模型本身的实力。

所有权分叉,如实核算成本
开放权重是选择Kimi K3的理由,也是需要细读条款的原因。Kimi K3是一个2.8万亿参数的稀疏混合专家模型;自行运行它意味着需要多节点GPU集群,而不是工作站上一下午就能搞定的事,而且Kimi K3的许可证设有一道面向超大型经销商的商业门槛。你用那套基础设施买到的东西是实打实的:没有速率限制,没有按token计费,可以在自有数据上微调,完全可审计,提示词永不离开你的网络——这些要求正是让封闭API在受监管和涉防务的工作中毫无立足之地的原因。
与之相伴的还有两个注意事项。自托管会失去 API 的原生视觉能力,因为图像输入属于服务层功能,而非已发布权重中的内容;此外,该模型速度较慢,根据当前指数,其输出速度仅为每秒 35.5 个 token——这是拥有 2.8T 参数、始终启用推理的专家混合模型的自然结果。生成 20,000 个 token 需要几分钟的时间,而在你自己的集群上运行,则意味着耗用你自己 GPU 的几分钟时间。
租赁版本之间的差距比所有权问题所暗示的要小。Moonshot API 上的 Kimi K3 价格为 3.00 美元 / 15.00 美元,缓存输入为 0.30 美元,约为 Claude Fable 5.1 代币费率的 1/3;而 Claude 方面在 9 月份将缓存读取价格下调了 75%——降至每百万 0.25 美元,低于 Kimi——这对两个模型都瞄准的长时间智能体会话至关重要,因为在这些会话中,相同的工具输出会被反复读取数十次。按独立的每任务成本衡量,差距为 Kimi K3 的 2.00 美元对比 Claude Fable 5.1 的 7.63 美元:接近四倍,而非代币价格所暗示的三倍,因为 Anthropic 模型在完成相同索引工作时写入了约 1.9 亿个代币,而 Kimi 为 1.6 亿个。
看得见的推理
{{1}}有一种开发者体验上的差异,不会出现在任何基准测试表中。{{/1}}{{2}}Kimi K3 通过 API 流式传输其推理痕迹,这把失败的代理步骤变成了你可以阅读的东西,而不是你需要推测的东西。{{/2}}{{3}}Claude Fable 5.1 则采取相反的做法:思考始终开启,原始思维链永远不会被返回,显示设置只决定你是收到一份可读摘要还是什么都收不到。{{/3}}{{4}}对于大多数生产环境日志记录来说,摘要已经足够;而对于调试一个总是走错分支的代理,痕迹则更好用。{{/4}}{{5}}如果你是在构建代理基础设施而不是消费它,这种差异会以小时计地显现出来。{{/5}}
采购脚注
对于美国企业而言,有一个非技术变量与这场较量相关。Moonshot AI 是一家总部位于北京的实验室,一直是美国政府审查的对象:财政部长曾公开威胁要将该公司列入贸易黑名单,美国官员指控它从美国模型中蒸馏能力——Moonshot 否认这一指控——媒体报道称,该公司正与微软、亚马逊和谷歌进行早期谈判,拟以收入分成条款托管 Kimi K3,此外还在9月初提交了保密的香港IPO申请。这些都不改变技术上的对比;而且,在你自己的基础设施内部进行美国托管的开放权重部署,与将提示词路由到离岸API有着实质性区别。但这确实意味着,关于 Kimi K3 的采购决策是一个带有政策维度的决策,应该由知晓这一点的人来做出。
运行比较而不是争论不休
这两个模型都可以在 OrcaRouter 上以各自提供商的标价获取,零加价,因此这一比较可以由你自己的数据来裁定,而不是看一张基准表:Moonshot 的 Kimi K3 定价为 $3.00 / $15.00,Anthropic 的 Claude Fable 5.1 定价为 $10.00 / $50.00,使用同一个密钥和同一张发票,无需签署第二份合同,也无需改动代码即可切换。将同一套测试工具指向两者,在实际工作负载上衡量每个已完成任务的成本,并在候选模型仍在评估期间,让自动故障转移守住生产路径。如果工作负载属于深度推理,或位于 Claude Code 之中,封闭旗舰模型通常胜出;如果是高容量生成,且百万 token 的输出或自托管部署会改变经济性,那么 Kimi K3 是两者中唯一可以拥有的,而路由层正是让你保留这两种选择的地方。

接下来值得关注的方面是对称的。Anthropic 一直以大约每月一次的节奏发布产品,并且现已表明它会在不调整公开费率的情况下降低缓存定价,因此这场对决的成本端可以在没有新模型的情况下发生变化。Moonshot 自己的未来现在与它的上市以及那些美国云谈判紧密相连,其中任何一项都可能改变 Kimi K3 的提供方式和提供地点。这两者都不是等待的理由:两个模型现在都能做到上面数字所表明的事情,而最能经得起时间考验的决定,是让模型 ID 保留为配置值,而不是重写。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
