为“Claude Fable 5.1 vs Kimi K3”制作的自制主视觉标题卡片,副标题为“推理天花板 vs 你可拥有的天花板”。两个面板:一个是“Claude Fable 5.1”(Anthropic,闭源 API,每 100 万 token 10.00 美元 / 50.00 美元,AA Intelligence Index 53,在 201 个中排名第 1,最大输出 128K);另一个是“Kimi K3”(Moonshot AI,开放权重,每 100 万 token 3.00 美元 / 15.00 美元,AA Intelligence Index 44,开放权重中排名第 2,最大输出可达 100 万 token)。页脚文字为“Claude Fable 5.1 于 2026 年 9 月 1 日发布 · Kimi K3 API 于 2026 年 7 月 16 日、权重于 2026 年 7 月 27 日发布 · 独立数据,取自当前 Artificial Analysis 指数,采集于 2026 年 9 月 10 日”;OrcaRouter 标志位于右下角。
Guides & Insights

Claude Fable 5.1 vs Kimi K3:推理天花板 vs 你可拥有的天花板

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Claude Fable 5.1Kimi K3 瞄准的是同一类买家——在大型代码库和文档集上运行长时间、使用工具的智能体的团队——并且它们来自市场的两端。Claude Fable 5.1 是 Anthropic 的闭源旗舰模型,于 2026 年 9 月 1 日发布,定价为每百万输入 token 10.00 美元,每百万输出 token 50.00 美元,在 Artificial Analysis 当前的智能指数中测得 53 分:在该指数追踪的 201 个模型中排名第一。Kimi K3 是 Moonshot AI 的 2.8 万亿参数混合专家模型,于 7 月 27 日开放权重,在同一指数中得分为 44——在其同类 112 个开放权重模型中排名第二。显而易见的解读是九分的智能差距对应约三倍的价格差距。更有用的解读是,这两个模型有不同的上限,而其中只有一个上限能被使用它的人提高。

关于来源:Artificial Analysis 在九月份重新发布了其智能指数(Intelligence Index),因此这里的分数、排名、速度和每任务成本数据均来自当前版本,采集于2026年9月10日,与两个模型发布时公布的数字不可比。Moonshot 自己的基准测试结果和 Anthropic 的结果在出现处均有标注,且两者均未得到对方实验室的复现。Claude Fable 5.1 发布至今仅九天,因此其供应商声明几乎没有经过外部测试;Kimi K3 则已接受六周的测试。

同一窗口,不同最大值

这两款模型均提供 1,048,576 个 token 的上下文窗口,并且都不对填满该窗口收取额外费用——Moonshot 将 Kimi K3 的定价定为每百万 token 3.00 美元 / 缓存 0.30 美元 / 15.00 美元,而 Claude Fable 5.1 的窗口定价为每百万 token 10.00 美元 / 缓存 0.25 美元 / 50.00 美元。正是这个共享窗口,使得这两者被放在一起比较:它们是为相同形态的工作而构建的,在这种工作中,单个任务会积累起一个代码库、一个数据室,或一整周的工具输出。

差异出在管道的另一端。Kimi K3 一次响应最多可输出 1,048,576 个 token——服务商通常默认设为 131,072,但上限是整整一百万,Moonshot 将其宣传为“一次调用即可输出整个代码库”。Claude Fable 5.1 将响应输出上限限制为 128K token。对于聊天轮次来说,这个限制无关紧要。但对于整个代码库的生成、批量迁移或长文档集来说,这就是一次调用与一个你必须构建、监督并逐轮付费的代理循环之间的区别。

数字,逐维度地

• 每 1M tokens 价格 — Claude Fable 5.1:输入 $10.00 / 输出 $50.00,对比 Kimi K3:输入 $3.00 / 输出 $15.00。

• 缓存输入 — Claude Fable 5.1 每 1M 的价格为 $0.25,而 Kimi K3 为 $0.30,Artificial Analysis 将其换算为有效缓存折扣:98% 对比 90%。

• 独立评分、速度和成本 — Claude Fable 5.1 在当前智能指数中得分为 53(在 201 个模型中位列第 1),每秒输出 67.2 个 token,每项指数任务成本 7.63 美元;Kimi K3 得分为 44(在 112 个开放权重模型中位列第 2),每秒输出 35.5 个 token,每项任务成本 2.00 美元;指数还指出它明显较慢且有些冗长——每次指数运行输出 1.6 亿个 token,而 Claude 模型为 1.9 亿。

• 上下文及输出上限 — 输入1M tokens,最多128K tokens输出,对比输入1M tokens,最多1M tokens输出。

权重 — 封闭式、仅限 API,与开放且可自行托管;由 Moonshot 以 Kimi K3 许可证发布,该许可证是 MIT 的修改变体,包含面向超大型经销商的商业条款,权重托管在 Hugging Face 上。

• 视觉 — Claude Fable 5.1 在 API 上接受文本、图像和文件输入;Kimi K3 在 API 上接受文本和图像,但原生视觉是服务层功能,不包含在已发布的权重中。

• 推理可见性 — Kimi K3 在 API 中流式输出其推理轨迹;Claude Fable 5.1 返回思考块,其显示方式由你选择,可摘要或省略,原始思维链永不公开。

• {{1}}架构{{/1}} — {{2}}Claude Fable 5.1 的参数量未公开{{/2}};{{3}}Kimi K3 是一种稀疏混合专家模型,总参数 2.8T,激活参数约 104B。{{/3}}

• 已发布 — Claude Fable 5.1 于 2026 年 9 月 1 日推出;Kimi K3 的 API 于 2026 年 7 月 16 日上线,开放权重于 7 月 27 日发布。

A self-built two-column scoreboard titled 'Claude Fable 5.1 vs Kimi K3 — the scoreboard'. Left column 'Claude Fable 5.1 (Anthropic)': 'AA Intelligence Index 53 (#1 of 201)', 'Price in / out $10.00 / $50.00 per 1M tokens', 'Cost per index task $7.63', 'Context / max output 1M / 128K', 'Weights closed, API only', 'Released Sep 1, 2026'. Right column 'Kimi K3 (Moonshot AI)': 'AA Intelligence Index 44 (#2 of 112 open-weights)', 'Price in / out $3.00 / $15.00 per 1M tokens', 'Cost per index task $2.00', 'Context / max output 1M / up to 1M', 'Weights open, self-hostable', 'Released API Jul 16, weights Jul 27, 2026'. Footer: 'AA figures per Artificial Analysis, current index version, captured Sep 10 2026.'

九分差距是什么,以及不是什么

在当前指数中,Claude Fable 5.1以53分领先,Kimi K3以44分在开放权重领域中位居第二。九分的差距是实打实的,并非噪声,但该指数是一个综合指标——对智能体工作、编码、科学推理和通用能力进行加权——单一数字掩盖了开放模型真正擅长的方面。在九月初的独立评测中,Kimi K3在长周期智能体工作上处于开放模型领域的顶部或接近顶部:在AutomationBench上排名第一,在Artificial Analysis的智能体Briefcase套件中排名第二,在已测模型中于GDPval-AA v2上排名第三。独立竞技场数据将其网页开发能力定在Code Arena的Web Dev排行榜上约1,679 Elo,截至九月初在该领域名列前茅。在这些工作负载上,开放模型并没有落后九分。

Claude Fable 5.1 真正拉开差距的地方是硬推理的上限。Anthropic 报告称,它在 Terminal-Bench-Science 0.1 上取得 52.6% 的成绩,是上一代 Claude 的 24.7% 的两倍多;在 Terminal-Bench 4.0 上则为 55.8%——这两项均为厂商自报数据,尚未经独立复现。这些数字支撑了这样的说法:9 月份的这次发布为科学研究和长周期工作设定了新的基准。客观地总结:Kimi K3 在智能体广度与 Web 开发上具备竞争力,而闭源模型在最深层的推理上领先;一个 9 分的指数差距就把这两项事实压缩成了一行数字。

有一个数据点值得一提,因为它不同寻常:Moonshot 自己给出的 Kimi K3 在 Terminal-Bench 2.1 上的成绩是 88.3%,而独立评测结果为 85.0%。厂商数据能在中立测量下几乎原样保留下来的情况很少见,而且如此小的差距——还是偏向厂商的差距——比任何单项指标分数都更能说明模型本身的实力。

Screenshot of the Artificial Analysis model page for Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback), captured September 10, 2026, showing Intelligence Index 53 ranked #1 of 201, output speed 67.2 tokens per second, a $7.63 cost per Intelligence Index task, a 98% cache discount against $10.00 input and $50.00 output pricing, 190M output tokens of verbosity, and a 1M-token context window.

所有权分叉,如实核算成本

开放权重是选择Kimi K3的理由,也是需要细读条款的原因。Kimi K3是一个2.8万亿参数的稀疏混合专家模型;自行运行它意味着需要多节点GPU集群,而不是工作站上一下午就能搞定的事,而且Kimi K3的许可证设有一道面向超大型经销商的商业门槛。你用那套基础设施买到的东西是实打实的:没有速率限制,没有按token计费,可以在自有数据上微调,完全可审计,提示词永不离开你的网络——这些要求正是让封闭API在受监管和涉防务的工作中毫无立足之地的原因。

与之相伴的还有两个注意事项。自托管会失去 API 的原生视觉能力,因为图像输入属于服务层功能,而非已发布权重中的内容;此外,该模型速度较慢,根据当前指数,其输出速度仅为每秒 35.5 个 token——这是拥有 2.8T 参数、始终启用推理的专家混合模型的自然结果。生成 20,000 个 token 需要几分钟的时间,而在你自己的集群上运行,则意味着耗用你自己 GPU 的几分钟时间。

租赁版本之间的差距比所有权问题所暗示的要小。Moonshot API 上的 Kimi K3 价格为 3.00 美元 / 15.00 美元,缓存输入为 0.30 美元,约为 Claude Fable 5.1 代币费率的 1/3;而 Claude 方面在 9 月份将缓存读取价格下调了 75%——降至每百万 0.25 美元,低于 Kimi——这对两个模型都瞄准的长时间智能体会话至关重要,因为在这些会话中,相同的工具输出会被反复读取数十次。按独立的每任务成本衡量,差距为 Kimi K3 的 2.00 美元对比 Claude Fable 5.1 的 7.63 美元:接近四倍,而非代币价格所暗示的三倍,因为 Anthropic 模型在完成相同索引工作时写入了约 1.9 亿个代币,而 Kimi 为 1.6 亿个。

看得见的推理

{{1}}有一种开发者体验上的差异,不会出现在任何基准测试表中。{{/1}}{{2}}Kimi K3 通过 API 流式传输其推理痕迹,这把失败的代理步骤变成了你可以阅读的东西,而不是你需要推测的东西。{{/2}}{{3}}Claude Fable 5.1 则采取相反的做法:思考始终开启,原始思维链永远不会被返回,显示设置只决定你是收到一份可读摘要还是什么都收不到。{{/3}}{{4}}对于大多数生产环境日志记录来说,摘要已经足够;而对于调试一个总是走错分支的代理,痕迹则更好用。{{/4}}{{5}}如果你是在构建代理基础设施而不是消费它,这种差异会以小时计地显现出来。{{/5}}

采购脚注

对于美国企业而言,有一个非技术变量与这场较量相关。Moonshot AI 是一家总部位于北京的实验室,一直是美国政府审查的对象:财政部长曾公开威胁要将该公司列入贸易黑名单,美国官员指控它从美国模型中蒸馏能力——Moonshot 否认这一指控——媒体报道称,该公司正与微软、亚马逊和谷歌进行早期谈判,拟以收入分成条款托管 Kimi K3,此外还在9月初提交了保密的香港IPO申请。这些都不改变技术上的对比;而且,在你自己的基础设施内部进行美国托管的开放权重部署,与将提示词路由到离岸API有着实质性区别。但这确实意味着,关于 Kimi K3 的采购决策是一个带有政策维度的决策,应该由知晓这一点的人来做出。

运行比较而不是争论不休

这两个模型都可以在 OrcaRouter 上以各自提供商的标价获取,零加价,因此这一比较可以由你自己的数据来裁定,而不是看一张基准表:Moonshot 的 Kimi K3 定价为 $3.00 / $15.00Anthropic 的 Claude Fable 5.1 定价为 $10.00 / $50.00,使用同一个密钥和同一张发票,无需签署第二份合同,也无需改动代码即可切换。将同一套测试工具指向两者,在实际工作负载上衡量每个已完成任务的成本,并在候选模型仍在评估期间,让自动故障转移守住生产路径。如果工作负载属于深度推理,或位于 Claude Code 之中,封闭旗舰模型通常胜出;如果是高容量生成,且百万 token 的输出或自托管部署会改变经济性,那么 Kimi K3 是两者中唯一可以拥有的,而路由层正是让你保留这两种选择的地方。

Screenshot of the OrcaRouter model page for Kimi K3 (model id kimi/kimi-k3) showing $3.00 input and $15.00 output per 1M tokens, the MoonshotAI provider listed as of 2026-07-15, a 1M-token context window with text and image input, Vision, Tools, JSON and Reasoning capability badges, a description of it as a 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding and end-to-end knowledge work, the /v1/chat/completions and /v1/responses endpoints, and seven-day traffic of 2,343.0M tokens.

接下来值得关注的方面是对称的。Anthropic 一直以大约每月一次的节奏发布产品,并且现已表明它会在不调整公开费率的情况下降低缓存定价,因此这场对决的成本端可以在没有新模型的情况下发生变化。Moonshot 自己的未来现在与它的上市以及那些美国云谈判紧密相连,其中任何一项都可能改变 Kimi K3 的提供方式和提供地点。这两者都不是等待的理由:两个模型现在都能做到上面数字所表明的事情,而最能经得起时间考验的决定,是让模型 ID 保留为配置值,而不是重写。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube