
Claude Sonnet 5.5 vs Kimi K3:两个模型都不会采用你的温度设置
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
下面是一组对比:两个模型在某件事上达成了一致,而这件事无论如何都会让你的代码崩溃。Claude Sonnet 5.5 于 2026 年 9 月 28 日发布,它会拒绝任何把 temperature、top_p 或 top_k设为非默认值的请求,并返回 400 错误。Kimi K3 自 2026 年 7 月中旬起由 Moonshot AI 正式全面提供,它完全不接受任何采样参数——没有 temperature,没有 top_p,没有 seed——并且只通过一个 reasoning_effort 控制项来暴露推理深度。两个不同的实验室,两种不同的架构,一个共同的结论:大多数集成仍出于习惯去设置的那些采样旋钮,在两者身上都已经没有了。
那不是任何人会去写的比较。所有人都写的那种比较是价格:Kimi K3 每百万输入 token 3 美元、输出 15 美元,而 Claude Sonnet 5.5 是 2 美元和 10 美元——单看价目表,这是 Anthropic 干脆利落的胜利。但 Kimi K3 是一个开放权重的 2.8 万亿参数混合专家模型,你可以把它下载下来,在自己的边界内运行;而 Claude Sonnet 5.5 是一个闭源模型,只在四家云上可用。在一个更便宜的闭源模型和一个更贵的可下载模型之间,这个决定根本不是靠每 token 的价格做出的。
每一项分别是什么,每项用一段话说明。
Claude Sonnet 5.5 是 Anthropic 5.5 代中的第二款模型,在 Claude Opus 5.5 之后五天登陆 Claude API。它作为 claude-sonnet-5-5 在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上提供,保持 1M token 上下文窗口和 128K 同步输出上限,并完全沿用 Claude Sonnet 5 的定价:输入 $2、输出 $10,缓存读取每百万 $0.20。自适应思考默认开启,努力级别为 high。它支持零数据保留,Artificial Analysis 在其 v4.3.2 修订版中给出的智能指数为 56——在其测评的 216 款模型中排名第三。

Kimi K3 是 Moonshot AI 的旗舰模型:一个 2.8 万亿参数的混合专家模型,每个 token 激活约 1040 亿参数,具备 100 万 token 上下文窗口和原生视觉理解能力。它专为长周期编程和多步骤知识工作打造,Moonshot 还点名将其定位用于编程智能体框架。它采用 OpenAI API 格式,仅以 reasoning_effort 作为其唯一的推理控制项,并以 Kimi K3 License 开放权重——这与开源并不是一回事,而这一区别正是你在基于它构建之前需要先读清楚的部分。
费率卡,以及它下面的数字
把这两者放在决定法案而非头条的各个维度上加以对比:
• 输入价格 — Claude Sonnet 5.5 每百万 2 美元,Kimi K3 则为每百万 3 美元
• 输出价格 —— Claude Sonnet 5.5 每百万 $10,对比 Kimi K3 每百万 $15
• 缓存读取 — 每百万 $0.20 对比每百万 $0.30
• 上下文窗口 — 1,000,000 个词元 对比 1,048,576 个词元
• 权重 — 专有,四个托管平台对比在Kimi K3许可证下的开放权重
• 智能指数 — 在同一 v4.3.2 修订版上,Claude Sonnet 5.5 为 56,Kimi K3 为 44
• 每项 Intelligence Index 任务的成本 — Claude Sonnet 5.5 $7.60 对比 Kimi K3 $2.00
• Index 上的冗长程度 — Claude Sonnet 5.5 410M 输出 token 对比 Kimi K3 160M
最后一组对比才是值得细细品味的反转。Anthropic 的模型在输入上便宜 50%,在输出上便宜三分之一,但完成同一项评测的成本却仍然高出 3.8 倍,因为它达到这一结果所消耗的 token 是 2.6 倍。在综合评分上,它还高出十二分,所以这并不是一个浪费的模型什么都没换来的情况。而是两个模型的成本行为无法通过看两张价目表来比较,这正是 index-task 数字存在的原因。
这两个 token 数都不会是你的 token 数。Moonshot 自己的文档指出,K3 的推理深度由 reasoning_effort决定,而非由采样决定;Claude Sonnet 5.5 的 effort 参数实际上也是如此——因此在这两个模型上,影响你账单的最大单一杠杆是 effort 设置,而不是价格谈判。

400 错误详解

对采样参数的共同拒绝是这里最实际的重合点,因为它是模型更换后第二天早上就会暴露出来的那个故障。
在 Claude Sonnet 5.5 上,这些规则明确且毫不留情。非默认的 temperature、top_p 或 top_k 会返回 400。发送 thinking: {"type": "disabled"} 会返回 400,并指向 between_tools,这是新的最低思考设置,在低、中、高 effort 下会被接受,但在 xhigh 或 max 下会被拒绝。强制工具使用——tool_choice 设为 "any" 或设为某个具名工具——会返回 400,消息为 "tool_choice: type \"tool\" and \"any\" are not supported for this model",而修复方法是 auto 加上严格工具使用或结构化输出。还有更多:思考块现在与产生它们的模型和账户绑定,因此对话可以从 Claude Sonnet 5 移到 Sonnet 5.5 上并保留完好的推理内容,但无法将该推理带到不同的模型系列,而且编辑过的前缀可能使重放变成 400。
在 Kimi K3 上,接口面更小,但后果类似。这里没有可发送的采样参数,因此任何把某个采样参数硬编码进去的客户端,其实都已经在发送模型不会读取的参数。推理深度则改为一个顶层reasoning_effort 字段。
这两项变化指向同一个方向:在提示词控制上,确定性的旋钮式方法正在被模型侧的努力程度拨盘所取代。任何曾用温度 0.2 和固定种子进行自我调优的流水线,都必须针对这两个模型按努力程度重新调优,而这种重新调优就是迁移。
开放权重实际上给你带来了什么
将 Kimi K3 与一个更便宜且得分更高的闭源模型放在一起考虑,原因既不是能力,也不是价格,而是边界。
在自己的基础设施内运行 K3,意味着提示、文档和输出永远不会离开你控制的网络;这与和供应商签订零数据保留协议是截然不同的合规讨论。它还意味着模型不会在你脚下被弃用——Claude Sonnet 5.5 附带 Anthropic 作出的不早于 2027 年 9 月 28 日的退役承诺,而下载下来的检查点没有这样的日期。它也意味着边际成本曲线会变得平缓:硬件之后,token 是免费的,而这是 2.8 万亿参数模型唯一能成为廉价选项的结构。
许可证才是你实际签署的内容。Kimi K3 是开放权重,而非开源,Moonshot 并不使用后一个说法。Kimi K3 许可证对大多数用途都很宽松,但滚动营收超过阈值的模型即服务业务需要另行签订商业协议,而用户量或营收超过大规模门槛的产品必须展示“Kimi K3”归属说明。把它称为 MIT 许可,是 K2 时代的不准确说法,至今仍在流传。如果你打算基于权重进行构建,而不是调用 API,这就属于法律审查,而非一条脚注。
而且,权重规模之大,足以让自托管成为一项资本决策。一个 2.8 万亿参数的 MoE,激活参数约为 1040 亿,并不是单服务器部署,而为搭建它所需付出的努力才是这一选项的真正成本——它让输出费率上每百万 5 美元的差异相形见绌。
OrcaRouter 的定位
大多数评估这两者的团队并不想在托管 API 和硬件采购之间做选择。他们想要的是路由。
OrcaRouter 是一个兼容 OpenAI 的端点,覆盖 200 多款模型,按提供商的目录价原价透传、不加价,因此无论哪一方的供应商费率发生变动,都能当天生效,而不必等到下一个账单周期。Kimi K3 自 7 月起就已收录在目录中,采用 Moonshot 自己的 $3 / $15,实测 p50 首 token 时间约为八秒,过去一周约有 3.719 亿 token 经由它处理。Claude Sonnet 5——目前大多数 Claude API 流量仍在使用的模型,实测每秒输出 150 个 token——自 6 月 30 日起即可路由,采用 Anthropic 的 $2 / $10。
Claude Sonnet 5.5 尚未收录在我们的目录中。如果确实如此,就如实说明并绕开它:厂商自己的 API 是通往它的途径,而在不做出承诺的情况下测试它的方式,是将一定比例的流量置于自动故障转移之后,并以 Claude Sonnet 5 或 Kimi K3 作为回退方案。如果你考虑 K3 的原因是边界而非速率,那么权重如今已可下载,而 API 只是权宜之计——这是关于你基础设施的决策,而不是关于模型对比的决策。
结论,按你实际购买的东西来划分
当任务是长上下文且输出量巨大时,当你要买的正是综合指数上那十二分的优势时,当零数据保留的托管 API 能通过你的审查时,就选 Claude Sonnet 5.5。要为 token 消耗习惯预留预算——Index 上 410M token 对比 K3 的 160M,是实打实的倍数差距——并为 tool-use 和 thinking-block 的改动预留一天时间。
当边界本身就是需求,当你想要一个没有任何供应商能将其退役的检查点,或者当你的工作负载是高频智能体编程、而每次索引任务 $2.00 对 $7.60 的差距会不断累积时,就选择 Kimi K3。同时也要接受:它是一个需要托管的 2.8T 参数模型,其许可证带有署名和收入条款,并且在综合评分上低于 Anthropic 那一档。
无论选哪一个,都避不开第一段:两者的采样参数都已消失,取而代之的控制项就是“努力程度”旋钮。无论你在这两者中选择哪一个,那都是你的代码需要做出的改动。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
