
GPT-6 与 Kimi K3:两款百万级 Token 模型,专精方向各异
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
GPT-6 Sol and Kimi K3 are the two models most likely to be shortlisted for the same job: a million-token context window, image input, and a price that makes long documents affordable. They got there from opposite directions. Kimi K3 is MoonshotAI's long-context specialist, released 15 July 2026, and its card is built around recall — it scores 88.7% on Artificial Analysis's long-context recall test, ahead of every model from the vendor we can compare it against. GPT-6 Sol is the vendor's mid-tier generalist, shipped 22 September 2026 at $2.00 per million input and $10.00 per million output, and its case is breadth: a slightly larger window, a higher general reasoning composite, and a cheaper output token.
所以,诚实的界定不是更好还是更差,而是召回还是推理,而这取决于你加载这百万个 token 之后拿它们做什么。
这些窗户在纸上尺寸相同。
两张卡都宣称大约一百万个 token,差异只是表面功夫。Kimi K3 的窗口是 1,048,576 个 token——正好是 2^20,也就是所有长上下文模型都会引用的二进制百万。GPT-6 Sol 的是 1,050,000,一个十进制整数,大约大了 1,400 个 token。对于你实际能塞进去的任何工作负载,这两个窗口完全一样。别在这上面做选择。
真正有所不同的是信封的其余部分,而它是一份简短的清单。
• 上下文:Kimi K3 1,048,576 tokens,GPT-6 Sol 1,050,000 —— 实际上持平
• 输入模态:Kimi K3 接受文本和图像;GPT-6 Sol 接受文本、图像和文件
• 输出上限:GPT-6 Sol 单次响应 128,000 tokens;Kimi K3 的卡片未公布最大输出数值
• 标准价格:Kimi K3 每百万 $3.00 输入 / $15.00 输出,GPT-6 Sol $2.00 输入 / $10.00 输出
• 缓存输入:Kimi K3 每百万 $0.30,GPT-6 Sol 每百万 $0.20
• 长上下文定价:Kimi K3 列出单一费率,没有记录在案的分级;GPT-6 Sol 在输入 tokens 超过 272,000 时对整个请求重新定价为 $4.00 输入 / $15.00 输出
• 推理控制:GPT-6 Sol 暴露一个可配置的 reasoning.effort;Kimi K3 通过相同的 OpenAI 兼容接口暴露 reasoning 和 reasoning-effort 参数
Kimi K3 缺失输出上限这一点值得指出,而不应被轻描淡写地略过:MoonshotAI 公布了一个上下文数值,却没有公布最大输出数值,因此依赖硬性输出上限来做预算的系统无法从说明卡上直接读到这一数值。长上下文层级是另一处不对称,而且它朝着一个反直觉的方向切——GPT-6 Sol 的标称费率更低,但其超过 272K 后按整个请求重新计价,意味着一次 300,000 token 的调用从第一个 token 起就按 $4.00 / $15.00 计费,而 Kimi K3 单一的 $3.00 / $15.00 费率则没有任何分级计价的文档说明。对于一份非常长的文档,尽管标称价格更高,Kimi K3 在输入方面最终可能反而是两者中更便宜的那个。
Recall 是 Kimi K3 真正的产品
选择 Kimi K3 的理由不是它拥有大窗口——好几个模型都有。而是它能记住窗口里的内容。在 Artificial Analysis 的长上下文召回评测(收录于模型目录中)里,Kimi K3 得分 88.7%,而 GPT-6 Sol 为 83.7%。在衡量模型能否找到并使用埋在长输入中的细节这一确切测试上,这是五个百分点的差距,而这类差距在生产环境中会表现为真实故障——摘要器漏掉第 400 页上的那个从句,合同审查器错过赔偿条款。
Kimi K3 在编程方面同样领先,且领先幅度比综合指数所体现的更大。在编程指数上,它以 76.2 的成绩位列所评估模型的前十名之内,并在 terminal-bench v2.1 上取得 85.0% 的成绩——这一智能体命令行基准正是编程智能体实用性的关键所在。其 GPQA Diamond 得分 93.5%,处于榜单的最高档位。
GPT-6 Sol 扳回一城的地方在于综合基准和科学代码。其通用智能指数为 47.6,比 Kimi K3 的 43.6 高出四点,接近最高十分位;在 SciCode 上,两者分别为 57.6% 和 59.5%,基本持平,处于单次运行的噪声范围内;而在 Humanity's Last Exam 上,GPT-6 Sol 的 47.9% 略胜 Kimi K3 的 46.9%。这些单一基准上的差异,没有一个大到足以单独作为选择依据。

按工作负载计费,而非按费率卡
费率表之所以会误导人,是因为每项任务的输入与输出 token 比例都不相同,而这两个模型对于这笔交易中哪一侧更便宜的看法并不一致。Kimi K3 更便宜,前提是你的工作以输入为主——输入长文档,输出简短答案。GPT-6 Sol 更便宜,前提是你的工作负载均衡或以输出为主,因为它的输出费率低了三分之一。
• “读一本书并总结”场景(900K 输入,4K 输出):在 272K 重新定价生效前,Kimi K3 ≈ $2.76,GPT-6 Sol ≈ $3.64;重新定价后,GPT-6 Sol 的整个调用会移至更高档位,差距进一步拉大
• 平衡型智能体场景(60K 输入,20K 输出):Kimi K3 ≈ $0.48,GPT-6 Sol ≈ $0.32
• 代码生成场景(30K 输入,60K 输出):Kimi K3 ≈ $0.99,GPT-6 Sol ≈ $0.66
这些都是在各厂商公布费率上进行的原始token算术,且不包含缓存输入,而缓存对哪一方最有利,取决于你相对谁做缓存。真正重要的是答案的形态:对于纯粹的长输入回忆类任务,Kimi K3的固定费率胜出;而对于任何需要大量回写输出的场景,GPT-6 Sol更低的输出费率胜出。两者都不是普遍更便宜,而一个只点名某一方在价格上胜出、却不说明token比例的比较,根本没有在衡量任何东西。
来源是决策的一部分
Kimi K3 由中国的实验室 MoonshotAI 打造,而 GPT-6 Sol 出自 OpenAI。这一差异并非某项基准测试的成绩,也不会出现在价目表上,但对于受监管的工作负载而言,它早在讨论价格之前就已决定了入围名单。MoonshotAI 在目录中的卡片并未公布许可字段,因此此处的任何内容都不应被解读为对权重是否可获取的任何一方的声明——如果开放权重对你的部署很重要,请到源头核实,而不要仅凭模型家族的名称来臆断。
对于同时需要两者的团队——流水线的一部分用中国实验室的模型,另一部分用 OpenAI 的模型,而路由、计费和驻留问题都在一处处理——这正是值得拥有一个统一网关、而不是两套凭据的原因。在 OrcaRouter 上,kimi/kimi-k3和 GPT-6 Sol 都是同一目录中的实时路由,按提供商的标价、0% 加价,因此 MoonshotAI 或 OpenAI 的价格变动当天即可生效。自动故障转移意味着任一提供商上的某条路由性能下降也不会让流水线中断,并且路由 DSL 让你可以按规则而非靠猜测,把偏重召回的工作发给 Kimi K3,把偏重生成的工作发给 GPT-6 Sol。

把哪一个放进流水线
当任务是在超长输入上进行检索与记忆保持时,请选择 Kimi K3——法律与医疗文档审阅、全代码库理解、横跨数百份文档的转录分析——并且当你的提示词输入量足够大,以至于 3.00 美元的固定费率胜过 GPT-6 Sol 的重新定价时。其召回率领先优势与编程排名前十,正是支撑这一选择的两项数据。
当任务是由百万 token 窗口支撑的通用助手时,选择 GPT-6 Sol:混合推理、序列化为 JSON、需要大量回写的智能体循环,以及任何把 128,000 token 输出上限视为特性而非约束的工作流。它的输出成本更低,提供显式的推理强度控制,其综合指数是更强的通用信号。当一条流水线确实两者兼有时,诚实的答案是路由而非二选一——这是关于你流量形态的陈述,而非关于任一模型。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
