Kimi K3是Moonshot AI的旗舰模型,也是迄今为止能力最强的版本——一个拥有2.8万亿参数的混合专家模型,专为长周期编程和端到端知识工作而构建。它配备了100万token的上下文窗口和原生视觉理解能力,接受文本和图像输入并输出文本,设计用于在超长智能体会话中保持连贯性。 Moonshot将K3定位于编程智能体场景,如Codex、Claude Code、Cline和RooCode,以及深度推理和知识工作。它暴露了顶层的reasoning_effort控制和原生工具调用,并采用OpenAI API格式以实现即插即用集成。请注意,K3不接受采样参数(无temperature / top_p / seed)——推理深度通过reasoning_effort控制。
MoonshotAI Kimi K3是由中国AI公司MoonshotAI开发的大型语言模型。它支持1,048,576个令牌的上下文窗口,接受文本和图像输入。该模型专为需要保留和推理极长信息序列的任务而设计,例如整本书、长篇幅研究论文或扩展对话。它通过OrcaRouter的OpenAI兼容API访问,基础URL为https://api.orcarouter.ai/v1,使用模型ID…
Kimi K3 的主要能力是处理高达 1,048,576 个 token 的上下文窗口,使其能够在单次提示中融入整本小说、长篇技术手册或大量对话历史。它还支持图像输入,实现多模态推理。该模型能够对超长输入执行摘要、问答和生成等任务,并能理解复杂指令并在长序列中遵循执行。通过 OrcaRouter,它支持与 OpenAI 兼容的 API 参数,例如 temperature、max_tokens、top_p 和停止序列。
Kimi K3 最适合在任务本身需要极大上下文窗口时使用——例如一次性分析一份1000页的文档,或维持包含数百条完整历史消息的对话。对于较短输入,其每个token更高的成本(每百万token $3/$15)可能并不划算。上下文窗口较小的廉价模型能更高效地处理大多数常规任务。仅在任务需要完整上下文窗口以避免截断或多次分块总结步骤时,才使用Kimi K3。
Kimi K3 擅长处理信息分散在极长文本或包含图像的任务。例如,从书卷长度的报告中提取关键事实、回答关于完整代码库的问题、比较多篇研究论文,或分析一系列图表。它还能在长时间对话中保持一致性。其优势在于能够同时关注上下文的所有部分,从而减少对外部检索或分块的依赖。
虽然Kimi K3拥有较大的上下文窗口,但在狭窄任务上,其表现可能不如经过微调的小型模型。大上下文窗口还会增加延迟和计算成本。具体的限制(例如最大图像分辨率、支持的文件类型、语言能力)在给定事实中并未说明,但这些是模型设计固有的。用户应注意,非常长的提示会消耗大量令牌,从而导致更高的成本。该模型通过OrcaRouter访问,需考虑提供商的正常运行时间和响应时间。
提供的事实不包括 Kimi K3 的具体基准分数。通常,大上下文模型会在“大海捞针”测试、长文档问答和摘要等任务上进行评估。MoonshotAI 可能已经发布了结果;用户应查阅官方文档。该模型在标准 NLP 基准(例如 MMLU、GSM8K)上的表现未作说明。我们建议在您自己的评估集上测试 Kimi K3,以衡量其对您用例的有效性。
一个1,048,576个token的上下文窗口意味着该模型单次可以处理大约150万个英文单词或80万个汉字。在实际应用中,这使得处理整本书籍、大量的对话记录或包含许多图像的多模态数据成为可能。然而,并非所有token都能被同等利用;注意力机制有时会更多地关注最近或突出的部分。可以测试模型从长上下文中间检索信息的能力。在这类任务上的表现通常优于小上下文模型,但仍可能有改进空间。
给定事实中未指定延迟和吞吐量。具有极大上下文窗口的模型通常处理每个请求需要更长时间,因为注意力机制随序列长度呈二次方增长。对于完整的100万token输出,预计会有高延迟。通过OrcaRouter,您可以设置max_tokens来限制输出长度并控制响应时间。对于实时应用,建议使用较小的模型。批处理较长任务可能更实用。实际性能将取决于提供商的架构和当前负载。
Kimi K3的大型上下文窗口既是优势也是挑战。与专注特定任务的模型相比,它在需要精确处理短输入的推理任务上可能不够精准。该模型在创意写作或代码生成等领域,相较针对这些任务微调的模型,可能表现稍逊。此外,每个词元的成本相对较高,因此用于短提示词效率较低。该模型较新,其长期稳定性及来自MoonshotAI的支持是需要考虑的因素。
Kimi K3 的定价为每百万输入代币 3.00 美元,每百万输出代币 15.00 美元。这些是提供商的费率,OrcaRouter 不添加任何加价。输入代币包括文本和图像代币(图像按其代币等价物计费)。输出代币是模型生成的任何代币。除按代币计费的成本外,不收取任何额外费用。定价可能由提供商更改,但 OrcaRouter 以不加利润的方式传递费率。
由于Kimi K3能够处理极长上下文,它可以替代较小上下文模型所需的多次API调用,从而降低需完整文档处理任务的总体成本。不过,每个token的单价高于许多紧凑型模型。例如,处理100万token的输入固定费用为$3.00,而小模型虽每百万token仅需$0.15,但处理相同数据需多次调用。这本质上是简洁性与单token成本之间的权衡。用户应根据任务估算总token用量。
提供的事实并未提及OrcaRouter上Kimi K3的任何缓存或批量折扣。定价严格按提供商计费的每个token计算。OrcaRouter可能提供请求日志或重试等功能,但未指示具体价格降低。用户应查看OrcaRouter当前定价页面以了解任何更新。通常,高用量用户可直接与提供商协商,但通过OrcaRouter,适用所列费率。
图像会根据其分辨率和服务商的算法被转换为令牌计费。通常,一张标准图像(例如1024x1024)可能消耗数百个令牌。由于Kimi K3的输入价格为每百万令牌3.00美元,在提示词中包含图像会增加输入令牌数量,从而提高成本。对于包含大量图像的工作负载,总成本会迅速累积。建议尽量缩小图像尺寸或仅包含相关图像以控制费用。
Kimi K3 通过 OrcaRouter 的 OpenAI 兼容 API 进行访问。您需要向 https://api.orcarouter.ai/v1/chat/completions 发送 HTTP POST 请求,并将模型参数设置为 "kimi/kimi-k3"。请求格式与 OpenAI 的 Chat Completions API 完全相同:需包含一个消息数组,其中 roles 可为 system、user 和 assistant。对于图像输入,请使用包含 type 为 "image_url" 的 content 数组。请确保您拥有 OrcaRouter 提供的 API 密钥。无需特殊配置,支持温度、max_tokens、top_p 和 stop 等标准参数。
通过OrcaRouter,Kimi K3支持标准OpenAI兼容参数:temperature(默认0.7)、max_tokens(最高至模型输出限制,该限制未指定但可能小于32K)、top_p、frequency_penalty、presence_penalty、stop sequences和n(生成回复数量)。该模型还接受stream参数用于实时输出。对于图像输入,您可以使用多模态内容格式。不支持的参数将被忽略。大上下文窗口允许设置较高的max_tokens以生成长输出,但需注意成本。
如果您已经使用兼容 OpenAI 的 API,迁移非常简单。将基础 URL 更改为 https://api.orcarouter.ai/v1,将模型 ID 更新为 "kimi/kimi-k3",并设置您的 OrcaRouter API 密钥。如果使用相同的消息格式,无需修改代码。对于图像支持,请确保您的提示中包含图像 URL 或 base64 数据。您可能需要调整 max_tokens 和其他参数以适应模型的能力。先使用小样本进行测试,以验证输出质量和成本。
您需要从OrcaRouter获取一个API密钥。将其作为Bearer YOUR_API_KEY包含在Authorization标头中。OrcaRouter负责身份验证和计费。为了安全起见,请勿共享您的密钥。OrcaRouter可能还支持API密钥轮换。MoonshotAI无需额外的身份验证。所有请求都通过OrcaRouter的基础设施处理,该设施负责速率限制和错误处理。请确保您的请求符合OrcaRouter的服务条款。
Kimi K3 的上下文窗口为 1,048,576 个 tokens,属于目前最大的之一。与其他同样支持百万 token 上下文的模型相当。其定价为每百万 tokens 3 美元/15 美元,具有竞争力。与某些模型不同,Kimi K3 支持多模态输入(文本和图像)。一个关键区别在于,它通过 OrcaRouter 访问且无加价。与 GPT-4 Turbo(128K 上下文、更高成本)等模型相比,Kimi K3 在极长序列上可能更便宜,但质量表现可能有所不同。未提供基准测试对比。
当任务需要完整的超大上下文窗口时,选择Kimi K3——例如,一次性分析500页文档,或在单条提示中包含大量图片。上下文窗口较小的廉价模型(如128K tokens)可能会迫使你将输入分块,从而丢失交叉引用。如果任务可以无损拆分,则由于每token成本较低,更推荐使用廉价模型。同时需考虑模型的特定优势(多模态、长上下文)是否至关重要。
提供的信息仅涵盖Kimi K3。MoonshotAI此前已有Kimi和Kimi K2等模型。Kimi K3是最新的,具有更大的上下文窗口和多模态支持。早期模型可能上下文较小,且可能不支持图像输入。其他模型的定价未给出。对于MoonshotAI旧模型的现有用户,升级到Kimi K3可提供更强大的功能,但每Token成本更高。是否升级取决于更大的上下文和图像输入是否值得支付溢价。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| 输入 / 1M tokens | $3.00 |
| 输出 / 1M tokens | $15.00 |
| 缓存读取 / 1M | $0.300 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3