Kimi K3

kimi/kimi-k3
Destaque
VisãoFerramentasJSONRaciocínio
por MoonshotAI · 2026-07-15

Kimi K3 é o modelo principal da Moonshot AI e seu lançamento mais capaz até o momento — um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros construído para codificação de longo horizonte e trabalho de conhecimento de ponta a ponta. Ele combina um contexto de 1 milhão de tokens com compreensão visual nativa, aceitando entrada de texto e imagem com saída de texto, e é projetado para manter a coerência em sessões de agente muito longas. A Moonshot posiciona o K3 para cenários de agente de programação como Codex, Claude Code, Cline e RooCode, bem como para raciocínio profundo e trabalho de conhecimento. Ele expõe um controle superior de reasoning_effort e chamada de ferramentas nativa, e fala o formato da API OpenAI para integração direta. Observe que o K3 não aceita parâmetros de amostragem (sem temperature / top_p / seed) — a profundidade do raciocínio é controlada através do reasoning_effort.

ctx1M tokens
Entradatext + image
Saídatext
p50 TTFT6.25 s
ENTRADA$3.00/ 1M tokens
SAÍDA$15.00/ 1M tokens
p50 TTFT6.25 s7 d
p95 TTFT10.00 s7 d
TRÁFEGO12237.0Mtokens / 7 d

MoonshotAI Kimi K3 é um modelo de linguagem de grande porte desenvolvido pela MoonshotAI, uma empresa chinesa de IA. Suporta uma janela de contexto de 1.048.576 tokens e aceita entradas de texto e…

O que é MoonshotAI Kimi K3?

Para quem é o Kimi K3 projetado?

Como o Kimi K3 lida com entradas multimodais?

Que tipo de desempenho pode ser esperado do Kimi K3?

Exemplos de código

Chame de qualquer SDK

Compatível com OpenAI — mantenha seu SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="kimi/kimi-k3",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parâmetros suportados

  • frequency_penalty
  • include_reasoning
  • max_tokens
  • presence_penalty
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • structured_outputs
  • tool_choice
  • tools

Preços

Entrada / 1M tokens$3.00
Saída / 1M tokens$15.00
Leitura de cache / 1M$0.300
MoedaUSD

Calculadora de custos

Tokens / mês10MM
Proporção de entrada70%%
Estimado / mês $66.00 · Com cache de prompt $56.55

Estimativa com base no preço de tabela

Estimador de tokens e custo

Tokens de entrada: 15Custo por solicitação: $0.007545

Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.

Desempenho

p50 TTFT
6.25 s
Velocidade de saída
37.6 tok/s
p95 TTFT
10.00 s
Taxa de erro
66.6%

Benchmarks públicos

76.2
AA Coding
Melhor que 96% dos modelos comparados
nº 6 de 134
59.7
AA Intelligence
Melhor que 94% dos modelos comparados
nº 8 de 136
GPQA Diamond
93.5
Humanity's Last Exam
46.9
Long-Context Recall
82.7
SciCode
58.7
tau_banking
46.0
terminalbench_v2_1
85.0
Fonte: artificialanalysis.ai

Atividade da comunidade

Do que os desenvolvedores estão falando esta semana

Hacker News4 menções · 7 d

Comparativo

Kimi K3kimi/kimi-k2.6Kimi K2.7 Codekimi/kimi-k2.5
Entrada $/M$3.00$0.95$0.95$0.60
Saída $/M$15.00$4.00$4.00$3.00
Contexto1.0M262K262K262K
Qualidade9/108/108/107/10
Comparar lado a ladoComparar lado a ladoComparar lado a ladoComparar lado a lado

FAQ

Qual é o custo para usar o Kimi K3?
Kimi K3 tem preço de $3.00 por 1 milhão de tokens de entrada e $15.00 por 1 milhão de tokens de saída. Esta é a taxa do provedor sem margem de lucro. Os tokens de entrada incluem tokens de texto e imagem. Os tokens de saída são os tokens gerados.
Qual é o tamanho da janela de contexto do Kimi K3?
Kimi K3 possui uma janela de contexto de 1.048.576 tokens. Isso equivale a aproximadamente 1,5 milhão de palavras em inglês ou 800.000 caracteres chineses. Pode lidar com documentos muito longos ou históricos extensos em uma única solicitação.
Quais são os principais pontos fortes do Kimi K3?
Os principais pontos fortes são sua janela de contexto muito grande e suporte multimodal (texto e imagem). Ele se destaca em tarefas que exigem processamento de longas sequências, como análise de livros completos, compreensão extensiva de bases de código e raciocínio multimodal em muitas imagens.
Como o Kimi K3 se compara ao GPT-4 Turbo?
Kimi K3 tem uma janela de contexto maior (1M vs 128K) e suporta imagens a um custo menor por token. GPT-4 Turbo normalmente tem desempenho mais forte em benchmarks restritos. A melhor escolha depende dos requisitos de comprimento de contexto da sua tarefa e das expectativas de qualidade.
O OrcaRouter armazena ou treina com meus dados ao usar o Kimi K3?
OrcaRouter não treina com seus dados. Seus prompts são encaminhados ao provedor (MoonshotAI) para inferência. As políticas de tratamento de dados da MoonshotAI se aplicam. OrcaRouter pode manter registros para fins operacionais, mas não utiliza dados de clientes para melhorias do modelo.
Como faço para chamar o Kimi K3 via a API compatível com OpenAI do OrcaRouter?
Envie solicitações para https://api.orcarouter.ai/v1/chat/completions com o ID do modelo "kimi/kimi-k3". Use o formato padrão de Chat Completions com um array de mensagens. Para imagens, use o tipo de conteúdo "image_url". Inclua sua chave de API do OrcaRouter no cabeçalho Authorization.
Qual é a latência esperada para o Kimi K3?
Os valores exatos de latência não são fornecidos. Como o modelo suporta contextos muito longos, o tempo de processamento aumenta com o comprimento da entrada. Para uma entrada de 1M-token, espere uma latência significativamente maior do que para entradas mais curtas. Use streaming para obter respostas parciais mais rapidamente.
Posso usar Kimi K3 para aplicações em tempo real?
O uso em tempo real é possível, mas a latência pode ser alta para contextos grandes. É mais adequado para processamento em lote offline, como análise de documentos. Para aplicações interativas, considere definir um max_tokens pequeno e limitar o comprimento da entrada.
Quais formatos e tamanhos de imagem o Kimi K3 suporta?
Os fatos fornecidos não especificam formatos de imagem suportados ou resolução máxima. Na prática, a maioria dos modelos multimodais aceita formatos comuns como JPEG, PNG e WebP. Para melhores resultados, use imagens com resolução moderada e evite arquivos extremamente grandes para controlar o custo de tokens.
Como faço para estimar o uso de tokens para uma determinada entrada?
OrcaRouter não fornece um tokenizer, mas você pode usar APIs que retornam contagens de tokens ou estimar com bibliotecas como tiktoken (for OpenAI) com cautela. Para imagens, assuma uma contagem fixa de tokens por imagem com base na resolução. Teste com entradas de amostra para avaliar o uso real.

Incorporar este selo

MoonshotAI: Kimi K3$3.00/M in6254ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/kimi/kimi-k3" target="_blank"> <img src="https://www.orcarouter.ai/embed/kimi/kimi-k3.svg" alt="MoonshotAI: Kimi K3 no OrcaRouter" /> </a>
Markdown [![MoonshotAI: Kimi K3](https://www.orcarouter.ai/embed/kimi/kimi-k3.svg)](https://www.orcarouter.ai/models/kimi/kimi-k3)

Ficha do modelo como dados

GET /api/public/models/kimi/kimi-k3Abrir
Legível por máquina:/llms.txt/llms-full.txt