Kimi K3 é o modelo principal da Moonshot AI e seu lançamento mais capaz até o momento — um modelo Mixture-of-Experts de 2,8 trilhões de parâmetros construído para codificação de longo horizonte e trabalho de conhecimento de ponta a ponta. Ele combina um contexto de 1 milhão de tokens com compreensão visual nativa, aceitando entrada de texto e imagem com saída de texto, e é projetado para manter a coerência em sessões de agente muito longas. A Moonshot posiciona o K3 para cenários de agente de programação como Codex, Claude Code, Cline e RooCode, bem como para raciocínio profundo e trabalho de conhecimento. Ele expõe um controle superior de reasoning_effort e chamada de ferramentas nativa, e fala o formato da API OpenAI para integração direta. Observe que o K3 não aceita parâmetros de amostragem (sem temperature / top_p / seed) — a profundidade do raciocínio é controlada através do reasoning_effort.
MoonshotAI Kimi K3 é um modelo de linguagem de grande porte desenvolvido pela MoonshotAI, uma empresa chinesa de IA. Suporta uma janela de contexto de 1.048.576 tokens e aceita entradas de texto e…
A capacidade principal do Kimi K3 é processar uma janela de contexto de até 1.048.576 tokens, permitindo incorporar romances inteiros, manuais técnicos extensos ou longos históricos de conversa em um único prompt. Ele também aceita imagens, possibilitando raciocínio multimodal. O modelo pode realizar tarefas como sumarização, resposta a perguntas e geração em entradas muito longas. É capaz de entender instruções complexas e segui-las ao longo de longas sequências. Suporta parâmetros de API compatíveis com OpenAI, como temperatura, max_tokens, top_p e sequências de parada por meio do OrcaRouter.
Kimi K3 é melhor utilizado quando a tarefa exige inerentemente um contexto muito grande — por exemplo, analisar um documento de 1,000 páginas de uma só vez, ou manter uma conversa com um histórico completo de centenas de mensagens. Para entradas mais curtas, seu custo mais alto por token ($3/$15 por milhão) pode não ser justificado. Modelos mais baratos com janelas de contexto menores podem lidar com a maioria das tarefas típicas de forma mais eficiente. Use Kimi K3 apenas quando a tarefa exigir a janela de contexto completa para evitar truncamento ou múltiplas etapas de chunk-and-summarize.
Kimi K3 se destaca em tarefas onde a informação está distribuída em um texto muito longo ou inclui imagens. Exemplos incluem extrair fatos-chave de um relatório do tamanho de um livro, responder perguntas sobre uma base de código completa, comparar múltiplos artigos de pesquisa ou analisar uma série de diagramas. Também pode manter consistência em diálogos longos. Sua força reside na capacidade de atender a todas as partes do contexto simultaneamente, reduzindo a necessidade de recuperação externa ou fragmentação.
Embora o Kimi K3 tenha uma janela de contexto grande, ele pode não ter um desempenho tão bom quanto modelos menores e ajustados em tarefas restritas. O contexto grande também pode aumentar a latência e o custo computacional. Limitações exatas (por exemplo, resolução máxima de imagem, tipos de arquivo suportados, proficiência no idioma) não são especificadas nos fatos fornecidos, mas são inerentes ao design do modelo. Os usuários devem estar cientes de que prompts muito longos consomem muitos tokens e, portanto, geram custos mais altos. O modelo é acessado através do OrcaRouter; aplicam-se o tempo de atividade do provedor e os tempos de resposta.
Os fatos fornecidos não incluem pontuações de referência específicas para o Kimi K3. Em geral, modelos de contexto grande são avaliados em tarefas como o teste Needle in a Haystack, QA de documentos longos e sumarização. A MoonshotAI pode ter publicado resultados; os usuários devem consultar a documentação oficial. O desempenho do modelo em benchmarks de NLP padrão (ex.: MMLU, GSM8K) não é declarado. Recomendamos testar o Kimi K3 em seu próprio conjunto de avaliação para medir sua eficácia para o seu caso de uso.
Uma janela de contexto de 1.048.576 tokens significa que o modelo pode processar aproximadamente 1,5 milhão de palavras em inglês ou 800.000 caracteres chineses em uma única passagem. Na prática, isso permite lidar com livros inteiros, registros extensos de conversas ou dados multimodais com muitas imagens. No entanto, nem todos os tokens podem ser igualmente utilizados; mecanismos de atenção às vezes focam mais em partes recentes ou salientes. A capacidade do modelo de recuperar informações do meio de contextos longos pode ser testada. O desempenho em tais tarefas é frequentemente melhor do que modelos com contexto menor, mas ainda pode ter espaço para melhoria.
Latência e throughput não são especificados nos dados fornecidos. Modelos com janelas de contexto muito grandes geralmente levam mais tempo para processar cada solicitação porque o mecanismo de atenção escala quadraticamente com o comprimento da sequência. Para uma saída completa de 1M tokens, espere alta latência. Através do OrcaRouter, você pode definir max_tokens para limitar o tamanho da saída e controlar o tempo de resposta. Para aplicações em tempo real, considere usar modelos menores. O processamento em lote de tarefas mais longas pode ser mais prático. O desempenho real dependerá da infraestrutura do provedor e da carga atual.
A grande janela de contexto do Kimi K3 é uma vantagem, mas também um desafio. Ele pode não ser tão preciso em tarefas que exigem raciocínio preciso em entradas curtas em comparação com modelos especializados. O modelo pode apresentar qualidade inferior em áreas como escrita criativa ou geração de código em comparação com modelos ajustados para essas tarefas. Além disso, o custo por token é relativamente alto, portanto, usá-lo para prompts curtos é ineficiente. O modelo é relativamente novo; estabilidade de longo prazo e suporte da MoonshotAI são fatores a considerar.
Kimi K3 custa $3.00 por 1 milhão de tokens de entrada e $15.00 por 1 milhão de tokens de saída. Estas são as taxas do provedor, sem nenhum acréscimo da OrcaRouter. Os tokens de entrada incluem tokens de texto e imagem (as imagens são cobradas com base em seu equivalente em tokens). Os tokens de saída são quaisquer tokens gerados pelo modelo. Não há taxas adicionais além dos custos por token. Os preços estão sujeitos a alterações pelo provedor, mas a OrcaRouter repassa as taxas sem adicionar margem.
Como o Kimi K3 pode lidar com contextos extremamente longos, ele pode substituir várias chamadas de API que seriam necessárias com modelos de contexto menor, potencialmente reduzindo o custo geral para tarefas que exigem processamento completo de documentos. No entanto, cada token é mais caro do que muitos modelos compactos. Por exemplo, uma entrada de 1M-token a $3.00 é fixa, enquanto um modelo menor pode custar $0.15 por milhão, mas exigir várias chamadas para processar os mesmos dados. A compensação está entre a simplicidade e o custo por token. Os usuários devem estimar o uso total de tokens por tarefa.
Os fatos fornecidos não mencionam nenhum cache ou descontos por volume para Kimi K3 no OrcaRouter. O preço é estritamente por token, conforme cobrado pelo provedor. O OrcaRouter pode oferecer recursos como registro de solicitações ou tentativas repetidas, mas nenhuma redução específica de preço é indicada. Os usuários devem verificar a página de preços atual do OrcaRouter para quaisquer atualizações. Em geral, usuários de alto volume podem negociar diretamente com o provedor, mas através do OrcaRouter, as taxas listadas se aplicam.
As imagens são convertidas em tokens para fins de faturamento. A tokenização exata das imagens depende da resolução e do algoritmo do provedor. Normalmente, uma imagem padrão (por exemplo, 1024x1024) pode custar na ordem de centenas de tokens. Como o preço de entrada do Kimi K3 é de $3,00 por 1M de tokens, incluir imagens em um prompt aumenta a contagem de tokens de entrada e, portanto, o custo. Para cargas de trabalho com muitas imagens, o custo total pode aumentar rapidamente. É aconselhável minimizar o tamanho das imagens ou incluir apenas imagens relevantes para controlar as despesas.
O Kimi K3 é acessado através da API compatível com OpenAI do OrcaRouter. Você envia solicitações HTTP POST para https://api.orcarouter.ai/v1/chat/completions com o parâmetro model definido como "kimi/kimi-k3". O formato da solicitação é idêntico ao da API Chat Completions da OpenAI: inclua um array messages com funções system, user e assistant. Para entradas de imagem, use o array content com o tipo "image_url". Certifique-se de ter uma chave de API do OrcaRouter. Nenhuma configuração especial é necessária; parâmetros padrão como temperature, max_tokens, top_p e stop são suportados.
Através do OrcaRouter, o Kimi K3 suporta parâmetros padrão compatíveis com OpenAI: temperature (padrão 0.7), max_tokens (até o limite de saída do modelo, que não é especificado, mas provavelmente menor que 32K), top_p, frequency_penalty, presence_penalty, sequências de parada e n (número de conclusões). O modelo também aceita um parâmetro stream para saída em tempo real. Para entradas de imagem, você pode usar o formato de conteúdo multimodal. Parâmetros não suportados serão ignorados. A grande janela de contexto permite definir um max_tokens alto para saídas longas, mas lembre-se do custo.
A migração é direta se você já usa uma API compatível com OpenAI. Altere a URL base para https://api.orcarouter.ai/v1, atualize o ID do modelo para "kimi/kimi-k3" e defina sua chave de API OrcaRouter. Nenhuma alteração de código é necessária se você usar o mesmo formato de mensagem. Para suporte a imagens, garanta que seus prompts incluam URLs de imagem ou dados base64. Você pode precisar ajustar max_tokens e outros parâmetros para se adequar às capacidades do modelo. Teste com uma pequena amostra primeiro para verificar a qualidade e o custo da saída.
Você precisa de uma chave de API do OrcaRouter. Inclua-a no cabeçalho Authorization como Bearer YOUR_API_KEY. OrcaRouter gerencia autenticação e faturamento. Por segurança, não compartilhe sua chave. OrcaRouter também pode suportar rotação de chave de API. Não é necessária autenticação adicional do MoonshotAI. Todas as solicitações passam pela infraestrutura do OrcaRouter, que lida com limitação de taxa e tratamento de erros. Certifique-se de que suas solicitações estejam em conformidade com os termos de serviço do OrcaRouter.
Kimi K3 oferece uma janela de contexto de 1.048.576 tokens, que está entre as maiores disponíveis. É comparável a modelos de outros provedores que também suportam contextos de milhões de tokens. Seu preço de US$ 3/US$ 15 por milhão de tokens é competitivo. Diferente de alguns modelos, o Kimi K3 suporta entradas multimodais (texto e imagem). Um diferencial importante é que ele é acessado via OrcaRouter sem margem de lucro. Quando comparado a modelos como GPT-4 Turbo (contexto de 128K, custo mais alto), o Kimi K3 pode ser mais barato para sequências muito longas, mas pode ter perfis de qualidade diferentes. Comparações de benchmark não são fornecidas.
Escolha o Kimi K3 quando a tarefa exigir a janela de contexto grande completa — por exemplo, analisar um documento de 500 páginas de uma só vez, ou incluir muitas imagens em um único prompt. Modelos mais baratos com janelas de contexto menores (por exemplo, 128K tokens) podem forçá-lo a dividir a entrada, perdendo referências cruzadas. Se a tarefa puder ser dividida sem perda de qualidade, um modelo mais barato é preferível devido ao menor custo por token. Considere também se os pontos fortes específicos do modelo (multimodal, longo contexto) são críticos.
Os fatos fornecidos cobrem apenas o Kimi K3. A MoonshotAI possui modelos anteriores como Kimi e Kimi K2. O Kimi K3 é o mais recente com uma janela de contexto maior e suporte multimodal. Modelos anteriores provavelmente têm contextos menores e podem não aceitar imagens. O preço para outros modelos não é fornecido. Para usuários existentes de modelos mais antigos da MoonshotAI, a atualização para o Kimi K3 oferece capacidades expandidas, mas a um custo maior por token. A decisão depende se o contexto maior e as entradas de imagem justificam o prêmio.
Compatível com OpenAI — mantenha seu SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="kimi/kimi-k3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatstopstructured_outputstool_choicetools| Entrada / 1M tokens | $3.00 |
| Saída / 1M tokens | $15.00 |
| Leitura de cache / 1M | $0.300 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
Do que os desenvolvedores estão falando esta semana
GET /api/public/models/kimi/kimi-k3Abrir @misc{orcarouter_kimi_k3,
title = {Kimi K3 API},
author = {MoonshotAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/kimi/kimi-k3}
}MoonshotAI. (2026). Kimi K3 API. OrcaRouter. https://www.orcarouter.ai/models/kimi/kimi-k3