
GPT-6 Luna vs Kimi K3: Quatro Vezes a Capacidade de Processamento, Um Trigésimo do Preço, Uma Verdadeira Exceção
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dois modelos, ambos lançados nos últimos três meses, ambos posicionados como o nível barato de uma família de fronteira, e ambos errados sobre o que "nível barato" significa da mesma forma — o que não é o caso de forma alguma. Kimi K3 é o carro-chefe de pesos abertos da Moonshot AI, público sob licença MIT Modificada desde 27 de julho de 2026, com preço de US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de saída, com leituras de cache a US$ 0,30. GPT-6 Luna é o nível de volume do fornecedor, disponível em geral desde 22 de setembro de 2026 a US$ 0,10 e US$ 0,50, com leituras de cache a um centavo. Trinta vezes na entrada, trinta vezes na saída, e uma licença de um lado que o outro não pode oferecer a preço algum.
A tabela de preços não é o que decide esse pareamento, porém, porque não está próxima o suficiente para precisar de decisão. O que decide é um número que nenhum dos fornecedores coloca numa manchete: velocidade de saída medida. Kimi K3 gera 38,7 tokens por segundo. GPT-6 Luna gera 153,9. Isso é uma diferença de quatro vezes e, para qualquer carga de trabalho em que o modelo é um componente dentro de um loop, e não um endpoint com quem uma pessoa conversa, uma diferença de quatro vezes na taxa de transferência muda a arquitetura, e não a fatura.
O que esses dois realmente são
Kimi K3 é um modelo de mistura de especialistas com 2,8 trilhões de parâmetros, dos quais 104 bilhões ficam ativos por token, uma janela de contexto de 1.048.576 tokens, um teto de saída de 1.048.576 tokens e pesos publicados no Hugging Face sob uma licença MIT Modificada. É o modelo de pesos abertos com a maior pontuação no painel independente — primeiro entre 112 modelos de pesos abertos — e ocupa a primeira posição no leaderboard WebDev do Code Arena, com 1.679 Elo. A Moonshot relata 88,3% no Terminal-Bench 2.0, que é um número do fornecedor e não foi reproduzido de forma independente.
GPT-6 Luna é o modelo de nível pequeno da geração GPT-6 da OpenAI, posicionado abaixo do GPT-6 Sol, a US$ 2,00/US$ 10,00, e bem abaixo do carro-chefe GPT-6 Astra, a US$ 10,00/US$ 50,00. Entrada de texto e imagem, saída de texto, uma janela de 1.050.000 tokens com máximo de entrada de 922.000 e teto de saída de 128.000 tokens, e esforço de raciocínio selecionável entre none, low, medium, high, xhigh e max, com medium como padrão. É fechado, de identificador único e disponível para qualquer pessoa com uma chave de API.
Um é um download. Um é um endpoint. Ambos são precificados por volume. Essa é a forma da comparação.
Os cartões, linha por linha
Uma linha por dimensão, ambos os lados em cada:
• Entrada por 1M — GPT-6 Luna $0.10 vs Kimi K3 $3.00
• Saída por 1M — GPT-6 Luna $0.50 vs Kimi K3 $15,00
• Entrada em cache por 1M — GPT-6 Luna $0.01 vs Kimi K3 $0.30, um décimo de sua própria tarifa de entrada em ambos os cartões
• Cláusula de contexto longo — GPT-6 Luna dobra a entrada e o cache e eleva a saída 1,5× acima de 272.000 tokens de entrada, aplicada à solicitação inteira, versus Kimi K3, sem cláusula equivalente publicada em seu cartão
• Janela de contexto — GPT-6 Luna 1.050.000 tokens com 922.000 de entrada máxima vs Kimi K3 1.048.576 tokens
• Saída máxima — GPT-6 Luna 128.000 tokens vs Kimi K3 1.048.576 tokens, oito vezes o teto
• Índice de Inteligência, independente — GPT-6 Luna 37 com esforço máximo vs Kimi K3 44 com esforço máximo, mesma revisão do índice
• Pontuação de esforço padrão — GPT-6 Luna 29 no seu nível médio padrão vs Kimi K3 medido na sua configuração máxima
• Custo por tarefa do Index, independente — GPT-6 Luna cerca de US$ 0,07 vs Kimi K3 US$ 2,00
• Tokens de saída na execução do índice — GPT-6 Luna 150M vs Kimi K3 160M, contra uma mediana do ranking de 88M; ambos são muito mais verbosos do que o modelo mediano do ranking
• Velocidade de saída, independente — GPT-6 Luna 153,9 tokens/seg vs Kimi K3 38,7 tokens/seg
• Pesos — GPT-6 Luna fechado, somente API vs Kimi K3 público no Hugging Face desde 27 de julho de 2026
• Licença — GPT-6 Luna não aplicável vs Kimi K3 MIT Modificada, que não é o mesmo instrumento que o MIT
• Parâmetros totais — GPT-6 Luna não divulgados vs. Kimi K3 2,8 trilhões, dos quais 104 bilhões são ativos por token
• Evidência destacada — chamada de ferramentas e loops agênticos do GPT-6 Luna a um décimo de centavo por mil tokens de entrada em cache vs. Kimi K3 Code Arena WebDev #1 com 1.679 Elo, Terminal-Bench 2.0 88,3% relatado pelo fornecedor, melhor pontuação de pesos abertos no ranking independente
• No OrcaRouter — GPT-6 Luna não está no nosso catálogo vs. Kimi K3 roteável pelo preço de tabela da Moonshot

A taxa de transferência é a especificação da qual ninguém faz manchete
Um modelo de 38,7 tokens por segundo e um modelo de 153,9 tokens por segundo não são o mesmo produto com etiquetas de preço diferentes. São produtos diferentes.
Considere uma tarefa em que o modelo precisa produzir uma resposta de 1.500 tokens — um resumo, uma extração estruturada, um patch de código com sua explicação. A 153,9 tokens por segundo, essa resposta leva cerca de dez segundos. A 38,7, leva cerca de trinta e nove. Nenhum dos números inclui tempo de raciocínio nem latência de rede, então a diferença no mundo real é proporcionalmente maior que quatro vezes, não menor.
Agora coloque isso em um loop. Um agente que faz trinta chamadas de modelo para concluir uma tarefa — planejar, selecionar uma ferramenta, ler o resultado, decidir o próximo passo, repetir — produz talvez 15.000 tokens de saída ao longo dessas chamadas. O GPT-6 Luna gasta cerca de 97 segundos gerando. O Kimi K3 gasta cerca de 388. Essa é a diferença entre uma tarefa pela qual um usuário espera e uma tarefa que um usuário agenda, e nenhum nível de permissividade de licença muda isso.
A verbosidade agrava o problema de velocidade em vez de compensá-lo. O Kimi K3 gerou 160 milhões de tokens de saída ao completar o índice independente, em comparação com os 150 milhões do GPT-6 Luna — portanto, nessa avaliação, o modelo mais lento também produziu um pouco mais de tokens, não menos. Os dois modelos são igualmente verbosos; eles simplesmente não são igualmente rápidos, e, numa tabela de preços por saída, ser verboso sai caro duas vezes.
Vale a pena dizer claramente que isto não é um defeito do Kimi K3. Um modelo de 2,8 trilhões de parâmetros, com 104 bilhões ativos, faz mais trabalho por token do que um modelo de categoria pequena, e a métrica de throughput é uma medida desse trabalho. A pergunta relevante é se sua carga de trabalho precisa desse trabalho. Se precisar, 38,7 tokens por segundo é o preço da capacidade. Se não precisar, você está pagando trinta vezes mais por uma deliberação que não pediu.
Onde ficam os sete pontos do K3
Kimi K3 pontua 44 no Intelligence Index independente com esforço máximo. GPT-6 Luna pontua 37 na mesma configuração. Sete pontos, em uma métrica composta em que um ponto está dentro do ruído de uma nova execução — e os dois estão separados por cerca de vinte e oito vezes no custo por tarefa concluída, US$ 2,00 contra cerca de US$ 0,07.
Esses sete pontos não estão distribuídos uniformemente. A reputação do Kimi K3 está concentrada em programação e em trabalho de software agêntico, e é a razão pela qual o modelo existe: o ranking WebDev da Code Arena o coloca em primeiro lugar, com 1.679 Elo, e o número de 88,3% do Terminal-Bench 2.0 do fornecedor é uma medição de agente de programação. A própria posição de programação do GPT-6 Luna é um passo para trás, e não para frente — seu Coding Agent Index está em 41, dois pontos abaixo do GPT-5.6 Luna que ele substituiu, com as quedas concentradas em SWE-Atlas-QnA e DeepSWE v1.1. Se o seu trabalho é um agente que escreve software contra um repositório real, isso é uma lacuna de sete pontos no índice e uma regressão geracional de dois pontos apontando na mesma direção, e a justificativa para a camada barata fica consideravelmente mais fraca.
O que não está entre os sete pontos é a classe de trabalho para a qual o GPT-6 Luna é precificado. Classificação, extração, roteamento, sumarização em massa, o loop interno de um agente que precisa de um sim ou não rápido — nessas tarefas, os dois modelos produzirão o mesmo resultado utilizável na esmagadora maioria das vezes, e a diferença não sobreviverá ao contato com o seu próprio conjunto de avaliação. O índice mede uma métrica composta que dá muito peso a raciocínio de longo horizonte e programação, e nenhuma dessas coisas é o que uma decisão de roteamento exige.
Uma ressalva que vale a pena associar aos números do índice dos dois lados: este painel é uma avaliação com janela móvel e a sua revisão importa. Instantâneos anteriores da mesma tabela de classificação colocavam o Kimi K3 materialmente acima do 44 que a nossa captura mostra hoje, porque a métrica composta, o harness e o conjunto de modelos mudam todos. Qualquer comparação que se apoie na diferença exata entre dois modelos num índice móvel está se apoiando em algo que não vai permanecer estável. A leitura honesta é que estes dois estão em faixas de capacidade adjacentes nos seus limites, e que o índice não consegue dizer qual é melhor para a sua tarefa.
A exceção: o que o Modified MIT realmente lhe oferece
A licença do Kimi K3 é a única dimensão na qual o GPT-6 Luna não tem resposta a nenhum preço, e merece mais precisão do que a frase "pesos abertos" costuma receber.
Os pesos são públicos no Hugging Face e a licença é Modified MIT, não MIT. Essa distinção importa: uma licença Modified MIT normalmente anexa condições — comumente a exigência de exibir uma atribuição quando o modelo é usado em um produto acima de determinada escala — e qualquer pessoa que planeje construir um produto comercial com base nos pesos deve ler o instrumento real, em vez do nome da família com que se parece. Isso não é um motivo para evitá-lo. É um motivo para não descrevê-lo como MIT em um documento de aquisição.
O que o download proporciona é real e tem limites. Ele proporciona um piso de custo, no sentido de que uma capacidade fixa de GPU pode superar uma fatura por consumo em volume suficiente. Ele proporciona independência do roadmap de um fornecedor — um modelo que você hospeda não pode ser descontinuado à sua revelia. Ele proporciona a capacidade de fazer ajuste fino na sua própria distribuição. E proporciona a opção de manter prompts dentro da sua própria fronteira, o que, para algumas equipes, encerra a comparação antes mesmo que o preço seja mencionado.
O que custa é o hardware. Um modelo de mistura de especialistas com 2,8 trilhões de parâmetros e 104 bilhões de parâmetros ativos não é um modelo que roda em uma estação de trabalho. Servi-lo com throughput de produção é um compromisso à escala de cluster, com um custo de capital, um custo operacional e um perfil de latência que você possui em vez de alugar. Isso não é um argumento contra hospedar o Kimi K3 por conta própria — é um argumento de que a comparação correta não é $15,00 por milhão de tokens de saída contra $0,00, mas $15,00 por milhão de tokens de saída contra um custo por token totalmente carregado que inclui o silício e as pessoas. Para um pequeno número de organizações, esse número é menor. Para a maioria, não é, e o ponto de equilíbrio está mais distante do que a licença faz parecer.
Executando um deles, ou ambos
O Kimi K3 está no OrcaRouter pelo preço de tabela da Moonshot, dentro do modelo de preços repassados, o que significa que uma mudança de tarifa do fornecedor entra em vigor do nosso lado no mesmo dia. O failover automático é a parte que justifica seu lugar para este modelo em particular: um endpoint Kimi K3 auto-hospedado ou de terceiros se degradando é exatamente o cenário em que você quer que a rota mude sem um deploy, e um modelo de 38,7 tokens por segundo tem menos margem para absorver um upstream lento do que um rápido.
O GPT-6 Luna não está no nosso catálogo até o momento desta redação e é acessado pela própria API da OpenAI, então uma equipe que quer os dois usa uma chave para o Kimi K3 ao lado do que já usa para a OpenAI. Este também é o pareamento em que a DSL de roteamento faz algo que uma divisão codificada de forma fixa não consegue: uma regra que envia trabalho de programação e de longo horizonte para o Kimi K3 e tudo o que é consumido por programas e de curta duração para o GPT-6 Luna expressa um limite que muda toda vez que qualquer um dos fornecedores lança algo, e muda como configuração, e não como um caminho de código. A fusão de modelos é a outra configuração que vale a pena mencionar aqui — um painel formado por um modelo lento e cuidadoso e um modelo rápido e barato respondendo juntos, com o membro barato fazendo o volume e o caro julgando os casos que importam, é um formato ao qual este par de modelos se ajusta excepcionalmente bem, porque a assimetria de custo entre eles é grande o suficiente para que gastar uma chamada do Kimi K3 em uma pequena fração do tráfego seja acessível.

Qual deles, e quando
Escolha o GPT-6 Luna se sua carga de trabalho for de alto volume, consumida por programas e sensível à latência. Classificação, extração, roteamento, sumarização em massa, o loop interno de um agente. A US$ 0,10/US$ 0,50 com uma leitura em cache de um centavo e quatro vezes o throughput do Kimi K3, a conta não chega nem perto, e a diferença de latência não é marginal. Defina o parâmetro effort explicitamente, porque o padrão é medium e o número de destaque 37 é um valor de esforço máximo, e mantenha as chamadas longas do lado certo da linha de 272.000 tokens.
Escolha o Kimi K3 se precisar dos pesos, se o seu trabalho for codificação agêntica contra um repositório real, onde a sua posição no WebDev e os 88,3% relatados pelo fornecedor no Terminal-Bench 2.0 são as evidências que importam, se precisar de um limite de saída acima de 128.000 tokens, ou se a sua organização não puder enviar prompts para um endpoint fechado. Aceite 38,7 tokens por segundo como parte do acordo, e leia os termos da Modified MIT em vez de os presumir.
O erro que essa comparação convida a cometer é tratar a taxa de trinta vezes como a resposta a uma pergunta sobre capacidade. Ela é a resposta a uma pergunta sobre tokens. A questão da capacidade é resolvida por se você precisa dos pesos ou da velocidade, e essas duas respostas apontam em direções opostas.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
