
Grok 4.7 vs Kimi K3: Metade do preço, metade do contexto, nenhum dos pesos
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Pegue um mês de 300 milhões de tokens de trabalho de codificação agêntica e processe-o pelos dois modelos às suas tarifas de tabela, e a escolha deixa de parecer uma discussão sobre benchmarks. Grok 4.7, que a SpaceXAI lançou em 21 de setembro de 2026, cobra US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída. Kimi K3, que a Moonshot AI lançou em 16 de julho de 2026, cobra US$ 3 e US$ 15. Nesse mês hipotético — digamos, 200 milhões de entrada e 100 milhões de saída — o Grok 4.7 chega a cerca de US$ 1.000 e o Kimi K3 a cerca de US$ 2.100. A diferença não é uma questão de arredondamento; é o orçamento equivalente a um segundo modelo. Em contrapartida, o Kimi K3 oferece uma janela de contexto de 1.000.000 de tokens em vez de 500.000, entrada de vídeo nativa, além de imagens, e pesos para download. O Grok 4.7 oferece um modelo fechado, mais rápido e mais barato, treinado explicitamente para o trabalho de terminal de longo horizonte que o Kimi K3 também visa. Ambos são de classe frontier. Não são a mesma compra.
Os dois modelos, brevemente.
Grok 4.7 é o modelo de fronteira da SpaceXAI para codificação e trabalho de conhecimento, construído sobre um modelo base maior que o Grok 4.6 e submetido a uma execução mais longa de aprendizado por reforço voltada para tarefas que podem levar horas. É proprietário — sem pesos, sem download — atende a uma janela de contexto de 500.000 tokens, recebe texto e imagens como entrada e retorna texto, e oferece suporte a níveis de esforço de raciocínio de low a xhigh. Sua principal alegação é velocidade e preço: a SpaceXAI o posiciona como aproximadamente duas vezes mais rápido que modelos comparáveis por aproximadamente metade do preço.
O Kimi K3 é o modelo principal aberto de mistura de especialistas da Moonshot AI, o primeiro modelo aberto da classe de três trilhões de parâmetros: 2,8 trilhões de parâmetros no total, com 104 bilhões ativos por token, construído sobre o Kimi Delta Attention e pesos MXFP4 com reconhecimento de quantização. Ele aceita texto, imagens e vídeo como entrada, atende a um contexto de 1.000.000 de tokens, executa raciocínio sempre ativo com esforço configurável, e seus pesos podem ser baixados sob a Licença Kimi K3 — uso comercial permitido, com restrições. Por concepção, é o modelo que você pode levar para casa.
Essa é toda a diferença estrutural entre eles. Um é um endpoint barato, rápido e fechado. O outro é um artefato aberto mais caro, mais lento e com o dobro do contexto. Tudo o que vem abaixo é uma consequência disso.
O que os benchmarks realmente comparam
É aqui que a maioria das análises comparando Grok 4.7 com Kimi K3 erra, então vale a pena ser direto: os números publicados dos dois modelos, em grande parte, não medem as mesmas coisas, e pelo menos um par que parece comparável não é.
Comece pelo par que é genuinamente enganoso. O material de lançamento do Kimi K3 cita uma pontuação de 88,3 no Terminal-Bench 2.1. O material de lançamento do Grok 4.7 cita o Terminal-Bench 4.0 com 38,0%. São versões diferentes do benchmark, com conjuntos de tarefas diferentes e pontuação diferente, e colocá-las lado a lado sugeriria que o Kimi K3 é mais que o dobro do modelo agêntico. Não é uma leitura defensável, e ninguém deveria repeti-la. Ambos os números também são relatados pelo fornecedor — nenhum deles foi reproduzido de forma independente.
O que pode ser comparado é o composto independente, e aí os dois estão próximos. No atual Artificial Analysis Intelligence Index, versão v4.3.2, o Kimi K3 obtém 44 — segundo de 113 modelos, a colocação mais alta de qualquer modelo de pesos abertos no ranking. O Grok 4.7 obtém 46, décimo sexto de 655. Dois pontos de diferença, com a colocação do Kimi K3 alcançada com esforço máximo de raciocínio. No composto combinado, esses modelos estão em pé de igualdade.
• Compósito independente — Grok 4.7 com 46 no AA Intelligence Index v4.3.2, contra Kimi K3 com 44 na mesma versão. Um empate na prática.
• Janela de contexto — Grok 4.7 500.000 tokens vs Kimi K3 1.000.000 tokens. Uma vantagem real e inequívoca para o Kimi K3, e a única diferença de especificação sem qualquer ressalva.
• Modalidades de entrada — texto e imagem no Grok 4.7 vs. texto, imagem e vídeo no Kimi K3. O Kimi K3 é mais abrangente, se a sua carga de trabalho incluir vídeo.
• Pesos — Grok 4.7 proprietário, sem download, versus Kimi K3 com pesos abertos sob a Licença Kimi K3. Para um requisito on-premise ou air-gapped, esta é a única linha que importa.
• Preço por milhão de tokens — Grok 4.7 US$ 2 de entrada / US$ 6 de saída vs. Kimi K3 US$ 3 de entrada / US$ 15 de saída, com a tarifa de entrada em cache do Kimi a US$ 0,30 por milhão. O Grok 4.7 é mais barato em todos os aspectos, e drasticamente mais barato na saída.
• Controle de esforço de raciocínio — Grok 4.7 de low a xhigh vs. Kimi K3 sempre ativo com esforço configurável. Funcionalmente semelhantes; a diferença é que o Grok 4.7 permite reduzir o raciocínio.
• Evidência agêntica relatada pelo fornecedor — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (todos relatados pelo fornecedor) vs Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena primeiro lugar com 1.679 Elo (relatado pelo fornecedor no lançamento). Não comparável — veja acima.


Para onde o dinheiro realmente vai
A tabela de preços subestima a diferença, porque os dois modelos consomem tokens de forma diferente. O Grok 4.7 é um raciocinador verborrágico — a Artificial Analysis mediu 240 milhões de tokens de saída gerados durante a execução do seu Intelligence Index, contra uma mediana de 92 milhões entre os modelos. O Kimi K3 é o tipo oposto de caro: é um grande modelo de raciocínio sempre ativo e, a US$ 15 por milhão de tokens de saída, o que você está comprando é a verbosidade.
Então, o modelo de custo honesto não é “$2/$6 versus $3/$15”. É tokens de saída por tarefa concluída, multiplicados pela tarifa de saída, mais tokens de entrada, incluindo cada nova tentativa, multiplicados pela tarifa de entrada. Um modelo que resolve uma tarefa em uma única passagem longa a $6 por milhão pode superar um modelo que precisa de três tentativas a $15 por milhão, e também pode perder para ele se as passagens do modelo barato forem longas o suficiente. Essa é uma medição que você faz no seu próprio repositório, não uma que alguém publique para você.
Há uma assimetria que vale a pena conhecer antes de executá-lo: o Grok 4.6, antecessor do Grok 4.7, aplica um degrau de precificação em 200.000 tokens de entrada, em que uma requisição que ultrapassa o limite reprecifica toda a requisição pelo dobro da tarifa. O trabalho com contexto longo do lado do Grok precisa que isso seja conferido na tabela de preços atual do modelo que você implantar, porque uma janela de 500.000 tokens e um degrau de 200.000 tokens interagem mal. A precificação do Kimi K3 é linear, o que é a vantagem mais discreta entre os dois.
Onde cada um quebra
Ambos os modelos têm um modo de falha com o qual o material de lançamento não abre, e são falhas diferentes.
A questão do Kimi K3 é a confiabilidade sob carga sustentada. Testes da comunidade e independentes no lançamento relataram que seu desempenho agêntico se degrada à medida que as execuções se prolongam — resultados fortes em tentativa única, taxas de aprovação sustentadas mais fracas — e que sua velocidade de saída fica em torno de 37 a 38 tokens por segundo, o que é lento para programação interativa. A Moonshot também teve de pausar novas assinaturas de consumidor logo após o lançamento porque a demanda superou a capacidade, o que diz algo sobre a margem de atendimento no lado hospedado.
O Grok 4.7 tem o formato oposto: é rápido, barato e fechado, o que significa que você não pode inspecioná-lo, não pode executá-lo por conta própria e não pode se proteger contra uma descontinuação. A SpaceXAI já divulgou publicamente, em sequência, o Grok 4.8, o Grok 4.9 e o Grok 5 depois deste lançamento, e o Grok 4.6 durou cerca de cinco semanas antes de ser substituído. Tudo o que você construir com base no Grok 4.7 deve ser construído de modo que o ID do modelo seja um valor de configuração, e não uma suposição.
Há uma terceira consideração que não é uma falha de nenhum dos modelos: nenhum dos dois é a resposta certa para uma execução autônoma de duas semanas, e ambos os fornecedores demonstraram exatamente isso. As demos publicadas de codificação autônoma de 16 dias e 48 horas são realizadas pelos fornecedores, em tarefas escolhidas por eles, sem reprodução independente. Vale a pena conhecê-las, mas não vale a pena planejar com base nelas.

Executando ambos, e por que essa é a resposta real
A lacuna de custo e a lacuna de contexto apontam em direções opostas, o que é o argumento para não escolher uma. Kimi K3 justifica seu preço em trabalho em escala de repositório, onde uma janela de 1M significa que você não fragmenta a entrada, e em qualquer coisa que precise ser auto-hospedada. Grok 4.7 justifica seu preço em volume — loops de agente com muitos turnos, pipelines com muitas chamadas de ferramentas e longas sessões de terminal onde a velocidade e o custo de saída dominam.
O Kimi K3 está no OrcaRouter, o que faz dessa divisão uma decisão de roteamento e não de compra. Ele está no catálogo pelo preço de tabela da Moonshot e, como o OrcaRouter repassa o preço de tabela dos provedores com 0% de margem, um corte de preço do fornecedor entra em vigor aqui no mesmo dia em que é anunciado, e não na próxima renovação de contrato. Para cargas de trabalho em que uma passada de contexto longo e uma passada de execução devem colaborar em vez de competir — um modelo mantendo o repositório inteiro em vista, outro agindo sobre ele —, o DSL de roteamento compõe vários modelos em uma única chamada, e a fusão de modelos permite que um painel de modelos responda em conjunto quando a tarefa vale o gasto extra. Uma única chave de API cobre o Kimi K3 somado a mais de 200 outros modelos, de modo que a metade de execução dessa divisão pode vir do modelo que for mais barato e rápido para a tarefa, e não daquele que por acaso detém o contexto.
É preciso deixar uma coisa clara: os pesos abertos do Kimi K3 estão disponíveis para download, mas o endpoint hospedado é para onde o OrcaRouter encaminha. Se o seu requisito for genuinamente inferência on-premise, isso é um projeto de auto-hospedagem no seu próprio hardware, não uma decisão de roteamento — e é o único cenário em que esta comparação tem uma única resposta correta.
O veredicto, e o único número a reter
Se você está escolhendo com base em custo e velocidade, o Grok 4.7 vence e não é por pouco: metade do preço de entrada, menos da metade do preço de saída, serviço mais rápido e um ajuste de raciocínio que você pode reduzir. Se você está escolhendo com base em contexto, amplitude de modalidades ou capacidade de possuir o modelo, o Kimi K3 vence nos mesmos termos. Se você está escolhendo apenas com base em capacidade, o índice composto independente diz que eles estão separados por dois pontos, e você deve decidir com base na sua própria avaliação, e não no gráfico de lançamento de qualquer um dos fornecedores.
O número ao qual se agarrar é o de cima: $2/$6 contra $3/$15. Todo o resto nesta comparação é negociável, e essa proporção não é.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
