
GPT-6 vs Kimi K3: Dois Modelos de Milhões de Tokens Que se Especializam de Formas Diferentes
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
GPT-6 Sol e Kimi K3 são os dois modelos com maior probabilidade de serem pré-selecionados para o mesmo trabalho: uma janela de contexto de um milhão de tokens, entrada de imagem e um preço que torna documentos longos acessíveis. Eles chegaram lá por direções opostas. Kimi K3 é o especialista em contexto longo da MoonshotAI, lançado em 15 de julho de 2026, e sua ficha técnica é construída em torno da recuperação — ele pontua 88,7% no teste de recuperação de contexto longo da Artificial Analysis, à frente de todos os modelos do fornecedor com o qual podemos compará-lo. GPT-6 Sol é o generalista de nível intermediário do fornecedor, lançado em 22 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, e seu argumento é a amplitude: uma janela um pouco maior, uma pontuação composta de raciocínio geral mais alta e um token de saída mais barato.
Então, o enquadramento honesto não é melhor versus pior. É recuperação versus raciocínio, e isso é decidido pelo que você está fazendo com o milhão de tokens depois de carregá-los.
As janelas têm o mesmo tamanho no papel.
Ambos os cartões indicam aproximadamente um milhão de tokens, e a diferença é cosmética. A janela do Kimi K3 é de 1.048.576 tokens — exatamente 2^20, o milhão binário que todo modelo de contexto longo cita. A do GPT-6 Sol é de 1.050.000, um número decimal redondo cerca de 1.400 tokens maior. Para qualquer carga de trabalho que você consiga realmente acomodar, são a mesma janela. Não escolha com base nisso.
O que difere é o resto do envelope, e é uma lista curta.
• Contexto: Kimi K3 1.048.576 tokens, GPT-6 Sol 1.050.000 — efetivamente equivalentes
• Modalidade de entrada: Kimi K3 aceita texto e imagens; GPT-6 Sol aceita texto, imagens e arquivos
• Limite de saída: GPT-6 Sol 128.000 tokens em uma resposta; a ficha técnica do Kimi K3 não publica um valor máximo de saída
• Preço padrão: Kimi K3 $3,00 de entrada / $15,00 de saída por milhão, GPT-6 Sol $2,00 de entrada / $10,00 de saída
• Entrada em cache: Kimi K3 $0,30 por milhão, GPT-6 Sol $0,20 por milhão
• Preço para contexto longo: Kimi K3 lista uma única tarifa sem faixa documentada; GPT-6 Sol aplica um novo preço a toda a solicitação acima de 272.000 tokens de entrada para $4,00 de entrada / $15,00 de saída
• Controles de raciocínio: o GPT-6 Sol expõe um parâmetro configurável chamado reasoning.effort; o Kimi K3 expõe os parâmetros reasoning e reasoning-effort pela mesma superfície compatível com OpenAI
O teto de saída ausente no Kimi K3 merece ser sinalizado, e não encoberto: a MoonshotAI publica um número de contexto e nenhum número de saída máxima, então um sistema que depende de um limite rígido de saída para orçamento não consegue lê-lo na ficha. O nível de contexto longo é a outra assimetria, e ela aponta numa direção contraintuitiva — a tarifa anunciada do GPT-6 Sol é menor, mas sua reprecificação da solicitação inteira acima de 272K faz com que uma chamada de 300.000 tokens cobre US$ 4,00 / US$ 15,00 desde o primeiro token, enquanto a tarifa única de US$ 3,00 / US$ 15,00 do Kimi K3 não está documentada como tendo qualquer escalonamento. Para um documento muito longo, o Kimi K3 pode acabar sendo o mais barato dos dois em entrada, apesar do valor anunciado mais alto.
Recall é o produto de fato do Kimi K3
A razão para recorrer ao Kimi K3 não é que ele tenha uma janela grande — vários modelos têm. É que ele retém o que está nela. Na avaliação de recall de contexto longo da Artificial Analysis, incluída no catálogo de modelos, o Kimi K3 obtém 88,7% contra os 83,7% do GPT-6 Sol. Essa é uma diferença de cinco pontos no teste exato que mede se um modelo consegue encontrar e usar um detalhe enterrado em uma entrada longa, e é o tipo de diferença que se manifesta como falhas reais em produção — o sumarizador que descarta a cláusula na página 400, o revisor de contratos que não percebe a seção de indenização.
Kimi K3 também lidera em programação, e por uma margem maior do que o índice composto sugere. No índice de programação, ele fica em 76,2, com posição entre os dez melhores modelos avaliados, e alcança 85,0% no terminal-bench v2.1 — o benchmark agêntico de linha de comando do qual depende a utilidade de um agente de programação. Sua pontuação no GPQA Diamond, 93,5%, está na faixa superior do ranking.
Onde o GPT-6 Sol responde é nos compósitos e no código científico. Seu índice de inteligência geral, 47,6, está quatro pontos à frente dos 43,6 do Kimi K3 e perto do decil superior; os dois estão empatados no SciCode, com 57,6% e 59,5%, respectivamente, dentro do ruído de uma única execução; e, no Humanity's Last Exam, os 47,9% do GPT-6 Sol superam por pouco os 46,9% do Kimi K3. Nenhuma dessas diferenças em um único benchmark é grande o suficiente para se escolher com base apenas nela.

Custo baseado na carga de trabalho, não em uma tabela de tarifas.
As tabelas de preços enganam porque a proporção entre tokens de entrada e de saída é diferente para cada tarefa, e esses dois modelos discordam sobre qual lado da relação é mais barato. O Kimi K3 é mais barato partindo do pressuposto de que o seu trabalho é majoritariamente de entrada — documentos longos entram, respostas curtas saem. O GPT-6 Sol é mais barato partindo do pressuposto de que o seu trabalho é equilibrado ou tem mais saída, porque a sua tarifa de saída é um terço menor.
• Formato de ler um livro e resumi-lo (900K de entrada, 4K de saída): Kimi K3 ≈ US$ 2,76, GPT-6 Sol ≈ US$ 3,64 antes que a reprecificação de 272K se aplique; com a reprecificação, a chamada inteira do GPT-6 Sol passa para o nível mais alto e a diferença aumenta
• Formato agêntico equilibrado (60K de entrada, 20K de saída): Kimi K3 ≈ US$ 0,48, GPT-6 Sol ≈ US$ 0,32
• Formato de geração de código (30K de entrada, 60K de saída): Kimi K3 ≈ US$ 0,99, GPT-6 Sol ≈ US$ 0,66
Esses são cálculos brutos de tokens com base nas tarifas publicadas de cada fornecedor e excluem a entrada em cache, o que favorece o modelo com o qual você mais faz cache. O que importa é o formato da resposta: para trabalho puro de recall com entradas longas, a tarifa fixa do Kimi K3 vence; e para qualquer coisa que gere muita saída, a tarifa de saída mais baixa do GPT-6 Sol vence. Nenhum dos dois é universalmente mais barato, e uma comparação que aponta um vencedor de preço sem declarar a proporção de tokens não está medindo nada.
A proveniência faz parte da decisão
O Kimi K3 é desenvolvido pela MoonshotAI, um laboratório chinês, e o GPT-6 Sol pela OpenAI. Essa diferença não é um benchmark e não aparece numa tabela de preços, mas, para cargas de trabalho regulamentadas, decide a lista restrita antes de se discutir o preço. A ficha da MoonshotAI no catálogo não publica um campo de licença, pelo que nada aqui deve ser interpretado como uma afirmação sobre a disponibilidade dos pesos, em qualquer dos sentidos — se os pesos abertos forem importantes para a sua implementação, verifique-o na fonte em vez de assumir pelo nome da família.
Para equipas que precisam de ambos — um modelo de laboratório chinês para uma parte de um pipeline e um modelo OpenAI para outra, com o encaminhamento, a faturação e a residência de dados tratados num único lugar — é por isso que vale a pena ter um único gateway em vez de dois conjuntos de credenciais. No OrcaRouter, tanto kimi/kimi-k3 como o GPT-6 Sol são rotas ativas no mesmo catálogo, ao preço de tabela do fornecedor com 0% de margem, pelo que uma alteração de tarifas da MoonshotAI ou da OpenAI fica ativa no próprio dia. O failover automático significa que uma rota degradada em qualquer um dos fornecedores não derruba o pipeline, e a DSL de encaminhamento permite enviar trabalho com muito recall para o Kimi K3 e trabalho com muita geração para o GPT-6 Sol por regra, e não por adivinhação.

Qual deles colocar no pipeline?
Escolha o Kimi K3 quando a tarefa for recuperação e retenção em entradas muito longas — revisão de documentos jurídicos e médicos, compreensão de código de repositório completo, análise de transcrições em centenas de documentos — e quando seus prompts forem suficientemente pesados em entrada para que a taxa fixa de $3,00 supere o novo preço do GPT-6 Sol. Sua liderança em recall e seu ranking entre os dez primeiros em programação são os dois números que justificam a escolha.
Escolha o GPT-6 Sol quando a tarefa for um assistente geral apoiado por uma janela de um milhão de tokens: raciocínio misto, serialização para JSON, ciclos agênticos que escrevem muito de volta, e qualquer fluxo de trabalho em que um teto de saída de 128.000 tokens seja uma vantagem em vez de uma restrição. Ele é mais barato na saída, expõe controle explícito do esforço de raciocínio, e seu índice composto é o sinal geral mais forte. Quando um pipeline faz genuinamente as duas coisas, a resposta honesta é encaminhar em vez de escolher — o que é uma afirmação sobre a forma do seu tráfego, não sobre qualquer um dos modelos.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
