Cartão de título principal para uma comparação entre GPT-6 e Kimi K3. A manchete diz 'GPT-6 vs Kimi K3'. Um chip diz 'Kimi K3: 1.048.576 de contexto, US$ 3,00 / US$ 15,00, lançado em 15/07/2026'. Um chip diz 'GPT-6 Sol: 1.050.000 de contexto, US$ 2,00 / US$ 10,00, GA em 22/09/2026'. Um rodapé diz 'Ambos aceitam entrada de texto e imagem; seus preços e pontuações são diferentes.'
Guides & Insights

GPT-6 vs Kimi K3: Dois Modelos de Milhões de Tokens Que se Especializam de Formas Diferentes

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-6 Sol e Kimi K3 são os dois modelos com maior probabilidade de serem pré-selecionados para o mesmo trabalho: uma janela de contexto de um milhão de tokens, entrada de imagem e um preço que torna documentos longos acessíveis. Eles chegaram lá por direções opostas. Kimi K3 é o especialista em contexto longo da MoonshotAI, lançado em 15 de julho de 2026, e sua ficha técnica é construída em torno da recuperação — ele pontua 88,7% no teste de recuperação de contexto longo da Artificial Analysis, à frente de todos os modelos do fornecedor com o qual podemos compará-lo. GPT-6 Sol é o generalista de nível intermediário do fornecedor, lançado em 22 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de saída, e seu argumento é a amplitude: uma janela um pouco maior, uma pontuação composta de raciocínio geral mais alta e um token de saída mais barato.

Então, o enquadramento honesto não é melhor versus pior. É recuperação versus raciocínio, e isso é decidido pelo que você está fazendo com o milhão de tokens depois de carregá-los.

As janelas têm o mesmo tamanho no papel.

Ambos os cartões indicam aproximadamente um milhão de tokens, e a diferença é cosmética. A janela do Kimi K3 é de 1.048.576 tokens — exatamente 2^20, o milhão binário que todo modelo de contexto longo cita. A do GPT-6 Sol é de 1.050.000, um número decimal redondo cerca de 1.400 tokens maior. Para qualquer carga de trabalho que você consiga realmente acomodar, são a mesma janela. Não escolha com base nisso.

O que difere é o resto do envelope, e é uma lista curta.

• Contexto: Kimi K3 1.048.576 tokens, GPT-6 Sol 1.050.000 — efetivamente equivalentes
• Modalidade de entrada: Kimi K3 aceita texto e imagens; GPT-6 Sol aceita texto, imagens e arquivos
• Limite de saída: GPT-6 Sol 128.000 tokens em uma resposta; a ficha técnica do Kimi K3 não publica um valor máximo de saída
• Preço padrão: Kimi K3 $3,00 de entrada / $15,00 de saída por milhão, GPT-6 Sol $2,00 de entrada / $10,00 de saída
• Entrada em cache: Kimi K3 $0,30 por milhão, GPT-6 Sol $0,20 por milhão
• Preço para contexto longo: Kimi K3 lista uma única tarifa sem faixa documentada; GPT-6 Sol aplica um novo preço a toda a solicitação acima de 272.000 tokens de entrada para $4,00 de entrada / $15,00 de saída
• Controles de raciocínio: o GPT-6 Sol expõe um parâmetro configurável chamado reasoning.effort; o Kimi K3 expõe os parâmetros reasoning e reasoning-effort pela mesma superfície compatível com OpenAI

O teto de saída ausente no Kimi K3 merece ser sinalizado, e não encoberto: a MoonshotAI publica um número de contexto e nenhum número de saída máxima, então um sistema que depende de um limite rígido de saída para orçamento não consegue lê-lo na ficha. O nível de contexto longo é a outra assimetria, e ela aponta numa direção contraintuitiva — a tarifa anunciada do GPT-6 Sol é menor, mas sua reprecificação da solicitação inteira acima de 272K faz com que uma chamada de 300.000 tokens cobre US$ 4,00 / US$ 15,00 desde o primeiro token, enquanto a tarifa única de US$ 3,00 / US$ 15,00 do Kimi K3 não está documentada como tendo qualquer escalonamento. Para um documento muito longo, o Kimi K3 pode acabar sendo o mais barato dos dois em entrada, apesar do valor anunciado mais alto.

Recall é o produto de fato do Kimi K3

A razão para recorrer ao Kimi K3 não é que ele tenha uma janela grande — vários modelos têm. É que ele retém o que está nela. Na avaliação de recall de contexto longo da Artificial Analysis, incluída no catálogo de modelos, o Kimi K3 obtém 88,7% contra os 83,7% do GPT-6 Sol. Essa é uma diferença de cinco pontos no teste exato que mede se um modelo consegue encontrar e usar um detalhe enterrado em uma entrada longa, e é o tipo de diferença que se manifesta como falhas reais em produção — o sumarizador que descarta a cláusula na página 400, o revisor de contratos que não percebe a seção de indenização.

Kimi K3 também lidera em programação, e por uma margem maior do que o índice composto sugere. No índice de programação, ele fica em 76,2, com posição entre os dez melhores modelos avaliados, e alcança 85,0% no terminal-bench v2.1 — o benchmark agêntico de linha de comando do qual depende a utilidade de um agente de programação. Sua pontuação no GPQA Diamond, 93,5%, está na faixa superior do ranking.

Onde o GPT-6 Sol responde é nos compósitos e no código científico. Seu índice de inteligência geral, 47,6, está quatro pontos à frente dos 43,6 do Kimi K3 e perto do decil superior; os dois estão empatados no SciCode, com 57,6% e 59,5%, respectivamente, dentro do ruído de uma única execução; e, no Humanity's Last Exam, os 47,9% do GPT-6 Sol superam por pouco os 46,9% do Kimi K3. Nenhuma dessas diferenças em um único benchmark é grande o suficiente para se escolher com base apenas nela.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

Custo baseado na carga de trabalho, não em uma tabela de tarifas.

As tabelas de preços enganam porque a proporção entre tokens de entrada e de saída é diferente para cada tarefa, e esses dois modelos discordam sobre qual lado da relação é mais barato. O Kimi K3 é mais barato partindo do pressuposto de que o seu trabalho é majoritariamente de entrada — documentos longos entram, respostas curtas saem. O GPT-6 Sol é mais barato partindo do pressuposto de que o seu trabalho é equilibrado ou tem mais saída, porque a sua tarifa de saída é um terço menor.

• Formato de ler um livro e resumi-lo (900K de entrada, 4K de saída): Kimi K3 ≈ US$ 2,76, GPT-6 Sol ≈ US$ 3,64 antes que a reprecificação de 272K se aplique; com a reprecificação, a chamada inteira do GPT-6 Sol passa para o nível mais alto e a diferença aumenta
• Formato agêntico equilibrado (60K de entrada, 20K de saída): Kimi K3 ≈ US$ 0,48, GPT-6 Sol ≈ US$ 0,32
• Formato de geração de código (30K de entrada, 60K de saída): Kimi K3 ≈ US$ 0,99, GPT-6 Sol ≈ US$ 0,66

Esses são cálculos brutos de tokens com base nas tarifas publicadas de cada fornecedor e excluem a entrada em cache, o que favorece o modelo com o qual você mais faz cache. O que importa é o formato da resposta: para trabalho puro de recall com entradas longas, a tarifa fixa do Kimi K3 vence; e para qualquer coisa que gere muita saída, a tarifa de saída mais baixa do GPT-6 Sol vence. Nenhum dos dois é universalmente mais barato, e uma comparação que aponta um vencedor de preço sem declarar a proporção de tokens não está medindo nada.

A proveniência faz parte da decisão

O Kimi K3 é desenvolvido pela MoonshotAI, um laboratório chinês, e o GPT-6 Sol pela OpenAI. Essa diferença não é um benchmark e não aparece numa tabela de preços, mas, para cargas de trabalho regulamentadas, decide a lista restrita antes de se discutir o preço. A ficha da MoonshotAI no catálogo não publica um campo de licença, pelo que nada aqui deve ser interpretado como uma afirmação sobre a disponibilidade dos pesos, em qualquer dos sentidos — se os pesos abertos forem importantes para a sua implementação, verifique-o na fonte em vez de assumir pelo nome da família.

Para equipas que precisam de ambos — um modelo de laboratório chinês para uma parte de um pipeline e um modelo OpenAI para outra, com o encaminhamento, a faturação e a residência de dados tratados num único lugar — é por isso que vale a pena ter um único gateway em vez de dois conjuntos de credenciais. No OrcaRouter, tanto kimi/kimi-k3 como o GPT-6 Sol são rotas ativas no mesmo catálogo, ao preço de tabela do fornecedor com 0% de margem, pelo que uma alteração de tarifas da MoonshotAI ou da OpenAI fica ativa no próprio dia. O failover automático significa que uma rota degradada em qualquer um dos fornecedores não derruba o pipeline, e a DSL de encaminhamento permite enviar trabalho com muito recall para o Kimi K3 e trabalho com muita geração para o GPT-6 Sol por regra, e não por adivinhação.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

Qual deles colocar no pipeline?

Escolha o Kimi K3 quando a tarefa for recuperação e retenção em entradas muito longas — revisão de documentos jurídicos e médicos, compreensão de código de repositório completo, análise de transcrições em centenas de documentos — e quando seus prompts forem suficientemente pesados em entrada para que a taxa fixa de $3,00 supere o novo preço do GPT-6 Sol. Sua liderança em recall e seu ranking entre os dez primeiros em programação são os dois números que justificam a escolha.

Escolha o GPT-6 Sol quando a tarefa for um assistente geral apoiado por uma janela de um milhão de tokens: raciocínio misto, serialização para JSON, ciclos agênticos que escrevem muito de volta, e qualquer fluxo de trabalho em que um teto de saída de 128.000 tokens seja uma vantagem em vez de uma restrição. Ele é mais barato na saída, expõe controle explícito do esforço de raciocínio, e seu índice composto é o sinal geral mais forte. Quando um pipeline faz genuinamente as duas coisas, a resposta honesta é encaminhar em vez de escolher — o que é uma afirmação sobre a forma do seu tráfego, não sobre qualquer um dos modelos.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente