Um placar comparativo de duas colunas gerado, intitulado 'GPT-6.1 Sol vs Kimi K3 - o placar'. Coluna esquerda 'GPT-6.1 Sol': linhas com 'Índice de Inteligência: 51,8', 'Custo por tarefa de índice: US$ 0,72', 'Tokens de saída na execução do índice: 67 mi', 'AA-LCR contexto longo: 0,83', 'Janela de contexto: 1.050.000', 'Pesos: fechados'. Coluna direita 'Kimi K3': linhas com 'Índice de Inteligência: 43,6', 'Custo por tarefa de índice: US$ 2,00', 'Tokens de saída na execução do índice: 160 mi', 'AA-LCR contexto longo: 0,89', 'Janela de contexto: 1.048.576', 'Pesos: abertos no Hugging Face'. Um rodapé diz 'Números independentes conforme a Artificial Analysis v4.3.2 em esforço máximo.'
Guides & Insights

GPT-6.1 Sol vs Kimi K3: O download existe, e ainda não é a opção barata

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Kimi K3 é o contraexemplo que normalmente resolve esse tipo de discussão. A Moonsh​oot AI lançou o modelo de 2,8 trilhões de parâmetros em julho de 2026 e publicou os pesos — moonshotai/Kimi-K3 está no Hugging Face, sem restrições, com mais de um milhão de downloads e uma última revisão em setembro. Então não há aqui nenhum asterisco de "aberto em princípio, retido para reforço de segurança", nem um atraso de duas semanas para aguardar. GPT-6.1 Sol, que a Open​AI lançou em 29 de setembro de 2026, é fechado e somente via API, e sempre será. E no ranking independente, o modelo baixável marca 43,6 contra 51,8 do modelo fechado, enquanto custa US$ 2,00 por tarefa de índice concluída, contra US$ 0,72. Pesos abertos deveriam ser a válvula de escape barata; neste emparelhamento, eles são o lado caro da troca, e a razão não é a licença.

O que cada modelo é

O Kimi K3 é um modelo esparso de mistura de especialistas com 2,8 trilhões de parâmetros totais e cerca de 104 bilhões — aproximadamente 3,7% — ativos por token. Ele possui uma janela de contexto de 1.048.576 tokens, aceita texto e imagens como entrada e retorna texto. O checkpoint publicado é um artefato FP8 e é um download genuinamente grande; uma implantação em produção no seu próprio hardware é uma decisão de cluster, e não de estação de trabalho. A alegação arquitetural da Moonsh​oot é um esquema híbrido de atenção linear que, segundo ela, é substancialmente mais rápido na decodificação de contextos longos, além do trabalho com resíduos e roteamento que tornou possível, afinal, servir um modelo de 2,8 trilhões de parâmetros.

O GPT-6.1 Sol é a atualização de nível intermediário da OpenAI — abaixo do GPT-6 Astra, acima do GPT-6 Luna — com uma janela de 1.050.000 tokens, um teto de saída de 128.000 tokens, entrada de texto, imagem e arquivo, e uma data de corte de conhecimento de 30 de abril de 2026. O raciocínio vai de baixo até máximo com médio como padrão; a opção nenhum que o GPT-6 Sol anterior aceitava é rejeitada de imediato, e a própria nota de migração da OpenAI orienta os desenvolvedores a usar baixo em vez disso. O preço é de $2,00 e $10,00 por milhão de tokens, com entrada em cache a $0,10.

Uma linha por dimensão, ambos os lados em cada:

• Entrada — GPT-6.1 Sol $2,00 por 1M vs Kimi K3 $3,00 por 1M
• Saída — GPT-6.1 Sol $10,00 por 1M vs Kimi K3 $15,00 por 1M
• Entrada em cache — GPT-6.1 Sol $0,10 por 1M vs Kimi K3 $0,30 por 1M
• Janela de contexto — 1.050.000 tokens vs 1.048.576 tokens; uma diferença de 0,1%, irrelevante
• Saída máxima — 128.000 tokens em ambos
• Parâmetros totais e ativos — não divulgados vs 2,8 bilhões no total, 104 bilhões ativos por token
• Modalidade — texto, imagem e arquivo na entrada, texto na saída vs texto e imagem na entrada, texto na saída
• Pesos — fechado, apenas via API vs aberto, sem restrições de acesso, mais de 1 milhão de downloads
• Cláusula de contexto longo — reprecifica toda a requisição acima de 272.000 tokens de entrada a 2× na entrada e no cache e 1,5× na saída vs nenhuma cláusula equivalente na tabela de preços publicada
• Índice de Inteligência, independente, esforço máximo — 51,8 vs 43,6
• Custo por tarefa do índice, independente — $0,72 vs $2,00
• Tokens de saída na execução do índice — 67 milhões vs 160 milhões, contra uma mediana de 140 milhões no ranking para a sua classe de comparação

A única avaliação que o K3 vence, e por que isso importa

Antes da aritmética, a exceção, porque é real. Avaliado avaliação por avaliação com esforço máximo no Artificial Analysis v4.3.2, GPT-6.1 Sol lidera em sete de dez e não empata nenhuma, mas o modelo que vence a avaliação de raciocínio de contexto longo é o K3:

• AA-LCR v1.1 — Kimi K3 0,887 vs GPT-6.1 Sol 0,830. Uma vantagem de seis pontos na avaliação criada especificamente para raciocínio sobre entradas longas.
• SciCode — Kimi K3 0,595 vs GPT-6.1 Sol 0,542. O K3 também lidera em codificação científica.
• Terminal-Bench 4.0 — Kimi K3 0,126 vs GPT-6.1 Sol 0,561. Uma diferença de 43 pontos na direção oposta, e de longe a maior divergência do confronto.
• Humanity's Last Exam — Kimi K3 0,469 vs GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 vs GPT-6.1 Sol 41,5; em confiabilidade factual, os dois não são modelos da mesma classe.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 vs GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 vs GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 e 0,234; Sol 0,649, 0,310 e 0,317.

O resultado do AA-LCR é o que vale a pena levar a sério, porque é o único número que contradiz a narrativa de custo por tarefa, e ele aponta para uma carga de trabalho em que a resposta aparentemente barata está errada nas duas direções. Se o seu tráfego é de entradas muito longas, uma resposta gerada modesta e reutilização intensa de um prefixo estável — o formato em que a verbosidade nunca chega a atrapalhar —, a combinação do K3 de uma pontuação de contexto longo de primeira linha, uma entrada de imagem e um checkpoint baixável ajusta-se melhor do que a do Sol, e o número de custo por tarefa da execução do índice não se aplica a você. Essa é a versão honesta de "pesos abertos valem um prêmio": às vezes o modelo aberto é simplesmente o melhor modelo para o trabalho, e aqui ele é isso em um eixo.

Também vale a pena nomear o que essas duas vitórias têm em comum. O K3 é forte quando uma tarefa pode ser respondida num único e longo ato de leitura ou raciocínio, e fraco quando precisa ser executada em muitos passos pequenos e verificada. A lacuna de 43 pontos no Terminal-Bench e a lacuna de 22 pontos de onisciência são a mesma constatação vista de dois ângulos: execução agêntica sustentada não é aquilo para que este checkpoint foi otimizado.

A aritmética, que é o que realmente decide isso.

A tabela de tarifas do K3 é 1,5× a do Sol em cada linha e o seu custo medido por tarefa de índice concluída é 2,8×, e a diferença entre 1,5 e 2,8 é inteiramente explicada pelo volume de tokens. A própria medição do conselho é de 160 milhões de tokens de saída para o K3 contra 67 milhões para o Sol no mesmo conjunto de dez avaliações. O K3 produz 2,4 vezes a saída a 1,5 vezes o preço, e 2,4 × 1,5 é 3,6 — o número do conselho de $2,00 contra $0,72 é um pouco mais favorável do que a proporção pura porque as contribuições de entrada e cache o compensam ligeiramente, mas a direção não está em disputa.

O marketing da própria Moonsh​oot vai contra isso de uma forma que vale a pena ler com atenção. A empresa afirma que o K3 emite menos tokens de saída do que seu antecessor, e o trabalho arquitetural — o esquema de atenção, o design residual — é voltado diretamente para o custo de decodificação de contexto longo. Ambas as afirmações podem ser verdadeiras enquanto o modelo ainda é duas vezes mais verboso do que a mediana de um benchmark em uma suíte geral. As duas alegações tratam de coisas diferentes: eficiência em relação a um Kimi anterior e eficiência em relação ao setor. Só a segunda é aquela pela qual você está sendo cobrado, e é a que o conselho independente mede.

O cache suaviza isso. Ambas as taxas de entrada em cache são um décimo da taxa de entrada sem cache de seus modelos — $0,30 para o K3, $0,10 para o Sol —, portanto, a linha de cache não altera a ordenação, mas significa que uma carga de trabalho com muitas requisições e poucas respostas estreita a diferença para aproximadamente a proporção da tabela de tarifas, em vez da proporção de tarefa medida. E a cláusula de contexto longo do Sol funciona no sentido oposto: acima de 272.000 tokens de entrada, ela reajusta o preço da requisição inteira para $4,00 e $15,00, com cache a $0,20, que é a única faixa em que a tabela fixa do K3 vence de forma absoluta. Vale a pena saber disso por dois motivos, porque também é a faixa em que a pontuação de contexto longo do K3 é o melhor número desta comparação.

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

Quanto valem realmente os pesos abertos aqui

Três coisas, e vale a pena separá-las, porque "pesos abertos" costuma ser usado como um único argumento quando são três.

A primeira é que você pode sair. Se a Moonsh​oot for adquirida, mudar a licença para versões futuras, descontinuar o K3 ou aumentar o preço da sua API, um checkpoint que você já baixou continua em execução. Isso não é hipotético para este laboratório: a Moonsh​oot suspendeu novas assinaturas cerca de 48 horas após um lançamento anterior para proteger a qualidade do serviço para clientes pagantes existentes, o que é uma demonstração ao vivo de que o acesso à API é uma decisão de política, e não uma propriedade. Nada disso aparece em uma tabela de custo por tarefa, e tudo isso é real.

O segundo é que você pode fixar. Uma revisão fixa, ajustada com precisão, executada dentro de um limite que você controla, é algo que pode ser mostrado a um auditor e que uma API não consegue fornecer. Para tráfego regulamentado, isso vale mais do que uma tabela de preços.

O terceiro — aquele que normalmente se presume — é que será mais barato. Não é. O checkpoint é um artefato FP8 de 2,8 trilhões de parâmetros, e a orientação de implantação publicada está estruturada em torno de configurações com múltiplos aceleradores, em vez de um único nó. Uma equipe que já opera esse tipo de cluster tem uma opção genuína aqui, e o cálculo muda por completo, porque o custo marginal de um token passa a ser eletricidade. Uma equipe que não opera está comparando uma fatura de API com uma compra de capital, e a fatura de API vence por uma margem ampla. O resumo honesto é que pesos abertos aqui lhe dão a capacidade de sair, não a capacidade de executar de forma barata.

Ambos numa só tecla, que é o que torna a troca útil

O Kimi K3 está no OrcaRouter pelo preço de tabela da própria Moonshoot — US$ 3,00 e US$ 15,00 por milhão de tokens, com leitura de cache a US$ 0,30, inalterado em relação à tabela do fornecedor — e o GPT-6.1 Sol chegou às nossas rotas ao preço da OpenAI no dia do lançamento, US$ 2,00 e US$ 10,00, com entrada em cache a US$ 0,10, e a faixa de 272.000 tokens repassada exatamente como listada. Nada é acrescentado a nenhum dos dois. A plataforma repassa o preço de tabela do provedor em vez de aplicar uma margem, de modo que uma alteração de preço da Moonshoot e uma alteração de preço da OpenAI aparecem do nosso lado no mesmo dia em que aparecem no lado do fornecedor, sem um segundo contrato ou um revendedor no meio.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

A razão pela qual isso importa mais para este par do que para a maioria é que os dois modelos pertencem a modos de falha diferentes. O GPT-6.1 Sol é o modelo que você usa para execução sustentada, loops de ferramentas e confiabilidade factual; o Kimi K3 é o modelo que você usa para entradas muito longas, quando quer a melhor pontuação de contexto longo e quer um checkpoint como proteção contra a decisão de negócio de outra pessoa. Essas não são escolhas concorrentes, são duas rotas no mesmo tráfego. Manter ambos atrás de um único endpoint, com failover automático entre eles e uma regra que direciona trabalho de entradas longas para o K3 e trabalho de execução para o Sol, é o que transforma "temos um fallback de pesos abertos" de uma linha num documento de design em algo que funciona às três da manhã numa chamada que está falhando.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Onde cada um pertence

• Agentes de terminal, codificação em escala de repositório, execução em múltiplas etapas — GPT-6.1 Sol, numa diferença de 43 pontos no Terminal-Bench 4.0. Isso não é nem de perto.
• Respostas em que uma alucinação sai cara — GPT-6.1 Sol, numa diferença de 22 pontos no AA-Omniscience.
• Entradas muito longas com uma resposta gerada curta — Kimi K3. Melhor pontuação de raciocínio de contexto longo nesta comparação, entrada de imagem e verbosidade que nunca tem chance de se aplicar.
• Auto-hospedagem ou uma pilha de inferência que você precisa conseguir congelar — Kimi K3, e somente se você já opera o hardware. O checkpoint é o entregável; a economia de executá-lo é outra questão.
• Uma proteção contra um fornecedor que muda seus termos — Kimi K3, e este é o único argumento que o GPT-6.1 Sol não consegue responder a nenhum preço.
• Escolher com base na tabela de preços — nem o K3 nem o Sol são a opção barata nesta comparação, e nenhum dos dois é a opção barata na linha GPT-6. Se a fatura for o fator decisivo, o modelo que você quer está mais abaixo na lista de preços, não do outro lado desta tabela.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente