
GPT-6 Sol vs Kimi K3: Três suposições sobre pesos abertos, testadas contra uma única fatura
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Comprar pesos abertos costuma ser uma aposta em três coisas: que eles serão mais baratos, que lhe dão controle e que são um seguro contra um fornecedor mudar de ideia. Kimi K3, o modelo de 2,8 trilhões de parâmetros que a Moonshot AI lançou sob pesos abertos em 27 de julho de 2026, e GPT-6 Sol, o modelo fechado lançado em 22 de setembro de 2026, são um caso de teste perfeito para todas as três, porque os dois modelos estão próximos o suficiente no ranking neutro para que as suposições tenham de sustentar o argumento por si sós.
Eis como eles se saem. O K3 não é mais barato por tarefa — é cerca de duas vezes mais caro, a US$ 3,00 e US$ 15,00 por milhão de tokens, contra os US$ 2,00 e US$ 10,00 do Sol. O controle é real, mas tem um piso de hardware que a maioria das equipes não vai ultrapassar. E o seguro é a única suposição que se sustenta completamente, o que faz dela a única pela qual vale a pena pagar. O que se segue é a aritmética por trás de cada um.
Os dois modelos, brevemente.
O Kimi K3 é um modelo esparso de mistura de especialistas com 2,8 trilhões de parâmetros totais e cerca de 104 bilhões — aproximadamente 3,7% — ativos por token, publicado sob uma licença MIT Modificada com uma janela de contexto de 1.048.576 tokens. As alegações arquiteturais da Moonshot são específicas: Kimi Delta Attention, um esquema híbrido de atenção linear que a empresa afirma ser até 6,3× mais rápido na decodificação de contexto longo, além de Attention Residuals e uma estrutura Stable LatentMoE. Ele recebe texto e imagem e retorna texto. O modelo não destilado excede 1 TB de tamanho, e uma implantação em produção é descrita em termos de um mínimo de 64 aceleradores.
GPT-6 Sol é fechado, de identificador único, e tem preço fixo de US$ 2,00 e US$ 10,00, com leitura em cache de US$ 0,20 e gravação em cache de US$ 2,50, reajustando toda a requisição acima de 272.000 tokens de entrada para US$ 4,00 e US$ 15,00. É entrada de texto e imagem, saída de texto, com uma janela de 1.050.000 tokens, um máximo de 922.000 tokens de entrada, um limite de 128.000 tokens de saída e uma data de corte de conhecimento em 20 de abril de 2026.
As janelas de contexto são, para todos os efeitos práticos, o mesmo número — uma diferença de 0,1%. Isso elimina a razão mais comum para preferir uma, e significa que a decisão depende inteiramente das três suposições.
Premissa um: pesos abertos são mais baratos. Não são.
• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs Kimi K3 $3,00 por milhão de tokens
• Saída — GPT-6 Sol US$ 10,00 por milhão de tokens vs Kimi K3 US$ 15,00 por milhão de tokens
• Entrada em cache — GPT-6 Sol $0,20 por milhão de tokens vs Kimi K3 $0,30 por milhão de tokens; ambos são um décimo da tarifa de entrada sem cache
• Índice de Inteligência, independente — GPT-6 Sol 48 no esforço máximo vs Kimi K3 44 no esforço máximo
• Custo por tarefa do Index, de forma independente — GPT-6 Sol $1.06 vs Kimi K3 $2.00
• Tokens de saída para a execução do índice — GPT-6 Sol 77M vs Kimi K3 160M
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Kimi K3 1.048.576 tokens
• Pesos — GPT-6 Sol fechado vs Kimi K3 aberto, baixável e auto-hospedável
• Licença — GPT-6 Sol não aplicável vs. Kimi K3 Modified MIT
• Parâmetros totais — não divulgados do {{1}}GPT-6 Sol{{/1}} vs 2,8 trilhões do {{2}}Kimi K3{{/2}}, dos quais 104 bilhões são ativos por token
Sol é mais barato em cada linha da tabela de preços, e a diferença é maior exatamente onde as cargas de trabalho agênticas gastam seu dinheiro. O conselho independente concorda quanto à direção e, aproximadamente, quanto à magnitude: Sol custa cerca da metade por tarefa concluída, com quatro pontos de índice a mais. K3 gerou um pouco mais que o dobro de tokens de saída para executar o mesmo índice.
Uma nuance impede que isto seja uma goleada. A Moonshot afirma que o K3 emite 21% menos tokens de saída do que o seu antecessor, e o trabalho arquitetural — o esquema de atenção, o design residual — visa diretamente o custo de decodificação em contexto longo. Numa carga de trabalho dominada por entradas muito longas, as funcionalidades de eficiência do K3 podem fechar parte da diferença que a execução do índice mostra. Ninguém publicou essa medição numa estrutura de avaliação comparável, por isso trate-a como uma alegação do fornecedor com um mecanismo plausível, não como um resultado.


Segunda premissa: pesos abertos lhe dão controle. Até certo piso de hardware.
O controle é genuíno e vale a pena declarar com precisão, porque "pesos abertos" é frequentemente usado de forma vaga. Uma licença MIT Modificada sobre um checkpoint baixável significa que você pode executar o modelo no seu próprio hardware, fazer fine-tuning nele, fixar uma revisão específica e manter a inferência dentro de um limite que você controla. Nada disso está disponível com o GPT-6 Sol a qualquer preço.
O que isso não significa é que a auto-hospedagem seja um substituto para a API em termos de custo. Os números publicados colocam o checkpoint de precisão total em cerca de 4,9 TB, ou cerca de 397 GB com quantização de 1 bit, com um piso de implantação na faixa de 410 GB de memória combinada e implantações em produção descritas em termos de 64 aceleradores. Uma equipe que já opera esse tipo de cluster tem uma opção real aqui. Uma equipe que não opera está comparando uma fatura de API com uma compra de capital, e a fatura da API vence por uma margem ampla.
A versão honesta do argumento do controle é mais restrita do que costuma ser apresentada: pesos abertos dão a você a capacidade de sair, não a capacidade de operar barato. Essas são coisas diferentes, e apenas uma delas está disponível para a maioria das equipes.
Suposição três: pesos abertos são seguro. Esta se sustenta.
A terceira premissa sobrevive a todos os números acima, e é a razão pela qual a K3 tem um mercado. A Moonshot pode ser adquirida, pode alterar a sua licença para versões futuras, pode descontinuar o K3, pode aumentar o seu preço, pode suspender assinaturas — e suspendeu novas assinaturas dentro de 48 horas após o lançamento para proteger a qualidade do serviço para os clientes pagantes existentes, o que é uma demonstração ao vivo de que o acesso à API é uma decisão de política, e não uma propriedade.
Se o K3 for descontinuado, os pesos que você baixou continuam funcionando. Se a Moonshot triplicar o preço da API, sua implantação auto-hospedada não será afetada. Se você precisar demonstrar a um auditor que sua pilha de inferência está congelada em uma revisão conhecida, um checkpoint lhe dá isso, e uma API não. Nada disso aparece em uma tabela de custo por tarefa, e tudo isso é real.
A questão é quanto vale. Com base nos números acima, você está pagando aproximadamente o dobro por tarefa concluída por esse seguro, além de quatro pontos de índice de capacidade. Para uma carga de trabalho em que a descontinuação de uma API é uma interrupção de negócios, isso é barato. Para uma carga de trabalho em que você simplesmente trocaria de modelo, é um prêmio por uma proteção que você nunca vai exercer.
Ambos estão na mesma tecla, se você quiser que estejam.

O Kimi K3 está no catálogo da OrcaRouter ao preço de tabela da Moonshot, sob o modelo de pass-through que coloca uma alteração de preços da Moonshot em vigor do nosso lado no mesmo dia em vez de só depois de um revendedor renegociar. O GPT-6 Sol não está no nosso catálogo na data em que escrevemos e pode ser acedido através da própria API da OpenAI.
Essa combinação vale mais do que parece para esta decisão específica, porque os dois modelos pertencem a modos de falha diferentes. A razão para executar o K3 não é que ele seja mais barato — não é —, mas sim que ele é uma proteção, e uma proteção para a qual você não consegue mudar rapidamente não é lá grande proteção. Manter o K3 atrás do mesmo endpoint que todo o resto, com failover automático e uma regra de roteamento que pode ser alterada na configuração, é o que transforma "temos um fallback de pesos abertos" de um slide em uma apresentação em algo que funciona às 3 da manhã.
Para que cada um realmente serve
• Se você quer o menor custo por tarefa concluída em trabalho geral — GPT-6 Sol, e a margem é de cerca de 2×.
• Se você quer a maior capacidade no ranking neutro entre os dois — GPT-6 Sol por quatro pontos.
• Se você já opera um cluster na classe de memória de 400 GB ou mais e precisa de inferência dentro do seu próprio perímetro — K3, e o cálculo muda por completo, porque o custo marginal dos pesos não é o mesmo que o custo do hardware.
• Se a sua exigência real é que o seu modelo não possa ser tirado de você — K3, e este é o único argumento na comparação que o Sol não consegue responder.
Se você está escolhendo com base no preço por token porque o K3 parece ser o modelo chinês mais barato — confira primeiro a contagem de tokens. Com 160 milhões de tokens de saída para a execução do índice, contra 77 milhões do Sol, a taxa mais barata está comprando mais tokens, não uma conta menor.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
