Cartão de destaque intitulado Claude Sonnet 5.5 vs Kimi K3, com subtítulo de que nenhum modelo aceitará sua configuração de temperatura, com pílulas mostrando $2 / $10 fechado vs $3 / $15 pesos abertos, Índice 56 vs 44, e nenhum dos dois aceita temperatura, e um rodapé citando Artificial Analysis v4.3.2 e preços de fornecedores.
Guides & Insights

Claude Sonnet 5.5 vs Kimi K3: Nenhum dos modelos vai respeitar sua configuração de temperatura

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Eis uma comparação em que os dois modelos concordam em algo que vai quebrar seu código de qualquer forma. Claude Sonnet 5.5, lançado em 28 de setembro de 2026, rejeita com um erro 400 qualquer requisição que defina temperature, top_p ou top_k com um valor diferente do padrão. Kimi K3, com disponibilidade geral pela Moonshot AI desde meados de julho de 2026, não aceita nenhum parâmetro de amostragem — sem temperature, sem top_p, sem seed — e expõe a profundidade de raciocínio apenas através de um reasoning_effort controle. Dois laboratórios distintos, duas arquiteturas distintas, uma conclusão em comum: os controles de amostragem que a maioria das integrações ainda define por hábito desapareceram nos dois.

Essa não é a comparação sobre a qual todo mundo escreve. A comparação sobre a qual todo mundo escreve é o preço: Kimi K3 a US$ 3 por milhão de tokens de entrada e US$ 15 de saída contra Claude Sonnet 5.5 a US$ 2 e US$ 10, o que é uma vitória clara da Anthropic na tabela de preços. Mas o Kimi K3 é um modelo de pesos abertos de mistura de especialistas com 2,8 trilhões de parâmetros que você pode baixar e executar dentro do seu próprio perímetro, e o Claude Sonnet 5.5 é um modelo fechado disponível em quatro nuvens. Entre um modelo fechado mais barato e um modelo mais caro que pode ser baixado, a decisão não se baseia de modo algum no preço por token.

O que cada um é, em um parágrafo cada

Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic, seguindo o Claude Opus 5.5 até a Claude API cinco dias após esse lançamento. Ele é lançado como claude-sonnet-5-5 na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry, mantém uma janela de contexto de 1M de tokens e um teto de saída síncrona de 128K, e mantém exatamente o preço do Claude Sonnet 5: US$ 2 de entrada, US$ 10 de saída, US$ 0,20 por milhão para leituras de cache. O pensamento adaptativo fica ativado por padrão no nível alto de esforço. Ele está disponível com retenção zero de dados, e a Artificial Analysis lhe atribui um Intelligence Index de 56 em sua revisão v4.3.2 — terceiro entre os 216 modelos que mede.

Two-column scoreboard for Claude Sonnet 5.5 and Kimi K3 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, closed weights on four clouds. Right column Kimi K3: input $3.00 per million, output $15.00 per million, 1M-token context, AA Intelligence Index 44, cost per Index task $2.00, open weights under the Kimi K3 License. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

O Kimi K3 é o carro-chefe da Moonshot AI: um modelo de mistura de especialistas com 2,8 trilhões de parâmetros que ativa cerca de 104 bilhões de parâmetros por token, com uma janela de contexto de 1M de tokens e compreensão visual nativa. Ele foi construído para codificação de longo horizonte e trabalho de conhecimento em múltiplas etapas, e a Moonshot o posiciona nominalmente para harnesses de agentes de programação. Ele fala o formato da API da OpenAI, expõe reasoning_effort como seu único controle de raciocínio, e tem pesos abertos sob a Licença Kimi K3 — o que não é a mesma coisa que código aberto, e a diferença é justamente a parte que você deve ler antes de construir sobre ele.

A tabela de tarifas, e o número abaixo dela.

Coloque os dois lado a lado nas dimensões que decidem um projeto de lei, e não uma manchete:

• Preço de entrada — Claude Sonnet 5.5 $2 por milhão vs Kimi K3 $3 por milhão

• Preço de saída — Claude Sonnet 5.5 $10 por milhão vs Kimi K3 por milhão

• Leituras de cache — $0,20 por milhão vs $0,30 por milhão

• Janela de contexto — 1.000.000 de tokens vs 1.048.576 de tokens

• Pesos — proprietários, quatro plataformas hospedadas vs. pesos abertos sob a Licença Kimi K3

• Índice de Inteligência — Claude Sonnet 5.5 56 vs Kimi K3 44 na mesma revisão v4.3.2

• Custo por tarefa do Intelligence Index — Claude Sonnet 5.5 $7,60 vs Kimi K3 $2,00

• Verbosidade no Índice — Claude Sonnet 5.5 410M tokens de saída vs Kimi K3 160M

Esse último par é a inversão que vale a pena ponderar. O modelo da Anthropic é 50% mais barato na entrada e um terço mais barato na saída e, ainda assim, custa 3,8 vezes mais para concluir a mesma avaliação, porque gasta 2,6 vezes os tokens para chegar lá. No resultado composto, ele também marca doze pontos a mais, portanto não se trata de um modelo perdulário que não entrega nada. Trata-se de dois modelos cujo comportamento de custo não pode ser comparado apenas lendo duas tabelas de preços, e é por isso que existe a métrica da tarefa de índice.

Nenhuma dessas contagens de tokens será a sua contagem de tokens. A própria documentação da Moonshot observa que a profundidade de raciocínio do K3 é definida por reasoning_effort e não pela amostragem, e o mesmo vale, na prática, para o parâmetro effort do Claude Sonnet 5.5 — portanto, em ambos os modelos, a maior alavanca sobre a sua fatura é uma configuração de esforço, não uma negociação de preço.

Anthropic Claude Platform documentation page for Claude Sonnet 5.5 showing the summary line the best combination of speed and intelligence, the model ID claude-sonnet-5-5, a 1M-token context window, a 128K maximum output, an input price of $2 per million tokens and an output price of $10 per million tokens, with links to the What is new and Migration guide pages.

Os erros 400, em detalhe

OrcaRouter model page for kimi/kimi-k3, attributed to MoonshotAI and dated 2026-07-15, showing a 1M-token context window, text and image input, Vision, Tools, JSON and Reasoning capability tags, an input price of $3.00 and output price of $15.00 per million tokens, a p50 time to first token of 8.20 seconds, and 371.9M tokens of traffic in the last seven days.

A recusa compartilhada de parâmetros de amostragem é a sobreposição mais prática aqui, porque é a falha que aparece na manhã seguinte a uma troca de modelo.

No Claude Sonnet 5.5, as regras são explícitas e implacáveis. Um valor não padrão de temperature, top_p ou top_k retorna um 400. Enviar thinking: {"type": "disabled"} retorna um 400 apontando para between_tools, a nova configuração de pensamento mais baixa, que é aceita em esforço baixo, médio e alto, mas rejeitada em xhigh ou max. Uso forçado de ferramentas — tool_choice definido como "any" ou como uma ferramenta nomeada — retorna um 400 com a mensagem "tool_choice: type \"tool\" and \"any\" are not supported for this model", e a correção é auto mais uso estrito de ferramentas ou saídas estruturadas. Mais ainda: blocos de pensamento agora estão vinculados ao modelo e à conta que os produziu, então uma conversa pode ser movida do Claude Sonnet 5 para o Sonnet 5.5 com seu raciocínio intacto, mas não pode levar esse raciocínio para uma família de modelos diferente, e um prefixo editado pode transformar um replay em um 400.

No Kimi K3, a superfície é menor, mas as consequências são semelhantes. Não há parâmetros de amostragem para enviar, então qualquer cliente que codifique um de forma fixa já está enviando um parâmetro que o modelo não lê. A profundidade de raciocínio é, em vez disso, um camporeasoning_effort de nível superior.

Ambas as mudanças apontam na mesma direção: a abordagem de botão determinístico para o controle de prompt está sendo substituída por um dial de esforço do lado do modelo. Qualquer pipeline que se ajustava com temperatura 0,2 e uma semente fixa precisa ser reajustado por nível de esforço em ambos esses modelos, e o reajuste é a migração.

O que os pesos abertos realmente lhe oferecem aqui

A razão para considerar o Kimi K3 em vez de um modelo fechado mais barato e com pontuação mais alta não é a capacidade nem o preço. É a fronteira.

Executar o K3 dentro da sua própria infraestrutura significa que prompts, documentos e resultados nunca saem de uma rede que você controla, o que é uma conversa de conformidade diferente de um acordo de retenção zero de dados com um fornecedor. Também significa que o modelo não pode ser descontinuado à sua revelia — Claude Sonnet 5.5 vem com um compromisso da Anthropic de não aposentar antes de 28 de setembro de 2027, e um checkpoint baixado não tem essa data. E significa que a curva de custo marginal se achata: depois do hardware, os tokens são gratuitos, a única estrutura na qual um modelo de 2,8 trilhões de parâmetros chega a se tornar a opção barata.

A licença é o que você está realmente assinando. O Kimi K3 é de pesos abertos (open-weight), não de código aberto, e a Moonshot não usa este último termo. A Licença Kimi K3 é ampla para a maioria dos usos, mas um negócio de modelo como serviço acima de um limite de receita móvel precisa de um acordo comercial separado, e produtos que ultrapassam grandes limites de usuários ou de receita devem exibir a atribuição "Kimi K3". Chamá-lo de licenciado sob MIT é uma imprecisão da era K2 que ainda circula. Se você planeja construir sobre os pesos em vez de chamar a API, isto é uma análise jurídica, e não uma nota de rodapé.

E os pesos são grandes o suficiente para que a auto-hospedagem seja uma decisão de capital. Um MoE de 2,8T de parâmetros com aproximadamente 104B de parâmetros ativos não é uma implantação em servidor único, e o esforço necessário para colocá-lo em funcionamento é o custo real da opção — um custo que ofusca a diferença de US$ 5 por milhão nas taxas de saída.

Onde o OrcaRouter se encaixa

A maioria das equipes que avalia essas duas opções não quer ter de escolher entre uma API gerenciada e uma aquisição de hardware. Elas querem rotear.

O OrcaRouter é um endpoint compatível com OpenAI sobre mais de 200 modelos, com o preço de tabela do fornecedor repassado e sem markup, pelo que uma alteração de tarifa do fornecedor de qualquer um dos lados entra em vigor no mesmo dia, em vez de no próximo ciclo de faturação. O Kimi K3 está no catálogo desde julho a $3 / $15 da própria Moonshot, com um tempo p50 medido até ao primeiro token de cerca de oito segundos e aproximadamente 371,9 milhões de tokens a passar por ele na última semana. O Claude Sonnet 5 — o modelo em que ainda corre a maior parte do tráfego da API Claude, a 150 tokens de saída por segundo medidos — está roteável desde 30 de junho a $2 / $10 da Anthropic.

O Claude Sonnet 5.5 ainda não está no nosso catálogo. Onde isso for verdade, diga-o e contorne o problema: a própria API do fornecedor é o caminho até ele, e a forma de o testar sem assumir compromissos é uma percentagem de tráfego por trás de failover automático, com o Claude Sonnet 5 ou o Kimi K3 como fallback. Se a sua razão para olhar para o K3 é a fronteira e não a tarifa, os pesos estão disponíveis para download hoje e a API é uma solução provisória — o que é uma decisão sobre a sua infraestrutura, não sobre uma comparação de modelos.

O veredito, dividido pelo que você está realmente comprando

Escolha o Claude Sonnet 5.5 quando o trabalho for de contexto longo e com muita saída, quando doze pontos de índice composto forem o que se está comprando e quando uma API gerenciada com retenção zero de dados passar pela sua revisão. Reserve orçamento para o hábito de tokens — 410M de tokens no Index contra os 160M do K3 é um multiplicador de verdade — e reserve um dia para as mudanças de uso de ferramentas e de blocos de pensamento.

Escolha o Kimi K3 quando o limite é o requisito, quando você quer um checkpoint que nenhum fornecedor pode retirar, ou quando sua carga de trabalho é codificação agêntica em alto volume, em que $2,00 por tarefa de indexação contra $7,60 se acumulam. Aceite que é um modelo de 2,8 trilhões de parâmetros para hospedar, que sua licença tem cláusulas de atribuição e receita, e que ele pontua abaixo do nível Anthropic no compósito.

O que nenhuma das duas escolhas consegue evitar é o primeiro parágrafo: os parâmetros de amostragem foram removidos em ambas, e o dial de esforço é o controle que os substituiu. Seja qual for dessas duas que você escolher, essa é a mudança de que seu código precisa.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente