
Claude Sonnet 5.5 vs Kimi K3: Nenhum dos modelos vai respeitar sua configuração de temperatura
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Eis uma comparação em que os dois modelos concordam em algo que vai quebrar seu código de qualquer forma. Claude Sonnet 5.5, lançado em 28 de setembro de 2026, rejeita com um erro 400 qualquer requisição que defina temperature, top_p ou top_k com um valor diferente do padrão. Kimi K3, com disponibilidade geral pela Moonshot AI desde meados de julho de 2026, não aceita nenhum parâmetro de amostragem — sem temperature, sem top_p, sem seed — e expõe a profundidade de raciocínio apenas através de um reasoning_effort controle. Dois laboratórios distintos, duas arquiteturas distintas, uma conclusão em comum: os controles de amostragem que a maioria das integrações ainda define por hábito desapareceram nos dois.
Essa não é a comparação sobre a qual todo mundo escreve. A comparação sobre a qual todo mundo escreve é o preço: Kimi K3 a US$ 3 por milhão de tokens de entrada e US$ 15 de saída contra Claude Sonnet 5.5 a US$ 2 e US$ 10, o que é uma vitória clara da Anthropic na tabela de preços. Mas o Kimi K3 é um modelo de pesos abertos de mistura de especialistas com 2,8 trilhões de parâmetros que você pode baixar e executar dentro do seu próprio perímetro, e o Claude Sonnet 5.5 é um modelo fechado disponível em quatro nuvens. Entre um modelo fechado mais barato e um modelo mais caro que pode ser baixado, a decisão não se baseia de modo algum no preço por token.
O que cada um é, em um parágrafo cada
Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic, seguindo o Claude Opus 5.5 até a Claude API cinco dias após esse lançamento. Ele é lançado como claude-sonnet-5-5 na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry, mantém uma janela de contexto de 1M de tokens e um teto de saída síncrona de 128K, e mantém exatamente o preço do Claude Sonnet 5: US$ 2 de entrada, US$ 10 de saída, US$ 0,20 por milhão para leituras de cache. O pensamento adaptativo fica ativado por padrão no nível alto de esforço. Ele está disponível com retenção zero de dados, e a Artificial Analysis lhe atribui um Intelligence Index de 56 em sua revisão v4.3.2 — terceiro entre os 216 modelos que mede.

O Kimi K3 é o carro-chefe da Moonshot AI: um modelo de mistura de especialistas com 2,8 trilhões de parâmetros que ativa cerca de 104 bilhões de parâmetros por token, com uma janela de contexto de 1M de tokens e compreensão visual nativa. Ele foi construído para codificação de longo horizonte e trabalho de conhecimento em múltiplas etapas, e a Moonshot o posiciona nominalmente para harnesses de agentes de programação. Ele fala o formato da API da OpenAI, expõe reasoning_effort como seu único controle de raciocínio, e tem pesos abertos sob a Licença Kimi K3 — o que não é a mesma coisa que código aberto, e a diferença é justamente a parte que você deve ler antes de construir sobre ele.
A tabela de tarifas, e o número abaixo dela.
Coloque os dois lado a lado nas dimensões que decidem um projeto de lei, e não uma manchete:
• Preço de entrada — Claude Sonnet 5.5 $2 por milhão vs Kimi K3 $3 por milhão
• Preço de saída — Claude Sonnet 5.5 $10 por milhão vs Kimi K3 por milhão
• Leituras de cache — $0,20 por milhão vs $0,30 por milhão
• Janela de contexto — 1.000.000 de tokens vs 1.048.576 de tokens
• Pesos — proprietários, quatro plataformas hospedadas vs. pesos abertos sob a Licença Kimi K3
• Índice de Inteligência — Claude Sonnet 5.5 56 vs Kimi K3 44 na mesma revisão v4.3.2
• Custo por tarefa do Intelligence Index — Claude Sonnet 5.5 $7,60 vs Kimi K3 $2,00
• Verbosidade no Índice — Claude Sonnet 5.5 410M tokens de saída vs Kimi K3 160M
Esse último par é a inversão que vale a pena ponderar. O modelo da Anthropic é 50% mais barato na entrada e um terço mais barato na saída e, ainda assim, custa 3,8 vezes mais para concluir a mesma avaliação, porque gasta 2,6 vezes os tokens para chegar lá. No resultado composto, ele também marca doze pontos a mais, portanto não se trata de um modelo perdulário que não entrega nada. Trata-se de dois modelos cujo comportamento de custo não pode ser comparado apenas lendo duas tabelas de preços, e é por isso que existe a métrica da tarefa de índice.
Nenhuma dessas contagens de tokens será a sua contagem de tokens. A própria documentação da Moonshot observa que a profundidade de raciocínio do K3 é definida por reasoning_effort e não pela amostragem, e o mesmo vale, na prática, para o parâmetro effort do Claude Sonnet 5.5 — portanto, em ambos os modelos, a maior alavanca sobre a sua fatura é uma configuração de esforço, não uma negociação de preço.

Os erros 400, em detalhe

A recusa compartilhada de parâmetros de amostragem é a sobreposição mais prática aqui, porque é a falha que aparece na manhã seguinte a uma troca de modelo.
No Claude Sonnet 5.5, as regras são explícitas e implacáveis. Um valor não padrão de temperature, top_p ou top_k retorna um 400. Enviar thinking: {"type": "disabled"} retorna um 400 apontando para between_tools, a nova configuração de pensamento mais baixa, que é aceita em esforço baixo, médio e alto, mas rejeitada em xhigh ou max. Uso forçado de ferramentas — tool_choice definido como "any" ou como uma ferramenta nomeada — retorna um 400 com a mensagem "tool_choice: type \"tool\" and \"any\" are not supported for this model", e a correção é auto mais uso estrito de ferramentas ou saídas estruturadas. Mais ainda: blocos de pensamento agora estão vinculados ao modelo e à conta que os produziu, então uma conversa pode ser movida do Claude Sonnet 5 para o Sonnet 5.5 com seu raciocínio intacto, mas não pode levar esse raciocínio para uma família de modelos diferente, e um prefixo editado pode transformar um replay em um 400.
No Kimi K3, a superfície é menor, mas as consequências são semelhantes. Não há parâmetros de amostragem para enviar, então qualquer cliente que codifique um de forma fixa já está enviando um parâmetro que o modelo não lê. A profundidade de raciocínio é, em vez disso, um camporeasoning_effort de nível superior.
Ambas as mudanças apontam na mesma direção: a abordagem de botão determinístico para o controle de prompt está sendo substituída por um dial de esforço do lado do modelo. Qualquer pipeline que se ajustava com temperatura 0,2 e uma semente fixa precisa ser reajustado por nível de esforço em ambos esses modelos, e o reajuste é a migração.
O que os pesos abertos realmente lhe oferecem aqui
A razão para considerar o Kimi K3 em vez de um modelo fechado mais barato e com pontuação mais alta não é a capacidade nem o preço. É a fronteira.
Executar o K3 dentro da sua própria infraestrutura significa que prompts, documentos e resultados nunca saem de uma rede que você controla, o que é uma conversa de conformidade diferente de um acordo de retenção zero de dados com um fornecedor. Também significa que o modelo não pode ser descontinuado à sua revelia — Claude Sonnet 5.5 vem com um compromisso da Anthropic de não aposentar antes de 28 de setembro de 2027, e um checkpoint baixado não tem essa data. E significa que a curva de custo marginal se achata: depois do hardware, os tokens são gratuitos, a única estrutura na qual um modelo de 2,8 trilhões de parâmetros chega a se tornar a opção barata.
A licença é o que você está realmente assinando. O Kimi K3 é de pesos abertos (open-weight), não de código aberto, e a Moonshot não usa este último termo. A Licença Kimi K3 é ampla para a maioria dos usos, mas um negócio de modelo como serviço acima de um limite de receita móvel precisa de um acordo comercial separado, e produtos que ultrapassam grandes limites de usuários ou de receita devem exibir a atribuição "Kimi K3". Chamá-lo de licenciado sob MIT é uma imprecisão da era K2 que ainda circula. Se você planeja construir sobre os pesos em vez de chamar a API, isto é uma análise jurídica, e não uma nota de rodapé.
E os pesos são grandes o suficiente para que a auto-hospedagem seja uma decisão de capital. Um MoE de 2,8T de parâmetros com aproximadamente 104B de parâmetros ativos não é uma implantação em servidor único, e o esforço necessário para colocá-lo em funcionamento é o custo real da opção — um custo que ofusca a diferença de US$ 5 por milhão nas taxas de saída.
Onde o OrcaRouter se encaixa
A maioria das equipes que avalia essas duas opções não quer ter de escolher entre uma API gerenciada e uma aquisição de hardware. Elas querem rotear.
O OrcaRouter é um endpoint compatível com OpenAI sobre mais de 200 modelos, com o preço de tabela do fornecedor repassado e sem markup, pelo que uma alteração de tarifa do fornecedor de qualquer um dos lados entra em vigor no mesmo dia, em vez de no próximo ciclo de faturação. O Kimi K3 está no catálogo desde julho a $3 / $15 da própria Moonshot, com um tempo p50 medido até ao primeiro token de cerca de oito segundos e aproximadamente 371,9 milhões de tokens a passar por ele na última semana. O Claude Sonnet 5 — o modelo em que ainda corre a maior parte do tráfego da API Claude, a 150 tokens de saída por segundo medidos — está roteável desde 30 de junho a $2 / $10 da Anthropic.
O Claude Sonnet 5.5 ainda não está no nosso catálogo. Onde isso for verdade, diga-o e contorne o problema: a própria API do fornecedor é o caminho até ele, e a forma de o testar sem assumir compromissos é uma percentagem de tráfego por trás de failover automático, com o Claude Sonnet 5 ou o Kimi K3 como fallback. Se a sua razão para olhar para o K3 é a fronteira e não a tarifa, os pesos estão disponíveis para download hoje e a API é uma solução provisória — o que é uma decisão sobre a sua infraestrutura, não sobre uma comparação de modelos.
O veredito, dividido pelo que você está realmente comprando
Escolha o Claude Sonnet 5.5 quando o trabalho for de contexto longo e com muita saída, quando doze pontos de índice composto forem o que se está comprando e quando uma API gerenciada com retenção zero de dados passar pela sua revisão. Reserve orçamento para o hábito de tokens — 410M de tokens no Index contra os 160M do K3 é um multiplicador de verdade — e reserve um dia para as mudanças de uso de ferramentas e de blocos de pensamento.
Escolha o Kimi K3 quando o limite é o requisito, quando você quer um checkpoint que nenhum fornecedor pode retirar, ou quando sua carga de trabalho é codificação agêntica em alto volume, em que $2,00 por tarefa de indexação contra $7,60 se acumulam. Aceite que é um modelo de 2,8 trilhões de parâmetros para hospedar, que sua licença tem cláusulas de atribuição e receita, e que ele pontua abaixo do nível Anthropic no compósito.
O que nenhuma das duas escolhas consegue evitar é o primeiro parágrafo: os parâmetros de amostragem foram removidos em ambas, e o dial de esforço é o controle que os substituiu. Seja qual for dessas duas que você escolher, essa é a mudança de que seu código precisa.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
