
Kimi K4: o que o vazamento realmente afirma, e por que "menos parâmetros ativos" seria a verdadeira história
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 506 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Uma única publicação colocou quatro nomes de modelos não anunciados em circulação de uma só vez. A lista começa com Kimi K4, a suposta próxima geração da Moonshot AI, ao lado de GLM-5.5 Flash e GLM-5.4 da Z.ai e DeepSeek V4.1P — e a própria ênfase do autor não está em nenhum dos nomes de destaque, mas numa suspeita sobre a aritmética por trás do K4: que ele pode ativar menos parâmetros do que o modelo que substitui. Essa alegação não foi verificada. Não há ficha de modelo do Kimi K4, nem pesos, nem identificador de API, nem preço nem rota, e o mesmo vale para todos os nomes da Z.ai na lista. O que vale a pena fazer agora é descobrir quais dessas alegações seriam verificáveis, como é a linha de base disponibilizada e o que um K4 mais esparso realmente significaria.
O sinal, e o seu nível
Este é um sinal precoce, e deve ser lido como tal. O post que o traz é uma leitura de convenções de nomenclatura de modelos, e não um relato de avistamento: ele sinaliza "GLM-5.5 Flash, GLM-5.4" como uma nomenclatura interessante e chama Kimi K4 de "muito estranho", depois oferece um mecanismo especulativo — menos especialistas ativados — sem alegar ter visto uma configuração, uma listagem de checkpoints ou um endpoint de staging.
Nada no registro público contradiz os nomes, e nada os corrobora também. Essa assimetria é normal nesta fase de um ciclo de lançamento, e é exatamente por isso que o movimento útil é fixar a linha de base e os testes, e não especular mais. Um nome em uma postagem é uma hipótese sobre um produto, não uma evidência dele.
A base de comparação com a qual um Kimi K4 seria medido
Kimi K3 é real, foi lançado e é excepcionalmente bem documentado, o que o torna um ponto de referência sólido. O cartão de modelo da própria Moonshot descreve um modelo de Mixture-of-Experts de 2,8 trilhões de parâmetros que ativa 104 bilhões de parâmetros por token, distribuídos por 93 camadas — uma camada densa e 92 esparsas. A esparsidade é agressiva e é declarada abertamente: 16 de 896 especialistas são ativados por token, além de 2 especialistas compartilhados, o que a Moonshot atribui a uma melhoria de aproximadamente 2,5× na eficiência de escala em relação ao Kimi K2.
A pilha de atenção é onde o K3 rompe com a geração anterior. Das suas 92 camadas esparsas, 69 usam Kimi Delta Attention — um mecanismo híbrido de atenção linear — e 24 usam MLA com gating, uma divisão de 3:1 que mantém uma minoria de camadas de atenção completa e envia o restante para o caminho linear mais barato. As camadas carregam um residual de atenção a cada 12 blocos, a função de ativação é SiTU-GLU, e todo o modelo é treinado com pesos MXFP4 e ativações MXFP8 sob treinamento ciente de quantização. O comprimento de contexto é 1.048.576 tokens, o vocabulário é 163.840, e a visão passa por um codificador MoonViT-V2 de 401M parâmetros, tornando o K3 nativamente capaz de imagens em vez de multimodal por acréscimo posterior.

Esses são os números que um sucessor precisa mover. Observe o que eles implicam sobre a ideia de "menos parâmetros ativos": o K3 já é um modelo extraordinariamente esparso. Ele ativa cerca de 3,7% do total de parâmetros por token. Um K4 que ativasse menos de 104B não estaria cortando gordura de um projeto superdimensionado — estaria recuando de uma taxa de esparsidade que a Moonshot apresentou publicamente como uma vitória, e faria isso justamente na geração em que o resto do campo está indo na direção oposta.
O que "menos parâmetros ativos" significaria se fosse verdade
Há duas leituras disponíveis e elas apontam em direções opostas. A mais generosa é arquitetural: a Moonshot poderia estar estendendo ainda mais o híbrido KDA, substituindo mais camadas de atenção completa por camadas lineares e reequilibrando o orçamento de especialistas de modo que uma contagem menor de ativações compre um contexto mais longo, uma pegada de serving mais barata, ou uma melhor relação qualidade por flop. Sob essa leitura, menos parâmetros ativos é um refinamento da mesma tese que o K3 já enuncia — a de que a esparsidade é uma estratégia de escala, não um compromisso.
A outra interpretação é que o K4 não é de forma alguma um sucessor uniforme. A linha do Kimi já se ramificou uma vez este ano, e relatos têm apontado de várias formas para K3.1, K3.2 e K4 como três produtos diferentes. Um K4 que ativa menos que o K3, numa família que traz uma variante de codificação separada, é pelo menos tão consistente com um reposicionamento quanto com uma atualização direta. Ambas as interpretações são especulação. Nenhuma delas se resolve com um post.
Há também uma dimensão de licenciamento que ninguém abordou. Os pesos do K3 são disponibilizados sob a Licença Kimi K3, uma licença personalizada do tipo "outra", em vez de uma licença padrão de código aberto, e é o primeiro modelo aberto da classe 3T. Se um K4 mais esparso herda essa licença, ou a restringe, importa mais para qualquer pessoa que construa sobre os pesos do que alguns pontos na pontuação do índice.

Os outros três nomes no mesmo post
GLM-5.5 Flash e GLM-5.4 são o par mais surpreendente, e não por causa dos números. O teto divulgado pela Z.ai é o GLM-5.3, lançado em 14 de agosto de 2026 com 743B parâmetros, seguido pelo GLM-5.3-Flash em 26 de agosto, com os lançamentos dos pesos BF16 e Flash-BF16 chegando em 25 de agosto. A própria documentação da Z.ai lista exatamente três identificadores de modelo atuais: glm-5.3, glm-5.3-flash e glm-5.2. Não existe GLM-5.4, nem GLM-5.5, nem GLM-5.5 Flash — e a direção da nomenclatura é a parte estranha, já que uma geração 5.5 precedendo uma 5.4 não é como a Z.ai jamais numerou uma família. Números de versão aparecendo fora de ordem em um vazamento são um modo de falha conhecido: eles tendem a ser produtos adjacentes, codinomes internos ou um rótulo de camada de serviço, e não um novo modelo base.
DeepSeek V4.1P é o nome pelo qual o autor do sinal diz estar mais interessado, e é o mais fácil dos quatro de verificar. A documentação da API da DeepSeek nomeia exatamente duas strings de modelo atuais: deepseek-flash e deepseek-v4-pro. O sufixo "P" não tem correspondente em nenhum identificador da DeepSeek, e o lançamento de pesos mais recente na própria organização da DeepSeek é DeepSeek-V4.1-Flash, publicado em 10 de setembro de 2026. Um V4.1P seria, muito provavelmente, um irmão de nível Pro desse modelo — mas "muito provavelmente" é um palpite sobre uma string, não um produto.
Como você saberia que algo disso é real?
Os quatro nomes falham da mesma forma no mesmo teste, o que torna a espera simples em vez de angustiante. Um lançamento real deixa artefactos, e cada um deles é barato de verificar:
• Um model card na própria organização Hugging Face do fornecedor. A entrada mais recente da Moonshot é o Kimi-K3, criado em 13 de junho de 2026; as entradas mais recentes da Z.ai são a família GLM-5.3, de 25 de agosto; a mais recente da DeepSeek é o DeepSeek-V4.1-Flash, de 10 de setembro. Não existe nada mais recente em nenhuma das três.
• Uma configuração que resolve a discussão. Especificamente para o K4, os campos a procurar são num_experts e num_experts_per_token — os do K3 trazem 896 e 16. Uma configuração do K4 com um número por token mais baixo é a alegação deste vazamento sendo confirmada ou refutada em um único arquivo.
• Um modelo roteável. Um nome que aparece num catálogo é um nome com um preço, uma janela de contexto e um provedor por trás; um nome que existe apenas num post não tem nada disso.

O que você pode rotear hoje
A versão prática deste vazamento é que a geração que ele descreve não é aquela sobre a qual você pode construir. O que está ativo é a anterior, e o trabalho do roteador é fazer com que a lacuna entre gerações seja uma decisão de roteamento, e não um projeto de migração. O Kimi K3 já está disponível com seu contexto completo de 1M de tokens e visão nativa, com preço de US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de tokens de saída, com leituras de cache a US$ 0,30 — cobrado à tarifa do provedor sem margem, e é por isso que uma mudança de preço do fornecedor no K3 chega à sua fatura no mesmo dia, em vez de no próximo ciclo de reprecificação.Kimi K3 no OrcaRoutertraz a ficha técnica completa e a tarifa atual.
O mesmo se aplica ao restante da linha. GLM-5.3, GLM-5.3-Flash e DeepSeek V4.1 Flash são todos roteáveis ao lado do Kimi K3, por meio de um endpoint compatível com OpenAI que abrange mais de 200 modelos, com failover automático quando um provedor sofre degradação e uma DSL de roteamento para expressar preferências — tetos de custo, pisos de qualidade, orçamentos de latência — como política em vez de lógica por chamada. Quando um Kimi K4, GLM-5.5 Flash ou DeepSeek V4.1P aparecer, a migração é uma mudança de string na política de roteamento e nada mais. A fusão de modelos permite combinar saídas de vários modelos no mesmo endpoint quando uma tarefa se beneficia disso.
Para ser explícito sobre o que isso não é: nenhum dos quatro nomes vazados é uma rota no OrcaRouter hoje. Nós não os hospedamos e não podemos servi-los.
Conclusão
A afirmação interessante aqui não são os números de versão. É o mecanismo — um carro-chefe de próxima geração que ativa menos parâmetros do que seu antecessor seria uma declaração de que a Moonshot acredita que a esparsidade, e não a contagem bruta de ativações, é o eixo que vale a pena impulsionar, e a divisão de especialistas 16-de-896 do K3 já é um argumento nessa direção. Todas as partes da afirmação não são verificadas: Kimi K4, GLM-5.5 Flash, GLM-5.4 e DeepSeek V4.1P não têm fichas de modelo, nem pesos, nem identificadores de API e nem preços, e os próprios catálogos dos fornecedores param uma geração antes em cada caso. Trate os nomes como uma prévia de uma pergunta, não como uma resposta — e, se você precisa hoje de pesos abertos de nível frontier com contexto de 1M, o Kimi K3 é o modelo que já existe.
Quando um Kimi K4 chegar, o failover automático é o que impede que a migração se transforme em um incidente
