
Kimi Linear Está Se Espalhando: Todo Modelo Que Podemos Verificar Realmente Executa KDA
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekNOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- qwenNOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 198 tok/s
- orcaNOVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligência42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligência39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligência72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligência52Código57Matemática
- z-aiZ.ai: GLM 5.22026-06-1653Inteligência69Código60Matemática
"Uau! Kimi-Linear está ganhando adoção! Esse é tipo o terceiro modelo externo que vejo." Essa era a postagem inteira — uma linha de @teortaxesTex em 5 de agosto de 2026, com uma captura de tela anexada e sem um único modelo nomeado. O link encurtado nela resolve para a imagem, não para um repositório, portanto não há nada em que clicar e nada para corroborar. A afirmação é verificável mesmo assim, e importa mais do que uma linha sugere: se laboratórios além da Moonshot AI estão agora construindo com base no design de atenção por trás de Kimi-Linear-48B-A3B-Instruct e Kimi K3, então a Kimi Delta Attention deixou de ser um truque interno de um laboratório e começou a se tornar um ingrediente que outras pessoas adotam. Por isso, fomos procurar os modelos em vez da captura de tela. A resposta curta: o caso mais forte é Ling-3.0-flash, cujo próprio model card descreve uma pilha de 5:1 de camadas KDA e MLA; o caso mais útil é um checkpoint de pesquisa de um laboratório dos EUA que quantifica o custo do KDA puro; e em escala de fronteira, fora da Moonshot, ninguém o lançou.
O que a alegação é, e o que ela não é
Um profissional, uma captura de tela, nenhum modelo nomeado, nenhuma corroboração. Essa é toda a base probatória para "ganhando adoção", e isso deve ser lido como um convite para verificar, não como notícia. Não conseguimos reproduzir a captura de tela, portanto nada abaixo é uma confirmação dela — tudo o que se segue é o que os metadados públicos do modelo mostraram em 5 de agosto de 2026, quando fizemos uma varredura, além do que cada laboratório diz em sua própria ficha do modelo. Quando um número vem da medição do próprio fornecedor, ele é rotulado dessa forma, porque nesta história específica quase todos os números de destaque são.
Uma única tela no Kimi Linear, porque "adoção" significa adotar isto.
Kimi Linear é uma arquitetura de atenção, publicada pela equipe Kimi como arXiv 2510.26692 em 30 de outubro de 2025, não um produto. Seu núcleo é a Kimi Delta Attention (KDA), que parte do Gated DeltaNet e substitui seu forget gate grosseiro por um decaimento fino por canal, de modo que o estado recorrente aprende o que manter canal por canal, em vez de por completo. A atualização é reestruturada em forma de blocos Diagonal-Plus-Low-Rank especificamente para ser processada nos Tensor Cores em vez de deixá-los ociosos. Esse enquadramento de hardware é o ponto do design: a atenção linear sempre foi barata na teoria e geralmente decepcionante na prática.
The released checkpoints — Kimi-Linear-48B-A3B-Base and Kimi-Linear-48B-A3B-Instruct — têm 48B de parâmetros totais com 3B ativos, uma janela de contexto de 1M de tokens e licença MIT. As camadas alternam em uma proporção de cerca de 3:1, vinte camadas KDA para sete camadas de Multi-Head Latent Attention, de modo que três em cada quatro camadas são do tipo recorrente barato, e a cada quarta camada mantém atenção global exata.
O que a Moonshot reporta, tudo medido contra uma linha de base MLA completa treinada com uma receita idêntica — números do fornecedor, não reproduzidos de forma independente:
• Throughput de decodificação — até 6x mais rápido no tempo por token de saída em contexto de 1M versus MLA completo
• Cache KV — até 75% menor, e é daí que vem a taxa de transferência.
• Contexto longo — RULER a 128k: 84.3 para Kimi Linear com aceleração de 3.98x, contra 81.3 para a linha de base MLA
• Contexto breve — MMLU-Pro a 4k: 51,0 contra 47,2 para a baseline MLA e 47,9 para um híbrido Gated DeltaNet, aproximadamente na mesma velocidade que a atenção completa, portanto o design não está obtendo velocidade de contexto longo ao abrir mão da qualidade de contexto curto.
• Ablação de pré-treinamento — o híbrido 3:1 atinge perplexidade de validação de 5.65, enquanto a atenção completa chega a 5.77
{{1}}O limite honesto de tudo isso: a evidência de linha de base correspondente se limita a 48B.{{/1}} {{2}}Ninguém construiu um equivalente de atenção total de 2.8T do Kimi K3 para comparar, e, segundo uma verificação de fatos do final de julho de 2026 sobre as alegações da arquitetura do K3, nenhuma sonda independente de recordação de contexto longo sem atalhos havia sido publicada para nenhum dos dois modelos.{{/2}} {{3}}A narrativa da eficiência é bem respaldada.{{/3}} {{4}}A narrativa de "supera a atenção total" é respaldada em escala de pesquisa pelo laboratório que escreveu o artigo.{{/4}}

Até agora, a tração parece ter sido mais uma questão de downloads do que de arquiteturas de outras pessoas: 98.164 downloads no último mês, 570 curtidas, um provedor de inferência listado no Hugging Face, e uma árvore de modelos com 2 adaptadores, 8 fine-tunes e 24 quantizações. Popular, claramente. Ser copiado é outra questão.
O caso de adoção mais forte: Ling-3.0-flash
Ling-3.0-flash é o que torna a afirmação real. Seu card no Hugging Face descreve uma arquitetura de atenção linear híbrida nativa construída a partir de uma pilha alternada de 5:1 entre Kimi Delta Attention e MLA — 35 camadas KDA para 7 camadas MLA com gating — em um modelo Mixture-of-Experts de 124B de parâmetros com 5.1B ativos por token, um contexto de 256K treinado em uma progressão de 8K para 32K para 256K, e licença MIT. Isso não é um brinquedo de pesquisa de um hobbyista; é um modelo em produção de um laboratório estabelecido, e ele nomeia o módulo de atenção da Moonshot em sua própria descrição de arquitetura.
Também é mais agressivo nisso do que a Moonshot. A Moonshot mantém uma camada de atenção exata em cada quatro; a Ling-3.0-flash mantém uma em cada seis. Se um design é uma desvantagem, você faz hedge contra ele; você não gasta menos camadas globais do que as pessoas que o inventaram. Lido em conjunto com a geração anterior, isso é uma mudança: os levantamentos de arquitetura de fevereiro de 2026 que catalogaram essa classe de modelos tinham o carro-chefe anterior da Ling com Lightning Attention emparelhado com MLA numa proporção de 7:1. O mecanismo mudou entre gerações, e a mudança foi na direção do KDA.
Duas ressalvas que não vamos encobrir. Isto é o que consta na ficha do modelo: lemos a descrição da arquitetura do próprio repositório e sua configuração, que declara um tipo de modelo personalizado `bailing_hybrid` com uma implementação `BailingMoeV3` — não auditamos os kernels para confirmar se a matemática é KDA ou apenas inspirada em KDA. E o repositório não possui nenhuma tag KDA; o que aparece em uma busca por tags é uma conversão GGUF de terceiros que outra pessoa rotulou. O que é um alerta útil sobre o método e leva diretamente às próximas duas seções.
Arcee AI realizou o experimento que a Moonshot não realizou.
O uso externo mais informativo da KDA não é um produto, de forma alguma. Cerca de seis semanas após o artigo Kimi Linear, em meados de dezembro de 2025, a Arcee AI publicou dois checkpoints de pesquisa sob licença Apache-2.0 — AFM-4.5B-Base-KDA-Only e AFM-4.5B-Base-KDA-NoPE — em sua própria implementação ArceeKDAForCausalLM, marcados, explicitamente, como kimi-delta-attention. A pergunta deles era aquela que o design híbrido da Moonshot evita cuidadosamente: a atenção total pode ser substituída por completo? Então eles converteram todas as 24 camadas de atenção para KDA, sem deixar nenhuma camada de atenção global, e destilaram o resultado usando o AFM-4.5B-Base original como professor, com comprimento de sequência de 32 mil.
Os resultados relatados por eles, professor versus aluno puro-KDA:
• MMLU — de 63,1 para 55,8, uma queda real, mas suportável.
• GSM8K — de 52.1 para 26.8, aproximadamente pela metade
• HellaSwag — de 78.0 para 74.3, praticamente intacto

O formato desse dano é a parte interessante. Conhecimento amplo e continuação de senso comum geralmente sobrevivem ao serem empurrados através de um estado recorrente de tamanho fixo. Aritmética de múltiplas etapas, que exige a recuperação exata de resultados intermediários que o modelo escreveu várias etapas atrás, não sobrevive. A Arcee também relata que a degradação de contexto longo é suave, sem um precipício abrupto. Em conjunto, é a evidência pública mais clara de por que toda implantação séria de KDA é híbrida: as camadas globais de uma em quatro da Moonshot e as de uma em seis da Ant não são timidez, são a parte que preserva a aritmética.
O que não é: um veredito sobre KDA em escala. Esta é uma destilação de 4,5B, não uma execução de pré-treinamento, e a destilação em uma arquitetura alterada perde coisas que o pré-treinamento do zero não perderia. Leia como a ablação que um fornecedor não tinha incentivo para publicar — de um laboratório independente que não tinha nada a ganhar com a resposta.
A cauda longa: um aglomerado de pequenos repositórios KDA em uma única semana
Abaixo dos dois casos sérios encontra-se uma dispersão de pequenos, e as datas são o que os tornam dignos de menção. NEXIVON-1B-BASE, enviado em 31 de julho de 2026, declara seu tipo de modelo como, literalmente, kda — Apache-2.0, 285 downloads, sem curtidas. qingyi-kda-0.6b, na mesma semana, é um fine-tune do Qwen3-0.6B-Base que acompanha uma implementação personalizada de qingyi_kda. Scrapegoat-Tiny-Coder, também nessa semana, combina uma tag kda com um design próprio de "dual-track parallel attention". Mais dois, maccy-106m-base e maccy-96m-16k-base, foram marcados com kimi-delta-attention em 27 e 28 de julho.
Nenhuma dessas coisas é importante por si só — curtidas de um dígito, autores desconhecidos, contagens de parâmetros em escala de pesquisa. Coletivamente, elas provavelmente são o que o total de "terceiro modelo externo que vejo" está contando, e não podemos confirmar quais três, já que o post não nomeou nenhum. O sinal nelas não são os modelos, são os dez dias: quatro execuções de treinamento pequenas e independentes alcançaram o KDA em uma semana e meia, o que acontece quando um kernel deixa de ser um artefato de pesquisa e se torna algo que você pode inserir em um script de treinamento em um fim de semana.
O que a varredura não encontrou
Consultamos o Hugging Face em busca de todos os repositórios que contêm o tipo de modelo kimi_linear. Havia 47. Todos exceto três têm "Kimi" no nome, e os que não são da própria Moonshot são derivados, em vez de adotantes: quantizações AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF e MLX em todas as profundidades de bits; variantes REAP de 35B com poda de especialistas da Cerebras; e builds FlagRelease FlagOS do checkpoint Instruct para aceleradores NVIDIA, MetaX e Hygon. Esse último grupo é genuinamente interessante por um motivo diferente — alguém realizou o trabalho de fazer o KDA rodar em silício chinês doméstico — mas nada disso é outro laboratório projetando outro modelo.
Nenhum modelo em escala de fronteira fora da Moonshot declara KDA. Ling-3.0-flash com 124B total e 5.1B ativos é o teto da adoção externa no momento.
E o método tem uma lacuna que merece ser nomeada, porque contraria o nosso próprio resultado negativo. Um laboratório que reimplementa o KDA registra o seu próprio tipo de modelo — arcee_kda, qingyi_kda, bailing_hybrid — portanto, as varreduras por tags subestimam sistematicamente exatamente os adotantes que procuramos, e um modelo pode usar o mecanismo sem nunca escrever "KDA" na sua ficha. A ausência de uma tag é uma evidência fraca, não uma prova. Se houver um quarto ou quinto adotante silencioso, é precisamente assim que ele permaneceria invisível.
Todos os outros escolheram uma atenção linear diferente.
A razão pela qual "Kimi Linear está ganhando adoção" é uma história é que, durante a maior parte de 2026, não estava. A atenção linear híbrida varreu o campo de modelos de pesos abertos — mas não esta variante dela. De acordo com os levantamentos de arquitetura publicados em fevereiro de 2026: Qwen3-Next 80B-A3B e Qwen3.5-397B-A17B combinam Gated DeltaNet com atenção gated na proporção de 3:1, o que significa que o Qwen3.5-397B-A17B tem 45 camadas recorrentes contra 15 de atenção completa, num total de 60. O principal modelo Ling anterior usava Lightning Attention com MLA em 7:1. Nemotron 3 Nano 30B-A3B e Super 120B-A12B são híbridos Mamba-2, com apenas 6 camadas de atenção em uma pilha de 52 camadas e 8 em uma pilha de 88 camadas, respectivamente. O GLM-5 permaneceu com MLA e adicionou atenção esparsa por cima. O MiniMax-M2.5 foi totalmente na direção oposta e manteve a atenção multi-head simples, supostamente por confiabilidade. E o Kimi K2.5, o próprio carro-chefe da Moonshot antes do K3, era MLA — o laboratório publicou KDA em outubro de 2025 e não o colocou em seu modelo de fronteira até julho de 2026.
Então {{1}}a categoria venceu e a variante não{{/1}}. Todos concordam que {{2}}três quartos das suas camadas podem ser recorrentes{{/2}}; ninguém concordou sobre {{3}}qual recorrência{{/3}}. O diferencial da KDA é a {{4}}porta de decaimento por canal{{/4}}, e seu custo é que você precisa de seus {{5}}kernels personalizados e de seu encanamento de cache de prefixo{{/5}} em vez do {{6}}caminho Gated DeltaNet{{/6}} que {{7}}metade do ecossistema já tinha{{/7}}. Até este mês, {{8}}um laboratório pagou esse custo{{/8}}.
A adoção que já aconteceu está nas stacks de serviço.
As arquiteturas não se espalham porque são elegantes; elas se espalham quando a infraestrutura as torna baratas. Essa parte já está feita para a KDA, e aconteceu mais rápido do que a adoção do model-card. Tanto a vLLM quanto a SGLang ofereceram suporte no dia zero quando os pesos do Kimi K3 foram lançados em 27 de julho de 2026, com a Moonshot integrando sua implementação de prefix-caching da KDA diretamente na própria vLLM, em vez de manter um fork. A SGLang enviou kernels fundidos de KDA e Gated DeltaNet e relatou capacidade lógica de KV subindo de 1,5M para 12,2M tokens no mesmo hardware — sua própria medição, e o número de eficiência de terceiros mais concreto em toda esta história. Os kernels de referência vivem no fla-core, que qualquer execução de treinamento pequena pode importar.
Essa é a diferença entre a Arcee precisar de um esforço de pesquisa deliberado em dezembro de 2025 e quatro repositórios anônimos declarando KDA casualmente em uma semana de julho de 2026. O mecanismo se tornou uma dependência que você instala. Se a fronteira vai seguir é uma questão separada, mas o argumento de atrito contra a KDA evaporou em grande parte.
O que muda se você está apenas comprando tokens
{{1}}Nada sobre o seu código. Você nunca chama KDA; você o experimenta como o que um contexto de um milhão de tokens custa e quanto tempo o primeiro token leva.{{/1}} {{2}}Kimi K3 é o modelo onde isso aparece comercialmente hoje — no OrcaRouter ele custa $3,00 por milhão de tokens de entrada e $15,00 por milhão de saída,{{/2}} {{3}}com o contexto completo de 1M de tokens e um p50 medido de 8,88 segundos de tempo até o primeiro token nos últimos sete dias.{{/3}} {{4}}Essa economia é, substancialmente, o que o híbrido KDA 3:1 compra: servir um contexto de um milhão de tokens a um preço que é meramente caro, em vez de proibitivo.{{/4}}

O checkpoint de pesquisa é uma questão diferente. O Kimi-Linear-48B-A3B-Instruct é licenciado sob MIT, com um único provedor de inferência listado em sua página no Hugging Face, e não está no OrcaRouter — se você quiser executá-lo, isso significa auto-hospedagem ou usar esse provedor. A aritmética da auto-hospedagem é mais favorável do que a contagem de parâmetros sugere: 48B de pesos em bf16 são aproximadamente 96 GB, então duas placas de 80 GB, enquanto as conversões de 4 bits em MLX e GGUF ficam perto de 25-30 GB e cabem em uma única placa ou em um Mac bem especificado. O Ling-3.0-flash também não está no OrcaRouter hoje. Não vamos fingir o contrário para defender um ponto sobre roteamento.
Onde o roteamento realmente importa aqui é no custo de errar uma aposta de arquitetura. Modelos híbridos de atenção linear são exatamente a classe em que a tabela de benchmarks do fornecedor e sua carga de trabalho podem divergir — um estado recorrente de tamanho fixo falha em padrões de recuperação que nenhuma pontuação agregada expõe, e essa é a lição daquele número GSM8K reduzido pela metade. Executar a comparação por meio de uma chave de API em mais de 200 modelos significa que o teste é uma mudança na string do modelo, e não um ciclo de aquisição, ao preço de tabela do provedor com 0% de acréscimo da nossa parte, e com failover automático para que um modelo de contexto longo que você ainda está avaliando não seja um ponto único de falha em um caminho de produção. Experimente no seu próprio tráfego de contexto longo por um dia. Essa é uma resposta mais barata do que qualquer tabela de benchmarks, incluindo a nossa.
Perguntas que realmente valem a pena fazer
Kimi Linear é a mesma coisa que Kimi K3?
Não, e confundi-los é o erro mais comum na cobertura de ambos. Kimi Linear é o artigo de arquitetura mais um modelo de pesquisa com 48B no total e 3B ativos, com contexto de 1M, lançado sob a licença MIT no final de 2025 para demonstrar que um híbrido com forte uso de KDA supera o MLA completo com treinamento equivalente. Kimi K3 é o carro-chefe de 2,8 trilhões de parâmetros da Moonshot, de julho de 2026 — 104B ativos, nativamente multimodal, contexto de 1M — que levou a ideia de KDA na proporção 3:1 à escala de fronteira e adicionou Attention Residuals, um truque separado que o laboratório reporta como responsável por cerca de 25% de eficiência de treinamento por menos de 2% de custo extra. Mecanismo compartilhado, escala, capacidade e preço totalmente diferentes. Benchmarks de um dizem muito pouco sobre o outro.
Por que um laboratório escolheria KDA em vez de Gated DeltaNet, visto que a maioria escolheu Gated DeltaNet?
KDA é um refinamento estrito do Gated DeltaNet, então a questão é se o refinamento vale o custo de troca. O refinamento é o portão: o Gated DeltaNet aplica um decaimento à sua memória recorrente com um escalar por passo, enquanto o KDA aprende um decaimento por canal de características, o que permite que o estado mantenha um nome de variável ao longo de dez mil tokens enquanto descarta a frase em que ele apareceu. A ablação da Moonshot coloca isso em aproximadamente 0,12 de perplexidade de validação em 48B, e sua formulação DPLR em blocos foi escrita para manter os núcleos de tensor ocupados, então a expressividade extra não sai ao custo da taxa de transferência que ela proporciona. Em contrapartida, o Gated DeltaNet já tinha amplo suporte de kernels e frameworks antes de qualquer um dos dois estar na moda, o que representa um ganho real de tempo de engenharia. A resposta de 2026 foi majoritariamente "não vale a pena." O Ling-3.0-flash é a primeira aposta em escala de produção no sentido contrário.
Alguma dessas coisas deveria mudar o que eu vou implantar neste trimestre?
Somente se você estiver trabalhando com contextos muito longos. Se seus prompts tiverem menos de cerca de 32 mil tokens, a atenção linear híbrida é um detalhe de implementação sem impacto na sua escolha de modelo; escolha com base em qualidade, preço e latência como de costume. Se você estiver usando 128 mil tokens ou mais, vale saber que os modelos que mantêm seus custos razoáveis nessa extensão são cada vez mais híbridos KDA, e que suas pontuações publicadas de contexto longo são benchmarks agregados, e não sondas de recordação adversariais. Teste a recuperação no seu comprimento de contexto real em vez de confiar em uma pontuação RULER. Esse conselho seria idêntico se o mecanismo fosse Gated DeltaNet ou Mamba-2.
Onde isso deixa a afirmação
Direcionalmente correto, e menor do que parece. Em 5 de agosto de 2026, o que é verificável é um modelo de produção de um laboratório estabelecido, um par de pesquisa de um laboratório independente dos EUA que publicou o lado negativo honesto, alguns repositórios sub-1B dos últimos dez dias, e um ecossistema de serving que já absorveu o kernel. Isso é mais do que "um truque de laboratório" e muito menos do que um padrão. O número a observar não são três modelos externos — é se o próximo lançamento de pesos abertos de fronteira de um laboratório que não seja a Moonshot inclui gating por canal, e se alguém fora da Moonshot publica uma sonda de recall que teste o que o estado de tamanho fixo realmente esquece. Ambos diriam mais do que outra captura de tela.
