Kimi Linear se está extendiendo-1.png
Engineering & Research

Kimi Linear se está extendiendo: cada modelo que podemos verificar realmente ejecuta KDA

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

"¡Vaya! ¡Kimi-Linear está ganando adopción! Es como el tercer modelo externo que veo." Ese era el post completo — una línea de @teortaxesTex del 5 de agosto de 2026, con una captura de pantalla adjunta y ni un solo modelo nombrado. El enlace acortado en él redirige a la imagen, no a un repositorio, así que no hay nada a lo que hacer clic ni nada que corroborar. La afirmación es verificable de todos modos, e importa más de lo que sugiere un comentario de una línea: si laboratorios distintos de Moonshot AI ahora están construyendo sobre el diseño de atención detrás de Kimi-Linear-48B-A3B-Instruct y Kimi K3, entonces Kimi Delta Attention ha dejado de ser un truco interno de un laboratorio y ha comenzado a convertirse en un ingrediente que otros adoptan. Así que buscamos los modelos en lugar de la captura de pantalla. La respuesta corta: el caso más sólido es Ling-3.0-flash, cuya propia ficha del modelo describe una pila 5:1 de capas KDA y MLA; el caso más útil es un checkpoint de investigación de un laboratorio de EE. UU. que cuantifica lo que cuesta la KDA pura; y a escala de frontera, fuera de Moonshot, nadie lo ha lanzado.

Qué es la afirmación y qué no es

Un solo profesional, una sola captura de pantalla, ningún modelo nombrado, ninguna corroboración. Esa es toda la base probatoria de que «está ganando adopción», y debe leerse como un aviso para ir a comprobarlo, no como una noticia. No pudimos reproducir la captura, así que nada de lo que sigue es una confirmación de ella: todo lo que viene a continuación es lo que los metadatos públicos del modelo mostraban el 5 de agosto de 2026, cuando hicimos el barrido para buscarla, además de lo que cada laboratorio dice en su propia ficha del modelo. Cuando una cifra proviene de una medición del propio proveedor, se indica así, porque en esta historia en particular casi todas las cifras titularables lo son.

Una pantalla en Kimi Linear, porque "adopción" significa adoptar esto

Kimi Linear es una arquitectura de atención, publicada por el equipo de Kimi como arXiv 2510.26692 el 30 de octubre de 2025, no un producto. Su núcleo es Kimi Delta Attention (KDA), que toma Gated DeltaNet y reemplaza su compuerta de olvido de grano grueso por un decaimiento fino por canal, de modo que el estado recurrente aprende qué conservar canal por canal en lugar de hacerlo de forma global. La actualización se reestructura en una forma fragmentada de Diagonal-Más-Rango-Bajo, específicamente para que se ejecute en los núcleos tensoriales en lugar de dejarlos inactivos. Ese enfoque de hardware es el punto del diseño: la atención lineal siempre ha sido barata en teoría y, por lo general, decepcionante en la práctica.

Los checkpoints publicados — Kimi-Linear-48B-A3B-Base y Kimi-Linear-48B-A3B-Instruct — tienen 48B de parámetros totales con 3B activos, una ventana de contexto de 1M de tokens y licencia MIT. Las capas se alternan en una proporción aproximada de 3:1, veinte capas KDA frente a siete capas de atención latente de múltiples cabezas, de modo que tres de cada cuatro capas son del tipo recurrente económico y cada cuarta capa mantiene atención global exacta.

Lo que reporta Moonshot, todo medido contra una línea base MLA completa entrenada con una receta idéntica — cifras del proveedor, no reproducidas de forma independiente:

• Rendimiento de decodificación — hasta 6 veces más rápido en tiempo por token de salida en contexto de 1M frente a MLA completo

• Caché KV — hasta un 75% más pequeña, que es de donde proviene el rendimiento

• Contexto largo — RULER a 128k: 84.3 para Kimi Linear con una aceleración de 3.98x, frente a 81.3 para la línea base MLA

• Contexto breve — MMLU-Pro a 4k: 51.0 frente a 47.2 para la línea base MLA y 47.9 para un híbrido Gated DeltaNet, aproximadamente a la misma velocidad que la atención completa, por lo que el diseño no está sacrificando la calidad de contexto corto para ganar velocidad en contexto largo.

• Ablación de preentrenamiento: el híbrido 3:1 alcanza una perplejidad de validación de 5.65, mientras que la atención completa se sitúa en 5.77

El límite honesto de todo eso: la evidencia de línea base emparejada se detiene en 48B. Nadie construyó un gemelo de 2.8T con atención completa de Kimi K3 para comparar, y a partir de una verificación de hechos de finales de julio de 2026 sobre las afirmaciones de la arquitectura de K3, no se habían publicado pruebas independientes de recuerdo de contexto largo sin atajos para ninguno de los dos modelos. La historia de la eficiencia está bien respaldada. La historia de que "supera a la atención completa" está respaldada a escala de investigación por el laboratorio que escribió el artículo.

Kimi Linear Is Spreading-2.png

La tracción, hasta ahora, se ha parecido más a descargas que a arquitecturas de otras personas: 98,164 descargas en el último mes, 570 me gusta, un proveedor de inferencia en Hugging Face, y un árbol de modelos con 2 adaptadores, 8 afinaciones y 24 cuantizaciones. Popular, claramente. Copiado es otra cuestión.

El caso de adopción más fuerte: Ling-3.0-flash

{{1}}Ling-3.0-flash es el que hace realidad esa afirmación.{{/1}} {{2}}Su ficha de Hugging Face describe una arquitectura de atención lineal híbrida nativa construida a partir de una pila alternada 5:1 de Kimi Delta Attention y MLA{{/2}} — {{3}}35 capas KDA frente a 7 capas MLA con compuerta{{/3}} — {{4}}en un modelo de Mezcla de Expertos de 124B de parámetros con 5.1B activos por token{{/4}}, {{5}}un contexto de 256K entrenado en una progresión de 8K a 32K a 256K{{/5}} y {{6}}una licencia MIT.{{/6}} {{7}}Eso no es un juguete de investigación de un aficionado; es un modelo en producción de un laboratorio consolidado{{/7}} y {{8}}nombra el módulo de atención de Moonshot en su propia descripción de arquitectura.{{/8}}

También es más agresivo al respecto que Moonshot. Moonshot mantiene una capa de atención exacta de cada cuatro; Ling-3.0-flash mantiene una de cada seis. Si un diseño es un lastre, te proteges; no dedicas menos capas globales que quienes lo inventaron. Si se lee junto con la generación anterior, eso es un cambio: los estudios de arquitectura de febrero de 2026 que catalogaron esta clase de modelo emparejaban el anterior buque insignia de Ling, basado en Lightning Attention, con MLA en una proporción de 7:1. El mecanismo cambió entre generaciones, y la dirección en que cambió fue hacia KDA.

Hay dos advertencias que no vamos a pasar por alto. Esto es según la ficha del modelo: leemos la descripción de la arquitectura del propio repositorio y su configuración, que declara un tipo de modelo personalizado `bailing_hybrid` con una implementación `BailingMoeV3` — no auditamos los kernels para confirmar que las matemáticas son KDA en lugar de inspiradas en KDA. Y el repositorio no lleva ninguna etiqueta KDA; lo que aparece en una búsqueda por etiqueta es una conversión GGUF de un tercero que otra persona etiquetó. Lo cual es una advertencia útil sobre el método, y conduce directamente a las dos secciones siguientes.

Arcee AI llevó a cabo el experimento que Moonshot no hizo.

El uso externo más informativo de KDA no es un producto en absoluto. Aproximadamente seis semanas después del artículo de Kimi Linear, a mediados de diciembre de 2025, Arcee AI publicó dos checkpoints de investigación bajo Apache-2.0 — AFM-4.5B-Base-KDA-Only y AFM-4.5B-Base-KDA-NoPE — bajo su propia implementación ArceeKDAForCausalLM, etiquetados explícitamente como kimi-delta-attention. Su pregunta era aquella que el diseño híbrido de Moonshot evita cuidadosamente: ¿puede la atención completa reemplazarse por completo? Así que convirtieron las 24 capas de atención a KDA, sin dejar capas de atención global, y destilaron el resultado desde el AFM-4.5B-Base original como maestro a una longitud de secuencia de 32k.

Sus resultados reportados, maestro versus estudiante puro de KDA:

• MMLU — de 63.1 a 55.8, una caída real pero superable

• GSM8K — de 52.1 a 26.8, aproximadamente la mitad

• HellaSwag — 78.0 a 74.3, casi intacto

Kimi Linear Is Spreading-3.png

La forma de ese daño es la parte interesante. {{1}}El conocimiento general y la continuación de sentido común sobreviven en su mayoría al ser empujados a través de un estado recurrente de tamaño fijo.{{/1}} {{2}}La aritmética de múltiples pasos, que requiere la recuperación exacta de resultados intermedios que el modelo escribió hace varios pasos, no lo hace.{{/2}} {{3}}Arcee también informa que la degradación de contexto largo es gradual, sin un precipicio abrupto.{{/3}} {{4}}En conjunto, es la evidencia pública más clara de por qué cada implementación seria de KDA es híbrida:{{/4}} las capas globales de uno de cada cuatro de Moonshot y las de uno de cada seis de Ant no son timidez, son la parte que conserva la aritmética.

Lo que no es: un veredicto sobre KDA a escala. Esto es una destilación de 4.5B, no una ejecución de preentrenamiento, y la destilación hacia una arquitectura modificada pierde cosas que el preentrenamiento desde cero no perdería. Léelo como la ablación que un proveedor no tenía incentivo para publicar, de un laboratorio independiente que no tenía nada en juego en la respuesta.

La larga cola: un cúmulo de pequeños repos KDA en una sola semana

Debajo de los dos casos serios hay un puñado de casos menores, y las fechas son lo que los hace dignos de mención. NEXIVON-1B-BASE, subido el 31 de julio de 2026, declara su tipo de modelo como, literalmente, kda — Apache-2.0, 285 descargas, sin me gusta. qingyi-kda-0.6b, la misma semana, es un ajuste fino de Qwen3-0.6B-Base que incluye una implementación personalizada de qingyi_kda. Scrapegoat-Tiny-Coder, también esa semana, combina una etiqueta kda con un diseño propio de "atención paralela de doble vía". Otros dos, maccy-106m-base y maccy-96m-16k-base, fueron etiquetados como kimi-delta-attention el 27 y 28 de julio.

Ninguna de estas cosas es importante por sí sola — likes de un solo dígito, autores desconocidos, recuentos de parámetros a escala de investigación. En conjunto, probablemente sean lo que cuenta el recuento del "tercer modelo externo que veo", y no podemos confirmar cuáles tres, ya que la publicación no mencionaba ninguno. La señal en ellos no son los modelos, sino los diez días: cuatro ejecuciones de entrenamiento pequeñas e independientes alcanzaron KDA en una semana y media, lo que ocurre cuando un kernel deja de ser un artefacto de investigación y se convierte en algo que puedes incorporar a un script de entrenamiento durante un fin de semana.

Lo que el barrido no encontró

Consultamos Hugging Face en busca de todos los repositorios que contienen el tipo de modelo kimi_linear. Había 47. Todos excepto tres tienen "Kimi" en el nombre, y los que no son de Moonshot son derivados, no adoptadores: cuantizaciones AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF y MLX en todas las profundidades de bits; variantes REAP de 35B con poda de expertos de Cerebras; y compilaciones FlagRelease FlagOS del checkpoint Instruct para aceleradores NVIDIA, MetaX e Hygon. Ese último grupo es genuinamente interesante por una razón diferente: alguien hizo el trabajo de hacer que KDA funcione en silicio chino doméstico, pero nada de eso es otro laboratorio diseñando otro modelo.

Ningún modelo a escala fronteriza fuera de Moonshot declara KDA. Ling-3.0-flash con 124B en total y 5.1B activos es el techo de la adopción externa en este momento.

Y el método tiene una brecha que merece ser nombrada, porque va en contra de nuestro propio resultado negativo. Un laboratorio que reimplementa KDA registra su propio tipo de modelo — arcee_kda, qingyi_kda, bailing_hybrid — por lo que los barridos de etiquetas subestiman sistemáticamente exactamente a los adoptantes que buscamos, y un modelo puede usar el mecanismo sin escribir nunca "KDA" en su ficha. La ausencia en una etiqueta es evidencia débil, no prueba. Si hay un cuarto o quinto adoptante silencioso, así es precisamente como permanecería invisible.

Todos los demás eligieron una atención lineal diferente.

The reason "Kimi Linear is gaining adoption" is a story at all is that, for most of 2026, it wasn't. Hybrid linear attention swept the open-weight field — but not this variant of it. Per the architecture surveys published in February 2026: Qwen3-Next 80B-A3B and Qwen3.5-397B-A17B both pair Gated DeltaNet with gated attention at 3:1, meaning Qwen3.5-397B-A17B runs 45 recurrent layers against 15 full-attention ones out of 60. The previous Ling flagship used Lightning Attention with MLA at 7:1. Nemotron 3 Nano 30B-A3B and Super 120B-A12B are Mamba-2 hybrids, with just 6 attention layers in a 52-layer stack and 8 in an 88-layer stack respectively. GLM-5 stayed with MLA and added sparse attention on top. MiniMax-M2.5 went the other way entirely and kept plain multi-head attention, reportedly for reliability. And Kimi K2.5, Moonshot's own flagship before K3, was MLA — the lab published KDA in October 2025 and did not put it in its frontier model until July 2026.

Así que la categoría ganó y la variante no. Todo el mundo coincide en que tres cuartas partes de tus capas pueden ser recurrentes; nadie se puso de acuerdo sobre qué recurrencia. El diferenciador de KDA es la puerta de decaimiento por canal, y su costo es que necesitas sus kernels personalizados y su infraestructura de almacenamiento en caché de prefijos en lugar de la ruta Gated DeltaNet que ya tenía la mitad del ecosistema. Hasta este mes, un laboratorio pagó ese costo.

La adopción que ya ocurrió está en los stacks de servicio.

Las arquitecturas no se difunden porque sean elegantes; {{1}}se difunden cuando la infraestructura las abarata{{/1}}. Esa parte ya está hecha para KDA, y {{2}}ocurrió más rápido que la adopción de las model cards{{/2}}. Tanto vLLM como SGLang ofrecieron soporte desde el día cero cuando los pesos de Kimi K3 llegaron el 27 de julio de 2026, con {{3}}Moonshot integrando su implementación de caché de prefijos KDA directamente en vLLM en lugar de mantener un fork{{/3}}. SGLang lanzó kernels fusionados de KDA y Gated DeltaNet y {{4}}reportó una capacidad lógica de KV que aumentó de 1,5M a 12,2M de tokens{{/4}} {{5}}en hardware idéntico{{/5}} — {{6}}una medición propia{{/6}}, y la cifra de eficiencia de terceros más concreta de toda esta historia. Los kernels de referencia residen en fla-core, {{7}}que cualquier ejecución de entrenamiento pequeña puede importar{{/7}}.

Esa es la diferencia entre que Arcee necesite un esfuerzo de investigación deliberado en diciembre de 2025 y que cuatro repos anónimos declaren KDA casualmente en una semana de julio de 2026. El mecanismo se convirtió en una dependencia que instalas. Que la frontera siga es una cuestión separada, pero el argumento de fricción contra KDA se ha evaporado en gran medida.

¿Qué cambia si solo compras tokens?

Nada sobre tu código. Nunca llamas a KDA; lo experimentas como lo que cuesta un contexto de un millón de tokens y cuánto tarda el primer token. Kimi K3 es el modelo donde eso se hace evidente comercialmente hoy: en OrcaRouter cuesta $3.00 por millón de tokens de entrada y $15.00 por millón de salida, con el contexto completo de 1M de tokens y un p50 medido de tiempo hasta el primer token de 8.88 segundos en los últimos siete días. Esa economía es, en gran medida, lo que compra el híbrido KDA 3:1: servir un contexto de un millón de tokens a un precio que es meramente caro, no prohibitivo.

Kimi Linear Is Spreading-4.png

{{1}}El checkpoint de investigación es una propuesta diferente.{{/1}} {{2}}Kimi-Linear-48B-A3B-Instruct tiene licencia MIT con un proveedor de inferencia listado en su página de Hugging Face, y no está en OrcaRouter — si quieres ejecutarlo, eso significa auto-alojamiento o ese proveedor.{{/2}} {{3}}La aritmética del auto-alojamiento es más favorable de lo que sugiere el número de parámetros: los pesos de 48B en bf16 son aproximadamente 96 GB, así que se necesitan dos tarjetas de 80 GB, mientras que las conversiones de 4 bits MLX y GGUF rondan los 25-30 GB y caben en una sola tarjeta o en un Mac con buenas especificaciones.{{/3}} {{4}}Ling-3.0-flash tampoco está en OrcaRouter hoy.{{/4}} {{5}}No vamos a fingir lo contrario para hacer una observación sobre el enrutamiento.{{/5}}

Donde el enrutamiento sí importa aquí es en el coste de equivocarse en una apuesta de arquitectura. Los modelos híbridos de atención lineal son exactamente la clase donde la tabla de benchmarks del proveedor y tu carga de trabajo pueden discrepar: un estado recurrente de tamaño fijo falla en patrones de recuperación que ninguna puntuación agregada expone, y esa es la lección de esa cifra de GSM8K reducida a la mitad. Ejecutar la comparación a través de una sola clave de API entre más de 200 modelos significa que la prueba es un cambio de cadena de modelo en lugar de un ciclo de adquisición, al precio de lista del proveedor con un margen del 0% por nuestra parte, y con failover automático para que un modelo de contexto largo que todavía estés evaluando no sea un punto único de fallo en una ruta de producción. Pruébalo con tu propio tráfico de contexto largo durante un día. Esa es una respuesta más barata que cualquier tabla de benchmarks, incluida la nuestra.

Preguntas que realmente vale la pena hacer

¿Es Kimi Linear lo mismo que Kimi K3?

No, y confundirlos es el error más común en la cobertura de ambos. Kimi Linear es el artículo de arquitectura más un modelo de investigación de 48B en total y 3B activos, con un contexto de 1M, publicado bajo MIT a finales de 2025 para demostrar que un híbrido con mucho KDA supera al MLA completo con entrenamiento equiparado. Kimi K3 es el buque insignia de Moonshot con 2,8 billones de parámetros, de julio de 2026 — 104B activos, multimodal nativo, contexto de 1M — que llevó la idea de KDA en proporción 3:1 a escala frontera y añadió Attention Residuals, un truco aparte que el laboratorio reporta que aporta alrededor de un 25% de eficiencia de entrenamiento por menos de un 2% de coste adicional. Mecanismo compartido, escala, capacidad y precio completamente diferentes. Los benchmarks de uno dicen muy poco sobre el otro.

¿Por qué elegiría un laboratorio KDA en lugar de Gated DeltaNet, dado que la mayoría eligió Gated DeltaNet?

KDA es un refinamiento estricto de Gated DeltaNet, así que la pregunta es si el refinamiento justifica el costo de cambio. El refinamiento es la compuerta: Gated DeltaNet decae su memoria recurrente con un escalar por paso; KDA aprende un decaimiento por canal de características, lo que permite que el estado mantenga un nombre de variable a lo largo de diez mil tokens mientras elimina la frase en la que apareció. La ablación de Moonshot sitúa eso en aproximadamente 0.12 de perplejidad de validación a 48B, y su formulación DPLR fragmentada fue escrita para mantener ocupados los tensor cores, por lo que la expresividad extra no cuesta el rendimiento que genera. En contra, Gated DeltaNet ya contaba con un amplio soporte de kernels y frameworks antes de que cualquiera de los dos estuviera de moda, lo que vale tiempo real de ingeniería. La respuesta de 2026 fue en su mayoría "no vale la pena". Ling-3.0-flash es la primera apuesta a escala de producción en la dirección contraria.

¿Debería algo de esto cambiar lo que despliego este trimestre?

Solo si trabajas con contextos muy largos. Si tus prompts tienen menos de unos 32k tokens, la atención lineal híbrida es un detalle de implementación sin relevancia para tu elección de modelo; elige por calidad, precio y latencia como siempre. Si estás manejando 128k o más, vale la pena saber que los modelos que mantienen tus costos razonables a esa longitud son cada vez más híbridos KDA, y que sus puntuaciones publicadas de contexto largo son métricas agregadas en lugar de pruebas adversariales de recuperación. Prueba la recuperación a tu longitud de contexto real en lugar de confiar en una puntuación RULER. Ese consejo sería idéntico si el mecanismo fuera Gated DeltaNet o Mamba-2.

Dónde deja esto a la afirmación

En la dirección correcta, y más pequeño de lo que parece. Lo que es verificable el 5 de agosto de 2026 es un modelo de producción de un laboratorio consolidado, un par de investigación de un laboratorio estadounidense independiente que publicó el lado negativo honesto, un puñado de repositorios de menos de 1B de los últimos diez días y un ecosistema de inferencia que ya ha absorbido el núcleo. Eso es más que un «truco de un laboratorio» y mucho menos que un estándar. El número a observar no son tres modelos externos — es si el próximo lanzamiento de pesos abiertos de frontera de un laboratorio que no sea Moonshot incluye compuertas por canal, y si alguien fuera de Moonshot publica alguna vez una sonda de recuperación que pruebe qué olvida realmente el estado de tamaño fijo. Ambas cosas te dirían más que otra captura de pantalla.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube