Una tarjeta de título generada que dice «Kimi K4» con el subtítulo «lo que dice la filtración y lo que no», una insignia de FILTRACIÓN / SIN VERIFICAR, tres líneas apiladas que dicen «Sin ficha de modelo», «Sin pesos» y «Sin precio ni ruta», y una línea de pie de página «Al 25 de septiembre de 2026», con el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Kimi K4: qué afirma realmente la filtración, y por qué «menos parámetros activos» sería la verdadera historia

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Una sola publicación ha puesto en circulación cuatro nombres de modelos no anunciados a la vez. La lista empieza con K​imi K4, la supuesta próxima generación de Moonshot AI, junto a GLM-5.5 Flash y GLM-5.4 de Z.ai y D​eepSeek V4.1P — y el énfasis del propio autor no recae en ninguno de los nombres insignia, sino en una sospecha sobre la aritmética que subyace a K4: que podría activar menos parámetros que el modelo al que reemplaza. Esa afirmación no está verificada. No hay ficha de modelo de K​imi K4, ni pesos, ni identificador de API, ni precio ni ruta, y lo mismo ocurre con todos los nombres de Z.ai de la lista. Lo que vale la pena hacer ahora es determinar cuáles de estas afirmaciones serían comprobables, cómo se ve la línea base ya lanzada y qué significaría realmente un K4 más disperso.

La señal, y su nivel

Esta es una señal temprana, y debe leerse como tal. La publicación que la contiene es una lectura de las convenciones de nombres de modelos más que un informe de un avistamiento: señala «GLM-5.5 Flash, GLM-5.4» como una nomenclatura interesante y llama a K​imi K4 «muy extraño», luego ofrece un mecanismo especulativo —menos expertos activados— sin afirmar haber visto una configuración, un listado de checkpoints ni un endpoint de staging.

Nada en el registro público contradice los nombres, y nada los corrobora tampoco. Esa asimetría es normal en esta etapa de un ciclo de lanzamiento y es exactamente por eso que el movimiento útil es fijar la línea base y las pruebas, no especular más. Un nombre en una publicación es una hipótesis sobre un producto, no una prueba de que exista.

El punto de referencia con el que se mediría un Kimi K4

Kimi K3 es real, ya se ha lanzado y está inusualmente bien documentado, lo que lo convierte en un punto de referencia sólido. La propia ficha del modelo de Moonshot describe un modelo de mezcla de expertos de 2,8 billones de parámetros que activa 104.000 millones de parámetros por token, repartidos en 93 capas: una capa densa y 92 dispersas. La dispersión es agresiva y se indica sin rodeos: se activan 16 de 896 expertos por token, además de 2 expertos compartidos, a lo que Moonshot atribuye una mejora de aproximadamente 2,5× en la eficiencia de escalado con respecto a Kimi K2.

La pila de atención es donde K3 rompe con la generación anterior. De sus 92 capas dispersas, 69 usan K​imi Delta Attention —un mecanismo híbrido de atención lineal— y 24 usan MLA con compuertas, una división 3:1 que mantiene una minoría de capas de atención completa y empuja el resto hacia la ruta lineal más económica. Las capas llevan un residual de atención cada 12 bloques, la función de activación es SiTU-GLU, y todo el modelo se entrena con pesos MXFP4 y activaciones MXFP8 bajo entrenamiento consciente de cuantización. La longitud del contexto es de 1,048,576 tokens, el vocabulario es de 163,840, y la visión pasa por un codificador MoonViT-V2 de 401 M de parámetros, lo que hace que K3 sea nativamente capaz de procesar imágenes en lugar de ser multimodal por añadidura.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Esos son los números que un sucesor tiene que mover. Fíjate en lo que implican para la idea de "menos parámetros activos": K3 ya es un modelo extraordinariamente disperso. Activa aproximadamente el 3,7 % de su número total de parámetros por token. Un K4 que active menos de 104B no estaría recortando grasa de un diseño sobreaprovisionado — estaría retrocediendo en una relación de dispersión que Moonshot ha presentado públicamente como un logro, y lo haría en la generación en la que el resto del campo va en la dirección opuesta.

Qué significaría "menos parámetros activos" si fuera cierto

Hay dos lecturas disponibles y apuntan en direcciones opuestas. La caritativa es arquitectónica: Moonshot podría estar extendiendo aún más el híbrido KDA, reemplazando más capas de atención completa por otras lineales y reequilibrando el presupuesto de expertos para que un menor número de activaciones compre un contexto más largo, una huella de servicio más económica o una mejor relación calidad por flop. Bajo esa lectura, menos parámetros activos es un refinamiento de la misma tesis que K3 ya plantea: que la esparsidad es una estrategia de escalado, no una concesión.

La otra lectura es que K4 no es en absoluto un sucesor uniforme. La línea de Kimi ya se ha ramificado una vez este año, y los informes han aludido de diversas maneras a K3.1, K3.2 y K4 como tres productos diferentes. Un K4 que se activa menos que K3, en una familia que incluye una variante de codificación aparte, es al menos tan consistente con un reposicionamiento como con una actualización directa. Ambas lecturas son especulación. Ninguna queda resuelta por una publicación.

También hay una dimensión de licencia que nadie ha abordado. Los pesos de K3 se publican bajo la Kimi K3 License, una licencia personalizada de tipo «otra» en lugar de una de código abierto estándar, y es el primer modelo abierto de clase 3T. Que un K4 más disperso herede esa licencia, o la restrinja, importa más a cualquiera que construya sobre los pesos que unos cuantos puntos de puntuación de índice.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Los otros tres nombres en la misma publicación

GLM-5.5 Flash y GLM-5.4 son el par más sorprendente, y no precisamente por los números. El límite publicado por Z.ai es GLM-5.3, que llegó el 14 de agosto de 2026 con 743B parámetros, seguido de GLM-5.3-Flash el 26 de agosto y con las publicaciones de pesos BF16 y Flash-BF16 el 25 de agosto. La propia documentación de Z.ai enumera exactamente tres identificadores de modelo vigentes: glm-5.3, glm-5.3-flash y glm-5.2. No existe ningún GLM-5.4, ni ningún GLM-5.5, ni ningún GLM-5.5 Flash — y la dirección de la nomenclatura es la parte extraña, ya que una generación 5.5 que precede a una 5.4 no es como Z.ai ha numerado nunca una familia. Los números de versión que aparecen fuera de orden en una filtración son un fallo habitual: suelen ser productos adyacentes, nombres en clave internos o una etiqueta de nivel de servicio, y no un nuevo modelo base.

D​eepSeek V4.1P es el nombre en el que el autor de la señal dice estar más interesado, y es el más fácil de comprobar de los cuatro. La documentación de la API de D​eepSeek nombra exactamente dos cadenas de modelos actuales: deepseek-flash y deepseek-v4-pro. El sufijo «P» no tiene equivalente en ningún identificador de D​eepSeek, y el lanzamiento de pesos más reciente en la propia organización de D​eepSeek es DeepSeek-V4.1-Flash, publicado el 10 de septiembre de 2026. Lo más plausible es que un V4.1P sea un hermano de gama Pro de ese modelo, pero «lo más plausible» es una conjetura sobre una cadena, no sobre un producto.

Cómo sabrías que algo de esto es real

Los cuatro nombres fallan la misma prueba de la misma manera, lo que hace que la espera sea sencilla en lugar de angustiosa. Un lanzamiento real deja artefactos, y cada uno de ellos es barato de comprobar:

• Una model card en la propia organización de Hugging Face del proveedor. La entrada más reciente de Moonshot es Kimi-K3, creada el 13 de junio de 2026; las más recientes de Z.ai son la familia GLM-5.3, del 25 de agosto; la más reciente de D​eepSeek es DeepSeek-V4.1-Flash, del 10 de septiembre. No existe nada más reciente en ninguno de los tres.

• Una configuración que zanja la discusión. En concreto para K4, los campos que hay que buscar son num_experts y num_experts_per_token — los de K3 marcan 896 y 16. Una configuración de K4 con una cifra menor por token es la afirmación de esta filtración que se confirma o se refuta en un solo archivo.

• Un modelo enrutable. Un nombre que aparece en un catálogo es un nombre con un precio, una ventana de contexto y un proveedor detrás; un nombre que solo está en una publicación no tiene nada de eso.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Lo que puedes enrutar hoy

La versión práctica de esta filtración es que la generación que describe no es aquella sobre la que puedes construir. Lo que está en producción es la anterior, y la labor del router es hacer que la brecha entre generaciones sea una decisión de enrutamiento en lugar de un proyecto de migración. Kimi K3 ya está disponible con su contexto completo de 1M de tokens y visión nativa, a un precio de $3.00 por millón de tokens de entrada y $15.00 por millón de tokens de salida, con lecturas de caché a $0.30 — facturado a la tarifa del proveedor sin margen añadido, y por eso un cambio de precio del proveedor en K3 llega a tu factura el mismo día en lugar de en el siguiente ciclo de reajuste de precios. Kimi K3 en OrcaRouter incluye la ficha técnica completa y la tarifa actual.

Lo mismo se aplica al resto de la gama. GLM-5.3, GLM-5.3-Flash y DeepSeek V4.1 Flash son todos enrutables junto con Kimi K3, a través de un único endpoint compatible con OpenAI que cubre más de 200 modelos, con conmutación por error automática cuando un proveedor se degrada y un DSL de enrutamiento para expresar preferencias —límites de coste, umbrales mínimos de calidad, presupuestos de latencia— como política en lugar de lógica por llamada. Cuando aparezca un Kimi K4, GLM-5.5 Flash o DeepSeek V4.1P, la migración es un cambio de cadena en la política de enrutamiento y nada más. La fusión de modelos te permite combinar salidas de varios modelos en el mismo endpoint cuando una tarea se beneficia de ello.

Para ser explícitos sobre lo que eso no es: ninguno de los cuatro nombres filtrados es una ruta en OrcaRouter hoy. No los alojamos y no podemos servirlos.

En resumen

Lo interesante de esta afirmación no son los números de versión. Es el mecanismo: un modelo insignia de próxima generación que activa menos parámetros que su predecesor sería una declaración de que Moonshot cree que la esparsidad, no el recuento bruto de activaciones, es el eje que vale la pena impulsar, y la división de expertos 16 de 896 de K3 ya es un argumento en esa dirección. Ninguna parte de la afirmación está verificada: Kimi K4, GLM-5.5 Flash, GLM-5.4 y DeepSeek V4.1P no tienen tarjetas de modelo, ni pesos, ni identificadores de API, ni precios, y los catálogos de los propios proveedores terminan una generación antes en cada caso. Considera los nombres como un adelanto de una pregunta, no una respuesta — y si hoy necesitas pesos abiertos de clase frontera con 1M de contexto, Kimi K3 es el modelo que ya existe.

Cuando llegue un K​imi K4, la conmutación por error automática es lo que evita que la migración se convierta en un incidente