
Qwen 4 Max vs. Kimi K3: la promesa de los pesos abiertos se encuentra con la entrega de los pesos abiertos
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Moonshot AI lanzó Kimi K3 el 16 de julio de 2026 y luego hizo eso de lo que la mayoría de los laboratorios solo habla: publicó los pesos. El checkpoint de 2,8 billones de parámetros llegó el 27 de julio de 2026 bajo una licencia MIT modificada, once días después del lanzamiento. Mientras tanto, la conferencia Yunqi del 22 de septiembre de 2026 sirvió para anunciar Qwen 4 Max como el buque insignia de una familia Qwen 4 de cuatro niveles que incluye un Qwen 4 27B de pesos abiertos, un nivel que está prometido, pero no entregado. Esos dos hechos son la comparación. Todo lo demás sobre Qwen 4 Max es actualmente desconocido, y la brecha entre un nivel abierto prometido y uno entregado es donde esta comparación realmente tiene algo que decir.
Lo que Kimi K3 puso sobre la mesa en julio
Kimi K3 es una mezcla de expertos de 2,8 billones de parámetros que activa 16 de 896 expertos por token, lo que pone aproximadamente 104 mil millones de parámetros a trabajar en cada paso. Cuenta con una ventana de contexto de 1.048.576 tokens tanto en la entrada como en la salida, y acepta entrada de texto, imagen y vídeo con salida de texto. Su API propia se cotiza a 3,00 $ por millón de tokens de entrada, 15,00 $ por millón de tokens de salida y 0,30 $ por millón de tokens de entrada en caché, y las tarifas de terceros son inferiores a esas.
La arquitectura es la parte de la que se hace eco la propia vista previa de Alibaba. Kimi K3 se basa en Kimi Delta Attention y Attention Residuals, que, según Moonshot, ofrecen una eficiencia de escalado aproximadamente 2,5 veces mejor que Kimi K2 y una decodificación hasta 6,3 veces más rápida en contextos de un millón de tokens. Ese es el mismo problema al que apunta el QSA de Qwen —hacer que la atención sea asequible en longitudes extremas—, lo que significa que las dos familias no compiten tanto por la escala como por cuál diseño de atención dispersa envejece mejor.
Las puntuaciones que Moonshot publicó en el lanzamiento, reportadas por el proveedor y no replicadas en aquel momento:
• Índice de Inteligencia de Artificial Analysis — 57, tercero en ese momento por detrás de Claude Fable 5 y GPT-5.6 Sol. Esa cifra se registró bajo una revisión anterior del índice; desde entonces el índice se ha reconstruido dos veces, por lo que es una lectura histórica y no una actual
• Frontend Code Arena — primer puesto con 1.679 Elo, por delante de ambos modelos que lo superaron en el índice general
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, por delante de Opus 4.8 y GPT-5.6 Sol
• DeepSearchQA — 0,95, primer puesto, y MATH-Vision 0,98, también en primer lugar
• GPQA-Diamond — 0.94
El propio material de lanzamiento de Moonshot admite que K3 todavía va por detrás de Claude Fable 5 y GPT-5.6 Sol en capacidad general, lo cual es una frase más útil que cualquiera de las afirmaciones de primer puesto que aparecen encima. La forma interesante de los números es que un modelo tercero en el índice general quedó primero en código de frontend y primero en búsqueda de largo horizonte — un perfil que indica que el índice agregado está ocultando una herramienta especializada en lugar de describir una general.

Lo que Alibaba ha prometido, y cuánto vale una promesa
El anuncio de Qwen 4 nombró cuatro niveles. Qwen 4 Max como buque insignia, Qwen 4 Flash para el rendimiento, Qwen 4 Plus como punto medio equilibrado y Qwen 4 27B como nivel local de pesos abiertos. El líder de Qwen LLM, Liu Da Yiheng, describió la familia como entrenada con una arquitectura de nueva generación y dijo que llegaría pronto. No hay fecha, ni ficha de modelo, ni identificador de API, ni listado en la nube, ni precio, ni puntuación publicada para ninguno de los cuatro.
Dos cosas concretas de ese anuncio se informan mal, y ambas son importantes para cualquiera que intente planificar en torno a él:
• La cifra de 5 billones a 10 billones de parámetros atribuida a la cobertura de Qwen 4 no es una especificación de Qwen 4. Pertenece a la hoja de ruta de Qwen 4.5 y Qwen 5. No se ha publicado ningún recuento de parámetros de ningún tipo para Qwen 4 Max
• Que los nombres de los niveles continúen no hace que las especificaciones se mantengan. La ventana de contexto, el precio y la licencia de Qwen 4 Max son desconocidos; las cifras del Qwen3.8-Max que se comercializa —1,000,000 tokens a $2.00 y $6.00 por millón— describen un modelo diferente.
La razón por la que el nivel de 27B es el interesante no tiene nada que ver con los benchmarks. Es el único nivel de la línea Qwen 4 que históricamente se ha lanzado con pesos abiertos, y la generación Qwen 3.8 mostró lo que eso desbloquea: en cuestión de días desde la llegada de los pesos de 27B, la comunidad ya había producido conversiones a MLX, cuantizaciones NVFP4 y ajustes finos de todo tipo. Un 27B anunciado es un compromiso con un ecosistema posterior, y es la entrega más predecible en la hoja de ruta.
Pero lo predecible no se cumple. Los pesos de Kimi K3 son un archivo que puedes descargar hoy. Los pesos de Qwen 4 27B son una línea en una charla de conferencia.
Los pesos abiertos y los pesos ejecutables son afirmaciones diferentes.
Hay una trampa en tratar Kimi K3 como la respuesta de pesos abiertos, y merece la pena decirla sin rodeos porque es la afirmación excesiva más común en la cobertura de los modelos frontera chinos. Un mixture-of-experts de 2,8 billones de parámetros es un artefacto a escala de centro de datos. Que los pesos estén publicados significa que se te permite ejecutarlo, que puedes inspeccionarlo, que puedes ajustarlo con fine-tuning y que puedes cuantizarlo. No significan que puedas ejecutarlo en una estación de trabajo. El servicio eficiente de un checkpoint de ese tamaño requiere decenas de aceleradores, y el trabajo de cuantización que sigue a una publicación abierta —las variantes al estilo NVFP4 y REAP que circulan en cuestión de semanas— tiene tanto que ver con hacer que el modelo se pueda servir como con hacerlo más pequeño.
Así que la lectura honesta de la licencia de Kimi K3 es más limitada y aun así significativa: es un modelo de frontera auditable, modificable y autoalojable, bajo una licencia MIT modificada, para organizaciones con el hardware necesario para servirlo. Eso es un activo estratégico real y encaja mal con cualquiera que leyera «pesos abiertos» como «funciona en mi portátil».
La misma advertencia se aplicará a Qwen 4 27B si llega a lanzarse, y se aplica con menos fuerza, porque una gama de pesos abiertos de 27B es genuinamente de escala local de un modo en que un buque insignia de 2,8T no lo es. Precisamente por eso la gama Qwen 4 27B merece más atención que la gama Max en esta comparación, aunque la gama Max sea con la que se encabezó el anuncio.

La cuestión comercial que subyace a la cuestión de la licencia.
La tarifa de primera parte de Kimi K3, de $3.00 por entrada y $15.00 por salida por millón de tokens, es una posición premium, y Moonshot ha dejado claro que se ha fijado deliberadamente por encima del extremo barato del mercado chino. Frente a Qwen3.8-Max, con $2.00 y $6.00, eso equivale a una vez y media la tarifa de entrada y dos veces y media la tarifa de salida: una brecha lo bastante grande como para que una carga de trabajo tenga que tener en cuenta las fortalezas específicas de Kimi K3 —entre ellas, el código de frontend y la búsqueda de horizonte largo— para que merezca la pena pagar la prima.
OrcaRouter enruta kimi/kimi-k3 junto a la familia Qwen 3.8 en un único endpoint compatible con OpenAI con 0 % de recargo, lo que significa que se te factura la tarifa de lista del proveedor en lugar de un equivalente con recargo. En una comparación en la que la diferencia de precio es de un factor de 2,5 en la salida, la ausencia de un margen de plataforma no es un detalle de redondeo: un recargo del diez por ciento sobre una tarifa de salida de $15.00 son $1.50 por millón de tokens, que es más que todo el coste de entrada del modelo más barato de esta comparación. El mismo endpoint incluye conmutación por error automática y un DSL de enrutamiento para expresar políticas de forma explícita, que es la forma de probar un modelo con el perfil de Kimi K3 en una porción del tráfico de producción sin apostar toda una ruta a un proveedor con el que no has trabajado antes.
Lo que OrcaRouter no incluye es Qwen 4 Max ni ningún nivel de Qwen 4, porque ninguno de ellos existe todavía como producto.

Qué observar y qué ignorar
Tres señales harían cambiar esta comparación, y son lo bastante específicas como para estar atento a ellas:
• Los pesos de Qwen 4 27B. No la tabla de benchmarks de la gama Max — el checkpoint 27B, su licencia y su tamaño. Ese es el lanzamiento que te dirá si el compromiso de Alibaba con los pesos abiertos en esta generación es tan real como el de la anterior
• La licencia de Qwen 4 Max, si la hay. Si Alibaba publica los pesos de su modelo insignia como lo hizo con Qwen3.8-Max, el argumento de los pesos abiertos en esta comparación deja de ser una ventaja de Kimi y se convierte en un empate
• Una nueva lectura independiente sobre Kimi K3. Las puntuaciones de lanzamiento de Moonshot fueron autodeclaradas y el índice Artificial Analysis se ha reconstruido dos veces desde entonces, por lo que tanto el 57 como el Elo de Frontend Code Arena necesitan recalcular su base antes de compararlos con cualquier dato actual.
Lo que hay que ignorar es cualquier tabla de especificaciones del Qwen 4 Max que aparezca antes de que Alibaba publique una ficha del modelo, y cualquier afirmación de que los pesos abiertos de Kimi K3 lo hagan ejecutable en local. Ambos errores ya están circulando. Mientras tanto, la comparación sobre la que sí puedes actuar es entre dos modelos que existen: Kimi K3 a una tarifa premium, con pesos ya entregados y un perfil de programación genuinamente diferenciado, y Qwen3.8-Max a menos de la mitad de la tarifa de salida, con una ventana plana de un millón de tokens y pesos propios. Esa es una elección real, con precio en ambos lados, y no exige esperar a que una diapositiva de conferencia se convierta en un producto.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
