
Qwen 3.8 vs Kimi K3: Dos gigantes chinos, y ahora uno es más barato
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Estos son los dos modelos frontera chinos más importantes de 2026, y son primos cercanos: ambos son enormes sistemas dispersos de mezcla de expertos, ambos con contexto de 1M de tokens, ambos multimodales, ambos prometen pesos abiertos. Kimi K3 de Moonshot es en realidad el más grande de los dos, con 2,8T de parámetros totales frente a los 2,4T de Qwen — un útil recordatorio de que el número de parámetros no es una clasificación.
Hasta el 3 de agosto de 2026, esta comparación estaba desequilibrada de una manera específica: Kimi K3 tenía un Artificial Analysis Intelligence Index auditado de 57,1, un ranking #1 de código frontend de LMArena, precios publicados y pesos liberados, mientras que Qwen3.8-Max tenía un titular de 2,4T y nada más. GA cambió la economía de forma decisiva. Qwen ahora publica $2 / $6 por millón de tokens frente a los $3 / $15 de Kimi, lo que convierte al modelo más grande y mejor probado en el más caro por un amplio margen.
Una nota para los desarrolladores: la forma más rápida de resolver esto es probar ambos con tus propios prompts. OrcaRouter ofrece más de 200 modelos a través de un único endpoint compatible con OpenAI, para que puedas enfrentar a Qwen 3.8 Max contra Kimi K3 en la misma tarea sin tener que configurar dos SDK.
Veredicto TL;DR. Kimi K3 sigue ganando en cuanto a pruebas: un AA Intelligence Index auditado de 57.1 (#3), el puesto #1 de LMArena en código de frontend con 1679, y pesos abiertos que están realmente listos. Qwen3.8-Max sigue sin ser puntuado por ningún evaluador independiente. Pero GA le dio a Qwen dos ventajas reales. En cuanto al precio, ahora es sustancialmente más barato — $2 / $6 frente a $3 / $15, lo que significa 2,5× menos en la salida. Y en la única prueba comparativa de terceros que existe, Qwen perdió el resultado principal 80 a 83, pero fue el agente visiblemente mejor comportado: 354 citas de repositorios frente a 274, 22 solicitudes de gateway frente a 53 y cero llamadas fallidas a herramientas frente a dos. Kimi por calidad auditada; Qwen por una ejecución agéntica más barata y limpia.
Conclusiones clave
• Kimi K3 es el modelo más grande — 2.8T MoE frente a los 2.4T de Qwen, aproximadamente 400B más — lo cual es un buen argumento en contra de tratar el número de parámetros como un indicador de capacidad.
• Qwen3.8-Max está en disponibilidad general desde el 3 de agosto de 2026 a $2 / $6 por 1M fijo, frente a los de Kimi K3 $3 / $15 (AA combinado ~$2.31). Qwen ahora es 2.5× más barato en salida.
• Kimi K3 mantiene la posición auditada: AA Intelligence Index 57.1 (#3), solo por detrás de Fable 5 y GPT-5.6 Sol, además de LMArena frontend-code #1 (1679). Qwen3.8-Max está sin puntuar.
• En la única prueba directa (Trilogy AI), Kimi superó a Qwen 83 a 80 en general — pero Qwen hizo más citas de repositorios (354 vs 274), menos solicitudes de gateway (22 vs 53), y tuvo cero llamadas a herramientas fallidas (vs dos), con una calificación de uso de herramientas de 9/10 frente al 8/10 de Kimi.
• Qwen ahora reporta cifras agénticas y de codificación: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (desde el 40.7 de un predecesor) — todo reportado por Alibaba.
• El calendario de apertura sigue favoreciendo a Kimi: sus pesos ya están prácticamente listos; los de Qwen se prometen para esta semana, aunque todavía no hay licencia ni repositorio.
Nota de precisión: todas las cifras de calidad de Qwen3.8-Max son reportadas por Alibaba y no están verificadas por terceros. Las cifras de Kimi K3 provienen de Artificial Analysis y LMArena. La comparación {{KEEP}}head-to-head{{/KEEP}} es una única prueba de Trilogy AI y debe leerse como un punto de datos, no como una clasificación general. El precio de Qwen corresponde a la tarjeta de tarifas GA y reemplaza el descuento de vista previa de julio.
Las especificaciones y el precio, lado a lado
Aquí están los datos concretos, cada cifra atribuida a su fuente.
• Fabricante / estado — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); Kimi K3: Moonshot; lanzamiento de pesos abiertos
• Arquitectura — Qwen3.8-Max: ~2,4T en total, MoE disperso (parámetros activos aún no revelados); Kimi K3: MoE de 2,8T, visión nativa (Artificial Analysis)
• Ventana de contexto — Qwen3.8-Max: 1M tokens (983,616 con razonamiento; salida máxima 131,072); Kimi K3: 1M tokens (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Aún sin puntuar; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / tabla de clasificación — Qwen3.8-Max: Sin puntuación pública; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Puntuaciones reportadas por el proveedor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (reportado por Alibaba); Kimi K3: la puntuación es medida por terceros
• Precios (entrada / salida) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fijo; entrada en caché $0.25; Kimi K3: $3 / $15 por 1M (AA combinado ~$2.31), aciertos de caché $0.30
• Pesos abiertos — Qwen3.8-Max: Prometido esta semana (sin licencia aún); Kimi K3: Peso abierto; pesos listos
• Velocidad — Qwen3.8-Max: p50 TTFT 1.64s (telemetría de 7 días de OrcaRouter); Kimi K3: verboso y lento (~34s TTFT, según AA)
Dos cosas enmarcan esta comparación, y una de ellas se invirtió por completo el 3 de agosto.
Primero, la relación de precios se invirtió. Durante julio, Kimi K3 era el modelo con un precio real y Qwen era el modelo con un cupón de descuento. Ahora ambos publican tarifas, y el modelo más probado y de mayor tamaño es el más caro: $3 / $15 frente a $2 / $6. En la salida — donde el razonamiento y la generación de código gastan su dinero — Kimi cuesta 2.5× más. Qwen también cobra una tarifa plana en todo su contexto de 1M de tokens, y su entrada en caché de $0.25 es ligeramente más barata que la tasa de aciertos de caché de Kimi de $0.30. Para cualquier carga de trabajo de alto volumen, la economía de Qwen es ahora claramente más favorable.
En segundo lugar, la brecha de pruebas no ha cambiado, y es la razón por la que Kimi sigue ganando. El índice de inteligencia de Kimi K3, con 57.1, lo sitúa en el tercer puesto general, solo por detrás de Fable 5 y GPT-5.6 Sol — ese es el veredicto de un evaluador neutral. Su #1 en frontend-code de LMArena, con 1679, es un resultado colaborativo obtenido a partir de muchas comparaciones ciegas. Los 86.6 de Qwen en Terminal-Bench y los 92.6 en GPQA Diamond son cifras reales, pero provienen de la propia Alibaba y se obtuvieron en un entorno de pruebas que nadie más ha ejecutado. Un punto de referencia útil: el predecesor Qwen3.7-Max obtuvo 46 en el índice AA frente a los 57.1 de Kimi, por lo que Qwen necesita un gran salto generacional solo para ponerse a la par.
También hay un detalle de latencia que vale la pena señalar, porque contradice la historia habitual. Artificial Analysis mide Kimi K3 en aproximadamente 34 segundos de tiempo hasta el primer token — realmente lento. La telemetría GA de OrcaRouter muestra Qwen3.8-Max con un TTFT p50 de 1.64 segundos. Esas mediciones provienen de fuentes diferentes y no son una comparación controlada, pero complican la suposición de la era de vista previa de que Qwen es el más lento de los dos.

La única prueba cara a cara, lee con atención.
Esta es la única comparación en la serie donde un tercero ha hecho competir a ambos modelos entre sí en la misma tarea, lo que hace que valga la pena leerla con atención en lugar de resumirla declarando un ganador.
Trilogy AI realizó una tarea de comprensión de arquitectura — comprender un repositorio real y llegar a una conclusión arquitectónica correcta — y calificó los resultados:
• Puntuación general — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Citas de repositorio — Qwen3.8-Max: 354; Kimi K3: 274
• Solicitudes de gateway — Qwen3.8-Max: 22; Kimi K3: 53
• Llamadas a herramientas fallidas — Qwen3.8-Max: 0; Kimi K3: 2
• Calificación de uso de herramientas — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
Tasa de aciertos de caché — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi ganó el titular por tres puntos. Pero mira las columnas de proceso, porque para la ingeniería de agentes importan más que la puntuación. Qwen llegó a la misma conclusión arquitectónica central utilizando menos de la mitad de las solicitudes de gateway mientras producía un 29% más de citas de fundamentación y — el detalle que debería interesar a cualquiera que construya agentes — cero llamadas a herramientas fallidas frente a las dos de Kimi.
Las llamadas a herramientas fallidas son lo que realmente rompe a los agentes en producción. Se propagan en cascada: una llamada mal formada produce un error que el modelo debe interpretar, lo que consume turnos, lo que a su vez arriesga más errores. Un modelo que hace 22 solicitudes limpias donde otro hace 53 con dos fallos es más barato y más predecible de operar, incluso si obtiene tres puntos menos en la respuesta. Combinado con la tarifa de salida 2.5× más barata de Qwen, la economía operativa de esa ejecución favorece sustancialmente a Qwen.
La advertencia es que esto es una tarea, un evaluador, una ejecución. No es un conjunto de pruebas de referencia y no generaliza. El índice de 57.1 de Kimi y su puesto #1 en frontend se basan en mucha más evidencia que esta única prueba. La conclusión correcta es limitada: en al menos una tarea agéntica realista, Qwen fue el usuario de herramientas más disciplinado, aunque perdió ligeramente en calidad de salida.

Costo en la práctica: ejecuciones de agentes a gran escala
Tome un agente de análisis de repositorio: 250,000 tokens de contexto de código por ejecución, 12,000 tokens de salida.
• Qwen3.8-Max: 0.25M × $2 = $0.50, más 0.012M × $6 = $0.072. ≈ $0.57 por ejecución.
• Kimi K3: 0.25M × $3 = $0.75, más 0.012M × $15 = $0.18. ≈ $0.93 por ejecución.
• A 1,500 ejecuciones/día: Qwen ≈ $858/día; Kimi ≈ $1,395/día — aproximadamente $16,000/mes de diferencia.
• Con el almacenamiento en caché en un repositorio estable: la entrada en caché de Qwen a $0.25/1M lleva la ejecución a ≈ $0.14; la tasa de aciertos de caché de Kimi de $0.30 la lleva a ≈ $0.26.
La brecha es real en ambos extremos, y el resultado de la Trilogía la agrava: si Qwen realmente utiliza menos de la mitad de las solicitudes de puerta de enlace para completar un trabajo comparable, la diferencia de costo efectivo en tareas de agente es mayor de lo que sugiere la tarifa por sí sola.
Ambos modelos facturan los tokens de razonamiento como salida, por lo que las configuraciones con mucho razonamiento cuestan más que la estimación ingenua en ambos lados — pero la tarifa de $6 de Qwen hace que esa penalización sea 2,5 veces menor.
Apertura: casi paridad, sincronización diferente
Este es el eje en el que ambos son más similares y la diferencia es puramente cuestión de preparación. Los pesos de Kimi K3 son abiertos y esencialmente están listos. Los de Qwen3.8-Max se prometen para esta semana, sin texto de licencia, ficha del modelo ni repositorio todavía — y una licencia es lo que determina si puedes usar un modelo comercialmente en absoluto.
En la práctica, ninguno de los dos modelos insignia puede ser autoalojado por un equipo normal. Qwen, con 2.4T, ocupa aproximadamente 1.2TB en 4 bits frente a unos 141GB por H200; Kimi, con 2.8T, es aún más grande. Ambos necesitan ocho o más aceleradores de gama alta, y el hecho de que Alibaba no haya revelado el número de parámetros activos significa que ni siquiera se puede modelar el rendimiento de Qwen.
Por eso el simultáneamente anunciado Qwen3.8-27B importa aquí. Además, al ser de pesos abiertos y ejecutarse supuestamente en unos 17GB de VRAM, le da a la familia Qwen una propuesta genuina de implementación local que ni el buque insignia de 2.4T ni el de 2.8T ofrecen. Si los pesos abiertos son tu razón real para elegir entre estos dos, el 27B cambia el cálculo más que cualquiera de los gigantes.
Preguntas frecuentes
¿Es Qwen 3.8 mejor que Kimi K3?
No según evidencia auditada. Kimi K3 tiene un índice independiente AA Intelligence Index de 57.1 (#3) y el puesto #1 de LMArena en código frontend, mientras que Qwen3.8-Max sigue sin puntuación por parte de todos los evaluadores externos. En la única prueba directa disponible, Kimi ganó 83 a 80. Las ventajas de Qwen son el precio (salida 2.5× más barata) y, en esa misma prueba, un uso de herramientas más limpio.
¿Qué modelo es más grande?
Kimi K3, con 2.8T de parámetros totales frente a los 2.4T de Qwen3.8-Max — unos 400B más. Sin embargo, ninguna de las dos revela lo suficiente para que eso sea significativo: Alibaba nunca ha publicado el número de parámetros activos de Qwen, que es la cifra que realmente determina el coste de servicio en un modelo de mezcla de expertos (Mixture-of-Experts).
¿Cuál es más barato?
Qwen3.8-Max, claramente, desde GA. Lista $2 / $6 por 1M frente a los $3 / $15 de Kimi K3: un 33% menos en entrada y 2,5× menos en salida. La tarifa de Qwen es plana en todo el contexto de 1M, y su entrada en caché a $0,25 es ligeramente inferior a la tasa de aciertos de caché de $0,30 de Kimi.
¿Qué mostró realmente la prueba comparativa?
La tarea de comprensión de arquitectura de Trilogy AI puntuó a Kimi con 83 y a Qwen con 80. Pero Qwen produjo 354 citas de repositorios frente a las 274 de Kimi, usó 22 solicitudes de gateway frente a 53, registró cero llamadas a herramientas fallidas frente a dos, y obtuvo un 9/10 en uso de herramientas frente al 8/10 de Kimi. Kimi dio la mejor respuesta; Qwen fue el agente más disciplinado. Es una única tarea, así que trátala como un dato puntual más que como una clasificación.
¿Qwen 3.8 Max salió de la vista previa?
Sí, el 3 de agosto de 2026, con una tarjeta de tarifas publicada y un endpoint compatible con OpenAI y DashScope. La campaña de créditos Qoder de julio ya no describe cómo se vende.
¿Cuál es más rápido?
Posiblemente Qwen ahora, lo que invierte el supuesto de la era de vista previa. Artificial Analysis mide Kimi K3 en aproximadamente 34 segundos de tiempo hasta el primer token; la telemetría GA de 7 días de OrcaRouter muestra Qwen3.8-Max con un TTFT p50 de 1.64 segundos. Fuentes diferentes y no una comparación controlada, pero ambos modelos tienen reputación de verbosidad, y el TTFT medido de Kimi es genuinamente lento.
¿Puedo autoalojar alguno de ellos?
No es realista a escala insignia: los modelos de 2.4T y 2.8T necesitan ocho o más GPU de clase H200. Los pesos de Kimi están listos hoy; los de Qwen se prometen dentro de la semana, pero sin licencia aún. Para una opción genuina on-premise, el Qwen3.8-27B anunciado simultáneamente (con ~17GB de VRAM según se informa) es la opción práctica en la familia Qwen.
En resumen
Qwen 3.8 vs Kimi K3 es el enfrentamiento más reñido de esta serie, y la disponibilidad general lo dividió limpiamente en dos ejes. Kimi K3 mantiene la corona de calidad gracias a lo que un árbitro midió: 57.1 en el Índice de Inteligencia, tercero en general, y el primer puesto en código frontend de LMArena. Esos no son afirmaciones — son resultados, y Qwen no tiene nada equivalente.
Lo que Qwen ganó el 3 de agosto es la economía, y la ganó de manera decisiva: $2 / $6 frente a $3 / $15, plano a lo largo de un millón de tokens, con caché ligeramente más barato. Añade el hallazgo de Trilogy de que Qwen completó una tarea agéntica comparable con la mitad de las solicitudes de pasarela y cero llamadas a herramientas fallidas, y Qwen parece el modelo más eficiente operativamente incluso donde es el menos preciso. Observa dos eventos: la primera puntuación independiente del Intelligence Index para Qwen3.8-Max, y la llegada de los pesos con una licencia. Si Qwen obtiene una puntuación cercana a la de Kimi de 57.1, la diferencia de precio hace muy difícil justificar a Kimi para trabajo de gran volumen. Hasta entonces, Kimi es el modelo en el que confías y Qwen es el que puedes permitirte ejecutar — y la forma honesta de elegir es en tus propios repositorios.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
