Qwen 3.8 vs Kimi K3: Los dos gigantes chinos de pesos abiertos, cara a cara
Guides & Insights

Qwen 3.8 vs Kimi K3: Los dos gigantes chinos de pesos abiertos, cara a cara

Autor

jinhao song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

De todos los modelos con los que se compara Qwen 3.8 Max, Kimi K3 de Moonshot es el rival más natural: ambos son enormes modelos chinos de Mixture-of-Experts, ambos son de clase de peso abierto, ambos son famosamente verbosos, exhaustivos y lentos. Son, en efecto, los dos gigantes más grandes del mundo chino de peso abierto — y, inusualmente, no tenemos que adivinar cómo se comparan, porque alguien los enfrentó en la misma tarea. Eso hace que esta sea la comparación más rica de la serie: no afirmaciones de proveedores frente a números auditados, sino un verdadero enfrentamiento directo.

Antes de los detalles, una nota para los constructores: la forma honesta de resolver una rivalidad tan reñida es ejecutar ambos en tu propia carga de trabajo y observar el equilibrio entre minuciosidad y velocidad. OrcaRouter ofrece más de 200 modelos a través de un único endpoint compatible con OpenAI, para que puedas enfrentar a Qwen 3.8 contra Kimi K3 en los mismos prompts sin tener que configurar dos SDK.

Veredicto TL;DR. En el único enfrentamiento directo que tenemos (Trilogy AI, una tarea de comprensión de arquitectura), Kimi K3 obtuvo 83/100 y Qwen 3.8 Max 80/100 — una estrecha ventaja de 3 puntos para Kimi. Pero Qwen fue el más *minucioso*: 354 citas de repositorio contra 274, 22 solicitudes de gateway contra 53 y cero llamadas a herramientas fallidas contra dos, a costa de una mayor latencia y más tokens. Ambos lograron un 90% de acierto en caché y llegaron a la misma decisión arquitectónica central. Hoy, Kimi K3 es la opción de peso abierto más segura: tiene una puntuación auditada (57.1, #3 en Artificial Analysis), la corona del frontend de Arena y pesos que esencialmente ya están aquí. Qwen 3.8 es la que hay que seguir: más ambiciosa, más exhaustiva en exploración, pero sin puntuar en tableros públicos con pesos solo "próximamente."

Conclusiones clave

•  Qwen 3.8 Max es un 2.4T-parameter MoE vista previa; Kimi K3 es un 2.8T MoE con contexto de 1M y visión nativa — lo que significa que Qwen es aproximadamente 400B parámetros más pequeño, un recordatorio de que un mayor número de parámetros no equivale a mejor.

• En la única prueba directa (Trilogy AI), Kimi K3 se impuso a Qwen por 80 a 83 en general — pero Qwen hizo más citas de repositorio (354 frente a 274), menos solicitudes de gateway (22 frente a 53), y tuvo cero llamadas a herramientas fallidas (frente a dos).

•  Kimi K3 tiene un auditado AA Intelligence Index de 57.1 (#3) — detrás de Fable 5 y GPT-5.6 Sol, por delante de todo lo demás. Qwen 3.8 tiene ningún benchmark independiente en absoluto.

• Kimi K3 también ostenta el puesto #1 en LMArena frontend-code (1679); Qwen 3.8 no ha sido puntuado en las tablas de clasificación públicas.

• La apertura es casi paritaria, pero los plazos difieren: los pesos de Kimi K3 son abiertos/prometidos y esencialmente están listos; los de Qwen 3.8 están "próximamente" sin fecha, licencia ni repositorio aún.

Las cifras de Qwen 3.8 son afirmaciones del proveedor o impresiones prácticas tempranas y no controladas — no auditadas de forma independiente. Las cifras de índice y precio de Kimi K3 se atribuyen a Artificial Analysis y pueden diferir del informe propio de Moonshot. La comparación directa de Trilogy AI es una tarea única, no un conjunto completo de pruebas de referencia. El precio de vista previa de Qwen 3.8 es un descuento temporal; verifique las tarifas antes de presupuestar.

Las especificaciones y el precio, lado a lado

Aquí están los datos concretos, cada cifra de la competencia atribuida a su fuente.

•  Fabricante / estado — Qwen 3.8 Max: Alibaba; vista previa (19 de julio de 2026); Kimi K3: Moonshot; lanzamiento open-weight

•  Arquitectura — Qwen 3.8 Max: ~2.4T total, MoE disperso (parámetros activos no revelados); Kimi K3: 2.8T MoE, visión nativa (fuente: Artificial Analysis)

•  Ventana de contexto — Qwen 3.8 Max: Reportado ~1M tokens (no confirmado formalmente); Kimi K3: 1M tokens (fuente: Artificial Analysis)

•  AA Intelligence Index — Qwen 3.8 Max: Ninguno aún — sin puntuación; Kimi K3: 57.1 — #3 (Artificial Analysis)

• Arena / clasificación — Qwen 3.8 Max: No puntuado públicamente; Kimi K3: Frontend-code #1, 1679 (LMArena)

•  Precios (entrada/salida) — Qwen 3.8 Max: Solo vista previa (~90% de descuento; API por token no publicada); Kimi K3: $3 / $15 por 1M (AA blended ~$2.31)

•  Pesos abiertos — Qwen 3.8 Max: Prometido "pronto" (no lanzado); Kimi K3: Peso abierto; pesos listos/cerca

•  Velocidad — Qwen 3.8 Max: Modelo más lento probado (en la práctica); Kimi K3: Verboso y lento (~34s TTFT, según AA)

Dos cosas enmarcan toda la comparación. Primero, la celda vacía del "AA Intelligence Index" para Qwen 3.8 es la historia: el 57.1 de Kimi K3 es el veredicto de un árbitro neutral que lo sitúa en el puesto #3 del mundo, solo por detrás de Fable 5 y GPT-5.6 Sol; la posición de Qwen 3.8 se basa en el encuadre del proveedor y un puñado de pruebas prácticas. Segundo, note la inversión de tamaño: Qwen 3.8 (2.4T) es en realidad unos 400B parámetros más pequeño que Kimi K3 (2.8T). El modelo de Alibaba es el que la gente describe como "más grande en ambición", pero en conteo bruto de parámetros, Kimi es el gigante más grande, y es el que tiene la puntuación auditada para respaldarlo. Ambos son famosamente verbosos y lentos, por lo que la latencia es un empate; los verdaderos separadores son la prueba y la disponibilidad de peso, y hoy ambos favorecen a Kimi.

La única verdadera comparación directa que tenemos.

Este es el raro enfrentamiento en el que no tenemos que inferir. Trilogy AI ejecutó ambos modelos en una sola tarea de comprensión de arquitectura — leer y razonar sobre un código base real — y publicó la comparación lado a lado. Kimi K3 ganó en la puntuación principal, pero el comportamiento subyacente cuenta una historia más interesante.

•  Puntuación general — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100

•  Citas de repositorio — Qwen 3.8 Max: 354; Kimi K3: 274

• Solicitudes de gateway — Qwen 3.8 Max: 22; Kimi K3: 53

•  Llamadas a herramientas fallidas — Qwen 3.8 Max: 0; Kimi K3: 2

•  Calificación de uso de herramientas — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10

• Tasa de aciertos de caché — Qwen 3.8 Max: >90%; Kimi K3: >90%

Lee las columnas, no solo la fila superior. Kimi K3 obtuvo la victoria por 3 puntos, pero Qwen 3.8 fue el trabajador más meticuloso: citó 80 lugares más en el repositorio (354 vs 274), llegó a su conclusión en muchas menos solicitudes de puerta de enlace (22 vs 53), hizo cero llamadas a herramientas fallidas frente a las dos de Kimi, y superó a Kimi en la calificación de uso de herramientas (9 vs 8). La compensación es exactamente lo que esperarías del carácter de Qwen en otros lugares: explora exhaustivamente, lo que conlleva una mayor latencia y más tokens totales. De manera crucial, ambos modelos llegaron a la misma decisión arquitectónica central, por lo que no se trata de que uno tenga razón y el otro no; es que Kimi llega a una respuesta ligeramente mejor calificada más rápido, y Qwen llega con más evidencia y una disciplina de herramientas más limpia. Si tu trabajo recompensa la exploración exhaustiva y bien citada, el perfil de Qwen es atractivo; si quieres la opción probada y más rápida para obtener la respuesta, Kimi ganó la ronda.

Preguntas frecuentes

¿Es Qwen 3.8 mejor que Kimi K3?

No según la evidencia que existe hoy. En el enfrentamiento directo (Trilogy AI), Kimi K3 obtuvo 83/100 frente a los 80/100 de Qwen, y Kimi tiene un Índice de Análisis Artificial auditado de 57.1 (#3) más la corona de código frontend de Arena, mientras que Qwen 3.8 no tiene ninguna puntuación independiente. La ventaja de Qwen fue la minuciosidad: más citas de repositorios (354 frente a 274), menos solicitudes de gateway y cero llamadas a herramientas fallidas, pero eso es una ventaja de estilo, no una ventaja de capacidad probada.

Qwen 3.8 es más grande — ¿eso lo hace mejor?

No, y en realidad es al revés en cuanto al tamaño: Qwen 3.8 tiene ~2,4T de parámetros frente a los ~2,8T de Kimi K3, por lo que Kimi es el mayor de los dos por aproximadamente 400B. Un recuento de parámetros mayor no equivale a mejor de todos modos — Kimi es tanto más grande como con mayor puntuación, lo cual es un claro recordatorio de que la arquitectura, el entrenamiento y el ajuste importan más que los totales de parámetros en bruto.

¿Cómo se compara el precio?

Kimi K3 es un producto publicado y duradero $3 / $15 por 1 millón de tokens (Artificial Analysis lo combina a aproximadamente $2.31). La vista previa de Qwen 3.8 tiene un gran descuento (~90% de descuento) pero no tiene un precio de API por token publicado y el descuento es temporal, por lo que no es posible una comparación de precios estable aún. Para presupuestar hoy, Kimi es el que tiene un número real.

¿Cuál es la mejor opción de peso abierto?

Ambos son de clase de peso abierto, pero el momento difiere. Los pesos de Kimi K3 están abiertos y esencialmente listos; los de Qwen 3.8 se prometen "próximamente" sin fecha, licencia o repositorio publicado. Si los pesos abiertos son la razón por la que eliges uno, Kimi es la opción en la que puedes actuar ahora.

¿Cuál debería usar hoy?

Kimi K3 es la opción predeterminada más segura: tiene puntuación (#3), los pesos están listos y ganó el cara a cara. Recurre a Qwen 3.8 cuando valores una exploración exhaustiva y bien citada, y un uso limpio de herramientas, por encima de la velocidad, y considéralo como el modelo a seguir cuando sus pesos estén disponibles y llegue una puntuación independiente.

En resumen

Qwen 3.8 vs Kimi K3 es lo más parecido que tiene esta serie a una lucha justa: dos gigantes chinos de peso abierto, ambos verbosos, ambos minuciosos, ambos lentos. Kimi K3 gana la ronda hoy porque gana las cosas que deciden la adopción — un puesto #3 auditado, la corona de la Arena frontend, un precio publicado y pesos que ya están listos — y superó a Qwen 80 a 83 en el único enfrentamiento directo real. Pero ese enfrentamiento también muestra por qué vale la pena seguir a Qwen 3.8: fue el modelo más meticuloso, citando más código base, usando menos solicitudes y realizando cero fallos en las llamadas a herramientas. Si la exploración exhaustiva es lo que tu trabajo recompensa, y si Alibaba envía los pesos y una puntuación independiente aterriza cerca del top, esta rivalidad podría cambiar. Hasta entonces, Kimi K3 es la opción de peso abierto más segura, y Qwen 3.8 es el retador para probar con tus propios prompts.


© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube