
MiMo-V2.6-Pro vs Qwen3.8-Max: un punto de índice, seis veces el precio
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max es un modelo de 2,4 billones de parámetros que activa 95.000 millones de ellos por token y se ejecuta en un único proveedor. Xiaomi MiMo-V2.6-Pro es un modelo de 1,02 billones de parámetros que activa 42.000 millones por token, obtiene un punto más en el mismo índice independiente y cuesta aproximadamente una sexta parte por llamada. Esos datos no encajan bien entre sí, y cómo los resuelvas constituye toda la decisión entre ambos. La versión corta: en el Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro obtiene 46 y Qwen3.8-Max obtiene 45 —un empate dentro del ruido—, mientras que la lista de precios indica 0,43 y 0,87 dólares por millón de tokens frente a 2,00 y 6,00.
Lo que cada modelo realmente es
Qwen3.8-Max es el buque insignia de Alibaba, disponible de forma general desde el 3 de agosto de 2026, y era el modelo más grande que la línea Qwen había lanzado cuando llegó. Se trata de un modelo de mezcla de expertos dispersa (sparse mixture-of-experts) construido sobre la arquitectura Qwen 3.5, con 2,4 billones de parámetros totales y aproximadamente 95 mil millones activos por token, una ventana de contexto de 1 millón de tokens, hasta 131.000 tokens de salida y entrada multimodal de texto, imagen y vídeo. Alibaba redujo la tarifa internacional a 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de salida, con la entrada en caché a 0,25 $, y lo presentó como aproximadamente el 40 % del precio de entrada de Claude Opus 5. Una actualización puntual, Qwen3.8-Max-0902, llegó el 2 de septiembre de 2026 y es la que Artificial Analysis evalúa actualmente con 45.
Xiaomi MiMo-V2.6-Pro alcanzó su disponibilidad general el 22 de septiembre de 2026, tres días antes de que se escribiera esta comparativa, y sus repositorios de checkpoints de aprendizaje por refuerzo aparecieron el día anterior. Es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42 000 millones activos por token, con la misma ventana de contexto de 1M de tokens, multimodalidad nativa en texto, imagen, vídeo y audio, y pesos publicados bajo la licencia MIT. Xiaomi mantuvo los precios de la generación anterior en lugar de subir el precio del nuevo checkpoint, y por eso figura a 0,43 $ y 0,87 $, con un descuento de caché del 99 % y un precio combinado de 0,18 $.
• Cómputo activo por token — Qwen3.8-Max 95B; Xiaomi MiMo-V2.6-Pro 42B, menos de la mitad
• Parámetros totales — Qwen3.8-Max 2,4T; Xiaomi MiMo-V2.6-Pro 1,02T
• Puntuación del índice — Xiaomi MiMo-V2.6-Pro 46; Qwen3.8-Max 45, ambos en Artificial Analysis v4.3.2
• Velocidad de salida — Xiaomi MiMo-V2.6-Pro 134,3 tokens/segundo; Qwen3.8-Max 39,2, frente a una mediana de categoría de 72,5
• Tiempo hasta el primer token — Xiaomi MiMo-V2.6-Pro 2,15 segundos; Qwen3.8-Max 2,93
• Precio de lista — Xiaomi MiMo-V2.6-Pro $0,43 / $0,87 por 1M; Qwen3.8-Max $2,00 / $6,00
• Tarifa combinada — Xiaomi MiMo-V2.6-Pro $0.18 por 1M con una proporción de 7:2:1 de aciertos de caché/entrada/salida; Qwen3.8-Max $1.18
• Pesos — Xiaomi MiMo-V2.6-Pro con licencia MIT y descargable; Qwen3.8-Max se ofrecía como endpoint propietario, con una versión de pesos abiertos solo de texto que elimina el contexto de 1M y la entrada de visión
• Accesibilidad — se cuenta un proveedor de API para cada uno en Artificial Analysis
El marcador está empatado. La velocidad no.
Un punto en un compuesto de diez evaluaciones no es una diferencia que deba motivar acción alguna, y la señal más útil es lo que ocurrió por debajo. El modelo con menos de la mitad de los parámetros activos por token obtuvo una puntuación marginalmente más alta y generó salida tres veces y media más rápido: 134,3 tokens por segundo frente a 39,2, cuando la mediana de los modelos de razonamiento comparables es 72,5. Qwen3.8-Max es el más lento de los modelos de clase frontera medidos en esa página, y eso es una consecuencia de diseño de activar 95.000 millones de parámetros por token, y no un accidente de servicio.
La latencia cuenta la historia opuesta a la que sugieren los recuentos de parámetros. Qwen3.8-Max alcanza su primer token en 2,93 segundos frente a los 2,15 de Xiaomi, y la brecha es mucho menor que la brecha de rendimiento: Qwen3.8-Max es lento una vez que empieza a escribir, no tarda en arrancar. En una interfaz de chat donde la respuesta es corta, esa diferencia apenas se manifiesta. Para un bucle de agente que genera decenas de miles de tokens de salida, el rendimiento es todo el tiempo de reloj, y una brecha de 3,4× se acumula en cada turno de la ejecución.

Donde las tablas del proveedor no coinciden, y por qué eso no es una contradicción
Alibaba publicó una tabla amplia para Qwen3.8-Max y es genuinamente potente: Terminal-Bench 2.1 en 86.6, SWE-bench Pro en 67.7, PaperBench en 93.0, GPQA Diamond en 92.6, IFBench en 82.8, OSWorld-Verified en 86.1 y Humanity's Last Exam en 43.6. Esas son cifras ejecutadas por el proveedor en los propios sistemas de evaluación de Alibaba y algunas de ellas en los propios benchmarks de Alibaba, así que son afirmaciones más que mediciones — pero son afirmaciones sobre benchmarks ampliamente utilizados, lo que las hace más comparables entre laboratorios que el resultado de un sistema de evaluación hecho a medida.
La cifra principal de Xiaomi es 72,57 en DeepSWE v1.1, frente a una línea base de 58,4, medida con mini-swe-agent como promedio de tres en el evaluador propio de Xiaomi, a lo largo de una ejecución de aprendizaje por refuerzo que Xiaomi documentó como de treinta pasos y aproximadamente 750.000 trayectorias, con un gasto publicado de unos 2,62 millones de dólares. No se ha enviado a la tabla de clasificación pública de DeepSWE y ningún tercero lo ha reproducido. Poner 72,57 frente al 67,7 de Qwen en SWE-bench Pro y declarar una victoria de Xiaomi por cinco puntos sería comparar a través de dos benchmarks diferentes, dos arneses diferentes y dos convenciones de puntuación diferentes. Hay exactamente una regla con la que se evaluó a ambos modelos por alguien distinto de su creador, y dice 46 a 45.
Dos de las cifras más trascendentales de Qwen3.8-Max no son puntuaciones en absoluto. Alibaba anunció que los pesos se publicarían como código abierto junto con Qwen3.8-27B, y el checkpoint que se publicó es solo de texto y no incluye el contexto completo de 1M tokens ni la entrada de visión que tiene el endpoint Max en producción. Así que «Qwen3.8-Max tiene pesos abiertos» y «Qwen3.8-Max es un endpoint multimodal con contexto de 1M» son ambas afirmaciones verdaderas sobre artefactos diferentes, y un plan de despliegue basado en la primera pero que espere la segunda no sobrevivirá al primer contacto. La versión puntual 0902, mientras tanto, llevó el modelo a lo más alto de una arena pública de desarrollo web sin cambiar el número de versión: un recordatorio de que el modelo que evaluaste en agosto no es necesariamente el modelo que atiende tus solicitudes en septiembre.
¿Que los pesos sean abiertos significa que puedes autoalojar cualquiera de los dos?
Para Xiaomi MiMo-V2.6-Pro, en principio sí: licencia MIT, no se necesita ningún acuerdo comercial. En la práctica, un checkpoint de 1,02 T de parámetros con 42 B activos necesita un clúster de servicio multinodo, lo que supone un nivel de compromiso muy distinto al de llamar a una API. Publicar los pesos hace que el autoalojamiento sea legal, no barato.
Para Qwen3.8-Max, la respuesta es más limitada de lo que sugiere la reputación. La versión abierta es solo texto y sin la ventana de contexto completa, así que autoalojarla te ofrece un modelo sustancialmente más pequeño que aquel con el que se midió el 45. Si lo que quieres es la configuración evaluada, el endpoint servido es el producto, y el endpoint es propietario.
Llamar a cualquiera de los dos, y la aritmética que lo decide
Artificial Analysis contabiliza ambos modelos en un solo proveedor de API, algo inusual para dos modelos insignia, lo que convierte la conmutación por error en una cuestión práctica y no en un simple detalle. Qwen3.8-Max está en OrcaRouter como qwen/qwen3.8-max — un endpoint compatible con OpenAI al precio de lista del propio Alibaba, con un 0 % de recargo, por lo que los $2.00 y $6.00 anteriores se trasladan sin cambios y cualquier cambio de precio por parte de Alibaba se refleja en el nuestro el mismo día. Nuestras propias mediciones sitúan el p50 del endpoint en torno a los 3,3 segundos, que es la cifra con la que conviene planificar en lugar del mejor caso teórico, y una cadena de respaldo hace que una solicitud que se queda bloqueada se reintente en otro upstream antes de que empiece la respuesta. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter; ningún modelo de Xiaomi lo está, y la vía para acceder a él hoy es la propia plataforma de Xiaomi y los catálogos de terceros que lo incluyen.
La aritmética de costos es donde realmente se decide este enfrentamiento, y no es la aritmética que sugieren las tarifas anunciadas. Con una mezcla de 7:2:1 de aciertos de caché/entrada/salida, las tarifas combinadas son $0.18 y $1.18 por millón — una brecha de 6.6×, más amplia que las brechas de entrada de 4.6× y de salida de 6.9×, porque el descuento de caché del 99% de Xiaomi es más profundo que el 88% de Alibaba. Artificial Analysis también registra un costo de $0.13 por tarea de Intelligence Index para Xiaomi MiMo-V2.6-Pro, medido de forma idéntica en todos los modelos del tablero. Ejecute la misma carga de trabajo en ambos y el modelo más barato es el que obtuvo una puntuación más alta, lo cual es algo inusual de poder escribir y la razón por la que esta comparación no es una formalidad.

¿Quién debería cambiar y quién no?
Si hoy usa Qwen3.8-Max y le funciona, no hay un caso urgente para cambiarse. La brecha del índice es un punto, el comportamiento de visión y contexto largo está demostrado en su carga de trabajo, y Alibaba sigue desarrollando la línea — la actualización 0902 lo demuestra. El argumento para cambiarse es el rendimiento y el costo combinado, y es un argumento sólido solo si su tráfico es intensivo en salida o de horizonte largo: agentes, generación de código, cualquier cosa que escriba mucho más de lo que lee.
Si empiezas desde cero, el orden es difícil de discutir con la evidencia publicada. El modelo Xiaomi es más rápido, más barato en todos los ejes, tiene licencia MIT y está ligeramente por delante en el único compuesto ejecutado de forma independiente que cubre a ambos. Los contrapesos son reales y específicos: tres días de historial de producción, una única ruta de servicio y ninguna entrada pública en benchmarks que se pueda inspeccionar. Esa combinación aboga por evaluarlo en un carril junto a una solución establecida en lugar de reemplazarla, que es para lo que sirve una configuración de enrutamiento, y por lo que el movimiento útil es poner al candidato y a la solución establecida detrás de una misma clave en lugar de elegir un ganador a partir de un marcador.

¿Qué cambiaría esta respuesta?
Tres cosas. Un segundo y un tercer proveedor para Xiaomi MiMo-V2.6-Pro eliminaría la única objeción estructural que hay contra él y convertiría la diferencia de precio en una decisión real en lugar de una tentadora. Una ejecución independiente de la configuración DeepSWE confirmaría el 72.57 o lo retiraría, y cualquiera de los dos resultados vale más que el número en sí. Y los desgloses por evaluación en v4.3.2 mostrarían qué evaluaciones de las diez gana cada modelo: el compuesto es un compuesto, y un modelo que lidera en codificación agéntica y otro que lidera en respuesta a preguntas con uso intensivo de recuperación pueden obtener la misma puntuación del índice aunque no sirvan para las tareas del otro.
