
MiMo-V2.6-Flash vs. Qwen3.8-Max: una descarga contra un medidor, y solo uno de ellos tiene una puntuación
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Un solo número decide cómo se suele escribir esta comparación, y no es un benchmark. Qwen3.8-Max es un modelo alojado que Artificial Analysis mide de forma continua, por lo que tiene un Intelligence Index actual de 45 en la escala v4.3 recalibrada, una velocidad de salida de 39,2 tokens por segundo y un precio de lista de $2,00 por millón de tokens de entrada y $6,00 por millón de salida. MiMo-V2.6-Flash, que Xiaomi publicó como pesos descargables el 21 de septiembre de 2026, no tiene nada de eso: ni tarifa de proveedor, ni identificador de modelo que Xiaomi haya anunciado, ni siquiera una página en Artificial Analysis. Todo lo publicado sobre la capacidad de MiMo-V2.6-Flash proviene de las propias tablas de evaluación de Xiaomi en su model card. Ni una sola cifra ha sido reproducida por alguien que no trabaje para Xiaomi.
Esa asimetría no es un punto negativo para el modelo. Es un hecho sobre qué tipo de compra es cada una, y cambia lo que realmente puedes concluir de una comparación directa. El resto de este artículo trata de las tres cosas que realmente puedes comparar —la forma de la afirmación, el coste de un token y la licencia—, más un número que es real, medido de forma independiente y que no pertenece a ninguno de los dos modelos del titular.
Primero, ¿cuál Qwen 3.8, y cuál MiMo?
Ambos nombres en ese titular son familias que se hacen pasar por puntos de control, y las sustituciones no son inofensivas.
• Qwen3.8-Max — el buque insignia alojado de Alibaba, presentado el 3 de agosto de 2026. Un modelo disperso de mezcla de expertos de 2,4 billones de parámetros con alrededor de 95.000 millones de parámetros activos por token, contexto de 1 millón de tokens, y entrada de texto, imagen y video. Este es el modelo que el resto de este artículo trata como el oponente.
• Qwen3.8-Max (0902) — la instantánea fechada del 2 de septiembre del mismo modelo, servida como su propia entrada con los mismos precios de $2.00 y $6.00 y un límite de salida de 131,072 tokens. La página actual de Artificial Analysis corresponde a esta compilación, lo cual importa cuando se cita una puntuación de índice.
• Qwen3.8-2.4T-A95B — el checkpoint de pesos abiertos del mismo núcleo, descargable desde el 12 de agosto de 2026 bajo la Licencia Qwen3.8-Max. Es solo texto, el pensamiento siempre está activado y su contexto nativo es de 262K en lugar de un millón. No es el modelo del titular.
• MiMo-V2.6-Flash — el checkpoint de mezcla de expertos dispersa de Xiaomi con 309B en total y 15B activos, sin acceso restringido en Hugging Face bajo la licencia MIT, omnimodal nativo y con una afirmación de contexto de 1M de tokens. Es el miembro eficiente de un lanzamiento de dos checkpoints cuyo buque insignia es MiMo-V2.6-Pro, con 1,02T en total y 42B activos.
• MiMo-V2-Flash — el modelo de diciembre de 2025. Mismo total de 309B, mismos 15B activos, misma ventana deslizante de 128 tokens. Diferente ejecución de entrenamiento, diferente tabla de benchmarks, y un contexto de 256K. Cualquier página que clasifique "MiMo-V2-Flash" frente a un modelo Qwen está comparando la generación equivocada, y la hoja de especificaciones por sí sola no te lo dirá.
La colisión de MiMo es la más aguda de las dos trampas, porque los números que identifican el modelo también resultan ser los números que son idénticos entre los checkpoints de 2025 y 2026. La colisión de Qwen es más leve, pero tiene un precio: los pesos abiertos de 2.4T y la API alojada son artefactos distintos con términos distintos, y una comparación que los intercambie se equivocará tanto en la capacidad como en la licencia.
El índice se reconstruyó, y el número que la mayoría de las páginas todavía imprimen ya no está
Este es el modo de fallo que hay que vigilar antes de que aparezca cualquier puntuación.
Artificial Analysis recalibró su Intelligence Index a la v4.3 el 7 de septiembre de 2026. Las puntuaciones anteriores a esa fecha no son comparables con las posteriores, y la página en vivo de Qwen3.8-Max lleva un distintivo Actualizado que marca un resultado reexpresado. La cifra ampliamente difundida de 58 para Qwen3.8-Max pertenece a la escala antigua. El Qwen3.8-Max actual (0902) muestra 45, clasificado en el puesto 19 de los 202 modelos que Artificial Analysis sitúa en esa clase.
Esto no es pedantería. Un 58 junto a un 46 se lee como una brecha de doce puntos. Esos mismos dos modelos en la misma escala actual están a un solo punto de distancia — y el 46 ni siquiera es el modelo del que trata este artículo:
• Qwen3.8-Max (0902), medido de forma independiente — Índice de Inteligencia 45 en v4.3. Velocidad de salida de 39,2 tokens por segundo, en el puesto 151 de 202, lo que la propia página señala que es lento. Coste por tarea del Índice de Inteligencia: 5,41 $. Tokens de salida generados para completar el índice: 190M.
• MiMo-V2.6-Pro, medido de forma independiente — Intelligence Index 46, ocupó el primer puesto entre los 114 modelos de la clase de pesos abiertos. Velocidad de salida: 134,3 tokens por segundo. Costo por tarea de Intelligence Index: $0,13. Tokens de salida para completar el índice: 140M.
• MiMo-V2.6-Flash, el verdadero tema — no existe una página de Artificial Analysis. Nada que citar.
Lea esos tres juntos y el resumen honesto resulta incómodo para ambos proveedores. El punto de comparación que todo el mundo quiere —Flash frente a Qwen3.8-Max en una escala neutral— no existe ni puede construirse a partir de las tablas de los proveedores, porque los dos proveedores ejecutaron distintos arneses de evaluación sobre distintos checkpoints en distintos momentos y luego se compararon con modelos de otras empresas que también ejecutaron. Lo que sí existe es una diferencia de un punto entre el Qwen insignia y el más grande de los checkpoints de Xiaomi, a aproximadamente una cuadragésima parte del costo por tarea de índice. Ese es el número real más interesante de este enfrentamiento, y se refiere a un modelo que ninguno de los dos bandos del titular menciona.

Lo que las tablas del proveedor le dirán y lo que no
Ambos proveedores publican cifras. No son el mismo tipo de cifra, y alinearlas columna por columna da como resultado un gráfico más que un hallazgo, pero la forma de las afirmaciones sigue mereciendo una lectura, porque te dice para qué optimizó cada laboratorio.
• Agente de código — Xiaomi reporta MiMo-V2.6-Flash con 67.9 en DeepSWE v1.1, 87.6 en Terminal Bench 2.1, 26.0 en ProgramBench y 61.2 en MiMo Code Bench. Alibaba reporta Qwen3.8-Max con 67.7 en SWE-bench Pro y 86.6 en Terminal-Bench 2.1. Las cifras de Terminal-Bench están lo suficientemente cerca como para que sea plausible que el arnés, y no el modelo, esté decidiendo el orden.
• Agente general — Xiaomi informa AutomationBench v1.0.6 52.3, Toolathlon-Verified 73.6, OSWorld-Verified 80.8 y Agents' Last Exam 27.6 para Flash. Alibaba informa OSWorld-Verified 86.1, WideSearch 81.9 y Agent's Last Exam 52.4 para Qwen3.8-Max. En los dos benchmarks que ambos laboratorios ejecutaron, las cifras informadas de Qwen van por delante — en el propio harness de Alibaba.
• Conocimiento y seguridad — Xiaomi ejecuta CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) y SEC Bench Pro (47.5). Alibaba ejecuta GPQA Diamond (92.6), Humanity's Last Exam (43.6) y PaperBench (93.0). Casi no hay superposición, así que casi nada que comparar.
Lo único realmente útil que puede mostrar la tabla de un proveedor es una inconsistencia interna, y la de Xiaomi tiene una. Su panel público de RL, que transmitió la ejecución de entrenamiento durante septiembre, publicó MiMo-V2.6-Flash con 65.68 en DeepSWE v1.1 usando un arnés mini-swe-agent con promedio de tres. La ficha final del modelo indica 67.9 para los pesos publicados. Aquellos describen una instantánea de entrenamiento y un artefacto publicado, respectivamente, y la diferencia de dos puntos es del mismo tamaño que la brecha entre los dos checkpoints de Xiaomi. Si has estado citando el número del panel desde la semana pasada, está desactualizado.
La factura, que es donde los dos modelos dejan de ser comparables.
Esta es la sección que decide los despliegues, y no está ni cerca.
• Qwen3.8-Max se factura por uso. $2.00 por millón de tokens de entrada y $6.00 por millón de salida según la tarifa internacional de Alibaba, con un descuento por caché que Artificial Analysis mide en un 88% y un costo de $5.41 por tarea del Intelligence Index. La documentación de Alibaba para la región de China indica CNY 12 y CNY 36 por millón para el mismo par. Puedes llamarlo esta tarde y recibirás una factura.
• MiMo-V2.6-Flash es una descarga. Xiaomi no publica ninguna tarifa por token para la generación MiMo-V2.6 en su propio sitio y no ha anunciado ningún identificador invocable para ninguno de los dos checkpoints, así que no hay nada que medir. En cambio, lo que sí hay son 172,9 GB de datos de pesos FP8 repartidos en 65 fragmentos, antes de la caché KV para un contexto de 1M de tokens, y una sección de despliegue que recomienda SGLang con paralelismo tensorial 16 y un factor de paralelismo de datos de 2, o una receta de vLLM con paralelismo tensorial 8: un trabajo de servicio multinodo.
• Los listados de terceros no son una lista de precios. Las páginas de catálogo sí incluyen cifras para la serie MiMo-V2.6, y Artificial Analysis cuenta con un único proveedor de API que sirve MiMo-V2.6-Pro a $0.435 y $0.87 por millón. Eso es el listado de un proveedor para el checkpoint más grande, no un precio de Xiaomi, y para Flash no existe en absoluto.
Así que la aritmética es una partida medida frente a una decisión de capital. Con unos pocos cientos de millones de tokens al mes, Qwen3.8-Max es una factura que puedes prever y Flash es un nodo que comprarías para servir un modelo que nadie fuera de Xiaomi ha medido. Con miles de millones de tokens al mes, la vía abierta empieza a ganar en coste, y este es el punto en el que la licencia deja de ser una nota a pie de página legal y se convierte en un insumo de adquisición.
Las licencias no son el mismo permiso
MIT es aproximadamente tan permisiva como llegan a ser los pesos abiertos. La Licencia Qwen3.8-Max no es MIT, y la diferencia tiene consecuencias reales.
MiMo-V2.6-Flash se distribuye bajo MIT sin umbral de ingresos, sin desencadenante por número de usuarios, sin acuerdo comercial por separado y sin cláusula de investigación. El despliegue comercial, la modificación, la redistribución y el entrenamiento adicional están permitidos, y el repositorio es de acceso libre.
La Licencia Qwen3.8-Max otorga el uso, la modificación, la distribución, la sublicencia, la venta, el despliegue, el alojamiento y el ajuste fino, bajo dos condiciones. Un producto o servicio que supere los 100 millones de usuarios activos mensuales o 20 millones de dólares estadounidenses en ingresos mensuales debe mostrar el nombre del modelo de forma prominente en su interfaz. Y un negocio de modelo como servicio o de asistente de trabajo con IA con ingresos agregados superiores a 50 millones de dólares estadounidenses en cualquier período de doce meses consecutivos necesita una licencia separada de Alibaba antes del uso comercial. El uso interno queda excluido, siempre que el modelo o sus capacidades no se expongan a terceros.
Para la mayoría de los equipos, ninguna de las dos condiciones resulta vinculante. Para un negocio de plataforma que tiene éxito, una sí lo es, y lo es precisamente en el momento en que el modelo se ha convertido en un elemento estructural. Nótese además que esas condiciones se aplican a los pesos descargables de 2,4 T, no a la API alojada, donde, en cambio, rigen los términos del proveedor. Las dos vías conllevan obligaciones distintas, lo que es una razón adicional para no comparar el checkpoint abierto con el alojado como si fueran el mismo producto.
Dónde encaja OrcaRouter y dónde no
Qwen3.8-Max es enrutable en OrcaRouter, tanto en la entrada base como en la instantánea fechada 0902, a través de una sola clave de API al precio de lista del proveedor, con un 0 % de margen repercutido. Esto importa específicamente aquí por dos razones. En primer lugar, la compilación 0902 es una entrada separada en lugar de un reemplazo silencioso, por lo que el DSL de enrutamiento puede fijar el tráfico sensible a la reproducibilidad a la instantánea fechada mientras que todo lo demás sigue el nivel base —sin una segunda integración y sin cambios en el código. En segundo lugar, dado que el precio de lista se repercute en lugar de aplicar un margen, un cambio en la tarifa de Alibaba llega a tu lado el mismo día en vez de en la próxima renovación del contrato, que es lo que mantiene honesta la aritmética de medido frente a nodo anterior a medida que cambian los precios. Las cargas de trabajo con uso intensivo de caché también conservan el descuento de caché del proveedor en lugar de perder parte de él por el margen de un revendedor.

MiMo-V2.6-Flash no es enrutable en ningún sitio, incluido el nuestro. No enrutamos ningún modelo de Xiaomi, y la línea de disponibilidad en la propia ficha de Xiaomi apunta a los canales propios de Xiaomi: la plataforma API de MiMo, AI Studio, MiMo Code y la aplicación de escritorio. Si quieres este checkpoint, tendrás que descargar 172,9 GB y encontrar un nodo.

¿Cuál, y cuándo?
Elige Qwen3.8-Max si quieres capacidad sin hardware, si tu volumen es incierto o si quieres la opción de un número independiente antes de comprometerte. Acepta que 45 en el índice actual es una posición intermedia dentro de la frontera y no una de las más altas, que 39.2 tokens por segundo es lo bastante lento como para importar dentro de un bucle de agente, y que 190M tokens de salida para completar el Intelligence Index es aproximadamente el doble de la mediana: la verbosidad cuesta dinero en el lado del medidor con precio de salida.
Elige MiMo-V2.6-Flash si la restricción es la licencia, la ruta de datos o una factura a largo plazo que puedas amortizar —y si tienes el nodo—. Los términos MIT sin barrera de ingresos son un permiso genuinamente distinto del de una licencia con un umbral de MAU y un desencadenante de reparto de ingresos, y para una empresa que espera ser grande, esa es la razón para elegirlo. Presupuesta para servicio multi-nodo, dimensiona a partir de los datos de pesos publicados en lugar de la página del repositorio, y trata cada número de la ficha de Xiaomi como reportado por el proveedor hasta que alguien fuera del laboratorio lo vuelva a ejecutar.
Y si estás eligiendo hoy en lugar del próximo trimestre, primero prueba la opción medida. Un mes de Qwen3.8-Max te dice lo que tu carga de trabajo realmente necesita. Un nodo solo te dice lo que esperabas que necesitara.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
