Tarjeta principal titulada «MiMo-V2.6-Pro vs MiMo-V2.6-Flash», con el subtítulo «Una diferencia de precio de 3x, y lo que no la explica», y dos paneles: un panel izquierdo titulado «MiMo-V2.6-Pro» que muestra «$0.435 / $0.87 por 1M» y «42B de parámetros activos», y un panel derecho titulado «MiMo-V2.6-Flash» que muestra «$0.14 / $0.28 por 1M» y «15B de parámetros activos», sobre un pie de página que dice «Ambos con licencia MIT · ambos con contexto de 1M · índice publicado solo para Pro».
Guides & Insights

MiMo-V2.6-Pro vs MiMo-V2.6-Flash: una diferencia de precio de 3x que dos benchmarks no explican

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En las propias tablas de evaluación de Xiaomi, MiMo-V2.6-Flash supera a MiMo-V2.6-Pro. La fila es CyberGym y el margen es de 95,1 a 94,0. Es una fila de quince, y es la razón para leer con atención el resto de esta comparación en lugar de asumir que el modelo insignia es siempre la respuesta, porque MiMo-V2.6-Flash cuesta aproximadamente un tercio de lo que cuesta MiMo-V2.6-Pro y, en la mayoría de las filas, ambos están a unos pocos puntos de diferencia.

Ambos modelos se publicaron como repositorios de Hugging Face el 21 de septiembre de 2026, bajo la licencia MIT, con dieciocho segundos de diferencia, como ejecuciones de entrenamiento separadas en lugar de peldaños de una misma escalera. Xiaomi MiMo-V2.6-Pro es el nivel de billón de parámetros. MiMo-V2.6-Flash es el nivel de eficiencia. La pregunta que responde esta página es cuál de ellos corresponde a tu ruta de producción, y la respuesta honesta depende de un número que no existe en ninguno de los dos lanzamientos.

Lo que es cada uno

• Parámetros — Xiaomi MiMo-V2.6-Pro 1,02T en total con 42B activos por token, frente a Xiaomi MiMo-V2.6-Flash con aproximadamente 309B en total y 15B activos
• Arquitectura — ambos son mezcla de expertos dispersa con entrada omnimodal nativa; Flash está documentado con 48 capas, 39 de ventana deslizante y 9 de atención completa, tamaño oculto de 4096, 256 expertos enrutados con 8 activos y sin expertos compartidos, junto con un transformador de visión de 681M, un tokenizador de audio de 308M y un codificador de parches de audio de 127M
• Contexto — 1M de tokens en ambos, con hasta 128.000 tokens de salida en ambos
• Licencia — MIT en ambos, pesos sin restricciones en ambos
• Precio — $0,435 de entrada y $0,87 de salida por millón de tokens para Pro, frente a $0,14 y $0,28 para Flash: una diferencia de 3,1x en ambos lados de la ficha
• Entrada con acierto de caché — $0,0036 por millón en Pro, $0,0028 en Flash
• Gasto en entrenamiento — Xiaomi reporta aproximadamente $2,62M para la ejecución de RL de Pro y $854K para Flash, cada una completada en menos de seis días a lo largo de 30 pasos de aprendizaje por refuerzo y alrededor de 750.000 trayectorias
• Puntuación de índice independiente — 46 para Xiaomi MiMo-V2.6-Pro en Artificial Analysis Intelligence Index v4.3.2; ninguna publicada para MiMo-V2.6-Flash

Esa última línea es la que hay que retener. Todo lo anterior, excepto la puntuación Pro, son datos aportados por Xiaomi.

Donde el triple del precio no compra casi nada

La Tabla 3 de Xiaomi los pone uno al lado del otro en los arneses con los que se entrenó la serie, y en el trabajo agéntico de horizonte largo los márgenes son estrechos:

• DeepSWE v1.1 — Pro 71,9, Flash 67,9
• MiMo Code Bench — Pro 63,2, Flash 61,2
• AutomationBench v1.0.6 — Pro 53,1, Flash 52,3
• Toolathlon-Verified — Pro 76,9, Flash 73,6
• Terminal Bench 2.1 — Pro 89,9, Flash 87,6
• OSWorld-Verified — Pro 82,0, Flash 80,8
• JobBench — Pro 62,0, Flash 61,2
• MiMo Visual Coding — Pro 72,3, Flash 71,5
• CyberGym — Pro 94,0, Flash 95,1
• MiMo Cyber Bench — Pro 80,2, Flash 77,2

Recorre esa columna de arriba abajo y la ventaja del buque insignia está, en su mayoría, entre uno y cuatro puntos, con una fila perdida por completo. En un flujo de trabajo donde la diferencia entre 67,9 y 71,9 es la diferencia entre que una tarea se complete y que falle, triplicar el precio es barato. En un flujo de trabajo donde es la diferencia entre dos respuestas aceptables, no lo es. Las tablas de proveedores con decimales como estos invitan a una falsa precisión: nadie fuera de Xiaomi las ha ejecutado, y una diferencia de dos puntos en un banco de pruebas calificado internamente está muy dentro del margen que puede desplazar un evaluador distinto o una política de reintentos distinta.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Donde compra mucho

Hay un grupo de filas donde la brecha deja de ser una cuestión de redondeo. Cada una de ellas es trabajo de seguridad:

• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8

En ExploitGym, el modelo insignia triplica al modelo más económico, el mismo factor que el del precio, y en SEC Bench Pro es de 1,4x. Ese patrón es lo que cabría esperar de un modelo con 42B de parámetros activos frente a uno con 15B: una tarea que requiere una larga cadena de razonamiento sin puntuación parcial es el tipo de tarea en la que se nota la capacidad adicional, y que CyberGym vaya en sentido contrario es la excepción que confirma que las dos ejecuciones aprendieron cosas distintas en lugar de lo mismo a diferentes tamaños.

Así que la división se corresponde con una frontera real de carga de trabajo, no con una de marketing. El trabajo de agentes de alto volumen con un criterio de éxito tolerante —recuperación, clasificación, ediciones rutinarias, llamadas que un reintento puede salvar— es territorio de Flash. El trabajo donde una respuesta incorrecta es costosa y una respuesta parcial no vale nada —desarrollo de exploits, revisión de seguridad, sesiones de terminal con estado de varios pasos— es donde el nivel Pro se gana el múltiplo.

El número que no existe

MiMo-V2.6-Flash no tiene página de modelo en Artificial Analysis. Su hermano sí. Esa asimetría es lo más importante de esta página, porque significa que la única cifra medida de forma independiente en toda la serie MiMo-V2.6 es el 46 junto a Xiaomi MiMo-V2.6-Pro. Cada número de Flash anterior —incluida la fila de CyberGym que gana— proviene de un harness de Xiaomi, un evaluador de Xiaomi y una ejecución offline de Xiaomi.

Hay un argumento razonable de que esto es temporal: el modelo tiene un día en el momento de escribir esto, y la evaluación por terceros lleva tiempo. También hay un argumento razonable de que es estructural, ya que Flash es el nivel de volumen y los niveles de volumen atraen menos atención de benchmarking. En cualquier caso, la consecuencia práctica hoy es que no puedes comparar Flash con nada fuera de su propia familia con la misma confianza con la que puedes comparar Pro. Si estás eligiendo entre Flash y un modelo que no es de Xiaomi por motivos de precio por calidad, estás comparando una cifra de un proveedor con una medida por alguien más.

Ambas tarjetas de modelo incluyen la misma segunda advertencia. Ninguno de los dos repositorios está desplegado por ningún proveedor de inferencia: Hugging Face lo dice explícitamente en cada página, y Artificial Analysis contó un único proveedor de API para Pro. No alojamos ninguno de los dos checkpoints, por lo que ninguno es enrutable a través de nosotros. La vía hacia ambos es la propia plataforma de Xiaomi y los catálogos de terceros que los incluyen.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

El precio que pagas en hardware, no en tokens

El precio por token es solo la mitad de lo que te cuesta un checkpoint, y ambos difieren mucho más drásticamente en disco que en la tarifa publicada. MiMo-V2.6-Flash publica 172,9 GB de pesos FP8 repartidos en 65 fragmentos. Xiaomi MiMo-V2.6-Pro tiene aproximadamente el triple de parámetros, lo que sitúa su descarga sin procesar en el rango del medio terabyte antes de cualquier cuantización, y su propio repositorio reporta un tamaño de modelo Safetensors de 524B parámetros, una cifra que no concuerda ni con el total de 1,02T ni con el recuento de 42B activos.

Esa diferencia cambia la forma de la decisión. Flash con 172,9 GB es un modelo que un equipo pequeño puede autoalojar en capacidad alquilada y tratar como un commodity. Pro, con aproximadamente el triple de eso, es una decisión de clúster: la cobertura en torno al lanzamiento situó las dos ejecuciones de entrenamiento en aproximadamente 4.000 y 8.000 GPU equivalentes a H200, respectivamente. Si tu razón para mirar los pesos abiertos es que quieres tener la opción de dejar de pagar por token, los dos checkpoints ofrecen esa opción a escalas de compromiso muy diferentes.

Elegir entre ellos

La regla que sobrevive a las salvedades anteriores es elegir por clase de carga de trabajo en lugar de por promedio de benchmarks. Flash para todo aquello que te sentirías cómodo reintentando; Pro para todo aquello en lo que un reintento no te salve. Luego mide, porque ninguno de los dos modelos tiene una puntuación independiente en los benchmarks que realmente te importan.

Medir dos checkpoints en paralelo es donde un router hace algo que un contrato por modelo no puede. Poner un nivel barato en la mayor parte de tu tráfico y escalar solo los casos difíciles al caro es la misma decisión que esta página, expresada como configuración en lugar de como una reescritura, y esa composición es exactamente aquello para lo que existe la capa de enrutamiento. También importa para el precio en sí: trasladamos el precio de lista del proveedor con un 0 % de margen, así que si Xiaomi reduce la tarifa en cualquiera de los dos checkpoints, la cifra de nuestro lado cambia ese mismo día en lugar de en la siguiente renovación de contrato. Eso se aplica a los modelos que ofrecemos. Para el par MiMo-V2.6 en concreto, hoy en día, sigues comprando directamente a Xiaomi.

¿Qué lo resolvería?

Dos cosas convertirían esto de una decisión subjetiva en una cuestión aritmética. Una página de Artificial Analysis para MiMo-V2.6-Flash pondría ambos checkpoints en el mismo eje de costo por tarea que actualmente sitúa a Pro en $0.133 por tarea de Intelligence Index, y la comparación se resolvería por sí sola. Una replicación por terceros del clúster de seguridad —ExploitGym, ExploitBench, SEC Bench Pro— confirmaría si la brecha de 3x en esas filas es una propiedad del modelo o una propiedad del calificador.

Hasta entonces, la postura defendible es que Xiaomi MiMo-V2.6-Flash es la mejor compra para la mayoría de los equipos la mayor parte del tiempo, y que Xiaomi MiMo-V2.6-Pro es la mejor compra para la reducida clase de trabajos en los que el fallo es el resultado costoso. La única fila en la que gana Flash no invalida eso, pero es un recordatorio útil de que el sobreprecio del buque insignia es una afirmación sobre una carga de trabajo, no sobre un modelo.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.