Tarjeta principal del radar de modelos de OrcaRouter titulada «MiMo-V2.6-Flash vs MiMo-V2.6», con el subtítulo «Una misma serie, dos checkpoints y un nombre que cumple una doble función», con un panel izquierdo para MiMo-V2.6-Flash que indica 309B en total / 15B activos, 172,9 GB de pesos FP8 y checkpoint de eficiencia, un panel derecho para MiMo-V2.6-Pro que indica 1,02T en total / 42B activos, «el nombre que la gente escribe para el buque insignia» y la misma licencia MIT, y tres insignias debajo que indican Publicado el 21 de sept. de 2026, afirmación de contexto de 1M de tokens y Sin endpoint de Xiaomi al que llamar.
Guides & Insights

MiMo-V2.6-Flash vs MiMo-V2.6: una serie, dos checkpoints y un nombre que cumple una doble función

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pregunta a dos personas qué es MiMo-V2.6 y puedes obtener dos modelos diferentes. El lanzamiento de septiembre de 2026 de Xiaomi es una serie con dos checkpoints publicados: MiMo-V2.6-Flash con 309 mil millones de parámetros y MiMo-V2.6-Pro con 1,02 billones — y el nombre a secas MiMo-V2.6 se usa tanto para la familia como, en la mayoría de la cobertura, para el nivel más alto de la generación. Así que una página titulada «MiMo-V2.6-Flash vs MiMo-V2.6» es en realidad el checkpoint de eficiencia frente al nombre que la gente escribe cuando se refiere al modelo insignia. Ambos checkpoints llegaron a Hugging Face con dieciocho segundos de diferencia el 21 de septiembre de 2026, ambos tienen la licencia MIT y en ambos casos primero hay que descargarlos: no hay ningún endpoint de Xiaomi al que llamar. Casi nada más sobre ellos es igual.

Eso importa más de lo que normalmente importaría una discusión sobre el nombre, porque los dos no son una escalera de tamaños por la que puedas subir más adelante. Son entrenamientos distintos, con tablas de referencia distintas, huellas de memoria distintas y —como muestran las cifras publicadas— un par de puntos en los que el más pequeño gana de manera contundente.

Dos puntos de control, un minuto publicado

Los repositorios son XiaomiMiMo/MiMo-V2.6-Flash-RL, creado a las 15:39:51 UTC, y XiaomiMiMo/MiMo-V2.6-Pro-RL, creado a las 15:39:33 UTC. Ninguno de los dos tiene acceso restringido. Ambos incluyen un informe técnico y una ficha de modelo, y Xiaomi los describe como el resultado de una única ejecución de aprendizaje por refuerzo mixto que integró tareas de programación, de agentes generales, visuales y de ciberseguridad en una sola pasada de entrenamiento, en lugar de ejecuciones separadas por dominio.

• Parámetros — MiMo-V2.6-Flash: 309B en total, 15B activados por token. MiMo-V2.6-Pro: 1.02T en total, 42B activados. Ambos son de mezcla de expertos dispersa.

• Backbone — Flash tiene 48 capas, 39 de ventana deslizante y 9 de atención completa, tamaño oculto 4096, 256 expertos enrutados con 8 activados, una ventana deslizante de 128 tokens y sin expertos compartidos. Pro ejecuta la misma idea de atención híbrida con un ancho mucho mayor.

• Modalidad — ambos son omnimodales nativos, ya que integran texto, imagen, video y audio en un solo modelo en lugar de tres pipelines ensamblados. Flash incorpora un transformer de visión de 681 M de parámetros, un tokenizador de audio de 308 M y un codificador de parches de audio de 127 M.

Contexto — 1M tokens, declarado para ambos, con la configuración que respalda un embedding de posición máxima de 1.048.576 tokens.

• Licencia — MIT en ambos, sin umbral de ingresos, sin restricción de uso aceptable más allá de lo habitual y sin cláusula de investigación. El despliegue comercial, la modificación y la redistribución están permitidos.

• Archivos de pesos — Flash publica 172,9 GB de datos de pesos FP8 repartidos en 65 fragmentos. Pro tiene aproximadamente tres veces la cantidad de parámetros, así que su descarga queda en el rango de medio terabyte antes de cualquier cuantización que apliques por tu cuenta.

• Dónde se ofrecen: Hugging Face, la propia plataforma API de Xiaomi, AI Studio, MiMo Code y la aplicación de escritorio MiMo. La tarjeta señala que actualmente ningún proveedor de inferencia de terceros despliega ninguno de los dos checkpoints en el propio Hub.

La colisión que le cuesta hardware a la gente

La confusión en este emparejamiento no se da realmente entre Flash y Pro. Se da entre MiMo-V2.6-Flash y el modelo que lo precedió.

MiMo-V2-Flash se lanzó en diciembre de 2025, y la propia entrada de blog de Xiaomi que lo anuncia describe un modelo de mezcla de expertos con 309 mil millones de parámetros totales, 15 mil millones activos, un esquema de atención híbrido que intercala atención de ventana deslizante y atención completa, y una agresiva ventana deslizante de 128 tokens. Lee eso en contraste con la lista de viñetas anterior. El checkpoint de 2026 y el checkpoint de 2025 tienen la misma forma general, el mismo tamaño de ventana deslizante y el mismo presupuesto de activación —nueve meses de diferencia, de distintas ejecuciones de entrenamiento, con distintas capacidades y una tabla de benchmarks distinta.

Así que una búsqueda de «MiMo V2.6 Flash» te devolverá sin problema páginas sobre MiMo-V2-Flash, con una cifra de contexto de 256K y un precio de una décima de dólar por millón de tokens de entrada que pertenece al modelo anterior. Si estás dimensionando un nodo, eso no es un error cosmético. El checkpoint anterior y el nuevo son descargas distintas con recetas de servicio diferentes, y el nuevo afirma tener cuatro veces el contexto.

Hay una segunda trampa, más silenciosa, en la nomenclatura. Ambos repositorios terminan en -RL, lo que se lee como un adaptador de aprendizaje por refuerzo montado sobre algún otro modelo base. No son adaptadores. El sufijo marca el linaje de postentrenamiento: estos son los checkpoints completos que salieron de la ejecución de RL en streaming. El índice de pesos lo confirma: decenas de miles de tensores que cubren todo el backbone, el codificador de visión, la pila de audio y el modelo borrador especulativo.

Lo que dice la propia tabla del proveedor

Cada cifra de esta sección proviene de las tablas de evaluación de Xiaomi en las dos fichas de modelo. Xiaomi ejecutó los arneses sobre sus propios puntos de control. Nada de esto se ha reproducido fuera del laboratorio, nada de esto aparece en una tabla de clasificación pública, y las columnas de comparación son ejecuciones propias del proveedor de los mismos arneses contra modelos de otras empresas. Considera la clasificación como informativa y los decimales como decoración.

• Agente de código — DeepSWE v1.1: Flash 67,9, Pro 71,9. Terminal Bench 2.1: Flash 87,6, Pro 89,9. ProgramBench: Flash 26,0. MiMo Code Bench: Flash 61,2.

• Agente general — AutomationBench v1.0.6: Flash 52,3, Pro 53,1. Toolathlon-Verified: Flash 73,6, Pro 76,9. OSWorld-Verified: Flash 80,8, Pro 82,0. Agents' Last Exam: Flash 27,6. Terminal Bench 4.0: Flash 28,8.

• Ciberseguridad — la única columna en la que el modelo más pequeño lidera. CyberGym: Flash 95,1 frente a 94,0 de Pro. MiMo Cyber Bench: Flash 77,2. Luego, el suelo se desploma: ExploitGym 6,0, ExploitBench 25,3, SEC Bench Pro 47,5.

• Agente visual — MiMo VisualCoding: Flash 71.5, Pro 72.3.

Si repasas esas viñetas, el resumen honesto es que Pro va por delante en casi todos los aspectos, por márgenes pequeños, y que esos márgenes son lo bastante pequeños como para quedar dentro del ruido de un harness autoejecutado. En DeepSWE, los dos están a cuatro puntos de distancia en una escala en la que el mismo checkpoint se movió dos puntos entre dos de las propias evaluaciones de Xiaomi.

Ese último punto merece su propio párrafo, porque es lo más útil de cualquiera de las dos tarjetas. El panel público de RL de Xiaomi, que transmitió ambas ejecuciones de entrenamiento durante septiembre, publicó Flash con 65,68 en DeepSWE v1.1 usando un arnés mini-swe-agent con promedio de tres. La tarjeta finalizada muestra 67,9 para los pesos publicados. Mientras tanto, la cifra del panel de Pro era 72,57 y su tarjeta muestra 71,9 — bajó. Dos checkpoints de la misma ejecución, evaluados dos veces, y la diferencia entre las dos evaluaciones es del mismo tamaño que la diferencia entre los dos modelos. Si has estado citando cifras del panel desde la semana pasada, describen instantáneas de entrenamiento, no los artefactos que descargarías hoy.

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

Ninguno de los dos está en un router.

Esta es la parte que decide la mayoría de las evaluaciones reales. Xiaomi no vende ninguno de los dos checkpoints: no hay un precio por token publicado para la generación MiMo-V2.6 en su propio sitio, ni un identificador de modelo invocable que haya anunciado para ninguno de los dos. Lo que existe en su lugar es una descarga y, además —solo para Pro—, un único proveedor de API que Artificial Analysis contabiliza como uno que lo sirve a $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida. Eso es un listado de un proveedor, no una lista de precios del fabricante, y no hay nada comparable para Flash en absoluto. Las cifras que circulan en páginas de catálogos de terceros deben leerse de la misma manera.

Así que la elección entre Flash y Pro no es una elección entre dos extremos con diferentes métricas. Es una elección entre dos facturas de GPU, y la más pequeña es aproximadamente un tercio de la más grande. Ese es todo el argumento comercial a favor de Flash, y es más sólido de lo que sugiere la tabla de benchmarks, porque los dos modelos están a unos pocos puntos de diferencia en las tareas para las que la mayoría de la gente compra.

Lo que queda es la consabida división en tres opciones. Alquilar la frontera, tener un modelo pequeño propio o tener uno grande propio. La columna de la frontera es la que Xiaomi toma como referencia en sus propias tablas —Claude Opus 5, GPT-5.6 Sol y Claude Fable 5 se sitúan unos puntos por encima de Pro en DeepSWE en la propia comparativa del proveedor, y los tres se pueden invocar hoy a través de una sola clave de API en OrcaRouter al precio de lista del proveedor, sin ningún recargo. Eso importa para la decisión concreta que tienes delante: un cambio de precio del proveedor llega a tu lado el mismo día, y no en la próxima renovación del contrato, de modo que la aritmética de alquilar frente a tenerlo propio se mantiene honesta a medida que se mueven los precios alojados. La conmutación por error automática también hace que un modelo que todavía estás evaluando nunca tenga que estar solo en una ruta de producción mientras decides.

Lo que no puedes hacer en ningún router hoy —incluido el nuestro— es llamar a MiMo-V2.6-Flash o MiMo-V2.6-Pro. No enrutamos ningún modelo de Xiaomi, y la línea de disponibilidad en la propia ficha de Xiaomi apunta a los canales propios de Xiaomi: la plataforma API de MiMo, AI Studio, MiMo Code y la aplicación de escritorio.

¿Qué punto de control, y cuándo?

Elige MiMo-V2.6-Flash si quieres la generación MiMo-V2.6 y el hardware es la limitación determinante. Renuncias a aproximadamente cuatro puntos de DeepSWE y a un punto o dos en la mayoría de los benchmarks de agentes frente al modelo insignia. Ganas un checkpoint que usa alrededor de un tercio de la memoria, que supera a Pro en CyberGym en la propia tabla de Xiaomi y que comparte la misma licencia, la misma afirmación de contexto de 1M tokens y la misma multimodalidad. Para un equipo que trabaja en evaluación de ciberseguridad, esa columna de CyberGym no es un error de redondeo.

Elige MiMo-V2.6-Pro si la carga de trabajo es de programación o de trabajo agéntico de horizonte largo y el nodo ya está pagado. Es el mejor modelo en casi todas las columnas, es el que Artificial Analysis ha medido realmente —un Índice de Inteligencia de 46 en la escala v4.3 recalibrada, el primero de los 114 modelos de su clase de pesos abiertos, 134,3 tokens de salida por segundo, y listado a $0,435 por millón de tokens de entrada y $0,87 por millón de salida— y una medición independiente vale más que una tabla del proveedor cuando se planifica producción.

No tomes ninguno hasta que hayas leído los archivos de configuración en lugar de los resúmenes. La ficha de Flash describe un borrador especulativo de cinco capas que predice siete tokens por pasada; el config.json del mismo repositorio establece num_nextn_predict_layers en 3. El resumen de la ficha no es lo que lee el entorno de ejecución. Y el bloque Safetensors de la página del repositorio informa 159B de parámetros para Flash y 524B para Pro, y ninguno de los cuales coincide con el total ni con el recuento de parámetros activos de ninguna de las dos fichas de modelo. Xiaomi no ha explicado la discrepancia. En su lugar, calcula el tamaño a partir de los datos de pesos publicados, porque ese es el número que pagas en VRAM independientemente de cómo se cuenten los parámetros.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

¿Qué lo resolvería?

Tres cosas, en orden aproximado de utilidad. Una ejecución de terceros en los mismos arneses — DeepSWE o Terminal Bench, presentada en lugar de autodeclarada — te diría si la diferencia de cuatro puntos entre Flash y Pro es una posición real o una configuración favorable. Una lista de precios publicada convertiría toda la comparación de un proyecto de hardware en una partida que puedes poner junto a la frontera alojada. Y los entornos de RL, que Xiaomi ha dicho que abrirá como código abierto, son el artefacto que la mayoría de los equipos realmente querría, porque son lo que necesitarías para reproducir el bucle con tus propias trazas.

Hasta entonces, la lectura práctica es limitada. MiMo-V2.6 son dos checkpoints, no uno, y el nombre a secas suele referirse al costoso. Si hoy estás eligiendo dentro de la serie, la opción predeterminada honesta es Flash, a menos que una columna de benchmark que te importe específicamente diga lo contrario — y si no estás listo para comprar un nodo, ninguna de las dos es todavía la respuesta correcta.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.