
Ya está disponible Xiaomi MiMo-V2.6-Flash: un modelo abierto de 309B que puedes servir tú mismo
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash dejó de ser un trabajo de entrenamiento el 21 de septiembre de 2026 a las 15:39 UTC, cuando el equipo MiMo de Xiaomi publicó el checkpoint como XiaomiMiMo/MiMo-V2.6-Flash-RL en Hugging Face —sin restricciones, con licencia MIT, informe técnico adjunto, 65 fragmentos de pesos en el índice. XiaomiMiMo/MiMo-V2.6-Pro-RL llegó dieciocho segundos después. Una semana antes, ambos modelos eran dos tarjetas marcadas como "detenido" en un panel de entrenamiento público, y la frase ampliamente repetida sobre ellos era que no existían pesos. Ahora son archivos que cualquiera puede descargar y servir. Eso es un cambio real en lo que se puede hacer con el modelo, lo cual es algo distinto de un anuncio sobre uno.
Empieza por la marca de tiempo, porque el lanzamiento llegó sin la coreografía habitual del proveedor. El propio blog de Xiaomi, consultado el 22 de septiembre, todavía muestra el lanzamiento de MiMo-V2-Flash de diciembre de 2025 como su entrada más reciente. No hay un artículo de lanzamiento de V2.6, ni una lista de precios publicada para la nueva generación, ni un identificador de modelo invocable que Xiaomi haya anunciado para ninguno de los dos checkpoints. Lo que existe es un repositorio, un informe técnico, recetas de despliegue y un conjunto de tablas de benchmarks ejecutadas por el proveedor — además de un pequeño detalle hostil en la tarjeta del modelo que solo importa a quienes planean cargarlo de verdad.
Las dos cartas que puedes sostener
Ambos puntos de control son omnimodales nativos con un contexto declarado de 1 millón de tokens, y ambos cuentan con la licencia MIT: utilizables comercialmente, ajustables, redistribuibles, sin umbral de ingresos y sin cláusula de investigación. La ficha llama a Flash el «checkpoint equilibrado en eficiencia» de la serie y a Pro el buque insignia; lo interesante es cómo difieren los dos cuando se miran las configuraciones en lugar de la frase de marketing.
• Recuento de parámetros — MiMo-V2.6-Flash: 309B en total con 15B activados por token; MiMo-V2.6-Pro: 1.02T en total con 42B activados. Ambos son de mezcla de expertos dispersa.
Backbone — Flash tiene 48 capas (39 de ventana deslizante, 9 de atención global), tamaño oculto de 4096, 256 expertos enrutados con 8 activados, una ventana deslizante de 128 tokens, sin expertos compartidos. El primer bloque es atención global con una red feed-forward densa; todo lo posterior a él se intercala.
• Codificadores — un MiMo ViT de 681 M de parámetros (28 capas, 24 de ventana deslizante más 4 completas), un tokenizador de audio de 308 M y un codificador de parches de audio de 127 M, de modo que texto, imagen, vídeo y audio entran todos en el mismo modelo en lugar de tres canalizaciones ensambladas a la fuerza.
• Decodificación especulativa — un generador de borradores de predicción multitoken de cinco capas, al estilo DFlash, descrito en la tarjeta como la predicción de siete tokens por adelantado por cada pasada hacia adelante para verificación en paralelo.
• Almacenamiento: el índice publicado reporta 172,9 GB de datos de pesos repartidos en 65 shards, en FP8 (e4m3) con un esquema de activación dinámico. Eso equivale a unos nueve bytes por parámetro: Xiaomi lanzó el modelo grande, no una cuantización del mismo tamaño que la de un portátil.
Tres números que no coinciden
Merece la pena decir esto claramente, porque los tres afectan a una decisión de despliegue más que a un argumento de benchmark, y ninguno de ellos es siniestro: parecen un desfase en la documentación entre el escrito, la página del repositorio y los archivos distribuidos.
El primero es el decodificador especulativo. El resumen del modelo dice que la cabeza MTP es un borrador de cinco capas que predice siete tokens por pasada. El config.json en el mismo repositorio establece num_nextn_predict_layers en 3. Ambos números no pueden describir el mismo artefacto, y la configuración es la que leerá el entorno de ejecución. Si estás dimensionando la memoria para decodificación especulativa, confía en la configuración y verifica después de cargar.
El segundo es más sutil y no es en absoluto un error, sino más bien una convención de nomenclatura que se lee como si lo fuera. El repositorio se llama MiMo-V2.6-Flash-RL, lo que invita a suponer que es un adaptador de aprendizaje por refuerzo en lugar de un modelo. Es el modelo. El sufijo -RL marca el linaje de post-entrenamiento — este checkpoint es la salida de la ejecución de RL mixta que Xiaomi transmitió, no un LoRA montado sobre alguna otra base. El índice de pesos lo confirma: decenas de miles de tensores que cubren la red troncal completa, el codificador de visión, la pila de audio y el modelo borrador.
El tercero es el que encuentras primero si dimensionas el hardware desde la página del repositorio en lugar de la ficha. El bloque Safetensors de esa página informa 159B parámetros. Ese no es ninguno de los dos números de la ficha —ni los 309B totales, ni los 15B activos—, y es la cifra que un planificador de capacidad es más probable que copie, porque está junto al botón de descarga. Xiaomi no ha explicado la diferencia y no podemos resolverla desde fuera; la interpretación más probable es una convención de conteo sobre tensores cuantizados en lugar de un modelo diferente. La medida segura es dimensionar a partir de los datos de pesos publicados: 172,9 GB de FP8 en 65 fragmentos es una cifra que hay que pagar en VRAM independientemente de cómo se cuenten los parámetros.
Qué dicen los benchmarks, y quién los ejecutó
Todas las cifras que aparecen a continuación provienen de las propias tablas de evaluación de Xiaomi en la tarjeta del modelo. Nada de esto ha sido reproducido de forma independiente, nada aparece en una tabla de clasificación pública, y las columnas de comparación son las propias ejecuciones del proveedor de los mismos arneses frente a modelos de otras empresas. Considere la forma de los resultados como informativa y los decimales como adorno.
• Agente de código — DeepSWE v1.1: Flash 67,9, Pro 71,9, frente a Claude Opus 5 a 74,0, GPT-5.6 Sol a 73,0 y Claude Fable 5 a 70,0. En Terminal Bench 2.1, Flash alcanza 87,6 frente al 89,1 de Opus 5 — una diferencia lo bastante pequeña como para que sea el arnés, y no el modelo, quien la esté decidiendo.
• Agente general — AutomationBench v1.0.6 sitúa a Flash en 52.3, por encima tanto de GPT-5.6 Sol (45.8) como de Claude Opus 5 (50.3) en la ejecución de Xiaomi. Toolathlon-Verified: Flash 73.6, Pro 76.9, Opus 5 80.6.
• Ciberseguridad: la columna más desequilibrada de la tabla. CyberGym: Flash 95,1, por encima de su propio hermano mayor, con 94,0, y MiMo-V2.5-Pro en 40,0. Después el suelo se desploma: ExploitGym 6,0 para Flash frente a 22,1 de Opus 5, ExploitBench 25,3 frente a 70,0, y SEC Bench Pro 47,5 frente a 79,1 de GPT-5.6 Sol.
• Agente visual — MiMo VisualCoding: Flash 71.5, Pro 72.3, Opus 5 70.0.
Hay un número que vale la pena destacar porque es el tipo de cosa que una publicación de lanzamiento suele ocultar. El panel de RL de Xiaomi publicó Flash con 65.68 en DeepSWE v1.1 — y la tarjeta del modelo ahora muestra 67.9 para el mismo benchmark en el checkpoint final. No son la misma medición. La cifra del panel estaba etiquetada como mini-swe-agent, avg@3, sobre una instantánea de entrenamiento; la tabla de la tarjeta es la evaluación offline del proveedor de los pesos publicados. La diferencia de dos puntos es la ganancia de la última parte de la ejecución más todo lo que haya cambiado en la configuración de la evaluación, y actualmente nadie fuera de Xiaomi puede separar ambas cosas. Si has estado citando 65.68 desde la semana pasada, ahora es un número obsoleto para un artefacto diferente.

Lo que cuesta ejecutarlo realmente
Los pesos abiertos son una licencia, no una factura, y aquí es donde el lanzamiento pierde parte de su carácter celebratorio. La propia sección de despliegue de la ficha recomienda SGLang (paralelismo de tensores 16, paralelismo de datos 2, con la ruta especulativa multicapa estilo EAGLE habilitada) o una receta de vLLM con paralelismo de tensores 8, y señala que la versión estable de vLLM puede quedar rezagada respecto a la arquitectura. Se trata de una tarea de servicio multinodo para un modelo de 309B cuyos pesos ocupan unos 173 GB antes de añadir la caché KV para un contexto de 1M de tokens. El muestreo recomendado es temperatura 1.0, top_p 0.95.
Así que el encuadre honesto de «código abierto» aquí es: Xiaomi eliminó la barrera de la licencia y dejó la barrera del hardware exactamente donde estaba. Hacer fine-tuning de Flash con tus propias trazas ahora es legal y posible; hacerlo en algo más pequeño que un nodo de GPU serio no lo es. Esa es una oferta real y distinta a la de un endpoint alojado, y es la razón por la que las dos formas de usar esta generación no compiten: cubren presupuestos diferentes.
Si quieres la capacidad sin el nodo, los modelos con los que Xiaomi se compara en esa tabla son la alternativa práctica: GPT-5.6 Sol, Claude Opus 5 y Claude Fable 5 se pueden invocar hoy mismo, y están a una clave de API al precio de lista del proveedor con un 0 % de recargo repercutido en OrcaRouter, así que la decisión que realmente tomas es "comprar un nodo" frente a "medir las llamadas". Si quieres ver cómo se compara el nivel invocable en las mismas tareas de programación antes de decidirte por una vía u otra, el tablero de programación se lee más rápido que la tabla del proveedor. Lo que no puedes hacer hoy en ningún router es invocar MiMo-V2.6-Flash en sí: no enrutamos ningún modelo de Xiaomi, y la línea de disponibilidad en la propia ficha de Xiaomi apunta a los canales propios de Xiaomi: la plataforma MiMo API, AI Studio, MiMo Code y la aplicación de escritorio.

La cuestión de los precios sigue abierta
Xiaomi no ha publicado una tarifa por token para MiMo-V2.6-Flash. Los informes sobre el lanzamiento dicen que la serie conservará los precios de API de MiMo-V2.5, y eso es una afirmación de la prensa, no una hoja de precios del proveedor: las tarifas publicadas para el extranjero de la generación V2.5 eran de alrededor de una décima de dólar por millón de tokens de entrada, con la entrada en caché un orden de magnitud más barata, pero nada en el sitio de Xiaomi confirma que los nuevos checkpoints las hereden. Hasta que aparezca una lista de precios, cualquier cifra que veas para un endpoint de MiMo-V2.6 es una inferencia de alguien.
Aún faltan otras dos cosas, y ambas están en la lista de tareas pendientes de la propia Xiaomi, no en la de nadie más. La declaración de Luo Fuli durante la transmisión en vivo sobre RL fue que los entornos de entrenamiento y el código de RL se publicarían como código abierto, y el material de lanzamiento repite ese compromiso; los repositorios actualmente incluyen los pesos, un informe técnico e instrucciones de despliegue, no el stack de entrenamiento. Y no hay una evaluación independiente: ninguna presentación a la tabla de clasificación, ninguna repetición por terceros de las columnas de DeepSWE o CyberGym. Esa es la brecha que más importa para cualquiera que esté decidiendo si un modelo de 309B con un presupuesto activo de 15B vale la pena para un nodo.
¿Qué cambiaría el panorama?
Vale la pena vigilar tres señales, en un orden aproximado según cuánto influirían en una decisión. Una lista de precios publicada convierte esto de un proyecto de autoalojamiento en una partida que puedes comparar con la vanguardia de los servicios alojados. Una ejecución de terceros en los mismos arneses —DeepSWE o Terminal Bench, presentada en lugar de autodeclarada— resolvería si el 67.9 es una posición real o una configuración favorable. Y los entornos de RL, si llegan a materializarse, serían el artefacto más interesante para la mayoría de los equipos, porque son lo que necesitarías para reproducir el bucle de automejora con tus propios datos.
Hasta entonces, la lectura práctica de este lanzamiento es estrecha y clara. MiMo-V2.6-Flash es un modelo de agente omnimodal legítimo, de pesos abiertos y con licencia MIT, de un tamaño que presupone un clúster, y es el primer checkpoint de la generación MiMo-V2.6 que puedes tener en tus manos, lo cual es más de lo que se podía decir la semana pasada.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
