
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6: un checkpoint, diez veces el precio
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed y Xiaomi MiMo-V2.6-Pro no son dos modelos. Son un solo modelo que se vende de dos maneras. Ambos se sirven desde el mismo checkpoint MiMo-V2.6 de un billón de parámetros que Xiaomi publicó en septiembre de 2026 — el nivel Pro de la serie Xiaomi MiMo-V2.6, cuyo hermano menor es Xiaomi MiMo-V2.6-Flash. La diferencia entre las dos ofertas Pro está enteramente en la velocidad con la que salen los tokens y en cuánto pagas por ellos. El nivel estándar pide $0,435 por millón de tokens de entrada y $0,87 por millón de tokens de salida. El nivel UltraSpeed pide $4,35 y $8,70. Eso es un limpio diez a uno en ambos lados del medidor, y compra una afirmación de aproximadamente diez veces la velocidad de salida — una afirmación que Xiaomi hace sobre su propio stack de servicio, y para la que ningún benchmark independiente ha publicado todavía una cifra.
Entonces, la pregunta interesante no es qué modelo es mejor. Es si un múltiplo de diez veces es el precio adecuado por diez veces la velocidad, y resulta que eso tiene un precedente que vale la pena leer antes de comprometer con él una ruta de producción.
El nivel rápido es una decisión de servicio, no una decisión de modelo
El propio planteamiento de Xiaomi para la línea UltraSpeed es que iguala al modelo estándar en calidad y solo se diferencia en el rendimiento. Eso importa más de lo que parece, porque elimina la razón habitual para dudar ante un nuevo nivel. No estás apostando por la personalidad de un checkpoint distinto, por su comportamiento de rechazo ni por sus peculiaridades de formato. Estás apostando a que los mismos pesos, ejecutados con una configuración de servicio más agresiva, se comportarán igual con tus prompts. Si eso se cumple, cambiar entre los dos niveles es un cambio de configuración, no una migración.
Lo que hay dentro de esa configuración de servicio no se ha documentado para esta generación. El nivel UltraSpeed anterior, construido sobre el checkpoint MiMo-V2.5-Pro en junio de 2026, fue descrito por Xiaomi como el uso de cuantización FP4 solo en las capas de expertos, un esquema de decodificación especulativa en paralelo por bloques llamado DFlash y un entorno de ejecución llamado TileRT, y se ejecutaba en un único nodo de ocho GPU. Xiaomi no ha publicado el detalle equivalente para el nivel V2.6. Trata el stack anterior como contexto sobre cómo se obtiene la velocidad, no como una descripción de lo que se ejecuta ahora.
La gama en la que se sitúa es corta. Junto a los dos niveles Pro está MiMo-V2.6-Flash, el hermano menor con 309 mil millones de parámetros totales y 15 mil millones activos. Pro es el buque insignia de mezcla de expertos dispersa: Artificial Analysis lo lista con 1,0 billones de parámetros totales con 42 mil millones activos por token, una ventana de contexto de 1 millón de tokens y una licencia MIT con pesos en Hugging Face. Esos son los números a los que hay que aferrarse, porque toda la comparación se basa en ellos.
Qué está realmente verificado y qué no

La asimetría entre las dos columnas de arriba es lo más importante de este artículo. Casi todo lo medible de este emparejamiento se ha medido en el lado lento.
Artificial Analysis ha evaluado MiMo-V2.6-Pro y publica un Intelligence Index de 46 para él — la puntuación más alta de la clase de 114 modelos en la que agrupa al modelo. Mide 134,3 tokens de salida por segundo a través de la API de Xiaomi, frente a una mediana de la clase de 77,9, y un tiempo hasta el primer fragmento de 2,15 segundos frente a una mediana de 2,34. Indica un coste por tarea de Intelligence Index de 0,13 $, un descuento de caché del 99 % sobre el precio de entrada y una verbosidad de salida de 140 millones de tokens. Esas son cifras independientes sobre una configuración concreta, y son el único anclaje sólido de rendimiento que tiene esta comparación.
Para UltraSpeed, la lista verificada es mucho más corta:
• Velocidad de salida — alrededor de diez veces el nivel estándar, según lo indicado por Xiaomi y repetido por las plataformas que lo incluyen en sus listados. Ningún tercero ha publicado una medición de tokens por segundo para este nivel en concreto.
• Precio — $4,35 por millón de tokens de entrada y $8,70 por millón de tokens de salida, diez veces el nivel estándar en ambos. No se indica ningún nivel de caché junto con esas dos tarifas.
• Calidad — "coincide con el original", de nuevo una declaración del proveedor. No se ha publicado ninguna evaluación independiente del endpoint de UltraSpeed, por lo que la afirmación de que la calidad no ha cambiado está más bien sin comprobar que refutada.
• Contexto y modalidad — 1,048,576 tokens y entrada nativa de texto, imagen, vídeo y audio, heredados del checkpoint base.
También hay un benchmark de proveedor que merece ser mencionado precisamente por el recorrido que ha tenido. El panel público de aprendizaje por refuerzo de Xiaomi, que transmitió las ejecuciones de post-entrenamiento de V2.6 en septiembre de 2026, reporta puntuaciones de DeepSWE v1.1 de 72.57 para la ejecución Pro y 65.68 para Flash. Esas provienen de la propia evaluación offline de Xiaomi usando un arnés mini-swe-agent con promedio de tres, nunca se enviaron al leaderboard público y no se han reproducido fuera del laboratorio. Si has visto citar 72.57 como una puntuación del leaderboard, ese es un número de proveedor disfrazado de puntuación de leaderboard.

El precedente: la última vez Xiaomi cobró tres veces, no diez.
Este no es el primer nivel de velocidad de Xiaomi, y el anterior es la comparación más útil de toda la historia — porque el multiplicador cambió.
MiMo-V2.5-Pro-UltraSpeed llegó en junio de 2026, construido sobre el checkpoint V2.5-Pro, y tenía un precio de aproximadamente tres veces la tarifa de salida del modelo estándar. La propuesta de Xiaomi entonces era la misma que hace ahora: unas diez veces la velocidad de salida. La cobertura de la época informó un rendimiento sostenido de alrededor de 1000 tokens por segundo, con picos cercanos a 1200, en un único nodo con ocho GPU, aunque la propia página del modelo indicaba un rango más amplio, de 500 a 1000, y nada de ello fue verificado de forma independiente. El acceso estaba condicionado a un formulario de solicitud en lugar de a un registro abierto.
Pon los dos uno al lado del otro y el cambio es la historia. El multiplicador de velocidad se mantuvo en aproximadamente diez. El multiplicador de precio pasó de tres a diez. Eso es un trato muy diferente para el mismo tipo de mejora, y Xiaomi no ha publicado una explicación del cambio. Podría reflejar un servicio genuinamente más caro —un checkpoint más grande, una configuración de decodificación más agresiva o una capacidad más ajustada en el lanzamiento—. Podría reflejar precios de la ventana de lanzamiento en un nivel que ha estado disponible durante un solo día. Lo que aún no tiene es una justificación pública que puedas comprobar.
Una diferencia práctica merece señalarse para cualquiera que haya usado el nivel V2.5: aquel era una prueba con acceso restringido. El nivel V2.6 figura como disponible de forma general a través de la propia API de Xiaomi y de varias plataformas de terceros, a las tarifas publicadas y sin necesidad de presentar una solicitud. Independientemente de lo demás que haya cambiado, la barrera para probarlo se redujo.
Lo que cuesta diez veces en una carga de trabajo real
Los porcentajes ocultan la forma de esto, así que aquí están los cálculos sobre una ejecución concreta de un agente, una que lee 20 millones de tokens de entrada y emite 2 millones de tokens de salida a lo largo de su vida útil. Esa es una carga de trabajo agéntica pesada, pero no exótica, del tipo en el que un modelo itera sobre llamadas a herramientas y vuelve a leer su propio contexto.
• Nivel estándar, entrada — 20M de tokens a $0.435 por millón: $8.70.
• Nivel Estándar, salida — 2M tokens a $0,87 por millón: $1,74.
• Nivel estándar, total — $10.44 por ejecución.
• Nivel UltraSpeed, entrada — 20M tokens a $4.35 por millón: $87.00.
• Nivel UltraSpeed, salida — 2M de tokens a $8.70 por millón: $17.40.
• Nivel UltraSpeed, total — $104.40 por ejecución.
La diferencia es de $93,96, y es exactamente diez veces la factura en lugar de diez veces una sola línea de ella, porque ambas tarifas escalan juntas. Ahora, el otro lado de la balanza. Con los 134,3 tokens de salida por segundo que Artificial Analysis mide para el nivel estándar, generar 2 millones de tokens de salida lleva un poco más de cuatro horas de tiempo de generación puro. A diez veces esa velocidad, lleva unos veinticinco minutos. Así que los $94 adicionales recuperan alrededor de tres horas y media de tiempo real en esta ejecución — aproximadamente $27 por cada hora ahorrada, si se quiere ver así.
Que ese intercambio sea bueno depende enteramente de cuánto valga para ti el tiempo de reloj, y hay un detalle que va en contra de una interpretación ingenua. El precio de entrada del nivel estándar conlleva un descuento de caché del 99 % en la página de Artificial Analysis, lo que significa que la mitad de entrada de la factura puede desplomarse hasta casi nada en cargas de trabajo que releen el mismo contexto. El listado de UltraSpeed muestra las dos tarifas principales y ningún nivel de caché. Si tu carga de trabajo tiene un uso intensivo de caché, el multiplicador efectivo no es diez, sino mucho peor, porque pierdes el descuento en el lado donde casi no pagabas nada. Si tu carga de trabajo tiene un uso intensivo de salida y poco uso de caché, diez veces se acerca al número real. Mide tu propia combinación antes de confiar en cualquiera de las dos cifras.
La asimetría de los pesos abiertos
Existe una diferencia estructural entre los dos niveles que no tiene nada que ver con el precio ni con la velocidad, y puede importar más que cualquiera de esos dos factores.
MiMo-V2.6-Pro se distribuye bajo una licencia MIT con pesos publicados en Hugging Face. Eso permite el despliegue comercial, la modificación y el entrenamiento adicional, y significa que el modelo estándar tiene un suelo de precio que ningún proveedor puede eliminar: si la tarifa alojada deja de tener sentido, puedes servir el checkpoint tú mismo. No igualarás el rendimiento de Xiaomi en tu propio hardware, y pagarás por las GPU, pero la opción existe y limita lo que puede cobrar el nivel alojado.
UltraSpeed no tiene ese piso. No hay pesos de UltraSpeed, porque el nivel es la pila de servicio en lugar del modelo: el checkpoint es el mismo que ya es público, y lo que alquilas es la capacidad de Xiaomi de ejecutarlo rápido. Eso es algo legítimo que vender, y tiene la misma forma que cualquier otro nivel de velocidad del mercado. Eso sí significa que la tarifa diez veces mayor no tiene ningún control competitivo salvo otros proveedores que ejecutan los mismos pesos abiertos, y ninguna vía de escape de autoalojamiento si el precio vuelve a moverse.

Contrasta eso con el panorama de disponibilidad. Se puede acceder al checkpoint estándar a través de los propios canales de Xiaomi y varias plataformas de terceros, y además está disponible como descarga. Se puede acceder al nivel UltraSpeed a través de la propia API de Xiaomi y varias plataformas de terceros, y esa es la única forma de obtenerlo. Para cualquiera que esté sopesando una dependencia de larga duración, esa diferencia en opcionalidad merece valorarse junto con la tarifa por token.
¿Quién debería tomar cuál?
La decisión se divide nítidamente en función de qué parte de tu coste corresponde a tokens de salida y qué parte de tu presupuesto de latencia corresponde a generación en lugar de espera en cola.
• Usa UltraSpeed cuando la carga de trabajo sea intensiva en salida, ligera en caché e interactiva: generación de textos extensos, bucles de agentes en los que el modelo escribe una gran cantidad de razonamiento entre llamadas a herramientas, o cualquier caso en el que haya una persona esperando al otro lado de la solicitud.
• Elige el nivel estándar cuando la carga de trabajo tenga un uso intensivo de caché, tolere el procesamiento por lotes o sea sensible al costo en el margen — clasificación masiva, respuesta aumentada por recuperación sobre un corpus fijo, ejecuciones de evaluación durante la noche, cualquier caso en el que cuatro horas de generación no supongan problema porque nadie está mirando.
• Elige el nivel estándar cuando quieras la opción de autoalojarte. Si tu postura de cumplimiento exige pesos que puedas poseer, UltraSpeed no está disponible para ti a ningún precio.
• No elijas ninguno de los dos hasta haber medido. La afirmación de diez veces es la cifra que sostiene todo aquí y actualmente la declara el proveedor. Una sola tarde de ejecutar tus propios prompts en ambos niveles te dice más que cualquiera de las cifras publicadas, porque la única cifra de rendimiento que alguien ha verificado de forma independiente pertenece al lado lento de la comparación.
Sobre ese último punto, la mecánica de probar un nivel de servicio es la misma que la de probar un modelo, y ahí es donde una capa de enrutamiento se gana su lugar. OrcaRouter ofrece más de 200 modelos tras una única clave de API al precio de lista del proveedor, con un 0 % de margen de beneficio repercutido, así que un cambio de precio del proveedor llega a tu lado el mismo día, en lugar de en la siguiente renovación del contrato. La conmutación por error automática hace que un nivel que todavía estás evaluando nunca se encuentre por sí solo en una ruta de producción, y el DSL de enrutamiento te permite enviar una clase de solicitudes al endpoint rápido y todo lo demás al estándar sin mantener dos integraciones. Nada de eso requiere específicamente los modelos de Xiaomi; el punto es que las decisiones a nivel de nivel como esta son baratas de revertir cuando los niveles están detrás de una sola clave.
¿Qué resolvería esto?
El estado honesto de la cuestión de MiMo-V2.6-Pro-UltraSpeed frente a MiMo-V2.6-Pro es que la mitad se mide y la otra mitad se afirma. El nivel estándar tiene un Intelligence Index independiente, una cifra de rendimiento independiente y pesos abiertos publicados. El nivel rápido tiene un precio, una ventana de contexto y la promesa del proveedor de que es el mismo modelo, pero más rápido.
Tres cosas cerrarían la brecha. Una medición independiente del throughput en el endpoint UltraSpeed —Artificial Analysis midió el nivel estándar a través de la API de Xiaomi, así que el mismo tratamiento es posible y simplemente aún no ha ocurrido—. Una política de caché para el nivel rápido, ya que su ausencia es lo que convierte una factura diez veces mayor en algo peor en trabajos con alta carga de caché. Y cualquier detalle publicado sobre el stack de servicio de V2.6, tal como Xiaomi documentó los expertos FP4, DFlash y TileRT para la generación V2.5.
Hasta entonces, el precio diez veces mayor es real y la velocidad diez veces mayor es una afirmación. Si tu carga de trabajo es intensiva en salida y alguien está esperando, vale la pena poner a prueba esa afirmación con tus propios prompts — y vale la pena probarla detrás de una capa que te permita volver atrás esa misma tarde si no se sostiene.
