
Xiaomi MiMo-V2.6-Pro vs MiniMax M3: la mejor puntuación tiene la ruta más delgada
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro se puso a disposición general el 22 de septiembre de 2026 y alcanzó la primera posición en pesos abiertos del Artificial Analysis Intelligence Index con 46 en la v4.3.2. MiniMax M3 ha ostentado una versión de ese título desde su lanzamiento el 31 de mayo de 2026, y en el mismo índice hoy obtiene 29 — diecisiete puntos por detrás. La puntuación es lo menos interesante del par. MiniMax M3 sirve a 168,9 tokens de salida por segundo frente a 134,3, responde en 0,92 segundos frente a 2,15, es más barato por token de entrada y es accesible a través de quince proveedores de API frente al único de Xiaomi. El modelo más nuevo y con mayor puntuación es el que resulta más difícil de elegir realmente, y de esa inversión trata esta comparación.
Ambos con pesos abiertos, ambos multimodales, con catorce semanas de diferencia
Los dos modelos son parientes cercanos en intención de diseño. Ambos son modelos de mezcla de expertos dispersos de laboratorios chinos, ambos tienen una ventana de contexto de 1M de tokens, ambos aceptan imágenes y video de forma nativa en lugar de mediante un adaptador añadido, y ambos publican sus pesos. Catorce semanas separan sus lanzamientos, y la brecha en el índice entre ellos es la distancia que recorrió la frontera de los pesos abiertos en ese lapso.
• Parámetros totales — Xiaomi MiMo-V2.6-Pro 1,02 T; MiniMax M3 aproximadamente 427B, ambos MoE dispersos
• Activos por token — Xiaomi MiMo-V2.6-Pro 42B; MiniMax M3 aproximadamente 23–25B
• Contexto — 1M tokens cada uno, con MiniMax M3 garantizando un mínimo de 512K
• Modalidades de entrada — texto, imagen y vídeo para ambos; Xiaomi añade entrada de audio
• Pesos — licencia MIT en Xiaomi MiMo-V2.6-Pro; MiniMax M3 se distribuye bajo la Licencia Comunitaria de MiniMax, que no es permisiva y requiere un acuerdo aparte para uso comercial
• Lanzado — Xiaomi MiMo-V2.6-Pro, 21–22 de septiembre de 2026; MiniMax M3, 31 de mayo de 2026
• Alcance — se contabiliza un proveedor de API para Xiaomi MiMo-V2.6-Pro en Artificial Analysis; quince para MiniMax M3
Esa última línea es la que hay que tener presente. Todo lo demás en la hoja favorece al modelo más nuevo. Esa línea no, y es la línea que decide si un modelo puede formar parte de una ruta de producción.
Qué mide el índice y quién lo midió
Artificial Analysis ejecutó ambos modelos por su cuenta en v4.3.2 — un compuesto de diez evaluaciones que abarca razonamiento, conocimiento, matemáticas y codificación, incluyendo AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Ni el 46 ni el 29 es un número de proveedor, lo cual importa aquí porque ambos laboratorios también publicaron cifras de benchmark propias que son números de proveedor, y los dos tipos no deben mezclarse.
El 46 sitúa a Xiaomi MiMo-V2.6-Pro a la cabeza del campo de pesos abiertos en ese compuesto. No lo sitúa a la cabeza del índice: tanto Claude Fable 5.1 como GPT-6 Astra se sitúan en 53, y Claude Opus 5 en 51. El 29 de MiniMax M3 lo coloca en decimosexto lugar de 114 modelos medidos, muy por encima de la mediana de su clase de tamaño, pero muy lejos de la frontera con la que se lo comparaba en junio.
MiniMax M3 tiene las pruebas que Xiaomi no tiene.
Esta es la parte de la comparación que se omite, y es la parte que un comprador debería sopesar con mayor peso. MiniMax M3 está en la tabla de clasificación pública de DeepSWE v1.1 con una entrada oficial: 20,4 % de Pass@1 y 48,7 % de Pass@4, publicada el 8 de junio de 2026 tras una actualización de inferencia de MiniMax que corrigió una generación anómala de tokens y mejoró el comportamiento de la caché de contexto largo. Esa entrada venía acompañada de una contabilidad de eficiencia, y la contabilidad no es halagüeña: una mediana de 311 pasos del agente, aproximadamente 91.000 tokens de salida y unos 5,04 $ por tarea. Supera tareas de ingeniería de horizonte largo, y lo hace de forma costosa.
La cifra principal de benchmark de Xiaomi para su nuevo modelo es 72.57 en DeepSWE v1.1, frente a una línea base de 58.4, medida con mini-swe-agent como promedio de tres en el arnés propio de Xiaomi. No es una entrada en la tabla de clasificación y no se ha enviado como tal. Poner 72.57 junto al 20.4 de MiniMax y leer una victoria de 52 puntos es aritmética entre dos mediciones diferentes: la tabla publica Pass@1 para una configuración específica, con un intervalo de confianza y un costo promedio por tarea que un tercero puede volver a ejecutar, y la cifra del proveedor no tiene nada de eso adjunto. Es muy posible que el 72.57 sea honesto. Simplemente no es el mismo tipo de objeto.
MiniMax también publicó cifras de lanzamiento propias, y la misma advertencia se aplica a todas ellas: SWE-Bench Pro con 59,0, BrowseComp con 83,5, SVG-Bench con 63,7 y Terminal-Bench 2.1 con 66,0, ejecutadas en la propia infraestructura de MiniMax con su propio andamiaje. Trátalas como afirmaciones sobre el modelo, no como mediciones de este.
Velocidad, latencia y los dos números que deciden una factura
La brecha de rendimiento va en dirección opuesta a la brecha de calidad, y es lo suficientemente amplia como para ser relevante. MiniMax M3 genera 168,9 tokens de salida por segundo frente a los 134,3 de Xiaomi MiMo-V2.6-Pro, y su tiempo hasta el primer token, de 0,92 segundos, es aproximadamente dos veces y media más rápido que los 2,15 de Xiaomi. Para un producto interactivo, la latencia del primer token es la cifra que el usuario percibe; para un pipeline por lotes, el rendimiento es la cifra que determina el tiempo real.
En cuanto al coste, los dos están más cerca de lo que sugieren las tarifas anunciadas, y la dirección depende de tu tráfico. MiniMax M3 se lista a $0,30 por millón de tokens de entrada y $1,20 por millón de salida; Xiaomi MiMo-V2.6-Pro se lista a $0,43 y $0,87. M3 es más barato de alimentar, Xiaomi es más barato de generar. Una vez aplicados los descuentos por caché —80% para M3, 99% para Xiaomi—, las tarifas combinadas se sitúan en $0,22 y $0,18 por millón en una mezcla 7:2:1 de aciertos de caché/entrada/salida. Artificial Analysis también registra un coste de $0,13 por tarea del Intelligence Index para Xiaomi MiMo-V2.6-Pro, medido de la misma manera en todos los modelos de la tabla, que es la cifra de coste única más comparable disponible para los dos.

Quince rutas contra una, y cuánto vale la conmutación por error
Una ventaja de diecisiete puntos en el índice no te sirve de nada si el punto de conexión está caído. Artificial Analysis contabilizó un solo proveedor de API para Xiaomi MiMo-V2.6-Pro en el momento de escribir esto, y ese recuento es un hecho sobre el lanzamiento, no sobre el modelo: un checkpoint publicado hace tres días no ha tenido tiempo de propagarse. A MiniMax M3, con cuatro meses de antigüedad, lo sirven quince.
Esa diferencia es para lo que sirve un router, y es donde los dos modelos divergen comercialmente. MiniMax M3 está en OrcaRouter como minimax/minimax-m3: un endpoint compatible con OpenAI, con el precio de lista del proveedor aplicado sin ningún margen (0 % de recargo), así que los $0.30 y $1.20 anteriores son cifras del propio MiniMax y no nuestras, y un cambio de precio de MiniMax se refleja en nuestro lado el mismo día. Sus quince proveedores upstream son lo que hace que una cadena de conmutación automática por fallo tenga sentido: una solicitud que se atasca en un proveedor se reintenta en otro antes de que empiece la respuesta, lo cual es una garantía distinta a la de un modelo que solo tiene un lugar al que ir. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter; ningún modelo de Xiaomi lo está, y llegar a él hoy significa la propia plataforma de Xiaomi y los catálogos de terceros que lo incluyen.
Si quieres ambos en la misma aplicación, la forma práctica es una única clave que contenga los modelos que ya has decidido usar, y que el recién llegado se evalúe frente a ellos en lugar de adoptarlo por una puntuación de hace tres días. Eso es una decisión de enrutamiento, y la propiedad útil es que un carril de reserva no cuesta nada hasta el día en que te salva.

¿Cuál elegir?
Si necesitas un modelo multimodal de pesos abiertos y de un millón de tokens en producción esta semana, la respuesta es MiniMax M3, y no hay competencia cercana: quince proveedores, primer token en menos de un segundo, una vía comercial lo suficientemente permisiva solo si has leído la licencia comunitaria, y una entrada oficial de benchmark de horizonte largo que puedes inspeccionar. La advertencia de eficiencia es real: presupuesta los 91.000 tokens de salida por tarea, no solo la tarifa por token.
Si estás eligiendo un modelo para un trabajo que empezarás el mes que viene, Xiaomi MiMo-V2.6-Pro es el modelo más capaz por un amplio margen medido, a una tarifa combinada más baja y con una licencia MIT que elimina por completo la conversación sobre licencias. Lo que aún no tiene es un segundo lugar donde ejecutarse. Lo que hay que observar es el número de proveedores: cuando deje de ser uno, la brecha de diecisiete puntos dejará de ser un resultado de investigación y se convertirá en una decisión de despliegue.
Hasta entonces, el resumen honesto es que el mejor modelo es aquel del que no puedes hacer failover, y el modelo más débil es el que puedes poner frente a los clientes esta noche.

¿De dónde vienen los números en esta pieza?
Las puntuaciones de índice, el rendimiento, la latencia, los descuentos de caché y los recuentos de proveedores para ambos modelos son mediciones de Artificial Analysis sobre el Intelligence Index v4.3.2, leídas el 22 de septiembre de 2026, y el 29 de MiniMax M3 se sitúa en la misma versión del compuesto que el 46 de Xiaomi MiMo-V2.6-Pro. Las cifras de DeepSWE v1.1 para MiniMax M3 provienen de la entrada pública de la tabla de clasificación del 8 de junio de 2026. El movimiento de DeepSWE de 58,4 a 72,57, el gasto en aprendizaje por refuerzo de aproximadamente 2,62 millones de dólares para la ejecución Pro a lo largo de treinta pasos, y las cifras de SWE-Bench Pro, BrowseComp, SVG-Bench y Terminal-Bench para MiniMax M3 son todos reportados por el proveedor en los harness propios de los respectivos laboratorios y no han sido reproducidos de forma independiente. Las tarifas por token son los precios de lista de los propios proveedores.
