Tarjeta destacada del radar de modelos de OrcaRouter para Xiaomi MiMo-V2.6-Pro, con el nombre del modelo como título y la línea «Pesos abiertos, 46 en el índice, $0.43 / $0.87», con dos paneles etiquetados «Lo que se lanzó» y «Lo que cuesta».
Guides & Insights

Xiaomi MiMo-V2.6-Pro encabeza el Índice de Pesos Abiertos con 46 — y publica la factura del entrenamiento

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Xiaomi MiMo-V2.6-Pro es ahora el modelo de pesos abiertos mejor clasificado del Artificial Analysis Intelligence Index, con 46 en la v4.3.2 — un punto por delante de GLM-5.3 y dos por delante de Kimi K3, y veinte puntos por encima de los 26 que registró su predecesor MiMo-V2.5-Pro en la escala anterior del índice. Ese número lo produjo Artificial Analysis ejecutando su propio sistema de evaluación, no Xiaomi, y es el dato más útil de este lanzamiento. El segundo dato más útil es el precio impreso junto a él: 0,43 $ por millón de tokens de entrada, 0,87 $ por millón de salida, frente a 5,00 $ y 25,00 $ de Claude Opus 5 — un modelo que se sitúa cinco puntos más arriba en el índice. El tercero es el que nadie esperaba que Xiaomi entregara: un desglose público de lo que costó realmente la ejecución de aprendizaje por refuerzo que produjo MiMo-V2.6-Pro.

La puntuación es una medición, no una afirmación.

Casi todo lo que se publica sobre el lanzamiento de un modelo chino llega como una cifra del proveedor, y los lectores han aprendido a descontarla. Este es diferente, y merece la pena ser precisos sobre la diferencia porque la cobertura del lanzamiento ya la ha difuminado.

Artificial Analysis evaluó el propio MiMo-V2.6-Pro, con el compuesto v4.3.2 — diez evaluaciones que abarcan razonamiento, conocimiento, matemáticas y programación, incluidas AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. El 46 es lo que devolvió esa batería. También registró las características operativas que determinan si un modelo es usable en lugar de ser meramente bueno: 134,3 tokens de salida por segundo, 2,15 segundos hasta el primer token, un descuento de caché del 99 % y un costo medido de 0,13 $ por tarea del Intelligence Index.

Dos de esos merecen énfasis. Los 134,3 tokens por segundo colocan a MiMo-V2.6-Pro en el undécimo puesto de 114 modelos por velocidad; para un modelo de mezcla de expertos de un billón de parámetros, eso es un resultado de servicio, no solo un resultado de entrenamiento. Y los $0,13 por tarea son la cifra que sobrevive al contacto con un presupuesto: es lo que realmente costó ejecutar el índice contra este modelo, medido de la misma manera en todos los modelos de la tabla, lo que lo hace comparable de una forma en que las tarifas por token destacadas no lo son.

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

Qué cubre el índice y qué no cubre

La corona de los pesos abiertos es real, pero más estrecha de lo que parece. Con 46, MiMo-V2.6-Pro lidera la categoría de pesos abiertos. No lidera el índice. Lo más alto de v4.3 es Claude Fable 5.1 con esfuerzo máximo y fallback predeterminado, y GPT-6 Astra con esfuerzo máximo, ambos con 53, con Claude Opus 5 con 51 y Claude Fable 5 con 50. Así que el planteamiento honesto es una brecha de cinco puntos con la frontera en un compuesto que premia la amplitud, y una mejora de veinte puntos respecto a la propia generación anterior de Xiaomi.

• Líder en pesos abiertos — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44

• Lo más alto del mismo índice — Claude Fable 5.1 (máx., alternativa) 53, GPT-6 Astra (máx.) 53, Claude Opus 5 (máx.) 51

• Velocidad — 134,3 tokens de salida por segundo, en el puesto 11 de 114 modelos medidos; la mediana para la categoría de tamaño es 77,9

• Tiempo hasta el primer token — 2,15 segundos, frente a una mediana de 2,34 segundos

• Coste por tarea del Intelligence Index: $0,13, con un coste de $206,66 por ejecutar la evaluación completa.

• Tarifa publicada: $0.43 por millón de tokens de entrada, $0.87 por millón de salida, un descuento de caché del 99 % y una tarifa combinada de $0.18 con una proporción de 7:2:1 de aciertos de caché/entrada/salida

Un número en la página de Artificial Analysis es una auténtica salvedad en lugar de un alarde: contabilizaba un único proveedor de API para MiMo-V2.6-Pro en el momento de escribir esto. Ese es el cuello de botella práctico para este modelo ahora mismo, y no es un problema de calidad —es uno de disponibilidad. Un modelo accesible a través de una sola ruta no tiene failover. Si esa ruta se degrada, tu aplicación se degrada con ella, y la historia del failover es exactamente aquello para lo que existe un enrutador. La observación relevante para cualquiera que planifique en torno a este lanzamiento es que nosotros no alojamos MiMo-V2.6-Pro, y no vamos a pretender lo contrario; la ruta hacia él hoy es la propia plataforma de Xiaomi y el puñado de catálogos de terceros que lo incluyen.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

Los dos números que no deben mezclarse

Xiaomi también publicó sus propias cifras de referencia, y son un tipo de objeto distinto del 46. El panel de la compañía informa que MiMo-V2.6-Pro pasa de 58.4 a 72.57 en DeepSWE v1.1 a lo largo de su ejecución de aprendizaje por refuerzo, evaluado con mini-swe-agent con promedio de tres. Ese es el arnés de Xiaomi, el evaluador de Xiaomi, la ejecución offline de Xiaomi. No se ha enviado a la tabla de clasificación pública de DeepSWE y nadie lo ha reproducido.

Lea los dos en paralelo y la tentación es tratar 72.57 como una puntuación a la par con el 74% que la tabla pública DeepSWE lista en el nivel más alto. No están en la misma escala. La cifra de la tabla de clasificación es una configuración enviada, Pass@1, con un intervalo de confianza publicado y un costo promedio por tarea; la cifra del proveedor es una evaluación interna sin nada de eso adjunto. Nuestro propio artículo del 21 de septiembre señaló esto cuando los números todavía eran lecturas del panel, y sigue siendo válido ahora que los pesos se han publicado. Un arnés de proveedor puede ser totalmente honesto y aun así no ser una entrada de la tabla de clasificación, porque la entrada de la tabla de clasificación es una afirmación sobre una configuración específica bajo condiciones específicas que un tercero puede volver a ejecutar.

La misma disciplina se aplica al gasto en entrenamiento. Xiaomi reporta aproximadamente $3,474,715 entre las ejecuciones Pro y Flash —$2,620,670 para Pro, $854,044 para Flash—, con más de treinta pasos de aprendizaje por refuerzo cada una y alrededor de 750,000 trayectorias por ejecución, completadas en menos de seis días. Esas son las cifras de contabilidad de cómputo de la propia empresa. Son interesantes porque los laboratorios casi nunca las publican, y no son un precio de API, ni un costo que vayas a pagar, ni una cifra que haya auditado ningún tercero.

Lo que Xiaomi realmente lanzó

El lanzamiento es un modelo de mezcla de expertos dispersa de 1,02 billones de parámetros totales con 42 mil millones activados por token, una ventana de contexto de 1M de tokens y multimodalidad nativa en texto, imagen, video y audio. Su hermano Xiaomi MiMo-V2.6-Flash es la misma arquitectura a menor escala: 309 mil millones en total y 15 mil millones activos. Los pesos publicados llevan una etiqueta de licencia MIT, y el paquete de lanzamiento incluye un informe técnico, instrucciones de despliegue y —según Xiaomi— los entornos de entrenamiento de aprendizaje por refuerzo y el código necesarios para examinar y reproducir el postentrenamiento.

Ese último elemento es la diferencia sustancial entre este lanzamiento y un anuncio típico de API, y vale la pena separarlo del marketing. Publicar el entorno de RL es una afirmación de que la configuración de entrenamiento es examinable. Que los entornos publicados sean suficientes para reproducir un 72.57 es una cuestión aparte que resolverán quienes lo intenten, no las notas de la versión. Las propias notas de entrenamiento de Xiaomi describen una ejecución que mezcló tareas de coding, de agente general, visuales y de ciberseguridad en una sola pasada, con evaluadores que clasifican las trayectorias exitosas y redistribuyen la recompensa hacia mejores rutas — y también registran fallos: un reinicio por falta de memoria de la GPU provocado por el desequilibrio de carga de expertos, una falla de red entre el clúster de entrenamiento y el despliegue del evaluador, y un reinicio de Flash tras un error de infraestructura que pasó desapercibido durante aproximadamente tres horas. Publicar los fallos junto con los logros es la parte que hace creíble el resto de la divulgación.

Lo que cuesta llamar, y dónde se sitúa la cuestión del enrutamiento.

A $0,43 y $0,87 por millón de tokens, MiMo-V2.6-Pro tiene un precio propio de un modelo de gama media y sus benchmarks corresponden a los de un modelo de pesos abiertos de frontera. Xiaomi mantuvo el precio estándar de la generación anterior, MiMo-V2.5, en lugar de subir el precio del nuevo checkpoint, y por eso la tarifa parece baja en relación con el número de parámetros. Un descuento de caché del 99 % significa que un bucle de agente con uso intensivo de caché lee su contexto por prácticamente nada, y ahí es donde realmente se acumula la factura de un agente de horizonte largo.

Hay una versión de esta operación que se enruta de forma limpia y una versión que no. La versión que sí lo hace: los modelos de frontera contra los que compararías MiMo-V2.6-Pro — Claude Opus 5 a $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — son todos accesibles a través de una sola clave de OrcaRouter al precio de lista del proveedor con 0% de margen, así que un recorte de precio de un proveedor en cualquiera de ellos está activo de nuestro lado el mismo día, y una regla de enrutamiento puede enviar una solicitud a un segundo modelo cuando el primero esté lento o no esté disponible. Eso importa más de lo habitual aquí, porque el modelo con la mejor puntuación de pesos abiertos es también el que tiene la ruta más delgada hacia él. Combinar ambos — un carril barato de pesos abiertos para trabajo en volumen y un carril de frontera para la cola difícil — es una decisión de enrutamiento, y es el tipo de decisión que deja de ser una apuesta en el momento en que ambos carriles están en la misma clave.

Un producto más que conviene tener claro, porque es fácil confundirlo con el modelo: Xiaomi también ofrece MiMo-V2.6-Pro-UltraSpeed, un nivel de servicio alojado construido a partir del mismo checkpoint. El propio material de Xiaomi afirma hasta veinte veces la velocidad de salida del servicio Pro estándar con la misma calidad; los listados de catálogos de terceros describen aproximadamente diez veces. Esos son dos números diferentes que describen el mismo nivel, nadie ha publicado distribuciones de latencia por solicitud que los concilien, y el nivel conlleva una tarifa materialmente más alta. Nada en UltraSpeed cambia lo que pueden hacer los pesos; cambia la velocidad a la que los ejecutarán los servidores de otra persona.

¿Qué cambiaría esta imagen?

Tres cosas, en orden de cuánto importarían.

Una segunda y una tercera ruta de servicio. El recuento de un solo proveedor en Artificial Analysis es la restricción para todo lo demás. Más rutas significan conmutación por error, significan competencia de precios en la capa de servicio y significan que el modelo puede ponerse en una ruta de producción en lugar de un experimento.

Reproducción independiente de las cifras de DeepSWE. El 46 ya es independiente; el 72.57 no. Si las ejecuciones externas se acercan a esa cifra, el argumento a favor del modelo se refuerza considerablemente. Si quedan sustancialmente por debajo, el número de Artificial Analysis sigue siendo el que merece confianza y la cifra del proveedor se suma a la larga lista de afirmaciones de lanzamiento que no sobrevivieron al contacto.

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

Desgloses por evaluación. El compuesto es un compuesto. Cuáles de las diez evaluaciones gana MiMo-V2.6-Pro y cuáles pierde es la diferencia entre un modelo que despliegas para codificación agéntica y uno que despliegas para responder preguntas con uso intensivo de recuperación, y el índice por sí solo no te lo dice. Ese detalle es lo que hay que observar a continuación, y es lo que necesita una configuración de enrutamiento antes de que valga la pena anotarla.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario