Tarjeta de título principal del artículo «Xiaomi MiMo-V2.6-Pro: 72.57 en DeepSWE», encabezada por el antetítulo «OrcaRouter · radar de modelos — sin lanzar», con el subtítulo «Una ejecución que se detuvo, un modelo que no se ha lanzado — lo que está confirmado y lo que no». Debajo, dos tarjetas: a la izquierda, «En el propio panel de Xiaomi», que dice «DeepSWE v1.1: 72.57 — ejecución detenida en el paso 30, 20 sep»; a la derecha, «Aún sin publicar», que dice «Sin ficha de modelo, sin ID de API, sin precio, sin pesos». Cuatro etiquetas dicen «Hermano Flash: 65.68», «Gasto total: $3,474,715», «Lo más alto de la tabla: 74 %» y «Evaluación ejecutada por el proveedor, no enviada». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: una puntuación de 72.57 en DeepSWE, una ejecución que se detuvo y todavía sin fecha de lanzamiento

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Xiaomi MiMo-V2.6-Pro detuvo el 20 de septiembre su ejecución de aprendizaje por refuerzo retransmitida públicamente, con una puntuación de DeepSWE v1.1 de 72,57 que figuraba en el propio panel de Xiaomi — 1,4 puntos por debajo del 74 % que GPT-6 Astra, Gemini 3.8 Flash y Claude Opus 5 comparten en lo más alto de la misma tabla de clasificación. Xiaomi MiMo-V2.6-Flash, el modelo más pequeño entrenado junto a él, se detuvo el 19 de septiembre en 65,68. Ambas ejecuciones terminaron en el paso 30, y la factura combinada que Xiaomi publicó junto a ellas indicaba $3.474.715 cuando capturamos la página esta mañana.

Esa es toda la buena noticia, y es genuinamente buena. El resto de la historia es una brecha entre un número y un producto. Ni Xiaomi MiMo-V2.6-Pro ni Xiaomi MiMo-V2.6-Flash tienen fecha de lanzamiento, ficha del modelo, identificador de API, precio publicado ni un conjunto de pesos descargables. No hay ningún endpoint al que llamar. Lo que existe es un panel de entrenamiento que cualquiera puede ver, una cifra de benchmark que produjo el propio harness de Xiaomi, y una comunidad que ha pasado seis días leyendo una página de telemetría como la gente solía leer las hojas de té.

Así que esto es un artículo de lo que sabemos hasta ahora, y su versión honesta separa tres cosas que la cobertura de la última semana ha estado mezclando sin decirlo: lo que Xiaomi ha declarado públicamente, lo que un único observador informó al respecto, y lo que todo ello significa para quien elige un modelo de programación hoy.

Lo que Xiaomi realmente publicó en línea

El 16 de septiembre, el equipo de MiMo, liderado por Luo Fuli, abrió una página en vivo en el dominio propio de Xiaomi que mostraba en tiempo real el post-entrenamiento de dos modelos no lanzados: recuentos de pasos, curvas de recompensa, rendimiento de tokens, recuentos de sandbox, avisos de fallos de GPU y un contador de costes que sube mientras lo miras. El enfoque de Xiaomi, según la cobertura, es que dedicó aproximadamente seis meses a trabajar en una sola pregunta —hasta dónde se puede escalar el aprendizaje por refuerzo— y decidió llevar a cabo ese experimento en público en lugar de anunciar un resultado.

El panel es inusualmente sincero para ser un artefacto de proveedor. Enumera sus propios fallos en un feed de avisos: un reinicio de Pro en el paso 17 causado por un fallo de memoria insuficiente de la GPU debido a un desequilibrio de carga de expertos, que el equipo dice haber solucionado ajustando su estrategia de paralelismo de entrenamiento; un fallo de conectividad de red entre el clúster de entrenamiento de Pro y el despliegue de evaluación que obligó a un reinicio y a la decisión de excluir el conjunto de datos de ciberseguridad de la próxima ejecución de Pro tras "patrones incorrectos en los registros de despliegue"; un reinicio de Flash desde el paso 15 después de que una clase de error de infraestructura pasara desapercibida durante unas tres horas; y un reinicio de Pro por un fallo de VRAM en un solo nodo. También señala que las tareas juzgadas como "relativamente fáciles para el modelo pro actual" se filtraron, una admisión que la mayoría de los informes posteriores al entrenamiento dejan sin decir.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

Las dos tarjetas de ejecución son la parte que importa para cualquiera que haga seguimiento de los tiempos. Ambos modelos están etiquetados como detenidos: MiMo-V2.6-Pro tras 5 días y 7 horas de tiempo real, MiMo-V2.6-Flash tras 3 días y 11 horas, cada uno en el paso 30, el 20 y el 19 de septiembre, respectivamente. Pro consumió 75B tokens y 753k muestras por su $2.62M; Flash consumió 81.4B tokens por $854k. Cada paso extrae un lote de 1.568 prompts con 16 rollouts por prompt — 25.088 trayectorias por paso, ejecutadas de forma totalmente asíncrona.

Vale la pena decirlo con claridad: Xiaomi no ha dicho si «detenido» significa que la ejecución terminó, está en pausa o quedó en un punto de control. Una tarjeta detenida no es un aviso de finalización, y nadie fuera del equipo sabe cuál de esas cosas es.

Qué está confirmado, y qué no

El 72,57 no es un rumor. Está impreso en el panel de Xiaomi, en un gráfico etiquetado DeepSWE v1.1, mini-swe-agent, avg@3, junto a la curva naranja de la ejecución Pro. El 65,68 del modelo Flash aparece en el mismo gráfico. La cifra también aparece —como 62,24 y, más tarde, 65,97— en capturas anteriores del mismo panel, lo que da forma a la curva: un ascenso sostenido a lo largo de 30 pasos en lugar de una única evaluación afortunada.

Lo que es únicamente reportado es el punto de partida. La afirmación que circula en X el 21 de septiembre, desde la cuenta @nrehiew_, es que el modelo Pro pasó «de 58.41 a 72.57» en DeepSWE y que las ejecuciones se han completado. El punto final coincide exactamente con el panel del proveedor. La línea base de 58.41 es la lectura de esa cuenta de dónde comienza la curva —el punto Pro más a la izquierda del gráfico sí se sitúa en los 50 altos—, y Xiaomi no ha publicado una cifra del paso 1. La afirmación de finalización es asimismo una interpretación de dos tarjetas marcadas como detenidas, lo cual es una lectura razonable y no una declaración de Xiaomi. Considera la mejora de 14 puntos como direccionalmente sólida y numéricamente aproximada.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

Hay una distinción más que la cobertura ha omitido, y es la que determina cuánto vale la cifra. Los paneles de benchmark del panel de control son evaluaciones de la propia Xiaomi: la empresa ejecutó el arnés sobre sus propios checkpoints y publicó los resultados. El arnés es el mismo que usa la tabla de clasificación pública —mini-swe-agent, DeepSWE v1.1—, lo que hace que la cifra sea más comparable de lo que sería un benchmark casero de un proveedor. Pero una evaluación autoejecutada no es una entrada en la tabla de clasificación, y 72.57 no aparece en la tabla de Datacurve, porque nadie la ha enviado.

El techo del 74% es más ajustado de lo que sugiere el titular

Lo que pone la comparación en el foco. La tabla de clasificación DeepSWE v1.1 de Datacurve, actualizada por última vez el 3 de septiembre de 2026, enumera 113 tareas en 91 repositorios en cinco lenguajes, y sus tres mejores configuraciones están empatadas con un 74% de Pass@1: GPT-6 Astra con esfuerzo de razonamiento xhigh, Gemini 3.8 Flash con high, y Claude Opus 5 con max. Los números que están junto a esas puntuaciones son los interesantes.

• Confianza — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. En la misma tabla, GPT-5.6 Sol se sitúa en 73 % ±3 y GLM-5.3 y Kimi K3 en 69 %. Los intervalos se superponen bastante más allá del segundo decimal.

• Coste por tarea: Gemini 3.8 Flash promedia $2,36; GPT-6 Astra, $6,52; Claude Opus 5, $11,84. El propio gráfico de la tabla de clasificación señala a Gemini 3.8 Flash como la configuración más eficiente del tablero, y la diferencia entre esos tres es de aproximadamente cinco a uno para una tasa de aciertos que el benchmark no puede distinguir.

• Pasos — Gemini 3.8 Flash necesitó en promedio 166 pasos de agente por tarea, Claude Opus 5, 99, GPT-6 Astra, 29. La puntuación empatada oculta tres estilos de trabajo muy distintos, y el más barato es el que más trabaja.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Así que cuando el 72.57 reportado se describe como "acercándose a lo más alto de la tabla", la versión precisa es más acotada y menos dramática. Está a alrededor de un punto y medio de un empate a tres cuyos miembros las propias barras de error del benchmark no permiten distinguir entre sí. Es un resultado sólido para un modelo que aún está en postentrenamiento, producido por el proveedor y no por los mantenedores del benchmark, en una tabla a la que el modelo no se ha enviado. La última actualización de la clasificación es completamente anterior a la ejecución de Xiaomi, por lo que todavía no aparece nada de MiMo en ella.

Por qué Xiaomi entrena en público

La transparencia no es casual. El último lanzamiento de pesos abiertos de Xiaomi fue Xiaomi MiMo-V2.5 y Xiaomi MiMo-V2.5-Pro a finales de abril, ambos bajo la licencia MIT: de uso comercial, ajustables y redistribuibles. MiMo-V2.5-Pro es un modelo de mezcla de expertos de 1,02 billones de parámetros con 42B de parámetros activos, una arquitectura de atención híbrida y una ventana de contexto de 1M de tokens, y su material de lanzamiento dejó explícitas las afirmaciones sobre capacidades agénticas: un compilador escrito desde cero en Rust a lo largo de cientos de llamadas a herramientas, una aplicación de escritorio de ocho mil líneas construida durante once horas de trabajo de agentes.

Transmitir en streaming el post-entrenamiento de la próxima generación es un tipo distinto de afirmación. Un laboratorio que publica sus curvas de recompensa, sus recuentos de sandbox y sus fallos de GPU en tiempo real está pidiendo que se le juzgue por el proceso y no por una presentación de lanzamiento, y está señalando un cronograma. Luo Fuli ha dicho que los detalles técnicos del trabajo de RL se publicarán como código abierto pieza por pieza durante las próximas semanas. Eso es lo más parecido a un calendario que ha ofrecido alguien: primero la metodología, después el modelo.

También encaja con un patrón que Xiaomi ha usado antes: un modelo aparece en público bajo otro nombre antes de que la empresa lo reclame como suyo. La empresa tiene por costumbre entrenar en silencio, probar en público y luego lanzar con pesos.

Lo que puedes ejecutar hoy

Nada en la familia MiMo-V2.6. Si quieres un modelo Xiaomi MiMo ahora mismo, lo que existe es la generación V2.5 — pesos abiertos a través de los canales propios de Xiaomi y varias plataformas de terceros, con tarjetas publicadas y precios. No hay ninguna API de MiMo-V2.6, ningún identificador de modelo y ninguna lista de precios, y cualquier página que cite un identificador MiMo-V2.6 o una tarifa por token está rellenando un espacio en blanco que Xiaomi ha dejado vacío. Las cadenas `mimo-v2.6-pro` y `mimo-v2.6-flash` del panel son nombres de trabajos de entrenamiento, no endpoints publicados.

La otra consecuencia práctica es qué hacer mientras tanto. Si la razón por la que MiMo-V2.6-Pro te resulta interesante es que podría ser una forma más barata de alcanzar un rendimiento de nivel frontera en programación, las configuraciones con las que se lo está midiendo ya se pueden invocar, y la tabla de clasificación dice que la opción barata es competitiva: Gemini 3.8 Flash iguala la mejor tasa de aprobación con $2.36 por tarea y está señalada como la configuración más eficiente del tablero. Gemini 3.8 Flash, Claude Opus 5 y GPT-6 Astra son accesibles a través de una sola clave de API de OrcaRouter al precio de lista del proveedor, con un 0% de margen trasladado —así que un cambio de precio de un proveedor se refleja de nuestro lado el mismo día y no en el siguiente ciclo de facturación— con la conmutación por error configurada por modelo en lugar de por proveedor. Y cuando un laboratorio abre un modelo como este, enrutarlo detrás de la misma clave es la forma de evaluarlo con el menor compromiso: puedes ponerlo delante de tráfico real sin apostar una ruta de producción a un checkpoint que nadie ha caracterizado.

¿Qué cambiaría realmente esta historia?

Cuatro señales, más o menos en orden de cuánto resolverían:

• Pesos en Hugging Face bajo una licencia declarada, que es como llegó la generación V2.5 y la evidencia más sólida de que la ejecución de RL produjo un modelo listo para distribuir en lugar de un experimento que llegó a su fin.

• Una ficha de modelo con recuento de parámetros, longitud de contexto y arquitectura — ninguno de los números de V2.6 es público, y el panel no los muestra. Suponer que V2.6-Pro hereda la forma 1.02T/42B de V2.5-Pro sería una conjetura.

• Un identificador de API y una hoja de precios, que es el momento en que la cifra de DeepSWE se convierte en una decisión de compra en lugar de un deporte de espectadores.

• Un envío al tablero DeepSWE de Datacurve, que pondría a MiMo-V2.6-Pro en la misma tabla y bajo las mismas barras de error que los modelos con los que se compara. Una evaluación ejecutada por el proveedor y un envío a una tabla de clasificación no son la misma afirmación, y la diferencia entre ambos es exactamente una fila de esa tabla.

Hasta entonces, el resumen honesto es que Xiaomi ha mostrado la ejecución de post-entrenamiento más transparente que haya publicado cualquier laboratorio importante, en dos modelos que no ha lanzado, con una cifra de benchmark autodeclarada que queda cerca —pero no llega— a lo más alto de la tabla. La descripción de la metodología se promete para las próximas semanas. La fecha de lanzamiento no se promete en absoluto.