
Xiaomi MiMo-V2.6-Pro: una puntuación de 72.57 en DeepSWE, una ejecución que se detuvo y todavía sin fecha de lanzamiento
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro detuvo el 20 de septiembre su ejecución de aprendizaje por refuerzo retransmitida públicamente, con una puntuación de DeepSWE v1.1 de 72,57 que figuraba en el propio panel de Xiaomi — 1,4 puntos por debajo del 74 % que GPT-6 Astra, Gemini 3.8 Flash y Claude Opus 5 comparten en lo más alto de la misma tabla de clasificación. Xiaomi MiMo-V2.6-Flash, el modelo más pequeño entrenado junto a él, se detuvo el 19 de septiembre en 65,68. Ambas ejecuciones terminaron en el paso 30, y la factura combinada que Xiaomi publicó junto a ellas indicaba $3.474.715 cuando capturamos la página esta mañana.
Esa es toda la buena noticia, y es genuinamente buena. El resto de la historia es una brecha entre un número y un producto. Ni Xiaomi MiMo-V2.6-Pro ni Xiaomi MiMo-V2.6-Flash tienen fecha de lanzamiento, ficha del modelo, identificador de API, precio publicado ni un conjunto de pesos descargables. No hay ningún endpoint al que llamar. Lo que existe es un panel de entrenamiento que cualquiera puede ver, una cifra de benchmark que produjo el propio harness de Xiaomi, y una comunidad que ha pasado seis días leyendo una página de telemetría como la gente solía leer las hojas de té.
Así que esto es un artículo de lo que sabemos hasta ahora, y su versión honesta separa tres cosas que la cobertura de la última semana ha estado mezclando sin decirlo: lo que Xiaomi ha declarado públicamente, lo que un único observador informó al respecto, y lo que todo ello significa para quien elige un modelo de programación hoy.
Lo que Xiaomi realmente publicó en línea
El 16 de septiembre, el equipo de MiMo, liderado por Luo Fuli, abrió una página en vivo en el dominio propio de Xiaomi que mostraba en tiempo real el post-entrenamiento de dos modelos no lanzados: recuentos de pasos, curvas de recompensa, rendimiento de tokens, recuentos de sandbox, avisos de fallos de GPU y un contador de costes que sube mientras lo miras. El enfoque de Xiaomi, según la cobertura, es que dedicó aproximadamente seis meses a trabajar en una sola pregunta —hasta dónde se puede escalar el aprendizaje por refuerzo— y decidió llevar a cabo ese experimento en público en lugar de anunciar un resultado.
El panel es inusualmente sincero para ser un artefacto de proveedor. Enumera sus propios fallos en un feed de avisos: un reinicio de Pro en el paso 17 causado por un fallo de memoria insuficiente de la GPU debido a un desequilibrio de carga de expertos, que el equipo dice haber solucionado ajustando su estrategia de paralelismo de entrenamiento; un fallo de conectividad de red entre el clúster de entrenamiento de Pro y el despliegue de evaluación que obligó a un reinicio y a la decisión de excluir el conjunto de datos de ciberseguridad de la próxima ejecución de Pro tras "patrones incorrectos en los registros de despliegue"; un reinicio de Flash desde el paso 15 después de que una clase de error de infraestructura pasara desapercibida durante unas tres horas; y un reinicio de Pro por un fallo de VRAM en un solo nodo. También señala que las tareas juzgadas como "relativamente fáciles para el modelo pro actual" se filtraron, una admisión que la mayoría de los informes posteriores al entrenamiento dejan sin decir.

Las dos tarjetas de ejecución son la parte que importa para cualquiera que haga seguimiento de los tiempos. Ambos modelos están etiquetados como detenidos: MiMo-V2.6-Pro tras 5 días y 7 horas de tiempo real, MiMo-V2.6-Flash tras 3 días y 11 horas, cada uno en el paso 30, el 20 y el 19 de septiembre, respectivamente. Pro consumió 75B tokens y 753k muestras por su $2.62M; Flash consumió 81.4B tokens por $854k. Cada paso extrae un lote de 1.568 prompts con 16 rollouts por prompt — 25.088 trayectorias por paso, ejecutadas de forma totalmente asíncrona.
Vale la pena decirlo con claridad: Xiaomi no ha dicho si «detenido» significa que la ejecución terminó, está en pausa o quedó en un punto de control. Una tarjeta detenida no es un aviso de finalización, y nadie fuera del equipo sabe cuál de esas cosas es.
Qué está confirmado, y qué no
El 72,57 no es un rumor. Está impreso en el panel de Xiaomi, en un gráfico etiquetado DeepSWE v1.1, mini-swe-agent, avg@3, junto a la curva naranja de la ejecución Pro. El 65,68 del modelo Flash aparece en el mismo gráfico. La cifra también aparece —como 62,24 y, más tarde, 65,97— en capturas anteriores del mismo panel, lo que da forma a la curva: un ascenso sostenido a lo largo de 30 pasos en lugar de una única evaluación afortunada.
Lo que es únicamente reportado es el punto de partida. La afirmación que circula en X el 21 de septiembre, desde la cuenta @nrehiew_, es que el modelo Pro pasó «de 58.41 a 72.57» en DeepSWE y que las ejecuciones se han completado. El punto final coincide exactamente con el panel del proveedor. La línea base de 58.41 es la lectura de esa cuenta de dónde comienza la curva —el punto Pro más a la izquierda del gráfico sí se sitúa en los 50 altos—, y Xiaomi no ha publicado una cifra del paso 1. La afirmación de finalización es asimismo una interpretación de dos tarjetas marcadas como detenidas, lo cual es una lectura razonable y no una declaración de Xiaomi. Considera la mejora de 14 puntos como direccionalmente sólida y numéricamente aproximada.

Hay una distinción más que la cobertura ha omitido, y es la que determina cuánto vale la cifra. Los paneles de benchmark del panel de control son evaluaciones de la propia Xiaomi: la empresa ejecutó el arnés sobre sus propios checkpoints y publicó los resultados. El arnés es el mismo que usa la tabla de clasificación pública —mini-swe-agent, DeepSWE v1.1—, lo que hace que la cifra sea más comparable de lo que sería un benchmark casero de un proveedor. Pero una evaluación autoejecutada no es una entrada en la tabla de clasificación, y 72.57 no aparece en la tabla de Datacurve, porque nadie la ha enviado.
El techo del 74% es más ajustado de lo que sugiere el titular
Lo que pone la comparación en el foco. La tabla de clasificación DeepSWE v1.1 de Datacurve, actualizada por última vez el 3 de septiembre de 2026, enumera 113 tareas en 91 repositorios en cinco lenguajes, y sus tres mejores configuraciones están empatadas con un 74% de Pass@1: GPT-6 Astra con esfuerzo de razonamiento xhigh, Gemini 3.8 Flash con high, y Claude Opus 5 con max. Los números que están junto a esas puntuaciones son los interesantes.
• Confianza — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. En la misma tabla, GPT-5.6 Sol se sitúa en 73 % ±3 y GLM-5.3 y Kimi K3 en 69 %. Los intervalos se superponen bastante más allá del segundo decimal.
• Coste por tarea: Gemini 3.8 Flash promedia $2,36; GPT-6 Astra, $6,52; Claude Opus 5, $11,84. El propio gráfico de la tabla de clasificación señala a Gemini 3.8 Flash como la configuración más eficiente del tablero, y la diferencia entre esos tres es de aproximadamente cinco a uno para una tasa de aciertos que el benchmark no puede distinguir.
• Pasos — Gemini 3.8 Flash necesitó en promedio 166 pasos de agente por tarea, Claude Opus 5, 99, GPT-6 Astra, 29. La puntuación empatada oculta tres estilos de trabajo muy distintos, y el más barato es el que más trabaja.

Así que cuando el 72.57 reportado se describe como "acercándose a lo más alto de la tabla", la versión precisa es más acotada y menos dramática. Está a alrededor de un punto y medio de un empate a tres cuyos miembros las propias barras de error del benchmark no permiten distinguir entre sí. Es un resultado sólido para un modelo que aún está en postentrenamiento, producido por el proveedor y no por los mantenedores del benchmark, en una tabla a la que el modelo no se ha enviado. La última actualización de la clasificación es completamente anterior a la ejecución de Xiaomi, por lo que todavía no aparece nada de MiMo en ella.
Por qué Xiaomi entrena en público
La transparencia no es casual. El último lanzamiento de pesos abiertos de Xiaomi fue Xiaomi MiMo-V2.5 y Xiaomi MiMo-V2.5-Pro a finales de abril, ambos bajo la licencia MIT: de uso comercial, ajustables y redistribuibles. MiMo-V2.5-Pro es un modelo de mezcla de expertos de 1,02 billones de parámetros con 42B de parámetros activos, una arquitectura de atención híbrida y una ventana de contexto de 1M de tokens, y su material de lanzamiento dejó explícitas las afirmaciones sobre capacidades agénticas: un compilador escrito desde cero en Rust a lo largo de cientos de llamadas a herramientas, una aplicación de escritorio de ocho mil líneas construida durante once horas de trabajo de agentes.
Transmitir en streaming el post-entrenamiento de la próxima generación es un tipo distinto de afirmación. Un laboratorio que publica sus curvas de recompensa, sus recuentos de sandbox y sus fallos de GPU en tiempo real está pidiendo que se le juzgue por el proceso y no por una presentación de lanzamiento, y está señalando un cronograma. Luo Fuli ha dicho que los detalles técnicos del trabajo de RL se publicarán como código abierto pieza por pieza durante las próximas semanas. Eso es lo más parecido a un calendario que ha ofrecido alguien: primero la metodología, después el modelo.
También encaja con un patrón que Xiaomi ha usado antes: un modelo aparece en público bajo otro nombre antes de que la empresa lo reclame como suyo. La empresa tiene por costumbre entrenar en silencio, probar en público y luego lanzar con pesos.
Lo que puedes ejecutar hoy
Nada en la familia MiMo-V2.6. Si quieres un modelo Xiaomi MiMo ahora mismo, lo que existe es la generación V2.5 — pesos abiertos a través de los canales propios de Xiaomi y varias plataformas de terceros, con tarjetas publicadas y precios. No hay ninguna API de MiMo-V2.6, ningún identificador de modelo y ninguna lista de precios, y cualquier página que cite un identificador MiMo-V2.6 o una tarifa por token está rellenando un espacio en blanco que Xiaomi ha dejado vacío. Las cadenas `mimo-v2.6-pro` y `mimo-v2.6-flash` del panel son nombres de trabajos de entrenamiento, no endpoints publicados.
La otra consecuencia práctica es qué hacer mientras tanto. Si la razón por la que MiMo-V2.6-Pro te resulta interesante es que podría ser una forma más barata de alcanzar un rendimiento de nivel frontera en programación, las configuraciones con las que se lo está midiendo ya se pueden invocar, y la tabla de clasificación dice que la opción barata es competitiva: Gemini 3.8 Flash iguala la mejor tasa de aprobación con $2.36 por tarea y está señalada como la configuración más eficiente del tablero. Gemini 3.8 Flash, Claude Opus 5 y GPT-6 Astra son accesibles a través de una sola clave de API de OrcaRouter al precio de lista del proveedor, con un 0% de margen trasladado —así que un cambio de precio de un proveedor se refleja de nuestro lado el mismo día y no en el siguiente ciclo de facturación— con la conmutación por error configurada por modelo en lugar de por proveedor. Y cuando un laboratorio abre un modelo como este, enrutarlo detrás de la misma clave es la forma de evaluarlo con el menor compromiso: puedes ponerlo delante de tráfico real sin apostar una ruta de producción a un checkpoint que nadie ha caracterizado.
¿Qué cambiaría realmente esta historia?
Cuatro señales, más o menos en orden de cuánto resolverían:
• Pesos en Hugging Face bajo una licencia declarada, que es como llegó la generación V2.5 y la evidencia más sólida de que la ejecución de RL produjo un modelo listo para distribuir en lugar de un experimento que llegó a su fin.
• Una ficha de modelo con recuento de parámetros, longitud de contexto y arquitectura — ninguno de los números de V2.6 es público, y el panel no los muestra. Suponer que V2.6-Pro hereda la forma 1.02T/42B de V2.5-Pro sería una conjetura.
• Un identificador de API y una hoja de precios, que es el momento en que la cifra de DeepSWE se convierte en una decisión de compra en lugar de un deporte de espectadores.
• Un envío al tablero DeepSWE de Datacurve, que pondría a MiMo-V2.6-Pro en la misma tabla y bajo las mismas barras de error que los modelos con los que se compara. Una evaluación ejecutada por el proveedor y un envío a una tabla de clasificación no son la misma afirmación, y la diferencia entre ambos es exactamente una fila de esa tabla.
Hasta entonces, el resumen honesto es que Xiaomi ha mostrado la ejecución de post-entrenamiento más transparente que haya publicado cualquier laboratorio importante, en dos modelos que no ha lanzado, con una cifra de benchmark autodeclarada que queda cerca —pero no llega— a lo más alto de la tabla. La descripción de la metodología se promete para las próximas semanas. La fecha de lanzamiento no se promete en absoluto.
