
MiMo-V2.6-Pro vs Grok 4.6: Ambos proveedores publicaron cifras de DeepSWE, y ninguno está en la tabla
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dos proveedores, un benchmark, dos cifras que no se pueden restar. El material de lanzamiento de SpaceXAI para Grok 4.6 reporta 65,9 % en DeepSWE v1.1. El material de Xiaomi para MiMo-V2.6-Pro reporta 72,57 en DeepSWE v1.1. Leídos juntos, sugieren que el modelo de pesos abiertos más barato supera al modelo propietario de frontera por casi siete puntos. Leídos con atención, no dicen casi nada, porque uno es un porcentaje de presentación de lanzamiento obtenido con el arnés propio del proveedor y el otro es un promedio de tres de una ejecución de aprendizaje por refuerzo con el evaluador propio de Xiaomi, y ninguno se ha enviado al tablero público de DeepSWE. La comparación entre MiMo-V2.6-Pro y Grok 4.6 que resiste el escrutinio está en el índice independiente, y allí la respuesta es la contraria a las cifras de los proveedores: 46 frente a 44, a favor de Xiaomi, por dos puntos.
Grok 4.6 se lanzó el 12 de agosto de 2026 por SpaceXAI y es el titular aquí — un modelo de frontera ya lanzado y ampliamente servido, con una lista de precios documentada y meses de medición independiente a sus espaldas. Xiaomi MiMo-V2.6-Pro pasó a estar disponible de forma general el 22 de septiembre de 2026, con sus repositorios de puntos de control de aprendizaje por refuerzo apareciendo el día anterior, y es el recién llegado. Ambos son capaces de razonar, ambos están construidos para trabajo agéntico de larga duración, y la diferencia de precio entre ellos es lo suficientemente grande como para que la inexperiencia del recién llegado sea lo único que frena la comparación.
Lo que cada modelo realmente es
Grok 4.6 es propietario, acepta entrada de texto e imágenes y devuelve texto, y tiene una fecha de corte de conocimiento del 1 de febrero de 2026. Su ventana de contexto es de 500.000 tokens, que es la mitad del tamaño de la de sus principales competidores y la especificación más determinante de su ficha. Sus tarifas de lista son $2.00 por millón de tokens de entrada, $0.50 por millón de entrada en caché y $6.00 por millón de salida por debajo de 200,000 tokens de prompt, con un precipicio en ese límite: en o por encima de 200K las tarifas pasan a ser $4.00, $1.00 y $12.00, y el nivel superior factura toda la solicitud en lugar de la porción que supera la línea. El procesamiento prioritario duplica la tarifa estándar. Artificial Analysis midió 63.0 tokens de salida por segundo y 42.79 segundos hasta el primer token a máximo esfuerzo, y $2,351.83 para ejecutar el índice completo.
Xiaomi MiMo-V2.6-Pro es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42.000 millones activados por token, con una ventana de contexto de 1 millón de tokens y multimodalidad nativa en texto, imagen, video y audio. Tiene licencia MIT con pesos descargables, y Xiaomi mantuvo el precio de la generación anterior en lugar de subir el precio del nuevo checkpoint: 0,43 $ por millón de tokens de entrada y 0,87 $ por millón de salida, un descuento de caché del 99 % y un precio combinado de 0,18 $ con una proporción de aciertos de caché/entrada/salida de 7:2:1. Artificial Analysis midió 134,3 tokens de salida por segundo, 2,15 segundos hasta el primer token y 206,66 $ para ejecutar el índice: 0,13 $ por tarea.
• Pesos — MiMo-V2.6-Pro con licencia MIT y descargable; Grok 4.6 propietario, solo API
• Parámetros — MiMo-V2.6-Pro 1,02T en total / 42B activos; Grok 4.6 sin divulgar
• Contexto — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, con un salto brusco de precio a partir de 200K de entrada
• Modalidad — MiMo-V2.6-Pro acepta texto, imagen, video y audio; la superficie de entrada publicada de Grok 4.6 es texto e imagen
• Puntuación del índice — MiMo-V2.6-Pro 46; Grok 4.6 44, ambos Artificial Analysis v4.3.2
• Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; Grok 4.6 $2.00 / $6.00, duplicándose por encima de 200K de entrada
• Tarifa combinada — MiMo-V2.6-Pro $0.18 por 1M; Grok 4.6 $1.35
• Coste de ejecutar el índice — MiMo-V2.6-Pro $206,66; Grok 4.6 $2.351,83
• Velocidad — MiMo-V2.6-Pro 134,3 tokens de salida por segundo; Grok 4.6 63,0
• Tiempo hasta el primer token — MiMo-V2.6-Pro 2,15 segundos; Grok 4.6 42,79 segundos
• Fecha de corte de conocimiento — MiMo-V2.6-Pro no publicado; Grok 4.6, 1 de febrero de 2026

El benchmark que ejecutaron ambos proveedores, y por qué no admite comparación
DeepSWE v1.1 es una evaluación real, pública y de terceros de agentes de programación, realizada por Datacurve, y es la familia de tareas sobre la que ambas compañías decidieron publicar. Eso la vuelve tentadora. No debería usarse como una comparación directa, y la razón no es que alguno de los proveedores esté mintiendo, sino que las dos cifras describen mediciones diferentes del mismo nombre de tarea.
El 72,57 de Xiaomi es un promedio de tres en su propio entorno de evaluación con mini-swe-agent, producido durante una ejecución de aprendizaje por refuerzo en lugar de a partir de un candidato a versión congelado, y reportado junto con una cifra de partida de 58,4. La ejecución está documentada como de 30 pasos y unas 750.000 trayectorias por modelo, completada en menos de seis días con un gasto publicado de alrededor de 2,62 millones de dólares para el modelo Pro. No se ha enviado al tablero de Datacurve. El 65,9 % de SpaceXAI para Grok 4.6 es una cifra de la presentación de lanzamiento del propio conjunto de evaluación del proveedor, reportada junto a mejoras sobre Grok 4.5 de 11,9 puntos en el mismo benchmark; y el tablero público incluye una configuración enviada de Grok 4.6 con alrededor del 67 %, lo suficientemente cerca de la cifra del proveedor como para sugerir que el entorno de evaluación está al menos aproximadamente alineado. Eso no es cierto en el caso de la cifra de Xiaomi, que no tiene ninguna contraparte pública.
Entonces, la afirmación honesta es esta: en el tablero público, Grok 4.6 está presente y MiMo-V2.6-Pro está ausente. En el compuesto independiente, el mismo evaluador realmente ejecutó a ambos, y el modelo de Xiaomi lidera por dos puntos. Esos dos hechos no están en tensión. Simplemente miden cosas diferentes, y el segundo es el que hay que citar.
El contexto de 500K es la especificación que decide las cargas de trabajo reales
Medio millón de tokens es una ventana de contexto grande según cualquier estándar normal y pequeña para 2026. Los modelos con los que se agrupa a MiMo-V2.6-Pro se sitúan todos en 1M, y la consecuencia práctica aparece exactamente en las cargas de trabajo para las que se comercializa Grok 4.6. Un agente de programación de larga duración que mantiene un repositorio, una transcripción de herramientas y un plan acumulado superará los 200.000 tokens de prompt en una sesión, y en ese umbral, las tarifas de Grok 4.6 se duplican y se aplican de forma retroactiva a toda la solicitud. La misma sesión en MiMo-V2.6-Pro llega a un millón de tokens sin un cambio de tramo.
Eso es una diferencia de especificación y una diferencia de estructura de precios al mismo tiempo, y la segunda es fácil de pasar por alto al comparar las tarifas anunciadas. Una tarifa combinada de $1.35 para Grok 4.6 frente a $0.18 para MiMo-V2.6-Pro es una brecha de 7.5x. En un prompt que supera los 200K, se amplía a algo más cercano a 15x, porque la tarifa de Grok se duplica y la de Xiaomi no se mueve.
El contraargumento también está registrado, y merece estarlo. La tesis de lanzamiento de Grok 4.6 era la eficiencia de turnos en lugar del contexto bruto: en la evaluación agéntica en la que se midió frente a Claude Opus 5 en tareas idénticas, terminó en aproximadamente 53 turnos y unos 500 millones de tokens de entrada, frente a aproximadamente 103 turnos y dos mil millones de tokens del otro modelo, con un costo estimado de $0.84 por tarea —la cifra más baja entre los modelos frontera de esa comparación. Un modelo que recorre el bucle la mitad de veces no necesita tanto contexto, y no consume tantos tokens. Esa es una ventaja arquitectónica genuina, y es el argumento más fuerte a favor de Grok 4.6 frente a cualquier alternativa más barata por token, incluida esta.

Llegar a cada uno de ellos
Grok 4.6 está en OrcaRouter como grok/grok-4.6, accesible a través de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0% de recargo; por lo que un cambio de precio de SpaceXAI, incluido un cambio en ese límite de 200K, se aplica en nuestro lado el mismo día. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter. Ningún modelo de Xiaomi lo está, y la vía para acceder a él hoy es la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen. Decirlo con claridad es más útil que dejar que una página de modelo dé a entender lo contrario.
En la práctica, cuánto vale esa asimetría es cosa de un experimento barato. Grok 4.6 es el modelo por el que quizá ya estés pagando. MiMo-V2.6-Pro supone una mejora de dos puntos en el índice a una fracción del precio, se lanzó esta semana y solo tiene una ruta de servicio detrás. La pregunta que merece respuesta no es cuál es mejor en abstracto, sino cuánto de tu tráfico de Grok puede asumir el modelo de Xiaomi con tus propios prompts, y responderla abriendo un segundo contrato, una segunda clave y una segunda relación de facturación es la fricción que impide que se haga la prueba. Con un único endpoint y failover automático entre proveedores, la comparación es un cambio de configuración, y la parte del failover importa más de lo habitual aquí: un modelo que salió esta semana y que estaba listado por un solo proveedor de API cuando Artificial Analysis lo capturó no es algo que convenga meter en una ruta de producción sin un carril al que recurrir.

¿Cuál elegir?
Elige Grok 4.6 cuando la eficiencia por turno sea lo que estás optimizando —bucles de agente largos en los que la capacidad del modelo de terminar en la mitad de los pasos vale más que su tarifa por token— o cuando quieras un modelo con meses de medición independiente detrás en lugar de una semana. Sus 63 tokens por segundo y su tiempo hasta el primer token de 42,79 segundos lo convierten, en términos interactivos, en un modelo para lotes y cargas de trabajo sin conexión, y su contexto de 500K con un salto de precio a partir de 200K aboga por mantener los prompts cortos.
Elige MiMo-V2.6-Pro cuando estés ejecutando bucles repetitivos y con mucho contexto que cruzarían el límite de 200K de Grok, cuando necesites una latencia del primer token lo bastante baja como para que un humano pueda esperarla, cuando quieras los pesos en tu propia infraestructura, o cuando el volumen haga que la brecha de tarifa combinada de 7,5x sea el número decisivo. Su ventaja de dos puntos en el índice es lo bastante pequeña como para que no deba ser el motivo por sí sola; el costo de $206,66 frente a $2.351,83 por ejecutar la misma batería de evaluación es uno mejor.
Lo que resolvería la cuestión abierta es una configuración de DeepSWE presentada para MiMo-V2.6-Pro. Grok 4.6 ya tiene una. En el momento en que el modelo de Xiaomi aparezca en el tablero público con un harness declarado, un intervalo de confianza y un costo por tarea, el 72.57 dejará de ser un número de proveedor y la comparación anterior se convertirá en una real — y, dado el margen de dos puntos en el índice, podría decantarse por cualquiera de los dos.
OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0 % de margen, por lo que un cambio de precio del proveedor se aplica el mismo día.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
