Una tarjeta de título generada que compara Xiaomi MiMo-V2.6-Pro y Grok 4.6 con esfuerzo alto. La tarjeta izquierda muestra Intelligence Index v4.3.2: 46, ventana de contexto: 1M tokens, $0.43 de entrada / $0.87 de salida por 1M, y 134,3 tokens por segundo; la tarjeta derecha muestra Intelligence Index v4.3.2: 44, ventana de contexto: 500K tokens, $2.00 de entrada / $6.00 de salida por 1M, y 63,0 tokens por segundo. Un pie de página dice: Ambas puntuaciones corresponden al Artificial Analysis Intelligence Index v4.3.2. Las cifras de DeepSWE son ejecutadas por el proveedor y no son comparables. El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

MiMo-V2.6-Pro vs Grok 4.6: Ambos proveedores publicaron cifras de DeepSWE, y ninguno está en la tabla

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos proveedores, un benchmark, dos cifras que no se pueden restar. El material de lanzamiento de SpaceXAI para Grok 4.6 reporta 65,9 % en DeepSWE v1.1. El material de Xiaomi para MiMo-V2.6-Pro reporta 72,57 en DeepSWE v1.1. Leídos juntos, sugieren que el modelo de pesos abiertos más barato supera al modelo propietario de frontera por casi siete puntos. Leídos con atención, no dicen casi nada, porque uno es un porcentaje de presentación de lanzamiento obtenido con el arnés propio del proveedor y el otro es un promedio de tres de una ejecución de aprendizaje por refuerzo con el evaluador propio de Xiaomi, y ninguno se ha enviado al tablero público de DeepSWE. La comparación entre MiMo-V2.6-Pro y Grok 4.6 que resiste el escrutinio está en el índice independiente, y allí la respuesta es la contraria a las cifras de los proveedores: 46 frente a 44, a favor de Xiaomi, por dos puntos.

Grok 4.6 se lanzó el 12 de agosto de 2026 por SpaceXAI y es el titular aquí — un modelo de frontera ya lanzado y ampliamente servido, con una lista de precios documentada y meses de medición independiente a sus espaldas. Xiaomi MiMo-V2.6-Pro pasó a estar disponible de forma general el 22 de septiembre de 2026, con sus repositorios de puntos de control de aprendizaje por refuerzo apareciendo el día anterior, y es el recién llegado. Ambos son capaces de razonar, ambos están construidos para trabajo agéntico de larga duración, y la diferencia de precio entre ellos es lo suficientemente grande como para que la inexperiencia del recién llegado sea lo único que frena la comparación.

Lo que cada modelo realmente es

Grok 4.6 es propietario, acepta entrada de texto e imágenes y devuelve texto, y tiene una fecha de corte de conocimiento del 1 de febrero de 2026. Su ventana de contexto es de 500.000 tokens, que es la mitad del tamaño de la de sus principales competidores y la especificación más determinante de su ficha. Sus tarifas de lista son $2.00 por millón de tokens de entrada, $0.50 por millón de entrada en caché y $6.00 por millón de salida por debajo de 200,000 tokens de prompt, con un precipicio en ese límite: en o por encima de 200K las tarifas pasan a ser $4.00, $1.00 y $12.00, y el nivel superior factura toda la solicitud en lugar de la porción que supera la línea. El procesamiento prioritario duplica la tarifa estándar. Artificial Analysis midió 63.0 tokens de salida por segundo y 42.79 segundos hasta el primer token a máximo esfuerzo, y $2,351.83 para ejecutar el índice completo.

Xiaomi MiMo-V2.6-Pro es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42.000 millones activados por token, con una ventana de contexto de 1 millón de tokens y multimodalidad nativa en texto, imagen, video y audio. Tiene licencia MIT con pesos descargables, y Xiaomi mantuvo el precio de la generación anterior en lugar de subir el precio del nuevo checkpoint: 0,43 $ por millón de tokens de entrada y 0,87 $ por millón de salida, un descuento de caché del 99 % y un precio combinado de 0,18 $ con una proporción de aciertos de caché/entrada/salida de 7:2:1. Artificial Analysis midió 134,3 tokens de salida por segundo, 2,15 segundos hasta el primer token y 206,66 $ para ejecutar el índice: 0,13 $ por tarea.

• Pesos — MiMo-V2.6-Pro con licencia MIT y descargable; Grok 4.6 propietario, solo API

• Parámetros — MiMo-V2.6-Pro 1,02T en total / 42B activos; Grok 4.6 sin divulgar

• Contexto — MiMo-V2.6-Pro 1M tokens; Grok 4.6 500K, con un salto brusco de precio a partir de 200K de entrada

• Modalidad — MiMo-V2.6-Pro acepta texto, imagen, video y audio; la superficie de entrada publicada de Grok 4.6 es texto e imagen

• Puntuación del índice — MiMo-V2.6-Pro 46; Grok 4.6 44, ambos Artificial Analysis v4.3.2

• Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; Grok 4.6 $2.00 / $6.00, duplicándose por encima de 200K de entrada

• Tarifa combinada — MiMo-V2.6-Pro $0.18 por 1M; Grok 4.6 $1.35

• Coste de ejecutar el índice — MiMo-V2.6-Pro $206,66; Grok 4.6 $2.351,83

• Velocidad — MiMo-V2.6-Pro 134,3 tokens de salida por segundo; Grok 4.6 63,0

• Tiempo hasta el primer token — MiMo-V2.6-Pro 2,15 segundos; Grok 4.6 42,79 segundos

• Fecha de corte de conocimiento — MiMo-V2.6-Pro no publicado; Grok 4.6, 1 de febrero de 2026

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.6, subtitled Two vendor DeepSWE figures, neither submitted to the public board. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; list price $0.43 / $0.87 per 1M; context window 1M tokens; speed 134.3 tokens per second; DeepSWE v1.1 72.57 vendor-run, avg@3; public DeepSWE entry none. The right column, Grok 4.6 (high), reads Intelligence Index v4.3.2 44; list price $2.00 / $6.00 per 1M; context window 500K tokens; speed 63.0 tokens per second; DeepSWE v1.1 65.9% vendor-reported; public DeepSWE entry ~67% submitted. A footer notes the two DeepSWE figures come from different vendor harnesses with different metrics and must not be subtracted, and that Grok 4.6 list rates double at or above 200K input tokens. The OrcaRouter logo is composited in the bottom-right corner.

El benchmark que ejecutaron ambos proveedores, y por qué no admite comparación

DeepSWE v1.1 es una evaluación real, pública y de terceros de agentes de programación, realizada por Datacurve, y es la familia de tareas sobre la que ambas compañías decidieron publicar. Eso la vuelve tentadora. No debería usarse como una comparación directa, y la razón no es que alguno de los proveedores esté mintiendo, sino que las dos cifras describen mediciones diferentes del mismo nombre de tarea.

El 72,57 de Xiaomi es un promedio de tres en su propio entorno de evaluación con mini-swe-agent, producido durante una ejecución de aprendizaje por refuerzo en lugar de a partir de un candidato a versión congelado, y reportado junto con una cifra de partida de 58,4. La ejecución está documentada como de 30 pasos y unas 750.000 trayectorias por modelo, completada en menos de seis días con un gasto publicado de alrededor de 2,62 millones de dólares para el modelo Pro. No se ha enviado al tablero de Datacurve. El 65,9 % de SpaceXAI para Grok 4.6 es una cifra de la presentación de lanzamiento del propio conjunto de evaluación del proveedor, reportada junto a mejoras sobre Grok 4.5 de 11,9 puntos en el mismo benchmark; y el tablero público incluye una configuración enviada de Grok 4.6 con alrededor del 67 %, lo suficientemente cerca de la cifra del proveedor como para sugerir que el entorno de evaluación está al menos aproximadamente alineado. Eso no es cierto en el caso de la cifra de Xiaomi, que no tiene ninguna contraparte pública.

Entonces, la afirmación honesta es esta: en el tablero público, Grok 4.6 está presente y MiMo-V2.6-Pro está ausente. En el compuesto independiente, el mismo evaluador realmente ejecutó a ambos, y el modelo de Xiaomi lidera por dos puntos. Esos dos hechos no están en tensión. Simplemente miden cosas diferentes, y el segundo es el que hay que citar.

El contexto de 500K es la especificación que decide las cargas de trabajo reales

Medio millón de tokens es una ventana de contexto grande según cualquier estándar normal y pequeña para 2026. Los modelos con los que se agrupa a MiMo-V2.6-Pro se sitúan todos en 1M, y la consecuencia práctica aparece exactamente en las cargas de trabajo para las que se comercializa Grok 4.6. Un agente de programación de larga duración que mantiene un repositorio, una transcripción de herramientas y un plan acumulado superará los 200.000 tokens de prompt en una sesión, y en ese umbral, las tarifas de Grok 4.6 se duplican y se aplican de forma retroactiva a toda la solicitud. La misma sesión en MiMo-V2.6-Pro llega a un millón de tokens sin un cambio de tramo.

Eso es una diferencia de especificación y una diferencia de estructura de precios al mismo tiempo, y la segunda es fácil de pasar por alto al comparar las tarifas anunciadas. Una tarifa combinada de $1.35 para Grok 4.6 frente a $0.18 para MiMo-V2.6-Pro es una brecha de 7.5x. En un prompt que supera los 200K, se amplía a algo más cercano a 15x, porque la tarifa de Grok se duplica y la de Xiaomi no se mueve.

El contraargumento también está registrado, y merece estarlo. La tesis de lanzamiento de Grok 4.6 era la eficiencia de turnos en lugar del contexto bruto: en la evaluación agéntica en la que se midió frente a Claude Opus 5 en tareas idénticas, terminó en aproximadamente 53 turnos y unos 500 millones de tokens de entrada, frente a aproximadamente 103 turnos y dos mil millones de tokens del otro modelo, con un costo estimado de $0.84 por tarea —la cifra más baja entre los modelos frontera de esa comparación. Un modelo que recorre el bucle la mitad de veces no necesita tanto contexto, y no consume tantos tokens. Esa es una ventaja arquitectónica genuina, y es el argumento más fuerte a favor de Grok 4.6 frente a cualquier alternativa más barata por token, incluida esta.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Llegar a cada uno de ellos

Grok 4.6 está en OrcaRouter como grok/grok-4.6, accesible a través de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0% de recargo; por lo que un cambio de precio de SpaceXAI, incluido un cambio en ese límite de 200K, se aplica en nuestro lado el mismo día. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter. Ningún modelo de Xiaomi lo está, y la vía para acceder a él hoy es la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen. Decirlo con claridad es más útil que dejar que una página de modelo dé a entender lo contrario.

En la práctica, cuánto vale esa asimetría es cosa de un experimento barato. Grok 4.6 es el modelo por el que quizá ya estés pagando. MiMo-V2.6-Pro supone una mejora de dos puntos en el índice a una fracción del precio, se lanzó esta semana y solo tiene una ruta de servicio detrás. La pregunta que merece respuesta no es cuál es mejor en abstracto, sino cuánto de tu tráfico de Grok puede asumir el modelo de Xiaomi con tus propios prompts, y responderla abriendo un segundo contrato, una segunda clave y una segunda relación de facturación es la fricción que impide que se haga la prueba. Con un único endpoint y failover automático entre proveedores, la comparación es un cambio de configuración, y la parte del failover importa más de lo habitual aquí: un modelo que salió esta semana y que estaba listado por un solo proveedor de API cuando Artificial Analysis lo capturó no es algo que convenga meter en una ruta de producción sin un carril al que recurrir.

Screenshot of the OrcaRouter model page for Grok 4.6, captured 22 September 2026, showing the breadcrumb Home > Models > SpaceXAI > Grok 4.6, the model id grok/grok-4.6 dated 2026-08-12, the Vision, Tools, JSON and Reasoning capability badges, and the on-this-page index for code samples, pricing, performance, public benchmarks, community buzz, comparisons and FAQ. The rate card sits below the visible area of the capture.

¿Cuál elegir?

Elige Grok 4.6 cuando la eficiencia por turno sea lo que estás optimizando —bucles de agente largos en los que la capacidad del modelo de terminar en la mitad de los pasos vale más que su tarifa por token— o cuando quieras un modelo con meses de medición independiente detrás en lugar de una semana. Sus 63 tokens por segundo y su tiempo hasta el primer token de 42,79 segundos lo convierten, en términos interactivos, en un modelo para lotes y cargas de trabajo sin conexión, y su contexto de 500K con un salto de precio a partir de 200K aboga por mantener los prompts cortos.

Elige MiMo-V2.6-Pro cuando estés ejecutando bucles repetitivos y con mucho contexto que cruzarían el límite de 200K de Grok, cuando necesites una latencia del primer token lo bastante baja como para que un humano pueda esperarla, cuando quieras los pesos en tu propia infraestructura, o cuando el volumen haga que la brecha de tarifa combinada de 7,5x sea el número decisivo. Su ventaja de dos puntos en el índice es lo bastante pequeña como para que no deba ser el motivo por sí sola; el costo de $206,66 frente a $2.351,83 por ejecutar la misma batería de evaluación es uno mejor.

Lo que resolvería la cuestión abierta es una configuración de DeepSWE presentada para MiMo-V2.6-Pro. Grok 4.6 ya tiene una. En el momento en que el modelo de Xiaomi aparezca en el tablero público con un harness declarado, un intervalo de confianza y un costo por tarea, el 72.57 dejará de ser un número de proveedor y la comparación anterior se convertirá en una real — y, dado el margen de dos puntos en el índice, podría decantarse por cualquiera de los dos.

OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0 % de margen, por lo que un cambio de precio del proveedor se aplica el mismo día.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario