Una tarjeta de título generada que dice MiMo-V2.6-Pro vs Grok 4.7, con el subtítulo 29x más barato por tarea, y más lento en ambos lados debajo de ella, y tres iconos de línea planos sobre el título que sugieren pilas de monedas comparadas, un velocímetro y un candado abierto. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Xiaomi MiMo-V2.6-Pro frente a Grok 4.7: 30× más baratos por tarea, y ninguno de los dos es rápido

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Xiaomi MiMo-V2.6-Pro y Grok 4.7 se lanzaron ambos el 21 de septiembre de 2026, ambos se sitúan en 46 en el Artificial Analysis Intelligence Index v4.3.2, y ambos son tildados de lentos por la página que los midió: 43,6 tokens de salida por segundo para MiMo-V2.6-Pro frente a una mediana de 67,1, y 40 para Grok 4.7 con esfuerzo xhigh. Lo que los separa es cuánto cuesta una respuesta. La cifra por tarea del evaluador es de 0,13 dólares para el checkpoint abierto chino y de 3,74 dólares para el modelo Grok 4.7, un factor de aproximadamente 29. No se trata de una diferencia de tarifa, o no solo de eso: la tarifa de salida de Grok 4.7 es de 6,00 dólares por millón de tokens frente a 0,87 dólares, lo que supone siete veces, y el resto del múltiplo proviene de cuántos tokens consume cada modelo hasta llegar a una respuesta.

Dos modelos en el mismo mes, sobre el mismo índice, con la misma puntuación, con precios como si pertenecieran a décadas distintas del mercado. La pregunta interesante no es cuál gana. Es qué parte de ese 29× puedes realmente sortear, porque en este emparejamiento exactamente uno de los dos es una ruta que puedes comprar hoy, y es el caro.

Mismo día, mismo marcador, diferentes animales

Grok 4.7 se lanzó el 21 de septiembre de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con una ventana de contexto de 500,000 tokens, una fecha de corte de conocimiento de mayo de 2026, un descuento de caché del 75%, y entrada de texto e imágenes frente a salida de texto. Obtuvo 46 en el índice con esfuerzo xhigh, 56 en el Coding Agent Index en el harness Grok Build, y 1,657 Elo en AA-Briefcase —cuarto en esa tabla, por detrás de tres entradas de Anthropic, a aproximadamente la mitad del coste por tarea de Claude Opus 5.

Xiaomi MiMo-V2.6-Pro es un checkpoint disperso de mezcla de expertos, con 1,02 billones de parámetros totales y 42 mil millones activos, con licencia MIT, contexto de 1M de tokens, entrada de texto, imagen, voz y vídeo frente a salida de texto, $0,43 y $0,87 por millón de tokens con un descuento de caché del 99% que reduce la tarifa efectiva de entrada a casi nada en un prompt en caliente. Artificial Analysis lo sitúa en primer lugar de 114 modelos de pesos abiertos en el índice y en duodécimo lugar de 114 en coste. Es accesible a través de tres proveedores de API. No está en nuestras rutas, y no listamos un modelo antes de que un proveedor lo haya incorporado.

La única línea que lo decide

• Coste por tarea de índice — MiMo-V2.6-Pro $0.13; Grok 4.7 $3.74 — 29× • Tarifa de salida — MiMo-V2.6-Pro $0.87 / 1M; Grok 4.7 $6.00 / 1M — 6.9× • Tokens de salida en la ejecución del índice — MiMo-V2.6-Pro 140M; Grok 4.7 240M, frente a una mediana de 88M • Velocidad de salida — MiMo-V2.6-Pro 43.6 t/s; Grok 4.7 40 t/s — ambas por debajo de la mediana • Ventana de contexto — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Pesos — MiMo-V2.6-Pro con licencia MIT y descargable; Grok 4.7 propietario, solo API

Lee los dos primeros puntos juntos y la forma de la brecha se vuelve clara. A precio de lista, los dos están separados por un factor de 6,9× en salida. En la ejecución del índice, están separados por un factor de 29× en lo que cuesta una respuesta. El factor multiplicador intermedio es la verbosidad: Grok 4.7 generó 240 millones de tokens de salida frente a una mediana de 88 millones para su clase, y MiMo-V2.6-Pro generó 140 millones. Eso es una penalización de 1,71× en tokens que se suma a la penalización de 6,9× en la tarifa, y 1,71 × 6,9 es 11,8 — el resto de la distancia hasta 29 proviene del lado de la entrada, donde el descuento de caché del 99% de MiMo-V2.6-Pro y la tarifa de entrada de $0,43 hacen el trabajo pesado en una carga de trabajo con cualquier prefijo repetido.

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

La verbosidad es el número que la gente deja fuera de la estimación

Los modelos de costos suelen construirse a partir de una tabla de tarifas y un recuento de tokens asumido. Ambas mitades de eso son incorrectas aquí. La tabla de tarifas es incorrecta porque el descuento de caché no es una nota al pie: 99 % frente a 75 % es la diferencia entre que un prompt del sistema te cueste dinero en cada llamada y que te cueste casi nada. El recuento de tokens es incorrecto porque los dos modelos no emiten la misma cantidad de tokens para el mismo trabajo, y el evaluador midió la diferencia: 240 millones frente a 140 millones, una brecha de 1,71× en un benchmark idéntico.

Ninguno de esos es un indicador indirecto que puedas leer en una hoja de especificaciones. La clasificación de verbosidad de Grok 4.7 es la #94 de 210 modelos de su clase; la clasificación de coste de MiMo-V2.6-Pro es la #12 de 114 en la suya. Un equipo que tome como referencia la lista de precios de Grok 4.7 y asuma una carga de trabajo neutral en tokens pronosticará aproximadamente una cuarta parte de lo que el índice gastó realmente por tarea. La corrección no consiste tampoco en usar el coste del índice como tu estimación: es una medición de la forma de un único benchmark. Consiste en medir tus propios recuentos de tokens en ambos lados antes de comprometerte, porque la brecha entre los dos modelos es de 6,9× sobre el papel y de 29× en la práctica, y solo uno de esos números es real para tu tráfico.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

Ambos son lentos, y eso no es un empate.

Artificial Analysis midió Grok 4.7 en 40 tokens de salida por segundo y lo califica como «entre los más lentos»; a MiMo-V2.6-Pro en 43.6 y lo califica como «notablemente lento». Esas dos lecturas son lo suficientemente cercanas como para que la velocidad no deba ser el desempate entre ellos. Pero las medianas subyacentes no lo son: 67.1 para el campo de pesos abiertos en el que se encuentra MiMo-V2.6-Pro. Ambos modelos están muy por debajo de ella, y MiMo-V2.6-Pro también presenta un tiempo hasta el primer token de 3.17 segundos frente a una mediana de 2.31 segundos, que es la cifra que duele en un bucle interactivo en lugar de uno por lotes.

Así que el resumen honesto de la parte de latencia es que ser 29× más barato no te compra un producto más rápido, sino uno más lento que cuesta menos — y si tus usuarios están mirando un cursor, la espera de 3,17 segundos puede costar más que los tokens ahorrados. Para trabajos por lotes durante la noche, evaluación offline o cualquier flujo de trabajo en el que el reloj se mida en horas, la compensación es clara y el 29× es casi gratis.

Qué puede y qué no puede hacer un router con este emparejamiento

Este es el emparejamiento en el que nuestro propio catálogo es genuinamente unilateral, y merece la pena ser claro al respecto. Grok 4.7 está disponible en OrcaRouter como grok/grok-4.7 con el precio del propio proveedor de $2.00 / $6.00, con una salida máxima de 450K y un endpoint compatible con el SDK de OpenAI en https://api.orcarouter.ai/v1 — así que si la comparación te hace querer el modelo de xAI detrás de la misma clave que todo lo demás, esa ruta existe hoy. Xiaomi MiMo-V2.6-Pro no está en nuestras rutas; para ese lado, la API del propio proveedor o cualquiera de los tres proveedores listados que ya uses es la respuesta, y no vamos a fingir lo contrario.

Donde un router se gana su lugar en una comparación como esta es en las partes que no son el modelo. Una sola clave a través de más de 200 modelos al precio de lista de cada proveedor con 0 % de margen significa que un recorte de precio del proveedor llega a tu factura el mismo día en lugar de en la próxima renovación del contrato. La conmutación automática por error significa que la degradación de la ruta de 40 t/s no se lleva tu pipeline consigo. El DSL de enrutamiento permite que la división se haga en función del coste publicado por tarea en lugar de por lealtad a la marca: modelo barato para el alto volumen, modelo potente para las llamadas difíciles, decidido por solicitud. Y para los casos en los que ninguno de los dos modelos es del todo adecuado, la fusión de modelos puede ejecutar varios detrás de una sola llamada.

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

Preguntas que esta comparación suele plantear

¿Se mantiene el 29× para mi carga de trabajo? Solo si tu combinación de tokens se parece a la de la ejecución del índice. Si tus salidas son cortas y tus prompts son largos y están en caché, el múltiplo se reduce hacia la diferencia de tarifas de 6.9× en salida y se amplía en entrada, donde el descuento del 99 % de MiMo-V2.6-Pro es el término decisivo. Si tus salidas son trazas de razonamiento largas, se amplía más allá de 29×, porque la penalización por verbosidad de Grok 4.7 es proporcional a la longitud de la salida.

¿El 46 de cada lado es el mismo 46? Es el mismo índice, la misma versión y la misma escala: las subpuntuaciones subyacentes eran 46,32 y 46,45, una diferencia de 0,13 puntos, y el índice redondea ambas a 46. Artificial Analysis no publica desgloses por evaluación para ninguno de los dos modelos, por lo que el compuesto es el nivel de detalle más fino disponible y una diferencia de 0,13 puntos no debería interpretarse como una clasificación de capacidad.

¿A cuál debería recurrir por defecto un proyecto nuevo? Si la carga de trabajo es por lotes, tolerante a la latencia y sensible al costo, MiMo-V2.6-Pro a $0.13 por tarea es la opción predeterminada, y los pesos abiertos significan que no quedas expuesto al precio de un único proveedor. Si necesitas específicamente el modelo de xAI —los resultados del harness Grok Build, la ubicación en AA-Briefcase, el contexto de 500K con corte en mayo de 2026—, Grok 4.7 es una ruta activa en OrcaRouter hoy, y el sobrecosto por tarea es el precio de esa capacidad concreta. Aquí no hay ningún modelo que gane en ambos frentes.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario