
Xiaomi MiMo-V2.6-Pro frente a Grok 4.7: 30× más baratos por tarea, y ninguno de los dos es rápido
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Xiaomi MiMo-V2.6-Pro y Grok 4.7 se lanzaron ambos el 21 de septiembre de 2026, ambos se sitúan en 46 en el Artificial Analysis Intelligence Index v4.3.2, y ambos son tildados de lentos por la página que los midió: 43,6 tokens de salida por segundo para MiMo-V2.6-Pro frente a una mediana de 67,1, y 40 para Grok 4.7 con esfuerzo xhigh. Lo que los separa es cuánto cuesta una respuesta. La cifra por tarea del evaluador es de 0,13 dólares para el checkpoint abierto chino y de 3,74 dólares para el modelo Grok 4.7, un factor de aproximadamente 29. No se trata de una diferencia de tarifa, o no solo de eso: la tarifa de salida de Grok 4.7 es de 6,00 dólares por millón de tokens frente a 0,87 dólares, lo que supone siete veces, y el resto del múltiplo proviene de cuántos tokens consume cada modelo hasta llegar a una respuesta.
Dos modelos en el mismo mes, sobre el mismo índice, con la misma puntuación, con precios como si pertenecieran a décadas distintas del mercado. La pregunta interesante no es cuál gana. Es qué parte de ese 29× puedes realmente sortear, porque en este emparejamiento exactamente uno de los dos es una ruta que puedes comprar hoy, y es el caro.
Mismo día, mismo marcador, diferentes animales
Grok 4.7 se lanzó el 21 de septiembre de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con una ventana de contexto de 500,000 tokens, una fecha de corte de conocimiento de mayo de 2026, un descuento de caché del 75%, y entrada de texto e imágenes frente a salida de texto. Obtuvo 46 en el índice con esfuerzo xhigh, 56 en el Coding Agent Index en el harness Grok Build, y 1,657 Elo en AA-Briefcase —cuarto en esa tabla, por detrás de tres entradas de Anthropic, a aproximadamente la mitad del coste por tarea de Claude Opus 5.
Xiaomi MiMo-V2.6-Pro es un checkpoint disperso de mezcla de expertos, con 1,02 billones de parámetros totales y 42 mil millones activos, con licencia MIT, contexto de 1M de tokens, entrada de texto, imagen, voz y vídeo frente a salida de texto, $0,43 y $0,87 por millón de tokens con un descuento de caché del 99% que reduce la tarifa efectiva de entrada a casi nada en un prompt en caliente. Artificial Analysis lo sitúa en primer lugar de 114 modelos de pesos abiertos en el índice y en duodécimo lugar de 114 en coste. Es accesible a través de tres proveedores de API. No está en nuestras rutas, y no listamos un modelo antes de que un proveedor lo haya incorporado.
La única línea que lo decide
• Coste por tarea de índice — MiMo-V2.6-Pro $0.13; Grok 4.7 $3.74 — 29× • Tarifa de salida — MiMo-V2.6-Pro $0.87 / 1M; Grok 4.7 $6.00 / 1M — 6.9× • Tokens de salida en la ejecución del índice — MiMo-V2.6-Pro 140M; Grok 4.7 240M, frente a una mediana de 88M • Velocidad de salida — MiMo-V2.6-Pro 43.6 t/s; Grok 4.7 40 t/s — ambas por debajo de la mediana • Ventana de contexto — MiMo-V2.6-Pro 1M; Grok 4.7 500K • Pesos — MiMo-V2.6-Pro con licencia MIT y descargable; Grok 4.7 propietario, solo API
Lee los dos primeros puntos juntos y la forma de la brecha se vuelve clara. A precio de lista, los dos están separados por un factor de 6,9× en salida. En la ejecución del índice, están separados por un factor de 29× en lo que cuesta una respuesta. El factor multiplicador intermedio es la verbosidad: Grok 4.7 generó 240 millones de tokens de salida frente a una mediana de 88 millones para su clase, y MiMo-V2.6-Pro generó 140 millones. Eso es una penalización de 1,71× en tokens que se suma a la penalización de 6,9× en la tarifa, y 1,71 × 6,9 es 11,8 — el resto de la distancia hasta 29 proviene del lado de la entrada, donde el descuento de caché del 99% de MiMo-V2.6-Pro y la tarifa de entrada de $0,43 hacen el trabajo pesado en una carga de trabajo con cualquier prefijo repetido.

La verbosidad es el número que la gente deja fuera de la estimación
Los modelos de costos suelen construirse a partir de una tabla de tarifas y un recuento de tokens asumido. Ambas mitades de eso son incorrectas aquí. La tabla de tarifas es incorrecta porque el descuento de caché no es una nota al pie: 99 % frente a 75 % es la diferencia entre que un prompt del sistema te cueste dinero en cada llamada y que te cueste casi nada. El recuento de tokens es incorrecto porque los dos modelos no emiten la misma cantidad de tokens para el mismo trabajo, y el evaluador midió la diferencia: 240 millones frente a 140 millones, una brecha de 1,71× en un benchmark idéntico.
Ninguno de esos es un indicador indirecto que puedas leer en una hoja de especificaciones. La clasificación de verbosidad de Grok 4.7 es la #94 de 210 modelos de su clase; la clasificación de coste de MiMo-V2.6-Pro es la #12 de 114 en la suya. Un equipo que tome como referencia la lista de precios de Grok 4.7 y asuma una carga de trabajo neutral en tokens pronosticará aproximadamente una cuarta parte de lo que el índice gastó realmente por tarea. La corrección no consiste tampoco en usar el coste del índice como tu estimación: es una medición de la forma de un único benchmark. Consiste en medir tus propios recuentos de tokens en ambos lados antes de comprometerte, porque la brecha entre los dos modelos es de 6,9× sobre el papel y de 29× en la práctica, y solo uno de esos números es real para tu tráfico.

Ambos son lentos, y eso no es un empate.
Artificial Analysis midió Grok 4.7 en 40 tokens de salida por segundo y lo califica como «entre los más lentos»; a MiMo-V2.6-Pro en 43.6 y lo califica como «notablemente lento». Esas dos lecturas son lo suficientemente cercanas como para que la velocidad no deba ser el desempate entre ellos. Pero las medianas subyacentes no lo son: 67.1 para el campo de pesos abiertos en el que se encuentra MiMo-V2.6-Pro. Ambos modelos están muy por debajo de ella, y MiMo-V2.6-Pro también presenta un tiempo hasta el primer token de 3.17 segundos frente a una mediana de 2.31 segundos, que es la cifra que duele en un bucle interactivo en lugar de uno por lotes.
Así que el resumen honesto de la parte de latencia es que ser 29× más barato no te compra un producto más rápido, sino uno más lento que cuesta menos — y si tus usuarios están mirando un cursor, la espera de 3,17 segundos puede costar más que los tokens ahorrados. Para trabajos por lotes durante la noche, evaluación offline o cualquier flujo de trabajo en el que el reloj se mida en horas, la compensación es clara y el 29× es casi gratis.
Qué puede y qué no puede hacer un router con este emparejamiento
Este es el emparejamiento en el que nuestro propio catálogo es genuinamente unilateral, y merece la pena ser claro al respecto. Grok 4.7 está disponible en OrcaRouter como grok/grok-4.7 con el precio del propio proveedor de $2.00 / $6.00, con una salida máxima de 450K y un endpoint compatible con el SDK de OpenAI en https://api.orcarouter.ai/v1 — así que si la comparación te hace querer el modelo de xAI detrás de la misma clave que todo lo demás, esa ruta existe hoy. Xiaomi MiMo-V2.6-Pro no está en nuestras rutas; para ese lado, la API del propio proveedor o cualquiera de los tres proveedores listados que ya uses es la respuesta, y no vamos a fingir lo contrario.
Donde un router se gana su lugar en una comparación como esta es en las partes que no son el modelo. Una sola clave a través de más de 200 modelos al precio de lista de cada proveedor con 0 % de margen significa que un recorte de precio del proveedor llega a tu factura el mismo día en lugar de en la próxima renovación del contrato. La conmutación automática por error significa que la degradación de la ruta de 40 t/s no se lleva tu pipeline consigo. El DSL de enrutamiento permite que la división se haga en función del coste publicado por tarea en lugar de por lealtad a la marca: modelo barato para el alto volumen, modelo potente para las llamadas difíciles, decidido por solicitud. Y para los casos en los que ninguno de los dos modelos es del todo adecuado, la fusión de modelos puede ejecutar varios detrás de una sola llamada.

Preguntas que esta comparación suele plantear
¿Se mantiene el 29× para mi carga de trabajo? Solo si tu combinación de tokens se parece a la de la ejecución del índice. Si tus salidas son cortas y tus prompts son largos y están en caché, el múltiplo se reduce hacia la diferencia de tarifas de 6.9× en salida y se amplía en entrada, donde el descuento del 99 % de MiMo-V2.6-Pro es el término decisivo. Si tus salidas son trazas de razonamiento largas, se amplía más allá de 29×, porque la penalización por verbosidad de Grok 4.7 es proporcional a la longitud de la salida.
¿El 46 de cada lado es el mismo 46? Es el mismo índice, la misma versión y la misma escala: las subpuntuaciones subyacentes eran 46,32 y 46,45, una diferencia de 0,13 puntos, y el índice redondea ambas a 46. Artificial Analysis no publica desgloses por evaluación para ninguno de los dos modelos, por lo que el compuesto es el nivel de detalle más fino disponible y una diferencia de 0,13 puntos no debería interpretarse como una clasificación de capacidad.
¿A cuál debería recurrir por defecto un proyecto nuevo? Si la carga de trabajo es por lotes, tolerante a la latencia y sensible al costo, MiMo-V2.6-Pro a $0.13 por tarea es la opción predeterminada, y los pesos abiertos significan que no quedas expuesto al precio de un único proveedor. Si necesitas específicamente el modelo de xAI —los resultados del harness Grok Build, la ubicación en AA-Briefcase, el contexto de 500K con corte en mayo de 2026—, Grok 4.7 es una ruta activa en OrcaRouter hoy, y el sobrecosto por tarea es el precio de esa capacidad concreta. Aquí no hay ningún modelo que gane en ambos frentes.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
