Tarjeta destacada del radar de modelos de OrcaRouter para la comparación entre MiMo-V2.6-Pro y Claude Opus 5, con el subtítulo «Cinco puntos de índice. Veintiún veces el precio.», con un panel por modelo.
Guides & Insights

MiMo-V2.6-Pro vs. Claude Opus 5: 21 veces más barato, cinco puntos por detrás en el índice

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Xiaomi MiMo-V2.6-Pro y Claude Opus 5 son los dos extremos de un mismo intercambio, y ese intercambio tiene un precio. En el Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (esfuerzo máximo) obtiene 51 puntos y Xiaomi MiMo-V2.6-Pro obtiene 46. Según la tarifa, Claude Opus 5 cuesta 5,00 $ por millón de tokens de entrada y 25,00 $ por millón de salida; MiMo-V2.6-Pro cuesta 0,43 $ y 0,87 $. Haz la división y la respuesta es 11,6 veces en la entrada y 28,7 veces en la salida, y 21 veces en la tarifa combinada que Artificial Analysis publica para cada uno. Cinco puntos de índice cuestan veintiún veces más dinero. Que eso sea una ganga o un desperdicio depende por completo de lo que tu carga de trabajo haga con el quinto punto, y la mayoría de los equipos nunca lo determina antes de comprometerse.

Los dos modelos, expresados claramente.

Claude Opus 5 es el buque insignia propietario de Anthropic, lanzado el 24 de julio de 2026, con una ventana de contexto de 1M de tokens y un número de parámetros no revelado. Xiaomi MiMo-V2.6-Pro es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42 mil millones activados, con una ventana de contexto de 1M de tokens, multimodalidad nativa en texto, imagen, video y audio, y pesos publicados con licencia MIT.

• Pesos — MiMo-V2.6-Pro con licencia MIT y descargable; Claude Opus 5 propietario, solo API

• Parámetros — MiMo-V2.6-Pro 1.02T en total / 42B activos; Claude Opus 5 no divulgado

• Contexto — 1M de tokens en ambos; Claude Opus 5 limita la salida a 128K en la Messages API y a 300K en la Batch API

• Modalidad — MiMo-V2.6-Pro acepta texto, imagen, vídeo y audio; la superficie de entrada publicada de Claude Opus 5 es texto e imagen

• Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M de tokens; Claude Opus 5 $5.00 / $25.00

• Caché — MiMo-V2.6-Pro indica un descuento de caché del 99%; Claude Opus 5 lee la caché a $0.50 por 1M, con escrituras de $6.25 en un TTL de 5 minutos

• Costo medido por tarea del Intelligence Index — MiMo-V2.6-Pro $0.13; Claude Opus 5 $5.86

• Servicio — MiMo-V2.6-Pro 134,3 tokens de salida por segundo y 2,15 s hasta el primer token; Claude Opus 5 57,9 tokens por segundo

Ese último par es el que se pierde. El modelo más barato es también el más rápido —por un factor de 2,3 en rendimiento de salida— porque se sirve en hardware controlado por Xiaomi y sus socios, que pueden procesar por lotes de forma agresiva. Claude Opus 5 a esfuerzo máximo es un modelo de razonamiento que hace más trabajo por token; la diferencia de velocidad no es un defecto, es un producto diferente. Pero sí significa que la vía barata no está pagando su descuento en latencia. Lo está pagando en cinco puntos de índice y en la cola de tareas donde vive ese quinto punto.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Dónde están realmente los cinco puntos

Una diferencia de cinco puntos en un compuesto de diez evaluaciones no está distribuida de manera uniforme, y el agregado oculta lo que importa. Ambos modelos se ejecutaron en la misma suite v4.3.2, que incluye AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Las páginas publicadas no desglosan las puntuaciones por evaluación para ninguno de los dos modelos, lo cual es una limitación real en ambos lados de esta comparación y vale la pena decirlo en lugar de disimularlo.

Lo que consta en el registro es direccional. Claude Opus 5, con el máximo esfuerzo, obtuvo un 49,0 % en Terminal-Bench 4.0 dentro de la suite v4.3, por detrás de GPT-6 Astra, con un 59,1 %, y de Claude Fable 5.1, con un 52,0 %. En AutomationBench-AA, Opus 5 completó todos los objetivos sin violar ningún guardarraíl en el 28,3 % de los flujos de trabajo, frente al 41,6 % de GPT-6 Astra y el 32,1 % de Fable 5.1. Esas son cifras agénticas duras, y son exactamente las categorías donde una brecha compuesta de cinco puntos tiene menos probabilidades de distribuirse de manera uniforme: la propia entrada de índice de MiMo-V2.6-Pro no publica un desglose agéntico comparable.

Por otro lado, las cifras de proveedor que publican ambas compañías no son comparables entre sí, y vale la pena ser francos sobre por qué. El material de lanzamiento de Anthropic informa SWE-bench Verified en 96,0 % y SWE-bench Pro en 79,2 %; un tracker señala que Opus 5 se lanzó sin una entrada independiente de SWE-bench, y no existe una cifra de SWE-bench Verified auditada de forma independiente para él. El material de Xiaomi informa que MiMo-V2.6-Pro pasa de 58,4 a 72,57 en DeepSWE v1.1 a lo largo de su ejecución de RL, en el harness propio de Xiaomi con mini-swe-agent y promedio de tres, sin haberse presentado al tablero público de DeepSWE. Dos harness de proveedores, dos tareas distintas, sin solapamiento. Poner 96,0 % junto a 72,57 y extraer una conclusión sería inventar una comparación que no existe.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

La comparación de costos, bien hecha

La aritmética por token subestima la brecha, porque los dos modelos no consumen la misma cantidad de tokens para terminar el mismo trabajo. Artificial Analysis midió lo que cada uno costó realmente ejecutar el Intelligence Index completo: $0.13 para MiMo-V2.6-Pro, $5.86 para Claude Opus 5. Esa es una brecha de 45x en un conjunto de tareas controlado e idéntico, y es el número único más justo disponible porque ambos se midieron de la misma manera.

Ahora ponle enfrente un bucle de producción plausible. Una ejecución de agente de 30 pasos que lee 200.000 tokens de contexto por paso y escribe 2000 tokens por paso son 6 millones de tokens de entrada y 60.000 tokens de salida por ejecución. Con Claude Opus 5 a precio de lista, eso es $30,00 de entrada y $1,50 de salida: $31,50 por ejecución antes de cualquier caché. Con MiMo-V2.6-Pro son $2,58 de entrada y $0,05 de salida: $2,63. Con los descuentos de caché que ofrecen ambos proveedores, el lado de la entrada se desploma en cualquiera de los dos modelos, y la proporción se desplaza en lugar de desaparecer: un descuento de caché del 99 % en un modelo barato frente a una lectura de caché de $0,50 en uno caro sigue dejando al modelo caro un orden de magnitud por delante en un bucle con mucho contexto.

Ese es todo el argumento a favor de un carril económico y en contra de un cambio total. Si tu carga de trabajo es un bucle de agente de horizonte largo que relee el mismo contexto cientos de veces, la diferencia de coste por ejecución no es un error de redondeo —es la diferencia entre una función que puedes permitirte ejecutar por usuario y otra que no. Ese es el argumento para poner a MiMo-V2.6-Pro al frente de la mayor parte de tu tráfico. No es un argumento para eliminar Claude Opus 5, porque las tareas en las que el quinto punto de índice se amortiza son, por construcción, las tareas en las que el fallo de un modelo barato resulta caro.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

Cómo se ve una decisión de enrutamiento aquí

Se puede acceder a Claude Opus 5 a través de una única clave de OrcaRouter al precio de lista del proveedor con 0% de margen, como anthropic/claude-opus-5con los modelos de frontera con los que lo compararías situados junto a él en la misma clave. Como trasladamos el precio de lista del proveedor sin margen, un cambio de precio del proveedor en cualquiera de las partes está activo en nuestro lado el mismo día en lugar de esperar a una nueva cotización. El DSL de enrutamiento es donde está la parte interesante: puedes componer los dos modelos en una sola llamada en lugar de elegir entre ellos, enviar la mayor parte de una carga de trabajo al carril barato y enrutar la cola —las tareas que fallan una autocomprobación, o que coinciden con un predicado de complejidad— al caro. La conmutación por error es la otra mitad. Claude Opus 5 tiene una amplia cobertura de proveedores; MiMo-V2.6-Pro figuraba listado por un único proveedor de API cuando Artificial Analysis lo capturó, lo que representa una ruta con poca cobertura para un modelo que pondrías en una ruta de producción. Un enrutador que puede conmutar por error es lo que hace que adoptar el carril barato sea seguro.

Vale la pena decirlo claramente, porque es fácil suponer lo contrario: no alojamos MiMo-V2.6-Pro. Acceder a él hoy implica la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen. El argumento de enrutamiento aquí trata sobre cómo usar un modelo como este junto con los que sí ofrecemos, no es una afirmación de que sea uno de los nuestros.

¿Cuál elegir?

Elige Claude Opus 5 cuando el coste de fallo de la tarea supera el coste de tokens lo suficiente como para que cinco puntos de índice sean un seguro barato: trabajo agéntico de horizonte largo con efectos secundarios reales, uso de herramientas donde una llamada errónea es peor que una lenta, cualquier cosa en la que ya estés pagando a una persona para verificar el resultado. La cifra de 5,86 $ por tarea de índice no es una razón para evitarlo; es el precio del nivel, y el nivel existe por una razón.

Elige MiMo-V2.6-Pro cuando el volumen sea la limitación, cuando la carga de trabajo tenga mucho contexto y sea repetitiva, cuando quieras los pesos en tu propia infraestructura —la licencia MIT permite el despliegue comercial, la modificación y el entrenamiento posterior— o cuando estés construyendo algo cuya economía unitaria solo funcione a un quinto de céntimo por cada mil tokens. Sus 134,3 tokens por segundo lo hacen viable para uso interactivo de un modo en que la mayoría de los modelos abiertos de un billón de parámetros no lo son.

Elige ambos, si tienes un enrutador, porque la respuesta honesta a «cuál es mejor» es que no compiten por las mismas solicitudes. El modo de fallo que hay que evitar es el que más cuesta: estandarizar en el modelo barato porque la ratio principal es de 21x, descubrir en el tercer mes que una clase específica de solicitud necesita el caro y no tener forma de enrutarla hacia allí. El segundo modo de fallo es la imagen especular: pagar tarifas de Opus 5 por una tarea de resumen que un modelo con índice 46 termina de forma idéntica. Ninguno de los dos es un problema del modelo. Ambos son problemas de configuración, y la configuración es la parte que puedes cambiar un martes por la tarde.