
MiMo-V2.6-Pro vs Kimi K3: dos pesos abiertos de dos billones de parámetros, catorce veces de diferencia en el costo por tarea
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ambos son modelos de mezcla de expertos con pesos abiertos de laboratorios chinos con una ventana de contexto de 1M de tokens. Ambos están disponibles para su descarga. En el Artificial Analysis Intelligence Index v4.3.2, consultado el 22 de septiembre de 2026, Kimi K3, de MoonshotAI, obtiene 44, y MiMo-V2.6-Pro, de Xiaomi, obtiene 46. Dos puntos. El coste medido de ejecutar esa misma batería de evaluación en cada uno es de 3.658,07 $ para Kimi K3 y 206,66 $ para MiMo-V2.6-Pro — un factor de diecisiete. Si ya has decidido que quieres pesos abiertos en esta clase, esa proporción, no los dos puntos, es lo que decide.
Kimi K3 es el modelo consolidado de este par: lanzado el 16 de julio de 2026, con los pesos completos disponibles el 27 de julio, y meses de evaluación independiente a sus espaldas. Xiaomi MiMo-V2.6-Pro se puso a disposición general el 22 de septiembre de 2026, con sus repositorios de checkpoints de aprendizaje por refuerzo apareciendo el día anterior. Por lo tanto, la comparación es entre un modelo abierto probado a precio premium y uno recién lanzado a precio de commodity, y la parte interesante es lo estrecha que resultó la brecha de capacidad medida.
Lo que cada modelo realmente es
Kimi K3 es un modelo de razonamiento multimodal de pesos abiertos con 2,8 billones de parámetros, descrito en su lanzamiento como el primer modelo abierto de la clase de tres billones. Activa 16 de 896 expertos por token —aproximadamente 104.000 millones de parámetros activos— y utiliza Kimi Delta Attention y Attention Residuals para mantener eficientemente un contexto de 1M de tokens, con una salida de hasta 1M de tokens por solicitud. Es razonamiento siempre activo con visión nativa. La API propia de Moonshot cobra $3,00 por millón de tokens de entrada, $0,30 por millón de tokens de entrada en caché y $15,00 por millón de salida, una tarifa plana sin escalonamiento por longitud de contexto, y Artificial Analysis informa un descuento de caché del 90% y una tarifa combinada de $2,31. Midió 42,8 tokens de salida por segundo —notablemente lento frente a una mediana de 77,9 para modelos de tamaño comparable— y 3,93 segundos hasta el primer token.
Xiaomi MiMo-V2.6-Pro es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42 mil millones activados por token, con una ventana de contexto de 1M tokens y multimodalidad nativa en texto, imagen, vídeo y audio. Sus pesos llevan una etiqueta de licencia MIT. Xiaomi mantuvo los precios de la generación anterior en lugar de subir el precio del nuevo checkpoint, por lo que se lista a $0,43 por millón de tokens de entrada y $0,87 por millón de salida con un 99% de descuento de caché y un costo combinado de $0,18. Midió 134,3 tokens de salida por segundo —undécimo de 114 modelos en velocidad— y 2,15 segundos hasta el primer token.
• Parámetros activos — MiMo-V2.6-Pro 42B por token; Kimi K3 unos 104B, activando 16 de 896 expertos
• Parámetros totales — MiMo-V2.6-Pro 1,02T; Kimi K3 2,8T
• Puntuación del índice — MiMo-V2.6-Pro 46; Kimi K3 44, ambos Artificial Analysis v4.3.2
• Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; Kimi K3 $3.00 / $15.00, entrada en caché $0.30
• Tarifa combinada — MiMo-V2.6-Pro $0.18 por 1M; Kimi K3 $2.31
• Coste de ejecutar el índice — MiMo-V2.6-Pro $206,66; Kimi K3 $3.658,07
• Velocidad — MiMo-V2.6-Pro 134.3 tokens de salida/segundo; Kimi K3 42.8, frente a una mediana de 77.9 para la clase de tamaño
• Tiempo hasta el primer token — MiMo-V2.6-Pro 2,15 segundos; Kimi K3 3,93 segundos
• Contexto — 1M de tokens en ambos; Kimi K3 publica salidas de hasta 1M de tokens por solicitud
• Pesos — ambos descargables; MiMo-V2.6-Pro lleva una etiqueta MIT

La velocidad es la diferencia que el índice oculta.
La brecha compuesta de dos puntos es el número menos interesante aquí, y la cifra de 134,3 frente a 42,8 tokens por segundo es la más interesante. Un modelo que genera tres veces más rápido no es tres veces mejor, pero es la diferencia entre una clase de aplicación que funciona y otra que no —y la propia página de Artificial Analysis de Kimi K3 lo señala como notablemente lento para su clase de tamaño. Para un bucle de agente de horizonte largo que hace docenas de llamadas secuenciales, el rendimiento se acumula igual que la latencia: una diferencia de tres veces por llamada no es una diferencia de tres veces de extremo a extremo, pero es la diferencia entre una sesión que un usuario espera hasta el final y otra que abandona.
La ventaja de Kimi K3 está en el lado de las entradas del balance. Sus 3.93 segundos hasta el primer token son más lentos que los 2.15 de MiMo-V2.6-Pro, pero no por el orden de magnitud que separa a cualquiera de los dos de un modelo de razonamiento de frontera a máximo esfuerzo. Donde K3 paga por su tamaño es en la generación, y la generación es lo que se te factura.
Los números de proveedor, y el que se lee mal
Ambos laboratorios publicaron cifras de DeepSWE v1.1 procedentes de sus propios harnesses, y ambas están en circulación como si fueran comparables. No lo son, y este par es donde ese error hace más daño, porque las cifras parecen tan cercanas entre sí.
Xiaomi informa que MiMo-V2.6-Pro pasa de 58,4 a 72,57 en DeepSWE v1.1 a lo largo de su ejecución de aprendizaje por refuerzo, evaluado con mini-swe-agent con promedio de tres en el propio evaluador de Xiaomi. La ejecución está documentada como de 30 pasos y aproximadamente 750.000 trayectorias por modelo, completada en menos de seis días con un gasto publicado de unos 2,62 millones de dólares para el modelo Pro y 854.044 dólares para el Flash más pequeño. Una lectura ampliamente difundida de esa ejecución sitúa a Kimi K3 en 68,51 en el mismo benchmark, lo que convertiría al modelo de Xiaomi en el ganador por cuatro puntos. Esa lectura es una cifra de la comunidad, no un número de Moonshot, y las dos mediciones utilizan métricas diferentes —promedio de tres frente a una tasa de aprobación—, por lo que restarlas es aritmética con escalas que no coinciden. Ninguno de los dos proveedores ha enviado una configuración al tablero público de Datacurve para estos modelos.
El número que es genuinamente comparable es el índice, porque Artificial Analysis ejecutó ambos por sí misma: 46 para MiMo-V2.6-Pro y 44 para Kimi K3, en v4.3.2, sin que se publicara el desglose por evaluación de ninguno de los dos. Ese margen de dos puntos es lo bastante pequeño como para quedar dentro del ruido de un compuesto de diez evaluaciones, y la conclusión honesta es que, en cuanto a capacidad medida, estos dos modelos están efectivamente empatados.
Qué ofrece el premium de Kimi K3
Sería un error interpretar la brecha de costes como puro margen. Kimi K3 es un modelo de 2,8 billones de parámetros frente a los 1,02 billones de Xiaomi, y activa aproximadamente dos veces y media tantos parámetros por token. Fue el primer modelo abierto de su clase de tamaño, y ostenta una serie de resultados independientes que MiMo-V2.6-Pro simplemente no ha tenido tiempo de acumular: según los propios informes de Artificial Analysis, ocupó el tercer puesto en el Intelligence Index, por detrás de Claude Fable 5 y GPT-5.6 Sol, en el momento de su lanzamiento, con GDPval-AA v2 en Elo 1668, el primer puesto en AutomationBench-AA con un 53 %, el segundo en AA-Briefcase con Elo 1547 y el primero en Frontend Code Arena con 1679. Son mediciones independientes, no afirmaciones de lanzamiento, y describen un modelo con una amplitud que un margen compuesto de dos puntos no capta.
También hay una historia de capacidad asociada. Según los informes, la demanda de Kimi K3 desbordó la capacidad de servicio en su lanzamiento, lo que provocó pausas temporales en las suscripciones a la API y límites de capacidad en la infraestructura ascendente en algunas pasarelas. Un modelo que es difícil de conseguir es un modelo sobre el que es difícil construir, y eso es un problema de disponibilidad, no de calidad.

Un endpoint, y una respuesta directa sobre lo que enrutamos
Kimi K3 está en OrcaRouter como kimi/kimi-k3 — una sola clave compatible con OpenAI, el precio de lista del proveedor se traslada con un 0 % de recargo, así que un cambio de precio de Moonshot está activo en nuestro lado el mismo día, y la conmutación automática por fallos entre proveedores cubre los límites de capacidad que han lastrado a este modelo desde su lanzamiento. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter. Ningún modelo de Xiaomi lo está, y la vía para acceder a él hoy es la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen. Merece la pena decirlo con claridad en lugar de dejar que una página de modelo insinúe lo contrario.
Lo que hace que esta combinación sea un buen ejemplo de para qué sirve la capa de enrutamiento. Dos modelos abiertos, empatados en la única medida independiente en la que se evaluaron ambos, con una diferencia de diecisiete veces en el costo medido por tarea: eso no es una elección, es una configuración de dos carriles. Coloque la mayor parte de su tráfico en el carril barato y enrute la cola al otro según un predicado que usted defina, o realice una conmutación por error cuando una ruta se degrade. Con los modelos detrás de una sola clave, el experimento que le indica qué proporción debe tomar cada uno es un cambio de configuración en sus propios prompts en lugar de una conversación de adquisición; y si Xiaomi cambia el precio de MiMo-V2.6-Pro una vez que se cierre la ventana de lanzamiento, o Moonshot reduce las tarifas de K3 en respuesta a la competencia, ambos movimientos recaen de nuestro lado el mismo día en lugar de al próximo ciclo de facturación.

¿Cuál elegir?
Elige Kimi K3 cuando necesites la amplitud que conlleva un modelo de este tamaño y medido de forma independiente —visión, programación de horizonte largo en repositorios grandes, uso agéntico de herramientas— o cuando ya lo estés ejecutando y el costo de migración sea real. Es el modelo más exhaustivamente caracterizado de los dos, y su límite de salida de 1 M de tokens es inusual. Ten en cuenta la velocidad de generación: a 42,8 tokens por segundo, en términos interactivos es un modelo para lotes y cargas de trabajo offline, independientemente de lo que sugiera su calidad de razonamiento.
Elige MiMo-V2.6-Pro cuando el rendimiento y la economía unitaria sean la restricción, cuando el bucle tenga mucho contexto y sea repetitivo, cuando la latencia del primer token importe, o cuando quieras los pesos en tu propio hardware bajo una licencia permisiva. Es el raro caso de un modelo barato que además es el rápido, y en la única puntuación independiente que ambos modelos comparten, va por delante por un margen lo suficientemente pequeño como para ser un empate.
Elige ambos si tienes un router. El modo de fallo que hay que evitar es estandarizar con uno u otro por una ratio de titular: pagar tarifas de Kimi K3 por un trabajo de resumen que un modelo de índice 46 termina de forma idéntica, o descubrir que una tarea de programación a escala de repositorio necesita el modelo de 2.8T después de haber trasladado todo al carril barato. Ninguno de los dos es un problema del modelo, y ambos son configuración.
OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0 % de margen, por lo que un cambio de precio del proveedor se aplica el mismo día.
