Tarjeta principal del radar de modelos de OrcaRouter para la comparación entre MiMo-V2.6-Pro y DeepSeek V4 Pro, con el subtítulo «Dos insignias abiertas, a diez puntos de índice de distancia», con un panel por modelo y un pie de página que indica que ambos tienen licencia MIT con una ventana de contexto de 1M tokens y que las puntuaciones son v4.3.2 y no son comparables con versiones anteriores del índice.
Guides & Insights

MiMo-V2.6-Pro vs. DeepSeek V4 Pro: dos buques insignia abiertos, separados por diez puntos de índice

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Xiaomi MiMo-V2.6-Pro y DeepSeek V4 Pro son el mismo tipo de objeto —modelos insignia chinos de mezcla de expertos con billones de parámetros, con licencia MIT, contexto de 1M de tokens, pesos abiertos que puedes descargar hoy mismo— y los separan diez puntos en el Artificial Analysis Intelligence Index v4.3.2, 46 frente a 36. También discrepan sobre para qué sirve un modelo insignia. DeepSeek V4 Pro, publicado el 13 de agosto de 2026, es un modelo de razonamiento solo de texto: 1,6 billones de parámetros con 49 mil millones activos, y sin entrada de visión, audio ni vídeo en ninguna parte de su superficie publicada. Xiaomi MiMo-V2.6-Pro, publicado el 21 de septiembre de 2026, tiene 1,02 billones de parámetros con 42 mil millones activos y acepta texto, imagen, vídeo y audio. Esa diferencia decide más despliegues que los diez puntos, y es lo primero que hay que resolver antes de comparar cualquier otra cosa.

Misma licencia, diferentes máquinas

Empieza por lo que es genuinamente idéntico, porque es más de lo que cabría esperar entre dos laboratorios competidores. Ambos se distribuyen bajo una etiqueta de licencia MIT en repositorios públicos, lo que significa despliegue comercial, modificación y entrenamiento adicional sin una barrera de ingresos ni una cláusula de campo de uso. Ambos afirman tener una ventana de contexto de 1M de tokens. Ambos son diseños de mezcla dispersa de expertos: la arquitectura se ha convertido en la opción predeterminada a esta escala, no en un diferenciador. Y ambos fueron entrenados por laboratorios que publican menos sobre el método de lo que lo hacen los laboratorios de frontera occidentales.

• Parámetros — MiMo-V2.6-Pro 1,02T en total / 42B activos; DeepSeek V4 Pro 1,6T en total / 49B activos

• Modalidad de entrada — MiMo-V2.6-Pro: texto, imagen, vídeo, audio; DeepSeek V4 Pro: solo texto

• Contexto — 1M tokens en ambos; DeepSeek V4 Pro limita la salida a 384K tokens

• Puntuación del índice — MiMo-V2.6-Pro 46 en Intelligence Index v4.3.2; DeepSeek V4 Pro 36 en la misma versión

• Costo por tarea de Index — MiMo-V2.6-Pro $0.13; DeepSeek V4 Pro $0.67

• Tarifa de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M de tokens; DeepSeek V4 Pro $1.32 / $3.96 tal como lo indica Artificial Analysis, antes del propio horario de pico/fuera de pico de DeepSeek

• Velocidad — MiMo-V2.6-Pro 134,3 tokens de salida/segundo; DeepSeek V4 Pro 97,4

• Tiempo hasta el primer token — MiMo-V2.6-Pro 2,15 s; DeepSeek V4 Pro 1,62 s

Lee esa lista dos veces, porque dos filas son contraintuitivas. El modelo más pequeño obtiene diez puntos más —42 mil millones de parámetros activos superando a 49 mil millones no es una diferencia de redondeo, es un resultado de postentrenamiento, y es la señal más clara de esta comparación de que la calidad del aprendizaje por refuerzo ha superado a la escala bruta como palanca. Y el modelo más barato también es el más rápido, tanto en rendimiento como en coste por tarea, lo que es lo opuesto al trade-off habitual. Xiaomi no te vende un descuento a cambio de paciencia. La ventaja de DeepSeek es el tiempo hasta el primer token, 1,62 segundos frente a 2,15 —real, pero la única categoría en la que V4 Pro lidera.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Por qué la misma versión del índice importa aquí

Comparar modelos de pesos abiertos entre revisiones del índice es la forma en que la mayoría de las comparaciones publicadas salen mal, así que el número de versión no es una nota al pie. Artificial Analysis reconstruyó el Intelligence Index como v4.3 en septiembre de 2026, y las puntuaciones se movieron sustancialmente a través de ese límite — Claude Opus 5 perdió tres puntos entre v4.2 y v4.3, y el campo de pesos abiertos se reordenó. Ambas cifras anteriores son v4.3.2, lo que significa que el 46 y el 36 son directamente comparables entre sí. No son comparables con los números más antiguos que encontrarás citados en otros lugares para cualquiera de los dos modelos.

Eso no es una hipótesis. Se informó ampliamente que DeepSeek V4 Pro obtuvo 53 en una escala de índice anterior en agosto de 2026, y nuestra propia cobertura de ese período lo recogió. En v4.3.2, el mismo modelo marca 36. Nada del modelo cambió; la regla sí. Si tienes una hoja de cálculo con 53 junto a un 46 para MiMo-V2.6-Pro, tienes una comparación que te señalará el modelo equivocado. El emparejamiento correcto es 46 frente a 36, y la conclusión correcta es que el modelo lanzado cinco semanas después, con dos tercios del número de parámetros, está sustancialmente por delante.

La brecha de reporte entre los dos laboratorios

Hay una segunda diferencia, más sutil, y tiene que ver con lo que cada laboratorio está dispuesto a dejar que se le revise.

El 46 de MiMo-V2.6-Pro es una medición de Artificial Analysis. La firma de evaluación ejecutó su propia batería —diez evaluaciones de razonamiento, conocimiento, matemáticas y programación— sobre el modelo publicado y publicó el resultado, junto con las cifras de funcionamiento: 134,3 tokens por segundo, 2,15 segundos hasta el primer token, un descuento de caché del 99 %, $0,13 por tarea de índice y un coste total de evaluación de $206,66. Ese es un dato de un tercero sobre el modelo de Xiaomi.

Las cifras agénticas destacadas de DeepSeek V4 Pro son de DeepSeek, y la brecha entre estas y las independientes ha sido documentada. El material de lanzamiento de la compañía reporta Terminal-Bench 2.1 en 87,9, DeepSWE en 62,7, CyberGym en 83,3 y SWE-bench Verified en 80,6. Ejecuciones independientes sitúan Terminal-Bench 2.1 en 78,7 —aproximadamente nueve puntos por debajo de la cifra del proveedor— y el Artificial Analysis Coding Index en 68,8. Ninguna de esas cifras del proveedor ha sido reproducida, y el tamaño de la brecha de Terminal-Bench es la razón para tratar el resto del conjunto como afirmaciones en lugar de mediciones.

Xiaomi tiene su propia versión del mismo problema. Su panel de control informa que MiMo-V2.6-Pro pasa de 58.4 a 72.57 en DeepSWE v1.1 a lo largo de su ejecución de aprendizaje por refuerzo, evaluado en el propio arnés de Xiaomi con mini-swe-agent en promedio de tres. Eso no es un envío a una tabla de clasificación y ninguna entidad externa lo ha vuelto a ejecutar. Así que ninguno de los dos modelos llega con un certificado de buena salud en los benchmarks de los proveedores. La diferencia es que MiMo-V2.6-Pro también llega con una puntuación compuesta independiente que el lanzamiento de DeepSeek no tenía en el momento equivalente — y si estás eligiendo entre ellos basándote en evidencia en lugar de en marketing, esa es la asimetría que debería tener peso.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

Cómo se ve esto en producción

La diferencia de modalidad es la bifurcación práctica, y favorece a DeepSeek con menos frecuencia de lo que sugiere la brecha de diez puntos. Si tu pipeline ingiere capturas de pantalla, PDF renderizados como imágenes, fotogramas de vídeo o audio, MiMo-V2.6-Pro lo maneja de forma nativa en un solo modelo, y DeepSeek V4 Pro no puede manejarlo en absoluto: necesitarías un modelo de visión separado por delante, lo que significa un segundo contrato, un segundo modo de fallo y una segunda factura. Si tu carga de trabajo es razonamiento exclusivamente de texto, la modalidad adicional es un peso muerto por el que no estás pagando nada.

El costo por tarea de indexación es la otra cifra que hay que tener en cuenta. $0.13 frente a $0.67 supone una diferencia de cinco veces en un conjunto de tareas controlado e idéntico, medido de la misma manera para ambos. DeepSeek aplica un esquema de facturación con horas pico y horas valle que puede reducir sustancialmente su tarifa efectiva según cuándo realices la llamada, por lo que la proporción en el mundo real se estrecha en horas valle y se amplía en horas pico: un detalle que importa si tu tráfico es en ráfagas y no puedes elegir cuándo llega.

Aquí es donde el lado de DeepSeek tiene una ventaja genuina que no tiene nada que ver con el modelo: está en nuestra plataforma. Se puede acceder a DeepSeek V4 Pro como deepseek/deepseek-v4-pro mediante una clave de OrcaRouter al precio de lista del proveedor con un 0 % de recargo, con conmutación por error automática entre proveedores y el DSL de enrutamiento disponible además — así que la aritmética de horas punta/valle, el diferencial entre proveedores y la ruta de respaldo son cosas que configuras en lugar de cosas que construyes. MiMo-V2.6-Pro no está en nuestra plataforma, y lo diremos sin rodeos: acceder a él hoy significa la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen, y Artificial Analysis contó un único proveedor de API para él en el momento de la captura. Una ruta no es una ruta de producción, que es el argumento más fuerte para tratar a MiMo-V2.6-Pro como un modelo que hay que evaluar ahora y al que hay que enrutar con cuidado, con algo más detrás.

¿Cuál, y cuándo?

Elige DeepSeek V4 Pro si tu trabajo es solo texto, si necesitas el techo de salida de 384K, si quieres el tiempo hasta el primer token más rápido de los dos, o si ya estás en nuestra plataforma y quieres una vía de pesos abiertos de un billón de parámetros con conmutación por error y sin nueva integración. Es el incumbente por una razón, y ser cinco semanas más antiguo ha significado cinco semanas de herramientas, cuantización y recetas de servicio que un modelo de septiembre aún no ha acumulado.

Elige MiMo-V2.6-Pro si la tarea es multimodal, si el coste por tarea domina tu economía unitaria, si el throughput importa más que medio segundo de latencia, o si quieres el actual líder en pesos abiertos de un índice medido de forma independiente. La licencia MIT en ambos zanja la cuestión de los pesos en cualquier caso: puedes ejecutar cualquiera de los dos en tu propio hardware, ajustarlo y comercializarlo.

La configuración que vale la pena considerar no es en absoluto una elección. Un enrutador te permite conservar el carril de DeepSeek para el razonamiento solo de texto a tarifas de horas valle y añadir un carril de MiMo para las solicitudes multimodales, con un respaldo por delante de la ruta más limitada. Eso no es cubrirse las espaldas; es asignar cada solicitud al modelo que realmente la maneja, lo cual es una respuesta más económica y duradera que elegir un ganador y esperar que la carga de trabajo nunca cambie de forma.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

La pregunta que esta comparación todavía no puede responder.

Los benchmarks más citados de ambos modelos los ejecuta el proveedor y no han sido reproducidos. En el caso de DeepSeek V4 Pro, esa brecha ha permanecido abierta desde agosto y es la razón por la que sus puntuaciones independientes son inferiores a las cifras de su lanzamiento. En el caso de MiMo-V2.6-Pro, el compuesto independiente existe, pero el desglose agéntico no: Artificial Analysis publica un 46 y no la dispersión por evaluación que hay debajo, que es el detalle que te dice si un modelo pertenece a un bucle de agentes o a una canalización de preguntas y respuestas.

Hasta que se publique esa diferencia y hasta que alguien vuelva a ejecutar el arnés DeepSWE de Xiaomi, la posición defendible es más estrecha que el marketing de cualquiera de los laboratorios: MiMo-V2.6-Pro lidera en un índice compuesto independiente y en el coste medido por tarea; DeepSeek V4 Pro lidera en madurez, longitud de salida, latencia del primer token y en ser accesible a través de una ruta que tiene redundancia detrás. Cinco semanas es una corta ventaja inicial, y es la única que tiene DeepSeek.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario