
MiMo-V2.6-Pro vs GPT-5.6 Sol: un punto de índice cuesta quince veces más por tarea
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 36 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 181 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
En el Artificial Analysis Intelligence Index v4.3.2, consultado el 25 de septiembre de 2026, GPT-5.6 Sol con el máximo esfuerzo obtiene 47 y el MiMo-V2.6-Pro de Xiaomi obtiene 46. Un punto. El número que realmente los separa no es la puntuación y no es la tarifa por token — es el costo de una sola tarea del índice, que Artificial Analysis publica como $1.99 para GPT-5.6 Sol y $0.13 para MiMo-V2.6-Pro. Quince veces el dinero por un punto. Y al momento de esta lectura, la propia página del evaluador para ese modelo tiene un aviso de obsolescencia, porque GPT-6 Sol lo ha reemplazado.
Xiaomi publicó los pesos y el informe técnico de MiMo-V2.6-Pro el 21 de septiembre de 2026, cuatro días antes de esta lectura; OpenAI lanzó GPT-5.6 Sol el 9 de julio de 2026. Ambos hechos anteriores son nuevos desde la última vez que se escribió sobre este emparejamiento, y tiran en direcciones opuestas. El aviso de obsolescencia dice que la comparación es contra un modelo que OpenAI ya ha superado. La cifra por tarea dice que lo que parecía un error de redondeo cuando ambos modelos se cotizaban a precio de lista es, en una carga de trabajo real, la decisión completa. Cuál de los dos importa depende de si estás comprando un modelo o reemplazando uno.
Lo que dicen ahora las dos páginas
GPT-5.6 Sol se lanzó el 9 de julio de 2026 como el buque insignia de la familia GPT-5.6. Su precio de lista es de $4.00 por millón de tokens de entrada y $20.00 por millón de tokens de salida en la API propia de OpenAI, con un descuento de caché del 90%, y la página registra 90 millones de tokens de salida generados durante la ejecución del índice frente a una mediana de 88 millones. Midió 73 tokens de salida por segundo, lo que la misma página califica como más rápido que el promedio frente a una mediana de 72 t/s. Su entrada en el índice ocupa el puesto 19 de 210 modelos de su clase.
Xiaomi MiMo-V2.6-Pro es un checkpoint de mezcla de expertos dispersa con 1,02 billones de parámetros totales y 42 mil millones activos, con licencia MIT, una ventana de contexto de 1M de tokens y entrada de texto, imagen, voz y vídeo frente a salida de texto. Figura a $0,43 y $0,87 por millón de tokens con un descuento de caché del 99 % —una décima parte de la tarifa de entrada de Sol y una vigesimotercera parte de su tarifa de salida—. Generó 140 millones de tokens de salida en la ejecución del índice, y midió 43,6 tokens de salida por segundo, lo que su página describe como notablemente lento frente a una mediana de 67,1 t/s.
• Coste de la tarea de índice — MiMo-V2.6-Pro $0.13; GPT-5.6 Sol $1.99 — la diferencia es de 15× • Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; GPT-5.6 Sol $4.00 / $20.00 • Descuento de caché — MiMo-V2.6-Pro 99%; GPT-5.6 Sol 90% • Tokens de salida en la ejecución de índice — MiMo-V2.6-Pro 140M; GPT-5.6 Sol 90M • Velocidad de salida — MiMo-V2.6-Pro 43.6 t/s, frente a una mediana de 67.1; GPT-5.6 Sol 73 t/s, frente a una mediana de 72 • Contexto y pesos — MiMo-V2.6-Pro 1M y con licencia MIT; GPT-5.6 Sol 1M y propietario

El aviso de obsolescencia es la línea más trascendental
Artificial Analysis ahora abre la página de GPT-5.6 Sol con un aviso enmarcado: «Este modelo está obsoleto. Solo seguimos realizando evaluaciones comparativas de rendimiento para la carga de trabajo predeterminada de 10k tokens de entrada», seguido de la frase de que OpenAI ha lanzado un modelo más nuevo, GPT-6 Sol (max), y de que debería considerarse en su lugar. Por lo tanto, el 47 en el índice es una lectura de un modelo que ya no es lo que hay que comprar. Eso no hace que la lectura sea incorrecta —se midió en el mismo índice, el mismo día y con el mismo ajuste de esfuerzo que el 46—, pero cambia para qué sirve la comparación. Ya no se trata de «qué modelo insignia debería usar». Se trata de «cuánto cuesta lo mejor de la clasificación de modelos propietarios, en el momento en que era lo mejor».
Ese replanteamiento importa más de lo que parece, porque los avisos de obsolescencia en las páginas de evaluadores son uno de los pocos lugares donde la cadencia de producto de un proveedor se manifiesta como un cambio de datos en lugar de como una nota de prensa. La puntuación está congelada; el modelo no se ofrece. Cualquier cosa que construyas contra el 47 la estás construyendo contra una instantánea.

Por qué el número por tarea es el que se debe tomar como referencia para el modelo
Las tarifas por token favorecen a los modelos baratos e inducen a error en cargas de trabajo que no son neutrales respecto de los tokens. El costo de la tarea de índice es una medición distinta: es lo que el evaluador gastó en realidad para obtener una respuesta de cada modelo, lo que incorpora tanto la tarifa como la cantidad de tokens que el modelo decidió emitir. MiMo-V2.6-Pro emite más tokens que Sol en la ejecución del índice —140 millones frente a 90 millones, alrededor de 1,6 veces más— y aun así cuesta $0,13 por tarea frente a $1,99. La ventaja de tarifa es de aproximadamente veintitrés veces en la salida; la penalización por verbosidad es de 1,6×; el producto es la diferencia de quince veces por tarea.
Esa es la aritmética sobre la que se debería construir un modelo de costos, y es la aritmética que resulta invisible si comparas $0.87 con $20.00 y te detienes ahí. También te dice qué rompería la conclusión. Si tu carga de trabajo está dominada por salidas muy cortas, el recuento de tokens de Sol se desploma hacia el tuyo y la brecha de tarifas de veintitrés veces hace la mayor parte del trabajo, así que el múltiplo real se acerca a la brecha de tarifas en lugar de alejarse de ella. Si tu carga de trabajo está dominada por trazas de razonamiento largas, la verbosidad de 1.6× de MiMo-V2.6-Pro se acumula y $0.13 se convierte en el techo en lugar de la estimación. La cifra publicada es una medición de la forma de un benchmark, no una cotización que puedas entregar a finanzas.
La línea de latencia es el contrapeso honesto
Con 43,6 tokens de salida por segundo, MiMo-V2.6-Pro es más lento que GPT-5.6 Sol, medido el mismo día en 73 —y más lento que los modelos con los que su propia página lo compara, cuya mediana es 67,1. Su página lo dice con todas las letras: «notablemente lento». Para un pipeline por lotes, este es un coste de rendimiento al que puedes poner precio. Para un agente interactivo, es una decisión de producto, y que sea quince veces más barato por tarea no hace que un modelo lento sea rápido. Si tu restricción es un presupuesto por turno en lugar de una factura mensual, la ratio que importa es 43,6 frente a 73, y MiMo-V2.6-Pro la pierde.
Dónde acaba esto en un router
La forma útil de este emparejamiento no es “elegir uno”. Es que ambos modelos responden al mismo índice y el evaluador publica un coste por tarea para cada uno, por lo que la división puede hacerse según el coste medido y no según los niveles del proveedor. En OrcaRouter el catálogo llega a más de 200 modelos con una sola clave al precio de lista de cada proveedor y con un 0 % de recargo — una rebaja de precio del proveedor llega a tu factura el mismo día, sin un segundo contrato que renegociar — y el DSL de enrutamiento permite que una carga de trabajo envíe las llamadas baratas y de gran volumen a un modelo y las difíciles a otro según la tarea y no según la marca. La conmutación por error automática cubre el caso en que la ruta más barata está degradada. Xiaomi MiMo-V2.6-Pro no está en nuestras rutas — no listamos un modelo antes de que un proveedor lo haya incorporado —, así que, para ese lado de la comparación, la respuesta honesta es la propia API del proveedor o la plataforma alojada con la que ya tengas relación.

Qué hacer con esto para la próxima semana
Dos cosas cambiaron el 25 de septiembre de 2026 y solo una de ellas tiene que ver con el precio. GPT-5.6 Sol lleva un aviso de descontinuación en el índice donde se midió en 47, lo que lo retira como decisión de compra y lo deja como referencia de benchmark. MiMo-V2.6-Pro se mide en $0,13 por tarea de índice frente a los $1,99 de Sol, lo que supone quince veces el dinero por un punto de índice — y es de 43,6 tokens por segundo, lo que es más lento que el modelo con el que se compara y más lento que la mediana de su propia clase. Contrasta ambas cifras con tu propio tráfico antes de que cualquiera de los dos números se convierta en una decisión: el costo por tarea es una medición, no una tarifa, y la latencia es una medición, no una opinión. Si tus salidas son cortas y no interactivas, el argumento a favor del checkpoint abierto es más fuerte de lo que sugiere la brecha del índice. Si tus salidas son largas o tus usuarios están esperando, el ahorro de quince veces te compra un producto más lento, y esa es una disyuntiva que solo tu carga de trabajo puede valorar.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
