Una tarjeta de título generada para «Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash», con los dos nombres de modelo a cada lado de un separador y la leyenda «Más barato por token, más barato por tarea, y aun así no es la misma decisión», sobre el pie de página «Tarifas publicadas por el proveedor; costos por tarea según Artificial Analysis». El logotipo real de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash: Cuando la tarifa y la factura medida no coinciden

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Si se toman las dos tarifas al pie de la letra, Claude Haiku 5.5 frente a Xiaomi MiMo-V2.6-Flash parece una paliza a favor del modelo Xiaomi: $0,14 y $0,28 por millón de tokens frente a $0,10 y $0,50, una ventaja de 1,8x en tokens de salida con una tarifa plana en lugar de una que escala después de 100.000 tokens. Luego observa lo que cuestan en realidad las ejecuciones de tareas independientes y el orden se invierte: MiMo-V2.6-Flash cuesta $0,06231 por terminar una tarea que el Haiku termina por $0,2128, y aun así el Haiku obtiene una puntuación un 15 % más alta en la misma tabla y termina la tarea en un tercio del tiempo real. Ninguna de esas cuatro afirmaciones es incorrecta; están midiendo cosas diferentes. Este artículo trata sobre cuál de ellas predice tu factura y dónde cada una deja de ser útil.

Las dos tarjetas de tarifas

Empieza por las cifras que publica cada proveedor, porque son las que se comparan y, en su mayoría, no son las que importan:

• Precio — Claude Haiku 5.5: $0.10 / $0.50 por millón por debajo de 100K tokens, $0.50 / $2.50 por encima (lista de Anthropic); Xiaomi MiMo-V2.6-Flash: $0.14 / $0.28 fijo (lista del proveedor)

• Ventana de contexto — 1,000,000 de tokens para Claude Haiku 5.5, 1,000,000 para MiMo-V2.6-Flash, ambos publicados por el proveedor

• Salida máxima — 128.000 tokens en el Haiku (300.000 en Batch); no se anuncia como un límite máximo independiente para MiMo-V2.6-Flash

• Arquitectura — no divulgada para el Haiku; 309B de parámetros totales con 15B activos, Mixture-of-Experts, para MiMo-V2.6-Flash (publicado por el proveedor)

• Licencia — cerrada y solo disponible mediante API para el Haiku; MIT para MiMo-V2.6-Flash (publicada por el proveedor)

• Índice independiente — 43.395 para Claude Haiku 5.5 frente a 37.884 para MiMo-V2.6-Flash (Artificial Analysis)

Tres de esas líneas deciden la mayoría de las compras reales y apuntan en tres direcciones distintas. En el precio de salida, el modelo Xiaomi es más barato: 0,28 $ frente a 0,50 $ en contexto corto. En el precio de entrada, el Haiku es más barato por debajo de 100.000 tokens y mucho más caro por encima. En la ventana de contexto, el modelo Xiaomi afirma tener el doble de espacio. Solo una de esas tres —la última— es siquiera una afirmación sobre capacidad, y el escalón de tarifa plana del Haiku a los 100.000 tokens significa que la comparación de precios tiene una costura que un único par de números oculta.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, context window 1,000,000 tokens, weights closed and API-only, cost per task $0.2128, seconds per task 426. Right column Xiaomi MiMo-V2.6-Flash: input price (flat) $0.14 per million, output price (flat) $0.28 per million, context window 1,000,000 tokens, weights open under MIT, cost per task $0.0623, seconds per task 1,320. Footer reads 'Task costs and timings per Artificial Analysis; prices vendor-published.' The real OrcaRouter logo is composited bottom-right.

La factura medida

Las tarifas ponen precio a los tokens. El trabajo cuesta dinero. Artificial Analysis somete a ambos modelos a la misma batería de tareas y publica cuánto costó realmente completar cada tarea, una cantidad distinta del precio por token y, con frecuencia, una clasificación distinta:

• Costo por tarea — MiMo-V2.6-Flash $0.06231 vs Claude Haiku 5.5 $0.2128

• Tokens de salida por tarea — MiMo-V2.6-Flash 77.792 frente a Claude Haiku 5.5 162.164

• Tiempo de reloj por tarea — MiMo-V2.6-Flash 1.320,08 s frente a Claude Haiku 5.5 426,26 s

• Índice de Inteligencia — Claude Haiku 5.5 43.395 vs MiMo-V2.6-Flash 37.884

• Terminal-Bench Hard — Claude Haiku 5.5 0.329 vs MiMo-V2.6-Flash 0.227

Las cinco cifras son de Artificial Analysis, tomadas de las propias páginas de modelos de la clasificación a principios de octubre de 2026, y son los números que hay que usar cuando una decisión tiene que resistir que alguien la revise.

La brecha de costo por tarea es mayor de lo que sugiere la tabla de tarifas, y la razón es la segunda línea. Claude Haiku 5.5 gasta 162.164 tokens de salida al realizar una tarea que MiMo-V2.6-Flash completa en 77.792 — aproximadamente 2,1 veces más tokens, en gran medida porque razona de forma extensa por defecto. Un modelo que es 1,8 veces más barato por token de salida y emite menos de la mitad de ellos por tarea no termina siendo 1,8 veces más barato; termina siendo casi un orden de magnitud más barato en esta suite en particular. Eso es lo más importante de esta página, y ninguna tabla de tarifas en ningún lugar lo publica.

La línea del tiempo real va en sentido contrario y conviene ser honestos al respecto. MiMo-V2.6-Flash tardó 1.320 segundos por tarea frente a los 426 del Haiku —tres veces más—, pese a una velocidad de salida medida superior, de 56,69 tokens por segundo, porque el razonamiento del Haiku no es el cuello de botella en esta suite de la forma en que lo predeciría la tasa bruta de tokens. Si una carga de trabajo está limitada por la latencia y no por el coste, el modelo barato no es automáticamente el adecuado, y la tabla independiente es el único lugar donde existe cualquiera de estas dos cifras.

A screenshot of the Artificial Analysis model page for MiMo-V2.6-Flash, marked 'Open weights model' and 'Released September 2026', showing its Intelligence Index rank of #8 of 117, a speed measured at 56.7 output tokens per second, and the comparison summary.

Dónde se encuentran realmente los quince puntos

43,395 frente a 37,884 es una brecha del quince por ciento en el Intelligence Index, y es el argumento más sólido a favor del Haiku en este enfrentamiento. Que importe depende por completo de la tarea. En Terminal-Bench Hard, los dos son 0,329 y 0,227 —una brecha relativa más amplia, y una que se sitúa en el lado agéntico y de múltiples pasos del tablero, donde una diferencia del quince por ciento en el índice tiende a acumularse hasta convertirse en una diferencia mucho mayor en la finalización de tareas. En los sub-benchmarks de razonamiento general y conocimiento, los dos están más cerca de lo que implica el índice principal, y MiMo-V2.6-Flash está por delante en varios de ellos.

La lectura práctica: en la parte baja de la curva de dificultad, los dos modelos son intercambiables y la diferencia de costo debería decidir. En la parte alta —agentes de horizonte largo, bases de código, cualquier cosa en la que una tarea fallida tenga que volver a ejecutarse—, los quince puntos de Haiku son la diferencia entre una tarea que termina y una tarea que cuesta el mismo dinero dos veces, y la ventaja de costo por tarea del modelo barato puede invertirse de una manera que el promedio de la tabla de clasificación no puede mostrarte. Este es el caso en el que tienes que ejecutar tu propia evaluación en lugar de leer el índice de otro, porque ningún promedio publicado lo resuelve.

Cuánto vale la licencia MIT

MiMo-V2.6-Flash se distribuye bajo la licencia MIT —la menos restrictiva de las licencias abiertas, sin límite de uso comercial y sin cláusula de compartir igual—. Es una concesión más fuerte que la Q​wen Community Licence, y significa que cualquiera que lo desee puede autoalojar, ajustar y redistribuir los pesos MoE de 309B/15B. Para un equipo cuya limitación sea que la inferencia se realice en su propio hardware, o cuyo volumen sea lo bastante alto como para que tener GPUs propias resulte mejor que alquilar tokens, esto no es una nota al pie: es la única línea de la comparación que importa, porque usted no puede ejecutar Claude Haiku 5.5 en absoluto.

También cambia el fallo. Un modelo cerrado servido por un solo proveedor y los socios de nube de ese proveedor se cae cuando ellos se caen; un modelo con licencia MIT con varios hosts independientes puede conmutarse por error entre ellos, siempre que algo se encargue de dicha conmutación. Ninguna de estas es una razón para elegir MiMo-V2.6-Flash para un equipo que quiere una API y nada más. Ambas son decisivas para un equipo que no.

Afirmaciones de proveedores que vale la pena comprobar por tu cuenta

La línea MiMo es de Xiaomi, y Xiaomi informa sus propias cifras de velocidad y calidad en el material de lanzamiento. Esas son cifras del proveedor, no reproducidas en el momento de escribir esto, y la clasificación independiente actualmente mide el modelo por debajo de donde lo situaría el planteamiento del proveedor: 37,884 en el índice, y 0,227 en Terminal-Bench Hard frente a 0,329 para el Haiku. Eso no es una acusación de nada; es la brecha normal entre el propio arnés de pruebas de un proveedor y el de un tercero, y es la razón para etiquetar cuál es cuál cada vez que se repite una cifra.

La comprobación que vale la pena hacer sobre tu propio tráfico cuesta una tarde y resuelve la cuestión mejor que cualquier índice. Ejecuta las mismas veinte tareas con ambos modelos con tus propios prompts, registra los tokens de entrada, los tokens de salida y el tiempo de reloj por tarea para cada uno, y multiplica por las tarifas anteriores. Los cuatro números que lo deciden son todos cosas que puedes medir: tokens de entrada, tokens de salida, segundos y si la tarea tuvo éxito. La cifra de coste por tarea del panel independiente es la imagen para un conjunto genérico; la tuya será distinta, y la diferencia entre ambas suele ser la verbosidad, que es exactamente lo que oculta la tabla de tarifas. Si el razonamiento por defecto de Haiku te está comprando finalizaciones de tareas que de otro modo pagarías por reintentar, es barato a 3,4 veces el precio por tarea. Si no lo es, estás pagando por tokens que no cambiaron la respuesta.

Obtener ambos a través de un solo endpoint

Ni Claude Haiku 5.5 ni X​iaomi MiMo-V2.6-Flash se sirven a través de OrcaRouter: para esos, la propia API del proveedor y varias plataformas de terceros son la vía para conseguirlos. Lo que sí ofrecemos es el resto del reparto: qwen/qwen3.8-flash a $0.15 y $0.47 por millón y z-ai/glm-5.3-flash a $0.15 y $0.50, ambos al precio de lista del proveedor, con la misma clave y la misma factura que un catálogo de más de 200 modelos con precios de traspaso y conmutación automática por error.

Eso importa para esta comparación de una manera concreta: cuando los dos modelos entre los que eliges son aquellos que no puedes enrutar, el desempate suele decidirse ejecutándolos en paralelo con tráfico real —lo que implica mantenerlos disponibles junto a los modelos que sí enrutas, sin un segundo contrato ni un segundo SDK para ninguno de los dos. Pon el candidato en la ruta de producción con un modelo que funcione detrás como respaldo, deja que la solicitud vaya al que elija la capa de enrutamiento y deja que tus propios registros de tokens produzcan el número de costo por tarea que las hojas de tarifas se negaron a darte. La suite del panel independiente es una aproximación; tu carga de trabajo es la medición.

A screenshot of the OrcaRouter models index, headed 'Models — 207 models' with the line '16 providers: one API key, one bill', a filter row for input modalities, context length, input price, status, series and supported parameters, and the first steps of the 'How to call any model' walkthrough.

La llamada

Si la carga de trabajo es de gran volumen, de salida corta y tolera reintentos ocasionales, Xiaomi MiMo-V2.6-Flash es el modelo más barato por un margen más amplio que el que anuncia su tarifa —$0.06231 por tarea frente a $0.2128—, y la licencia MIT te da una vía de escape que el Haiku no tiene. Si la carga de trabajo es de horizonte largo y agéntica, los quince puntos de índice de Claude Haiku 5.5 y la finalización de tareas tres veces más rápida justifican el múltiplo de precio, y la brecha de costos se reduce o se invierte una vez que se cuentan los reintentos.

Lo único que no hay que hacer es elegir basándose únicamente en la tarifa. Dos modelos aquí tienen precios que difieren en un factor de dos por token y quedan a un orden de magnitud de distancia por tarea finalizada, y solo uno de esos números aparece en la página que te muestra el proveedor.

un catálogo de más de 200 modelos

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario