
GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed: la misma maniobra, dos ofertas diferentes
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos laboratorios realizaron la misma maniobra en la misma quincena, y la parte interesante es que la realizaron bajo supuestos opuestos sobre lo que un cliente está comprando. GPT-6 Astra Ultrafast es el producto estrella del proveedor vendido a través del nivel de servicio Ultrafast — el modelo lanzado el 3 de septiembre de 2026, el nivel disponible de forma general desde el 29 de septiembre de 2026, y mencionado en la publicación de NVIDIA del 1 de octubre como ejecutándose en GPU Blackwell. Xiaomi MiMo v2.6 Pro Ultraspeed es la versión de Xiaomi, lanzada el 22 de septiembre de 2026: el mismo checkpoint de 1,02 billones de parámetros que MiMo-V2.6-Pro, servido más rápido, a un ritmo aproximadamente diez veces superior al estándar.
Uno de ellos es la forma más rápida de llamar a un modelo frontera. El otro es el nivel rápido más barato que existe. No son competidores en el sentido habitual —tendrías que escribir una aplicación muy extraña para estar eligiendo entre un buque insignia cerrado de $300 por millón de tokens y un modelo de pesos abiertos de $8.70 por millón de tokens. Lo que hace que la comparación merezca una página es que ambos son niveles de velocidad en lugar de modelos, así que compararlos aísla la única pregunta que plantea un nivel de velocidad: ¿por qué exactamente estás pagando el múltiplo?
Ambos niveles venden la misma no-cosa
Ninguno de los dos nombres es un punto de control. Esta es la parte que la cobertura de lanzamiento tiende a difuminar, así que vale la pena ser meticuloso al respecto.
• Qué indica el nombre — GPT-6 Astra Ultrafast es GPT-6 Astra con el campo de solicitud service_tier: "ultrafast" establecido; el id del modelo en la solicitud sigue siendo gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed es el checkpoint MiMo-V2.6-Pro servido en una ruta más rápida y facturado como una línea propia.
• Qué cambia — el batching, la decodificación especulativa, la asignación de hardware, los límites de concurrencia, el manejo de conexiones. Todo lo que hay entre los pesos y tu solicitud HTTP, y nada dentro de los pesos.
• Lo que no cambia — las respuestas. El mismo checkpoint con la misma configuración debería producir el mismo contenido a una tarifa distinta. Si dos vías del mismo modelo divergen ante una entrada idéntica, eso es un defecto que hay que reportar, no una capacidad que usted haya comprado.
• Por qué eso importa para esta comparación — porque ningún nivel afirma una mejora de rendimiento frente a su propio carril estándar, toda la decisión de compra se reduce a precio por token frente a segundos ahorrados. Lo que significa que los dos acuerdos se deciden por aritmética, no por evaluación.
Sin embargo, hay una asimetría en el planteamiento, y no está en los niveles. UltraSpeed de Xiaomi se asienta sobre un modelo con licencia abierta: los pesos de MiMo-V2.6 llevan una licencia MIT, según las propias tarjetas de modelo de Xiaomi, y la familia se publicó junto con su entorno de entrenamiento de RL. Ultrafast de OpenAI se asienta sobre un modelo insignia cerrado al que solo puedes llegar a través de una API. Pagar un múltiplo de velocidad por pesos abiertos es una decisión reversible; siempre puedes servir el checkpoint tú mismo. Pagar ese múltiplo por un modelo insignia cerrado no lo es.

Los dos múltiplos de precio, y lo que compran
Aquí es donde el par deja de ser simétrico, y las cifras son inusualmente limpias en ambos lados porque cada proveedor fijó el precio como un múltiplo en lugar de un valor absoluto.
• GPT-6 Astra Ultrafast — 60,00 $ por millón de tokens de entrada, 6,00 $ de entrada en caché, 75,00 $ de escritura en caché y 300,00 $ de salida, frente a los 10,00 $ y 50,00 $ del nivel estándar. De forma uniforme, 6,00x en todas las columnas, y sube a 120,00 $ y 450,00 $ por encima de 272.000 tokens de entrada. El nivel estándar ya está disponible en nuestro catálogo al precio de lista de OpenAI, que es la forma más económica de acceder al buque insignia.
• Xiaomi MiMo v2.6 Pro Ultraspeed — $4.35 de entrada y $8.70 de salida por millón de tokens, frente a la tarifa Pro estándar de $0.44 y $0.87. Eso es aproximadamente 9.9x en la entrada y exactamente 10x en la salida.
• Las afirmaciones de velocidad asociadas a esos múltiplos — tanto OpenAI como NVIDIA limitan Astra Ultrafast a "hasta 8x" más de velocidad en la generación de tokens que el modo estándar de Astra. El propio material de Xiaomi afirma una velocidad de salida de hasta 20x respecto al servicio Pro estándar; los listados de catálogos de terceros que describen el mismo modelo el mismo día indican aproximadamente 10x. No se ha publicado ninguna medición que concilie esas dos cifras.
• La relación entre el multiplicador y la velocidad — Con el precio 6x de OpenAI se compra un techo declarado de 8x, por lo que el nivel se sitúa por debajo de su propio mejor escenario. Dependiendo de a quién le creas, con el precio 10x de Xiaomi se compra un techo declarado de 10x a 20x, así que con el techo del proveedor la operación es favorable y con la cifra más baja es un empate absoluto.
Esa es la diferencia más relevante para la decisión entre las dos, y es más estrecha de lo que sugieren los precios destacados. Por unidad de latencia eliminada según las propias afirmaciones de los proveedores, Astra Ultrafast es la mejor de las dos ofertas. Por token de trabajo, Xiaomi UltraSpeed es aproximadamente catorce veces más barato en la entrada y treinta y cuatro veces más barato en la salida frente a las tarifas de Ultrafast, y entre dos y seis veces más barato que el carril estándar de Astra — pero es un modelo diferente, y considerablemente menos capaz, que es el intercambio que en realidad estás haciendo. Las propias fichas de modelo de Xiaomi para la familia publican datos de arquitectura y entrenamiento en lugar de una puntuación agregada independiente, y para él no se ha publicado en absoluto ninguna lectura del índice en el que se mide el buque insignia de OpenAI.

Lo que los dos proveedores eligieron revelar
Los niveles de velocidad son más una prueba de divulgación que una prueba de rendimiento, porque lo que necesitarías para verificar la afirmación —una distribución de latencia a una concurrencia declarada— está enteramente en manos del proveedor.
La publicación de octubre de NVIDIA es la declaración pública más específica que hay detrás del nivel Astra, y lo que aporta es atribución más que medición: GPU Blackwell, disponibilidad en la API de OpenAI y para usuarios elegibles de ChatGPT Work y Codex, y dos ingenieros de OpenAI que describen el bucle. Philippe Tillet, responsable de inferencia de OpenAI, afirma que Astra puede «convertir ese conocimiento en kernels de alto rendimiento que hacen atractivo el hardware de NVIDIA»; Uday Ruddarraju, director de tecnología de cómputo de OpenAI, dice: «usamos nuestros modelos internos para optimizar la inferencia en GPU de NVIDIA». Ninguna de las dos frases incluye una cifra de rendimiento para el nivel. El 8x se sostiene por sí solo, sin más salvedades que «hasta».
La divulgación de Xiaomi fue en la dirección opuesta: publicó la economía del entrenamiento, incluido el entorno de aprendizaje por refuerzo y el código, y sus model cards contienen datos de arquitectura en lugar de datos de servicio. El propio nivel UltraSpeed vino con una afirmación de 20x y ninguna curva de latencia publicada. Lo que significa que, en la cuestión que un nivel de velocidad existe para responder, ambos proveedores son igual de poco útiles, y ese empate es el hallazgo honesto.
Eligiendo, si de verdad tienes que hacerlo
Los dos niveles apenas se solapan, así que la decisión no es tanto elegir un ganador como reconocer cuál de las dos compras es la tuya.
Elige Astra Ultrafast si el trabajo es agéntico y la elección del modelo ya está hecha. Un trabajo de 40 000 tokens de salida pasa de $2.00 a $12.00, y este nivel es la única forma de obtener la calidad de un modelo de frontera a un ritmo más rápido. La propia documentación de OpenAI es explícita sobre la precondición operativa: recomienda WebSockets «especialmente para aplicaciones agénticas que hacen muchas llamadas a herramientas en rápida sucesión», y advierte que «sin una conexión persistente, la sobrecarga de red puede reducir las ganancias de latencia». Si activas este nivel y dejas HTTP por solicitud por debajo, habrás pagado 6 veces más por una fracción de la mejora de velocidad. También conviene saberlo antes de integrarlo: este nivel solo admite residencia de datos en EE. UU. y procesamiento global, sin endpoints de procesamiento regionales en la UE ni en otras regiones fuera de EE. UU., y se lanzó con límites de velocidad iniciales bajos incluso para cuentas que, de otro modo, calificarían para más.
Elige MiMo v2.6 Pro Ultraspeed si el modelo es un insumo básico para una canalización que podrías alojar tú mismo. La licencia MIT significa que el carril Pro estándar no es tu única alternativa: el autoalojamiento lo es. A $4.35 y $8.70 es lo bastante barato como para que merezca la pena habilitar especulativamente un nivel más rápido en lugar de justificarlo tarea por tarea, y su contexto de 1M de tokens iguala al del buque insignia. Ahora bien, entiende lo que estás comprando: una tarifa aproximadamente diez veces mayor por un modelo que va por detrás de la frontera, lo cual es el intercambio correcto para la extracción de gran volumen y el incorrecto para cualquier cosa en la que la calidad de la respuesta condicione el flujo de trabajo.
Ninguno de los dos niveles rápidos está en OrcaRouter, y eso vale la pena afirmarlo en lugar de insinuarlo. Lo que sí está en OrcaRouter es openai/gpt-6-astra — el modelo insignia del nivel estándar, a $10.00 y $50.00 por millón de tokens, con el escalón de contexto largo a $20.00 y $75.00, un contexto de 1,050,000 tokens y una salida máxima de 128,000 tokens, sobre un endpoint compatible con OpenAI. Aquí no se aloja ningún modelo de Xiaomi, así que MiMo-V2.6-Pro y su carril UltraSpeed solo son accesibles a través de la propia API de Xiaomi y de varias plataformas de terceros. El uso práctico de un endpoint con más de 200 modelos en esta comparación no es el acceso a los niveles rápidos. Es que, cuando quieres saber si el carril caro está justificando su múltiplo, puedes enviar el mismo prompt a un modelo más barato con la misma credencial y la misma clave, en la siguiente solicitud, y averiguarlo. Ese es el experimento más barato disponible y es el que responde a la pregunta, porque ningún proveedor ha publicado la curva de latencia que te permitiría responderla sin medir.

La lectura honesta
Ambos proveedores enviaron una tarifa de latencia en las últimas tres semanas, y ninguno envió una medición. Esa simetría es la historia, y tiene una consecuencia práctica: las únicas cifras sobre las que puedes actuar hoy son los precios, y estos son inusualmente informativos porque ambas partes fijaron un múltiplo limpio en lugar de una cifra a medida.
El nivel rápido de OpenAI cuesta seis veces su propia tarifa estándar y afirma un techo de ocho. El de Xiaomi cuesta diez veces su propia tarifa estándar y afirma un techo de entre diez y veinte, según a quién le creas sus cifras. Si se leen como aritmética sobre las propias cifras de los proveedores, los dos vienen a quedar casi en tablas: el nivel de OpenAI compra un techo declarado equivalente a 1,33 unidades de velocidad por unidad de precio; el de Xiaomi compra entre 1,0 y 2,0 según el mismo cálculo, y la razón por la que ambos pueden ser defendibles es que los dos niveles les venden a compradores distintos que nunca considerarían seriamente la opción del otro. Los precios son, además, la única parte de cualquiera de los dos acuerdos que hoy es auditable, ya que una tarifa publicada es un hecho y una afirmación sobre la latencia no lo es.
