
GPT-6 Astra Ultrafast a 6x: lo que la tarifa publicada realmente te cuesta
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 210 tok/s
- OrcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
GPT-6 Astra Ultrafast dejó de ser una lista de espera el 29 de septiembre de 2026. Ahora es un nivel de servicio comprable con un precio publicado, y ese precio es exactamente seis veces el estándar en cada una de las líneas. El modelo subyacente —GPT-6 Astra, el buque insignia de la compañía, lanzado el 3 de septiembre de 2026— no ha cambiado; lo que cambió en DevDay es que la vía rápida sobre él pasó a estar disponible de forma general, y la documentación de la API de la compañía ahora dice claramente que Ultrafast «está ampliamente disponible para GPT-6 Astra, con acceso de vista previa para GPT-5.6 Sol». Por primera vez, puedes poner este nivel en una línea de presupuesto, y el número que debes poner ahí es $60.00 por millón de tokens de entrada y $300.00 por millón de tokens de salida, tomado de la propia página de precios de la compañía el 30 de septiembre de 2026.
Eso hace que esta sea una pregunta distinta de la que respondió la cobertura del lanzamiento. El dato interesante de esta semana no es que el nivel exista — la vista previa se anunció el 13 de agosto de 2026 y se cubrió hasta la saciedad. El dato interesante es que un nivel que no tenía precio ahora lo tiene, y la aritmética que se deriva de ello es poco halagüeña de una manera específica y cuantificable. Seis veces no es un sobreprecio que uno absorba con un encogimiento de hombros; es un sobreprecio que hay que recuperar en menos turnos, y que puedas hacerlo es una propiedad de tu carga de trabajo más que del modelo.
Las múltiples retenciones en cada línea, y eso es lo primero que hay que entender.
Al leer la página de precios de OpenAI el 30 de septiembre de 2026, la columna Ultrafast para GPT-6 Astra es un 6x plano de la columna Standard, en lugar de un recargo en algunas líneas y no en otras. Eso importa, porque significa que no puedes optimizar para librarte de ello cambiando la forma de tus solicitudes.
• GPT-6 Astra, Servicio estándar, solicitudes de hasta 272.000 tokens de entrada — $10,00 entrada, $1,00 entrada en caché, $12,50 escrituras en caché, $50,00 salida, por 1 millón de tokens.
• GPT-6 Astra Ultrafast, mismo umbral — $60.00 de entrada, $6.00 de entrada en caché, $75.00 de escrituras en caché, $300.00 de salida, por 1M de tokens. Exactamente 6x en las cuatro líneas.
• Por encima de 272,000 tokens de entrada, toda la solicitud se vuelve a tarificar — Standard pasa a $20.00 / $2.00 / $25.00 / $75.00, Ultrafast a $120.00 / $12.00 / $150.00 / $450.00. Sigue siendo 6x. La regla de contexto largo que OpenAI documenta para GPT-6 Astra es 2x en las tarifas de entrada y de caché con 1.5x en la salida sobre la solicitud completa una vez que se cruza el umbral, y se aplica de forma idéntica a ambos niveles.
• Los otros niveles de la misma tarjeta — Batch y Flex son el 50 % de Standard, y el modo Fast es 2 veces Standard. Así que la escala de multiplicadores de este modelo va de 0,5x, 1x, 2x, 6x, sin ningún peldaño entre los dos últimos.
No existe un equivalente Ultrafast de Batch. Batch y Flex son descuentos que se compran con una programación más laxa en la vía estándar; no hay una versión lenta y barata de la vía rápida. Si quieres la velocidad, pagas el 6x por cada token que envías y cada token que recibes, y no hay ninguna mezcla de entrada en caché y entrada nueva que mejore la proporción.

Lo que realmente cuesta una llamada
La abstracción resulta más fácil de razonar con dos solicitudes concretas. Ambas usan las tarifas por millón publicadas por OpenAI; la aritmética es nuestra.
Una llamada única con 20,000 tokens de entrada y una respuesta de 2,000 tokens cuesta $0.30 en Standard — 20,000 tokens a $10 por millón son $0.20, más 2,000 a $50 por millón son $0.10. La misma llamada en Ultrafast cuesta $1.80. Exactamente seis veces, como se anuncia.
Ahora el caso que realmente describe un bucle de agente: una conversación de 200.000 tokens donde 190.000 tokens son un prefijo en caché y solo 10.000 son nuevos, lo que produce un paso de 1.000 tokens. Standard cobra $0,19 por la lectura en caché, $0,10 por la entrada nueva y $0,05 por la salida — $0,34 por paso. Ultrafast cobra $1,14, $0,60 y $0,30 — $2,04 por paso. De nuevo, 6x, pero observa lo que hizo la mezcla: el almacenamiento en caché es la palanca de costes más eficaz en este modelo y aun así es exactamente 6x más barato en el carril estándar, así que un agente con uso intensivo de caché no gana nada proporcionalmente del nivel rápido y tampoco suaviza el sobrecoste.
La consecuencia es la parte que vale la pena interiorizar. Como el multiplicador es constante, el punto de equilibrio no tiene nada que ver con tu combinación de tokens. Tiene que ver enteramente con el número de turnos. Ultrafast se amortiza en una carga de trabajo solo cuando ejecutarlo reduce el número de turnos facturados en aproximadamente un factor de seis —ya sea colapsando un bucle de reintentos en una sola pasada, o reemplazando una secuencia de llamadas cortas de aclaración con una única sesión interactiva más rápida. Si tu carga de trabajo emite el mismo número de turnos que antes, solo que más pronto, estás comprando latencia a exactamente 6x y nada más.
Los límites de tasa y la geografía son los techos no anunciados
Dos restricciones quedan fuera del precio y son fáciles de pasar por alto cuando se lee un tarifario.
Lo primero es el rendimiento. Ultrafast para GPT-6 Astra está disponible para todos los usuarios de la API, pero inicialmente con límites de velocidad bajos: OpenAI documenta 500.000 tokens por minuto para los niveles 1 a 3, 1.000.000 para el nivel 4 y 5.000.000 para el nivel 5. Para un nivel que se vende por su velocidad, eso es un techo real: un contexto de agente de 200.000 tokens a medio millón de tokens por minuto son dos solicitudes y media por minuto en un nivel bajo. La propia guía de OpenAI apunta al mismo problema desde el otro lado y recomienda encarecidamente WebSockets precisamente porque la sobrecarga de red por solicitud puede comerse la latencia por la que se está pagando en ese nivel.
El segundo es la residencia. Ultrafast solo admite residencia de datos en EE. UU. y procesamiento global. No admite endpoints de procesamiento regionales de la UE ni de otras regiones fuera de EE. UU. Si su implementación depende de un endpoint de residencia en la UE para GPT-6 Astra, este nivel no está disponible para usted a ningún precio, y se trata de un límite infranqueable, no de una opción de configuración. Tenga en cuenta también que los endpoints de residencia conllevan un recargo del 10 % para los modelos publicados a partir del 5 de marzo de 2026, y GPT-6 Astra lo es.
El titular sobre la velocidad bajó de 14x a 8x
Vale la pena decirlo con cuidado, porque la cifra que circula en la mayoría de las coberturas está desactualizada. La página de documentación de Ultrafast de OpenAI, tal como está publicada hoy, incluye la frase «nuestro nivel de servicio de API más rápido, con velocidades hasta 8 veces superiores al modo Estándar». El anuncio de vista previa del 13 de agosto de 2026 para GPT-5.6 Sol prometía «hasta 14 veces más rápido que el procesamiento Estándar» y hasta 750 tokens de salida por segundo en hardware de Cerebras.
No son la misma afirmación, y la diferencia no es tanto una retractación como un cambio de tema. La cifra de 14x se midió en GPT-5.6 Sol en una vista previa limitada; la cifra de 8x es la que OpenAI publica para el nivel tal como está ahora, con GPT-6 Astra como su modelo disponible de forma general. Cualquiera que presupueste con base en 14x para Astra está presupuestando con base en un número que OpenAI no ha publicado para Astra. La lectura honesta es que ambas cifras son techos reportados por el proveedor sobre el rendimiento de salida, que ninguna constituye una garantía de latencia para su carga de trabajo, y que el tiempo de extremo a extremo aún incluye el procesamiento de entrada, las llamadas a herramientas y su propia orquestación. Trate 8x como la cifra de planificación y trate cualquier cosa mejor como un bono que verifica con su propio tráfico en lugar de darlo por sentado.
¿Qué hacer con esto el lunes?
La regla de decisión que se desprende de la aritmética es más limitada de lo que sugiere el marketing, y vale la pena dejarla por escrito antes de que alguien proponga habilitar Ultrafast en todo un parque.
Actívalo cuando la carga de trabajo esté limitada por la latencia y sea interactiva, y cuando haya una persona esperando. El triaje de incidentes, una escalada de soporte en vivo, un bucle de investigación en el que un analista itera dentro de una misma sesión: estos son los casos en los que el valor de que la respuesta llegue ahora y no dentro de cuatro minutos no es proporcional al precio por token, y en los que una factura 6 veces mayor en un pequeño número de turnos es trivialmente menor que el coste de la persona que espera. Los propios ejemplos de OpenAI en el anuncio de la vista previa eran exactamente de esta forma: leer registros mientras se desarrolla una caída del servicio, convertir un bucle de investigación nocturno en una sesión de trabajo.
Déjalo desactivado cuando la carga de trabajo esté limitada por el throughput o tenga forma de lote. Una reindexación nocturna, una pasada de clasificación masiva, un informe programado, un backfill: a ninguno de ellos le importa la latencia de reloj, todos están dominados por el recuento de tokens, y todos tienen una opción de 0,5x justo ahí, en la misma tarifa, en Batch y Flex. Pagar 12 veces la tarifa por lotes para terminar antes es la forma más clara de desperdiciar dinero en esta tabla.
El incómodo punto medio es el bucle de codificación agéntica, y ahí es donde la aritmética del recuento de turnos lo decide. Si la velocidad elimina de verdad los reintentos —si la primera pasada del modelo en un cambio de varios archivos acierta más a menudo porque no está luchando contra un tiempo de espera—, entonces Ultrafast puede salir más barato por tarea completada a pesar de costar 6x por token. Esa es una afirmación medible sobre tus propias trazas, no una afirmación general, y la medición es barata: cuenta los turnos facturados por tarea completada en ambos niveles y multiplícalos por la tarifa. Si la proporción no se acerca a seis, el nivel rápido es una compra de latencia y debería justificarse como tal.
El nivel tiene precio; las rutas a su alrededor no son la misma cuestión.
Una nota práctica sobre cómo manejar esto. GPT-6 Astra en servicio estándar ya está disponible en OrcaRouter como openai/gpt-6-astra a la tarifa del propio proveedor: $10.00 de entrada y $50.00 de salida por millón de tokens, con el tramo de contexto largo de 272K a $20.00 / $75.00; se sirve con un 0% de margen, lo que significa que el precio de lista del proveedor se traslada tal cual y cualquier movimiento del proveedor llega a tu factura el mismo día en que llega a la tarjeta de precios de OpenAI, en lugar de en tu próxima renovación de contrato. La misma clave da acceso a más de 200 modelos, así que el nivel estándar puede estar detrás del mismo cliente que el nivel económico o el modelo de un competidor, sin necesidad de una segunda integración.
Lo que no hacemos es servir el nivel Ultrafast. Es una marca de nivel de servicio en una cuenta de OpenAI, más que un modelo enrutable por separado: tú estableces service_tier: "ultrafast" en una solicitud a gpt-6-astra — y OpenAI lo factura a tu propia cuenta según las tarifas indicadas arriba. Si lo habilitas, reside en tu integración directa con OpenAI, y OrcaRouter es el lugar adecuado para el tráfico de nivel estándar que enrutes junto a él. Decirlo con claridad es más útil que insinuar una capacidad que no tenemos.

La regla de decisión, en un párrafo
Seis veces es el precio de un nivel, no el precio de un modelo: los pesos, la ventana de contexto de 1.050.000 tokens, el límite de salida de 128.000 tokens y las respuestas son idénticos al GPT-6 Astra estándar. Lo que estás comprando es un rendimiento de salida hasta 8 veces más rápido, con una tarifa que es 6 veces en cada línea, sujeta a límites de velocidad iniciales bajos y una restricción de residencia en EE. UU. que excluye por completo a la UE. Ese intercambio es obviamente correcto para una persona que espera una respuesta, obviamente incorrecto para un trabajo por lotes programado que tiene disponible una vía a mitad de precio, y genuinamente indeciso para bucles agénticos donde la respuesta depende de si la velocidad elimina turnos. Mide el número de turnos en tus propias trazas antes de comprometerte, y enruta el resto a precio de lista.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
