
GPT-6 Astra Ultrafast funciona en Blackwell: NVIDIA nombra el hardware detrás del 8x
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El 1 de octubre de 2026, NVIDIA publicó una entrada de Dion Harris titulada «Cómo las GPU de NVIDIA ayudan a acelerar GPT-6 Astra Ultrafast de OpenAI», y la frase en el centro de la misma es la primera vez que cualquiera de las dos compañías dice sobre qué se ejecuta ese nivel: «GPT-6 Astra Ultrafast, que se ejecuta en GPU NVIDIA Blackwell, ya está disponible en la API de OpenAI y para los usuarios elegibles de ChatGPT Work y Codex». Esa es la noticia, y es más limitada de lo que sugiere el titular. GPT-6 Astra, el modelo, se lanzó el 3 de septiembre de 2026. El nivel de servicio Ultrafast sobre él pasó a estar ampliamente disponible el 29 de septiembre de 2026. La afirmación sobre la velocidad —hasta 8 veces más rápida en la generación de tokens que el modo estándar de Astra— ya tenía dos días cuando NVIDIA la repitió.
Lo cual plantea la pregunta que el artículo responde en realidad: no «¿qué tan rápido es?», sino «¿de quién es el silicio?».

Tres cosas que la publicación realmente añadió
Si quitamos la reiteración, la publicación del 1 de octubre aporta tres datos.
• El hardware — Blackwell. La propia documentación de Ultrafast de OpenAI, publicada el 30 de septiembre, describe la velocidad del nivel, su configuración y sus límites de tasa, y no menciona ninguna GPU en absoluto. Por lo tanto, la atribución del silicio se basa en una única fuente: el proveedor del hardware. Eso no hace que sea falso; lo convierte en una afirmación de un proveedor sobre su propio equipo, y vale la pena etiquetarla como tal.
• Dos ingenieros identificados por su nombre — Philippe Tillet, responsable de inferencia de OpenAI, y Uday Ruddarraju, director de tecnología de cómputo de OpenAI, ambos citados oficialmente sobre el origen de la aceleración.
• El público — "usuarios elegibles de ChatGPT Work y Codex", que es más amplio que el enfoque exclusivo para la API con el que se lanzó este nivel. La propia documentación de OpenAI sigue afirmando que Ultrafast para GPT-6 Astra está "disponible para todos los usuarios de la API con límites de velocidad bajos", y esa advertencia sobre los límites bajos no se ha retirado de manera oficial.
Las dos citas, y por qué son la parte interesante
La contribución de Tillet es un bucle en lugar de un benchmark. La inversión de NVIDIA en herramientas y documentación, dice, “nos ha permitido lograr que nuestros modelos sean excepcionalmente buenos programando”, y Astra puede entonces “convertir ese conocimiento en kernels de alto rendimiento que hacen que el hardware de NVIDIA sea atractivo”. Ruddarraju es más directo respecto a la dirección del trabajo: “Usamos nuestros modelos internos para optimizar la inferencia en las GPU de NVIDIA”.
Leído en conjunto, eso es una afirmación sobre el despliegue más que sobre la capacidad: los modelos de frontera de OpenAI son ahora lo bastante buenos escribiendo kernels de GPU como para que OpenAI los use para optimizar su propia pila de servicio. También concuerda con la única sección del artículo de NVIDIA que no trata en absoluto de la semana de lanzamiento —un encabezado que dice «Mejorando continuamente el rendimiento», que sostiene que la inferencia desplegada se vuelve más rápida con el tiempo porque OpenAI sigue dirigiendo sus propios modelos al software de NVIDIA sobre el que se ejecuta.
Nada de esto es una medición. Son dos ingenieros describiendo un proceso, publicado por la empresa que vendió las GPU. La lectura honesta es que el proceso es plausible, barato de creer y no falsable desde fuera —lo cual también es cierto de todas las cifras de velocidad en esta historia.
Blackwell aquí, Cerebras allí
Lo más útil que hace esta publicación es exponer una división que nadie ha explicado. El 13 de agosto de 2026, OpenAI presentó un nivel rápido sobre un modelo diferente —GPT-5.6 Sol ejecutándose "hasta 14×" más rápido— y nombró a Cerebras como el socio detrás de ello, describiendo hardware a escala de oblea que genera hasta 750 tokens de salida por segundo. Siete semanas después, el nivel rápido sobre Astra se ejecuta en Blackwell, y la cifra es 8x.
Dos niveles rápidos, dos respuestas de hardware: una de ellas un socio especializado y la otra el mayor proveedor de la propia empresa. Ninguno de los dos proveedores ha publicado una comparación entre las dos vías de servicio, y ningún evaluador independiente ha medido ninguna de ellas. Obsérvese también qué hace la publicación de NVIDIA con el segundo nombre: «Rubin» aparece una sola vez, dentro de la cita de Tillet sobre modelos que escriben kernels para «las GPU Blackwell y Rubin». Es una afirmación sobre lo que los modelos de OpenAI pueden programar, no una afirmación de que algo esté dando servicio en Rubin hoy en día.
El número que NVIDIA no imprimió
Hay una cifra en esta historia que ninguna de las dos compañías ha puesto junto al 8x, y es la que decide si un equipo activa el nivel. La tabla de tarifas Ultrafast publicada por OpenAI enumera gpt-6-astra a $60.00 por millón de tokens de entrada, $6.00 de entrada en caché, $75.00 de escritura en caché y $300.00 de salida. El mismo modelo en el nivel estándar está a $10.00 y $50.00, con la entrada en caché a $1.00 y la escritura en caché a $12.50. Cada columna es exactamente seis veces la tarifa estándar.
• El multiplicador — 6,00x en entrada, salida, entrada en caché y escritura en caché. No "hasta". Seis.
• El techo — 8x, la cifra que ambos proveedores citan con el «hasta» pegado y sin condiciones especificadas.
• Qué significa eso — el múltiplo de precio se sitúa por debajo del mejor caso declarado por el propio nivel. En el límite superior, el intercambio es favorable; con cualquier cosa por debajo de 6x en tu tráfico, estás pagando más por unidad de tiempo ahorrado de lo que implica el marketing. Por eso, la única prueba significativa de este nivel es una medición en tus propias solicitudes.
• El tramo de contexto largo — por encima de 272,000 tokens de entrada, las tarifas de Ultrafast pasan a ser $120.00 de entrada y $450.00 de salida, seis veces las propias tarifas escalonadas del nivel estándar.
• La letra pequeña operativa — OpenAI documenta una escalera de tokens por minuto de Ultrafast de 500.000 para los niveles de uso 1 a 3, 1.000.000 para el nivel 4 y 5.000.000 para el nivel 5; Ultrafast solo admite residencia de datos en EE. UU. y procesamiento global, sin ningún endpoint de procesamiento regional en la UE ni en otras regiones fuera de EE. UU.; y la documentación recomienda WebSockets para Ultrafast, «especialmente para aplicaciones agénticas que realizan muchas llamadas a herramientas en rápida sucesión», y advierte que «sin una conexión persistente, la sobrecarga de red puede reducir las ganancias de latencia».

Ese último punto es el que hay que atender. Un equipo que habilita el nivel y deja HTTP por solicitud por debajo de él ha pagado seis veces la tarifa para devolver parte del aumento de velocidad al establecimiento de conexión: una forma documentada y evitable de desperdiciar el dinero.
Cómo se ve esto desde un único endpoint
GPT-6 Astra está en OrcaRouter como openai/gpt-6-astra: una ventana de contexto de 1.050.000 tokens, hasta 128.000 tokens de salida, entradas de texto, imagen y archivos, y el precio de lista de OpenAI transferido directamente a 10,00 $ de entrada y 50,00 $ de salida por millón de tokens, pasando a 20,00 $ y 75,00 $ por encima de 272.000 tokens de entrada. Su benchmark destacado del catálogo es 96,1 en GPQA Diamond.
El nivel Ultrafast no está en OrcaRouter, y no puede estarlo: es un atributo de acceso controlado de una cuenta de OpenAI más que un id de modelo, y por eso openai/gpt-6-astra-ultrafast devuelve modelo no encontrado. Si activas el nivel, este vive en tu integración directa con OpenAI. Lo que un endpoint con más de 200 modelos con 0 % de margen te ofrece en esta situación no es la vía rápida, sino el control. Como el precio de lista del proveedor se transfiere en lugar de aplicar un margen, un cambio de tarifas de OpenAI llega a nuestro lado el mismo día que llega al suyo, y como la vía estándar de Astra ya está ahí, el experimento que resuelve esta decisión es una línea de configuración: el mismo prompt, el nivel estándar y un modelo más barato al lado, con la misma clave. Eso es lo más parecido a un benchmark de latencia que la mayoría de los equipos llegará a hacer, y no cuesta nada configurarlo.

¿Qué todavía no se ha medido?
Hay tres cosas que se pueden comprobar hoy. El nivel existe, aparece en la tarifa a exactamente seis veces la tarifa estándar y, desde el 1 de octubre, se atribuye públicamente a las GPU NVIDIA Blackwell.
Una cosa no lo es: el multiplicador de tu tráfico. Ningún proveedor ha publicado una distribución de latencia para el nivel de servicio con un nivel de concurrencia declarado, y ningún tercero ha reproducido el 8x. Tampoco hay ningún benchmark que compare Astra en Ultrafast con Astra en estándar, y no debería haber uno favorable — es el mismo checkpoint en una ruta más rápida, así que ajustes idénticos deberían producir respuestas idénticas a distintas velocidades. Si tus dos carriles divergen con los mismos prompts, tienes un informe de bug, no una funcionalidad.
Así que el resumen útil del 1 de octubre es más modesto de lo que da a entender el anuncio. Es la misma gama al mismo precio con el mismo techo de velocidad no verificado, ahora con una etiqueta de hardware. Esa etiqueta importa: te dice en qué línea de aceleradores está escalando OpenAI esto, y te dice que la historia de la gama rápida ha pasado de un socio especializado al mayor proveedor de GPU de la industria en menos de dos meses. Simplemente no te dice nada sobre tu propio presupuesto de latencia, y ninguna publicación lo va a hacer.
