Ilustración editorial de vector plano para el hero de un blog de tecnología sobre inferencia de IA ultrarrápida: un gran chip de modelo redondeado en azul profundo con un suave resplandor cian sobre un fondo claro, un rayo estilizado y un dial de velocidad con la aguja al máximo a su lado, rápidas corrientes de tokens que avanzan a lo largo de una línea de velocidad horizontal con líneas de movimiento, y un pequeño cronómetro. Fondo blanco con suaves acentos de degradado azul y cian y un sutil resaltado cálido; iconos minimalistas de línea plana; tipografía geométrica moderna limpia sin serifa; sin texto legible, sin letras, sin palabras, sin marca de agua, sin logotipos de terceros, composición 16:9.
Guides & Insights

GPT-5.6 Sol Ultrafast: Ultrafast se lanzó a 6× del precio estándar, pero este modelo sigue siendo solo de vista previa

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La espera terminó para el nivel, pero no para este modelo. En el DevDay del 29 de septiembre de 2026, el proveedor convirtió Ultrafast en algo que se puede comprar: el nuevo plan ChatGPT Pro 500 a $500 al mes lo incluye, la API ahora publica una tarifa de Ultrafast a seis veces la tarifa estándar — $60.00 de entrada / $300.00 de salida por millón de tokens en GPT-6 Astra — y la documentación de Codex del proveedor confirma que los niveles Pro no tienen ningún límite de uso de cinco horas, una ventana que se aplica a Plus. Todo eso lo declara el proveedor, publicado en su propio resumen de DevDay, páginas de ayuda y documentación para desarrolladores. Lo que no ha cambiado es el modelo del que trata esta página. GPT-5.6 Sol Ultrafast, anunciado el 13 de agosto de 2026 como el nivel de servicio acelerado por Cerebras para GPT-5.6 Sol a una velocidad de hasta 14× la estándar y 750 tokens de salida por segundo, sigue siendo solo de acceso preview — gestionado a través del equipo de cuentas del proveedor — y todavía no tiene un precio publicado propio. El nivel se lanzó. La variante Sol sigue esperando.

Dos movimientos de precios se produjeron desde que escribimos esto por primera vez, y apuntan en direcciones opuestas. El modelo subyacente se abarató: el GPT-5.6 Sol estándar ahora se factura a $4.00 por millón de tokens de entrada y $20.00 por millón de salida —la tarifa promocional de OpenAI, que el proveedor dice que estará disponible al menos hasta el 21 de noviembre de 2026—, no los $5.00 / $30.00 vigentes en agosto. El nivel de velocidad que se le añade recibió un precio por primera vez, y no es barato: Ultrafast en GPT-6 Astra se factura a $60.00 / $300.00 por millón. Todas las cifras de este artículo se volvieron a verificar con la tarjeta de tarifas publicada por OpenAI, su referencia de la API y su documentación de precios de Codex el 2026-09-30.

Lo que realmente es el modo Ultrafast

Ultrafast es un nivel de servicio, no un modelo nuevo. OpenAI lo anunció el 13 de agosto de 2026 como el primer producto de su asociación de cómputo de enero de 2026 con el fabricante de chips Cerebras — un acuerdo valorado en aproximadamente 10 000 millones de dólares a lo largo de tres años. Mientras que la inferencia estándar de GPT-5.6 Sol se ejecuta en clústeres de GPU y pasa buena parte de su tiempo moviendo pesos entre la memoria y el cómputo, Ultrafast carga los pesos del modelo en 44 GB de SRAM en chip sobre los chips de escala de oblea de Cerebras; un modelo del tamaño de Sol abarca varias obleas en capas, de modo que los pesos quedan donde está el cómputo. El resultado es un techo de rendimiento determinado por el silicio y no por el ancho de banda de memoria.

La historia del hardware avanzó el 18 de agosto de 2026. En su evento Supernova, Cerebras presentó el CS-4, el sistema a escala de rack de próxima generación construido sobre su plataforma Nexus: tres chips Wafer-Scale Engine por rack, hasta 2 veces la velocidad de generación de tokens del CS-3 anterior y, según Cerebras, más de 1.000 tokens por segundo en modelos de más de 10 billones de parámetros. Son afirmaciones de Cerebras sobre un sistema en acceso anticipado, aún no disponible de forma general. Desde la presentación, una sola publicación en X afirma que el CS-4 ya sirve GPT-5.6 Sol a aproximadamente 1.300 tokens por segundo, lo que va en la misma dirección que las propias cifras de Cerebras, pero que nadie ha confirmado hasta ahora. Trátala como una señal temprana: plausible, no verificada y digna de volver a comprobar antes de planificar capacidad en torno a ella.

La parte que importa para tu código: el id del modelo, los pesos, el comportamiento de razonamiento y la salida son idénticos al GPT-5.6 Sol estándar. OpenAI presenta Ultrafast como "más trabajo útil por segundo" en lugar de un nivel de calidad, y la vista previa ejecuta el modelo insignia completo: la velocidad no proviene de cambiar a un modelo más barato. Lo que cambia es la rapidez con la que salen los tokens.

No confundas Ultrafast con el modo rápido. El modo rápido es un nivel aparte y comprable en hardware estándar: hasta aproximadamente 2,5× la velocidad de salida con un recargo de 2× por token, sin cambios en la calidad — se renombró de Priority Processing el 30 de julio de 2026 y, en GPT-5.6 Sol, cuesta $8,00 de entrada / $40,00 de salida por 1M. Ultrafast es algo distinto: hardware de Cerebras, hasta 14× en GPT-5.6 Sol y hasta 8× en GPT-6 Astra, cuesta 6× la tarifa estándar en Astra y todavía no tiene precio en Sol. Los dos nombres ahora aparecen uno al lado del otro en el mismo selector de modelos, que sigue siendo lo más confuso de este lanzamiento.

Qué tan rápido — los números que importan

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

La cifra principal es 14×, y necesita una definición. OpenAI dice que Ultrafast genera hasta 750 tokens de salida por segundo frente al procesamiento estándar de GPT-5.6 Sol. Ese es un número de rendimiento para tokens de salida, no una afirmación simplista de que "todo funciona 14× más rápido" — el tiempo de solicitud de extremo a extremo también incluye el procesamiento de entrada y el razonamiento del propio modelo, por lo que 14× se etiqueta como un máximo.

• Rendimiento máximo de salida — de hasta 750 tokens de salida por segundo, según el anuncio de OpenAI (2026-08-13).

• Frente al procesamiento estándar — hasta 14× más rápido, según el mismo anuncio; las ganancias reales varían según la longitud de la entrada y el tipo de tarea.

• Humanity's Last Exam, 2.500 preguntas — OpenAI/Cerebras informan que GPT-5.6 Sol Ultrafast termina en 11 horas y 11 minutos, frente a 78 horas y 27 minutos de Claude Fable 5, con una precisión comparable. Datos reportados por el proveedor, y la comparación abarca los stacks de hardware de dos proveedores: léelo como orientativo, no como un veredicto.

• GDP-Val, de extremo a extremo — Cerebras informa que es 5,6× más rápido en general, sin ninguna pérdida de calidad medible. También reportado por el proveedor.

• Comparación entre el modo Fast y Ultrafast: el modo Fast alcanza como máximo aproximadamente 2,5× la velocidad de salida a cambio de un precio 2× superior, con el mismo límite de ~272K tokens que el precio estándar. Ultrafast es el mayor salto: 14× en GPT-5.6 Sol según el anuncio de agosto, y hasta 8× en GPT-6 Astra en Codex según la documentación actual de OpenAI, y la cobertura de lanzamiento lo sitúa en hasta 300 tokens de salida por segundo.

• CS-4, el próximo hardware: Cerebras afirma que el rack CS-4 ofrece más de 1,000 tokens por segundo en modelos de más de 10 billones de parámetros, hasta 2× la generación de tokens del CS-3. Un informe no verificado de la comunidad sitúa a GPT-5.6 Sol en CS-4 en ~1,300 tokens por segundo — misma dirección, aún no confirmado por OpenAI ni Cerebras.

Una advertencia antes de que cites el 14×: es un techo de rendimiento de salida en el hardware de un proveedor, y las comparaciones independientes del lanzamiento de agosto oscilaron entre aproximadamente 7× y 11× según qué parte de una carga de trabajo se midiera. La misma disciplina se aplica a la señal de velocidad de CS-4 —la cifra de ~1300 tokens/s para GPT-5.6 Sol en CS-4 comenzó como una sola publicación en X, y ni OpenAI ni Cerebras la han confirmado. Considera todo esto como afirmaciones de proveedores y de la comunidad, no como veredictos de benchmarks.

Lo que cuesta Ultrafast ahora — y por qué eso todavía no le pone precio a Sol

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Este es el estado de la cuestión de precios al 2026-09-30, dicho sin rodeos. Ultrafast tiene una tarifa publicada —para GPT-6 Astra, y solo para GPT-6 Astra. La página de precios de OpenAI ahora incluye una columna Ultrafast junto a Standard, Batch, Flex y Fast: $60.00 de entrada / $6.00 de entrada en caché / $75.00 de escrituras en caché / $300.00 de salida por millón de tokens en contexto corto, duplicándose a $120.00 / $12.00 / $150.00 / $450.00 más allá de aproximadamente 272K tokens. Eso es seis veces la tarifa estándar de Astra, mientras que el modo Fast es dos veces, y es la primera cifra concreta que OpenAI ha puesto a este nivel. La tarjeta de arriba es nuestra propia instantánea del 2026-08-18, y sus cifras en dólares quedan superadas por partida doble, por el recorte de la tarifa estándar y ahora por esta fila de Ultrafast. Lo que aún falta en esa tabla es cualquier tarifa de Ultrafast para GPT-5.6 Sol: la columna Ultrafast enumera exactamente un modelo, gpt-6-astra. El nivel tiene precio; este modelo no.

Lo que puedes cotizar hoy, modelo por modelo:

• GPT-5.6 Sol estándar — 4,00 $ de entrada / 20,00 $ de salida por cada millón de tokens, para prompts de hasta aproximadamente 272K tokens. OpenAI lo indica como precio promocional disponible al menos hasta el 21 de noviembre de 2026. Este es el modelo base que puedes invocar ahora mismo.

• Modo rápido — $8.00 / $40.00 con contexto corto en GPT-5.6 Sol, duplicándose a $16.00 / $60.00 a partir de aproximadamente 272K tokens. El doble de la tarifa estándar por hasta aproximadamente 2.5× la velocidad de salida y, en Sol, sigue siendo lo más rápido que se puede comprar realmente.

• Caché de prompts — las lecturas de caché se facturan a $0.40 por 1M (90% de descuento sobre la entrada nueva); las escrituras de caché se facturan a $5.00 por 1M.

• Nivel de contexto largo — las entradas que superan aproximadamente los 272K tokens se facturan a $8.00 / $30.00 con procesamiento estándar, dentro de la ventana de ~1.05M tokens del modelo y de la salida máxima de 128K tokens.

• Batch API — $2.00 / $10.00 para contexto corto y $4.00 / $15.00 para contexto largo, un 50% de descuento fijo con un plazo de aproximadamente 24 horas.

Para GPT-5.6 Sol, el número de Astra es la mejor pista disponible y nada más. OpenAI fija el precio de Ultrafast en 6× la tarifa estándar del modelo subyacente; aplica ese multiplicador a los $4 / $20 de Sol y llegas a $24 / $120 por millón. Eso es aritmética, no un precio publicado: OpenAI no ha dicho nada sobre una tarifa de Sol Ultrafast, y a las cohortes de la preview de agosto no se les facturó a una tarifa por niveles en absoluto. Planifica con el Sol estándar a $4 / $20 o el modo rápido a $8 / $40 hasta que el proveedor publique la fila.

Cómo usarlo — ampliamente disponible en Astra, todavía bajo solicitud para Sol

El acceso se dividió en dos el 29 de septiembre, y la división va en contra del modelo que cubre esta página. Ultrafast ahora está ampliamente disponible en GPT-6 Astra: la documentación de la API de OpenAI dice que está abierto a todos los usuarios de la API con límites de velocidad bajos —500.000 tokens por minuto en los niveles de uso 1–3, 1 millón en el nivel 4, 5 millones en el nivel 5— y se incluye dentro de ChatGPT Work y Codex en el nuevo plan Pro 500 y en los planes Enterprise y Edu elegibles, donde el propietario de un espacio de trabajo tiene que activarlo, y donde no es compatible con espacios de trabajo que requieren inferencia fuera de Estados Unidos. GPT-5.6 Sol Ultrafast no se movió junto con él. La misma documentación todavía lo describe como acceso de vista previa a través de un equipo de cuentas de OpenAI, y la propia descripción del parámetro en el esquema de la API todavía dice «currently available for gpt-5.6-sol» —una línea que ahora va por detrás del resto de la documentación en lugar de ir por delante. Si quieres el nivel hoy, lo quieres en Astra.

La cuestión de la interfaz también está resuelta. TestingCatalog informó el 26 de septiembre de 2026 de que un selector de velocidad que ofrecía Estándar, Rápida y Ultrarrápida permanecía sin publicar en el Responses API Playground; tres días después, OpenAI lanzó la versión para consumidores de exactamente eso, con Ultrarrápida ahora como opción en el selector de modelos de ChatGPT Work y Codex en Pro 500. Señalamos ese avistamiento como la interpretación de una publicación sobre una interfaz de usuario no lanzada y dijimos que OpenAI no había confirmado nada de eso. Acertó en la dirección, y el despliegue al que apuntaba llegó en DevDay, no después de él.

Los grupos de vista previa que OpenAI nombró en agosto eran de programación, comercio, investigación financiera, soporte y otras cargas de trabajo interactivas: equipos cuyos agentes realizan muchas llamadas por solicitud y donde la latencia de respuesta es el cuello de botella. Jane Street, Rogo y Podium estuvieron entre los primeros evaluadores nombrados. Si tu carga de trabajo es un chat de un solo turno, el nivel de velocidad importa mucho menos que para un bucle de agente de 40 llamadas. La respuesta práctica ahora depende del modelo por el que preguntes: en GPT-6 Astra puedes establecer service_tier: "ultrafast" esta tarde, y en GPT-5.6 Sol todavía no puedes.

Lo que puedes hacer hoy — la respuesta práctica

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Mientras GPT-5.6 Sol Ultrafast sigue tras la puerta de vista previa, ambos modelos insignia están activos en OrcaRouter a la tarifa del proveedor con $0 de margen por token — ID de modelo openai/gpt-5.6-sol a través del endpoint compatible con OpenAI en api.orcarouter.ai/v1, y GPT-6 Astra junto a él al estándar de $10.00 / $50.00, que es el modelo sobre el que OpenAI ahora ha añadido un nivel Ultrafast y que nosotros no enrutamos en ese nivel. La captura de abajo es de agosto de 2026 y todavía muestra la línea de $5.00 / $30.00 vigente entonces; la tarifa actual de Sol es $4.00 / $20.00, que es lo que repercutimos tal cual. Esa repercusión directa es la razón por la que los cambios de precio del proveedor llegan a nuestro lado el mismo día: $4.00 de entrada / $20.00 de salida, las mismas cifras que publica OpenAI, sin ningún margen por token añadido. Si ya tienes un cliente de OpenAI, la migración consiste en cambiar la URL base y el ID del modelo; nada más. La misma clave y el mismo endpoint sirven más de 200 modelos, así que Sol está junto a sus propios hermanos — GPT-5.6 Terra a $2.00 / $12.00 y GPT-5.6 Luna a $0.20 / $1.20 — y los modelos de pesos abiertos con los que lo compararías, y puedes enrutar según la dificultad en lugar de reintegrar cada uno.

Dos detalles específicos de OrcaRouter vale la pena mencionar en una página de velocidad. BYOK: trae tu propia clave de OpenAI y OpenAI te factura directamente a sus propias tarifas — OrcaRouter agrega $0 por token y mantiene intactos los límites de velocidad y los créditos de tu proveedor. Guardrails: el PII Shield y la política de contenido se ejecutan antes de la facturación, así que una solicitud bloqueada devuelve un 400 limpio y nunca se cobra, y el Agent Firewall evalúa las llamadas de herramientas y de MCP antes de que se ejecuten. Ultrafast en sí está ampliamente disponible en GPT-6 Astra, pero no en términos enrutables y no para Sol — es un nivel con control de acceso facturado a 6× la tarifa estándar, y nosotros no lo servimos. Si OpenAI alguna vez lo ofrece en términos estándar, conectarlo al mismo endpoint es un cambio de model-id; la configuración que construyas hoy se conserva.

El límite honesto — cuando Ultrafast no es la respuesta

Cinco puntos en los que el relato de la velocidad todavía no se sostiene, ahora que la mitad de él se ha asentado:

Disponible no es lo mismo que disponible para ti. Ultrafast se abrió a todos los usuarios de la API en GPT-6 Astra, pero se abrió con límites de tasa bajos, todavía se describe como de acceso controlado en el esquema de OpenAI, no admite procesamiento regional en la UE ni en otras regiones fuera de EE. UU., y en los espacios de trabajo de Enterprise está desactivado hasta que un propietario lo habilita. En GPT-5.6 Sol no se abrió nada en absoluto. Comprueba tu propio acceso antes de diseñar tu arquitectura sobre cualquiera de los dos.

14× es un máximo, no una garantía. Es un techo de rendimiento de salida en el hardware de Cerebras; la latencia de extremo a extremo sigue incluyendo el procesamiento de entrada, el tiempo de razonamiento del modelo y tu propia red. Un prompt con mucha carga de razonamiento puede pasar la mayor parte de su tiempo de reloj pensando, y ahí es donde se reduce la aceleración destacada.

Tiene un precio para un modelo y ningún precio para el otro. La tarifa de Astra Ultrafast está publicada —6× estándar— y no hay ninguna fila de Ultrafast para GPT-5.6 Sol en ninguna parte. Presupueste tomando como referencia el Sol estándar a $4 / $20 o el modo rápido a $8 / $40, y trate cualquier cifra de «costo de GPT-5.6 Sol Ultrafast» que vea, incluida la extrapolación de $24 / $120 anterior, como aritmética y no como una tabla de tarifas.

Los benchmarks son reportados por el proveedor. La ejecución de HLE de 11 horas y la cifra de 5,6× en GDP-Val son números de OpenAI/Cerebras del anuncio de agosto; las estimaciones independientes de la aceleración van desde aproximadamente 7× hasta 11× según qué se mida. Añade la señal de CS-4 a esa lista: la cifra de ~1.300 tokens/s para GPT-5.6 Sol en CS-4 proviene de una sola publicación en X y no tiene confirmación independiente. Los nuevos números de Astra Ultrafast —8× en Codex, 6× el precio— también son de OpenAI.

Y el que cuesta dinero en lugar de tiempo: no arreglará un cuello de botella que no tienes. Si tus agentes son lentos por tu propia orquestación, la latencia de las herramientas o prompts con mucha entrada, una ruta de salida más rápida apenas mueve la cola. La decisión de emparejamiento de niveles —GPT-5.6 Sol a $4 / $20 frente a GPT-5.6 Terra a $2 / $12 frente a GPT-5.6 Luna a $0.20 / $1.20— sigue moviendo tu factura más que cualquier nivel de velocidad.

En resumen. Ultrafast ya no es un nivel de lista de espera del que solo puedes leer. A partir del 29 de septiembre de 2026, OpenAI lo vende: incluido con el plan ChatGPT Pro 500 de $500 en Work y Codex, abierto a todos los usuarios de la API en GPT-6 Astra con límites de frecuencia bajos, y con un precio seis veces superior a la tarifa estándar: $60 / $300 por millón de contexto corto. GPT-5.6 Sol Ultrafast, la vista previa de agosto sobre la que se construyó esta página, no ha cambiado: sigue con control de acceso, sigue limitada a gpt-5.6-sol en el esquema de la API, sigue sin precio, y la cifra de ~1300 tokens/s reportada para Sol en el CS-4 de Cerebras sigue siendo una única publicación de X sin verificar. El GPT-5.6 Sol estándar a $4 / $20 es el que puedes invocar hoy en OrcaRouter con $0 de recargo; GPT-6 Astra a $10 / $50 es el que puedes invocar si quieres el modelo que obtuvo la fila Ultrafast.

Ultrafast ahora cuesta dinero real en GPT-6 Astra — 6× el estándar, o incluido en el plan Pro 500 de $500 — mientras que GPT-5.6 Sol Ultrafast sigue siendo una vista previa. El GPT-5.6 Sol completo ya está disponible en OrcaRouter a $4 / $20 por millón de tokens sin margen de beneficio, listo para tu propia clave.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario