Tarjeta de título principal generada para «GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol» con el antetítulo «Mismos pesos. Distinto nivel de servicio.» y dos tarjetas: a la izquierda, «GPT-5.6 Sol Ultrafast», que indica Hardware: obleas de Cerebras, Velocidad: hasta 750 tok/s, Precio: aún sin publicar; a la derecha, «GPT-5.6 Sol», que indica Hardware: clústeres de GPU, Velocidad: estándar, Precio: $4.00 / $20.00; pie de página: «Ambos ejecutan el mismo checkpoint de GPT-5.6 Sol.» Logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: Mismos pesos, diferente nivel de servicio

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-5.6 Sol Ultrafast no es un modelo nuevo, y esto no es una historia de lanzamiento. El proveedor anunció el modo el 13 de agosto de 2026, y ese mismo día el valor ultrafast apareció en el esquema público de OpenAPI de la empresa, dentro de la descripción ServiceTierResponses de la especificación, que delimita el nivel, según su propia redacción, al endpoint gpt-5.6-sol y lo marca como de acceso controlado. Lo que devolvió esta página a nuestra cola es algo más pequeño y más específico: el 25 de septiembre de 2026, el commit fe4f7a1 extendió ese valor a dos enumeraciones más, el parámetro service-tier a nivel de solicitud y el campo de política service-tier del agente. Seis semanas después del anuncio, el nivel sigue en lista de espera, todavía no tiene un precio publicado y ahora está conectado a más superficie de la API de la que realmente puede servir. GPT-5.6 Sol Ultrafast y GPT-5.6 Sol son el mismo modelo; lo único que esta comparación puede decidir es quién controla el puntero y quién te ha dicho el costo.

Así que el enfrentamiento que aparece en el titular es de lo más inusual. GPT-5.6 Sol Ultrafast y GPT-5.6 Sol son el mismo modelo. Los mismos pesos, el mismo checkpoint, el mismo comportamiento de razonamiento, la misma ventana de contexto de 1,05 millones de tokens, la misma salida máxima de 128K, las mismas respuestas. El propio planteamiento de OpenAI es «más trabajo útil por segundo», no un modelo más inteligente. Lo único que difiere entre las dos columnas de esta comparación es cómo se producen los tokens y cómo se llama el nivel en el cuerpo de tu solicitud, lo que la convierte en el experimento de control más limpio de la gama actual y, a la vez, en el más difícil de comprar, porque uno de los dos niveles no tiene ningún precio publicado.

Qué cambió realmente esta semana

La evidencia del cambio de septiembre es un commit, no una publicación de blog. OpenAI mantiene openai-openapi, el repositorio que publica el esquema legible por máquina para su API, y el commit fe4f7a1 —con fecha 2026-09-25— añade ultrafast a dos enumeraciones: la política de nivel de servicio asociada a los agentes y el campo a nivel de solicitud que la especificación describe como «el nivel de servicio utilizado para las solicitudes de modelo». Eso es una extensión, no un debut: antes de este commit, esas dos listas contenían auto, default, flex, priority, fast, y el nivel ya estaba en el esquema desde el 13 de agosto. Vale la pena señalar el commit por el campo al que llegó: el campo de política con el que se configura un agente, que es una superficie distinta de una anulación por solicitud.

La descripción que importa data del commit del 13 de agosto, no de este, y es la declaración más específica que OpenAI ha publicado sobre el nivel en cualquier lugar. Junto con el nuevo valor, la especificación dice: "Si se establece en 'ultrafast', la solicitud se procesará con el nivel de servicio Ultrafast Processing con control de acceso. Este nivel está disponible actualmente para gpt-5.6-sol; una respuesta servida a través de él mostrará service_tier=ultrafast."

Lee esa frase dos veces, porque resuelve dos cuestiones sobre las que, de otro modo, esta página de comparación tendría que andarse con rodeos. El nivel está acotado a un solo modelo —el insignia GPT-5.6 Sol y nada más en la línea— y está controlado por acceso en lugar de ser abierto, lo que coincide con el planteamiento de OpenAI de una vista previa con lista de espera. También te indica cómo sabrías que lo obtuviste: la respuesta devuelve qué nivel atendió realmente la solicitud, de modo que un retroceso al procesamiento estándar es visible en el cuerpo de la respuesta en lugar de algo que tengas que inferir a partir de la latencia. La misma descripción aparece tanto en los esquemas estándar como en los de Beta Responses, y así ha sido desde el 13 de agosto.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

Una segunda señal, más débil, llegó al día siguiente. Un informe del 26 de septiembre describe un nuevo selector de Speed —Fast, Standard y Ultrafast— que llegará al Responses API Playground, y se espera una disponibilidad más amplia de Ultrafast después de la conferencia para desarrolladores DevDay de OpenAI. No hemos visto el selector nosotros mismos y OpenAI no ha publicado una nota de despliegue, así que trátalo como un informe de una sola fuente y no como una función ya lanzada. Las partes que se pueden verificar hoy son los dos puntos en el esquema público y el hecho de que no ha aparecido ninguna lista de precios para el nivel.

Lo que no ha cambiado es igual de importante. Sigue sin haber un precio de Ultrafast. La página de precios de OpenAI, consultada el 27 de septiembre, contiene las cuatro pestañas que tenía antes —Standard, Batch, Flex y Fast— y la cadena "ultrafast" no aparece en ella por ningún lado. El acceso sigue describiéndose como una vista previa limitada para clientes selectos, que se va ampliando a medida que crece la capacidad. El nivel está en el contrato y fuera de la lista de precios al mismo tiempo, y ese es su estado real.

Los dos niveles, uno al lado del otro.

Como ninguna capacidad separa a estos dos, la comparación se reduce casi por completo a la prestación del servicio y la facturación. Cada línea a continuación incluye ambos lados en una sola fila.

• Modelo — GPT-5.6 Sol Ultrafast ejecuta el mismo checkpoint de GPT-5.6 Sol que el procesamiento estándar de GPT-5.6 Sol, el mismo checkpoint, sin destilación, sin reducción de tamaño.

• Rendimiento de salida — hasta 750 tokens de salida por segundo, hasta 14× el estándar, según el anuncio de OpenAI del 13 de agosto frente al procesamiento estándar de GPT-5.6 Sol en clústeres de GPU, que es la cifra frente a la que se mide el 14×.

• Hardware — chips de oblea de escala completa de Cerebras, con los pesos residentes en SRAM dentro del chip, el primer producto de la asociación de cómputo de OpenAI con Cerebras de enero de 2026, valorada según se informa en unos 10.000 millones de dólares a lo largo de tres años, frente a la inferencia convencional con GPU, donde gran parte del tiempo se dedica a mover los pesos entre la memoria y el cómputo.

• Precio — no publicado a fecha de 27 de septiembre de 2026 frente a $4.00 de entrada / $20.00 de salida por millón de tokens, la tarifa promocional actual de OpenAI, más $0.40 por millón para entrada en caché.

• Disponibilidad — vista previa limitada con lista de espera para clientes selectos frente al canal predeterminado, invocable por cualquiera que tenga una clave de API.

• Las respuestas que recibes — idénticas, en principio vs idénticas, en principio; si divergen ante el mismo prompt, eso es un hallazgo, no una característica.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

La afirmación sobre la velocidad, y su límite máximo

El número destacado es 14× y merece el mismo cuidado que recibe el resto de esta página. OpenAI afirma hasta 750 tokens de salida por segundo frente al procesamiento estándar: una cifra de rendimiento de salida de tokens, no una afirmación de que cada solicitud termine 14 veces antes. El tiempo de extremo a extremo también incluye el procesamiento de entrada y el razonamiento propio del modelo, y el hardware de escala de oblea no comprime ninguno de los dos en la misma proporción. Por eso la compañía califica el 14× como un máximo y no como una medición.

Las comparaciones publicadas son reportadas por los proveedores en ambos lados de la tabla, y una de ellas abarca los stacks de dos proveedores. Una ejecución de Humanity's Last Exam de 2.500 preguntas se reporta como finalizada en 11 horas 11 minutos en Ultrafast, frente a 78 horas 27 minutos para Claude Fable 5, con una precisión comparable; es decir, OpenAI y Cerebras nos hablan de un benchmark que incluye el modelo de un rival, y la cobertura independiente del lanzamiento citó una comparación más acotada de aproximadamente 11× de velocidad de generación en la misma ejecución, mientras que las propias cifras de Cerebras implican alrededor de 7× para el tiempo total de la prueba. La diferencia entre 14×, 11× y 7× no es una contradicción; es lo que ocurre cuando tres partes miden porciones diferentes de una misma carga de trabajo. Cerebras reporta por separado 5,6× de extremo a extremo en GDP-Val sin pérdida de calidad medible. Nada de esto ha sido reproducido por un tercero.

La lista de precios tiene un hueco.

Aquí es donde los dos niveles dejan de ser simétricos. GPT-5.6 Sol tiene cuatro tarjetas de tarifas publicadas y Ultrafast no es una de ellas.

• Estándar GPT-5.6 Sol — $4.00 / $20.00 por millón de tokens, con entrada en caché a $0.40 y un nivel de contexto largo de $8.00 / $30.00 una vez que la entrada supera aproximadamente los 272 K tokens.

• Modo rápido — $8.00 / $40.00, exactamente el doble de la tarifa estándar. Este es el nivel que se renombró de Priority processing el 30 de julio de 2026, y la API acepta tanto service_tier: "priority" como service_tier: "fast". Ofrece hasta aproximadamente 2,5× de velocidad de salida.

• Batch and Flex — $2.00 / $10.00, un 50 % de descuento fijo sobre la tarifa estándar a cambio de una programación más flexible.

• Ultrafast — sin tarifario. No es un espacio en blanco que rellenamos con una conjetura; es un espacio en blanco que OpenAI ha dejado.

Esa fila de Fast-mode es el único antecedente real con el que cualquiera puede comparar el precio de Ultrafast, y es un dato aleccionador para quien esté planificando un presupuesto: el único nivel de velocidad al que OpenAI le ha puesto realmente una cifra cuesta exactamente el doble de la tarifa estándar a cambio de dos veces y media la velocidad. Ultrafast es una promesa de velocidad mayor que se sustenta en hardware más escaso —la capacidad de obleas de Cerebras no es un producto básico—, así que la dirección del sobreprecio final no está en duda. Su magnitud, sí. Hasta que exista una lista de tarifas, cualquier cifra de «precio de GPT-5.6 Sol Ultrafast» que veas citada en cualquier sitio es una inferencia de alguien, incluidas las nuestras.

Cómo lo llamarías realmente

El cambio de esquema te indica la forma que tendrá la llamada final. Si el nivel sigue el patrón de los demás, llega como un campo adicional en una solicitud que ya estás haciendo: mantienes el modelo gpt-5.6-sol, mantienes tu prompt y añades el selector de nivel, de la misma manera en que el modo Fast se selecciona hoy intercambiando priority por fast. Nada de tu análisis de la respuesta cambia, porque nada del modelo cambia. Ese es todo el atractivo de un nivel de servicio frente a un cambio de modelo, y la razón por la que una página comparativa como esta tiene tan poco que comparar.

Lo que hoy no puedes hacer es decidirlo. El valor de enumeración existe; la capacidad que lo respalda, no, para la mayoría de las cuentas. Así que la pregunta práctica para las próximas semanas no es cuál de los dos niveles elegir, sino qué ejecutar mientras la opción no está disponible.

Esa es una pregunta que una pasarela responde mejor que una lista de espera. El nivel estándar del modelo ya está activo en OrcaRouter como openai/gpt-5.6-sol, servido a la tarifa del propio proveedor con cero margen sobre los tokens, a través del endpoint compatible con OpenAI en api.orcarouter.ai/v1, de modo que el precio promocional de OpenAI de $4 / $20 y su escalón de contexto largo de $8 / $30 se trasladan tal cual en lugar de ser repreciados por nosotros, y cualquier cambio en ellos llega a nuestro lado el mismo día en que llega al de OpenAI. La misma clave da acceso a más de 200 modelos, lo cual importa aquí más de lo habitual: como no puedes configurar service_tier: "ultrafast" y obtener una respuesta, la forma de comprar latencia hoy es enrutar el trabajo de otra manera: envía las llamadas interactivas al modelo del catálogo que supere tu umbral de calidad más rápido, y mantén los lotes nocturnos en el carril más económico que lo cumpla. Cuando el nivel se abra, el router es donde activarías el interruptor y, hasta entonces, es la diferencia entre una lista de espera y un plan.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

¿Cuál va en producción?

Ignore la palabra «versus» por un momento, porque aquí no hay ninguna decisión de calidad que tomar. Si optimizas el coste por token, la respuesta es GPT-5.6 Sol estándar, y la vía Batch con un 50 % de descuento es la respuesta para todo lo que pueda esperar. Si optimizas cuánto tiempo pasa una persona sentada frente a un indicador de carga, Ultrafast es la respuesta en cuanto puedas conseguirla, y las cargas de trabajo que OpenAI menciona para la preview demuestran exactamente por qué: respuesta ante incidentes con registros y diffs abiertos durante una caída en vivo, comprobaciones de fraude contra datos en movimiento, conversaciones de soporte en las que medio segundo de silencio se interpreta como un producto roto, y bucles de investigación que antes se ejecutaban durante la noche y ahora se comprimen en una jornada de trabajo.

La pista reveladora es la forma de tu grafo de solicitudes, no el tamaño de tu prompt. Una única generación larga gana 14× sobre el papel y bastante menos en la práctica, porque el procesamiento de entrada y el razonamiento no se comprimen en esa proporción. Cuarenta llamadas secuenciales a herramientas detrás de una única acción visible para el usuario ganan algo mucho más cercano al multiplicador completo, porque cada uno de esos viajes de ida y vuelta es latencia que el usuario está aguantando. Si tu carga de trabajo se parece a la segunda, el nivel está pensado para ti; si se parece a la primera, la vía estándar siempre iba a ser suficiente.

Dos cosas que vigilar, y ninguna es un rumor que podamos resolver desde aquí. Primero, la tarifa: un nivel premium sin precio no se puede presupuestar, y el precedente del modo Fast sugiere que no será pequeño. Segundo, si la lista de espera realmente se reduce alrededor del DevDay, como se informa, porque un valor de service_tier que la mayoría de las cuentas no puede usar es documentación, no disponibilidad, y la diferencia entre ambas es la diferencia entre un plan y una promesa.