Ilustración editorial de vector plano para el hero de un blog de tecnología sobre inferencia de IA ultrarrápida: un gran chip de modelo redondeado en azul profundo con un suave resplandor cian sobre un fondo claro, un rayo estilizado y un dial de velocidad con la aguja al máximo a su lado, rápidas corrientes de tokens que avanzan a lo largo de una línea de velocidad horizontal con líneas de movimiento, y un pequeño cronómetro. Fondo blanco con suaves acentos de degradado azul y cian y un sutil resaltado cálido; iconos minimalistas de línea plana; tipografía geométrica moderna limpia sin serifa; sin texto legible, sin letras, sin palabras, sin marca de agua, sin logotipos de terceros, composición 16:9.
Guides & Insights

GPT-5.6 Sol Ultrafast: velocidad 14×, 750 Tok/s — CS-4, según se informa, ~1,300, todavía sin precio

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El modo GPT-5.6 Sol Ultrafast es el nivel de servicio acelerado por hardware del modelo insignia: el mismo GPT-5.6 Sol completo ejecutado en chips a escala de oblea de Cerebras en lugar de clústeres de GPU, con hasta 14 veces la velocidad del procesamiento estándar y hasta 750 tokens de salida por segundo en el nivel que OpenAI anunció en agosto. El 18 de agosto de 2026, Cerebras presentó el sistema de próxima generación CS-4 sobre el que crece este nivel, y un informe preliminar no verificado afirma que GPT-5.6 Sol en CS-4 ya sirve aproximadamente 1.300 tokens por segundo. No es un modelo más pequeño ni una destilación: solo cambiaron el hardware y la programación, y la inteligencia se preserva. Lo que todavía no tiene es un precio: al 19 de agosto de 2026, Ultrafast es una vista previa limitada de API sin tarifa publicada, por lo que la cifra con la que puedes presupuestar hoy es el nivel estándar en la página en vivo del modelo GPT-5.6 Sol: $5 por millón de tokens de entrada y $30 por millón de salida, trasladados sin margen adicional. Este artículo aborda qué es el modo, qué tan rápidas son en realidad las cifras —incluido el nuevo hardware CS-4 y lo que aún no está verificado—, cuánto cuesta (incluida la respuesta honesta de «aún sin precio») y qué hacer hasta que alcance disponibilidad general.

Lo que realmente es el modo Ultrafast

Ultrafast es un nivel de servicio, no un modelo nuevo. OpenAI lo anunció el 13 de agosto de 2026 como el primer producto de su acuerdo de computación de enero de 2026 con el fabricante de chips Cerebras — un acuerdo reportado en aproximadamente $10 mil millones en tres años. Mientras que la inferencia estándar de GPT-5.6 Sol se ejecuta en clústeres de GPU y dedica gran parte de su tiempo a mover pesos entre la memoria y la computación, Ultrafast carga los pesos del modelo en 44 GB de SRAM integrada en los chips a escala de oblea de Cerebras; el tamaño de un modelo como Sol abarca varias obleas en capas, por lo que los pesos se ubican donde está la computación. El resultado es un límite de rendimiento establecido por el silicio, no por el ancho de banda de la memoria.

La historia del hardware avanzó el 18 de agosto de 2026. En su evento Supernova, Cerebras presentó el CS-4, el sistema a escala de rack de próxima generación construido sobre su plataforma Nexus: tres chips Wafer-Scale Engine por rack, hasta 2 veces la velocidad de generación de tokens del CS-3 anterior y, según Cerebras, más de 1.000 tokens por segundo en modelos de más de 10 billones de parámetros. Son afirmaciones de Cerebras sobre un sistema en acceso anticipado, aún no disponible de forma general. Desde la presentación, una sola publicación en X afirma que el CS-4 ya sirve GPT-5.6 Sol a aproximadamente 1.300 tokens por segundo, lo que va en la misma dirección que las propias cifras de Cerebras, pero que nadie ha confirmado hasta ahora. Trátala como una señal temprana: plausible, no verificada y digna de volver a comprobar antes de planificar capacidad en torno a ella.

La parte que importa para tu código: el id del modelo, los pesos, el comportamiento de razonamiento y la salida son idénticos al GPT-5.6 Sol estándar. OpenAI presenta Ultrafast como "más trabajo útil por segundo" en lugar de un nivel de calidad, y la vista previa ejecuta el modelo insignia completo: la velocidad no proviene de cambiar a un modelo más barato. Lo que cambia es la rapidez con la que salen los tokens.

No confundas Ultrafast con el existente modo rápido. El modo rápido es un nivel aparte, adquirible en hardware estándar: hasta aproximadamente 2,5× la velocidad de salida a una prima de 2× por token ($10 de entrada / $60 de salida por 1M), sin cambios en la calidad. Ultrafast es algo diferente: hardware de Cerebras, hasta 14×, y por ahora sin precio alguno.

Qué tan rápido — los números que importan

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

La cifra principal es 14×, y necesita una definición. OpenAI dice que Ultrafast genera hasta 750 tokens de salida por segundo frente al procesamiento estándar de GPT-5.6 Sol. Ese es un número de rendimiento para tokens de salida, no una afirmación simplista de que "todo funciona 14× más rápido" — el tiempo de solicitud de extremo a extremo también incluye el procesamiento de entrada y el razonamiento del propio modelo, por lo que 14× se etiqueta como un máximo.

Max output throughput — up to 750 output tokens per second, per OpenAI's announcement (2026-08-13).

Frente al procesamiento estándar — hasta 14 veces más rápido, según el mismo comunicado; las ganancias reales varían según la longitud de entrada y el tipo de tarea.

Humanity's Last Exam, 2,500 preguntas — OpenAI/Cerebras informan que GPT-5.6 Sol Ultrafast terminó en 11 horas 11 minutos frente a las 78 horas 27 minutos de Claude Fable 5, con una precisión comparable. Informado por los proveedores, y la comparación abarca las pilas de hardware de dos proveedores — tómalo como una indicación, no como un veredicto.

GDP-Val, de extremo a extremo — Cerebras informa que es 5.6 veces más rápido en general sin pérdida medible de calidad. También reportado por el proveedor.

Línea base del modo rápido — el nivel de velocidad de pago existente alcanza un máximo de aproximadamente 2,5× la velocidad de salida por un sobreprecio de 2×.

• CS-4, el próximo hardware: Cerebras afirma que el rack CS-4 ofrece más de 1,000 tokens por segundo en modelos de más de 10 billones de parámetros, hasta 2× la generación de tokens del CS-3. Un informe no verificado de la comunidad sitúa a GPT-5.6 Sol en CS-4 en ~1,300 tokens por segundo — misma dirección, aún no confirmado por OpenAI ni Cerebras.

Una advertencia antes de citar el 14×: la cobertura independiente del lanzamiento cita una comparación de velocidad de generación de ~11× frente a Claude Fable 5, mientras que las propias cifras de Cerebras implican ~7× para el tiempo total de prueba en la misma ejecución — la diferencia radica en qué parte de una carga de trabajo se mide. La misma disciplina se aplica a la señal de velocidad del CS-4: la cifra de ~1,300 tokens/s comenzó como una sola publicación en X, y ni OpenAI ni Cerebras la han confirmado. Todos estos son números de proveedores o de la comunidad anunciados esta semana, y ninguno está verificado de forma independiente todavía. Trátalos como afirmaciones, no como veredictos de referencia.

Lo que cuesta — y la brecha honesta

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Aquí está el estado de la cuestión del precio el 2026-08-19, dicho claramente: Ultrafast no tiene un precio publicado. OpenAI no ha anunciado uno, y la vista previa no aparece en ninguna tarifa pública. Los informes de que los espacios de acceso temprano están incluidos o son gratuitos son especulación, no política — y hasta que OpenAI fije el precio del nivel, cualquier cifra de "GPT-5.6 Sol Ultrafast cost" que encuentres en otro lugar es una conjetura.

Lo que puedes cotizar hoy es el resto de la línea GPT-5.6 Sol, verificado contra las tarifas publicadas de OpenAI el 2026-08-18:

Standard GPT-5.6 Sol — $5.00 de entrada / $30.00 de salida por 1M de tokens. La línea base que puedes llamar ahora mismo.

Modo rápido — $10.00 / $60.00, una prima de 2× para hasta aproximadamente 2.5× de velocidad de salida. Lo más parecido a un nivel de velocidad que puedes comprar de verdad.

Lectura de caché de prompt — $0,50 por 1M (90 % de descuento sobre la entrada nueva); las escrituras de caché se facturan a $6,25 por 1M.

Nivel de contexto largo — las entradas que superan aproximadamente 272K tokens se facturan a $10.00 / $45.00.

Batch API — $2.50 / $15.00, un 50 % de descuento fijo con un tiempo de procesamiento de aproximadamente 24 horas.

Para contextualizar la prima esperada: el modo rápido sentó el precedente de 2× la tarifa estándar por 2.5× la velocidad. Si Ultrafast sigue una curva similar, se situará muy por encima de los $5 / $30 estándar, y los comentarios en torno a la vista previa esperan exactamente eso, porque la capacidad de obleas de Cerebras es escasa y cara. Pero una prima esperada no es un precio. Planifica en función del modo estándar Sol o del modo rápido hasta que exista una tarifa.

Cómo usarlo — la realidad de la vista previa

El acceso es la segunda brecha real. Ultrafast está disponible a través de la API de OpenAI para un grupo selecto de clientes mediante lista de espera, según se anunció el 13 de agosto de 2026, y OpenAI afirma que el acceso se ampliará «a medida que crezca la capacidad». No hay fecha de disponibilidad general. Las cohortes de vista previa anunciadas son codificación, comercio, investigación financiera, soporte y otras cargas de trabajo interactivas: equipos cuyos agentes realizan muchas llamadas por solicitud y donde la latencia de respuesta es el cuello de botella. Jane Street, Rogo y Podium se encuentran entre los primeros evaluadores mencionados.

El patrón de uso para el que está diseñado: respuesta a incidentes (lectura de registros, trazas y diferencias mientras un corte está en curso), investigación financiera y detección de fraude en datos en movimiento, soporte al cliente y voz en tiempo real (donde medio segundo de silencio se percibe como una interrupción), proceso de pago en comercio electrónico y compresión de lotes de investigación nocturnos en sesiones interactivas. Si su carga de trabajo es un chat de un solo turno, el 14× importa mucho menos que en un bucle de agente de 40 llamadas.

Lo que puedes hacer hoy — la respuesta práctica

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Mientras Ultrafast está en vista previa, el GPT-5.6 Sol completo ya está disponible — y en OrcaRouter el nivel estándar se sirve a la tarifa del proveedor con un recargo de $0 por token, como ID de modelo openai/gpt-5.6-sol a través del endpoint compatible con OpenAI en api.orcarouter.ai/v1. Si ya tienes un cliente de OpenAI, la migración es un cambio de URL base y de ID de modelo; nada más. La misma clave y el mismo endpoint dan acceso a más de 200 modelos, así que Sol está junto a GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 y los modelos de peso abierto con los que lo compararías — y puedes enrutar por dificultad en lugar de integrar cada uno por separado.

Dos características específicas de OrcaRouter merecen mencionarse en una página de velocidad. BYOK: trae tu propia clave de OpenAI y OpenAI te factura directamente a sus propias tarifas — OrcaRouter añade $0 por token y mantiene intactos los límites de tasa y créditos de tu proveedor. Guardrails: el PII Shield y la política de contenido se ejecutan antes de la facturación, así que una solicitud bloqueada devuelve un 400 limpio y nunca se cobra, y el Agent Firewall evalúa las llamadas de herramientas y MCP antes de que se ejecuten. Cuando —y si— Ultrafast alcance disponibilidad general a un precio enrutable, conectarlo al mismo endpoint es un cambio de ID de modelo; la configuración que construyas hoy se conserva.

El límite honesto — cuando Ultrafast no es la respuesta

Cuatro lugares donde la historia de 14× no se sostiene, así que no diseñes ni presupuestes en función de un número que no está asentado:

14× es un máximo, no una garantía. Es un techo de rendimiento de salida en hardware Cerebras; la latencia de extremo a extremo aún incluye el procesamiento de entrada, el tiempo de razonamiento del modelo y tu propia red. Un prompt con mucho razonamiento puede pasar la mayor parte del tiempo efectivo pensando, donde la aceleración anunciada se reduce.

No tiene precio ni fecha de disponibilidad general. A partir del 19 de agosto de 2026, no puedes comprar Ultrafast — solo solicitar acceso de vista previa, y el hardware CS-4 que lo respalda está en acceso temprano, no disponible de forma general. Presupuesta según Sol estándar ($5 / $30) o modo rápido ($10 / $60), y trata cualquier precio de Ultrafast que veas en línea como no verificado.

Los benchmarks son reportados por el proveedor. La ejecución de HLE de 11 horas y la cifra de 5,6× en GDP-Val son datos de OpenAI/Cerebras del anuncio; las estimaciones independientes oscilan entre aproximadamente 7× y 11× según lo que se mida. Añada a esa lista el dato de velocidad del CS-4: la cifra de ~1300 tokens/s para GPT-5.6 Sol en CS-4 proviene de una sola publicación en X y no tiene confirmación independiente. Ninguno de estos datos está verificado de forma independiente todavía.

No arreglará un cuello de botella que no tienes. Si tus agentes son lentos debido a tu propia orquestación, la latencia de las herramientas o prompts con muchas entradas, una ruta de salida más rápida solo mueve la cola ligeramente. La decisión de selección de nivel — GPT-5.6 Sol a $5 / $30 versus GPT-5.6 Terra a $2 / $12 versus GPT-5.6 Luna a $0.20 / $1.20 — sigue moviendo tu factura más que cualquier nivel de velocidad.

En resumen. GPT-5.6 Sol Ultrafast es el nivel de servicio más rápido que OpenAI ha lanzado para su modelo insignia: los mismos pesos en hardware de Cerebras, hasta 14× de rendimiento y 750 tokens de salida por segundo en el nivel anunciado. Según se informa, el nuevo CS-4 de Cerebras (presentado el 2026-08-18) impulsa a GPT-5.6 Sol hasta ~1,300 tokens por segundo, pero esa cifra es una única publicación no verificada en X. A fecha de 2026-08-19, Ultrafast está en vista previa con lista de espera y sin precio público. Si buscas una cifra para hacer presupuesto, la respuesta honesta es que todavía no la hay. GPT-5.6 Sol estándar a $5 / $30 es lo que puedes usar hoy; el modo rápido a $10 / $60 es el nivel de velocidad que se puede comprar, y OrcaRouter enruta ambos sin recargo usando tu propia clave. Configura el enrutamiento ahora — y cuando Ultrafast tenga precio y fecha, bastará con cambiar el model-id.

Hasta que Ultrafast tenga un precio, el GPT-5.6 Sol completo está disponible en el GPT-5.6 Sol on OrcaRouter a $5 / $30 por millón de tokens, sin margen, listo para tu propia clave.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube