Una tarjeta principal generada con el título «Ahora en el nivel más rápido», el subtítulo «GPT-6.1 Sol Ultrafast llega a la API, Codex y ChatGPT Work» y cuatro chips que dicen «$12.00 / $60.00 por 1M de tokens», «6x Estándar», «hasta 8x más rápido (medición de Astra)» y «API, Codex y ChatGPT Work», sobre un pie de página que dice «Disponibilidad y precios según la documentación de OpenAI, 8 de octubre de 2026».
Guides & Insights

GPT-6.1 Sol Ultrafast llega a la API, Codex y ChatGPT Work

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

O​penAI está lanzando el modo Ultrafast para GPT-6.1 Sol — el nivel de servicio más rápido que vende, y la primera vez que el nivel casi-Astra Sol ha tenido uno. La medida coloca a GPT-6.1 Sol en la misma categoría que GPT-6 Astra Ultrafast en la API, en Codex y en ChatGPT Work, y llega con una tarifa publicada en lugar de una lista de espera: $12.00 por millón de tokens de entrada y $60.00 por millón de tokens de salida, exactamente seis veces lo que el estándar GPT-6.1 Sol cuesta. La afirmación de velocidad en la etiqueta es "hasta 8x". La parte interesante es qué está midiendo esa frase, y la respuesta no es el modelo por el que estás a punto de pagar.

El registro de cambios para desarrolladores incluye la entrada con fecha del 8 de octubre: «Se añadió el modo Ultrafast para GPT-6.1 Sol en la API de Responses. Usa gpt-6.1-sol con service_tier: "ultrafast" para reducir el tiempo entre los tokens de salida generados. Está disponible para todos los usuarios de la API, sujeto a límites de tasa, con procesamiento global y residencia de datos en EE. UU. y la UE.» La página de documentación de Ultrafast ahora dice «disponible de forma general para GPT-6 Astra y GPT-6.1 Sol, con acceso en vista previa para GPT-5.6 Sol», y la página de velocidad del lado de ChatGPT confirma la parte de suscripción: Ultrafast está disponible en Codex y ChatGPT Work en Pro de $500 y en planes Enterprise y Edu elegibles.

Ultrafast es un nivel de servicio, no un segundo modelo

Nada de los pesos cambia. El mismo checkpoint, la misma ventana de contexto de 1,050,000 tokens, la misma entrada máxima de 922,000 tokens, el mismo techo de salida de 128,000 tokens, la misma fecha de corte de conocimiento del 30 de abril de 2026, las mismas respuestas. Lo que compras es una prioridad de programación: el modelo genera tokens más rápido, y el propio planteamiento de O​penAI es deliberadamente limitado — el nivel «reduce el tiempo entre los tokens de salida generados». No hace que el modelo sea más inteligente, ni acorta la fase de razonamiento.

Esa distinción lo decide todo. Para un bucle de agente que hace cuarenta llamadas a herramientas seguidas, la ganancia se multiplica porque la salida de cada turno llega antes. Para una única solicitud de razonamiento complejo que pasa la mayor parte de su tiempo real deliberando, puedes pagar seis veces más y ver el mismo indicador de carga.

La escalera de niveles, una vez, en términos sencillos:

• Batch and Flex — la mitad que Standard, el carril barato para trabajo que nadie está esperando

• Estándar — $2.00 de entrada / $0.10 en caché / $2.50 de escritura en caché / $10.00 de salida por millón de tokens

• Fast — el doble que Standard, o $4.00 / $0.20 / $5.00 / $20.00; OpenAI renombró Priority processing a modo Fast el 30 de julio de 2026

• Ultrarrápida — seis veces la Estándar, o $12.00 / $0.60 / $15.00 / $60.00

• Más de 272K tokens de entrada — toda la solicitud se vuelve a tarificar a 2x las tarifas de entrada y de caché, y 1.5x la de salida; Ultrafast de contexto largo es $24.00 / $1.20 / $30.00 / $90.00

La aritmética que nadie pone en la página de marketing

Pagar seis veces el precio por ocho veces la velocidad no es un intercambio deficitario, y tampoco es un almuerzo gratis. Ultrafast se factura por token, así que un trabajo que cuesta $1.00 en Standard cuesta $6.00 en Ultrafast —y termina en aproximadamente una octava parte del tiempo. El ahorro no está en la factura, sino en el tiempo de reloj. Estás pagando cinco dólares extra para eliminar siete octavos del tiempo de cola de ese trabajo, y que eso sea barato o absurdo depende por completo de cuánto vale por minuto la persona o el pipeline que espera al otro lado.

De ello se derivan dos implicaciones, y son precisamente las que se pasan por alto:

• El trabajo interactivo es el sí fácil. Un desarrollador viendo cómo aterriza un diff, un agente que no puede continuar hasta haber leído el resultado: esos son los casos en los que la latencia es el producto. Una salida ocho veces más rápida en un bucle de cuarenta turnos no es una mejora marginal para la percepción humana; es la diferencia entre una herramienta que usas y una herramienta que mandas a segundo plano.

• El trabajo programado y por lotes es un no fácil. Si un trabajo tiene hasta la mañana de todos modos, Ultrafast es una factura 6 veces mayor para nada, y el carril Batch a mitad de precio está ahí mismo.

La entrada en caché merece un segundo vistazo porque también se mueve: $0,60 por millón en Ultrafast frente a $0,10 en Standard, todavía el 5% de la tarifa de entrada sin caché. Los agentes con caché de prompt que reenvían un gran prompt de sistema en cada turno descubrirán que el descuento de caché escala con el nivel en lugar de protegerlos de él.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, alongside the page's notes that regional processing endpoints carry a 10% uplift, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

De dónde viene el número «hasta 8x»

Esta es la parte que hay que leer con atención, porque es donde el titular del despliegue y la documentación del despliegue describen, de forma sutil, cosas distintas.

La única medición de velocidad específica del modelo que OpenAI publica es esta frase: "GPT-6 Astra Ultrafast genera tokens hasta 8 veces más rápido que GPT-6 Astra en modo Estándar en Codex". Esa es una cifra de Astra, medida en Codex. No hay un múltiplo equivalente publicado para GPT-6.1 Sol. El documento que cubre Ultrafast para este modelo reduce el tiempo de generación de tokens de salida y apunta a un precio; no le pone un número. La velocidad del lado de ChatGPT repite la frase de Astra y se detiene.

Así que la lectura honesta de «hasta 8 veces más rápido» es: es el titular del nivel, proveniente del modelo hermano que ha estado en Ultrafast desde el 29 de septiembre, y es una afirmación del proveedor que ninguna parte independiente ha reproducido para ninguno de los dos modelos. Bien puede ser válido para GPT-6.1 Sol —los dos se ejecutan en la misma pila de servicio y el mecanismo del nivel es el mismo—, pero nadie fuera de O​penAI ha publicado una medición de tokens por segundo para la variante Sol, y el «hasta» desempeña una función real en esa frase.

También vale la pena mantener los niveles separados por modelo, porque el más antiguo sigue siendo un asunto pendiente. Ultrafast se anunció el 13 de agosto de 2026 para GPT-5.6 Sol con «hasta 14 veces más rápido que Standard processing», en vista previa limitada para clientes selectos. Tres meses después, la documentación sigue diciendo que GPT-5.6 Sol tiene «acceso de vista previa» y la tabla de precios de Ultrafast contiene exactamente dos filas: GPT-6 Astra y GPT-6.1 Sol. Un número de 14x que nunca ha alcanzado disponibilidad general y que no tiene tarifa publicada es una afirmación, no un producto.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Ultrafast mode is the fastest service tier in the OpenAI API', the availability sentence naming broad availability for GPT-6 Astra and GPT-6.1 Sol with preview access for GPT-5.6 Sol, the statement that Ultrafast mode for GPT-6 Astra and GPT-6.1 Sol is available to all API users, the recommendation to use WebSockets because network overhead without a persistent connection can reduce the latency gains, the note that Ultrafast has separate rate limits from Standard and Fast modes, the GPT-6.1 Sol rate-limit row reading 1,000,000 / 4,000,000 / 40,000,000 tokens per minute and 5,000 / 20,000 / 200,000 requests per minute, the line that GPT-6.1 Sol supports US and EU data residency and global processing, and a code sample setting service_tier to 'ultrafast' with model 'gpt-6.1-sol'.

¿Quién puede encenderlo de verdad?

El lado de la API es amplio; el lado de la suscripción es estrecho, y la diferencia pilla a la gente por sorpresa.

• API — disponible para todos los usuarios de API en gpt-6.1-sol, separado de Standard y Fast. Eso significa un segundo presupuesto que vigilar, no solo un segundo precio.

• Límites de velocidad ultrarrápidos para GPT-6.1 Sol — 1.000.000 de tokens por minuto en Build, 4.000.000 en Launch, 40.000.000 en Grow. O​penAI simplificó sus niveles de uso de cinco a tres el 6 de octubre, así que esos tres nombres son la escala actual, no una heredada del pasado.

• Residencia de datos — GPT-6.1 Sol admite residencia de datos en EE. UU. y la UE, así como procesamiento global, incluso con Fast y Ultrafast. Ultrafast de Astra no obtiene residencia en la UE, así que si tu carga de trabajo está fijada a la UE, esta es la primera configuración de Ultrafast que puedes contratar.

• Codex y ChatGPT Work — Ultrafast está disponible en el plan Pro de $500 y en los planes Enterprise y Edu elegibles. Los administradores de Enterprise lo tienen desactivado de forma predeterminada y deben activarlo por usuario o por espacio de trabajo.

• Chat — no incluido. GPT-6.1 Sol en sí mismo vive en Work y Codex; la superficie de Chat para consumidores no forma parte de esto.

• Cómo se factura en una suscripción — el uso incluido se consume a 8 veces la tarifa Estándar, y los créditos comprados o el pago por uso de Enterprise se facturan a 6 veces la tarifa Estándar. Vale la pena conocer ambos números antes de dejarlo activado.

Un detalle de implementación determina si llegas a ver algo de la velocidad en absoluto. La guía de OpenAI es tajante al respecto: usa WebSockets, «especialmente para aplicaciones agénticas que hacen muchas llamadas a herramientas en rápida sucesión», porque «sin una conexión persistente, la sobrecarga de red puede reducir las ganancias de latencia». Si tu cliente abre una conexión HTTP nueva por cada llamada, la sobrecarga por solicitud puede comerse toda la ventaja del nivel por el que acabas de pagar 6 veces más. HTTP sigue funcionando. Simplemente puede que no valga la pena para ese nivel.

Qué enrutamos y qué no

El GPT-6.1 Sol de nivel estándar está en OrcaRouter como openai/gpt-6.1-sol a los propios $2.00 de entrada y $10.00 de salida por millón de tokens del proveedor, servido con un 0% de recargo — el precio de lista del proveedor pasado tal cual, así que cuando O​penAI cambia una tarifa, el cambio llega a tu factura el mismo día en que llega a la tarifa, y no en tu siguiente renovación de contrato. La misma clave y el mismo endpoint cubren más de 200 modelos, de modo que una llamada a GPT-6.1 Sol y una llamada a Claude o Q​wen quedan detrás de una única integración con conmutación por error automática y sin un segundo contrato, y el DSL de enrutamiento compondrá modelos en una sola llamada cuando una tarea necesite más de una opinión.

Ultrafast no es uno de esos modelos, y sería engañoso insinuar lo contrario. Es un indicador de nivel de servicio en una cuenta de O​penAI: usted envía service_tier: "ultrafast" a gpt-6.1-sol y O​penAI factura a su propia cuenta según las tarifas anteriores, así que forma parte de su integración directa con O​penAI. Si lo activa, mantenga el tráfico por niveles en la clave de su proveedor y dirija el tráfico de volumen estándar a través de nosotros. Esa es la división honesta, y también es la más económica para todo lo que no esté esperando a una persona.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s, a 10.00 s figure, and 313.9M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Qué hacer con él hoy

Si tienes una licencia de Codex o ChatGPT Work en Pro $500, el interruptor ya está ahí y la prueba no te cuesta nada salvo el multiplicador de uso: ejecuta la misma tarea de las dos maneras y comprueba si el bucle que realmente ejecutas tiene suficientes turnos para que aparezca el factor de ocho. Si usas la API, el experimento que vale la pena ejecutar es más acotado de lo que sugiere el anuncio: instrumenta cuánto de tu latencia es generación de tokens y cuánto es el modelo pensando, y luego dirige Ultrafast a la parte que realmente puede comprimir.

Y si tienes la opción de elegir entre Fast a 2x y Ultrafast a 6x para la misma solicitud, Fast es el nivel que llegó primero y aquel cuyo comportamiento puedes razonar solo con una lista de tarifas. Ultrafast es nuevo para este modelo, ninguna medición independiente le ha puesto precio, y vale exactamente lo que diga tu propio cronómetro.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario