
GPT-6.1 Ultrafast vs GPT-6.1 Sol: Tres trabajos, un veredicto para cada uno
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pregunta si GPT-6.1 Ultrafast vale seis veces el precio de GPT-6.1 Sol y la respuesta honesta es que dos de tus tres cargas de trabajo deberían quedarse exactamente donde están. El agente de programación interactivo sí debería cambiar. El barrido de evaluación nocturno no, y el resumidor por lotes tampoco, y la razón no es que el nivel esté sobrevalorado — es que nunca estuvieron comprando lo que vende. GPT-6.1 Sol se lanzó el 29 de septiembre de 2026 y Ultrafast llegó como un modo sobre él el 8 de octubre de 2026: mismo checkpoint, misma ventana de contexto de 1.050.000 tokens, mismo límite de salida de 128.000 tokens, misma fecha de corte de conocimiento del 30 de abril de 2026, mismas respuestas, a 12,00 $ por millón de tokens de entrada y 60,00 $ por millón de salida frente a 2,00 $ y 10,00 $. Un nivel de velocidad es la compra de tiempo de reloj, y el tiempo de reloj solo vale dinero para una tarea por la que alguien está esperando.
Ese replanteamiento es todo el artículo. El resto es la aritmética que te dice cuál de tus trabajos es del tipo que implica esperar, y los dos costos que llegan junto con el múltiplo, los hayas planificado o no.
Lo que realmente difiere: un campo de solicitud y una factura
No hay ningún checkpoint Ultrafast, ningún límite de contexto separado, ningún corte de conocimiento alternativo y nada que fijar. Envías el mismo identificador de modelo con un campo de nivel de servicio establecido, y OpenAI programa la solicitud de manera diferente; envíalo sin el campo y estás en Standard. Todo aquello contra lo que programa un desarrollador es idéntico, y vale la pena ser mecánico con la lista, porque la longitud de la lista es el argumento.
• Id. de modelo — el mismo identificador en ambos, una instantánea predeterminada, nada con fecha que fijar.
• Contexto — una ventana de 1.050.000 tokens, una entrada máxima de 922.000 tokens y una salida máxima de 128.000 tokens en ambos.
• Escala de razonamiento — low, medium (predeterminado), high, xhigh y max en ambos, y none y minimal no compatibles en ambos.
• Superficie de herramientas — búsqueda web, búsqueda de archivos, generación de imágenes, intérprete de código, shell alojado, apply patch, skills, computer use, MCP y búsqueda de herramientas, a través de la API de Responses, en ambas.
• Precio — $2.00 de entrada / $0.10 / $2.50 / $10.00 de salida por millón de tokens en Standard, frente a $12.00 / $0.60 / $15.00 / $60.00 en Ultrafast.
• Por encima de 272,000 tokens de entrada — toda la solicitud se vuelve a tarifar a 2x las tarifas de entrada y de caché y 1.5x la de salida en ambas, lo que sitúa a Ultrafast de contexto largo en $24.00 / $1.20 / $30.00 / $90.00.
• Velocidad — Standard es la línea base por definición; Ultrafast es el nivel más alto, y el único múltiplo específico del modelo que OpenAI publica pertenece a GPT-6 Astra, no a este modelo.
Esa última línea es la advertencia que subyace a todo lo demás, y tiene su propia sección más abajo. Primero, los trabajos.
Trabajo uno: el agente interactivo. Este es el que se mueve
Un bucle de agente que hace cuarenta llamadas a herramientas seguidas es el comprador para el que se creó este nivel, porque el tiempo de generación de cada turno condiciona el siguiente turno, y el usuario está observando. Tomemos una sesión que envía 30.000 tokens de entrada y recibe 1.500 tokens de salida por turno a lo largo de 40 turnos — 1.200.000 tokens de entrada y 60.000 tokens de salida en total, cada solicitud muy por debajo del umbral de reajuste de precios de 272.000 tokens.
• Estándar — 1,2 millones de tokens de entrada a $2,00 son $2,40; 60.000 tokens de salida a $10,00 son $0,60. Tres dólares por la ejecución.
• Ultrafast — 1.2 millones de tokens de entrada a $12.00 son $14.40; 60,000 tokens de salida a $60.00 son $3.60. Dieciocho dólares por la ejecución.
• El delta — $15.00 para eliminar la mayor parte de la latencia de generación de un trabajo cuyo resultado por lo demás es idéntico.
Que 15,00 $ sea barato o no es una cuestión de minutos, no de tokens. Si la sesión dura veinte minutos en Standard y cuatro minutos en Ultrafast, has comprado dieciséis minutos por quince dólares —unos 0,94 $ por minuto—, y la comparación que importa es con lo que te cuestan esos dieciséis minutos. Un desarrollador con una tarifa que incluye todos los costos vale más de un dólar por minuto, así que, para el caso con intervención humana, la respuesta es obvia. Un agente que espera en una cola de revisión humana no vale nada por minuto, y ahí esos mismos dieciséis minutos son dieciséis minutos gratis y el nivel es un desperdicio.
Esa es la prueba que hay que aplicar, y no tiene nada que ver con el modelo. ¿En el reloj de quién se mide el tiempo de generación, y cuánto vale ese reloj? Si la respuesta es «el de una persona, y mucho», Ultrafast es lo más barato de tu factura. Si la respuesta es «el de un planificador, y nada», es lo más caro.

Trabajo dos: el barrido de evaluación nocturno. Esto es un no
Un barrido de evaluación ejecuta unos miles de prompts a través del modelo, escribe los resultados en el almacenamiento de objetos y una persona lee la tabla por la mañana. Su presupuesto de latencia no se mide en minutos; se mide en una noche. Nada en el pipeline está esperando al modelo, excepto la siguiente solicitud en la cola.
Ultrafast no elimina el coste de reloj de pared del barrido, porque el coste de reloj de pared del barrido es una decisión de planificación que tomaste tú, no un problema de latencia que tengas. Lo que hace es multiplicar la factura por seis y trasladar el trabajo a un presupuesto con sus propios límites de tasa por organización, lo cual es un riesgo real en un lote desatendido, porque un techo de límite de tasa es exactamente el modo de fallo contra el que choca un barrido grande, y la página del nivel no publica la cifra.
Y hay un carril en la misma tarjeta de tarifas que tiene precio para este trabajo y está cotizado en la dirección opuesta. Batch y Flex cuestan la mitad que Standard, y el procesamiento Batch de la API está diseñado exactamente para esta forma: grandes volúmenes, sin fecha límite interactiva, resultados devueltos de forma asíncrona. Con los números anteriores, el mismo total de tokens de 40 turnos cuesta $1.50 en Batch frente a $18.00 en Ultrafast. Eso es un diferencial de 12x para un trabajo que no puede notar la diferencia.
El error que hay que evitar es tratar Ultrafast como la actualización de uso general. Es lo más alto de una escala —Batch y Flex a la mitad, Standard a uno, Fast a dos, Ultrafast a seis—, y una escala no es un menú de mejores versiones. Elegir el peldaño equivocado tiene mayores consecuencias económicas que elegir el modelo equivocado.
Trabajo tres: el resumidor por lotes. También un no, por una razón diferente.
Supongamos que la carga de trabajo es una pasada nocturna sobre un almacén de documentos: entradas largas, salidas cortas, sin intervención humana y un SLA medido en horas. Aquí es donde la combinación de tokens se vuelve en contra de Ultrafast en lugar de a su favor.
El umbral de 272.000 tokens es la razón. En cualquiera de los dos niveles, una sola solicitud que lo cruce recalcula el precio de toda la solicitud —cada token de entrada, cada lectura en caché, cada token de salida— al doble de las tarifas de entrada y de caché y 1,5 veces la de salida. Por lo tanto, Ultrafast de contexto largo cuesta $24,00 por millón de tokens de entrada y $90,00 por millón de tokens de salida, y el recálculo del precio lo activa la solicitud, no la porción que supera el límite. Un resumidor de documentos que ocasionalmente envía una solicitud de 300.000 tokens de entrada paga la tarifa de contexto largo por los 300.000.
El comportamiento de la caché lo agrava. Las lecturas en caché son los tokens menos costosos de este modelo y la palanca de costes más eficaz, y escalan con el nivel en lugar de absorberlo — $0,10 por millón de tokens de entrada en caché en Standard, $0,60 en Ultrafast, ambos al 5 % de la tarifa de entrada sin caché. No hay ninguna combinación de tokens en caché y nuevos que suavice el múltiplo, por lo que una canalización en caché rigurosamente optimizada no obtiene un descuento de la vía rápida. Simplemente paga seis veces una cifra menor.
Si juntamos las dos cosas, el resumidor es el caso en el que el sobreprecio de Ultrafast es mayor en términos absolutos y su beneficio es menor. Si los documentos son realmente largos y el plazo es realmente de horas, la configuración correcta es Batch o Standard estándar, y el uso correcto de Ultrafast es el bucle intermedio de desarrollo, donde se itera sobre el prompt y hay una persona esperando cada revisión.
Los dos costes que llegan con el múltiplo
La tarifa de seis veces es la parte visible del precio. Dos partes invisibles importan más en producción.
El primero es el presupuesto de límites de velocidad. Ultrafast funciona con sus propios límites, separados de los presupuestos de Standard y Fast, y OpenAI los establece por organización en lugar de publicarlos en la página del nivel; la recomendación es comprobar los límites de tu organización antes de aumentar el tráfico y contactar con un equipo de cuentas si es necesario ampliarlos. Así que cambiar una carga de trabajo a Ultrafast hace dos cosas a la vez: multiplica la factura y traslada la carga de trabajo a un techo que puede que no puedas leer. Para un agente desatendido, el techo se impone primero.
La segunda es la forma de los ahorros. Ultrafast reduce el tiempo entre tokens, no el tiempo hasta el primer token ni la fase de deliberación. Una solicitud que pasa la mayor parte de su tiempo real pensando antes de emitir algo puede cambiarse a Ultrafast y seguir sintiéndose lenta, porque el nivel acelera la parte de la solicitud que nunca fue el cuello de botella. Este es el modo de fallo que produce informes del tipo «pagamos seis veces más y la velocidad es la misma»: se está midiendo una aplicación cuya latencia vive en algún lugar al que el nivel no llega. Antes de comprometerse, mida dónde se van realmente los segundos —el tiempo hasta el primer token frente al tiempo entre tokens—, porque el nivel solo controla uno de esos dos.
Por qué "más rápido" aún no es una cifra que se le pueda exigir a {{1}}OpenAI{{/1}}
Ultrafast se vende como "hasta 8x", y la medición que respalda esa frase corresponde a un modelo diferente. La frase publicada se refiere a GPT-6 Astra Ultrafast generando tokens hasta 8 veces más rápido que GPT-6 Astra en modo Standard en Codex. No existe un múltiplo publicado equivalente para GPT-6.1 Sol, y ninguna parte independiente ha publicado tampoco una cifra de tokens por segundo para la variante Sol. La documentación de este nivel lo describe como una reducción del tiempo entre tokens de salida generados y remite a una tarjeta de tarifas.
Es una suposición previa razonable que el multiplicador se mantiene —ambos modelos se asientan sobre la misma pila de servicio y el mecanismo del nivel es el mismo—, pero "hasta" hace un trabajo real en esa frase, y un techo de proveedor medido en un modelo hermano con un cliente distinto no es el número que verá tu carga de trabajo. Lo mismo ocurre con el escalón más antiguo: Ultrafast sobre GPT-5.6 Sol se anunció en agosto de 2026 como "hasta 14 veces más rápido que el procesamiento Standard" en vista previa limitada, y la documentación sigue indicando acceso en vista previa, con la tabla de tarifas de Ultrafast conteniendo exactamente dos filas.
Lo único que puedes exigirle a OpenAI es el precio, porque el precio está publicado y se aplica a cada token. Lo que significa que la decisión de la que trata esta página es una decisión sobre tu propio presupuesto de latencia, no sobre la afirmación de velocidad del proveedor.

Probarlo sin confirmar y volver atrás.
El nivel está disponible para todos los usuarios de la API, así que la forma económica de responder a la pregunta del tiempo de reloj es ejecutar el mismo conjunto de prompts dos veces, con el campo activado y desactivado, y comparar los recuentos de tokens y los tiempos. Dos cosas que hay que vigilar en esa prueba: si tus solicitudes cruzan la línea de 272.000 tokens y si el tiempo hasta el primer token domina el tiempo entre tokens. Cualquiera de las dos puede hacer que la prueba parezca un resultado nulo cuando el nivel funciona exactamente como se anuncia.
Volver atrás es un campo de solicitud, no una migración, y la vía estándar se sirve a la tarifa de lista del propio proveedor a través de OrcaRouter como openai/gpt-6.1-sol — 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida, 0 % de recargo con el precio del proveedor traspasado tal cual, de modo que un cambio de precios del proveedor queda activo en nuestro lado el mismo día. Ultrafast en sí no es algo que vendamos; es un indicador de nivel de servicio que se factura en tu propia cuenta de OpenAI, y decir eso es más útil que insinuar lo contrario. Lo que sí compra una sola clave es la vía estándar más el resto del catálogo detrás de un único endpoint compatible con OpenAI, y conmutación automática por error entre proveedores, que vale la pena tener si estás a punto de poner un nivel caro delante de un agente de producción y quieres que la vía estándar sea una decisión de enrutamiento y no un cambio de código.

Una nota práctica sobre la vía rápida que no se aplica a la barata: WebSockets. OpenAI recomienda una conexión WebSocket persistente para Ultrafast, que es la forma adecuada para un agente que hace muchas llamadas secuenciales y la forma incorrecta para un script por lotes con una solicitud por proceso. Si tu cliente es del segundo tipo, el transporte recomendado por el propio nivel es otra razón por la que el trabajo nocturno debería estar en otro lugar.
Cuando el veredicto cambia
Tres avances quitarían trabajos de la lista de «quedarse». Un límite de tasa de Ultrafast publicado para GPT-6.1 Sol eliminaría el riesgo de techo del caso de Batch. Una medición de velocidad publicada o reproducida de forma independiente para el nivel Sol le permitiría presupuestar el ahorro de tiempo real en lugar de suponerlo. Y un peldaño con descuento en la vía rápida —un equivalente en Ultrafast de Batch, donde el nivel sigue siendo rápido pero no cuesta seis veces el precio— cambiaría la economía de cada trabajo en medio de la escalera.
Ninguno de esos existe hoy. Lo que existe es un nivel que es exactamente lo que dice ser: el mismo GPT-6.1 Sol, programado de forma diferente, a seis veces el precio en cada línea. Mueve el agente interactivo, deja en paz a los otros dos, y mide adónde van realmente tus segundos antes de decidir cuál es el tuyo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
