
GPT-6.1 Sol Ultrafast é lançado para a API, o Codex e o ChatGPT Work
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A OpenAI está lançando o modo Ultrafast para GPT-6.1 Sol — o nível de serviço mais rápido que ela vende, e a primeira vez que o nível Sol próximo do Astra conta com um. A medida coloca GPT-6.1 Sol no mesmo patamar que GPT-6 Astra Ultrafast na API, no Codex e no ChatGPT Work, e chega com uma tabela de preços publicada em vez de uma lista de espera: US$ 12,00 por milhão de tokens de entrada e US$ 60,00 por milhão de tokens de saída, exatamente seis vezes o que o padrão GPT-6.1 Sol custa. A promessa de velocidade no rótulo é "até 8x". A parte interessante é o que essa frase está medindo, e a resposta não é o modelo pelo qual você está prestes a pagar.
O changelog para desenvolvedores traz a entrada datada de 8 de outubro: "Modo Ultrafast adicionado para o GPT-6.1 Sol na API Responses. Use gpt-6.1-sol com service_tier: "ultrafast" para reduzir o tempo entre os tokens de saída gerados. Ele está disponível para todos os usuários da API, sujeito a limites de taxa, com processamento global e residência de dados nos EUA e na UE." A página de documentação do Ultrafast agora diz "amplamente disponível para o GPT-6 Astra e o GPT-6.1 Sol, com acesso de prévia para o GPT-5.6 Sol", e a página de velocidade do lado do ChatGPT confirma a metade da assinatura: o Ultrafast está disponível no Codex e no ChatGPT Work no plano Pro de US$ 500 e em planos Enterprise e Edu elegíveis.
Ultrafast é um nível de serviço, não um segundo modelo
Nada muda em relação aos pesos. O mesmo checkpoint, a mesma janela de contexto de 1.050.000 tokens, a mesma entrada máxima de 922.000 tokens, o mesmo teto de saída de 128.000 tokens, o mesmo corte de conhecimento em 30 de abril de 2026, as mesmas respostas. O que você está comprando é uma prioridade de agendamento: o modelo gera tokens mais rapidamente, e o enquadramento da própria OpenAI é deliberadamente restrito — o nível "reduz o tempo entre os tokens de saída gerados". Ele não torna o modelo mais inteligente, e não torna a fase de raciocínio mais curta.
Essa distinção é a decisão inteira. Para um loop de agente que faz quarenta chamadas de ferramenta seguidas, o ganho se acumula porque a saída de cada turno chega mais cedo. Para uma única solicitação difícil de raciocínio que passa a maior parte do seu tempo real deliberando, você pode pagar seis vezes mais e continuar vendo o mesmo indicador de carregamento.
A escada de níveis, uma vez, em termos simples:
• Batch and Flex — metade do Standard, a via barata para trabalhos que ninguém está aguardando
• Padrão — $2,00 de entrada / $0,10 em cache / $2,50 de gravação em cache / $10,00 de saída por milhão de tokens
• Fast — o dobro do Standard, ou $4.00 / $0.20 / $5.00 / $20.00; a OpenAI renomeou o processamento Priority para o modo Fast em 30 de julho de 2026
• Ultrarrápido — seis vezes o Padrão, ou $12,00 / $0,60 / $15,00 / $60,00
• Acima de 272K tokens de entrada — toda a solicitação é recalculada às taxas de 2x para entrada e cache e 1,5x para saída; o Ultrafast de contexto longo custa $24.00 / $1.20 / $30.00 / $90.00
A aritmética que ninguém coloca na página de marketing
Pagar seis vezes o preço por oito vezes a velocidade não é uma troca que dá prejuízo, e também não é um almoço grátis. O Ultrafast é cobrado por token, então um trabalho que custa US$ 1,00 no Standard custa US$ 6,00 no Ultrafast — e termina em aproximadamente um oitavo do tempo. A economia não está na fatura, está no tempo de relógio. Você está pagando cinco dólares a mais para eliminar sete oitavos do tempo de fila nesse trabalho, e se isso é barato ou absurdo depende inteiramente de quanto vale por minuto a pessoa ou o pipeline que espera do outro lado.
Duas implicações decorrem, e são elas que são tratadas:
• Trabalho interativo é o sim fácil. Um desenvolvedor vendo um diff chegar, um agente que não consegue prosseguir até ter lido o resultado — esses são os casos em que a latência é o produto. Uma saída oito vezes mais rápida num loop de quarenta turnos não é uma melhoria marginal para a percepção humana; é a diferença entre uma ferramenta que você usa e uma ferramenta que você deixa em segundo plano.
• Trabalho agendado e em lote é o não fácil. Se um job tem até de manhã de qualquer forma, o Ultrafast é uma fatura 6x mais cara sem motivo algum, e a faixa Batch pela metade do preço está logo ali.
A entrada em cache merece uma segunda olhada porque também muda: US$ 0,60 por milhão no Ultrafast contra US$ 0,10 no Standard, ainda 5% da tarifa de entrada sem cache. Agentes com cache de prompt que reenviam um grande prompt de sistema a cada turno descobrirão que o desconto de cache escala com o nível, em vez de os proteger dele.

De onde vem o número "até 8x"
Esta é a parte que deve ser lida com atenção, porque é aqui que a manchete do lançamento e a documentação do lançamento descrevem, discretamente, coisas diferentes.
A única medição de velocidade específica do modelo que a OpenAI publica é esta frase: "O GPT-6 Astra Ultrafast gera tokens até 8x mais rápido do que o GPT-6 Astra no modo Standard no Codex." Esse é um valor do Astra, medido no Codex. Não há um múltiplo equivalente publicado para o GPT-6.1 Sol. O documento que cobre o Ultrafast para este modelo diz que ele reduz o tempo entre os tokens de saída gerados e aponta para uma tabela de preços; não atribui um número a isso. A página de velocidade do ChatGPT repete a frase do Astra e para por aí.
Então, a leitura honesta de "até 8x mais rápido" é: é a manchete do nível, proveniente do modelo irmão que está no Ultrafast desde 29 de setembro, e é uma alegação de fornecedor que nenhuma parte independente reproduziu para nenhum dos dois modelos. Pode muito bem valer para o GPT-6.1 Sol — os dois rodam na mesma pilha de serviço e o mecanismo do nível é o mesmo —, mas ninguém fora da OpenAI publicou uma medição de tokens por segundo para a variante Sol, e o "até" está fazendo um trabalho de verdade nessa frase.
Também vale a pena manter os níveis separados por modelo, porque o mais antigo ainda é uma pendência. O Ultrafast foi anunciado em 13 de agosto de 2026 para o GPT-5.6 Sol como "até 14x mais rápido que o processamento padrão", em pré-visualização limitada para clientes selecionados. Três meses depois, a documentação ainda diz que o GPT-5.6 Sol tem "acesso de pré-visualização" e a tabela de preços do Ultrafast contém exatamente duas linhas — GPT-6 Astra e GPT-6.1 Sol. Um número de 14x que nunca chegou à disponibilidade geral e não tem preço publicado é uma alegação, não um produto.

Quem pode realmente ligá-lo?
O lado da API é amplo; o lado das assinaturas é restrito, e a diferença apanha as pessoas de surpresa.
• API — disponível para todos os usuários da API no gpt-6.1-sol, sujeito a limites de taxa separados dos de Standard e Fast. Isso significa um segundo orçamento a acompanhar, não apenas um segundo preço.
• Limites de taxa ultrarrápidos para o GPT-6.1 Sol — 1,000,000 tokens por minuto no Build, 4,000,000 no Launch, 40,000,000 no Grow. A OpenAI simplificou seus níveis de uso de cinco para três em 6 de outubro, então esses três nomes são a escada atual, e não um legado.
• Residência de dados — O GPT-6.1 Sol oferece suporte a residência de dados nos EUA e na UE e processamento global, inclusive em Fast e Ultrafast. O Ultrafast da Astra não obtém residência na UE, portanto, se a sua carga de trabalho estiver fixada na UE, esta é a primeira configuração Ultrafast que você pode comprar.
• Codex e ChatGPT Work — Ultrafast está disponível no plano Pro de US$ 500 e nos planos Enterprise e Edu elegíveis. Os administradores do Enterprise o recebem desativado por padrão e precisam ativá-lo por usuário ou por workspace.
• Chat — não incluído. O próprio GPT-6.1 Sol vive no Work e no Codex; a superfície de Chat para consumidores não faz parte disto.
• Como isso é cobrado em uma assinatura — o uso incluído é consumido a 8x a tarifa Standard, e os créditos comprados ou o pay-as-you-go do Enterprise são cobrados a 6x a tarifa Standard. Vale a pena conhecer esses dois números antes de deixar isso ativado.
Um detalhe de implementação decide se você verá alguma coisa da velocidade. A orientação da OpenAI é direta quanto a isso: use WebSockets, "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", porque "sem uma conexão persistente, a sobrecarga de rede pode reduzir os ganhos de latência". Se o seu cliente abre uma nova conexão HTTP a cada chamada, a sobrecarga por requisição pode consumir toda a vantagem do nível pelo qual você acabou de pagar 6x. O HTTP ainda funciona. Só que pode não valer a pena o nível.
O que encaminhamos, e o que não encaminhamos
O GPT-6.1 Sol de nível padrão está no OrcaRouter como openai/gpt-6.1-sol aos preços do próprio provedor: US$ 2,00 de entrada e US$ 10,00 de saída por milhão de tokens, oferecido com 0% de markup — o preço de tabela do fornecedor repassado, então quando a OpenAI altera uma tarifa, a mudança entra na sua fatura no mesmo dia em que entra na tabela de preços, e não na sua próxima renovação de contrato. A mesma chave e o mesmo endpoint atendem mais de 200 modelos, então uma chamada ao GPT-6.1 Sol e uma chamada ao Claude ou ao Qwen ficam atrás de uma única integração, com failover automático e sem um segundo contrato, e a DSL de roteamento irá compor modelos em uma única chamada quando uma tarefa precisar de mais de uma opinião.
O Ultrafast não é um desses modelos, e seria enganoso sugerir o contrário. É uma flag de nível de serviço numa conta da OpenAI — você envia service_tier: "ultrafast"para gpt-6.1-sole a OpenAI fatura a sua própria conta com as tarifas acima —, por isso ela vive dentro da sua integração direta com a OpenAI. Se você a ativar, mantenha o tráfego escalonado por níveis na chave do seu fornecedor e encaminhe o tráfego de volume padrão através de nós. Essa é a divisão honesta, e também é a mais barata para tudo o que não está à espera de um humano.

O que fazer com isso hoje
Se você tiver um assento Codex ou ChatGPT Work no Pro de $500, o botão de alternância já está lá e o teste não custa nada além do multiplicador de uso — execute a mesma tarefa das duas maneiras e veja se o loop que você realmente executa tem turnos suficientes para que o fator oito apareça. Se você estiver na API, o experimento que vale a pena rodar é mais restrito do que o anúncio sugere: instrumente quanto da sua latência é geração de tokens e quanto é o modelo pensando, depois direcione o Ultrafast para a parte que ele realmente consegue comprimir.
E se você tiver uma escolha entre Fast a 2x e Ultrafast a 6x para a mesma requisição, Fast é o nível que chegou primeiro e aquele cujo comportamento você consegue deduzir apenas de uma tabela de preços. Ultrafast é novo para este modelo, não tem preço definido por nenhuma medição independente e vale exatamente o que o seu próprio cronômetro disser que vale.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
