Um cartão hero gerado, intitulado 'Agora no nível mais rápido', com o subtítulo 'GPT-6.1 Sol Ultrafast chega à API, ao Codex e ao ChatGPT Work' e quatro chips com o texto '$12.00 / $60.00 por 1M tokens', '6x Standard', 'até 8x mais rápido (medição Astra)' e 'API, Codex e ChatGPT Work', sobre um rodapé com o texto 'Disponibilidade e preços conforme a documentação da OpenAI, 8 de outubro de 2026'.
Guides & Insights

GPT-6.1 Sol Ultrafast é lançado para a API, o Codex e o ChatGPT Work

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A OpenAI está lançando o modo Ultrafast para GPT-6.1 Sol — o nível de serviço mais rápido que ela vende, e a primeira vez que o nível Sol próximo do Astra conta com um. A medida coloca GPT-6.1 Sol no mesmo patamar que GPT-6 Astra Ultrafast na API, no Codex e no ChatGPT Work, e chega com uma tabela de preços publicada em vez de uma lista de espera: US$ 12,00 por milhão de tokens de entrada e US$ 60,00 por milhão de tokens de saída, exatamente seis vezes o que o padrão GPT-6.1 Sol custa. A promessa de velocidade no rótulo é "até 8x". A parte interessante é o que essa frase está medindo, e a resposta não é o modelo pelo qual você está prestes a pagar.

O changelog para desenvolvedores traz a entrada datada de 8 de outubro: "Modo Ultrafast adicionado para o GPT-6.1 Sol na API Responses. Use gpt-6.1-sol com service_tier: "ultrafast" para reduzir o tempo entre os tokens de saída gerados. Ele está disponível para todos os usuários da API, sujeito a limites de taxa, com processamento global e residência de dados nos EUA e na UE." A página de documentação do Ultrafast agora diz "amplamente disponível para o GPT-6 Astra e o GPT-6.1 Sol, com acesso de prévia para o GPT-5.6 Sol", e a página de velocidade do lado do ChatGPT confirma a metade da assinatura: o Ultrafast está disponível no Codex e no ChatGPT Work no plano Pro de US$ 500 e em planos Enterprise e Edu elegíveis.

Ultrafast é um nível de serviço, não um segundo modelo

Nada muda em relação aos pesos. O mesmo checkpoint, a mesma janela de contexto de 1.050.000 tokens, a mesma entrada máxima de 922.000 tokens, o mesmo teto de saída de 128.000 tokens, o mesmo corte de conhecimento em 30 de abril de 2026, as mesmas respostas. O que você está comprando é uma prioridade de agendamento: o modelo gera tokens mais rapidamente, e o enquadramento da própria O​penAI é deliberadamente restrito — o nível "reduz o tempo entre os tokens de saída gerados". Ele não torna o modelo mais inteligente, e não torna a fase de raciocínio mais curta.

Essa distinção é a decisão inteira. Para um loop de agente que faz quarenta chamadas de ferramenta seguidas, o ganho se acumula porque a saída de cada turno chega mais cedo. Para uma única solicitação difícil de raciocínio que passa a maior parte do seu tempo real deliberando, você pode pagar seis vezes mais e continuar vendo o mesmo indicador de carregamento.

A escada de níveis, uma vez, em termos simples:

• Batch and Flex — metade do Standard, a via barata para trabalhos que ninguém está aguardando

• Padrão — $2,00 de entrada / $0,10 em cache / $2,50 de gravação em cache / $10,00 de saída por milhão de tokens

• Fast — o dobro do Standard, ou $4.00 / $0.20 / $5.00 / $20.00; a OpenAI renomeou o processamento Priority para o modo Fast em 30 de julho de 2026

• Ultrarrápido — seis vezes o Padrão, ou $12,00 / $0,60 / $15,00 / $60,00

• Acima de 272K tokens de entrada — toda a solicitação é recalculada às taxas de 2x para entrada e cache e 1,5x para saída; o Ultrafast de contexto longo custa $24.00 / $1.20 / $30.00 / $90.00

A aritmética que ninguém coloca na página de marketing

Pagar seis vezes o preço por oito vezes a velocidade não é uma troca que dá prejuízo, e também não é um almoço grátis. O Ultrafast é cobrado por token, então um trabalho que custa US$ 1,00 no Standard custa US$ 6,00 no Ultrafast — e termina em aproximadamente um oitavo do tempo. A economia não está na fatura, está no tempo de relógio. Você está pagando cinco dólares a mais para eliminar sete oitavos do tempo de fila nesse trabalho, e se isso é barato ou absurdo depende inteiramente de quanto vale por minuto a pessoa ou o pipeline que espera do outro lado.

Duas implicações decorrem, e são elas que são tratadas:

• Trabalho interativo é o sim fácil. Um desenvolvedor vendo um diff chegar, um agente que não consegue prosseguir até ter lido o resultado — esses são os casos em que a latência é o produto. Uma saída oito vezes mais rápida num loop de quarenta turnos não é uma melhoria marginal para a percepção humana; é a diferença entre uma ferramenta que você usa e uma ferramenta que você deixa em segundo plano.

• Trabalho agendado e em lote é o não fácil. Se um job tem até de manhã de qualquer forma, o Ultrafast é uma fatura 6x mais cara sem motivo algum, e a faixa Batch pela metade do preço está logo ali.

A entrada em cache merece uma segunda olhada porque também muda: US$ 0,60 por milhão no Ultrafast contra US$ 0,10 no Standard, ainda 5% da tarifa de entrada sem cache. Agentes com cache de prompt que reenviam um grande prompt de sistema a cada turno descobrirão que o desconto de cache escala com o nível, em vez de os proteger dele.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, alongside the page's notes that regional processing endpoints carry a 10% uplift, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

De onde vem o número "até 8x"

Esta é a parte que deve ser lida com atenção, porque é aqui que a manchete do lançamento e a documentação do lançamento descrevem, discretamente, coisas diferentes.

A única medição de velocidade específica do modelo que a OpenAI publica é esta frase: "O GPT-6 Astra Ultrafast gera tokens até 8x mais rápido do que o GPT-6 Astra no modo Standard no Codex." Esse é um valor do Astra, medido no Codex. Não há um múltiplo equivalente publicado para o GPT-6.1 Sol. O documento que cobre o Ultrafast para este modelo diz que ele reduz o tempo entre os tokens de saída gerados e aponta para uma tabela de preços; não atribui um número a isso. A página de velocidade do ChatGPT repete a frase do Astra e para por aí.

Então, a leitura honesta de "até 8x mais rápido" é: é a manchete do nível, proveniente do modelo irmão que está no Ultrafast desde 29 de setembro, e é uma alegação de fornecedor que nenhuma parte independente reproduziu para nenhum dos dois modelos. Pode muito bem valer para o GPT-6.1 Sol — os dois rodam na mesma pilha de serviço e o mecanismo do nível é o mesmo —, mas ninguém fora da OpenAI publicou uma medição de tokens por segundo para a variante Sol, e o "até" está fazendo um trabalho de verdade nessa frase.

Também vale a pena manter os níveis separados por modelo, porque o mais antigo ainda é uma pendência. O Ultrafast foi anunciado em 13 de agosto de 2026 para o GPT-5.6 Sol como "até 14x mais rápido que o processamento padrão", em pré-visualização limitada para clientes selecionados. Três meses depois, a documentação ainda diz que o GPT-5.6 Sol tem "acesso de pré-visualização" e a tabela de preços do Ultrafast contém exatamente duas linhas — GPT-6 Astra e GPT-6.1 Sol. Um número de 14x que nunca chegou à disponibilidade geral e não tem preço publicado é uma alegação, não um produto.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Ultrafast mode is the fastest service tier in the OpenAI API', the availability sentence naming broad availability for GPT-6 Astra and GPT-6.1 Sol with preview access for GPT-5.6 Sol, the statement that Ultrafast mode for GPT-6 Astra and GPT-6.1 Sol is available to all API users, the recommendation to use WebSockets because network overhead without a persistent connection can reduce the latency gains, the note that Ultrafast has separate rate limits from Standard and Fast modes, the GPT-6.1 Sol rate-limit row reading 1,000,000 / 4,000,000 / 40,000,000 tokens per minute and 5,000 / 20,000 / 200,000 requests per minute, the line that GPT-6.1 Sol supports US and EU data residency and global processing, and a code sample setting service_tier to 'ultrafast' with model 'gpt-6.1-sol'.

Quem pode realmente ligá-lo?

O lado da API é amplo; o lado das assinaturas é restrito, e a diferença apanha as pessoas de surpresa.

• API — disponível para todos os usuários da API no gpt-6.1-sol, sujeito a limites de taxa separados dos de Standard e Fast. Isso significa um segundo orçamento a acompanhar, não apenas um segundo preço.

• Limites de taxa ultrarrápidos para o GPT-6.1 Sol — 1,000,000 tokens por minuto no Build, 4,000,000 no Launch, 40,000,000 no Grow. A OpenAI simplificou seus níveis de uso de cinco para três em 6 de outubro, então esses três nomes são a escada atual, e não um legado.

• Residência de dados — O GPT-6.1 Sol oferece suporte a residência de dados nos EUA e na UE e processamento global, inclusive em Fast e Ultrafast. O Ultrafast da Astra não obtém residência na UE, portanto, se a sua carga de trabalho estiver fixada na UE, esta é a primeira configuração Ultrafast que você pode comprar.

• Codex e ChatGPT Work — Ultrafast está disponível no plano Pro de US$ 500 e nos planos Enterprise e Edu elegíveis. Os administradores do Enterprise o recebem desativado por padrão e precisam ativá-lo por usuário ou por workspace.

• Chat — não incluído. O próprio GPT-6.1 Sol vive no Work e no Codex; a superfície de Chat para consumidores não faz parte disto.

• Como isso é cobrado em uma assinatura — o uso incluído é consumido a 8x a tarifa Standard, e os créditos comprados ou o pay-as-you-go do Enterprise são cobrados a 6x a tarifa Standard. Vale a pena conhecer esses dois números antes de deixar isso ativado.

Um detalhe de implementação decide se você verá alguma coisa da velocidade. A orientação da OpenAI é direta quanto a isso: use WebSockets, "especialmente para aplicações agênticas que fazem muitas chamadas de ferramentas em rápida sucessão", porque "sem uma conexão persistente, a sobrecarga de rede pode reduzir os ganhos de latência". Se o seu cliente abre uma nova conexão HTTP a cada chamada, a sobrecarga por requisição pode consumir toda a vantagem do nível pelo qual você acabou de pagar 6x. O HTTP ainda funciona. Só que pode não valer a pena o nível.

O que encaminhamos, e o que não encaminhamos

O GPT-6.1 Sol de nível padrão está no OrcaRouter como openai/gpt-6.1-sol aos preços do próprio provedor: US$ 2,00 de entrada e US$ 10,00 de saída por milhão de tokens, oferecido com 0% de markup — o preço de tabela do fornecedor repassado, então quando a O​penAI altera uma tarifa, a mudança entra na sua fatura no mesmo dia em que entra na tabela de preços, e não na sua próxima renovação de contrato. A mesma chave e o mesmo endpoint atendem mais de 200 modelos, então uma chamada ao GPT-6.1 Sol e uma chamada ao Claude ou ao Q​wen ficam atrás de uma única integração, com failover automático e sem um segundo contrato, e a DSL de roteamento irá compor modelos em uma única chamada quando uma tarefa precisar de mais de uma opinião.

O Ultrafast não é um desses modelos, e seria enganoso sugerir o contrário. É uma flag de nível de serviço numa conta da O​penAI — você envia service_tier: "ultrafast"para gpt-6.1-sole a O​penAI fatura a sua própria conta com as tarifas acima —, por isso ela vive dentro da sua integração direta com a O​penAI. Se você a ativar, mantenha o tráfego escalonado por níveis na chave do seu fornecedor e encaminhe o tráfego de volume padrão através de nós. Essa é a divisão honesta, e também é a mais barata para tudo o que não está à espera de um humano.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s, a 10.00 s figure, and 313.9M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

O que fazer com isso hoje

Se você tiver um assento Codex ou ChatGPT Work no Pro de $500, o botão de alternância já está lá e o teste não custa nada além do multiplicador de uso — execute a mesma tarefa das duas maneiras e veja se o loop que você realmente executa tem turnos suficientes para que o fator oito apareça. Se você estiver na API, o experimento que vale a pena rodar é mais restrito do que o anúncio sugere: instrumente quanto da sua latência é geração de tokens e quanto é o modelo pensando, depois direcione o Ultrafast para a parte que ele realmente consegue comprimir.

E se você tiver uma escolha entre Fast a 2x e Ultrafast a 6x para a mesma requisição, Fast é o nível que chegou primeiro e aquele cujo comportamento você consegue deduzir apenas de uma tabela de preços. Ultrafast é novo para este modelo, não tem preço definido por nenhuma medição independente e vale exatamente o que o seu próprio cronômetro disser que vale.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente