
GPT-5.6 Sol Ultrafast: Ultrafast foi lançado a 6× o preço padrão, mas este modelo ainda é apenas de pré-visualização
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 362 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A espera acabou para o nível, mas não para este modelo. No DevDay, em 29 de setembro de 2026, o fornecedor transformou o Ultrafast em algo que você pode comprar: o novo plano ChatGPT Pro 500, de US$ 500 por mês, o inclui no pacote, a API agora publica uma tabela de tarifas do Ultrafast a seis vezes a tarifa padrão — US$ 60,00 de entrada / US$ 300,00 de saída por milhão de tokens no GPT-6 Astra — e a documentação do Codex do fornecedor confirma que os níveis Pro não têm absolutamente nenhum limite de uso de cinco horas, uma janela que se aplica ao Plus. Tudo isso é declarado pelo fornecedor, publicado no próprio resumo do DevDay do fornecedor, nas páginas de ajuda e na documentação para desenvolvedores. O que não mudou é o modelo sobre o qual esta página trata. GPT-5.6 Sol Ultrafast, anunciado em 13 de agosto de 2026 como o nível de serviço acelerado pela Cerebras para GPT-5.6 Sol com até 14× a taxa de transferência padrão e 750 tokens de saída por segundo, ainda é apenas acesso de pré-visualização — organizado por meio da equipe de contas do fornecedor — e ainda não tem preço publicado próprio. O nível foi lançado. A variante Sol ainda está esperando.
Dois movimentos de preço surgiram desde que escrevemos isto pela primeira vez, e eles apontam em direções opostas. O modelo por trás ficou mais barato: o GPT-5.6 Sol padrão agora é cobrado a US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída — a tarifa promocional da OpenAI, que, segundo o fornecedor, está disponível pelo menos até 21 de novembro de 2026 — e não os US$ 5,00 / US$ 30,00 vigentes em agosto. O nível de velocidade adicional recebeu um preço pela primeira vez, e não é barato: o Ultrafast no GPT-6 Astra é cobrado a US$ 60,00 / US$ 300,00 por milhão. Todos os números desta matéria foram verificados novamente em relação à tabela de preços publicada pela OpenAI, à sua referência de API e à sua documentação de preços do Codex em 30 de setembro de 2026.
O que o modo Ultrafast realmente é
Ultrafast é um nível de serviço, não um novo modelo. A OpenAI o anunciou em 13 de agosto de 2026 como o primeiro produto de sua parceria de computação de janeiro de 2026 com a fabricante de chips Cerebras — um acordo noticiado em cerca de US$ 10 bilhões ao longo de três anos. Enquanto a inferência padrão do GPT-5.6 Sol roda em clusters de GPU e passa grande parte do tempo movendo pesos entre memória e computação, o Ultrafast carrega os pesos do modelo em 44 GB de SRAM on-chip nos chips em escala de wafer da Cerebras; um modelo do tamanho do Sol se estende por vários wafers em camadas, então os pesos ficam onde está a computação. O resultado é um teto de throughput definido pelo silício, e não pela largura de banda de memória.
A história do hardware avançou em 18 de agosto de 2026. No evento Supernova, a Cerebras revelou o CS-4, o sistema rack-scale de próxima geração construído em sua plataforma Nexus — três chips Wafer-Scale Engine por rack, até 2× a velocidade de geração de tokens do CS-3 anterior e, segundo a Cerebras, mais de 1.000 tokens por segundo em modelos acima de 10 trilhões de parâmetros. Essas são as afirmações da Cerebras para um sistema em acesso antecipado, ainda não disponível ao público em geral. Desde a revelação, uma única postagem no X afirma que o CS-4 já atende ao GPT-5.6 Sol a cerca de 1.300 tokens por segundo — em linha com os próprios números da Cerebras, mas não confirmado por ninguém até o momento. Trate isso como um sinal precoce: plausível, não verificado e que vale a pena verificar novamente antes de planejar capacidade com base nele.
A parte que importa para o seu código: o id do modelo, os pesos, o comportamento de raciocínio e a saída são idênticos ao GPT-5.6 Sol padrão. A OpenAI enquadra o Ultrafast como "mais trabalho útil por segundo" em vez de um nível de qualidade, e a prévia executa o carro-chefe completo — a velocidade não vem de trocar por um modelo mais barato. O que muda é a velocidade com que os tokens são emitidos.
Não confunda o Ultrafast com o modo rápido. O modo rápido é um nível separado e comprável no hardware padrão: até cerca de 2,5× de velocidade de saída, com um prêmio de 2× por token, sem qualquer mudança de qualidade — ele foi renomeado de Priority Processing em 30 de julho de 2026, e no GPT-5.6 Sol custa US$ 8,00 de entrada / US$ 40,00 de saída por 1M. O Ultrafast é outra coisa — hardware Cerebras, até 14× no GPT-5.6 Sol e até 8× no GPT-6 Astra, custando 6× a tarifa padrão no Astra e ainda sem preço definido no Sol. Os dois nomes agora ficam lado a lado no mesmo seletor de modelos, o que continua sendo a coisa mais confusa desta versão.
Quão rápido — os números que importam

O número principal é 14×, e ele precisa de uma definição. A OpenAI afirma que o Ultrafast gera até 750 tokens de saída por segundo, em comparação com o processamento padrão do GPT-5.6 Sol. Esse é um número de throughput para tokens de saída, não uma afirmação genérica de que "tudo roda 14× mais rápido" — o tempo de requisição de ponta a ponta também inclui o processamento da entrada e o raciocínio do próprio modelo, e é por isso que 14× é rotulado como um máximo.
• Taxa de transferência máxima de saída — até 750 tokens de saída por segundo, conforme anúncio da OpenAI (2026-08-13).
• Em comparação com o processamento padrão — até 14× mais rápido, conforme o mesmo anúncio; os ganhos reais variam de acordo com o comprimento da entrada e o tipo de tarefa.
• Humanity's Last Exam, 2.500 perguntas — a OpenAI/Cerebras relata que o GPT-5.6 Sol Ultrafast termina em 11 horas e 11 minutos, contra 78 horas e 27 minutos do Claude Fable 5, com precisão comparável. Relatado pelos próprios fornecedores, e a comparação abrange as pilhas de hardware de dois fornecedores — interprete como indicação, não como veredito.
• GDP-Val, de ponta a ponta — a Cerebras relata ser 5,6× mais rápido no geral, sem perda de qualidade mensurável. Também relatado pelo fornecedor.
• Modo rápido e Ultrafast em comparação — o modo rápido chega a cerca de 2,5× a velocidade de saída por um acréscimo de preço de 2×, limitado ao mesmo limite de ~272K tokens do preço padrão. O Ultrafast é o salto maior: 14× no GPT-5.6 Sol, segundo o anúncio de agosto, e até 8× no GPT-6 Astra no Codex, conforme a documentação atual da OpenAI, com a cobertura de lançamento indicando até 300 tokens de saída por segundo.
{{1}}CS-4, o próximo hardware{{/1}} — {{2}}A Cerebras afirma que o rack CS-4 entrega mais de 1.000 tokens por segundo em modelos acima de 10 trilhões de parâmetros, até 2× a geração de tokens do CS-3.{{/2}} — {{3}}Um relato não verificado da comunidade coloca o GPT-5.6 Sol no CS-4 em ~1.300 tokens por segundo — mesma direção, ainda não confirmado pela OpenAI ou pela Cerebras.{{/3}}
Uma ressalva antes de você citar o 14×: trata-se de um teto de taxa de transferência de saída no hardware de um único fornecedor, e comparações independentes do lançamento de agosto variaram de cerca de 7× a 11×, dependendo de qual parte de uma carga de trabalho foi medida. A mesma disciplina se aplica ao sinal de velocidade do CS-4 — o número de ~1.300 tokens/s para o GPT-5.6 Sol no CS-4 começou como uma única postagem no X, e nem a OpenAI nem a Cerebras o confirmaram. Trate todas essas informações como alegações de fornecedores e da comunidade, não como veredictos de benchmark.
Quanto custa o Ultrafast agora — e por que isso ainda não precifica Sol

Aqui está o estado da questão de preços em 2026-09-30, dito de forma clara. O Ultrafast tem uma tarifa publicada — para o GPT-6 Astra, e apenas para o GPT-6 Astra. A página de preços da OpenAI agora traz uma coluna Ultrafast ao lado de Standard, Batch, Flex e Fast: US$ 60,00 de entrada / US$ 6,00 de entrada em cache / US$ 75,00 de gravações em cache / US$ 300,00 de saída por milhão de tokens em contexto curto, dobrando para US$ 120,00 / US$ 12,00 / US$ 150,00 / US$ 450,00 após aproximadamente 272K tokens. Isso é seis vezes a tarifa padrão do Astra, enquanto o modo rápido é duas vezes — e é o primeiro número concreto que a OpenAI apresenta para o nível. O cartão acima é o nosso próprio snapshot de 2026-08-18, e os seus valores em dólares foram superados duas vezes: pelo corte da tarifa padrão e, agora, por esta linha do Ultrafast. O que ainda falta nessa tabela é qualquer tarifa Ultrafast para o GPT-5.6 Sol: a coluna Ultrafast lista exatamente um modelo, gpt-6-astra. O nível tem preço; este modelo, não.
O que você pode precificar hoje, modelo por modelo:
• GPT-5.6 Sol padrão — US$ 4,00 de entrada / US$ 20,00 de saída por 1 milhão de tokens para prompts de até aproximadamente 272 mil tokens. A OpenAI classifica isso como preço promocional, disponível pelo menos até 21 de novembro de 2026. Esta é a linha de base que você pode chamar agora mesmo.
• Modo rápido — $8,00 / $40,00 em contexto curto no GPT-5.6 Sol, dobrando para $16,00 / $60,00 após cerca de 272K tokens. O dobro da tarifa padrão para até cerca de 2,5× a velocidade de saída e, no Sol, ainda é a opção mais rápida que você pode de fato comprar.
• Cache de prompt — leituras de cache custam $0.40 por 1M (90% de desconto sobre entrada nova); gravações de cache custam $5.00 por 1M.
• Nível de contexto longo — entradas acima de aproximadamente 272K tokens são cobradas a US$ 8,00 / US$ 30,00 no processamento padrão, dentro da janela de ~1,05M tokens do modelo e da saída máxima de 128K tokens.
• Batch API — $2.00 / $10.00 para contexto curto e $4.00 / $15.00 para contexto longo, um desconto fixo de 50% com um prazo de aproximadamente 24 horas.
Para o GPT-5.6 Sol, o número da Astra é a melhor pista disponível e nada mais. A OpenAI cobra o Ultrafast a 6× a tarifa padrão do modelo subjacente; aplique esse multiplicador aos US$ 4 / US$ 20 do Sol e você chega a US$ 24 / US$ 120 por milhão. Isso é aritmética, não um preço publicado — a OpenAI não disse nada sobre uma tarifa do Sol Ultrafast, e as coortes de prévia de agosto não foram cobradas a uma tarifa de nível de forma alguma. Planeje com base no Sol padrão a US$ 4 / US$ 20 ou no modo rápido a US$ 8 / US$ 40 até que o fornecedor publique a linha.
Como usá-lo — amplamente disponível no Astra, ainda sob solicitação no Sol
O acesso se dividiu em dois em 29 de setembro, e a divisão vai contra o modelo que esta página aborda. O Ultrafast agora está amplamente disponível no GPT-6 Astra: a documentação da API da OpenAI diz que ele está aberto a todos os usuários da API com baixos limites de taxa — 500.000 tokens por minuto nos níveis de uso 1–3, 1 milhão no nível 4, 5 milhões no nível 5 — e é disponibilizado dentro do ChatGPT Work e do Codex no novo plano Pro 500 e em planos Enterprise e Edu elegíveis, onde o proprietário de um workspace precisa ativá-lo, e onde não é compatível com workspaces que exigem inferência fora dos Estados Unidos. O GPT-5.6 Sol Ultrafast não se moveu com ele. A mesma documentação ainda o descreve como acesso de pré-visualização por meio de uma equipe de contas da OpenAI, e a própria descrição do parâmetro no esquema da API ainda diz "atualmente disponível para gpt-5.6-sol" — uma linha que agora fica atrás do resto da documentação em vez de liderá-la. Se você quer o nível hoje, você o quer no Astra.
A questão da interface também está resolvida. O TestingCatalog informou em 2026-09-26 que um seletor de velocidade com opções Padrão, Rápido e Ultrarrápido estava não publicado no Responses API Playground; três dias depois, a OpenAI lançou a versão para consumidores exatamente desse recurso, com o Ultrarrápido agora como opção no seletor de modelos do ChatGPT Work e do Codex no Pro 500. Sinalizamos esse avistamento como a leitura de uma publicação sobre uma interface não lançada e dissemos que a OpenAI não havia confirmado nada disso. Estava certo na direção, e o lançamento ao qual ele apontava chegou no DevDay, e não depois dele.
As coortes de pré-visualização que a OpenAI nomeou em agosto eram de codificação, comércio, pesquisa financeira, suporte e outras cargas de trabalho interativas — equipes cujos agentes fazem muitas chamadas por solicitação e nas quais a latência de resposta é o gargalo. Jane Street, Rogo e Podium estavam entre os primeiros testadores nomeados. Se sua carga de trabalho for um chat de turno único, o nível de velocidade importa muito menos do que para um loop de agente com 40 chamadas. A resposta prática agora depende de sobre qual modelo você está perguntando: no GPT-6 Astra, você pode definir service_tier: "ultrafast" hoje à tarde, e no GPT-5.6 Sol você ainda não pode.
O que você pode fazer hoje — a resposta prática

Embora o GPT-5.6 Sol Ultrafast permaneça atrás da porta de pré-visualização, ambos os modelos carro-chefe estão disponíveis no OrcaRouter à tarifa do provedor, com $0 de markup por token — ID do modelo openai/gpt-5.6-sol por meio do endpoint compatível com OpenAI em api.orcarouter.ai/v1, e o GPT-6 Astra ao lado dele no padrão de $10.00 / $50.00, que é o modelo sobre o qual a OpenAI agora colocou um nível Ultrafast e que não roteamos nesse nível. A captura abaixo é de agosto de 2026 e ainda mostra a linha então vigente de $5.00 / $30.00; a tarifa atual do Sol é $4.00 / $20.00, que é o que repassamos. Esse repasse é o motivo pelo qual mudanças de preço do fornecedor chegam ao nosso lado no mesmo dia: $4.00 de entrada / $20.00 de saída, os mesmos números que a OpenAI publica, sem markup por token adicionado por cima. Se você já tem um cliente OpenAI, a migração é uma mudança de URL base e de ID do modelo; nada mais. A mesma chave e o mesmo endpoint atendem mais de 200 modelos, então o Sol fica ao lado de seus próprios irmãos — GPT-5.6 Terra a $2.00 / $12.00 e GPT-5.6 Luna a $0.20 / $1.20 — e dos modelos de pesos abertos com os quais você o compararia, e você pode rotear por dificuldade em vez de reintegrar cada um.
Dois detalhes específicos do OrcaRouter merecem ser mencionados em uma página de velocidade. BYOK: use a sua própria chave da OpenAI e a OpenAI faz a cobrança diretamente, às tarifas da própria OpenAI — o OrcaRouter acrescenta $0 por token e mantém intactos os limites de taxa e os créditos do seu provedor. Guardrails: o PII Shield e a política de conteúdo são executados antes da cobrança, então uma solicitação bloqueada retorna um 400 limpo e nunca é cobrada, e o Agent Firewall avalia chamadas de ferramentas e de MCP antes que sejam executadas. O próprio Ultrafast está amplamente disponível no GPT-6 Astra, mas não em termos que permitam roteamento e não para o Sol — é um nível com controle de acesso, cobrado a 6× a tarifa padrão, e nós não o servimos. Se a OpenAI algum dia oferecê-lo em termos padrão, conectá-lo ao mesmo endpoint é uma mudança de model-id; a configuração que você criar hoje continua valendo.
O limite honesto — quando Ultrafast não é a resposta
Cinco pontos em que a história da velocidade ainda não se sustenta, agora que metade dela já se assentou:
Disponível não é o mesmo que disponível para você. O Ultrafast foi aberto a todos os usuários da API no GPT-6 Astra, mas foi aberto com limites de taxa baixos, ainda é descrito como de acesso controlado no schema da OpenAI, não oferece suporte a processamento regional na UE ou em outras regiões fora dos EUA e, em workspaces Enterprise, fica desativado até que um proprietário o habilite. No GPT-5.6 Sol, nada foi aberto. Verifique seu próprio acesso antes de arquitetar em qualquer um dos dois.
14× é um máximo, não uma garantia. É um teto de vazão de saída no hardware Cerebras; a latência ponta a ponta ainda inclui o processamento de entrada, o tempo de raciocínio do modelo e a sua própria rede. Um prompt com muito raciocínio pode passar a maior parte do tempo de relógio pensando, onde a aceleração anunciada diminui.
Há um preço para um modelo e nenhum preço para o outro. A tarifa do Astra Ultrafast está publicada — 6× a tarifa padrão — e não há nenhuma linha Ultrafast para o GPT-5.6 Sol em lugar algum. Faça o orçamento com base no Sol padrão a $4 / $20 ou no modo rápido a $8 / $40, e trate qualquer valor de "custo do GPT-5.6 Sol Ultrafast" que você vir, incluindo a extrapolação de $24 / $120 acima, como aritmética, e não como uma tabela de tarifas.
Os benchmarks são relatados pelo fornecedor. A execução de 11 horas do HLE e o número de 5,6× do GDP-Val são dados da OpenAI/Cerebras do anúncio de agosto; estimativas independentes da aceleração variam de aproximadamente 7× a 11×, dependendo do que é medido. Adicione o sinal do CS-4 a essa lista: o número de ~1.300 tokens/s para o GPT-5.6 Sol no CS-4 vem de um único post no X e não tem confirmação independente. Os novos números do Astra Ultrafast — 8× no Codex, 6× o preço — também são da própria OpenAI.
E aquele que custa dinheiro em vez de tempo: ele não corrige um gargalo que você não tem. Se os seus agentes estão lentos por causa da sua própria orquestração, da latência das ferramentas ou de prompts pesados em entrada, um caminho de saída mais rápido move a cauda apenas ligeiramente. A decisão de correspondência de níveis — GPT-5.6 Sol a $4 / $20 versus GPT-5.6 Terra a $2 / $12 versus GPT-5.6 Luna a $0,20 / $1,20 — ainda move a sua fatura mais do que qualquer nível de velocidade.
Em resumo. O Ultrafast não é mais um nível de lista de espera sobre o qual você só pode ler. Desde 29 de setembro de 2026, a OpenAI o vende: incluído no plano ChatGPT Pro 500 de US$ 500 no Work e no Codex, disponível para todos os usuários da API no GPT-6 Astra com limites de taxa baixos, e com preço seis vezes a tarifa padrão — US$ 60 / US$ 300 por milhão de contexto curto. GPT-5.6 Sol Ultrafast, a prévia de agosto em torno da qual esta página foi construída, não mudou: ainda com acesso controlado, ainda limitado a gpt-5.6-sol no esquema da API, ainda sem preço definido, e o número de ~1.300 tokens/s relatado para o Sol no CS-4 da Cerebras ainda é uma única postagem não verificada no X. O GPT-5.6 Sol padrão a US$ 4 / US$ 20 é o que você pode chamar hoje no OrcaRouter com US$ 0 de acréscimo; o GPT-6 Astra a US$ 10 / US$ 50 é o que você pode chamar se quiser o modelo que ganhou a linha Ultrafast.
Ultrafast agora custa dinheiro de verdade no GPT-6 Astra — 6× o padrão, ou incluído no plano Pro 500 de US$ 500 — enquanto o GPT-5.6 Sol Ultrafast continua em prévia. O GPT-5.6 Sol completo está disponível no OrcaRouter a US$ 4 / US$ 20 por milhão de tokens, sem nenhum acréscimo, pronto para sua própria chave.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
