
GPT-5.6 Sol Ultrafast: Velocidade 14×, 750 Tok/s — CS-4 supostamente ~1.300, sem preço ainda
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
GPT-5.6 Sol Ultrafast mode é a camada de serviço acelerada por hardware para o modelo principal — o mesmo modelo GPT-5.6 Sol completo executado em chips Cerebras em escala de wafer em vez de clusters de GPU, entregando até 14× a velocidade do processamento padrão e até 750 tokens de saída por segundo na camada que a OpenAI anunciou em agosto. Em 2026-08-18, a Cerebras revelou o sistema CS-4 de próxima geração sobre o qual esta camada passa a operar, e um relatório inicial não verificado afirma que o GPT-5.6 Sol no CS-4 já atende aproximadamente 1.300 tokens por segundo. Não é um modelo menor nem uma destilação: apenas o hardware e o agendamento mudaram, e a inteligência é preservada. O que ainda não tem é um preço definido — em 2026-08-19, o Ultrafast é uma prévia limitada da API sem tabela de preços publicada, então o número que você pode realmente usar como referência de orçamento hoje é o nível padrão na página ativa do modelo GPT-5.6 Sol: US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de saída, repassados sem margem. Este artigo aborda o que é o modo, quão rápidos os números realmente são — incluindo o novo hardware CS-4 e o que ainda não foi verificado — quanto custa (incluindo a resposta honesta "ainda sem preço") e o que fazer até que atinja a disponibilidade geral.
O que o modo Ultrafast realmente é
Ultrafast é uma camada de servição, não um novo modelo. A OpenAI a anunciou em 13 de agosto de 2026 como o primeiro produto de sua parceria de computação de janeiro de 2026 com a fabricante de chips Cerebras — um acordo noticiado em cerca de US$ 10 bilhões ao longo de três anos. {{1}}Enquanto a inferência padrão do GPT-5.6 Sol roda em clusters de GPU e gasta grande parte do tempo movendo pesos entre memória e computação, a Ultrafast carrega os pesos do modelo nos 44 GB de SRAM on-chip dos chips em escala de wafer da Cerebras; um modelo do tamanho do Sol se estende por vários wafers em camadas, então os pesos ficam onde a computação acontece.{{/1}} {{2}}O resultado é um teto de throughput definido pelo silício, e não pela largura de banda da memória.{{/2}}
A história do hardware avançou em 18 de agosto de 2026. No evento Supernova, a Cerebras revelou o CS-4, o sistema rack-scale de próxima geração construído em sua plataforma Nexus — três chips Wafer-Scale Engine por rack, até 2× a velocidade de geração de tokens do CS-3 anterior e, segundo a Cerebras, mais de 1.000 tokens por segundo em modelos acima de 10 trilhões de parâmetros. Essas são as afirmações da Cerebras para um sistema em acesso antecipado, ainda não disponível ao público em geral. Desde a revelação, uma única postagem no X afirma que o CS-4 já atende ao GPT-5.6 Sol a cerca de 1.300 tokens por segundo — em linha com os próprios números da Cerebras, mas não confirmado por ninguém até o momento. Trate isso como um sinal precoce: plausível, não verificado e que vale a pena verificar novamente antes de planejar capacidade com base nele.
A parte que importa para o seu código: o id do modelo, os pesos, o comportamento de raciocínio e a saída são idênticos ao GPT-5.6 Sol padrão. A OpenAI enquadra o Ultrafast como "mais trabalho útil por segundo" em vez de um nível de qualidade, e a prévia executa o carro-chefe completo — a velocidade não vem de trocar por um modelo mais barato. O que muda é a velocidade com que os tokens são emitidos.
Não confunda o Ultrafast com o modo rápido existente. O modo rápido é um nível separado e comprável em hardware padrão: até aproximadamente 2,5× a velocidade de saída com um prêmio de 2× por token ($10 de entrada / $60 de saída por 1M), sem mudança de qualidade. O Ultrafast é outra coisa — hardware Cerebras, até 14×, e por enquanto sem preço nenhum.
Quão rápido — os números que importam

O número principal é 14×, e ele precisa de uma definição. A OpenAI afirma que o Ultrafast gera até 750 tokens de saída por segundo, em comparação com o processamento padrão do GPT-5.6 Sol. Esse é um número de throughput para tokens de saída, não uma afirmação genérica de que "tudo roda 14× mais rápido" — o tempo de requisição de ponta a ponta também inclui o processamento da entrada e o raciocínio do próprio modelo, e é por isso que 14× é rotulado como um máximo.
• Vazão máxima de saída — até 750 tokens de saída por segundo, conforme anúncio da OpenAI (2026-08-13).
• Vs processamento padrão — até 14× mais rápido, de acordo com o mesmo anúncio; os ganhos reais variam conforme o tamanho da entrada e o tipo de tarefa.
• Humanity's Last Exam, 2.500 perguntas — OpenAI/Cerebras relatam que o GPT-5.6 Sol Ultrafast terminou em 11 horas e 11 minutos, contra 78 horas e 27 minutos para o Claude Fable 5, com acurácia comparável. Relatado pelos próprios fornecedores, e a comparação abrange os stacks de hardware de dois fornecedores — veja isso como indicativo, não como um veredito.
• GDP-Val, ponta a ponta — A Cerebras relata 5,6× mais rápido no geral, sem perda mensurável de qualidade. Também relatado pelo fornecedor.
• Linha de base do modo rápido — o nível de velocidade comprável existente atinge no máximo aproximadamente 2,5× a velocidade de saída por um prêmio de preço de 2×.
{{1}}CS-4, o próximo hardware{{/1}} — {{2}}A Cerebras afirma que o rack CS-4 entrega mais de 1.000 tokens por segundo em modelos acima de 10 trilhões de parâmetros, até 2× a geração de tokens do CS-3.{{/2}} — {{3}}Um relato não verificado da comunidade coloca o GPT-5.6 Sol no CS-4 em ~1.300 tokens por segundo — mesma direção, ainda não confirmado pela OpenAI ou pela Cerebras.{{/3}}
Uma ressalva antes de você citar o 14×: a cobertura independente do lançamento cita uma comparação de velocidade de geração de ~11× em relação ao Claude Fable 5, enquanto os próprios números da Cerebras implicam ~7× para o tempo total de teste na mesma execução — a diferença é qual parte de uma carga de trabalho você mede. A mesma disciplina se aplica ao sinal de velocidade do CS-4: o número de ~1.300 tokens/s começou como uma única postagem no X, e nem a OpenAI nem a Cerebras o confirmaram. Todos esses números são de fornecedores ou da comunidade, anunciados esta semana, e nenhum foi verificado de forma independente ainda. Trate-os como alegações, não como veredictos de benchmark.
Quanto custa — e a lacuna honesta

Esta é a situação da questão de preço em 2026-08-19, dita claramente: a Ultrafast não tem preço publicado. A OpenAI não anunciou um, e a prévia não aparece em nenhuma tabela de preços pública. Relatos de que os slots de acesso antecipado são empacotados ou gratuitos são especulação, não política — e até que a OpenAI defina o preço do nível, qualquer número de "custo do GPT-5.6 Sol Ultrafast" que você encontrar em outro lugar é um palpite.
O que você pode precificar hoje é o restante da linha GPT-5.6 Sol, verificado em relação às taxas publicadas pela OpenAI em 2026-08-18:
• Standard GPT-5.6 Sol — $5,00 de entrada / $30,00 de saída por 1M de tokens. O modelo básico que você pode acessar agora.
• Modo rápido — $10.00 / $60.00, um prêmio de 2× por até cerca de 2.5× de velocidade de saída. É o mais próximo de um nível de velocidade que você pode realmente comprar.
• Leitura do cache de prompt — US$ 0,50 por 1M (90% de desconto em relação à entrada nova); gravações em cache são cobradas a US$ 6,25 por 1M.
• Nível de contexto longo — entradas que ultrapassam cerca de 272 mil tokens custam $10.00 / $45.00.
• Batch API — $2.50 / $15.00, um desconto fixo de 50% com um prazo de aproximadamente 24 horas.
Para contextualizar o prêmio esperado: o modo rápido estabeleceu o precedente de 2× a tarifa padrão para 2,5× a velocidade. Se o Ultrafast seguir uma curva semelhante, ficará bem acima dos padrão $5 / $30 — e os comentários sobre a prévia esperam exatamente isso, porque a capacidade de wafers da Cerebras é escassa e cara. Mas um prêmio esperado não é um preço. Planeje com base no Sol padrão ou no modo rápido até que exista uma tabela de preços.
Como usar — a realidade da pré-visualização
Acesso é a segunda lacuna honesta. Ultrafast está disponível através da API da OpenAI para um grupo seleto de clientes em lista de espera, anunciado em 2026-08-13, com a OpenAI afirmando que o acesso se expandirá "à medida que a capacidade cresce". Não há data de disponibilidade geral. As coortes de pré-visualização anunciadas são codificação, comércio, pesquisa financeira, suporte e outras cargas de trabalho interativas — equipes cujos agentes fazem muitas chamadas por solicitação e onde a latência de resposta é o gargalo. Jane Street, Rogo e Podium estão entre os primeiros testadores nomeados.
O padrão de uso para o qual ele foi projetado: resposta a incidentes (leitura de logs, traces e diffs enquanto uma interrupção está ativa), pesquisa financeira e detecção de fraudes em dados em movimento, suporte ao cliente em tempo real e voz (onde meio segundo de silêncio é percebido como falha), checkout de e-commerce e compactação de lotes de pesquisa noturnos em sessões interativas. Se a sua carga de trabalho for um chat de turno único, o 14× importa muito menos do que em um loop de agente com 40 chamadas.
O que você pode fazer hoje — a resposta prática

Enquanto o Ultrafast está em prévia, o GPT-5.6 Sol completo já está no ar — e, no OrcaRouter, o nível padrão é servido à taxa do provedor, com margem de $0 por token, como ID de modelo openai/gpt-5.6-sol pelo endpoint compatível com OpenAI em api.orcarouter.ai/v1. Se você já tem um cliente OpenAI, a migração é uma mudança de URL base e de ID de modelo; nada mais. A mesma chave e o mesmo endpoint dão acesso a mais de 200 modelos, então o Sol fica ao lado do GPT-5.6 Terra, do GPT-5.6 Luna, do Claude Opus 5 e dos modelos de pesos abertos com os quais você o compararia — e você pode rotear por dificuldade em vez de reintegrar cada um.
Duas particularidades do OrcaRouter merecem ser citadas em uma página de velocidade.BYOK: use sua própria chave OpenAI e a OpenAI cobra você diretamente pelas próprias tarifas — o OrcaRouter adiciona $0 por token e mantém intactos os limites de taxa e os créditos do seu provedor.Guardrails: o PII Shield e a política de conteúdo são executados antes da cobrança, então uma solicitação bloqueada retorna um 400 limpo e nunca é cobrada, e o Agent Firewall avalia chamadas de ferramentas e MCP antes de executá-las. Quando — e se — o Ultrafast atingir disponibilidade geral a um preço que viabilize o roteamento, conectá-lo ao mesmo endpoint é uma mudança de ID do modelo; a configuração que você criar hoje será mantida.
O limite honesto — quando Ultrafast não é a resposta
Quatro pontos onde a história do 14× não se sustenta, para que você não arquitete nem faça orçamento com base em um número que ainda não está definido:
14× é um máximo, não uma garantia. É um teto de throughput de saída no hardware da Cerebras; a latência de ponta a ponta ainda inclui o processamento de entrada, o tempo de raciocínio do modelo e a sua própria rede. Um prompt com muito raciocínio pode gastar a maior parte do seu tempo real pensando, e é aí que o ganho de velocidade anunciado diminui.
Não tem preço nem data de GA. Em 2026-08-19, você não pode comprar o Ultrafast — apenas solicitar acesso de pré-visualização, e o hardware CS-4 por trás dele está em acesso antecipado, não em disponibilidade geral. Faça um orçamento com base no Sol padrão ($5 / $30) ou no modo rápido ($10 / $60), e trate qualquer preço do Ultrafast que você vir online como não verificado.
Os benchmarks são relatados pelos fornecedores. A execução de 11 horas do HLE e o valor de 5,6× do GDP-Val são números divulgados pela OpenAI/Cerebras no anúncio; estimativas independentes variam de aproximadamente 7× a 11×, dependendo do que é medido. Adicione o sinal de velocidade do CS-4 a essa lista: o número de ~1.300 tokens/s para o GPT-5.6 Sol no CS-4 vem de um único post no X e não tem confirmação independente. Nenhum desses números foi ainda verificado de forma independente.
Isso não vai corrigir um gargalo que você não tem.Se seus agentes estão lentos por causa da sua própria orquestração, latência de ferramentas ou prompts com alta carga de entrada, um caminho de saída mais rápido move a cauda apenas ligeiramente. A decisão de seleção de camada — GPT-5.6 Sol a $5 / $30 versus GPT-5.6 Terra a $2 / $12 versus GPT-5.6 Luna a $0.20 / $1.20 — ainda impacta mais a sua fatura do que qualquer camada de velocidade.
Em suma. O GPT-5.6 Sol Ultrafast é o nível de serviço mais rápido que a OpenAI já lançou para seu carro-chefe — os mesmos pesos no hardware da Cerebras, com até 14× de throughput e 750 tokens de saída por segundo no nível anunciado. O novo CS-4 da Cerebras (revelado em 2026-08-18) supostamente eleva o GPT-5.6 Sol para ~1.300 tokens por segundo, mas esse número é uma única postagem não verificada no X. Em 2026-08-19, o Ultrafast é uma prévia com lista de espera e sem preço público. Se você procura um número para planejar seu orçamento, a resposta honesta é que ainda não há um. O GPT-5.6 Sol padrão a US$ 5 / US$ 30 é o que você pode chamar hoje; o modo rápido a US$ 10 / US$ 60 é o nível de velocidade que se pode adquirir, e o OrcaRouter repassa ambos sem margem (US$ 0) na sua própria chave. Configure o roteamento agora — e, quando o Ultrafast tiver preço e data, estará a apenas uma mudança de model-id de distância.
Até que a Ultrafast tenha um preço, o GPT-5.6 Sol completo está disponível no GPT-5.6 Sol no OrcaRouter a $5 / $30 por milhão de tokens, sem margem de lucro, pronto para sua própria chave.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
