Um cartão de título principal gerado para 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol' com a sobrelinha 'Os mesmos pesos. Nível de serviço diferente.' e dois cartões: à esquerda, 'GPT-5.6 Sol Ultrafast', listando Hardware: wafers da Cerebras, Velocidade: até 750 tok/s, Preço: ainda não publicado; à direita, 'GPT-5.6 Sol', listando Hardware: clusters de GPU, Velocidade: padrão, Preço: $4.00 / $20.00; rodapé 'Ambos executam o mesmo checkpoint do GPT-5.6 Sol.' Logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: Mesmos Pesos, Nível de Serviço Diferente

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O GPT-5.6 Sol Ultrafast não é um novo modelo, e esta não é uma matéria de lançamento. O fornecedor anunciou o modo em 13 de agosto de 2026, e no mesmo dia o valor ultrafast apareceu no schema OpenAPI público da empresa, dentro da descrição ServiceTierResponses da especificação — que, por sua própria redação, restringe o nível ao endpoint gpt-5.6-sol e o marca como de acesso controlado. O que colocou esta página de volta na nossa fila é algo menor e mais específico: em 25 de setembro de 2026, o commit fe4f7a1 estendeu esse valor a duas outras enumerações, o parâmetro service-tier no nível da solicitação e o campo de política service-tier do agente. Seis semanas após o anúncio, o nível continua em lista de espera, ainda não tem preço publicado e agora está integrado a mais partes da superfície da API do que consegue de fato atender. GPT-5.6 Sol Ultrafast e GPT-5.6 Sol são o mesmo modelo; a única coisa que esta comparação pode decidir é quem controla o ponteiro e quem lhe informou o custo.

Então, o confronto em destaque é incomum. GPT-5.6 Sol Ultrafast e GPT-5.6 Sol são o mesmo modelo. Mesmos pesos, mesmo checkpoint, mesmo comportamento de raciocínio, mesma janela de contexto de 1,05 milhão de tokens, mesma saída máxima de 128K, mesmas respostas. O próprio enquadramento da OpenAI é "mais trabalho útil por segundo", não um modelo mais inteligente. A única coisa que difere entre as duas colunas desta comparação é como os tokens são produzidos e como o tier é chamado no corpo da sua requisição — o que a torna o experimento de controle mais limpo da linha atual e também o mais difícil de comprar, porque um dos dois tiers não tem preço publicado.

O que realmente mudou esta semana

A evidência da mudança de setembro é um commit, não um post de blog. A OpenAI mantém o openai-openapi, o repositório que publica o esquema legível por máquina para sua API, e o commit fe4f7a1 — datado de 2026-09-25 — adiciona ultrafast a duas enumerações: a política de nível de serviço associada a agentes, e o campo no nível da requisição que a especificação descreve como "o nível de serviço usado para requisições de modelo". Isso é uma extensão, não uma estreia: antes desse commit, essas duas listas exibiam auto, default, flex, priority, fast, e o nível já estava no esquema desde 13 de agosto. Vale a pena destacar o commit por causa do campo que ele alcançou — o campo de política com o qual um agente é configurado, que é uma superfície diferente de uma substituição por requisição.

A descrição que importa remonta ao commit de 13 de agosto, não a este, e é a declaração mais específica que a OpenAI já publicou sobre a camada em qualquer lugar. Junto com o novo valor, a especificação diz: "Se definido como 'ultrafast', então a solicitação será processada com a camada de serviço Ultrafast Processing com controle de acesso. Esta camada está atualmente disponível para gpt-5.6-sol; uma resposta servida por meio dela mostrará service_tier=ultrafast."

Leia essa frase duas vezes, porque ela esclarece duas questões sobre as quais esta página de comparação, de outro modo, teria de fazer rodeios. O nível é restrito a um único modelo — o carro-chefe GPT-5.6 Sol, e nada mais na linha — e tem controle de acesso, em vez de ser aberto, o que corresponde à forma como a OpenAI descreve uma prévia com lista de espera. Ela também informa como você saberia que o recebeu: a resposta devolve qual nível de fato atendeu à solicitação, de modo que um fallback para o processamento padrão fica visível no corpo da resposta, em vez de ser algo que você precisa inferir pela latência. A mesma descrição aparece nos esquemas Responses padrão e Beta, e tem sido assim desde 13 de agosto.

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

No dia seguinte, chegou um segundo sinal, mais fraco. Uma reportagem de 26 de setembro descreve um novo seletor Speed — Fast, Standard e Ultrafast — chegando ao Responses API Playground, com uma disponibilidade mais ampla do Ultrafast prevista após a conferência de desenvolvedores DevDay da OpenAI. Não vimos o seletor nós mesmos e a OpenAI não publicou uma nota de lançamento, então trate isso como um relato de fonte única, e não como um recurso já lançado. As partes que podem ser verificadas hoje são os dois pontos no schema público e o fato de que nenhuma tabela de preços surgiu para o nível.

O que não mudou é igualmente importante. Ainda não existe um preço Ultrafast. A página de preços da OpenAI, consultada em 27 de setembro, contém as quatro abas que tinha antes — Standard, Batch, Flex e Fast — e a string "ultrafast" não aparece em lugar nenhum dela. O acesso ainda é descrito como uma prévia limitada para clientes selecionados, expandindo conforme a capacidade cresce. O nível está no contrato e fora da lista de preços ao mesmo tempo, e esse é o estado honesto das coisas.

Os dois níveis, lado a lado

Como nenhuma capacidade separa estes dois, a comparação reduz-se quase inteiramente a serviço e faturação. Cada linha abaixo apresenta ambos os lados numa só linha.

• Modelo — O GPT-5.6 Sol Ultrafast executa exatamente o mesmo checkpoint do GPT-5.6 Sol que o processamento padrão do GPT-5.6 Sol, mesmo checkpoint, sem destilação, sem redução de tamanho.

• Vazão de saída — até 750 tokens de saída por segundo, até 14× o padrão, conforme o anúncio da OpenAI de 13 de agosto, em comparação com o processamento padrão do GPT-5.6 Sol em clusters de GPU, que é a referência usada para medir o fator de 14×.

• Hardware — chips em escala de wafer da Cerebras, pesos residentes na SRAM do próprio chip, o primeiro produto da parceria de computação da OpenAI de janeiro de 2026 com a Cerebras, que se diz valer cerca de US$ 10 bilhões ao longo de três anos, em comparação com a inferência convencional em GPU, na qual grande parte do tempo é gasta movendo pesos entre a memória e a computação.

• Preço — não publicado em 27 de setembro de 2026, vs. $4,00 de entrada / $20,00 de saída por milhão de tokens, a tarifa promocional atual da OpenAI, além de $0,40 por milhão para entrada em cache.

• Disponibilidade — prévia limitada com lista de espera para clientes selecionados vs a via padrão, chamável por qualquer pessoa com uma chave de API.

• Respostas que você recebe — idênticas, em princípio vs idênticas, em princípio; se divergirem no mesmo prompt, isso é um achado, não uma funcionalidade.

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

A alegação de velocidade, e o teto sobre ela

O número de destaque é 14× e merece o mesmo cuidado que o resto desta página recebe. A OpenAI afirma até 750 tokens de saída por segundo em comparação com o processamento padrão — um número de throughput para saída de tokens, não uma afirmação de que cada solicitação é concluída 14 vezes mais cedo. O tempo ponta a ponta também inclui o processamento de entrada e o raciocínio do próprio modelo, nenhum dos quais o hardware em escala de wafer comprime na mesma proporção. É por isso que a empresa rotula 14× como um máximo, e não como uma medição.

As comparações publicadas são relatadas pelos fornecedores em ambos os lados da tabela, e uma delas abrange as stacks de dois fornecedores. Uma execução do Humanity's Last Exam de 2.500 perguntas é relatada como concluída em 11 horas e 11 minutos no Ultrafast, contra 78 horas e 27 minutos para o Claude Fable 5, com precisão comparável — isto é, OpenAI e Cerebras nos informando sobre um benchmark que inclui o modelo de um concorrente, e a cobertura independente do lançamento citou uma comparação mais restrita de aproximadamente 11× de velocidade de geração na mesma execução, enquanto os próprios números da Cerebras sugerem cerca de 7× para o tempo total de teste. A diferença entre 14×, 11× e 7× não é uma contradição; é o que acontece quando três partes medem porções diferentes de uma mesma carga de trabalho. A Cerebras relata separadamente 5,6× de ponta a ponta no GDP-Val, sem perda de qualidade mensurável. Nada disso foi reproduzido por terceiros.

A lista de preços tem uma lacuna

É aqui que os dois níveis deixam de ser simétricos. O GPT-5.6 Sol tem quatro tabelas de preços publicadas, e o Ultrafast não é uma delas.

• Standard GPT-5.6 Sol — $4,00 / $20,00 por milhão de tokens, com entrada em cache a $0,40 e um nível de contexto longo a $8,00 / $30,00 assim que a entrada ultrapassar aproximadamente 272 mil tokens.

• Modo rápido — US$ 8,00 / US$ 40,00, exatamente o dobro da tarifa padrão. É o nível que foi renomeado de Processamento prioritário em 30 de julho de 2026, e a API aceita service_tier: "priority" ou service_tier: "fast". Ele proporciona até cerca de 2,5× a velocidade de saída.

• Batch e Flex — $2,00 / $10,00, um desconto fixo de 50% sobre o padrão em troca de uma programação mais flexível.

• Ultrafast — sem tabela de preços. Não uma lacuna que preenchemos com um palpite; uma lacuna que a OpenAI deixou em aberto.

Essa linha do Fast-mode é o único precedente real com o qual se pode comparar o preço do Ultrafast, e é um precedente que impõe cautela a quem planeja um orçamento: o único nível de velocidade sobre o qual a OpenAI de fato divulgou um número custa exatamente o dobro da tarifa padrão para oferecer duas vezes e meia a velocidade. O Ultrafast é uma promessa de velocidade maior, apoiada em hardware mais escasso — a capacidade de wafers da Cerebras não é uma commodity —, então a direção do eventual prêmio não está em dúvida. O tamanho dele, sim. Enquanto não existir uma tabela de preços, qualquer valor de "preço do GPT-5.6 Sol Ultrafast" que você veja citado em qualquer lugar é inferência de alguém, inclusive qualquer inferência nossa.

Como você realmente chamaria isso

A mudança de schema revela o formato da chamada que virá. Se o tier seguir o padrão dos outros, ele chega como um campo extra em uma requisição que você já está fazendo: você mantém o modelo gpt-5.6-sol, mantém seu prompt e adiciona o seletor de tier — do mesmo modo como o modo Fast é selecionado hoje, trocando priority por fast. Nada muda na sua análise da resposta, porque nada muda no modelo. É exatamente esse o apelo de um tier de serviço em vez de uma troca de modelo, e a razão pela qual uma página de comparação como esta tem tão pouco a comparar.

O que você não pode fazer hoje é chamá-lo. O valor de enumeração existe; a capacidade por trás dele não existe, para a maioria das contas. Portanto, a questão prática para as próximas semanas não é qual dos dois níveis escolher — é o que executar enquanto a escolha não estiver disponível.

Essa é uma pergunta que um gateway responde melhor do que uma lista de espera. O tier padrão do modelo está no ar no OrcaRouter agora mesmo como openai/gpt-5.6-sol, servido à tarifa do próprio provedor com zero markup sobre tokens, por meio do endpoint compatível com a OpenAI em api.orcarouter.ai/v1 — assim os $4 / $20 promocionais da OpenAI e seu degrau de $8 / $30 para contexto longo são repassados diretamente, em vez de terem o preço redefinido por nós, e uma mudança neles chega ao nosso lado no mesmo dia em que chega ao lado da OpenAI. A mesma chave carrega mais de 200 modelos, o que importa mais do que o de costume aqui: como você não consegue definir service_tier: "ultrafast" e receber uma resposta, a forma de comprar latência hoje é rotear o trabalho de modo diferente — envie as chamadas interativas para o modelo do catálogo que superar sua barra de qualidade mais rápido, e mantenha os lotes noturnos na via mais barata que passar. Quando o tier de fato abrir, é no roteador que você acionaria o interruptor e, até lá, é a diferença entre uma lista de espera e um plano.

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

Qual deles pertence à produção?

Ignore a palavra "versus" por um momento, porque não há nenhuma decisão de qualidade a tomar aqui. Se você está otimizando para custo por token, o GPT-5.6 Sol padrão é a resposta, e a via Batch com 50% de desconto é a resposta para tudo o que pode esperar. Se você está otimizando para quanto tempo uma pessoa fica sentada diante de um spinner, o Ultrafast é a resposta no momento em que você puder obtê-lo — e as cargas de trabalho que a OpenAI está citando para a prévia mostram exatamente por quê: resposta a incidentes com logs e diffs abertos durante uma indisponibilidade ao vivo, verificações de fraude contra dados em movimento, conversas de suporte em que meio segundo de silêncio é interpretado como um produto quebrado, e ciclos de pesquisa que costumavam rodar durante a noite sendo comprimidos em uma sessão de trabalho.

O indicador revelador é o formato do seu grafo de requisições, não o tamanho do seu prompt. Uma única geração longa rende 14× no papel e bem menos na prática, porque o processamento de entrada e o raciocínio não se comprimem nessa proporção. Quarenta chamadas sequenciais de ferramentas por trás de uma única ação visível ao usuário rendem algo muito mais próximo do multiplicador total, porque cada uma dessas idas e voltas é latência que o usuário fica esperando. Se sua carga de trabalho se parece com a segunda, o nível é destinado a você; se se parece com a primeira, a via padrão sempre ia dar conta.

Duas coisas para ficar de olho, e nenhuma delas é um boato que possamos resolver daqui. Primeiro, a tabela de preços: um nível premium sem preço não pode ser orçado, e o precedente do Fast-mode sugere que não será pequeno. Segundo, se a lista de espera realmente cresce perto do DevDay conforme relatado — porque um valor service_tier que a maioria das contas não consegue usar é documentação, não disponibilidade, e a diferença entre os dois é a diferença entre um plano e uma promessa.