Um card de título gerado encabeçado por 'Ultrafast vs Sol' com o subtítulo 'Mesmo checkpoint, duas tabelas de tarifas, três cargas de trabalho' e três chips com os textos 'Agente interativo: mover', 'Varredura noturna: ficar' e 'Sumarizador em lote: ficar', sobre um rodapé com o texto 'Os preços são tarifas de lista da OpenAI por 1M de tokens, contexto curto, outubro de 2026'.
Engineering & Research

GPT-6.1 Ultrafast vs GPT-6.1 Sol: Três Tarefas, Um Veredito Cada

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pergunte se GPT-6.1 Ultrafast vale seis vezes o preço de GPT-6.1 Sol e a resposta honesta é que duas das suas três cargas de trabalho deveriam ficar exatamente onde estão. O agente de programação interativo deveria migrar. A varredura de avaliação noturna não deveria, e o sumarizador em lote também não, e o motivo não é que o nível seja caro demais — é que eles nunca estavam comprando aquilo que ele vende. O GPT-6.1 Sol foi lançado em 29 de setembro de 2026 e o Ultrafast chegou como um modo sobre ele em 8 de outubro de 2026: mesmo checkpoint, mesma janela de contexto de 1.050.000 tokens, mesmo teto de saída de 128.000 tokens, mesma data de corte de conhecimento de 30 de abril de 2026, mesmas respostas, a US$ 12,00 por milhão de tokens de entrada e US$ 60,00 por milhão de tokens de saída contra US$ 2,00 e US$ 10,00. Um nível de velocidade é a compra de tempo de relógio, e tempo de relógio só vale a pena para um trabalho em que alguém está esperando.

Essa reformulação é o artigo inteiro. O restante é a aritmética que lhe diz qual dos seus trabalhos é do tipo que espera, e os dois custos que chegam junto com o múltiplo, quer você tenha planejado para eles ou não.

O que realmente difere: um campo de solicitação e uma fatura

Não existe checkpoint Ultrafast, não há limite de contexto separado, não há data de corte de conhecimento alternativa, e não há nada para fixar. Você envia o mesmo identificador de modelo com um campo service-tier definido, e a OpenAI agenda a requisição de forma diferente; envie-o sem o campo e você estará no Standard. Tudo contra o que um desenvolvedor programa é idêntico, e vale a pena ser mecânico em relação à lista, porque o comprimento da lista é o argumento.

• ID do modelo — o mesmo identificador nos dois, um snapshot padrão, nada datado para fixar.

• Contexto — uma janela de 1.050.000 tokens, entrada máxima de 922.000 tokens e saída máxima de 128.000 tokens em ambos.

• Escada de raciocínio — baixo, médio (padrão), alto, xhigh e máximo em ambos, com none e minimal não suportados em ambos.

• Superfície de ferramentas — pesquisa na web, pesquisa de arquivos, geração de imagens, interpretador de código, shell hospedado, aplicação de patch, habilidades, uso do computador, MCP e pesquisa de ferramentas, por meio da Responses API, em ambos.

• Preço — $2,00 de entrada / $0,10 em cache / $2,50 de escrita de cache / $10,00 de saída por milhão de tokens no Standard, contra $12,00 / $0,60 / $15,00 / $60,00 no Ultrafast.

• Acima de 272.000 tokens de entrada — a solicitação inteira é reprecificada em 2x as tarifas de entrada e cache e 1,5x a saída em ambos, o que coloca o Ultrafast de contexto longo em $24,00 / $1,20 / $30,00 / $90,00.

• Velocidade — Standard é a linha de base por definição; Ultrafast é o nível mais alto, e o único múltiplo específico de modelo que a OpenAI publica pertence ao GPT-6 Astra, não a este modelo.

Essa última linha é a ressalva que percorre todo o resto, e ganha sua própria seção mais abaixo. Primeiro, os trabalhos.

Tarefa número um: o agente interativo. É aquele que se move

Um loop de agente que faz quarenta chamadas de ferramenta em sequência é o comprador para quem este nível foi feito, porque o tempo de geração de cada turno condiciona o turno seguinte, e o usuário está observando. Considere uma sessão que envia 30.000 tokens de entrada e recebe 1.500 tokens de saída por turno ao longo de 40 turnos — 1.200.000 tokens de entrada e 60.000 tokens de saída no total, com cada requisição bem abaixo do limite de reprecificação de 272.000 tokens.

• Padrão — 1,2 milhão de tokens de entrada a $2,00 resulta em $2,40; 60.000 tokens de saída a $10,00 resultam em $0,60. Três dólares pela execução.

• Ultrafast — 1,2 milhão de tokens de entrada a US$ 12,00 custa US$ 14,40; 60.000 tokens de saída a US$ 60,00 custam US$ 3,60. Dezoito dólares pela execução.

• O delta — $15,00 para remover a maior parte da latência de geração de uma tarefa cuja saída é, de resto, idêntica.

Saber se $15,00 é barato é uma questão de minutos, não de tokens. Se a sessão leva vinte minutos no Standard e quatro minutos no Ultrafast, você comprou dezesseis minutos por quinze dólares — cerca de $0,94 por minuto — e a comparação que importa é com o que esses dezesseis minutos custaram a você. Considerando o custo total, um desenvolvedor vale mais de um dólar por minuto, então, para o caso com humano no circuito, a resposta não é nem de longe. Um agente esperando em uma fila de revisão humana não vale nada por minuto, e nesse caso os mesmos dezesseis minutos são dezesseis minutos de graça, e o nível é um desperdício.

Esse é o teste a aplicar, e não tem nada a ver com o modelo. De quem é o relógio em que assenta o tempo de geração, e quanto vale esse relógio? Se a resposta for "de uma pessoa, e muito", o Ultrafast é o item mais barato da sua fatura. Se a resposta for "de um escalonador, e nada", ele é o mais caro.

A generated cost card headed 'One run, four configurations', listing Batch at half of Standard for $1.50, standard GPT-6.1 Sol at $3.00, GPT-6.1 Ultrafast at $18.00 and Ultrafast above 272,000 input tokens at $24.00 input and $90.00 output per 1M, with a note that all four describe the same 40-turn agent of 1,200,000 input and 60,000 output tokens and a footer reading that prices are OpenAI list rates and the arithmetic is ours.

Tarefa dois: a varredura de avaliação da noite. Isso é um não

Uma varredura de avaliação executa alguns milhares de prompts pelo modelo, grava os resultados em armazenamento de objetos, e uma pessoa lê a tabela pela manhã. Seu orçamento de latência não é de minutos; é de uma noite. Nada no pipeline está esperando pelo modelo, exceto a próxima requisição na fila.

O Ultrafast não remove o custo de tempo decorrido da varredura, porque o custo de tempo decorrido da varredura é uma decisão de agendamento que você tomou, não um problema de latência que você tem. O que ele faz é multiplicar a conta por seis e mover o trabalho para um orçamento com seus próprios limites de taxa por organização — o que é um risco real em um lote não assistido, porque um teto de limite de taxa é exatamente o modo de falha que uma varredura grande atinge e a página do nível não publica o número.

E há uma faixa no mesmo cartão de tarifas que tem preço para este trabalho e preço na direção oposta. Batch e Flex custam metade do Standard, e o processamento Batch da API é projetado exatamente para este formato: grandes volumes, sem prazo interativo, resultados retornados de forma assíncrona. Nos números acima, o mesmo total de tokens de 40 turnos custa $1.50 no Batch contra $18.00 no Ultrafast. Isso é uma diferença de 12x para um trabalho que não consegue perceber a diferença.

O erro a evitar é tratar o Ultrafast como a atualização de uso geral. Ele é o topo de uma escada — Batch e Flex na metade, Standard em um, Fast em dois, Ultrafast em seis — e uma escada não é um menu de versões melhores. Escolher o degrau errado custa mais dinheiro do que escolher o modelo errado.

Trabalho três: o sumarizador de lotes. Também é um não, por um motivo diferente.

Suponha que a carga de trabalho seja uma passagem noturna por um repositório de documentos: entradas longas, saídas curtas, sem intervenção humana e um SLA medido em horas. É aqui que a mistura de tokens se volta contra o Ultrafast, em vez de a favor dele.

O limite de 272.000 tokens é o motivo. Em qualquer um dos dois níveis, uma única solicitação que ultrapasse esse limite altera o preço de toda a solicitação — cada token de entrada, cada leitura em cache, cada token de saída — ao dobro das tarifas de entrada e de cache e a 1,5 vez a de saída. O Ultrafast de contexto longo, portanto, custa US$ 24,00 por milhão de tokens de entrada e US$ 90,00 por milhão de tokens de saída, e o reajuste de preço é acionado pela solicitação, não pela parte que ultrapassa o limite. Um sumarizador de documentos que ocasionalmente envia uma solicitação com 300.000 tokens de entrada paga a tarifa de contexto longo sobre todos esses 300.000.

O comportamento do cache intensifica isso. Leituras em cache são os tokens menos caros neste modelo e o eixo de custo mais eficaz, e escalam com o nível em vez de absorvê-lo — US$ 0,10 por milhão de entrada em cache no Standard, US$ 0,60 no Ultrafast, ambos a 5% da taxa de entrada sem cache. Não há mistura de tokens em cache e novos que suavize o múltiplo, então um pipeline otimizado com cache não ganha desconto pela via rápida. Ele apenas paga seis vezes um número menor.

Junte os dois e o resumidor é o caso em que o premium do Ultrafast é maior em termos absolutos e o seu benefício é menor. Se os documentos forem genuinamente longos e o prazo for genuinamente de horas, a configuração correta é Batch ou o Standard padrão, e o uso correto do Ultrafast é o ciclo no meio do desenvolvimento, em que você está iterando no prompt e uma pessoa está aguardando cada revisão.

Os dois custos que chegam com o múltiplo

A taxa de seis vezes é a parte visível do preço. Duas partes invisíveis importam mais na produção.

O primeiro é o orçamento de limite de taxa. O Ultrafast opera com limites próprios, separados dos orçamentos Standard e Fast, e a OpenAI os define por organização, em vez de publicá-los na página do nível; a orientação é verificar os limites da sua organização antes de aumentar o tráfego e entrar em contato com a equipe de contas se for necessário elevá-los. Portanto, mudar uma carga de trabalho para o Ultrafast faz duas coisas ao mesmo tempo: multiplica a fatura e coloca a carga de trabalho sob um teto que talvez você não consiga ler. Para um agente sem supervisão, o teto é o primeiro a restringir.

O segundo é a forma da poupança. Ultrafast reduz o tempo entre tokens, não o tempo até ao primeiro token nem a fase de deliberação. Um pedido que passa a maior parte do seu tempo de relógio a pensar antes de emitir seja o que for pode ser mudado para Ultrafast e continuar a parecer lento, porque o nível acelera a parte do pedido que nunca foi o gargalo. Este é o modo de falha que produz relatórios como "pagámos seis vezes e continua à mesma velocidade": está a medir uma aplicação cuja latência reside num ponto a que o nível não chega. Antes de assumir o compromisso, meça para onde vão realmente os segundos — tempo até ao primeiro token em comparação com o tempo entre tokens — porque o nível só controla um deles.

Por que “mais rápido” ainda não é um número pelo qual você pode responsabilizar a OpenAI

O Ultrafast é vendido como "até 8x", e a medição por trás dessa frase pertence a um modelo diferente. A frase publicada é sobre o G​PT-6 Astra Ultrafast gerando tokens até 8x mais rápido que o G​PT-6 Astra no modo Standard no Codex. Não existe um múltiplo publicado equivalente para o GPT-6.1 Sol, e nenhuma parte independente publicou um número de tokens por segundo para a variante Sol também. A documentação desse nível o descreve como reduzindo o tempo entre os tokens de saída gerados e aponta para uma tabela de preços.

É um prior razoável que o múltiplo se sustente — ambos os modelos rodam sobre a mesma stack de serving e o mecanismo do nível é o mesmo —, mas o “até” faz um trabalho de verdade nessa frase, e um teto de fornecedor medido em um modelo irmão em um cliente diferente não é o número que sua carga de trabalho verá. O mesmo vale para o patamar mais antigo: Ultrafast sobre GPT-5.6 Sol foi anunciado em agosto de 2026 como “até 14x mais rápido que o processamento Standard” em prévia limitada, e a documentação ainda diz acesso de prévia com a tabela de tarifas do Ultrafast contendo exatamente duas linhas.

O que você pode exigir da OpenAI é o preço, porque o preço é publicado e se aplica a cada token. O que significa que a decisão sobre a qual esta página trata é uma decisão sobre o seu próprio orçamento de latência, não sobre a alegação de velocidade do fornecedor.

A generated decision card headed 'Which lane for which job' with three columns: 'Interactive agent' carrying the rows 'A person is waiting' and 'Ultrafast: yes', 'Overnight eval sweep' carrying 'Nobody is waiting' and 'Batch: half of Standard', and 'Long-document batch pass' carrying '272,000-token repricing line' and 'Standard: yes', footnoted to OpenAI's published per-million rates and tier documentation, October 2026.

Testando sem fazer commit, e voltando

O nível está disponível para todos os usuários da API, então a maneira barata de responder à questão do tempo de relógio de parede é executar o mesmo conjunto de prompts duas vezes, com o campo ativado e desativado, e comparar as contagens de tokens e os tempos. Duas coisas a observar nesse teste: se suas requisições cruzam a linha de 272.000 tokens e se o tempo até o primeiro token domina o tempo entre tokens. Qualquer uma delas pode fazer o teste parecer um resultado nulo quando o nível está funcionando exatamente como anunciado.

Voltar atrás é um campo de solicitação, não uma migração, e a rota padrão é atendida à própria tarifa de tabela do fornecedor por meio do OrcaRouter como openai/gpt-6.1-sol — US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída, 0% de markup, com o preço do provedor repassado direto, de modo que um reajuste do fornecedor entra no ar do nosso lado no mesmo dia. O Ultrafast em si não é algo que vendemos; é um sinalizador de nível de serviço cobrado na sua própria conta O​penAI, e dizer isso é mais útil do que sugerir o contrário. O que uma única chave compra é a rota padrão mais o restante do catálogo por trás de um único endpoint compatível com a O​penAI, e failover automático entre provedores, o que vale a pena ter se você estiver prestes a colocar um nível caro na frente de um agente em produção e quiser que a rota padrão seja uma decisão de roteamento em vez de uma mudança de código.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128,000 maximum output tokens, text and image input with text output, input price $2.00 and output price $10.00 per 1M tokens, with the page's code sample and EN language toggle visible in the header.

Uma observação prática sobre a via rápida que não se aplica à barata: WebSockets. A OpenAI recomenda uma conexão WebSocket persistente para o Ultrafast, que é o formato certo para um agente que faz muitas chamadas sequenciais e o formato errado para um script em lote com uma requisição por processo. Se o seu cliente é do segundo tipo, o transporte recomendado pelo próprio nível é mais um motivo para o job noturno ficar em outro lugar.

Quando o veredito muda

Três desenvolvimentos tirariam tarefas da lista "stay". Um limite de taxa Ultrafast publicado para o GPT-6.1 Sol eliminaria o risco de teto no caso do batch. Uma medição de velocidade publicada ou reproduzida independentemente para o nível Sol permitiria orçamentar a economia de tempo de relógio em vez de a assumir. E um degrau de desconto na via rápida — um equivalente Ultrafast do Batch, em que o nível continua rápido mas não a seis vezes o preço — mudaria a economia de todas as tarefas no meio da escada.

Nenhum desses existe hoje. O que existe é um nível que é exatamente o que diz ser: o mesmo GPT-6.1 Sol, agendado de forma diferente, a seis vezes o preço em cada linha. Mova o agente interativo, deixe os outros dois em paz e meça para onde os seus segundos realmente vão antes de decidir qual deles é o seu.