Um cartão de título gerado com a manchete 'Ultrafast vs Standard' e o subtítulo 'Um checkpoint do GPT-6.1 Sol, duas tabelas de preços', com chips exibindo '$2.00 / $10.00 Standard' e '$12.00 / $60.00 Ultrafast', um selo '6x' e a linha 'mesmos tokens, seis vezes a conta', sobre um rodapé indicando que os preços são as tarifas de lista da própria OpenAI para requisições de contexto curto.
Engineering & Research

GPT-6.1 Sol Ultrafast vs GPT-6.1 Sol: A via rápida custa mais do que o modelo de fronteira

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ativar GPT-6.1 Sol Ultrafast torna o GPT-6.1 Sol a forma mais cara da família GPT-6 de gerar um token que não seja produzido pelo GPT-6 Astra. Essa é a comparação inteira em uma frase, e é o oposto do que “opção rápida no modelo mais barato” parece que deveria significar. O preço do Ultrafast é seis vezes o do Standard — US$ 12,00 por milhão de tokens de entrada e US$ 60,00 por milhão de tokens de saída, contra US$ 2,00 e US$ 10,00 — o que coloca uma chamada rápida ao GPT-6.1 Sol acima do GPT-6 Astra em velocidade normal, acima do GPT-5.6 Sol em velocidade normal, e sem estar a menos de um erro de arredondamento de qualquer outro item da tabela de preços.

Nada disso torna o nível um erro. Torna-o uma compra de latência, e a pergunta que esta página responde é quando a latência vale esse preço e quando não vale. Os dois produtos sendo comparados são o mesmo checkpoint e as mesmas respostas; toda a diferença está numa flag de nível de serviço e numa fatura.

Mesmo modelo, e vale a pena dizer exatamente o quão igual

There is no Ultrafast checkpoint to download, no separate context limit, no different knowledge cutoff. You send model: "gpt-6.1-sol" with service_tier: "ultrafast" and O​penAI schedules the request differently; send it without the flag and you get Standard. Everything a developer actually codes against is identical:

• ID do modelo — gpt-6.1-sol para ambos, um snapshot padrão, nada datado para fixar

• Contexto — janela de 1,050,000 tokens, entrada máxima de 922,000 tokens, saída máxima de 128,000 tokens, para ambos

• Data de corte do conhecimento — 30 de abril de 2026, para ambos

• Escada de raciocínio — baixo, médio (padrão), alto, xhigh, máximo para ambos; nenhum e mínimo não são suportados em ambos

• Modalidades — texto e imagem como entrada, texto como saída, para ambos

• Superfície de ferramentas — a mesma pesquisa na web, pesquisa de arquivos, geração de imagens, interpretador de código, shell hospedado, aplicação de patch, habilidades, uso do computador, MCP e pesquisa de ferramentas, por meio da API Responses, para ambos

• Preço — $2,00 / $0,10 em cache / $2,50 gravação em cache / $10,00 de saída por milhão de tokens vs $12,00 / $0,60 / $15,00 / $60,00

• Prompts longos acima de 272K tokens de entrada — a solicitação inteira é reprecificada em 2x as tarifas de entrada e de cache e 1,5x as de saída em ambos, então o contexto longo do Ultrafast fica em $24,00 / $1,20 / $30,00 / $90,00

• Speed — Standard is Standard; Ultrafast is the top of the tier ladder, and the only published model-specific multiple in O​penAI's documentation belongs to G​PT-6 Astra, not this model

That last line is the honest caveat on the whole article. O​penAI's docs say G​PT-6 Astra Ultrafast "generates tokens up to 8x faster than G​PT-6 Astra in Standard mode in Codex". GPT-6.1 Sol's documentation describes the tier, lists its rate limits, and says it supports US and EU data residency — it does not publish a multiple. If you are buying this because you expect eight times the speed, you are extrapolating from a sibling model, and no independent measurement exists for either.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context stepping to $120.00 / $12.00 / $150.00 / $450.00 in long context, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, with the page's note that short context means up to 272K input tokens.

O exemplo prático: quanto custa um turno de agente em cada lane

Ponha um agente de programação num loop real e pouco glamouroso: a cada turno, ele relê 40.000 tokens de contexto do repositório e emite 6.000 tokens de raciocínio e patch, e a tarefa leva doze turnos. Suponha que nada esteja em cache, o que é o caso pessimista e o que faz o nível parecer pior na entrada; depois, faça de novo com o contexto em cache, porque é isso que um agente com cache de prompt realmente faz.

• Padrão, sem cache — 40.000 tokens de entrada custam US$ 0,08 e 6.000 tokens de saída custam US$ 0,06, então US$ 0,14 por turno e US$ 1,68 para a tarefa

• Ultra-rápido, sem cache — $0.48 de entrada e $0.36 de saída por turno, $0.84 por turno, $10.08 pela tarefa

• Contexto padrão em cache — os 40.000 tokens caem para $0,10 por milhão, então o turno é $0,064 e a tarefa é $0,77

• Contexto em cache ultrarrápido — a entrada em cache custa $0.60 por milhão neste nível, então o turno fica em $0.384 e a tarefa é $4.61

O multiplicador é seis em todas as linhas, e é esse o ponto: o cache não o protege do nível, ele escala com ele. O que os números compram é uma tarefa que termina em cerca de um oitavo do tempo de relógio, e todo o julgamento é se remover essa espera vale de US$ 2,40 a US$ 8,40 por tarefa.

Aqui está, porém, a comparação que deveria decidir a questão para a maioria das equipes. Calcule o preço das mesmas quantidades de tokens no GPT-6 Astra no Standard — US$ 0,40 de entrada e US$ 0,30 de saída por turno, US$ 8,40 pela tarefa. O Ultrafast no GPT-6.1 Sol é mais caro por token do que o modelo de fronteira em velocidade normal. Isso não é um argumento contra o nível; é um argumento sobre qual dimensão você está otimizando. Se o seu problema é a qualidade da resposta, o Astra no Standard é o melhor uso do dinheiro. Se o seu problema é que um humano está encarando um indicador de carregamento, nem o Astra nem o Sol ajudarão, e o nível ajudará.

Uma ressalva antes que alguém monte um orçamento com base nesses números: as contagens de tokens não são constantes entre modelos para a mesma tarefa. Estas são comparações por token com contagens de tokens idênticas pressupostas, que é a única comparação que a tabela de preços permite. Meça seus próprios rastreamentos.

A generated cost card headed 'One agent turn, four ways', comparing GPT-6.1 Sol Standard at $0.14 per turn and $1.68 over twelve turns uncached and $0.064 and $0.77 with prompt caching, GPT-6.1 Sol Ultrafast at $0.84 and $10.08 uncached and $0.384 and $4.61 cached, and GPT-6 Astra Standard at $0.70 and $8.40 on the same token counts, over a footer reading that these are OpenAI list rates per 1M tokens for short-context requests and that the per-turn and per-task figures are the article's arithmetic on those rates rather than vendor benchmarks.

O nível que você provavelmente realmente quer é o Fast

Between Standard and Ultrafast there is a middle lane, and on GPT-6.1 Sol it is the one most teams should be pricing first. Fast mode runs at twice Standard — $4.00 input and $20.00 output per million tokens — for the same checkpoint, and O​penAI renamed Priority processing to Fast mode on July 30, 2026, so it has been stable for months. It is one third of Ultrafast's rate for a speed-up that the tier documentation treats as the ordinary supported case.

Ultrafast é a resposta certa quando a latência é o produto e o volume de tokens é pequeno: um agente interativo que não pode dar o próximo passo até que a saída anterior chegue, um ciclo de desenvolvedor em que quarenta turnos curtos se acumulam, uma demonstração em que a pausa é o modo de falha. Fast é a resposta certa quando você quer um modelo amplamente mais rápido e não está preparado para pagar o triplo pelo último incremento. Batch e Flex continuam sendo a resposta certa para qualquer coisa com um prazo medido em horas — eles são metade do Standard, não o dobro.

Speed is also not the only lever. If the latency you are trying to remove is the model thinking rather than the model typing, the tier does nothing for you: Ultrafast compresses token generation, and O​penAI's own description is that it "reduces the time between generated output tokens". A request that spends most of its wall-clock in reasoning will arrive sooner by a fraction of what the price suggests. Move the reasoning effort down a notch and see what that does to the bill before you move the tier up six.

Onde fica a faixa padrão

Standard GPT-6.1 Sol is on OrcaRouter as openai/gpt-6.1-sol at the provider's own $2.00 input and $10.00 output per million tokens, served at 0% markup — the vendor's list price passed through, so a rate change from O​penAI shows up in your usage the same day rather than at the next renewal. The same key reaches more than 200 models, so the standard-lane traffic you keep after the Ultrafast experiment can sit behind one integration next to whatever else the task needs, with automatic failover if a provider degrades and a routing DSL for composing models into a single call.

Ultrafast itself is not something we can sell you, and it would be dishonest to phrase it any other way. It is a service-tier flag billed by O​penAI against your own account, not a separately routable model — we host the checkpoint, not the tier. Run the tiered traffic on your vendor key; route the volume through us.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s and 313.9M tokens of traffic, with the page's code snippet and EN language toggle visible in the header.

Quem deveria alterná-lo

Deixe ativado se uma pessoa ou um consumidor automatizado estiver bloqueado a cada resposta e o volume de tokens por tarefa for pequeno o suficiente para que a conta absoluta fique na casa dos poucos dólares — a aritmética acima coloca uma tarefa de agente de doze turnos em cerca de US$ 10, o que é uma solução barata se estiver substituindo dois minutos de espera humana e cara se não estiver substituindo absolutamente nada.

Deixe desativado se sua carga de trabalho for em lote, reexecutada à noite, ou ... Desligado é o correto se o que você está buscando é: seis vezes o gasto não compra nenhuma capacidade adicional neste modelo, e o mesmo dinheiro direcionado ao GPT-6 Astra é um upgrade real em vez de um mero girador mais rápido. Ultrafast vende tempo, e o tempo só vale US$ 50 por milhão de tokens para os fluxos de trabalho que estão realmente esperando por ele.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente