Um cartão hero gerado intitulado "GPT-6.1 Sol vs. a geração GPT-6", encabeçado por "Uma geração, 48x o custo", mostrando quatro degraus empilhados rotulados GPT-6 Astra (Índice 52,7, $3,26 por tarefa), GPT-6.1 Sol (Índice 51,8, $0,72 por tarefa), GPT-6 Sol (Índice 47,6, $1,05 por tarefa) e GPT-6 Luna (Índice 38,1, $0,07 por tarefa), com um rodapé que diz "Valores: Artificial Analysis v4.3.2." e o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

GPT-6.1 Sol vs. a Geração GPT-6: Uma Geração de Um Só

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O fornecedor adicionou um quarto nome à sua linha de modelos em 29 de setembro de 2026 e o chamou de geração, e a aritmética da linha é o mais interessante nisso: GPT-6.1 Sol é a geração inteira. GPT-6 Luna e GPT-6 Sol, ambos lançados em 22 de setembro de 2026, permanecem inalterados; GPT-6 Astra, disponível desde 4 de setembro de 2026, permanece inalterado; a atualização 6.1 afetou exatamente um nível. Enquanto isso, o GPT-6.1 Sol, a $2,00 de entrada e $10,00 de saída por milhão de tokens, marca 51,83 no Artificial Analysis Intelligence Index por $0,724 por tarefa — a 0,84 ponto de GPT-6 Astra, que custa $3,2575 por tarefa a $10,00/$50,00. A mesma geração no rótulo, quatro economias diferentes por baixo.

Isso torna "devo usar a geração GPT-6" a pergunta errada. A linha abrange uma variação de 48× no custo por tarefa e uma variação de 14,6 pontos na inteligência medida, e a resposta depende inteiramente de qual nível você quer dizer. Aqui está a escada, medida.

Os quatro degraus, conforme medidos

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — Índice 38,12, $0,10 / $0,50 por 1M, $0,01 em cache, $0,0678 por tarefa, 50.012 tokens de saída, 100,1 s até o primeiro token
• GPT-6 Sol — Índice 47,63, $2,00 / $10,00, $0,20 em cache, $1,045 por tarefa, 31.000 tokens de saída, 124,3 s
• GPT-6.1 Sol — Índice 51,83, $2,00 / $10,00, $0,10 em cache, $0,724 por tarefa, 38.128 tokens de saída, 332,0 s
• GPT-6 Astra — Índice 52,67, $10,00 / $50,00, $1,00 em cache, $3,2575 por tarefa, 27.206 tokens de saída, 400,4 s

Todos eles têm a mesma janela de contexto de 1.050.000 tokens e a mesma saída máxima de 128.000 tokens, e todos aceitam entrada de texto, imagem e arquivo. Os níveis não se diferenciam por sinalizadores de capacidade. Eles se diferenciam por quanto de raciocínio você está disposto a pagar, e as duas pontas dessa escala estão separadas por um fator de 48 por tarefa.

O que a atualização 6.1 realmente mudou

Três coisas, e apenas uma delas é uma pontuação.

A pontuação mudou: de 47,63 para 51,83, um ganho de 4,2 pontos, em uma semana. A taxa de entrada em cache caiu pela metade, de US$ 0,20 para US$ 0,10 por milhão, e é por isso que o custo medido por tarefa caiu de US$ 1,045 para US$ 0,724, apesar de os preços de tabela serem idênticos — a mesma tabela de preços, uma fatura diferente. E a contagem de tokens de saída subiu de 31.000 para 38.128, enquanto o tempo de relógio por tarefa passou de 321 segundos para 640, que é o único ponto em que a atualização andou para trás e o menos visível em qualquer ficha técnica.

Na comparação com a Astra, esse é o comparativo que surpreende as pessoas. O GPT-6.1 Sol está 0,84 ponto de índice atrás do carro-chefe e é 4,5 vezes mais barato por tarefa. A vantagem restante da Astra não é sua pontuação no índice; é o conjunto de avaliações em que só ela é medida, e a capacidade que a OpenAI descreve como exclusiva dela — encontrar novas vulnerabilidades de segurança, razão pela qual o modelo é classificado como "crítico" sob o próprio Preparedness Framework do fornecedor e suas configurações mais capazes são restritas a parceiros verificados.

O cartão OrcaRouter para o GPT-6 Astra é o topo da mesma escada: $10,00 / $50,00, um p50 de 1,64 segundo até o primeiro token, 40,7 milhões de tokens ao longo de sete dias, e a mesma janela de contexto de 1.050.000 tokens que todos os níveis compartilham.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

Em comparação com o 6.0 Sol, a atualização é quase uma melhoria direta — mais índice, menos dinheiro — com a ressalva de que o modelo 6.1 é um modelo diferente e não um checkpoint, e de que ele reemite seu raciocínio de forma mais prolixa. Em comparação com Luna, não é uma comparação de modo algum: 10,7 vezes o custo por 13,7 pontos de índice, o que é uma boa troca para trabalho árduo e uma péssima para trabalho de alto volume.

O que os nossos próprios dados de roteamento dizem que o mercado já decidiu

Uma coisa que esta comparação tem que uma ficha técnica não tem é uma visão do uso real. Nos sete dias encerrados em 7 de outubro de 2026, na nossa própria camada de roteamento, o GPT-6.1 Sol movimentou 284,2 milhões de tokens e o GPT-6 Sol que ele substituiu movimentou 950 mil — uma diferença de 300 vezes para dois modelos com uma semana de diferença de idade, que é como uma substituição de nível se parece vista de dentro. O GPT-6 Luna, o nível barato, movimentou 641,6 milhões, mais do que os dois modelos Sol combinados. O GPT-6 Astra movimentou 40,7 milhões.

Leia isso como três comportamentos separados. O trabalho de alto volume foi para o nível barato, que recebeu o maior volume. O trabalho sério consolidou-se no Sol mais recente em até uma semana após o lançamento, abandonando o modelo que ele substituiu. E o modelo principal permaneceu um nicho: o degrau mais capaz, o menos usado, por equipes cujo problema é aquele que só ele resolve. A linha de modelos não é uma escada que as pessoas sobem; é um conjunto de ferramentas entre as quais as pessoas escolhem, e escolhem por nível, não por geração.

É por isso que o tier pertence à requisição, não à arquitetura

O problema prático de uma geração de quatro níveis é que a resposta certa muda por tarefa e por semana — como mostram os números de tráfego acima, o mercado decidiu de novo em sete dias. Fixar no código o nome de um único modelo em um aplicativo é o que transforma uma linha de modelos em um compromisso.

Todos os quatro são acessíveis por um único endpoint do OrcaRouter: uma única API para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de margem. Essa última parte é essencial aqui especificamente porque três dos quatro níveis compartilham um preço de tabela ou uma tarifa de cache que já mudou uma vez — a tarifa de cache do GPT-6.1 Sol caiu pela metade em menos de uma semana após o lançamento, e é o medidor de repasse que faz isso chegar automaticamente à sua fatura.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

Duas funcionalidades da camada de roteamento merecem ser mencionadas para esta composição em particular. O DSL de roteamento permite que o nível seja um parâmetro da requisição, e não da implantação — nível barato para a etapa de extração, 6.1 Sol para a etapa de raciocínio, Astra apenas para as chamadas que precisam do que só o Astra faz. E a fusão de modelos permite que um painel deles responda a uma pergunta em conjunto, que é a forma honesta de usar um flagship para o qual você não pode rotear tudo: ele se torna uma voz em um painel em vez da conta inteira.

O que fazer com uma geração de um

Não compre a geração. Compre um degrau e volte a comprá-lo quando os degraus mudarem.

Para trabalhos de alto volume e sensíveis à latência, o GPT-6 Luna a US$ 0,0678 por tarefa e 100 segundos para o primeiro token é o nível que já concentra o maior tráfego, e o preço é uma ordem de magnitude inferior a qualquer outro item na escala. Para raciocínio geral e programação, o GPT-6.1 Sol agora é o padrão que o modelo 6.0 costumava ser — mesmo preço de tabela, índice melhor, metade do custo de cache, e o tempo de 640 segundos por tarefa é a única coisa que você deve testar com sua própria carga de trabalho antes de presumir que a atualização é gratuita. Para as tarefas que exigem medição de fronteira ou o trabalho de segurança que apenas o carro-chefe executa, o GPT-6 Astra continua sendo o único degrau que as realiza, a 4,5 vezes o custo do degrau abaixo dele.

O que se deve observar é se a atualização 6.1 chega aos outros níveis. Se Luna ou Astra receberem o mesmo tratamento, a forma da escada muda, e a aritmética por tarefa deste artigo muda junto. Até lá, "GPT-6.1" designa um único modelo, e tratá-lo como uma família é como as equipes acabam pagando tarifas de modelo de ponta para extração.