
GPT-6.1 Sol vs GPT-6 Luna: Treze Pontos de Índice, Dez Vezes o Dinheiro e Duas Avaliações em que Isso Não Se Sustenta
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A OpenAI lançou GPT-6.1 Sol em 29 de setembro de 2026, uma semana depois de GPT-6 Luna chegar em 22 de setembro, no mesmo ciclo de keynote. Eles são os dois extremos da mesma geração: Luna é o nível barato, Sol é o nível intermediário acima dele, e GPT-6 Astra fica acima dos dois. A diferença de preço entre os dois é de uma ordem de magnitude — US$ 0,10 e US$ 0,50 por milhão de tokens contra US$ 2,00 e US$ 10,00, entrada em cache US$ 0,01 contra US$ 0,10 — e a diferença de capacidade no quadro independente é de 13,7 pontos do Intelligence Index, 51,8 contra 38,1 no esforço máximo de raciocínio. Dez vezes o dinheiro por treze pontos é mais ou menos a pior taxa de câmbio do atual lineup da OpenAI. O que torna a comparação digna de ser escrita é a pergunta de quarenta dólares que se segue: quais treze pontos?
Os dois modelos, e a semana entre eles
GPT-6 Luna é o modelo pequeno da geração GPT-6 — aquele que a OpenAI descreve como criado para trabalho de alto volume e sensível à latência: classificação, extração, roteamento, sumarização em massa, o loop interno de um agente. Ele tem uma janela de contexto de 1.050.000 tokens e um teto de saída de 128.000 tokens, aceita texto, imagens e arquivos como entrada e mantém a escada completa de seis níveis de esforço, incluindo nenhum, que o nível 6.1 removeu. A tabela de preços é a razão de sua existência: US$ 0,10 de entrada e US$ 0,50 de saída por milhão de tokens, entrada em cache a US$ 0,01 e gravações de cache a US$ 0,125, com um patamar de contexto longo acima de 272.000 tokens de entrada, passando para US$ 0,20, US$ 0,75 e US$ 0,02 em cache.
GPT-6.1 Sol é a atualização de nível médio lançada uma semana depois. Mesma janela, mesmo limite de saída, mesmas modalidades de entrada, um corte de conhecimento de 30 de abril de 2026 em comparação com o da Luna, e uma escala de esforço que começa em baixo porque nenhum e mínimo são rejeitados de imediato. Está precificado em $2,00 e $10,00 com entrada em cache a $0,10 — vinte vezes a taxa de entrada da Luna e vinte vezes a sua taxa de saída, com uma linha de cache que é dez vezes mais cara por acerto.
Ambos estão à venda, ambos estão no ChatGPT Work e no Codex, bem como na API, e ambos podem ser chamados pela mesma chave do nosso lado. Nada nesse emparelhamento exige uma escolha.
O que treze pontos de índice realmente compram
O composto é o número menos informativo da comparação, porque faz a média de tarefas que se comportam de maneiras muito diferentes. Pontuado avaliação por avaliação com esforço máximo de raciocínio no Artificial Analysis v4.3.2, o formato é uma divisão, e não uma inclinação:
• AA-LCR v1.1, raciocínio de contexto longo — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna está marginalmente à frente.
• SciCode — GPT-6 Luna 0,546 vs GPT-6.1 Sol 0,542. Novamente efetivamente empatados, e novamente o modelo mais barato está nominalmente à frente.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. Uma diferença de 43 pontos; os dois modelos estão em ligas diferentes no trabalho de terminal.
• Humanity's Last Exam — GPT-6 Luna 0,385 vs. GPT-6.1 Sol 0,529.
• AutomationBench-AA — GPT-6 Luna 0,532 vs GPT-6.1 Sol 0,649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs GPT-6.1 Sol Elo 1575,1, uma diferença de 138 pontos de Elo em trabalho de conhecimento profissional.
• GDP.pdf — GPT-6 Luna 0,228 vs. GPT-6.1 Sol 0,310.
• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0,65 vs GPT-6.1 Sol 41,5. Numa escala em que zero significa tantas respostas corretas quanto incorretas, Luna está na linha d'água e Sol está significativamente acima dela.
• MMMU-Pro — GPT-6 Luna 0,797 vs GPT-6.1 Sol 0,860.
• Custo por tarefa de índice, independente — GPT-6 Luna $0,068 vs GPT-6.1 Sol $0,72; uma diferença de cerca de dez vezes a favor do modelo barato
• Tokens de saída na execução do índice — GPT-6 Luna 144 milhões vs GPT-6.1 Sol 67 milhões, em comparação com uma mediana da classe de 100 milhões para o Luna e cerca de 81 milhões para o Sol
Duas de dez avaliações são um empate a favor do modelo barato. Oito ficam com o caro, e em seis dessas oito a margem não é marginal. Essa é a leitura honesta dos treze pontos: não é um gradiente uniforme de qualidade; são duas capacidades — execução agêntica sustentada e confiabilidade factual — nas quais Luna simplesmente não é a mesma classe de modelo, e um meio amplo onde a diferença é real, mas pequena o bastante para ser invisível no seu próprio conjunto de avaliações.
O resultado do AA-LCR merece uma ressalva, porque é o número que mais favorece o Luna. O raciocínio de contexto longo em 0,833 é uma pontuação forte, e os dois modelos estão a menos de meio ponto um do outro, mas o benchmark mede recuperação e raciocínio sobre entradas longas, não a capacidade de agir ao longo de uma sessão longa. A diferença no Terminal-Bench 4.0 é o que "agir ao longo de uma sessão longa" parece quando é pontuado, e é de 43 pontos.

A aritmética do custo por tarefa, e onde ela deixa de ser verdade
A Artificial Analysis calcula o preço de cada execução de índice a partir do consumo medido de tokens, portanto o valor de custo não é uma inferência de tabela de preços. A execução do GPT-6 Luna custou US$ 0,068 por tarefa; a do GPT-6.1 Sol custou US$ 0,72. A razão é de 10,7×, o que é ligeiramente pior do que a razão nominal de preço de vinte vezes apenas porque Luna gerou 144 milhões de tokens de saída na execução, contra 67 milhões de Sol — o modelo barato é mais de duas vezes mais tagarela, e isso corrói sua própria vantagem. Mesmo assim, a diferença na classificação não é pequena, e em uma carga de trabalho de respostas curtas ela aumentaria: menos volume de saída significa que a penalidade de verbosidade de Luna diminui, enquanto sua vantagem de preço permanece fixa.
Onde a aritmética deixa de ser verdadeira é em qualquer carga de trabalho à qual o índice não se assemelha. Se sua tarefa é uma edição em escala de repositório que precisa de vinte chamadas de ferramentas mantidas coerentes, um modelo de US$ 0,07 que falha na tarefa custa a você todo o ciclo de novas tentativas mais o tempo de relógio de parede, e o modelo de US$ 0,72 que conclui de uma só vez é mais barato. O próprio enquadramento de lançamento do GPT-6.1 Sol é inteiramente construído sobre essa ideia — custo por tarefa concluída — e é o enquadramento correto: a comparação relevante não é a taxa de tokens, é o custo esperado por resultado, e em tarefas que Luna não consegue completar, essa expectativa é ilimitada.
Dois detalhes estruturais aguçam a fronteira. Primeiro, a etapa de contexto longo: ambos os modelos são reprecificados acima de 272.000 tokens de entrada, Luna para $0,20 e $0,75, e Sol para $4,00 e $15,00, então a diferença absoluta aumenta na fronteira em vez de diminuir, mas a tarifa reprecificada de Luna ainda está uma ordem de magnitude abaixo da tarifa padrão de Sol. Segundo, e fácil de passar despercebido: a escada de esforço não tem o mesmo formato. Luna aceita none; Sol não. Uma cascata que encaminha primeiro para Sol e recorre a Luna em caso de erro ou timeout não deve transportar o reasoning.effort da solicitação sem alterações, porque uma configuração que é válida em um modelo retorna um erro no outro. Isso é uma preocupação da camada de roteamento, não de qualidade do modelo, e é exatamente o tipo de coisa que um endpoint único com uma regra de roteamento deveria absorver.
Executar ambos é o objetivo, não uma proteção.
Ambos os modelos estão no OrcaRouter aos preços de tabela da própria OpenAI, sem nada acrescentado: GPT-6 Luna a $0,10 e $0,50, com entrada em cache a $0,01; GPT-6.1 Sol a $2,00 e $10,00, com entrada em cache a $0,10; e o degrau de 272.000 tokens de cada um é repassado exatamente como o fornecedor o lista. Como a plataforma repassa o preço de tabela do provedor em vez de aplicar uma margem, a proporção de vinte para um neste artigo é a proporção que você realmente paga, em ambos os lados.

O motivo que importa aqui especificamente é que este par é uma cascata à espera de ser escrita. Um classificador, um roteador, um trabalho de extração em massa e um agente de codificação em escala de repositório não pertencem ao mesmo modelo, e a diferença de preço é ampla o suficiente para que escolher errado em qualquer direção seja caro — vinte vezes demais por chamada em uma direção, uma tarefa malsucedida na outra. Uma chave, dois modelos e uma regra que envia tráfego fácil para Luna e escala para Sol quando a classe da tarefa muda ou quando a saída de Luna falha em uma verificação é uma mudança de configuração do nosso lado, em vez de um segundo contrato com fornecedor. O failover automático cobre o caso em que um dos dois está degradado, o que, para um modelo lançado há oito dias, ainda é uma possibilidade real.

A decisão, de uma só vez
• Classificação, extração, roteamento, sumarização em massa, loops internos de agentes — GPT-6 Luna, e pare de ler. A $0,10/$0,50 com uma leitura em cache de um centavo, treze pontos de índice de capacidade geral não valem dez vezes a fatura em trabalho onde a resposta é curta e verificável.
• Codificação em escala de repositório, agentes de terminal, execução em múltiplas etapas — GPT-6.1 Sol. O diferencial de 43 pontos no Terminal-Bench 4.0 é todo o argumento; é esta a capacidade que o preço está a comprar.
• Perguntas de trabalho do conhecimento em que uma resposta errada sai cara — GPT-6.1 Sol, sobre as lacunas do AA-Omniscience e do GDPval-AA. A pontuação de confiabilidade factual da Luna está na linha d'água.
• Entradas longas com uma resposta gerada curta — GPT-6 Luna. Ele raciocina sobre contexto longo em paridade com um modelo que custa vinte vezes mais, e sua penalidade de verbosidade de 144 milhões de tokens nunca tem chance de se aplicar.
• Qualquer coisa que já esteja definindo como nenhum — fique na Luna, ou reserve orçamento para a mudança. Esse degrau não existe no GPT-6.1 Sol.
• Superfícies sensíveis à latência — GPT-6 Luna, segundo as próprias medições do ranking: 129,4 tokens de saída por segundo e 100 segundos até o primeiro chunk, contra 59,7 e 332 do Sol.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
