
GPT-6 Luna vs Gemini 3.1 Pro: Uma prévia de sete meses a vinte vezes o preço de entrada
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O modelo de raciocínio de fronteira tem sido rotulado como "Preview" desde que o Gemini 3.1 Pro foi lançado em 19 de fevereiro de 2026. Sete meses depois, ele ainda é uma prévia, ainda a US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída, e ainda o que a página do produto chama de modelo de raciocínio de fronteira da empresa. Em 22 de setembro de 2026, o fornecedor lançou GPT-6 Luna como uma camada pequena com disponibilidade geral a US$ 0,10 e US$ 0,50. Leia as duas tabelas de preços lado a lado e o modelo mais novo, mais barato e com disponibilidade geral é vinte vezes mais barato na entrada e vinte e quatro vezes mais barato na saída — e pontua mais alto no índice independente com que os departamentos de marketing de ambos os fornecedores se importam.
A última cláusula é a parte que vale a pena analisar com mais calma. O GPT-6 Luna pontua 37 no Artificial Analysis Intelligence Index com esforço máximo. O Gemini 3.1 Pro Preview pontua 30 na mesma revisão. Um modelo comercializado como uma aposta de eficiência para grande volume está sete pontos à frente de um modelo comercializado como um sistema de raciocínio de fronteira, a um vigésimo do preço de entrada. Não se trata de um modelo barato a alcançar um modelo caro. Neste eixo em particular, o modelo barato está simplesmente à frente, e o caro está em pré-visualização há sete meses.
A conclusão natural — de que o Gemini 3.1 Pro é caro demais — também não é bem assim, e o restante deste artigo trata dos três pontos em que o modelo do Google justifica sua tabela de preços, porque eles são reais e não são pequenos.
As cinco coisas que decidem isso
Antes do detalhe, a versão curta:
• GPT-6 Luna vence no preço por cerca de 20x na entrada e 24x na saída, na entrada em cache por uma margem ampla, e no índice de uso geral por sete pontos com esforço máximo equivalente.
• O Gemini 3.1 Pro vence na modalidade de entrada — aceita áudio e vídeo, o que o GPT-6 Luna não faz — e por estar acessível há sete meses, o que, para uma prévia, é um longo histórico de produção.
• Os tetos de saída não estão próximos em nenhuma direção: o GPT-6 Luna emite até 128.000 tokens, o Gemini 3.1 Pro até 65.000.
• Ambos têm um limite de faixa de contexto longo que reajusta o preço de toda a solicitação, em 272.000 tokens de entrada para o GPT-6 Luna e cerca de 200.000 para o Gemini 3.1 Pro.
• A armadilha do esforço padrão aplica-se apenas à Luna: seu 37 é uma pontuação de esforço máximo e sua configuração média padrão pontua 29, o que fica abaixo dos 30 do Gemini 3.1 Pro.
Duas tabelas de preços e a aritmética entre elas
Uma linha por dimensão, ambos os lados em cada:
• Entrada por 1M — GPT-6 Luna $0,10 vs Gemini 3.1 Pro $2,00
• Saída por 1M — GPT-6 Luna $0.50 vs Gemini 3.1 Pro $12.00
• Entrada em cache — GPT-6 Luna US$ 0,01 por 1M, um desconto de 90% em comparação com Gemini 3.1 Pro US$ 0,20 por 1M, um desconto de 90%
• Limite de contexto longo — GPT-6 Luna acima de 272K tokens de entrada vs. Gemini 3.1 Pro acima de aproximadamente 200K tokens de entrada
• Efeito de contexto longo — GPT-6 Luna 2x entrada e cache, 1,5x saída, em toda a solicitação vs Gemini 3.1 Pro US$ 4,00 entrada / US$ 18,00 saída, também em toda a solicitação
• Janela de contexto — GPT-6 Luna 1.050.000 tokens vs. Gemini 3.1 Pro 1 milhão de tokens
• Saída máxima — GPT-6 Luna 128.000 tokens vs Gemini 3.1 Pro 65.000 tokens
• Modalidade de entrada — texto e imagem do GPT-6 Luna vs. texto, imagem, áudio, vídeo e arquivos do Gemini 3.1 Pro
• Índice de Inteligência AA — GPT-6 Luna 37 no esforço máximo, 29 na configuração padrão vs Gemini 3.1 Pro 30
• Velocidade de saída — GPT-6 Luna 153,9 tokens/seg vs. Gemini 3.1 Pro cerca de 115-143 tokens/seg, dependendo do snapshot
• Interruptor de desativação do raciocínio — GPT-6 Luna, de nenhum a máximo, vs. Gemini 3.1 Pro que prioriza raciocínio, sem modo sem raciocínio exposto
• Status — GPT-6 Luna com disponibilidade geral desde 2026-09-22 vs Gemini 3.1 Pro em pré-visualização desde 2026-02-19

A linha interessante não é o preço. É o par de linhas na parte inferior. O rótulo de prévia do Gemini 3.1 Pro não é um mero detalhe técnico — ele muda o que o Google deve a você. Um modelo de prévia pode ser alterado, ter seu preço modificado ou ser retirado sem o aviso de descontinuação que um modelo GA recebe, e um preço que permanece inalterado após sete meses é uma promessa que ninguém fez por escrito. Tudo abaixo sobre o modelo do Google ser a aposta mais segura para produção precisa ser lido à luz dessa ressalva, porque "sete meses de estabilidade" e "sete meses sem uma garantia de estabilidade" são os mesmos sete meses.
Onde o modelo do Google justifica as vinte vezes a mais
Três lugares, e o primeiro é aquele que encerra a comparação para algumas equipes de forma definitiva.
Modalidade. Gemini 3.1 Pro aceita entrada de áudio e vídeo. GPT-6 Luna aceita texto e imagem. Se o seu pipeline ingere gravações de chamadas, capturas de tela ou vídeo, não há versão alguma desta comparação em que a diferença de preço importe, porque um dos dois modelos não consegue realizar a tarefa. Isso não é uma lacuna de benchmark que se estreita com uma versão pontual; é uma capacidade que ou está presente ou ausente, e é a única razão mais forte pela qual a tabela de preços do Google sobrevive ao contato com uma aquisição real.
Teto de saída, no sentido oposto. Os limites de saída funcionam na direção oposta à da modalidade de entrada, e este favorece a OpenAI. O GPT-6 Luna emite até 128.000 tokens em uma resposta; o Gemini 3.1 Pro, até 65.000. Se você está gerando artefatos estruturados longos — um documento completo, uma grande refatoração, um patch de vários arquivos —, o teto do Google é cerca da metade do da OpenAI, e um pipeline que trunca em 65.000 tokens está quebrado, independentemente de quanto ele pague por token.
Trabalho de fronteira multimodal. O posicionamento do Gemini 3.1 Pro é como um modelo de raciocínio que, por acaso, é multimodal, e a consequência prática é que tarefas que exigem raciocínio sobre um diagrama, um gráfico ou uma gravação de tela acabam ficando com ele, e não com uma camada menor focada primeiro em texto. O GPT-6 Luna aceita imagens, então a fronteira não é apenas áudio e vídeo — é que o modelo do Google é construído para raciocínio visual e de áudio como caso de uso principal, e o da OpenAI é construído para throughput.
Onde a categoria barata realmente perde, e não é onde você espera
O padrão de esforço é a armadilha neste confronto, e ele corta mais fundo aqui do que cortaria contra um oponente mais fraco. A pontuação de índice principal do GPT-6 Luna, de 37, é medida no esforço de raciocínio máximo. Seu padrão é médio, e no médio ele pontua 29 — um ponto abaixo de 30 do Gemini 3.1 Pro. Então a vantagem de sete pontos com que este artigo abriu é uma comparação entre o teto de um modelo e o teto de outro, e uma equipe que instala o GPT-6 Luna e deixa a configuração como está está executando um modelo que está fracionalmente atrás do da Google, sete meses mais velho, ainda em pré-visualização, a um vigésimo do preço.
Isso ainda é, para a maioria das cargas de trabalho, o trade-off certo — um ponto de índice não é uma diferença de capacidade, e uma diferença de preço de 20x é. Mas é um trade-off diferente daquele que as tabelas de preços anunciam, e é invisível a menos que você vá procurar o parâmetro de esforço.
O segundo ponto em que o nível barato perde é a aritmética de contexto longo. Ambos os modelos recalculam o preço de toda a solicitação assim que ela ultrapassa um limite, em vez de cobrar sobretaxa sobre o excedente, e ambos os limites são baixos o suficiente para fazer diferença: 272.000 tokens de entrada no GPT-6 Luna, cerca de 200.000 no Gemini 3.1 Pro. A cláusula do GPT-6 Luna dobra a entrada e o cache e aumenta a saída em 50%. A do Gemini 3.1 Pro leva a chamada inteira para US$ 4,00 de entrada e US$ 18,00 de saída. Nenhuma das duas é uma sobretaxa marginal, e, num modelo vendido pelo preço, a cláusula é o preço.
A terceira é a verbosidade, a linha de custo que nunca aparece em uma tabela de preços. A Artificial Analysis mediu o GPT-6 Luna gerando 150 milhões de tokens de saída ao longo da execução do índice, contra uma mediana de 85 milhões — o modelo é tagarela, e a US$ 0,50 por milhão de tokens de saída isso dá US$ 75 em tokens, enquanto um modelo conciso teria gasto US$ 42,50. Ele ainda é uma ordem de magnitude mais barato que a alternativa. Também é a razão pela qual números de custo por tarefa e números de custo por token contam histórias diferentes, e a razão para medir seu próprio volume de saída antes de modelar a economia.
Como é uma migração entre eles
O modelo do Google pode ser acessado por meio da própria API do fornecedor e de várias plataformas de terceiros; o GPT-6 Luna pode ser acessado por meio da própria API da OpenAI e, no momento em que escrevo, nenhum dos dois é a metade mais simples do par para se padronizar. Ambos expõem uma superfície de chat completions compatível com a OpenAI, o que significa que o formato da chamada não é o problema — os parâmetros são. A escada de esforço do GPT-6 Luna, sua cláusula de 272.000 tokens e seu requisito de que a chamada de função no Chat Completions seja executada com o esforço de raciocínio definido como none são todos comportamentos que o Gemini 3.1 Pro não compartilha, e um porte que altera apenas a string do modelo produzirá uma chamada funcional com o perfil de custo errado.
O Gemini 3.1 Pro Preview está no OrcaRouter pelo preço de tabela do Google, sob o preço de repasse, o que significa que uma mudança de tarifa do Google entra em vigor do nosso lado no mesmo dia. O GPT-6 Luna não está no nosso catálogo até o momento desta redação. Para uma equipe que usa os dois — o modelo do Google para tudo que precisa de áudio ou vídeo, o da OpenAI para texto em alto volume — isso é uma única chave para o Gemini 3.1 Pro ao lado do que você já usa para a OpenAI, com a decisão de roteamento expressa como configuração, e não como dois caminhos de código. Esse é o pareamento em que isso mais importa, porque os dois modelos não são nem um pouco intercambiáveis: uma rota que precisa escolher entre um preview multimodal e uma pequena camada GA apenas de texto é uma rota que será decidida de novo toda vez que qualquer um dos fornecedores lançar algo.

O que mudaria isso?
A comparação, como está, é um retrato de um momento incomum: um modelo GA de setembro superando um modelo de pré-visualização de fevereiro no índice geral a um vigésimo do preço de entrada, enquanto perde em modalidade e na maturidade que uma pré-visualização nunca chega realmente a conquistar. Três coisas poderiam mudar isso, e vale a pena observar cada uma em vez de tentar adivinhar.
O primeiro é o Gemini 3.1 Pro saindo da prévia. Um lançamento GA traria uma política de descontinuação, uma tabela de preços estável e, muito provavelmente, uma mudança de preço — o Google manteve US$ 2,00/US$ 12,00 ao longo de sete meses de prévia enquanto o restante do mercado caiu pela metade ao seu redor, e essa contenção é mais consistente com um preço de lançamento à espera de uma data de GA do que com uma posição ponderada.
O segundo é se a OpenAI amplia a escada de esforço da Luna ou altera seu padrão. A diferença de vinte e dois pontos entre a pontuação de esforço máximo do GPT-6 Luna e sua pontuação de esforço padrão é a maior sensibilidade de configuração neste artigo, e uma mudança no padrão alteraria a capacidade efetiva do modelo para todo chamador que nunca mexeu no parâmetro.
O terceiro é a lacuna de modalidade. É a única dimensão aqui que não é uma questão de grau, e é a que impede que isto seja uma comparação direta de preços. Até que um desses modelos consiga fazer o que o outro não consegue, a diferença de vinte vezes é um número real que aponta para dois trabalhos diferentes.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
