Cartão de título de destaque com o texto "GPT-6 vs Gemini 3.1 Pro", com um chip com o texto "Gemini 3.1 Pro: em pré-visualização desde 2026-02-19", duas linhas de preço com os textos "GPT-6 Sol $2 / $10" e "Gemini 3.1 Pro $2 / $12", e um rodapé com o texto "Valores do índice conforme o Artificial Analysis v4.3.2; itens reportados pelo fornecedor do GPT-6 identificados no texto." O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

GPT-6 vs Gemini 3.1 Pro: A linha Pro do Google não lançou um novo modelo desde fevereiro.

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Gemini 3.1 Pro está na tabela de preços do Google há sete meses e meio e nunca saiu da prévia. Foi anunciado em 19 de fevereiro de 2026, ainda é servido por um endpoint chamado Gemini 3.1 Pro Preview e, até hoje, não há compromisso de disponibilidade geral nem data de encerramento — as duas datas que diriam onde o modelo se situa no plano de seu próprio fornecedor. O GPT-6 Sol, em contrapartida, foi lançado em 22 de setembro de 2026 e, em 7 de outubro de 2026, tornou-se o modelo por trás dos níveis pagos do lançamento global do ChatGPT para mais de 1,2 bilhão de usuários semanais.

Então, a comparação principal não é entre dois níveis de ponta. É entre um produto já disponível e uma prévia aberta e sem prazo definido, e essa diferença acaba valendo mais do que a diferença de benchmark. Coloque-os lado a lado no Intelligence Index v4.3.2 da Artificial Analysis e a prévia de sete meses do Goo​gle marca 29,7 contra 47,6 do GPT-6 Sol, enquanto cobra 1,25× mais por tarefa de índice concluída — US$ 1,30 contra US$ 1,04. Ambos os números são reais, e ambos precisam de uma ressalva antes que você gaste dinheiro com eles.

O que torna isto digno de leitura em vez de ser descartado é que a pré-visualização de facto ganha em algumas coisas. Supera o GPT-6 Sol no GPQA Diamond, no uso agêntico de ferramentas do τ²-Bench e numa medição de contexto longo — e aceita áudio e vídeo como entrada, o que o GPT-6 Sol não faz. Uma pré-visualização com sete meses que ainda vence dois de quatro combates não é um modelo a descartar. É um modelo cujo ciclo de vida, e não a capacidade, é o problema.

Os números, e a ressalva de revisão que tem de acompanhá-los

A Artificial Analysis reexecuta seu conjunto de testes e republica as pontuações sob a revisão atual do índice, o que significa que o mesmo modelo pode apresentar dois números diferentes dependendo de quando você o consulta. Para o Gemini 3.1 Pro, essa discrepância é incomumente ampla: a cobertura anterior desse modelo reportava 57 em uma revisão mais antiga, enquanto a página como está agora reporta 29.7 na v3.2.2. Os dois números são genuínos e ambos estão no mesmo site.

Isso importa porque apenas números da mesma revisão podem ser subtraídos. O 29,7 e o 47,6 são o par a usar aqui, já que ambos vêm da v4.3.2 — a mesma execução que pontua Claude Opus 5.5 com 57,6 e GPT-6 Astra com 52,7. A leitura da mesma execução, uma linha por dimensão:

• Índice de Inteligência, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Custo por tarefa de índice concluída — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; o modelo mais antigo é 25% mais caro por resposta final
• Preço de entrada — $2,00 por 1M em ambos, iguais no valor de destaque
• Preço de saída — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol é 17% mais barato
• Cláusula de contexto longo — GPT-6 Sol recotiza a solicitação inteira para $4,00/$15,00 acima de 272.000 tokens de entrada; Gemini 3.1 Pro passa para $4,00/$18,00 acima de 200.000
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Gemini 3.1 Pro 1.048.576, efetivamente equivalentes
• Saída máxima — GPT-6 Sol 128.000 tokens vs Gemini 3.1 Pro 65.536; Sol é quase o dobro
• Modalidades de entrada — GPT-6 Sol texto, imagem, arquivo vs Gemini 3.1 Pro texto, imagem, áudio, vídeo, PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

Duas linhas ali merecem ser expandidas, porque invertem a leitura óbvia. A linha de custo por tarefa diz que a tabela de preços aparentemente mais barata pertence ao modelo que é mais caro por trabalho concluído — a tarifa de saída de US$ 12 do Gemini 3.1 Pro, somada ao seu volume de raciocínio, faz mais trabalho do que seu preço de entrada anunciado de US$ 2 sugere. E a etapa de contexto longo vale a pena ser relida dos dois lados: a faixa do Gemini 3.1 Pro começa em 200.000 tokens, abaixo dos 272.000 do GPT-6 Sol, mas reprecifica a saída para US$ 18,00, enquanto o Sol reprecifica para US$ 15,00. Nenhuma das duas é uma tabela de preços fixa, e os pontos de cruzamento não se alinham.

Onde a pré-visualização ainda vence

O modelo do Goo​gle não é uma relíquia. Puxe as avaliações que ambos os cartões carregam:

• GPQA Diamond — Gemini 3.1 Pro 94,1% vs GPT-6 Sol, nenhum número comparável publicado nesta revisão
• τ²-Bench uso de ferramentas agênticas — Gemini 3.1 Pro 95,6% vs GPT-6 Sol, não publicado no mesmo ranking
• Recordação em contexto longo — Gemini 3.1 Pro 82,0% vs GPT-6 Sol 83,7%, uma diferença de 1,7 ponto
• SciCode — Gemini 3.1 Pro 58,7% vs GPT-6 Sol 57,6%, praticamente empatados
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% vs GPT-6 Sol 43,9%; a única categoria em que a prévia não é competitiva

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

Uma pontuação de 94,1% no GPQA Diamond e 95,6% em uso de ferramentas agênticas são números de fronteira, não legados, e são a razão pela qual a lacuna de 17,9 pontos no índice superestima a distância prática. O índice é um composto de dez avaliações, e as perdas do Gemini 3.1 Pro estão concentradas onde a suíte tem peso fortemente voltado à engenharia de software — Terminal-Bench 4.0 com 4,0% é um valor atípico catastrófico ao lado de seus 58,7% no SciCode e de seus 73,8% no Terminal-Bench 2.1. Um modelo que pontua perto do topo de um benchmark agêntico e perto da base de seu sucessor está dizendo algo sobre sua data de treinamento, não sobre seu teto.

A entrada de áudio e vídeo é a outra vantagem concreta, e é um critério de tudo ou nada, não uma gradação. Se o seu pipeline recebe uma gravação de reunião ou uma captura de tela como entrada, o Gemini 3.1 Pro consegue processá-la e o GPT-6 Sol não. Nenhuma quantidade de liderança em índices substitui isso.

O que "ainda em pré-visualização" lhe custa, concretamente

O status de preview não é um rótulo cosmético, e os custos são do tipo que só aparecem depois que você já construiu algo em cima disso.

Um endpoint de pré-visualização não traz qualquer compromisso de disponibilidade geral, o que significa que o fornecedor não prometeu que o modelo ainda estará lá segundo um cronograma com o qual você possa planejar. Também não traz uma data de desligamento, o que soa como a versão boa disso — nada está sendo aposentado —, mas também pode ser lido ao contrário: o Goo​gle não publicou um ciclo de vida para um modelo que se encontra nesse estado desde fevereiro, enquanto lançava modelos da linha Flash ao longo do mesmo período. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, a linha 3.6 e 3.8 Flash: o nível Pro permaneceu onde estava, e o sucessor chegou, em vez disso, como Gemini 4 Argon, que o Goo​gle anunciou em 30 de setembro de 2026 numa implementação faseada para um grupo nomeado de parceiros de segurança, também sem qualquer data de disponibilidade geral associada.

É esse o padrão que esta comparação realmente aborda. Se você construir um pipeline durável sobre o Gemini 3.1 Pro Preview, estará construindo sobre um modelo cujo próprio fornecedor não disse quando ele deixará a fase de prévia, será substituído ou descontinuado. A posição do GPT-6 Sol é a oposta: é um produto de API em disponibilidade geral, com uma tabela de preços publicada e, desde 7 de outubro de 2026, também é o padrão no aplicativo que a maioria dos seus colegas usa. Em informações fornecidas pelo próprio fabricante e ainda não reproduzidas, a OpenAI diz que, no ChatGPT, o GPT-6 compõe respostas usando texto, elementos gráficos, gráficos e controles interativos por meio de um recurso que chama de Intelligent UI, que respostas que precisam de pesquisa na web começam 44% mais cedo do que o GPT-5.6 Instant, e que o nível de esforço Extra High começa a responder tão rápido quanto o GPT-5.6 no Medium. Nada disso muda uma integração de API. Tudo isso é o motivo pelo qual o GPT-6 agora é o padrão ambiente, e a prévia não é.

Há também uma versão simples do argumento. Você está pagando 25% a mais por tarefa concluída, com uma pontuação de capacidade mais baixa, por um modelo cujo ciclo de vida não foi declarado. O contra-argumento é válido — você obtém GPQA Diamond a 94,1% e entrada de áudio —, mas é um argumento específico para uma carga de trabalho específica, não um motivo geral para preferir o modelo mais antigo.

Testando um preview sem apostar nisso

O erro a evitar com um modelo na posição do Gemini 3.1 Pro é tratar "devemos usá-lo" como uma única decisão binária. Não é. Tanto o Gemini 3.1 Pro Preview quanto o GPT-6 Sol estão no catálogo da OrcaRouter atrás de um endpoint compatível com a Ope​nAI e de uma única chave, com 0% de markup sobre o preço de tabela do provedor — então a versão preview é algo que você pode colocar em um caminho de requisição real, medir em relação às suas próprias cargas de trabalho e manter ou descartar sem um segundo contrato com fornecedor ou uma alteração de código.

O failover automático é o que torna isso seguro para um modelo em ciclo de vida de pré-visualização. Encaminhe o tráfego de áudio e vídeo para o Gemini 3.1 Pro, já que ele é o único dos dois capaz de receber a entrada; encaminhe o tráfego de engenharia de software e de saídas longas para o GPT-6 Sol; e configure o fallback de modo que, se o endpoint de pré-visualização for descontinuado, tiver limite de taxa ou for discretamente reprecificado, a solicitação chegue a um modelo de disponibilidade geral em vez de falhar. Essa é a estrutura que uma pré-visualização de sete meses merece — não a evitação, mas um caminho que não depende dela.

Se quiser ir mais longe, a DSL de roteamento compõe vários modelos em uma única chamada lógica, de modo que uma requisição pode ser testada contra o Gemini 3.1 Pro e o GPT-6 Sol e a resposta ser escolhida pelos seus próprios critérios, e não pelos de um único fornecedor. A fusão de modelos faz o mesmo na direção oposta — um painel de modelos respondendo a uma única pergunta —, o que é uma forma razoável de descobrir onde vale a pena pagar pelos pontos fortes específicos de um preview antes de comprometer um caminho de produção com ele.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

O veredicto, e o número a observar

Para novos trabalhos, o GPT-6 Sol é a escolha mais segura em quatro das seis dimensões que decidem uma implantação, e é mais barato por tarefa concluída, além de pontuar 17,9 pontos de índice a mais na mesma revisão. Para cargas de trabalho que exigem entrada de áudio ou vídeo, ou nas quais um GPQA Diamond de 94,1% é aquilo que você está comprando, o Gemini 3.1 Pro Preview ainda vence, e o rótulo de pré-visualização é um risco a ser gerenciado, não um motivo para desistir.

O número a que se deve prestar atenção não é o índice. É a data no nome do endpoint do Gemini 3.1 Pro. Quando o sufixo de prévia sair — ou quando o Argon alcançar a disponibilidade geral com um identificador de API real —, esta comparação muda de forma por completo, e a lacuna de sete meses entre o último lançamento do nível Pro e hoje passa a ser o tema do artigo.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente