
GPT-6.1 Sol vs Gemini 3.1 Pro: Sete meses de prévia contra oito dias de entrega
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Gemini 3.1 Proestá na lista de preços do fornecedor há sete meses e meio e nunca saiu do preview. Anunciado em 19 de fevereiro de 2026, documentado hoje em um endpoint que termina em -preview, sem compromisso de disponibilidade geral e — mais revelador ainda — sem data de desligamento tampouco. GPT-6.1 Soltem oito dias de existência, lançado em 29 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. Coloque-os lado a lado no Artificial Analysis Intelligence Index e o preview de sete meses não é apenas competitivo: está a 22 pontos do modelo mais novo na revisão mais recente do índice — 29,7 contra 51,8 na v4.3.2 — ao mesmo tempo que custa 1,8× mais por tarefa do índice, US$ 1,30 contra US$ 0,72. Essa combinação é o motivo pelo qual esta comparação é interessante e não uma formalidade: neste quadro, o modelo mais antigo está ao mesmo tempo atrás em capacidade e à frente em custo, o que é o inverso do que se esperaria de um preview que deveria ter se formado. Mas a ressalva da revisão do índice importa aqui mais do que em qualquer outro lugar deste conjunto, porque um 29,7 e um 53 são ambos citados no mesmo site e não são a mesma medição.
Ambos são modelos multimodais grandes, com janelas de contexto da classe de 1M. O Gemini 3.1 Pro aceita texto, imagens, vídeo, áudio e PDFs, com um teto de saída de 65.536 tokens e uma faixa de preço de 200.000 tokens acima da qual a tarifa dobra. O GPT-6.1 Sol aceita texto, imagens e arquivos, com uma janela de 1.050.000 tokens, um teto de saída de 128.000 tokens, cinco níveis de esforço de raciocínio e uma faixa de contexto longo acima de 272.000 tokens de prompt. Um é um produto já lançado, com compromisso de suporte. O outro é um preview com ciclo de vida em aberto, e essa diferença acaba valendo mais do que a lacuna no índice.
O número do índice precisa de sua revisão anexada
A Artificial Analysis reexecuta a sua suíte e republica as pontuações sob a revisão atual do índice, o que significa que o mesmo modelo pode apresentar dois números diferentes dependendo de quando você consulta. Para o Gemini 3.1 Pro, essa diferença é invulgarmente ampla: a cobertura anterior deste veículo sobre este modelo reportou 57 numa revisão mais antiga, enquanto a página como está hoje reporta 29,7 na v4.3.2, a versão de dez avaliações que também traz o 51,8 do GPT-6.1 Sol. Ambos os valores são reais e ambos estão no mesmo site.
O que isto significa para uma comparação é restrito e importante. Só números da mesma revisão são subtraíveis. Um 29,7 e um 51,8 da v4.3.2 produzem uma diferença de 22 pontos; um 57 e um 51,8 produzem uma diferença de cinco pontos na direção oposta. O valor de 22 pontos é o que deve ser usado aqui, porque é aquele em que ambos os modelos foram medidos pelo mesmo conjunto de testes na mesma escala — e porque os valores de custo por tarefa, $1,30 contra $0,72, vêm dessa mesma execução.
• Índice de Inteligência, v4.3.2 — GPT-6.1 Sol 51.8 vs Gemini 3.1 Pro 29.7
• Custo por tarefa de indexação — GPT-6.1 Sol US$ 0,72 vs. Gemini 3.1 Pro US$ 1,30
• Custo de executar a suíte completa — GPT-6.1 Sol $1,082 vs Gemini 3.1 Pro $1,935
• Janela de contexto — GPT-6.1 Sol 1.050.000 tokens vs Gemini 3.1 Pro 1.000.000 tokens
• Saída máxima — GPT-6.1 Sol 128.000 tokens vs Gemini 3.1 Pro 65.536 tokens
• Modalidades de entrada — texto, imagem e arquivo em ambos, além de vídeo, áudio e PDF no Gemini 3.1 Pro
Duas dessas linhas favorecem o preview e merecem ser ditas de forma clara. O Gemini 3.1 Pro aceita vídeo e áudio, o que o GPT-6.1 Sol não faz; se o seu pipeline ingere uma gravação de tela ou uma chamada, essa é uma lacuna de capacidade que nenhuma pontuação fecha. E o seu teto de saída de 65.536 tokens é metade do teto do GPT-6.1 Sol, o que importa para a geração de conteúdo longo, mas raramente limita no trabalho agêntico, onde as saídas são curtas e os turnos são muitos.
Por que o número mais recente é o que deve orientar a sua decisão
A questão do preço é mais interessante do que a questão do índice.
A tabela de preços do Gemini 3.1 Pro é $2,00 de entrada e $12,00 de saída por milhão de tokens, com entrada em cache a $0,20 e gravações de cache a $0,375, e um limite de faixa em 200.000 tokens de prompt acima do qual as tarifas passam a $4,00 e $18,00. O GPT-6.1 Sol custa $2,00 de entrada e $10,00 de saída, com entrada em cache a $0,10, gravações de cache a $2,50, e um limite em 272.000 tokens acima do qual suas tarifas passam a $4,00 e $15,00. O preço de entrada anunciado é idêntico. O preço de saída é 20% menor no GPT-6.1 Sol, e o degrau de contexto longo é menor nos dois eixos. Onde as duas tabelas se diferenciam é no cache: $0,10 contra $0,20 por milhão de tokens de entrada em cache, com o modelo de pré-visualização gravando cache mais barato, a $0,375 contra $2,50.

Esse último par inverte a leitura casual. Se sua carga de trabalho for pesada em cache — um longo prompt de sistema fixo reenviado a cada turno, ou um documento relido ao longo de uma sessão —, a linha de gravação em cache do Gemini 3.1 Pro é drasticamente mais barata, e sua linha de leitura de cache é o dobro. Qual modelo vence depende de quantas vezes você relê o que escreveu, e esse é um número que seus próprios logs carregam e que nenhum benchmark publica. O que não é ambíguo é o custo de índice: em trabalho de avaliação idêntico, o modelo de oito dias terminou 33% mais barato, e o preview de sete meses terminou 79% mais caro do que o modelo mais novo no geral.
O selo de pré-visualização é o fato operacional.
Esta é a parte da comparação que uma tabela de pontuação não consegue abranger e que, para uma implantação em produção, supera tudo o que foi mencionado acima.
Gemini 3.1 Pro está em pré-visualização desde fevereiro, sem anúncio de disponibilidade geral e sem data de encerramento. Ambas as ausências importam e apontam em direções opostas. A ausência de GA significa nenhum compromisso de ciclo de vida: endpoints de pré-visualização não são cobertos pelos mesmos termos de aviso de descontinuação que os de disponibilidade geral e podem ser revisados sob um chamador sem um incremento de versão, o que é o motivo padrão para fixar um identificador exato de modelo em produção, em vez de um alias. A ausência de uma data de encerramento significa que você também não pode planejar uma janela de migração — o modelo já durou mais do que o trimestre em que todos esperavam que ele fosse promovido, e esta família já encerrou um modelo Pro antes.
A posição do GPT-6.1 Sol é a imagem espelhada. Ele tem oito dias de vida, o que significa que seu registro de avaliação independente se resume a uma única configuração e que seus modos de falha não estão documentados; não há corpus de profissionais a consultar quando ele se comporta de forma inadequada. O lançamento em si foi a notícia, e ele é disponibilizado sob uma estrutura de suporte que a preview não possui.
Esses são riscos diferentes, não quantidades diferentes de risco. Escolha a prévia e você estará apostando que o fornecedor continuará servindo um endpoint sem nenhuma obrigação contratual de fazê-lo. Escolha o modelo com oito dias de idade e você estará apostando que uma execução de benchmark e oito dias de disponibilidade são evidência suficiente para sua carga de trabalho. O índice não ajudará com nenhum dos dois.
A única coisa que tornaria isso fácil
Um anúncio de disponibilidade geral para o Gemini 3.1 Pro, com um identificador de modelo fora do namespace -preview e um compromisso de ciclo de vida publicado, resolveria a maior parte disso. Não fecharia a diferença de 22 pontos no índice nem a diferença de 1,8× no custo por tarefa, mas eliminaria o risco de depreciação que atualmente torna a comparação desigual, e permitiria que uma equipe adotasse o modelo sem fixar um identificador de pré-visualização e esperar que dê certo.
A ausência desse anúncio, após sete meses e meio, é em si mesma uma informação. Uma prévia que deveria validar atualizações antes de entrar em GA "em breve", segundo a formulação do fornecedor em fevereiro, teve dois trimestres completos para fazer isso. Ou a validação está em andamento, ou a prévia é o produto — e quem faz a chamada não consegue distinguir, de fora, qual é qual. O que quem faz a chamada pode fazer é precificar a incerteza e rotear de acordo.
Ambos em uma única tecla, para que a resposta possa ser por carga de trabalho

Gemini 3.1 Pro está no OrcaRouter com suas próprias tarifas listadas — $2,00 / $12,00, passando para $4,00 / $18,00 acima de 200.000 tokens de prompt, com leituras de cache a $0,20. GPT-6.1 Sol está no OrcaRouter a $2,00 / $10,00, passando para $4,00 / $15,00 acima de 272.000 tokens de prompt, com leituras de cache a $0,10. Preço de lista do provedor em ambos, nada acrescentado, uma chave e uma fatura.
Isso torna barato resolver as partes incômodas desta comparação. A ingestão de vídeo e áudio permanece no preview porque nada mais no par aceita isso; o trabalho de texto e codificação de alto volume vai para o modelo mais novo, que é mais barato por tarefa e 33% mais barato em trabalho de avaliação idêntico. Se o endpoint de preview for revisado ou retirado, o failover automático move essas chamadas para outra rota em vez de falhá-las — que é a proteção específica que o risco de ciclo de vida de um preview exige. E, como ambos ficam atrás de um único endpoint compatível com OpenAI, a comparação de preços que realmente importa pode ser feita no seu próprio tráfego em uma tarde, em vez de discutida a partir de uma tabela de tarifas.

A leitura defensável, então, não é qual modelo é melhor. É que esses dois têm preços quase equivalentes, embora estejam separados por sete meses em maturidade de ciclo de vida e por 22 pontos no quadro independente atual, e que as vantagens reais do modelo de pré-visualização — entrada de vídeo e áudio, gravações de cache baratas — são restritas e específicas. Se sua carga de trabalho precisa dessas modalidades, o Gemini 3.1 Pro é a única opção entre os dois e a diferença no índice é o preço de entrada. Se não precisar, está sendo oferecido a você um endpoint de pré-visualização com um futuro em aberto a um custo por tarefa 80% superior ao de um modelo que foi lançado na semana passada, e o ônus da prova corre no sentido oposto.
