
Gemini 3.1 Pro vs Qwen3.8-27B: Uma prévia de sete meses vs um checkpoint que você pode baixar
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Em 18 de setembro de 2026, usuários no próprio fórum de desenvolvedores de IA do fornecedor começaram a relatar que Gemini 3.1 Pro havia desaparecido do seletor de modelos do AI Studio — incluindo contas pagas, apesar de limpezas de cache e janelas anônimas. O tópico que pedia ao fornecedor que dissesse se era "um bug ou intencional" ainda estava ativo em 21 de setembro. Não há aviso de descontinuação, nem caminho de migração, nem resposta da equipe. Enquanto isso, Qwen3.8-27B, que o laboratório disponibilizou como código aberto em 14 de agosto sob a licença Apache 2.0, não pode ser retirado de ninguém que o tenha baixado. Essa assimetria — não a diferença de benchmark, que é real, mas modesta — é o que realmente define esse confronto, e é por isso que os dois modelos não estão de fato competindo pela mesma posição, embora as tabelas de comparação os coloquem lado a lado.
O que segue é a comparação direta entre os números existentes, com cada um rotulado: valores da Artificial Analysis obtidos a partir de capturas feitas em 23 de setembro de 2026, a própria ficha do modelo da Alibaba, o post de lançamento do Google e nossa própria telemetria de roteamento — mantidos separados do início ao fim. Onde nada foi medido, esta página diz isso em vez de adivinhar.
O que aconteceu esta semana, e o que isso significa e não significa
Os relatos são específicos e vêm do próprio fórum do Google, e não do blog de um concorrente. Um tópico intitulado "Gemini 3.1 Pro ausente do AI Studio desde 2026-09-18 — bug ou intencional?" descreve usuários pagantes perdendo o modelo sem nenhum anúncio, o suporte do Google One oferecendo etapas de solução de problemas não relacionadas, e a página de status do Google não mostrando nada de errado. Um segundo tópico, "Modelo Gemini 3.1 Pro Preview não disponível no AI Studio para criar App", reúne a mesma reclamação, inclusive de um usuário cujo assistente de programação havia sido construído com base no preview por meses e que diz que o Flash "faz porcaria" na base de código do usuário.
Três ressalvas honestas. É um desaparecimento do console do desenvolvedor, não uma indisponibilidade confirmada da API: o Gemini 3.1 Pro ainda está listado e é roteável em nosso próprio catálogo, onde movimentou 94,7 milhões de tokens nos últimos sete dias. É um relato de usuários — o Google não disse nada, então ninguém fora do Google consegue distinguir "depreciação silenciosa" de "problema de capacidade" de "bug do console". E o momento não é favorável, considerando que este modelo está em prévia desde 19 de fevereiro de 2026 — sete meses, sem data de GA publicada, enquanto o Google lançou uma série de modelos Flash abaixo dele. Separadamente, o GitHub Copilot desativou o Gemini 3.1 Pro em 1º de setembro de 2026 com aviso prévio de 30 dias, o que é um evento diferente e não relacionado, mas aponta na mesma direção: um endpoint de prévia sem compromisso de GA é uma dependência com a qual você tem o direito de ficar nervoso.
Um número da nossa parte merece ser colocado ao lado desse contexto, porque não conseguimos explicá-lo e preferimos dizê-lo. Nossa telemetria de sete dias sobre a entrada do catálogo do Gemini 3.1 Pro mostra uma taxa de erro de 80,5%; os modelos vizinhos que verificamos na mesma manhã — Qwen3.8-Max, Claude Fable 5.1 — estão em 5,9% e 6,9%. Não sabemos se isso é o mesmo problema que o fórum está relatando, uma semana ruim para um provedor upstream, ou um artefato de instrumentação. Trate isso como um motivo para executar um canário antes de se comprometer, não como um veredito sobre o modelo.
Mesma régua, duas pontuações diferentes
Esta é a parte que a maioria das páginas de comparação erra, por isso vale a pena fazê-la com cuidado. A Artificial Analysis pontua ambos esses modelos no Intelligence Index v4.3.2. Capturamos as duas páginas em 23 de setembro de 2026, e ambas trazem a mesma revisão — então, ao contrário da maioria das alegações de índices entre modelos, esta é do mesmo snapshot e a diferença é real.
• Qwen3.8-27B (xhigh) — Índice de Inteligência 33.7
• Gemini 3.1 Pro Preview — Índice de Inteligência 29,7
A Qwen lidera por quatro pontos na régua atual. A pergunta mais difícil é o que isso significa, porque a própria régua já mudou pelo menos três vezes neste ano. Em fevereiro, a Artificial Analysis publicou um artigo chamando o Gemini 3.1 Pro Preview de "o novo líder em IA", quatro pontos à frente do Claude Opus 4.6, e a cobertura de imprensa da época relatou uma pontuação de 57 no que então era o Index v4.0. No v4.3.2, é 29,7. A Artificial Analysis anunciou o v4.3 em 7 de setembro de 2026, quatro dias depois do v4.2, e a revisão trocou o Terminal-Bench 2.1 pelo muito mais difícil Terminal-Bench 4.0 de 66 tarefas e substituiu o τ³-Banking pelo AutomationBench-AA. Os pontos fortes do Gemini 3.1 Pro em fevereiro estavam em avaliações que o novo índice aposentou ou reponderou. Ou seja: o modelo não piorou, o exame piorou. Mas, se você está escolhendo um modelo hoje, o número de hoje é o único sobre o qual você pode realmente agir, e o número de hoje favorece a Qwen.
Onde os dois genuinamente divergem
As pontuações agregadas escondem o formato da diferença, e o formato é a parte útil. Todos os números abaixo vêm da mesma captura de 23 de setembro das páginas v4.3.2 da Artificial Analysis para ambos os modelos, na mesma revisão.
• Raciocínio e conhecimento — o Gemini lidera com clareza. GPQA Diamond 94,1 vs 90,5; Humanity's Last Exam 47,0 vs 33,9; SciCode 58,7 vs 46,6; CritPt 17,7 vs 5,4.
• Tarefas ocupacionais do mundo real — a Qwen lidera, e por uma grande margem. GDPval normalizado 45,4% vs 13,8%.
• Banking agêntico e transações — Qwen lidera. τ-Banking 48,0 vs 21,4 do Gemini.
• Uso de ferramentas agênticas em um benchmark geral — o Gemini lidera onde o Qwen não foi medido. τ²-Bench 95,6 para o Gemini; não existe um valor para o Qwen3.8-27B.
• Trabalho de terminal — próximos, e ambos ruins no novo benchmark. Terminal-Bench 2.1: Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0: Qwen 5,6%, Gemini 4,0% — ambos com um dígito.
• Calibração — a divergência mais acentuada em qualquer uma das páginas. No AA-Omniscience, o Gemini obtém 31,9 com 54,9% de precisão e uma taxa de alucinação de 50,9%; o Qwen obtém −10,0 com 15,6% de precisão e uma taxa de alucinação de 30,3%. O Gemini sabe mais e inventa em mais da metade das vezes; o Qwen frequentemente se recusa a responder e alucina em cerca de um terço do que responde.
• Contexto longo — completamente empatados no recall de contexto longo, 82,0 cada. No recall de contexto longo multimodal, Qwen 21,7% vs Gemini 15,6%.
Leia as entradas "não medidas" como o que são. O Gemini não tem nenhum valor normalizado GDPval-AA publicado em comparação com os 45,4% do Qwen, e o Qwen não tem nenhum valor para τ²-Bench, IFBench, Terminal-Bench Hard ou ITBench-SRE em comparação com os 77,1, 53,8 e 30,3 do Gemini. Cada uma dessas lacunas é um lugar onde uma tabela de resumo teria silenciosamente plantado um vencedor.

A divergência que decide os orçamentos: mesmo custo para executar o índice
Qwen3.8-27B é drasticamente mais barato por token. Segundo os números de mercado que a Artificial Analysis publica, ele custa US$ 0,50 por milhão de entrada e US$ 3,00 por milhão de saída, com um desconto de cache de 80% e uma taxa combinada 7:2:1 de US$ 0,47. O Gemini 3.1 Pro Preview custa US$ 2,00 e US$ 12,00 — quatro vezes o preço de entrada e quatro vezes o preço de saída —, com um desconto de cache de 90% e uma taxa combinada de US$ 1,74.
Agora, o número que ninguém publica: o próprio cálculo da Artificial Analysis estima o custo de executar todo o Intelligence Index em $1.310,21 para o Gemini 3.1 Pro Preview e $1.335,92 para o Qwen3.8-27B. O Qwen não é mais barato de executar. É ligeiramente mais caro, porque leva mais tempo para chegar lá. Da fatura de saída do Qwen, $512,36 foram tokens de raciocínio contra $82,51 de resposta propriamente dita; na do Gemini, $691,82 foram de raciocínio contra $113,08 de resposta. O preço por token é uma taxa, não uma fatura.
Mais dois fatos de preço que as tabelas comparativas omitem. Primeiro, o preço do Gemini 3.1 Pro é escalonado pelo tamanho da entrada de cada requisição: $2,00/$12,00 até 200 mil tokens de entrada, e depois $4,00/$18,00 acima disso, com leituras de cache dobrando de $0,20 para $0,40. A janela de contexto de um milhão de tokens é real, mas os últimos 800.000 tokens dela custam o dobro. Segundo, nossa própria entrada de catálogo para o Qwen3.8-27B — servido em block-FP8, torre de visão em precisão total — lista $0,40 de entrada e $4,21 de saída, o que é mais barato na entrada e mais caro na saída do que o número de mercado acima, e não publica nenhuma tarifa de token em cache. Provedores diferentes, divisão diferente. Confira a tarifa que será realmente cobrada de você.
Ambos os modelos são acessíveis por meio de uma única chave OrcaRouter ao preço de tabela do provedor, com 0% de markup, então uma mudança de preço do fornecedor chega até nós no mesmo dia, em vez de só depois de um ciclo de reprecificação — o que importa mais do que o habitual quando um dos dois tem um limite de faixa situado em 200K tokens.
Latência: o primeiro token mais rápido pertence ao modelo mais lento
Este é o par de números mais enganoso de toda a comparação, e é aquele sobre o qual um leitor tem maior probabilidade de agir de forma equivocada.
• Tempo até o primeiro chunk — Qwen 4,04 s vs. Gemini 28,37 s. Qwen parece ser sete vezes mais rápido.
• Tempo até a resposta real — Gemini 28,37s vs Qwen 52,52s. Gemini vence por cerca de 1,8x, porque Qwen passa 48,48 segundos pensando entre o primeiro bloco e o primeiro token de resposta.
• Velocidade de saída — Gemini 116,5 tokens por segundo vs. Qwen 41,3. O Gemini é 2,8x mais rápido depois que começa a escrever, em comparação com a mediana dos comparadores que a Artificial Analysis estima em 95,4 tokens por segundo. A própria página do Qwen o chama de "notavelmente lento".
Se o seu produto transmite um primeiro token a um usuário, a latência de destaque do Qwen é uma mentira que você contará a si mesmo uma vez. Se o seu produto espera por uma resposta completa, o Gemini é o modelo mais rápido. Ambas as métricas são medições da Artificial Analysis; ambas foram obtidas na configuração de esforço xhigh do Qwen, que é o padrão do model card.
Esse padrão é uma queixa recorrente entre profissionais, e o card do modelo meio que admite isso. O Qwen3.8-27B expõe o parâmetro reasoning_effort com três níveis — xhigh (o padrão, "para tarefas complexas que exigem análise minuciosa"), medium e low. Relatos da comunidade até setembro indicam que xhigh produz fases de pensamento muito longas e recomendam reduzir para medium ou low e limitar o orçamento de raciocínio. O próprio card da Alibaba adverte que, em trabalho agêntico multiturno, reduzir o esforço "nem sempre reduz o tempo total de conclusão da tarefa" — o que é uma declaração franca para um card de modelo dizer e um alerta de que a solução óbvia nem sempre é a solução.
Contexto: 1M vs 262K, e o que realmente cabe
O Gemini 3.1 Pro carrega uma janela de contexto de 1.000.000 de tokens, com uma saída máxima de 65.536 tokens. O Qwen3.8-27B carrega 262.144 tokens nativamente, extensível para 1.000.000 com escalonamento YaRN, com orçamentos separados recomendados dentro dele: conteúdo de raciocínio de até 262.144 e uma resposta final de até 131.072.
Duas notas de rodapé honestas. A tabela de especificações da Artificial Analysis lista a janela do Qwen como 256.000, enquanto o próprio texto de FAQ diz 260K e o cartão do modelo diz 262.144 — são diferenças de arredondamento no mesmo número, mas cite 262.144 porque é o que o cartão diz. E a extensão para 1M é uma técnica de escalonamento, não a mesma coisa que uma janela nativa de um milhão de tokens: a recuperação de contexto longo em 1M num modelo estendido com YaRN não é o que a figura 82,0 do AA-LCR mede. Ninguém publicou uma pontuação de recuperação de contexto de 1M para o Qwen3.8-27B. Trate a janela do Gemini como aquela com o comportamento medido em comprimento total e a do Qwen como aquela que você deve testar por si mesmo antes de projetar em torno dela — e lembre-se de que, acima de 200K tokens de entrada, o preço do Gemini dobra.
Trabalho agêntico e chamada de ferramentas
É aqui que o confronto está genuinamente em aberto, e onde um vencedor fabricado seria fácil e errado. O Qwen3.8-27B tem pontuações agênticas medidas que o Gemini não tem, e vice-versa.
O argumento da Qwen baseia-se em um número independente forte e em um número do fornecedor forte. O número independente é τ-Banking em 48,0 contra os 21,4 do Gemini — mais que o dobro, na mesma revisão, em um benchmark sobre uso de ferramentas em várias etapas dentro de um ambiente bancário. O número do fornecedor é o card da própria Alibaba, que lista OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 e Agents' Last Exam 20,4 Pass@1. Essas são avaliações da Alibaba, não reexecutadas por mais ninguém, e ficam exatamente nas categorias em que o resultado do GDPval medido de forma independente (45,4% normalizado vs. 13,8%) aponta na mesma direção.
O argumento do Gemini é que ele tem o único número agêntico absoluto alto na comparação — τ²-Bench 95,6 — e o Qwen não tem nenhuma pontuação no τ²-Bench. Ele também tem IFBench 77,1 para seguimento de instruções, outra lacuna do lado do Qwen. E tem um histórico de produção de sete meses que um lançamento de pesos abertos de cinco semanas não tem.
O desempate não é uma pontuação, é a sua topologia. A vantagem agêntica do Qwen é medida em benchmarks nos quais o modelo opera dentro de um grande sistema de software preexistente que ele não projetou. A do Gemini é medida em benchmarks nos quais o modelo precisa seguir instruções com precisão por muito tempo. Essas são habilidades diferentes, e ambas são reais.

Codificação
A programação se divide da mesma forma, e é por isso que "qual é melhor em código" não tem uma resposta clara aqui. Gemini lidera o lado da computação científica — SciCode 58,7 vs 46,6 — e seu AA Coding Index de 68,8 em nossa página de catálogo está dentro de um erro de arredondamento em relação ao 68,1 do Qwen, bem dentro de qualquer intervalo de confiança que valha a pena citar. No trabalho agêntico de terminal, os dois estão próximos no benchmark mais antigo, Qwen 79,8 vs Gemini 73,8 no Terminal-Bench 2.1, e indistinguíveis no mais novo, em que ambos caem para valores de um dígito.
A ficha da Alibaba afirma muito mais — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 —, mas esses números foram relatados pelo fornecedor, e a ficha observa em nota de rodapé que SWE-bench Pro e QwenSWEBench foram executados no harness do Claude Code, que não é o harness que o número de um concorrente teria usado. A afirmação segura é que, no único benchmark de programação em que os modelos dos dois laboratórios foram medidos por um terceiro, os dois estão separados por quatro pontos no Terminal-Bench 2.1 e por 1,6 ponto no Terminal-Bench 4.0, e ambos vão mal no mais difícil.
Pesos abertos versus um endpoint de pré-visualização
Este é o eixo no qual os dois não são de todo comparáveis, e é o que tem a maior consequência prática.
Qwen3.8-27B é Apache 2.0, 27B de parâmetros densos, 64 camadas, com um híbrido de atenção linear Gated DeltaNet e atenção completa numa proporção de aproximadamente 3:1 — o design que torna uma janela de 262K economicamente viável de servir. Ele roda. Quantizado para 4 bits, cabe em cerca de 17GB, o que corresponde a uma única GPU de consumidor; todo um ecossistema de compressão cresceu ao seu redor em cinco semanas, desde os quants Dynamic V3 da Unsloth, incluindo uma versão de 1 bit que a Unsloth diz rodar em 8GB com cerca de 77% da precisão original, até o Ternary Bonsai 2 27B da PrismML em meados de setembro. Você pode fazer fine-tuning nele, pode auditá-lo e pode executá-lo em um laptop com a rede desconectada.
Gemini 3.1 Pro é um endpoint de prévia fechado, com sete meses de existência, sem data de GA, com uma ficha do modelo que adverte explicitamente que prévias podem não ter a estabilidade, a disponibilidade e o suporte de uma versão estável e — a partir desta semana — um console de desenvolvedor que ele parece ter deixado discretamente. Você não pode baixá-lo, não pode fixar uma versão e não pode fazer failover para você mesmo.
Se você quer a resposta honesta de roteamento em vez de um veredito: a existência do checkpoint aberto é o que torna a dependência do Gemini sobrevivível. Coloque o Qwen3.8-27B atrás de um caminho local ou auto-hospedado como fallback, mantenha o Gemini 3.1 Pro no caminho primário para o trabalho com uso intenso de raciocínio no qual ele é mensuravelmente melhor, e coloque ambos atrás de um único endpoint com failover automático, de modo que um desaparecimento silencioso do console de outra pessoa seja um incidente que sua camada de roteamento absorve, em vez de uma interrupção que seus usuários veem. Isso não é um discurso de venda de um produto — é a única configuração na qual as notícias desta semana não custam um fim de semana.
Escolha o Gemini 3.1 Pro se
• Seu trabalho mais difícil é raciocínio intensivo em conhecimento, em vez de uso de ferramentas de longo horizonte — ele lidera GPQA Diamond 94,1 a 90,5, Humanity's Last Exam 47,0 a 33,9, SciCode 58,7 a 46,6 e CritPt 17,7 a 5,4.
• Você precisa de entradas genuinamente longas. Uma janela medida de um milhão de tokens, com comportamento de recall testado exaustivamente, supera uma janela de 262K estendida por técnica — desde que você consiga conviver com o preço dobrando depois de 200K tokens de entrada.
• O tempo para completar a resposta importa mais do que o tempo até o primeiro token, e você quer 116,5 tokens por segundo em vez de 41,3.
• Você precisa de ampla multimodalidade hoje: entrada de áudio, arquivo, imagem, texto e vídeo em comparação com texto, imagem e vídeo do Qwen.
• Você está disposto a aceitar o risco de pré-visualização e tem um plano de contingência sob seu controle.
Escolha o Qwen3.8-27B se
• Seus agentes operam dentro de grandes sistemas existentes — τ-Banking 48,0 a 21,4 e GDPval 45,4% a 13,8% normalizado são as duas maiores vantagens de um único modelo em toda esta comparação.
• Você precisa que uma resposta seja honesta em vez de confiante. Uma taxa de alucinação de 30,3% contra 50,9% do Gemini é um tipo diferente de produto.
• Licenciamento ou residência de dados exclui uma API fechada, ou você precisa fazer ajuste fino com seus próprios dados.
• Você quer uma conta por token de um quarto da do Gemini e aceita que vai gastar a diferença em tokens de raciocínio — o índice custa o mesmo para rodar nos dois.
• Você está preparado para ajustar reasoning_effort para baixo em relação ao seu xhigh que é o padrão, em vez de entregá-lo como está.
O que não conseguimos verificar
Para que conste, e porque uma página de comparação só vale o que valem suas lacunas: nenhuma avaliação independente foi publicada para o Qwen3.8-27B com esforço de raciocínio reduzido, então seu trade-off entre velocidade e qualidade nos níveis médio e baixo não foi medido. Não existe pontuação de recall de contexto longo para a configuração de 1M estendida com YaRN. O Gemini 3.1 Pro não tem pontuação normalizada GDPval-AA publicada, e o Qwen3.8-27B não tem nenhuma para τ²-Bench, IFBench ou ITBench-SRE. E ninguém — incluindo o Google — disse por que o Gemini 3.1 Pro saiu do seletor do AI Studio em 18 de setembro. Atualizaremos esta página quando qualquer um desses pontos mudar.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
