Gemini 3.5 Flash-Lite vs Qwen 3.8: Cavalo de batalha barato vs Carro-chefe 2.4T
Guides & Insights

Gemini 3.5 Flash-Lite vs Qwen 3.8: Cavalo de batalha barato vs Carro-chefe 2.4T

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Quando esta comparação foi escrita pela primeira vez, estava desequilibrada de uma forma incomum: Gemini 3.5 Flash-Lite era um produto real e comprável e Qwen 3.8 era uma prévia restrita sem preço, sem benchmark e sem pesos. Havia muito pouco para comparar.

Essa não é mais a situação. A Qwen3.8-Max alcançou disponibilidade geral em 3 de agosto de 2026 com uma tabela de preços publicada de US$ 2 / US$ 6 por milhão de tokens, um endpoint compatível com OpenAI e DashScope e uma tabela completa de benchmarks. É self-service, orçável e está no ar — inclusive no OrcaRouter. Portanto, este artigo foi reescrito do zero, porque a comparação honesta hoje não é "modelo em produção versus vapor". É uma genuína comparação de níveis: o burro de carga de alta produtividade mais barato do Google contra o maior carro-chefe da Alibaba.

Uma nota para desenvolvedores — esses dois estão em extremos opostos da curva de custo, então a pergunta certa é em qual camada a sua carga de trabalho se encaixa. O OrcaRouter disponibiliza mais de 200 modelos por trás de um único endpoint compatível com OpenAI, para que você possa testar ambos na mesma tarefa sem precisar integrar dois SDKs.

Veredito TL;DR.Esses modelos não estão realmente competindo — eles respondem a perguntas diferentes. Flash-Liteé um modelo de eficiência: Artificial Analysis Index 36, $0.30 / $2.50por 1M, aproximadamente 490 tokens/seg, amplamente disponível. Ele é feito para rodar em cada requisição com custo desprezível. Qwen3.8-Maxé um carro-chefe: ~2,4T de parâmetros, um contexto de 1M de tokens com tarifa fixa, entrada nativa de imagem e vídeo, e pontuações auto-relatadas de nível de fronteira (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — a $2 / $6, o que é 6,7× a taxa de entrada do Flash-Lite. Flash-Lite é a escolha padrão ideal para classificação, roteamento e extração em alto volume. Qwen3.8-Max é para onde você escala quando uma tarefa realmente precisa de raciocínio de fronteira, um milhão de tokens de contexto ou entrada não textual. A única ressalva que não mudou: Qwen ainda não tem pontuação independente em benchmarks.

Principais conclusões

Qwen 3.8 agora está disponível ao público — desde 3 de agosto de 2026, foram publicados preços, acesso autoatendido e uma tabela de benchmarks. A visão anterior de uma prévia restrita e sem verba prevista está obsoleta.

Flash-Lite é dramaticamente mais barato: $0.30 / $2.50 por 1M contra os da Qwen, $2 / $6 — cerca de 6,7× na entrada e 2,4× na saída.

Flash-Lite é muito mais rápido: aproximadamente 490 tokens/sec, construído para trabalhos de alto rendimento. O Qwen3.8-Max mostra um tempo p50 até o primeiro token de 1,64s na telemetria de 7 dias do OrcaRouter, mas é um modelo grande e completo.

Flash-Lite tem a única pontuação auditada: Artificial Analysis Index 36. Qwen3.8-Max permanece sem pontuação por todos os avaliadores independentes, embora a Alibaba agora publique seus próprios números.

Qwen vence decisivamente na superfície de capacidades: um contexto de 1M tokens com preço fixo sem sobretaxa para prompts longos, além de entrada de texto/imagem/vídeo e OmniDocBench 1.5 92.1 para parsing de documentos. Flash-Lite é um pequeno modelo de eficiência.

Pesos abertos: os da Qwen são prometidos para esta semana (ainda sem licença), além de um Qwen3.8-27B supostamente rodando em ~17GB de VRAM. O Flash-Lite está encerrado permanentemente.

Nota de precisão: todos os números de qualidade do Qwen3.8-Max são reportados pela Alibaba e não verificados por terceiros. Os números do Gemini 3.5 Flash-Lite vêm da Artificial Analysis. O preço do Qwen corresponde à tabela de preços GA do Alibaba Model Studio e substitui o acesso da era de pré-visualização descrito em versões anteriores deste artigo.

Especificações e preço, lado a lado

• Fabricante / status — Flash-Lite: Google; geralmente disponível; Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026)

• Posicionamento — Flash-Lite: camada de eficiência barata e de alto throughput; Qwen3.8-Max: carro-chefe / ambição de fronteira

• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Ainda sem pontuação

• Pontuações relatadas pelo fornecedor — Flash-Lite: a classificação é medida por terceiros; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (todos relatados pela Alibaba)

• Preço (por 1M, entrada / saída) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, preço fixo para contexto de 1M; entrada em cache $0.25

• Velocidade — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1,64s (Telemetria de 7 dias do OrcaRouter)

• Contexto — Flash-Lite: contexto de nível de eficiência; Qwen3.8-Max: 1M tokens (983.616 com pensamento; saída máxima 131.072)

• Modalidade — Flash-Lite: modelo de eficiência focado em texto; Qwen3.8-Max: entrada de texto, imagem e vídeo → saída de texto

• Pesos — Flash-Lite: fechado, somente API; Qwen3.8-Max: prometido para esta semana, sem licença ainda

• Acesse hoje — Flash-Lite: API padrão, autoatendimento; Qwen3.8-Max: API padrão, autoatendimento (Model Studio, DashScope, OrcaRouter)

Apresentado desta forma, a constatação é completamente diferente do que costumava ser. A coluna da Qwen não está mais em branco — está completa, e em várias linhas ela é a entrada mais forte. O que substitui o antigo enquadramento de "quantidade conhecida versus promessa" é uma clara diferença de níveis: Flash-Lite é cerca de 6,7× mais barato em entrada e aproximadamente 13× mais rápido em termos de throughput, enquanto a Qwen oferece um contexto multimodal de um milhão de tokens e raciocínio alegado de nível de ponta.Ambos são produtos legítimos; servem apenas a propósitos diferentes.

A única linha em que a antiga ressalva ainda se aplica é a linha de benchmark. O Índice 36 do Flash-Lite foi medido pela Artificial Analysis em um ranking público. Todos os números do Qwen — GPQA Diamond 92,6, Terminal-Bench 86,6 e o restante — foram produzidos pela Alibaba em sua própria plataforma de testes. Isso é uma melhoria real em relação a não publicar nada, mas não é verificação de terceiros, e os laboratórios publicam os benchmarks em que vencem.

Índice 36 contra um carro-chefe sem pontuação: lendo isto honestamente

É tentador comparar o Índice 36 do Flash-Lite com o GPQA Diamond 92.6 do Qwen e declarar uma goleada. Isso seria um erro de categoria em dobro.

Primeiro, o Artificial Analysis Intelligence Index é um composto que abrange muitas tarefas; o GPQA Diamond é um único teste de ciência em nível de pós-graduação. Eles não estão na mesma escala e não podem ser subtraídos um do outro.

Em segundo lugar, e mais importante, o Flash-Lite nunca foi projetado para obter pontuações altas. Um Índice de 36 é o que se espera de um modelo de eficiência. O objetivo de engenharia do Google era um modelo barato e rápido o suficiente para ser colocado diante de cada solicitação recebida — roteamento de tickets, classificação, extração, sumarização em grande volume — onde um modelo de fronteira seria economicamente absurdo. Avaliá-lo contra um carro-chefe de 2,4T em termos de teto de raciocínio não capta para que ele serve.

O que podemos dizer é mais restrito e mais útil. Qwen3.8-Max é muito provavelmente o modelo substancialmente mais capaz — seus números autorrelatados estão muito acima do que um modelo Index-36 produziria, e o salto do FrontierSWE para 73,5, ante os 40,7 do predecessor, sugere progresso real. Mas "muito provavelmente" continua sendo uma inferência, porque nenhum avaliador independente o pontuou. Para contextualizar, o predecessor Qwen3.7-Max obteve 46 no AA Index — superior aos 36 do Flash-Lite, mas muito aquém do nível frontier — portanto, o salto geracional implícito da Alibaba é grande e não verificado.

A consequência prática: se a sua tarefa é uma que o Flash-Lite já conclui corretamente, o teto mais alto do Qwen não vale nada para você e você estaria pagando 6,7× por isso. O teto só importa quando o Flash-Lite está de fato falhando.

Custo na prática: a lacuna entre níveis em números

Considere uma tarefa de classificação de alto volume: 2.000 tokens de entrada, 200 tokens de saída, executada 500.000 vezes por dia — um formato realista de triagem de suporte ou roteamento de conteúdo.

Flash-Lite: por chamada, 0.002M × $0.30 = $0.0006, mais 0.0002M × $2.50 = $0.0005. ≈ $0.0011 por chamada → ~$550/dia.

Qwen3.8-Max: por chamada, 0,002M × $2 = $0,004, mais 0,0002M × $6 = $0,0012. ≈ $0,0052 por chamada → ~$2.600/dia.

• Mensal: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — uma diferença de $61,500 para o mesmo volume de tarefas.

Nessa escala, a escolha do nível é o maior item individual no sistema, e é muito difícil justificar um carro-chefe para um trabalho que um modelo de eficiência resolve. É exatamente para esse cenário que o Flash-Lite existe.

Agora inverta. Considere uma tarefa de documento longo: 600.000 tokens de contexto, 5.000 tokens de saída, 200 vezes por dia.

Qwen3.8-Max: 0,6M × $2 = $1,20, mais 0,005M × $6 = $0,03. ≈ $1,23 por chamada, sem sobretaxa de prompt longo — e aproximadamente $0,18 se o contexto for armazenado em cache a $0,25/1M.

Flash-Lite não pode ser precificado para este formato de forma alguma, porque um contexto de chamada única de 600.000 tokens não é algo que um modelo de nível de eficiência foi projetado para suportar.

Portanto, a resposta muda completamente com o formato da carga de trabalho, que é a verdadeira lição. Flash-Lite vence trabalhos de alto volume e contexto curto por uma margem enorme. Qwen vence qualquer coisa que exija um milhão de tokens ou entrada não textual, onde Flash-Lite não é uma opção mais barata, mas simplesmente não é uma opção.

Cenários: qual nível se encaixa

Triagem e roteamento de suporte em volume. Flash-Lite, claramente. Índice 36 é suficiente para classificação, e a cerca de $0.0011 por chamada você pode executá-lo em todos os tickets. Escale apenas a minoria ambígua para um modelo maior.

Análise de documento inteiro, seja contrato ou registro. Qwen3.8-Max. O contexto de 1M com tarifa fixa significa que um documento de 400 páginas é processado em uma única chamada, sem sobretaxa e sem divisão em blocos, e sua pontuação autodeclarada de 92,1 no OmniDocBench 1.5 tem como alvo exatamente esse trabalho.

Pipelines de captura de tela, gráficos ou vídeo.Qwen3.8-Max, por padrão — aceita entrada de imagem e vídeo e reporta OSWorld-Verified 86.1 ao operar uma GUI real. Flash-Lite não é um candidato para entrada não textual.

Codificação agêntica. Qwen3.8-Max nos números alegados (Terminal-Bench 2.1 86,6, FrontierSWE 73,5), com a ressalva de que nenhum deles é verificado de forma independente e sua pontuação auto-relatada mais fraca é IFBench 82,8 em seguir instruções — um risco real para pipelines que analisam a saída de cada etapa.

Uma arquitetura de duas camadas. Muitas vezes a resposta correta é ambas: Flash-Lite como a primeira passagem barata em cada solicitação, Qwen3.8-Max como o caminho de escalada para a pequena fração que precisa de um milhão de tokens, uma imagem ou raciocínio genuíno. Esse padrão captura a maior parte da vantagem de custo do Flash-Lite enquanto mantém uma opção de fronteira disponível.

Auto-hospedagem e abertura

O Flash-Lite é fechado e exclusivamente via API, permanentemente — não existe opção de autohospedagem.

Os pesos do Qwen3.8-Max estão prometidos para esta semana, mas o carro-chefe não é um alvo realista: aproximadamente 1.2TB em 4 bits em comparação com cerca de 141GB por H200 significa oito ou mais aceleradores de ponta, e a Alibaba ainda não divulgou a contagem de parâmetros ativos, portanto o rendimento que esse gasto compraria é impossível de modelar. Também ainda não há texto de licença, o que significa que a usabilidade comercial está formalmente indeterminada.

O simultaneamente anunciado Qwen3.8-27B é o lançamento que realmente importa para planos on-premise. Também adotando pesos abertos e, segundo relatos, rodando em cerca de 17GB de VRAM, é uma opção genuína de auto-hospedagem — e, notavelmente, um concorrente muito mais próximo do nicho de eficiência do Flash-Lite do que o carro-chefe de 2,4T é.

Perguntas Frequentes

Posso usar o Qwen 3.8 hoje?

Sim. O Qwen3.8-Max atingiu disponibilidade geral em 3 de agosto de 2026 com preços publicados de US$ 2 / US$ 6 por 1 milhão de tokens e um endpoint compatível com OpenAI e DashScope. Ele é autoatendido via Alibaba Model Studio, DashScope e OrcaRouter. Versões anteriores deste artigo descreviam uma prévia restrita; isso está desatualizado.

Qual é mais barato?

Gemini 3.5 Flash-Lite, por ampla margem: $0.30 / $2.50 por 1M contra $2 / $6 do Qwen3.8-Max — cerca de 6.7× mais barato na entrada e 2.4× na saída. Em trabalhos de alto volume com contexto curto, essa diferença domina todas as outras considerações.

Qual é melhor?

São níveis diferentes. Flash-Lite tem a única pontuação auditada (AA Index 36), mas foi construído para throughput barato, não para raciocínio. Qwen3.8-Max é, com toda probabilidade, muito mais capaz — seus resultados auto-relatados de 92.6 no GPQA Diamond e 86.6 no Terminal-Bench 2.1 têm formato de fronteira — mas ele não tem benchmark independente, então isso permanece uma inferência em vez de um resultado medido.

Qual é mais rápido?

Flash-Lite, substancialmente. A Artificial Analysis mede aproximadamente 490 tokens/segundo, que é o objetivo do seu design de nível de eficiência. O Qwen3.8-Max apresenta um p50 de tempo até o primeiro token de 1,64 segundos na telemetria de 7 dias do OrcaRouter, mas é um modelo grande e completo, e os avaliadores da era de pré-visualização o consideraram lento em builds agênticos longos.

O Qwen 3.8 já tem pesos abertos agora?

Ainda não. A Alibaba diz que os pesos do modelo carro-chefe chegam dentro da semana, mas ainda não há licença, model card ou repositório. Mesmo após o lançamento, um modelo de 2,4T precisa de oito ou mais GPUs da classe H200. O Qwen3.8-27B, anunciado simultaneamente, com cerca de 17GB de VRAM, é a opção prática para self-hosting.

Devo usar os dois?

Frequentemente sim. Uma configuração em duas camadas — Flash-Lite como a primeira passagem de baixo custo em cada solicitação, Qwen3.8-Max como a via de escalada para tarefas de contexto longo, multimodais ou genuinamente difíceis — mantém a maior parte da vantagem de custo do Flash-Lite enquanto oferece uma opção de ponta onde ela justifica seu preço.

Qual devo escolher para produção hoje?

Flash-Lite para trabalho de alto volume, contexto curto e somente texto, onde o Index 36 é suficiente — é barato, rápido, auditado e comprovado. Qwen3.8-Max quando a carga de trabalho precisa de um contexto de um milhão de tokens, entrada de imagem ou vídeo, ou raciocínio em que o Flash-Lite comprovadamente falha. Ambos agora são genuinamente implantáveis, o que não era verdade quando esta comparação foi escrita originalmente.

Conclusão

Gemini 3.5 Flash-Lite vs Qwen 3.8costumava ser uma comparação entre um produto e um anúncio. Não é mais. Desde 3 de agosto de 2026, o Qwen3.8-Max está geralmente disponível, com preço definido, autosserviço e documentação — portanto, o enquadramento honesto é uma decisão de nível, e não de prontidão.

Flash-Lite continua sendo o padrão correto para o trabalho para o qual foi criado: a US$ 0,30 / US$ 2,50 e ~490 tokens/seg, ele roda em toda requisição por um erro de arredondamento, e seu Índice 36 auditado é totalmente adequado para classificação, roteamento e extração. Qwen3.8-Max é o nível de escalada — um contexto de um milhão de tokens com tarifa fixa, entrada nativa de imagem e vídeo e alegado raciocínio de fronteira — a cerca de 6,7× o custo de entrada. Sua única fraqueza não resolvida é a mesma de antes: nenhum avaliador independente o pontuou, então seu caso de qualidade depende da tabela da própria Alibaba. Fique atento à primeira pontuação independente do Intelligence Index e aos pesos do Qwen3.8-27B, que competirão muito mais diretamente com o nicho do Flash-Lite. Nesse meio tempo, escolha pelo formato da carga de trabalho — e considere executar ambos.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube