Qwen3.8-Flash-Next vs Qwen3.8-27B — o MoE Qwen4-preview contra o cavalo de batalha de pesos abertos. Ilustração regenerada.
Guides & Insights

{{1}}Qwen3.8-Flash-Next{{/1}} vs {{2}}Qwen3.8-27B{{/2}}: o MoE {{3}}Qwen4-preview{{/3}} contra o cavalo de batalha de pesos abertos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O que surpreende no Qwen3.8-Flash-Next não é que a Alibaba afirme que um modelo que ativa apenas {{1}}6 bilhões de parâmetros por token{{/1}} supera a maior parte dos modelos abertos — é que servi-lo exige mais memória do que o {{2}}modelo denso de 27 bilhões de parâmetros{{/2}} com o qual está sendo comparado. O Qwen3.8-Flash-Next, lançado como código aberto em 26 de agosto de 2026 como prévia da arquitetura Qwen4, mantém uma tabela de consulta N-gram de {{3}}51 bilhões de parâmetros{{/3}} na RAM do sistema em vez da VRAM; o Qw​en3.8-27B, o modelo denso multimodal Apache-2.0 que foi lançado em meados de agosto e é o cavalo de batalha de pesos abertos da geração atual Qw​en 3.8, cabe em uma única {{4}}placa gráfica de 24GB em 4 bits{{/4}}. Na planilha de benchmarks da própria Alibaba, o novo MoE supera o 27B em {{5}}21 dos 22 benchmarks comparados{{/5}}. Em evidências independentes — colocações em arena, um estudo de agente jurídico, medições de throughput de terceiros — o 27B é o único dos dois que possui alguma. Essa combinação é toda a decisão.

O confronto em uma linha: dois modelos de peso aberto, com texto e visão, da mesma geração, mesmo contexto nativo de 262K, ambos projetados para rodar fora de um datacenter — e separados por arquitetura, por licença, por preço e por quanto de sua história é verificada. Qwen3.8-Flash-Next é o MoE esparso que antecipa tudo o que se espera que o Qwen4 herde. Qwen3.8-27B é o modelo denso que comprime o que a Alibaba aprendeu ao construir o carro-chefe de 2.4T em algo que uma única GPU pode rodar. Escolher entre eles é menos sobre capacidade — a Alibaba diz que o preview está à frente — e mais sobre se você confia em uma ficha técnica de fornecedor de um dia em vez de um modelo que já foi dissecado pela comunidade.

O placar

Primeiro, a fonte: todos os números do Qwen3.8-Flash-Next abaixo são da própria Alibaba, publicados há apenas um dia e não reproduzidos. As principais alegações de benchmark do Qw​en3.8-27B também são relatadas pela Alibaba, mas o 27B apresenta resultados independentes — colocações em arena de preferência humana, um estudo de domínio jurídico e medições de throughput da AMD — que o preview não consegue igualar.

• Parâmetros totais — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B armazenados), 6B ativos. Qw​en3.8-27B: ~27B densos (28B com codificador de visão), todos ativos.

• Arquitetura — Qwen3.8-Flash-Next: prévia do Qwen4 — Qwen Sparse Attention alternando com Gated DeltaNet, residual com gate, embeddings N-gram, treinado com Muon. Qwen3.8-27B: 48 camadas de atenção linear GDN mais 16 camadas de atenção completa (3:1), denso.

• Contexto — ambos com 262.144 tokens nativos, extensíveis para 1M via YaRN.

• Modalidade — ambos aceitam entrada de texto, imagem e vídeo e retornam texto.

• Licença — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.

• Preço — Qwen3.8-Flash-Next: $0,16 / $0,47 por 1M (anunciado; API de produção ainda não aberta). Qwen3.8-27B: $0,33 / $2,40 por 1M, já disponível hoje.

• Pegada de execução — Qwen3.8-Flash-Next: tabela de 51B na RAM do host, ~96GB de memória do sistema além de qualquer GPU; FP8 ~186GB, Q4 GGUF ~82GB. Qw​en3.8-27B: BF16 ~55.6GB, 4-bit cabe em uma placa de 24GB.

• Evidência independente — Qwen3.8-Flash-Next: nenhuma ainda. Qw​en3.8-27B: #1 modelo aberto no Arena.ai Image-to-WebDev, #9 geral no Code Arena WebDev, #1 em pesos abertos no benchmark Harvey's Legal Agent, throughput medido pela AMD.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

Nos próprios números da Alibaba, a prévia vence quase tudo.

A comparação publicada pela Alibaba dá ao Qwen3.8-Flash-Next pontuações iguais ou superiores em 21 de 22 benchmarks de linguagem e visão frente ao Qw​en3.8-27B, e as vitórias não são cosméticas. SWE-bench Pro 62,5 contra 61,7 é uma vantagem marginal, mas DeepSWE 58,7 contra 42,2, JobBench 55,7 contra 33,4 e CoWorkBench 73,9 contra 70,7 são diferenças reais exatamente nas cargas de trabalho agênticas e de escritório às quais o nível flash se destina. Os números de destaque da prévia — LiveCodeBench v6 91,9, GPQA Diamond 91,7, MathVision 95,7 — também superam as linhas correspondentes do 27B na tabela da Alibaba. Esta é a tese do lançamento expressa em dados: a maior parte da capacidade de raciocínio e codificação da maior linha Qw​en 3.8, a uma fração do poder computacional ativo.

Mantenha o rótulo anexado a essa frase. Estas são avaliações da própria Alibaba, da própria estrutura de testes da Alibaba, com um dia de idade no caso da prévia e não replicadas em ambos os casos. A análise da arquitetura KGP Talkie que ranqueia para este confronto chega à mesma forma de conclusão, mas está trabalhando a partir da mesma ficha técnica do fornecedor. Uma tabela do fornecedor é uma promessa; nada neste parágrafo foi confirmado de forma independente.

O que o 27B tem que o Flash-Next não tem: evidência

É aqui que o confronto deixa de ser desigual. O Qw​en3.8-27B está exposto há duas semanas, e a comunidade produziu três pontos de dados independentes. No leaderboard Image-to-WebDev do Arena.ai — votos cegos de humanos sobre qual das duas saídas anonimizadas um espectador preferiria colocar em produção — o 27B ocupa a 1ª posição entre os modelos abertos e a 7ª geral, com uma pontuação relatada de 1.574. No board irmão Code Arena WebDev, ele fica em 9º lugar geral com 1.595, o único modelo da sua classe de tamanho entre os dez primeiros. Harvey, a empresa de IA jurídica, e Engram realizaram um estudo sintético de escritório de advocacia que colocou um 27B adaptado no topo do seu benchmark de agente jurídico — com a ressalva de que o modelo havia estudado o corpus de teste anteriormente, o que faz disso uma demonstração do potencial de fine-tuning, e não uma pontuação para os pesos originais. A AMD publicou medições de throughput do Dia 0: 24,5 tokens/s em um Ryzen AI Max+ 395 e 51,8 tokens/s em uma Radeon AI PRO R9700. Nenhuma dessas é uma pontuação de qualidade de propósito geral — ainda não há índice Artificial Analysis para o 27B —, mas cada uma vem de um terceiro que realmente executou o modelo.

Qwen3.8-Flash-Next não tem nada disso. Sua planilha inteira de benchmarks é da Alibaba, com poucas horas de existência no momento em que este texto foi escrito, e nenhum laboratório independente reproduziu uma única linha. Isso não é uma acusação; é a definição de um lançamento de um dia. Mas é exatamente a assimetria que deveria orientar a escolha: a prévia está à frente nos únicos números que existem, e cada um desses números foi escrito pelo fornecedor que quer que você acredite neles.

O fork de implantação

A diferença prática entre esses dois modelos é {{1}}onde os parâmetros residem{{/1}}, e ela {{2}}determina qual hardware você precisa{{/2}}. O Qwen3.8-Flash-Next {{3}}descarrega deliberadamente{{/3}} sua tabela de embeddings N-gram de 51B para a memória do host, onde ela pode ser {{4}}pré-buscada de forma assíncrona{{/4}} — é por isso que ele {{5}}adiciona 51B de parâmetros de capacidade sem adicionar computação por token{{/5}}. A consequência é que o modelo {{6}}não caberá{{/6}} em uma GPU de consumo com 24GB como um Qwen local cabia antes. {{7}}Estimativas da comunidade{{/7}} situam um Q4 GGUF em aproximadamente 82GB no total (cerca de 58GB de pesos principais mais a tabela de consulta de 24GB), a versão FP8 em torno de 186GB e a versão BF16 em torno de 360GB; {{8}}a receita que funciona{{/8}} é uma máquina com cerca de 96GB de RAM do sistema mais qualquer GPU que execute o 6B ativo. A vantagem é que a computação por token é barata — {{9}}toda a aposta da arquitetura{{/9}} — e o contexto longo de 1M de tokens {{10}}continua acessível{{/10}} porque as camadas GDN {{11}}comprimem o histórico em vez de aumentar o cache KV{{/11}}.

Qw​en3.8-27B é o modelo ao contrário: denso, então cada token executa todos os 27B parâmetros, mas pequeno o suficiente para que tudo caiba no hardware que você já possui. Os pesos BF16 têm aproximadamente 55,6 GB; em 4 bits, roda em uma placa de 24 GB, como uma RTX 3090 ou 4090, e as medições da AMD mostram que ele faz de 24,5 a 51,8 tokens/s em hardware da classe AI Max e Radeon PRO. Se a restrição for uma única estação de trabalho, o 27B é o que realmente cabe; se a restrição for o custo por token em escala, o Flash-Next é o que vence no papel.

A bifurcação de preços

Os preços da API contam a mesma história do outro lado. O Qw​en3.8-27B está no ar no OrcaRouter hoje a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, com o preço de tabela do provedor repassado sem margem alguma — a opção de autohospedagem ficou disponível para chamadas, sem precisar comprar GPU. O Qwen3.8-Flash-Next ainda não está roteado em lugar nenhum: os pesos abertos são o único caminho até o Qwen3.8-Flash de produção abrir na API QwenCloud aos preços anunciados de US$ 0,16/US$ 0,47. Quando essa API abrir, o mesmo repasse coloca o preço de US$ 0,16/US$ 0,47 do nosso lado no mesmo dia, na mesma chave do 27B, com failover automático entre eles — então a forma de adotar uma arquitetura de um dia não é apostar a produção nela, mas direcionar uma fatia do tráfego para ela com o modelo comprovado como fallback. Uma camada de roteamento também pode ficar à frente de um modelo que você mesmo hospeda, o que é o caminho prático para avaliar os pesos abertos do Flash-Next hoje sem uma segunda integração.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

Qual deles executar

Escolha o Qwen3.8-Flash-Next se você quiser seguir a direção do Qwen4 agora, se sua carga de trabalho for de volume alto o suficiente para que $0.16/$0.47 contra $0.33/$2.40 seja um número real, ou se você tiver RAM para auto-hospedá-lo e estiver confortável com uma ficha de fornecedor. Escolha o Qw​en3.8-27B se você precisar dos termos Apache-2.0, de uma única placa de 24GB, de um modelo que você possa usar hoje, ou de qualquer grau de evidência independente — ele é o único dos dois que já foi executado por alguém fora da Alibaba.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

As duas capturas acima são as faces públicas de cada metade: a listagem do OrcaRouter onde o Qw​en3.8-27B pode ser chamado hoje por $0.33/$2.40, e o cartão do modelo Qwen/Qwen3.8-Flash-Next no Hugging Face.

E a conclusão honesta é uma pergunta, porque a base de evidências tem apenas um dia: pode um modelo que ativa 6 bilhões de seus parâmetros manter uma varredura de 21 de 22 sob replicação independente, ou a tabela de N-gramas que o faz funcionar de forma enxuta é também a que falha em cargas de trabalho reais? O 27B já sobreviveu a duas semanas de escrutínio da comunidade. Flash-Next está onde o 27B estava há duas semanas — o que é o melhor argumento para rodá-los lado a lado em vez de escolher.