
Qwen3.8-27B vs Qwen 3.8: Mesma geração, uma GPU versus um rack
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Esta semana, a Alibaba colocou o Qwen3.8-27B na via de inferência rápida da Cerebras — a primeira vez que o modelo denso de 27B tem uma opção hospedada genuinamente rápida — e a Artificial Analysis finalmente indexou os dois lados desse confronto. O Qwen3.8-27B obtém 34 no AA Intelligence Index. O Qwen 3.8, ou seja, o núcleo aberto que a maioria das pessoas quer dizer quando escreve o nome sem sufixo, obtém 40. Esses dois números redefinem uma comparação que a cobertura do lançamento de agosto teve de fazer inteiramente com base na palavra do fornecedor.
O modelo por trás de "Qwen 3.8" como um nome independente é o Qwen3.8-2.4T-A95B: os pesos de mistura de especialistas de 2,4 trilhões de parâmetros que a Alibaba publicou sob uma licença personalizada. O Qwen3.8-27B é o membro denso da mesma geração — cerca de 27 bilhões de parâmetros, Apache 2.0, dimensionado para uma única GPU. Eles compartilham o nome da família, o comprimento de contexto nativo de 262K e uma janela de lançamento. Todo o resto sobre eles é um estudo de opostos: um você pode possuir, o outro você só pode alugar. Aqui está para que cada um realmente serve agora que ambos têm números independentes.
A mesma geração, formas opostas
Qwen3.8-27B é um modelo denso — 27B parâmetros (28B contando o codificador de visão), 64 camadas, uma pilha de atenção híbrida com 48 camadas de atenção linear Gated DeltaNet contra 16 camadas de atenção completa. É por causa desse híbrido que um 27B consegue carregar 262.144 tokens de contexto nativo. Qwen3.8-2.4T-A95B é a arquitetura carro-chefe: 2,4T parâmetros totais, cerca de 95B ativos por token, 92 camadas com 512 especialistas por camada, e 69 dessas 92 camadas em atenção linear. Mesmo truque, noventa vezes o tamanho.
• Arquitetura — Qwen3.8-27B: 27B denso, cada token ativa todo ele. Qwen3.8-2.4T-A95B: 2,4T no total / ~95B ativos em MoE.
• Contexto — ambos têm 262K nativos; a extensão de 1M do 27B é exclusiva da versão hospedada, o 2.4T chega a ~984K medidos.
• Entrada — Qwen3.8-27B: texto, imagem e vídeo. Qwen3.8-2.4T-A95B: somente texto; raciocínio fixado em ativado.
• Licença — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Licença personalizada Qwen3.8-Max.
• Pesos — Qwen3.8-27B: 55,6GB BF16, quantiza para uma build Q4 de ~16GB. Qwen3.8-2.4T-A95B: ~2,4TB BF16, um rack de GPU, não um desktop.
• Onde você os encontra — Qwen3.8-27B: auto-hospedado ou alugado barato. Qwen3.8-2.4T-A95B: alugado, porque ninguém sensato possui o rack.
Números independentes, finalmente
Todo artigo de comparação de agosto sobre o Qwen3.8-27B trazia a mesma ressalva: "ainda não há pontuações independentes". Isso já não é verdade. A Artificial Analysis tem ambos os modelos medidos nesta semana, e o formato dos dados é genuinamente interessante.
No Intelligence Index, o Qwen3.8-2.4T-A95B obtém 40, ficando em 4º de 113 em sua classe. O Qwen3.8-27B obtém 34 — o que o coloca em primeiro de 140 modelos em sua classe de tamanho de 4–40B com pesos abertos, um desempenho genuinamente forte para um 27B denso. Ambos são lentos segundo medição independente: 39,0 tokens de saída por segundo para o 27B e 38,1 para o 2.4T, contra uma mediana da classe em torno de 90. Ambos são verbosos, com o 27B gerando cerca de 200M tokens de saída ao longo das execuções do índice, contra uma mediana de classe de 68M. Nenhum dos dois é um modelo de fronteira de destaque; ambos são cavalos de batalha, e o índice diz que o 2.4T é o cavalo de batalha mais forte por uma margem clara.

A precificação do lado independente conta a mesma história em dólares. A Artificial Analysis precifica o 27B em US$ 0,50 por milhão de entrada e US$ 3,00 por milhão de saída na versão hospedada do Qwen Cloud (desconto de cache de 90%), e o 2.4T em US$ 2,00 / US$ 6,00 (desconto de cache de 88%). Custo por tarefa do Intelligence Index: US$ 0,82 para o 27B contra US$ 2,16 para o 2.4T. O modelo menor é mais barato de executar por unidade de inteligência — e ambos são caros em relação à sua classe de velocidade porque ambos são modelos de raciocínio que queimam tokens de saída.
Todo o resto — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 para o 27B; os 86,6 do Terminal-Bench 2.1 e os 67,7 de SWE-bench Pro do 2.4T — permanece relatado pelo fornecedor, não reproduzido e rotulado como tal ao longo deste artigo. Os índices AA acima são o piso independente por baixo de tudo isso.
O que a listagem da Cerebras muda
Em 12 de setembro de 2026, a conta da Qwen anunciou que o Qwen3.8-27B agora roda na Cerebras, com sua entrada de catálogo no ar sob o banner “Qwen 3.8 27B já está disponível no Cerebras PayGo”. A Cerebras o lista a US$ 0,99 por milhão de tokens de entrada e US$ 1,49 por milhão de tokens de saída no hardware da classe WSE que consagrou a empresa pela velocidade. Isso dá ao 27B algo que o núcleo 2.4T nunca teve: uma via rápida.

Isso importa porque lento e verboso foi a única crítica real ao 27B desde o primeiro dia. No harness independente, ele faz 39 t/s; na nossa própria telemetria de serving, vem fazendo ~154 tokens de saída por segundo, com uma latência p50 para o primeiro token de 4,48s — e agora um segundo provedor está competindo nesse mesmo eixo. O 2.4T, em contrapartida, não tem via rápida alguma: a 38 t/s, você paga preços de fronteira por uma velocidade mediana, e a única forma de contornar isso é um cluster de GPU alugado no qual você mesmo roda os pesos abertos.
Três faixas para o 27B, uma para o 2.4T
A partir de hoje, o dense 27B está disponível para aluguel de três maneiras, e a diferença de preços vale a pena ser lida antes de você escolher:
• Via auto-hospedada — Qwen3.8-27B já está no ar no OrcaRouter a $0.33 / $2.40 por milhão, executado na nossa própria infraestrutura. Entrada mais barata do mercado para ele, ~154 tok/s de saída, contexto de 262K.
• Via do fornecedor — o build hospedado do Qwen Cloud, $0,50 / $3,00 por milhão, com contexto de 1M de tokens e 90% de desconto em cache.
• Via rápida — Cerebras PayGo, $0.99 / $1.49 por milhão, posicionado pela velocidade, e não pelo preço.

O núcleo aberto 2.4T não tem spread equivalente. A API carro-chefe que atende a mesma arquitetura — Qwen3.8-Max — custa US$ 2,00 / US$ 6,00 por milhão, e esse é o número que se mantém quer você o chame de Max ou de núcleo aberto. Execute os pesos em vez disso e a economia vira uma questão de hardware: o 2.4T precisa de ~2,4 TB de pesos BF16 e de um nó multi-GPU, uma decisão de capital que ninguém toma de ânimo leve. Uma GPU de 24 GB roda a build Q4 do 27B a um custo marginal que se arredonda para zero.
O exemplo prático que decide a maioria das equipes: 100M de tokens de entrada e 20M de tokens de saída por dia. Com a tarifa de $2/$6 do 2.4T, isso dá cerca de $320 por dia, ~$117.000 por ano. Com o 27B, à nossa tarifa de $0,33/$2,40, isso dá cerca de $81 por dia — e, na cópia auto-hospedada, é o preço da energia elétrica. O 2.4T oferece uma vantagem real de qualidade, AA 40 contra 34. Se essa vantagem vale uma fatura mensal de cinco dígitos é a questão central que este pareamento levanta.
Onde eles divergem verdadeiramente
Além do índice, três diferenças práticas decidem qual deles se adequa a uma determinada carga de trabalho.
A entrada multimodal é o filtro mais limpo. O Qwen3.8-27B lê texto, imagens e vídeo — capturas de tela, gráficos, documentos com figuras, quadros de vídeo, tudo entra na mesma janela de 262K. O Qwen3.8-2.4T-A95B é agressivamente somente texto. Se a sua entrada incluir qualquer coisa visual, o 2.4T é desqualificado, independentemente do seu índice mais alto.
O controle de pensamento vem em segundo lugar. O modo de raciocínio do 27B pode ser desativado por requisição, o que importa para extração sensível à latência, em que uma cadeia de pensamento é pura sobrecarga; ele também expõe reasoning_effort. O núcleo 2.4T não consegue desativar o pensamento — toda resposta começa com um bloco think>, e você paga por esses tokens quer os quisesse ou não. A API principal corrige isso, mas o núcleo aberto não.
O licenciamento vem em terceiro lugar e, discretamente, importa em escala. O Apache 2.0 no 27B é o padrão permissivo: modificar, redistribuir, comercializar, com concessão de patente incluída. O 2.4T é distribuído sob uma licença personalizada Qwen3.8-Max — permissiva em espírito, mas são os termos da Alibaba, não um padrão da comunidade, e vale a pena ler o arquivo antes de construir um produto sobre ele.
Encaminhando a decisão
Ambos os lados deste confronto podem ser acessados por meio de uma única chave OrcaRouter, e é isso que torna a pergunta "qual eu escolho" barata de responder empiricamente. O Qwen3.8-27B já está disponível como qwen/qwen3.8-27b pelo preço de tabela do provedor, sem nenhuma margem, e a API principal, construída sobre o mesmo núcleo de 2,4T, já está disponível como qwen/qwen3.8-max a US$ 2,00 / US$ 6,00 por milhão — a própria tarifa da Alibaba, repassada diretamente, de modo que qualquer mudança de preço do fornecedor entra em vigor aqui no mesmo dia.
Essa mesma arquitetura 2.4T como pesos baixáveis não é algo que nós servimos — se você quer o núcleo aberto via API hoje, a rota carro-chefe é o caminho prático para chegar até ele, e qwen/qwen3.8 já vem pré-configurado para ser ativado no momento em que um provedor servir os pesos abertos. Uma regra de roteamento que envia o tráfego visual e sensível à latência para qwen/qwen3.8-27b e a cauda de raciocínio pesado para qwen/qwen3.8-max não custa nada para configurar e faz failover automaticamente entre provedores. Uma chave só, nenhum segundo contrato, e a divisão é uma mudança de configuração em vez de uma re-arquitetura — a maneira mais barata de testar se os seis pontos de índice extras do 2.4T valem US$ 5,67 por milhão de tokens de saída para você.
Quem deve escolher qual
• Escolha o Qwen3.8-27B se a sua entrada incluir imagens ou vídeo, se você quiser um raciocínio que possa ser desativado, se você tiver uma GPU de 24 GB ou pretende ter uma, ou se o seu gasto por token tiver volume suficiente para que $0.33/$2.40 versus $2.00/$6.00 seja todo o argumento.
• Escolha o Qwen 3.8 (o núcleo de 2,4T) se você trabalha apenas com texto, quer o número de raciocínio independente mais forte da família (AA 40) e a tarifa de $2/$6 — ou o custo de operar um nó de GPU — cabe tranquilamente no seu orçamento.
• Escolha os dois se o seu tráfego abrange os dois perfis: encaminhe pelo gateway, deixe o roteador dividir por modalidade e dificuldade, e mude de ideia quando o próximo checkpoint ou o preço de qualquer um dos modelos for anunciado.
O veredito
O nome Qwen 3.8 sempre foi dois produtos fingindo ser uma única família, e agora ambos têm números independentes para se discutir. O Qwen3.8-2.4T-A95B é o cérebro mais forte, somente texto, caro e inegavelmente rentável a $2/$6. O Qwen3.8-27B é o que pode ser implantado — multimodal, Apache 2.0, auto-hospedável e, a partir desta semana, finalmente também tem uma via rápida. A diferença de índice é real: 40 contra 34. A diferença de preço também é: cerca de cinco vezes o custo por token quando você roda o 2.4T como uma API. Para a maioria das equipes, a decisão não é sobre os seis pontos de índice. É sobre se você está comprando tokens ou comprando hardware — e o 27B é o único dos dois que permite comprar o hardware.
