Um card de título hero para o confronto Qwen3.8-27B vs Qwen 3.8, mostrando dois cards de chip arredondados — o modelo denso de 27B com contexto de 262K e licença Apache 2.0 contra o núcleo MoE de 2,4T / 95B ativos com uma licença personalizada — e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Qwen3.8-27B vs Qwen 3.8: Mesma geração, uma GPU versus um rack

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esta semana, a Alibaba colocou o Qwen3.8-27B na via de inferência rápida da Cerebras — a primeira vez que o modelo denso de 27B tem uma opção hospedada genuinamente rápida — e a Artificial Analysis finalmente indexou os dois lados desse confronto. O Qwen3.8-27B obtém 34 no AA Intelligence Index. O Qwen 3.8, ou seja, o núcleo aberto que a maioria das pessoas quer dizer quando escreve o nome sem sufixo, obtém 40. Esses dois números redefinem uma comparação que a cobertura do lançamento de agosto teve de fazer inteiramente com base na palavra do fornecedor.

O modelo por trás de "Qwen 3.8" como um nome independente é o Qwen3.8-2.4T-A95B: os pesos de mistura de especialistas de 2,4 trilhões de parâmetros que a Aliba​ba publicou sob uma licença personalizada. O Qwen3.8-27B é o membro denso da mesma geração — cerca de 27 bilhões de parâmetros, Apache 2.0, dimensionado para uma única GPU. Eles compartilham o nome da família, o comprimento de contexto nativo de 262K e uma janela de lançamento. Todo o resto sobre eles é um estudo de opostos: um você pode possuir, o outro você só pode alugar. Aqui está para que cada um realmente serve agora que ambos têm números independentes.

A mesma geração, formas opostas

Qwen3.8-27B é um modelo denso — 27B parâmetros (28B contando o codificador de visão), 64 camadas, uma pilha de atenção híbrida com 48 camadas de atenção linear Gated DeltaNet contra 16 camadas de atenção completa. É por causa desse híbrido que um 27B consegue carregar 262.144 tokens de contexto nativo. Qwen3.8-2.4T-A95B é a arquitetura carro-chefe: 2,4T parâmetros totais, cerca de 95B ativos por token, 92 camadas com 512 especialistas por camada, e 69 dessas 92 camadas em atenção linear. Mesmo truque, noventa vezes o tamanho.

• Arquitetura — Qwen3.8-27B: 27B denso, cada token ativa todo ele. Qwen3.8-2.4T-A95B: 2,4T no total / ~95B ativos em MoE.

• Contexto — ambos têm 262K nativos; a extensão de 1M do 27B é exclusiva da versão hospedada, o 2.4T chega a ~984K medidos.

• Entrada — Qwen3.8-27B: texto, imagem e vídeo. Qwen3.8-2.4T-A95B: somente texto; raciocínio fixado em ativado.

• Licença — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Licença personalizada Qwen3.8-Max.

• Pesos — Qwen3.8-27B: 55,6GB BF16, quantiza para uma build Q4 de ~16GB. Qwen3.8-2.4T-A95B: ~2,4TB BF16, um rack de GPU, não um desktop.

• Onde você os encontra — Qwen3.8-27B: auto-hospedado ou alugado barato. Qwen3.8-2.4T-A95B: alugado, porque ninguém sensato possui o rack.

Números independentes, finalmente

Todo artigo de comparação de agosto sobre o Qwen3.8-27B trazia a mesma ressalva: "ainda não há pontuações independentes". Isso já não é verdade. A Artificial Analysis tem ambos os modelos medidos nesta semana, e o formato dos dados é genuinamente interessante.

No Intelligence Index, o Qwen3.8-2.4T-A95B obtém 40, ficando em 4º de 113 em sua classe. O Qwen3.8-27B obtém 34 — o que o coloca em primeiro de 140 modelos em sua classe de tamanho de 4–40B com pesos abertos, um desempenho genuinamente forte para um 27B denso. Ambos são lentos segundo medição independente: 39,0 tokens de saída por segundo para o 27B e 38,1 para o 2.4T, contra uma mediana da classe em torno de 90. Ambos são verbosos, com o 27B gerando cerca de 200M tokens de saída ao longo das execuções do índice, contra uma mediana de classe de 68M. Nenhum dos dois é um modelo de fronteira de destaque; ambos são cavalos de batalha, e o índice diz que o 2.4T é o cavalo de batalha mais forte por uma margem clara.

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

A precificação do lado independente conta a mesma história em dólares. A Artificial Analysis precifica o 27B em US$ 0,50 por milhão de entrada e US$ 3,00 por milhão de saída na versão hospedada do Qwen Cloud (desconto de cache de 90%), e o 2.4T em US$ 2,00 / US$ 6,00 (desconto de cache de 88%). Custo por tarefa do Intelligence Index: US$ 0,82 para o 27B contra US$ 2,16 para o 2.4T. O modelo menor é mais barato de executar por unidade de inteligência — e ambos são caros em relação à sua classe de velocidade porque ambos são modelos de raciocínio que queimam tokens de saída.

Todo o resto — SWE-bench Pro 61,7, DeepSWE 1.1 42,2, LiveCodeBench v6 90,3 para o 27B; os 86,6 do Terminal-Bench 2.1 e os 67,7 de SWE-bench Pro do 2.4T — permanece relatado pelo fornecedor, não reproduzido e rotulado como tal ao longo deste artigo. Os índices AA acima são o piso independente por baixo de tudo isso.

O que a listagem da Cerebras muda

Em 12 de setembro de 2026, a conta da Qwen anunciou que o Qwen3.8-27B agora roda na Cerebras, com sua entrada de catálogo no ar sob o banner “Qwen 3.8 27B já está disponível no Cerebras PayGo”. A Cerebras o lista a US$ 0,99 por milhão de tokens de entrada e US$ 1,49 por milhão de tokens de saída no hardware da classe WSE que consagrou a empresa pela velocidade. Isso dá ao 27B algo que o núcleo 2.4T nunca teve: uma via rápida.

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

Isso importa porque lento e verboso foi a única crítica real ao 27B desde o primeiro dia. No harness independente, ele faz 39 t/s; na nossa própria telemetria de serving, vem fazendo ~154 tokens de saída por segundo, com uma latência p50 para o primeiro token de 4,48s — e agora um segundo provedor está competindo nesse mesmo eixo. O 2.4T, em contrapartida, não tem via rápida alguma: a 38 t/s, você paga preços de fronteira por uma velocidade mediana, e a única forma de contornar isso é um cluster de GPU alugado no qual você mesmo roda os pesos abertos.

Três faixas para o 27B, uma para o 2.4T

A partir de hoje, o dense 27B está disponível para aluguel de três maneiras, e a diferença de preços vale a pena ser lida antes de você escolher:

• Via auto-hospedada — Qwen3.8-27B já está no ar no OrcaRouter a $0.33 / $2.40 por milhão, executado na nossa própria infraestrutura. Entrada mais barata do mercado para ele, ~154 tok/s de saída, contexto de 262K.

• Via do fornecedor — o build hospedado do Qwen Cloud, $0,50 / $3,00 por milhão, com contexto de 1M de tokens e 90% de desconto em cache.

• Via rápida — Cerebras PayGo, $0.99 / $1.49 por milhão, posicionado pela velocidade, e não pelo preço.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

O núcleo aberto 2.4T não tem spread equivalente. A API carro-chefe que atende a mesma arquitetura — Qwen3.8-Max — custa US$ 2,00 / US$ 6,00 por milhão, e esse é o número que se mantém quer você o chame de Max ou de núcleo aberto. Execute os pesos em vez disso e a economia vira uma questão de hardware: o 2.4T precisa de ~2,4 TB de pesos BF16 e de um nó multi-GPU, uma decisão de capital que ninguém toma de ânimo leve. Uma GPU de 24 GB roda a build Q4 do 27B a um custo marginal que se arredonda para zero.

O exemplo prático que decide a maioria das equipes: 100M de tokens de entrada e 20M de tokens de saída por dia. Com a tarifa de $2/$6 do 2.4T, isso dá cerca de $320 por dia, ~$117.000 por ano. Com o 27B, à nossa tarifa de $0,33/$2,40, isso dá cerca de $81 por dia — e, na cópia auto-hospedada, é o preço da energia elétrica. O 2.4T oferece uma vantagem real de qualidade, AA 40 contra 34. Se essa vantagem vale uma fatura mensal de cinco dígitos é a questão central que este pareamento levanta.

Onde eles divergem verdadeiramente

Além do índice, três diferenças práticas decidem qual deles se adequa a uma determinada carga de trabalho.

A entrada multimodal é o filtro mais limpo. O Qwen3.8-27B lê texto, imagens e vídeo — capturas de tela, gráficos, documentos com figuras, quadros de vídeo, tudo entra na mesma janela de 262K. O Qwen3.8-2.4T-A95B é agressivamente somente texto. Se a sua entrada incluir qualquer coisa visual, o 2.4T é desqualificado, independentemente do seu índice mais alto.

O controle de pensamento vem em segundo lugar. O modo de raciocínio do 27B pode ser desativado por requisição, o que importa para extração sensível à latência, em que uma cadeia de pensamento é pura sobrecarga; ele também expõe reasoning_effort. O núcleo 2.4T não consegue desativar o pensamento — toda resposta começa com um bloco think>, e você paga por esses tokens quer os quisesse ou não. A API principal corrige isso, mas o núcleo aberto não.

O licenciamento vem em terceiro lugar e, discretamente, importa em escala. O Apache 2.0 no 27B é o padrão permissivo: modificar, redistribuir, comercializar, com concessão de patente incluída. O 2.4T é distribuído sob uma licença personalizada Qwen3.8-Max — permissiva em espírito, mas são os termos da Alibaba, não um padrão da comunidade, e vale a pena ler o arquivo antes de construir um produto sobre ele.

Encaminhando a decisão

Ambos os lados deste confronto podem ser acessados por meio de uma única chave OrcaRouter, e é isso que torna a pergunta "qual eu escolho" barata de responder empiricamente. O Qwen3.8-27B já está disponível como qwen/qwen3.8-27b pelo preço de tabela do provedor, sem nenhuma margem, e a API principal, construída sobre o mesmo núcleo de 2,4T, já está disponível como qwen/qwen3.8-max a US$ 2,00 / US$ 6,00 por milhão — a própria tarifa da Aliba​ba, repassada diretamente, de modo que qualquer mudança de preço do fornecedor entra em vigor aqui no mesmo dia.

Essa mesma arquitetura 2.4T como pesos baixáveis não é algo que nós servimos — se você quer o núcleo aberto via API hoje, a rota carro-chefe é o caminho prático para chegar até ele, e qwen/qwen3.8 já vem pré-configurado para ser ativado no momento em que um provedor servir os pesos abertos. Uma regra de roteamento que envia o tráfego visual e sensível à latência para qwen/qwen3.8-27b e a cauda de raciocínio pesado para qwen/qwen3.8-max não custa nada para configurar e faz failover automaticamente entre provedores. Uma chave só, nenhum segundo contrato, e a divisão é uma mudança de configuração em vez de uma re-arquitetura — a maneira mais barata de testar se os seis pontos de índice extras do 2.4T valem US$ 5,67 por milhão de tokens de saída para você.

Quem deve escolher qual

• Escolha o Qwen3.8-27B se a sua entrada incluir imagens ou vídeo, se você quiser um raciocínio que possa ser desativado, se você tiver uma GPU de 24 GB ou pretende ter uma, ou se o seu gasto por token tiver volume suficiente para que $0.33/$2.40 versus $2.00/$6.00 seja todo o argumento.

• Escolha o Qwen 3.8 (o núcleo de 2,4T) se você trabalha apenas com texto, quer o número de raciocínio independente mais forte da família (AA 40) e a tarifa de $2/$6 — ou o custo de operar um nó de GPU — cabe tranquilamente no seu orçamento.

• Escolha os dois se o seu tráfego abrange os dois perfis: encaminhe pelo gateway, deixe o roteador dividir por modalidade e dificuldade, e mude de ideia quando o próximo checkpoint ou o preço de qualquer um dos modelos for anunciado.

O veredito

O nome Qwen 3.8 sempre foi dois produtos fingindo ser uma única família, e agora ambos têm números independentes para se discutir. O Qwen3.8-2.4T-A95B é o cérebro mais forte, somente texto, caro e inegavelmente rentável a $2/$6. O Qwen3.8-27B é o que pode ser implantado — multimodal, Apache 2.0, auto-hospedável e, a partir desta semana, finalmente também tem uma via rápida. A diferença de índice é real: 40 contra 34. A diferença de preço também é: cerca de cinco vezes o custo por token quando você roda o 2.4T como uma API. Para a maioria das equipes, a decisão não é sobre os seis pontos de índice. É sobre se você está comprando tokens ou comprando hardware — e o 27B é o único dos dois que permite comprar o hardware.