Análise do Qwen3.8-Max: o carro-chefe de 2.4T da Alibaba por US$ 2/US$ 6 — a build 0902 lidera o Code Arena WebDev
Guides & Insights

Análise do Qwen3.8-Max: o carro-chefe de 2.4T da Alibaba por US$ 2/US$ 6 — a build 0902 lidera o Code Arena WebDev

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Alibaba Qw​en apresentou em prévia Qwen3.8-Max na Conferência Mundial de IA em Xangai em 19 de julho de 2026, e durante duas semanas foi o modelo mais comentado que ninguém conseguia realmente precificar. Não havia tabela de preços, nem tabela de benchmarks, nem ficha técnica do modelo, nem licença, nem contagem de parâmetros ativos — apenas um título de 2,4 trilhões de parâmetros e a afirmação de que o modelo estava "atrás apenas do Claude Fable 5."

Em 3 de agosto de 2026, isso mudou. O Qwen3.8-Max está geralmente disponível: uma tabela de preços publicada a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de saída, um endpoint compatível com OpenAI e DashScope, uma tabela completa de benchmarks e pesos abertos que chegaram em 12 de agosto. Uma semana depois, em 14 de agosto, ele foi lançado no DigitalOcean Serverless Inference como o "parceiro de lançamento Day 0" da Alibaba — a primeira grande nuvem ocidental a servi-lo. Em 2 de setembro, a Alibaba lançou uma atualização nomeada, Qwen3.8-Max-0902, com pós-treinamento adicional em Coding e Cowork, que, segundo a Qwen, fortalece o desempenho em trabalhos empresariais e científicos complexos. Esta análise é escrita com base nos fatos da GA, com esse lançamento de dia zero e a compilação 0902 incorporados, e responde à pergunta que as equipes realmente têm agora que o modelo pode ser comprado: o Qwen3.8-Max está pronto para receber tráfego de produção, ou ainda é um modelo de lista de observação?

A resposta curta é que ela foi além do que a maioria esperava — o preço em particular é agressivo de um jeito que redefine a fronteira, e a atualização de 2 de setembro reforça as duas coisas em que o modelo já era bom — codificação e trabalho colaborativo. O scorecard independente que surgiu desde então é genuinamente bom, mas traz uma ressalva que vale a pena ler antes de você comprometer o tráfego.

TL;DR. O Qwen3.8-Max agora está em GA a US$ 2 / US$ 6 por 1M de tokens, com valor uniforme em todo o contexto de 1M de tokens, sem sobretaxa para prompts longos — subcotando Kimi K3 (US$ 3/US$ 15) e Claude Opus 5 (US$ 5/US$ 25) no output, o principal fator de custo para tarefas de raciocínio. A Alibaba publicou uma tabela de benchmarks robusta (Terminal-Bench 2.1 86,6, GPQA Diamond 92,6, OSWorld-Verified 86,1) e o salto em codificação em relação ao predecessor é dramático: FrontierSWE 73,5 versus 40,7. Mas a tabela de qualidade é da própria Alibaba, e o primeiro árbitro independente — o Artificial Analysis Intelligence Index — já se manifestou: o Qwen3.8-Max pontua 56 a US$ 1,14 por tarefa, no mesmo nível de Claude Opus 4.8 (56) e um ponto atrás do líder de pesos abertos Kimi K3 (57), com um custo por tarefa 25% maior. A quantidade de parâmetros ativos não é mais uma incógnita: 95B ativados de um total de 2,4T, confirmado na ficha técnica oficial do modelo, o que finalmente permite que terceiros avaliem a economia do serving. Desde que esta análise foi publicada, um segundo caminho gerenciado também foi aberto: o Qwen3.8-Max entrou no ar no DigitalOcean Serverless Inference em 14 de agosto, com a DigitalOcean como parceira Day 0 da Alibaba, com números de serving publicados pela DigitalOcean — prefill escalando para ~16.000 tokens/seg e ~1.937 tokens de saída/seg com 256 solicitações simultâneas e zero erros — os primeiros dados concretos de latência de um fornecedor que não seja a Alibaba. Em 2 de setembro, a Alibaba atualizou o carro-chefe como Qwen3.8-Max-0902, com pós-treinamento adicional em Coding e Cowork; a Qwen afirma que o novo snapshot é mais forte em cargas de trabalho empresariais e científicas complexas — uma alegação do fornecedor, ainda sem números independentes sobre trabalho empresarial ou científico. O lado de codificação da build 0902 agora tem seu próprio resultado de arena independente: Qwen3.8-Max-0902 estreou em #1 no ranking Code Arena: WebDev com 1.691 pontos — 22 a mais que a versão anterior e à frente de Claude Opus 5 e Kimi K3 — segundo a Alibaba, citando a listagem ao vivo da arena de terceiros. A história do comércio agêntico ganhou um placar na mesma semana: no CommerceAgentBench, um novo benchmark da equipe Accio da Alibaba, construído sobre réplicas com estado de software comercial real, o Qwen3.8-Max obtém o resultado mais forte entre modelos de pesos abertos — 156 passes agregados em três harnesses, dois à frente do DeepSeek V4 Pro — uma tabela conduzida pelo fornecedor, não um árbitro independente. Veredito: realmente comprável agora, e barato o suficiente para justificar uma avaliação real — mas direcione-o deliberadamente, não indiscriminadamente.

Principais conclusões

GA desde 3 de agosto de 2026. A era da campanha de pré-visualização e créditos acabou; há uma tabela de preços real e um endpoint real.

$2 / $6 por 1M de tokens, uma única faixa fixa em contexto de 1M. A maioria dos concorrentes cobra taxa extra por prompts longos. A Alibaba não cobra, o que importa enormemente para trabalhos com documentos longos e grandes repositórios.

A tabela de benchmarks da Alibaba é forte, mas não auditada:Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

O salto geracional na codificação é a verdadeira história: FrontierSWE 73,5 (de 40,7) e DeepSWE 1.1 56,6 (de 21,6) — quase uma duplicação em ambos.

A primeira pontuação independente chegou: Qwen3.8-Max pontua 56 no AA Intelligence Index por US$ 1,14/tarefa — um salto de 10 pontos sobre o Qwen3.7-Max (46), no mesmo nível do Claude Opus 4.8 (56), um ponto atrás do Kimi K3 (57). A classificação geral da LMArena ainda não tem pontuação pública.

• Parâmetros ativos confirmados em 95B — o card oficial do modelo informa 2,4T no total e 95B ativados, encerrando a maior questão em aberto no cálculo do custo de servir.

• Os pesos abertos foram lançados — Qwen3.8-2.4T-A95B (BF16) e Qwen3.8-2.4T-A95B-FP8 chegaram ao Hugging Face em 12 de agosto sob uma licença personalizada Qwen3.8-Max, não Apache 2.0. A versão on-premise Qwen3.8-27B foi disponibilizada em 14 de agosto sob a licença Apache 2.0.

Um segundo caminho gerenciado foi aberto em 14 de agosto. Qwen3.8-Max está disponível no DigitalOcean Serverless Inference como o "parceiro de lançamento Day 0" da Alibaba — NVFP4 em NVIDIA HGX B300, $2/$6 com $0,20 para entrada em cache, servido no contexto nativo de 262K do checkpoint aberto. Os números medidos pela DigitalOcean (prefill de ~16 mil tokens/seg, zero erros com concorrência de 256) são os primeiros dados de desempenho de inferência em uma plataforma gerenciada fora da Alibaba.

Atualização de 2 de setembro: Qwen3.8-Max-0902. A Alibaba realizou um pós-treinamento adicional do carro-chefe em Coding e Cowork e o está oferecendo no QwenCloud com os mesmos $2/$6 e contexto de 1M. A Qwen afirma que o desempenho empresarial e científico é mais forte — ainda são alegações do fornecedor — enquanto o lado de codificação ganhou um resultado independente de arena no mesmo dia: a versão estreou em #1 no Code Arena: WebDev com 1.691 (item do Code Arena abaixo).

CommerceAgentBench: líder de peso aberto, executado pelo fornecedor. A equipe Accio da Alibaba lançou o CommerceAgentBench esta semana — 107 tarefas de horizonte longo dentro de réplicas com estado de softwares reais de comércio e negócios, avaliadas com base em estado nos harnesses Accio, OpenClaw e Pi. O Qwen3.8-Max lidera os modelos de peso aberto com 156 passes agregados, dois à frente do DeepSeek V4 Pro; o modelo fechado Claude Opus 5 lidera no geral com 191, e a tabela é da própria Alibaba, não um árbitro independente.

Code Arena: WebDev #1 — o resultado independente da build 0902 na arena. Qwen3.8-Max-0902 estreou no topo do ranking do Code Arena: WebDev com 1.691 pontos — 22 a mais que a build anterior e à frente de Claude Opus 5 e Kimi K3 — e lidera a fronteira de Pareto de custo-benefício desse ranking com um preço combinado de ~US$ 5/MToken, cerca de um quarto do preço combinado do Claude Opus 5. A conta oficial da Qwen no QwenCloud confirmou a colocação. Ao contrário do CommerceAgentBench, esse ranking é de terceiros: uma arena de votação humana cega, não uma tabela da Alibaba, embora 'estrear em #1' seja o anúncio da Alibaba de uma listagem em um ponto no tempo.

Nota de precisão: a tabela de benchmark do Qwen3.8-Max nesta análise é reportada pela Alibaba e não foi replicada de forma independente. A pontuação do Artificial Analysis Intelligence Index (56 a US$ 1,14/tarefa) é medida de forma independente pela AA na API oficial da Alibaba — o primeiro árbitro independente do modelo. Os preços vêm da tabela de preços de GA do Alibaba Model Studio. Os repositórios de pesos abertos (Qwen3.8-2.4T-A95B e Qwen3.8-2.4T-A95B-FP8), o número de 95B ativos e o texto da licença são de fonte primária: vêm da própria organização Hugging Face da Qwen, verificados em 13 de agosto de 2026. A disponibilidade na DigitalOcean, a respectiva tabela de preços, as medições de desempenho de serving e o teste pontual de GPQA de 88 na versão quantizada vêm da própria documentação da DigitalOcean e do tutorial da comunidade, publicados junto com o anúncio de 14 de agosto; a caracterização de "parceiro de lançamento do Dia 0" é linguagem do anúncio da Alibaba. Onde citamos números de concorrentes, eles vêm do Artificial Analysis ou do fornecedor nomeado no texto. A atualização Qwen3.8-Max-0902, anunciada em 2 de setembro, baseia-se integralmente em declarações do fornecedor: suas especificações, sua descrição de pós-treinamento Coding-and-Cowork e os ganhos empresariais e científicos alegados vêm todos do anúncio da própria Qwen e da página do modelo no QwenCloud, e nenhum de seus números foi replicado de forma independente. A classificação no Code Arena: WebDev abordada na seção de benchmarks é a única exceção: esse ranking é uma arena de terceiros com votação às cegas, e não uma tabela da Alibaba — embora "estreia em #1 com 1.691" seja a forma como a Alibaba anunciou uma classificação pontual, e as pontuações da arena continuem mudando à medida que os votos se acumulam. O resultado do CommerceAgentBench abordado abaixo está na mesma categoria: o benchmark foi criado e publicado pela Accio, equipe da Alibaba International; portanto, suas tabelas são reportadas pela Alibaba — um benchmark de código aberto, mas não um árbitro independente como o Artificial Analysis. Como regra, tabelas de benchmark de fornecedores tendem a ser otimistas — trate esses números como uma hipótese a testar em sua própria carga de trabalho, não como um ranking definitivo.

O que é Qwen3.8-Max?

Qwen3.8-Max é o carro-chefe da família Qw​en da Alibaba: um modelo esparso de Mistura de Especialistas com 2,4 trilhões de parâmetros no total, uma janela de contexto de 1 milhão de tokens e entrada multimodal nativa. Ele aceita texto, imagens e vídeo, e retorna texto. Suporta modo de raciocínio, chamada de funções, ferramentas integradas e saídas estruturadas, e é servido por um endpoint /v1/chat/completions compatível com a OpenAI, o que significa que a maioria das integrações existentes precisa apenas de uma alteração na URL base, e não de uma reescrita. O snapshot de produção atual, lançado em 2 de setembro, é o Qwen3.8-Max-0902, adicionalmente pós-treinado em Coding e Cowork.

Os números de contexto prático são ligeiramente mais específicos do que o "1M" do marketing. Os metadados de nuvem da Alibaba listam uma janela de 983.616 tokens com raciocínio habilitado, uma entrada máxima de cerca de 991 mil tokens, e uma saída máxima de 131.072 tokens. Esse teto de saída é extraordinariamente generoso e importa para tarefas como geração de código de arquivo completo ou redação de relatórios longos, em que tetos menores forçam você a dividir e costurar. O checkpoint aberto que a DigitalOcean agora disponibiliza tem uma configuração diferente: sua ficha do modelo lista 262.144 tokens nativamente, extensível para cerca de 1.010.000, então um serviço de terceiros que executa a base aberta normalmente ficará no número nativo menor.

{{1}}A contagem de parâmetros ativos agora é pública, e o nome do repositório a carrega: A95B significa 95 bilhões ativados.{{/1}} {{2}}A ficha oficial do modelo Qwen3.8-2.4T-A95B afirma "2.4T no total e 95B ativados",{{/2}} {{3}}um Mixture-of-Experts de granularidade fina com 512 especialistas, dos quais 10 roteados mais um compartilhado são ativos por token.{{/3}} {{4}}Esse número importa mais do que o 2.4T da manchete.{{/4}} {{5}}Para um modelo denso, os parâmetros totais dizem aproximadamente quanto custa a inferência; para um modelo MoE, eles não dizem quase nada — só a contagem de ativos importa, porque é isso que realmente roda por token.{{/5}} {{6}}Um modelo de 2.4T ativando 30B se comporta de forma completamente diferente, em latência e em economia de serviço, de um que ativa 200B.{{/6}} {{7}}Com 95B ativos, o cálculo por token fica na mesma ordem de grandeza de um modelo denso na faixa dos 90B — uma fração do que um denso de 2.4T exigiria — que é o número que finalmente torna a questão de auto-hospedagem abaixo respondível.{{/7}}

A atualização de 2 de setembro: Qwen3.8-Max-0902

Em 2 de setembro de 2026, a Qwen lançou sua primeira atualização de produção com nome próprio. O Qwen3.8-Max-0902 mantém a mesma arquitetura sparse-MoE de 2,4T parâmetros, os mesmos 95B parâmetros ativos e a mesma janela de contexto de 1M tokens, mas foi adicionalmente pós-treinado em duas capacidades — Coding e Cowork — e está ativo na API do QwenCloud como qwen3.8-max-0902 (também listado como qwen3.8-max-2026-09-02). É a build recomendada atual, e não um branch secundário: o endpoint qwen3.8-max sem data da Alibaba agora atende ao snapshot 0902, então uma chamada ao nome padrão do modelo cai na atualização, enquanto o id datado existe para equipes que desejam fixar a versão exata. A partir de 3 de setembro, o snapshot também foi listado como um id de modelo roteável próprio em APIs gerenciadas de terceiros. A tabela de preços não mudou: US$ 2 por 1M de entrada, US$ 6 por 1M de saída, com as mesmas taxas de cache.

As afirmações de desempenho são da Qwen. O anúncio e a página do modelo QwenCloud descrevem uma {{1}}capacidade de codificação{{/1}} que "abre novos caminhos" em projetos em escala de engenharia e desenvolvimento autônomo de longo horizonte, uma experiência de agente colaborativo {{2}}"significativamente aprimorada"{{/2}} em orquestração de múltiplas ferramentas e entrega de tarefas de ponta a ponta e — nas palavras da empresa — um desempenho mais forte em tarefas empresariais complexas, pesquisa científica e fluxos de trabalho de ciclo longo. A primeira verificação independente saiu no mesmo dia. O Qwen3.8-Max-0902 estreou em #1 no {{3}}ranking do Code Arena: WebDev{{/3}} — uma arena de terceiros, com votação cega, para desenvolvimento web agêntico, o projeto anteriormente conhecido como WebDev Arena — com {{4}}1.691 pontos{{/4}}, 22 pontos acima da versão anterior e à frente de Claude Opus 5 e Kimi K3, segundo a Alibaba, que cita o ranking ao vivo — colocação confirmada no mesmo dia pela conta oficial da Qwen, com referência à API do QwenCloud. O que isso prova — e o que não prova — é detalhado na {{5}}seção de benchmarks{{/5}} abaixo. As demais afirmações da atualização — raciocínio empresarial, trabalho científico e autonomia geral de longo horizonte — ainda são afirmações do fornecedor; portanto, mantenha a disciplina aplicada à tabela de agosto: trate-as como hipóteses até que uma avaliação do Artificial Analysis ou uma carga de trabalho real as confirme.

O que "Cowork" significa na prática é onde a atualização fica interessante. O Qwen3.8-Max da era GA já se apoiava na autonomia de longo horizonte — o desenvolvimento do oh-my-cli em 16 dias, o negócio virtual com mais de 2.000 rodadas — e, com a build 0902, a Alibaba dobra a aposta nesse eixo: agentes que orquestram múltiplas ferramentas e entregam uma tarefa de ponta a ponta, em vez de respostas de uma única etapa. Na mesma semana, o time da Accio, da Alibaba, publicou o CommerceAgentBench, um benchmark criado para medir esse eixo diretamente: 107 tarefas de longo horizonte em réplicas com estado de softwares reais de comércio e de negócios, em que o Qwen3.8-Max lidera o campo dos modelos de pesos abertos — detalhado na seção de benchmarks abaixo. Para equipes que avaliam o modelo para uso corporativo, essa é a afirmação a ser testada primeiro, porque também é a mais difícil de verificar a partir de uma tabela de benchmarks.

Preços: o aspecto mais agressivo deste lançamento.

O Alibaba Model Studio lista o Qwen3.8-Max a $2,00 por 1M de tokens de entrada e $6,00 por 1M de tokens de saída. A saída inclui tokens de raciocínio, o que importa porque configurações com uso intenso de raciocínio cobram sua deliberação interna pela taxa de saída. Economia de cache: acertos de entrada em cache custam $0,25 por 1M, criação explícita de cache $2,50, e leituras explícitas de cache $0,17.

A parte estruturalmente interessante não é o número principal, é a faixa fixa. A Alibaba cobra os mesmos $2/$6 independentemente do prompt ter 5.000 tokens ou 900.000. A maioria dos concorrentes aplica uma sobretaxa por contexto longo precisamente porque atender a um prompt de quase um milhão de tokens é caro. A Alibaba absorver isso é uma conquista deliberada de mercado voltada exatamente para as cargas de trabalho em que o contexto longo é o ponto central: revisão de código de repositório inteiro, análise de contratos e documentos, síntese de pesquisa com múltiplos documentos.

Exemplo prático. Digamos que você execute um agente de análise de repositório: 200.000 tokens de entrada de contexto de código e 8.000 tokens de saída por chamada.

Por chamada: 0.2M × $2 = $0.40 de entrada, mais 0.008M × $6 = $0.048 de saída. ≈ $0.45 por chamada.

Com 1.000 chamadas/dia: ≈ US$ 448/dia, ou cerca de US$ 13.400/mês.

A mesma chamada contra o Claude Opus 5 a $5/$25: $1.00 + $0.20 = $1.20 — aproximadamente 2,7× mais.

Com o cache de prompt em um contexto de código estável, a entrada em cache a $0,25 reduz o custo de entrada de $0,40 para $0,05, levando a chamada para ≈ $0,10 — uma redução de quase 4,5× no tráfego repetido.

É nesse diferencial de cache que está o orçamento real. Se o seu agente relê um contexto quase inalterado a cada turno — o que descreve a maioria dos agentes de codificação e suporte — o preço efetivo fica muito mais próximo de $0,25/$6 do que de $2/$6. Equipes que não configuram o cache rotineiramente pagam 3–4× mais neste modelo.

Para comparação a preços de tabela: Qwen3.8-Max $2/$6; seu próprio antecessor Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. Na entrada, o Qwen é apenas competitivo. Na saída — o lado que domina os gastos com raciocínio e trabalho agêntico — ele é o modelo mais barato que alega ser de fronteira nessa lista.

A medição independente da Artificial Analysis expõe o lado oposto desses tokens baratos. No seu Índice de Inteligência, o Qwen3.8-Max custa $1.14 por tarefa — mais que o dobro dos $0.53 do antecessor, e 25% maior que os $0.86 do Kimi K3 mesmo que o Kimi K3 liste a $3/$15 por token. A diferença é comportamental, não um aumento de preço: o modelo teve média de 64 passos por tarefa GDPval-AA contra 14 para o Qwen3.7-Max, e porque o harness reenvia a conversa completa a cada passo, os tokens de entrada cresceram cerca de 15× e os de saída ~45%. Tokens baratos não significam agentes baratos — a verbosidade que os testadores da prévia sinalizaram agora tem um custo mensurável. Como o OrcaRouter repassa o preço de tabela com margem de 0% por trás de um endpoint compatível com OpenAI, essa questão de $1.14 versus $0.86 pode ser medida com prompts idênticos sem um segundo contrato.

A tabela de benchmark e o que cada número realmente mede

Na GA, a Alibaba publicou a tabela que havia retido na prévia. Pontuações relatadas:

Terminal-Bench 2.1 — 86.6. Mede se um modelo consegue operar um shell real até a conclusão: executar comandos, ler a saída, recuperar-se de erros. Este é o proxy mais próximo de "pode funcionar como um agente de codificação em vez de um sugeridor de código".

GPQA Diamond — 92,6. Questões de nível de pós-graduação em física, química e biologia, escritas para serem resistentes à recuperação. Uma pontuação alta indica raciocínio científico genuíno, em vez de memorização. 92,6 está no topo do cenário atual.

PaperBench — 93.0. Reproduzir resultados de artigos de pesquisa — ler uma metodologia e reimplementá-la. Recompensa a compreensão sustentada em múltiplas etapas.

IFBench — 82.8. Seguimento de instruções sob restrição: formato, tamanho e instruções negativas. Notavelmente, a pontuação mais baixa na própria tabela da Alibaba, o que é consistente com a reclamação da era de pré-visualização de que o modelo é minucioso a ponto de ignorar limites de escopo.

OSWorld-Verified — 86,1. Uso de computador: operar uma GUI de desktop real para concluir tarefas. O forte desempenho aqui reforça o posicionamento agêntico.

OmniDocBench 1.5 — 92.1.Análise de documentos — tabelas, layout, texto misto e figuras. Combina com o contexto de tarifa fixa de 1M para apresentar um caso de uso real para pipelines de documentos.

FrontierSWE — 73,5, acima dos 40,7 do predecessor. DeepSWE 1.1 — 56,6, acima de 21,6.

Esses dois últimos merecem ênfase. Quase duplicações em benchmarks difíceis de engenharia de software em uma geração não são ganhos incrementais normais, e são consistentes com a decisão da Alibaba de comercializar este modelo para desenvolvedores, em vez de usuários de chat. Se o índice FrontierSWE sobreviver à replicação independente, o Qwen3.8-Max é um modelo sério de codificação e não apenas um modelo grande.

A ressalva da prévia encolheu, mas não desapareceu. A tabela acima foi produzida pela Alibaba, em sua própria estrutura de testes, sob condições que ninguém mais pode inspecionar. As tabelas dos fornecedores são escolhidas, não amostradas — os laboratórios publicam os benchmarks em que se saem bem. Mas, desde 6 de agosto, há agora um verdadeiro árbitro independente: a Artificial Analysis avaliou o Qwen3.8-Max em 56 no Intelligence Index a US$ 1,14 por tarefa, medido na API oficial da Alibaba — um salto de 10 pontos em relação aos 46 do antecessor, no mesmo nível do Claude Opus 4.8 (56) e um ponto atrás do Kimi K3 (57). No ranking agêntico GDPval-AA da AA, o modelo alcança 1.739 Elo, superando o Kimi K3 (1.685) e o GPT-5.6 Sol (1.730), com apenas o Claude Opus 5 (1.852) à frente. As próprias ressalvas da AA merecem o mesmo peso: uma execução anterior marcou 53 antes de os problemas de endpoint serem resolvidos, e o reteste da API oficial produziu 56; a AA-Omniscience apresentou queda de 10 pontos, com uma taxa de alucinação que subiu de 23% para 40%; e o custo por tarefa é alto precisamente porque o modelo percorre muito mais etapas. O ranking geral da LMArena ainda não tem pontuação pública.

O lançamento da DigitalOcean adicionou um terceiro ponto de dados, este na versão quantizada em vez do carro-chefe. A própria verificação interna da DigitalOcean dos pesos NVFP4 que ela serve obteve 88 no GPQA Diamond, contra os 92,6 publicados pela Alibaba para o carro-chefe não quantizado. A própria DigitalOcean classifica a comparação como "um ponto de dados indicativo em vez de uma comparação controlada" — as diferenças ocorrem em três eixos (base de pesos abertos em vez do carro-chefe hospedado, NVFP4 em vez de BF16 e uma pilha de avaliação diferente) — mas é a primeira verificação independente em uma implantação real de serviço desses pesos, e um lembrete de que o checkpoint aberto não é, byte por byte, o número na tabela da Alibaba.

CommerceAgentBench: o placar do agentic-commerce

Junto com a atualização, a equipe Accio da Alibaba International lançou o CommerceAgentBench, um benchmark criado para pontuar exatamente o trabalho de longo horizonte que a Qwen continua promovendo. Um agente inicia cada tarefa dentro de um container novo, em uma das 14 réplicas offline de softwares reais de comércio e negócios — publicação de produtos, reserva de frete, administração de lojas virtuais, operações de pagamento e análise de fornecedores — e a avaliação é baseada em estado: uma tarefa só passa quando os serviços simulados subjacentes e os arquivos produzidos realmente mudam; portanto, um agente que narra um fluxo de trabalho plausível sem alterar o estado não pontua nada. A suíte executa 107 tarefas em superfícies de CLI, navegador, arquivo/documento e API/MCP, por meio de três harnesses — Accio, OpenClaw e Pi — e o código dos harnesses (Apache 2.0) e os dados das tarefas (CC BY 4.0) estão abertos para inspeção ou reexecuções.

Nas tabelas publicadas, o Qwen3.8-Max tem o resultado mais forte entre os modelos de pesos abertos: 56 das 107 tarefas no harness Accio, 47 no OpenClaw e 53 no Pi — 156 passes agregados, dois à frente dos 154 do DeepSeek V4 Pro. Toda a vantagem vem do harness Accio; os dois modelos empatam no OpenClaw e no Pi. O líder de pesos abertos não é o líder geral: o modelo fechado Claude Opus 5 supera todos com 191 passes agregados, 35 à frente. E a tabela é da própria Alibaba — Accio é o time da Alibaba, e o próprio repositório aponta as limitações de auditoria: o harness Accio é somente de referência e não pode ser reproduzido a partir de um checkout (o OpenClaw é o caminho reexecutável), os resultados em nível de tarefa não possuem somas de verificação públicas imutáveis, e as linhas do Qwen dependeram de um protocolo de replay de conteúdo de raciocínio para continuarem comparáveis. Considere isso um dado declarado pelo fornecedor no mesmo eixo agêntico que o OSWorld-Verified e o GDPval-AA da AA abordam de ângulos diferentes — vale testá-lo com seus próprios workflows, e não tratá-lo como um ranking definitivo.

Code Arena WebDev: o árbitro independente do build 0902

Code Arena é a peça de evidência independente que faltava à atualização. É um ranking de terceiros para desenvolvimento web agêntico — o projeto anteriormente conhecido como WebDev Arena — onde votos humanos cegos e pareados sobre qual saída de modelo o usuário preferiria enviar são convertidos em uma classificação no estilo Elo. No ranking WebDev, o Qwen3.8-Max-0902 estreou no topo com 1.691 pontos, 22 a mais que a build anterior e à frente de Claude Opus 5 e Kimi K3. A colocação também traz uma vantagem de eficiência de custo: a um preço combinado de ~US$ 5 por milhão de tokens — a taxa de lista de US$ 2/US$ 6 ponderada para a mistura com alto volume de saída que a geração de aplicações web de fato produz —, a build 0902 é o modelo com maior pontuação na fronteira de Pareto do ranking, custando cerca de um quarto do preço combinado de ~US$ 20/M do Claude Opus 5 e bem menos que os ~US$ 12/M do Kimi K3, motivo pelo qual esses dois ficam fora da fronteira apesar de estarem em 2º e 3º lugar na pontuação. A Alibaba anunciou a posição em 2 de setembro e a conta oficial do Qwen confirmou, apontando os usuários para o QwenCloud; a medição não é da Alibaba: diferente da tabela de benchmark acima ou da execução do CommerceAgentBench logo acima, essa pontuação é produzida por uma arena de terceiros com base em votos de preferência humana.

Duas ressalvas mantêm o quadro honesto. Primeiro, as classificações da arena são instantâneas: 1.691 é onde o placar estava quando a Alibaba anunciou a estreia, e esse número vai flutuar conforme os votos se acumulam; portanto, leia-o como um forte sinal sobre codificação para desenvolvimento web, e não como uma coroa permanente. Segundo, isso cobre apenas um eixo. As alegações da atualização sobre enterprise, científico e horizontes longos em geral ainda não têm um árbitro independente, e é por isso que a tabela do fornecedor e o AA Index 56 no modelo base continuam sendo os pontos de referência para tudo fora do trabalho de front-end agêntico. Terceiro, o preço de fronteira é uma escolha de modelagem, não uma nova tabela de preços: o valor de ~US$ 5/MToken combina a lista inalterada de US$ 2/US$ 6 sob uma premissa de uso com alta geração de saída; portanto, trate-o como um ranking de custo-benefício nos termos da própria arena, e não como um reajuste de preços pela Alibaba.

Pesos abertos, Qwen3.8-27B e a questão on-premise.

A promessa de pesos abertos da Alibaba foi finalmente cumprida. Em 12 de agosto de 2026, a Qwen publicou dois repositórios no Hugging Face — Qwen3.8-2.4T-A95B em BF16 e Qwen3.8-2.4T-A95B-FP8 — cada um com 213 arquivos de pesos. A licença é uma licença personalizada Qwen3.8-Max, não Apache 2.0; o campo de licença do Hugging Face diz "other". Os termos permitem uso, modificação, distribuição e ajuste fino, incluindo uso comercial, com atribuição, além de dois limites baseados em escala: produtos com mais de 100 milhões de usuários ativos mensais ou US$ 20 milhões de receita mensal devem exibir o nome do modelo em destaque, e negócios de Modelo-como-Serviço ou Assistente-de-Trabalho-IA com receita agregada acima de US$ 50 milhões nos últimos doze meses precisam de uma licença separada da Qwen. A maioria das equipes está dentro desses limites; se o seu negócio ultrapassá-los, leia o texto da licença antes de construir sobre ele. Os contadores de downloads corroboram a recentidade — 978 no repositório BF16 e 3.851 no repositório FP8 no momento em que escrevo, baixos para um lançamento de ponta e consistentes com um repositório criado em 8 de agosto e tornado público apenas em 12 de agosto, não um que estava visível há uma semana. Mais uma nota de honestidade: o checkpoint aberto é o modelo base, somente texto com raciocínio sempre ativo, enquanto a API hospedada Qwen3.8-Max adiciona entrada de visão, um modo opcional sem raciocínio e o contexto completo de 1M — baixar os pesos dá a você o modelo, não todos os recursos da API.

Auto-hospedar o modelo carro-chefe ainda está fora do alcance da maioria das equipes, mas agora está fora do alcance com números conhecidos. O conjunto completo de pesos com 2,4T de parâmetros ocupa cerca de 4,9 TB em BF16 e aproximadamente 2,4 TB em FP8, porque todos os especialistas precisam estar residentes na memória, mesmo que apenas 95B sejam ativados por token. Com quantização de 4 bits, isso fica na ordem de 1,2 TB contra cerca de 141 GB por H200, então você precisa de oito ou mais aceleradores de ponta antes de servir um único token. O que a contagem de parâmetros ativos agora pública acrescenta é o lado do throughput: com 95B ativados por token, o custo computacional por token é comparável ao de um modelo denso da classe de ~90B — uma fração do custo que um modelo denso de 2,4T imporia — portanto, uma vez que os pesos estejam residentes, o custo por token não é o pesadelo que o número total de parâmetros sugere. Essa combinação de grande pegada de memória e custo computacional modesto por token é exatamente o motivo pelo qual a Alibaba pode precificar a saída a US$ 6/1M, e direciona as equipes de auto-hospedagem para nós com múltiplas GPUs executando os checkpoints FP8, em vez de qualquer coisa com uma única GPU.

A escolha de serviço da DigitalOcean é um exemplo prático dessa matemática em produção. Ela executa o modelo quantizado em NVFP4 em GPUs NVIDIA HGX B300 especificamente para que os pesos de 2,4T caibam em um único nó, evitando o roteamento de especialistas entre nós — uma implantação real da economia de 4 bits que esta seção vem fazendo no papel. O trade-off é exatamente aquele que a verificação pontual do GPQA acima quantifica: uma pegada menor, a um custo mensurável em qualidade em relação ao carro-chefe não quantizado.

É isso que torna o Qwen3.8-27B o lançamento mais relevante para a maioria dos leitores — e, ao contrário do modelo principal, seus pesos chegaram no prazo. Em 14 de agosto de 2026, a Qwen publicou o Qwen/Qwen3.8-27B no Hugging Face e no ModelScope sob a licença Apache 2.0: um modelo denso de 27B, nativamente multimodal, com contexto nativo de 262 mil tokens extensível a 1M e um modo reasoning_effort configurável. Daniel Han, da Unsloth, estimou que ele rodaria em cerca de 17 GB de VRAM — uma única placa prosumer — e isso agora é testável: o repositório oficial traz safetensors BF16 (cerca de 55,6 GB em 18 shards), com quantizações GGUF chegando em repositórios da comunidade. Assim, o padrão de lançamento da geração está completo: os pesos do carro-chefe de 2,4T saíram primeiro, em 12 de agosto, e o modelo pequeno para implantação on-premise chegou dois dias depois. Acompanhamos o lançamento em nosso post sobre a data de lançamento do Qwen3.8-27B.

Onde o Qwen3.8-Max se encaixa: quatro cenários

1. Análise de documentos longos e contratos. Esta é a opção mais adequada. A taxa fixa para 1 milhão de tokens, aliada ao desempenho de 92.1 no OmniDocBench, significa que você pode processar um documento de 400 páginas em uma única chamada, sem sobretaxa e sem divisão em blocos. Concorrentes que cobram taxas extras por contexto longo tornam o mesmo trabalho consideravelmente mais caro. No caminho da DigitalOcean, lembre-se de que ele atende à base aberta com contexto de 262K — ainda é um documento grande, mas não o milhão completo.

2. Agentes de codificação em escala de repositório.Terminal-Bench 86,6 e FrontierSWE 73,5 apoiam isso, e o preço do cache torna barato o trabalho iterativo em uma base de código estável. A primeira coisa a testar é a latência sob sua própria concorrência, porque os revisores da era de preview consideraram o modelo minucioso, mas lento em execuções longas de agentes, e o serviço de GA é algo bem diferente do serviço de preview. O resultado da AA no GDPval-AA — um Elo líder de 1.739 ao custo de 64 passos por tarefa — é a confirmação independente das duas metades desse trade-off. As medições da DigitalOcean de 12 de agosto — throughput agregado escalando quase linearmente até ~1.937 tokens de saída/segundo a 256 requisições concorrentes, zero erros e sem saturação encontrada — são o primeiro ponto de dados de plataforma gerenciada sobre essa questão, embora sejam números da própria DigitalOcean em seu próprio serviço, não um confronto direto contra o da Alibaba.

3. Pipelines de documentos e capturas de tela. A entrada de vídeo e imagem, além do OSWorld-Verified 86.1, tornam-no plausível para fluxos de trabalho que leem telas — automação de QA, triagem de suporte a partir de capturas de tela, tarefas adjacentes a RPA. Novamente, a entrada multimodal é um recurso de API hospedada; o caminho de base aberta da DigitalOcean é somente texto.

4. Onde ainda não o colocaríamos. UX interativa de latência crítica e qualquer carga de trabalho regulamentada que exija avaliação reprodutível. Para a primeira, você quer um throughput medido que você controla. Para a segunda, a reprodutibilidade agora tem um model card e uma licença para citar, mas a tabela de benchmark da Alibaba ainda não foi replicada — e a regressão de Omniscience da AA (taxa de alucinação de até 40%) é um lembrete de que a pontuação independente é uma faca de dois gumes.

Como acessar Qwen3.8-Max

Existem vários caminhos práticos. Diretamente via Alibaba Model Studio / DashScope — ou a própria API QwenCloud da Qwen — você obtém a tabela de preços acima e o acesso mais antecipado a novos snapshots datados — a compilação Qwen3.8-Max-0902 de 2 de setembro apareceu lá primeiro antes de ser distribuída para outros endpoints — ao custo de integrar um novo fornecedor e gerenciar outra chave. O Qwen Chat e o aplicativo Qwen são a maneira mais rápida de observar o comportamento antes de escrever código. Baixar os pesos abertos do Hugging Face é um quarto caminho para equipes que desejam executar sua própria infraestrutura — com as ressalvas de tamanho e licença acima. Através de um roteador é a opção que a maioria das equipes de produção deve considerar, pois remove a decisão de migração da decisão de avaliação.

Desde 14 de agosto de 2026, existe uma opção genuinamente nova: Qwen3.8-Max está disponível no DigitalOcean Serverless Inference, que a Alibaba anunciou como seu "Day 0 launch partner" — enquadramento da própria Alibaba, embora a listagem seja da DigitalOcean e se sustente por si só. A DigitalOcean serve o checkpoint de pesos abertos (identificador do modelo na plataforma qwen3.8-max), quantizado com NVFP4 em GPUs NVIDIA HGX B300 em colaboração técnica com a Inferact, como uma API serverless totalmente gerenciada: um endpoint, preços baseados em uso, sem infraestrutura para gerenciar. Sua tabela de preços corresponde à lista da Alibaba — $2.00 de entrada / $6.00 de saída por 1M, com entrada em cache a $0.20 — e serve o contexto nativo de 262K da base aberta com o raciocínio sempre ativo, em vez do modo multimodal de ~1M de tokens do flagship hospedado. Esse teto de contexto importa se a sua carga de trabalho pende para o lado longo: o modo completo de um milhão de tokens permanece exclusivo da API da Alibaba.

O que o caminho da DigitalOcean acrescenta além da geografia são os primeiros dados concretos de serving de um provedor que não seja a Alibaba. As próprias medições da DigitalOcean contra seu endpoint de produção, feitas em 12 de agosto, mostram o prefill escalando linearmente a aproximadamente 16.000 tokens/seg — regra prática TTFT ≈ (input ÷ 16.000) + 0,7s, portanto ~1,1s em ~1.080 tokens e ~15,8s em ~254K — e a vazão agregada alcançando ~1.937 tokens de saída por segundo em 256 requisições concorrentes com zero erros e nenhum ponto de saturação encontrado. Esses são os números da DigitalOcean em sua própria implantação, não um teste comparativo controlado, mas são os primeiros dados de latência e concorrência sobre este modelo fora da nuvem da Alibaba, e eles abordam diretamente a preocupação de "minucioso, porém lento" da era do preview.

Qwen3.8-Max já está disponível na OrcaRouter como qwen/qwen3.8-max, e a atualização de 2 de setembro pode ser roteada sob seu próprio id datado — qwen/qwen3.8-max-0902 — ambos com o mesmo preço de tabela de $2,00 / $6,00. A OrcaRouter aplica margem de 0% e repassa o preço do provedor integralmente; portanto, qualquer uma das rotas custa o mesmo que ir direto. Nossa própria telemetria de inferência atualmente mostra um p50 de tempo até o primeiro token de 1,64 segundos em uma janela de 7 dias. Essa é uma medição de latência própria, e não uma alegação do fornecedor, e vale a pena ponderá-la contra os relatos da fase de preview do "modelo mais lento que já usei": eles vieram de um único revisor executando builds agênticos de uma hora em infraestrutura de preview, e devem ser re-testados contra o serving de GA em vez de repetidos como fato atual.

O valor prático da rota do roteador é que o Qwen3.8-Max fica atrás do mesmo endpoint compatível com OpenAI que os modelos que você já executa; portanto, avaliá-lo é apenas uma mudança de string de modelo. Você pode enviar 5% do tráfego de produção para ele, comparar com o modelo atual em prompts idênticos e manter um fallback — exatamente a postura que um modelo com uma tabela de fornecedores não replicada merece. Essa mesma postura é a forma correta de testar a implantação na DigitalOcean: executar uma fatia contra ela com um fallback em vigor, em vez de apostar um caminho de produção em uma stack de serviço com duas semanas de existência.

Limitações e riscos honestos

Tabela de fornecedores ainda não auditada. A pontuação independente chegou (AA Index 56), mas a própria tabela de benchmark da Alibaba permanece não replicada, e a medição da AA sinaliza uma regressão de Omniscience com a taxa de alucinação de até 40%. A pontuação independente ajuda; ela não torna a tabela de fornecedores auditável.

O caminho da DigitalOcean é a base aberta, não o carro-chefe. Ele serve o checkpoint com contexto de 262K, somente texto, raciocínio sempre ativo, quantizado em NVFP4 — e as próprias pontuações de verificação pontual da DigitalOcean que marcam 88 no GPQA Diamond versus os 92,6 publicados pela Alibaba, uma diferença que a DigitalOcean considera indicativa, não controlada. Se você precisar da API multimodal completa de um milhão de tokens, essa ainda é hospedada pela Alibaba.

Qwen3.8-27B foi lançado, mas com numeração do fornecedor. Os pesos da 27B chegaram em 14 de agosto sob a licença Apache 2.0, fechando a lacuna on-premise — mas seus resultados de benchmark são relatados pela Alibaba e não foram replicados, e as quantizações da comunidade ainda estavam sendo lançadas até o momento desta atualização.

Licença personalizada, não Apache 2.0. A licença do Qwen3.8-Max permite uso comercial com atribuição, mas inclui dois limites de escala — exibição proeminente do nome do modelo acima de 100M de MAU ou US$ 20M de receita mensal, e uma licença separada para negócios de MaaS/Assistente de Trabalho com IA acima de US$ 50M de receita nos últimos doze meses. Leia antes de escalar além dos limites.

Verbosidade e desvio de instruções.IFBench 82.8 é o número mais fraco na tabela da própria Alibaba, e testadores da prévia viram repetidamente o modelo extrapolar o escopo — adicionando recursos não solicitados. Os números da própria AA agora quantificam isso: 64 passos por tarefa GDPval-AA é o que eleva o custo a US$ 1,14, 25% acima do Kimi K3. Encantador em uma demo, caro quando a saída é cobrada a US$ 6/1M e desestabilizador quando você precisa de formatos exatos.

Salvaguardas de conteúdo. Como outros modelos de fronteira hospedados na China, as respostas sobre tópicos politicamente sensíveis são limitadas. Relevante se o seu produto atende a consultas abertas.

Tokens de raciocínio são cobrados como saída. Com o raciocínio ativado, os custos reais ficam acima das estimativas ingênuas. Meça com o raciocínio configurado da forma como você realmente vai implantá-lo.

Perguntas Frequentes

O Qwen3.8-Max está disponível agora?

Sim. Ele atingiu disponibilidade geral em 3 de agosto de 2026, com uma tabela de preços publicada e uma API compatível com OpenAI e DashScope. O snapshot de produção atual — Qwen3.8-Max-0902, lançado em 2 de setembro — está ativo na API do QwenCloud e é o que o endpoint padrão qwen3.8-max atende agora. Isso é uma mudança em relação ao status de prévia de 19 de julho, quando o acesso era limitado ao Qwen Chat, ao Qwen App e à campanha de créditos da Qoder.

O que é Qwen3.8-Max-0902?

Qwen3.8-Max-0902 é a atualização de produção de 2 de setembro de 2026 do Qwen3.8-Max: o mesmo carro-chefe sparse-MoE de 2,4T de parâmetros e contexto de 1M de tokens, com pós-treinamento adicional em Coding e Cowork, e disponível na API do QwenCloud pelos mesmos US$ 2/US$ 6. A Qwen afirma que o novo snapshot é mais forte em tarefas empresariais e científicas complexas — uma afirmação do fornecedor, ainda não avaliada de forma independente — enquanto no eixo de codificação já possui um resultado independente: nº 1 no ranking Code Arena: WebDev com 1.691 pontos e o topo de sua fronteira de Pareto de custo-benefício a um valor combinado de ~US$ 5/MToken, conforme anúncio da Alibaba sobre a listagem na arena ao vivo, confirmado pela própria conta QwenCloud da Qwen.

Quanto custa o Qwen3.8-Max?

US$ 2,00 por 1M de tokens de entrada e US$ 6,00 por 1M de tokens de saída, fixos em todo o contexto de 1M de tokens, sem sobretaxa para prompts longos. Acessos a cache de entrada custam US$ 0,25 por 1M, criação explícita de cache US$ 2,50 e leituras de cache US$ 0,17. Tokens de raciocínio são cobrados à taxa de saída. No Intelligence Index da Artificial Analysis, o custo medido do modelo é de US$ 1,14 por tarefa — veja a seção de preços para entender por que isso fica acima do cálculo de tokens. O caminho serverless da DigitalOcean lista os mesmos US$ 2/US$ 6 com entrada em cache a US$ 0,20.

Quantos parâmetros o Qwen3.8-Max tem?

2,4 trilhões no total, em uma configuração esparsa de Mistura de Especialistas. A contagem de parâmetros ativos — o número que realmente determina o custo de serviço e a latência — agora está confirmada em 95 bilhões ativados, conforme o card oficial do modelo para Qwen3.8-2.4T-A95B (512 especialistas; 10 roteados mais um compartilhado ativo por token).

Os pesos do Qwen3.8-Max são abertos?

{{1}}Sim — desde 12 de agosto de 2026.{{/1}} {{2}}A Qwen publicou Qwen3.8-2.4T-A95B (BF16) e Qwen3.8-2.4T-A95B-FP8 no Hugging Face, cada um com 213 arquivos de pesos.{{/2}} {{3}}Trata-se de uma licença personalizada Qwen3.8-Max (o Hugging Face a lista como "other"), não Apache 2.0: ela permite uso comercial com atribuição e possui duas restrições baseadas em escala.{{/3}} {{4}}O checkpoint aberto é somente texto com o modo de pensamento sempre ativo; a API hospedada adiciona visão, um modo opcional sem pensamento e o contexto completo de 1M.{{/4}}

O Qwen3.8-Max foi submetido a benchmarks independentes?

Sim — desde 6 de agosto de 2026. A Artificial Analysis o pontua em 56 no seu Índice de Inteligência a US$ 1,14 por tarefa, medido na API oficial da Alibaba: um salto de 10 pontos sobre o Qwen3.7-Max (46), no mesmo nível do Claude Opus 4.8 (56) e um ponto atrás do Kimi K3 (57). A tabela de benchmarks acima, no entanto, permanece relatada pela Alibaba e não replicada, e o ranking geral da LMArena ainda não tem pontuação pública. O cenário da arena independente mudou em 2 de setembro: a atualização 0902 estreou em #1 no quadro Code Arena: WebDev da mesma plataforma, com 1.691 pontos — um resultado de terceiros, por votação cega, não uma tabela da Alibaba — e a fronteira de custo-benefício do Code Arena a lista como o valor de maior pontuação do quadro, a uma taxa combinada de cerca de US$ 5/MToken. A verificação pontual da DigitalOcean de sua compilação quantizada (88 no GPQA Diamond) é a primeira checagem de terceiros em uma implantação de serviço, sendo explicitamente indicativa, e não controlada. Uma ressalva para a coluna "independente": o CommerceAgentBench, onde o Qwen3.8-Max lidera entre os modelos de pesos abertos, não é um segundo árbitro independente — a Accio, que o criou e publicou, é a própria equipe da Alibaba.

O Qwen3.8-Max é melhor que o Qwen3.7-Max?

Pelos próprios números da Alibaba, substancialmente — FrontierSWE 73,5 contra 40,7 e DeepSWE 1.1 56,6 contra 21,6 são quase o dobro em tarefas difíceis de engenharia de software. Também é mais barato que os US$ 2,50/US$ 7,50 do seu antecessor. De forma independente, a AA estima o salto geracional em 10 pontos no seu Índice de Inteligência (56 contra 46). Ambas as alegações do fornecedor ainda devem ser verificadas na sua carga de trabalho.

Posso auto-hospedar o Qwen3.8-Max?

Na prática, não. O conjunto completo de pesos de 2,4T tem aproximadamente 4,9 TB em BF16, cerca de 2,4 TB em FP8 e algo em torno de 1,2 TB em 4 bits — contra cerca de 141 GB por H200, isso equivale a oito ou mais GPUs topo de linha. Com 95B de parâmetros ativos por token, o custo computacional por token é relativamente modesto, mas a pegada de memória é o fator limitante. O serving NVFP4 da DigitalOcean em B300s é a prova concreta de que o modelo cabe em 4 bits em um único nó. O Qwen3.8-27B — que segundo relatos usa cerca de 17 GB de VRAM — é a opção realista para on-premise, e seus pesos foram disponibilizados em 14 de agosto de 2026 sob a licença Apache 2.0 — agora disponíveis para download, em vez de uma promessa.

O que é Qwen3.8-27B?

Um modelo bem menor, anunciado junto com o carro-chefe, posicionado como o caminho prático para implantação on-premise. É um modelo denso de 27B, nativamente multimodal, com contexto nativo de 262 mil tokens, extensível a 1M, e é distribuído sob a licença Apache 2.0. Seus pesos foram disponibilizados no Hugging Face e no ModelScope em 14 de agosto de 2026; Daniel Han, da Unsloth, informa que ele roda em cerca de 17 GB de VRAM — uma única placa de consumo de ponta. Suas alegações de benchmark são relatadas pela Alibaba e não foram reproduzidas de forma independente.

O Qwen3.8-Max é multimodal?

Sim — aceita entrada de texto, imagem e vídeo e retorna texto. Também suporta modo de raciocínio, chamada de funções, ferramentas integradas e saídas estruturadas. O checkpoint de pesos abertos é somente texto; a entrada multimodal é um recurso da API hospedada, que é o que o caminho da DigitalOcean não inclui.

O Qwen3.8-Max está disponível na DigitalOcean?

Sim — desde 14 de agosto de 2026. O DigitalOcean Serverless Inference serve o checkpoint de pesos abertos (NVFP4 em NVIDIA HGX B300) a US$ 2,00/US$ 6,00 por 1M com US$ 0,20 de entrada em cache, um contexto de 262 mil tokens, somente texto, raciocínio sempre ativo. A Alibaba chama a DigitalOcean de seu "Day 0 launch partner"; a listagem em si é da DigitalOcean e independente desse idioma. Os números medidos pela DigitalOcean: prefill de ~16 mil tokens/s e ~1.937 tokens de saída por segundo em 256 solicitações simultâneas com zero erros.

Posso usar o Qwen3.8-Max através do OrcaRouter?

Sim. Está disponível como qwen/qwen3.8-max, e o snapshot de 2 de setembro com seu próprio ID datado — qwen/qwen3.8-max-0902 — pelo mesmo preço de tabela de $2,00/$6,00, com margem de 0%. O custo de roteamento é o mesmo que ir diretamente, por trás do endpoint compatível com OpenAI que você já usa. Nossa telemetria de 7 dias mostra um p50 de tempo até o primeiro token de 1,64 segundos.

Devo mover o tráfego de produção para isso hoje?

Não é uma adoção em massa. O preço e a primeira pontuação independente tornam uma avaliação séria barata e que vale a pena fazer agora, mas, com um custo por tarefa 25% maior do que o do Kimi K3, a medida disciplinada é dividir o tráfego entre o seu modelo atual e o novo em prompts idênticos, com um fallback em vigor — não uma migração. O caminho da DigitalOcean adiciona uma segunda implantação gerenciada para servir de comparação, o que torna a avaliação ainda mais barata.

Conclusão

Qwen3.8-Max passou duas semanas como o modelo mais interessante que ninguém conseguia comprar. Na GA, é uma proposta genuinamente diferente: US$ 2/US$ 6 fixos por um milhão de tokens é um preço agressivo, as taxas de cache tornam o trabalho iterativo de agentes barato, e o salto geracional em FrontierSWE e DeepSWE — se for replicado — o torna um modelo real de codificação, e não uma ostentação de escala. A chegada dos pesos abertos sob uma licença legítima em 12 de agosto transformou "pesos abertos em breve" de promessa em fato, e o caminho day-zero na DigitalOcean anunciado em 14 de agosto — com números de inferência medidos e uma leitura de cache de US$ 0,20 — reforça o argumento do "experimente por pouco" e dá às equipes uma implantação gerenciada por terceiros para comparar com a própria API da Alibaba. A atualização de 2 de setembro do Qwen3.8-Max-0902 mantém essa tese intacta: os mesmos US$ 2/US$ 6 e contexto de 1M, com mais pós-treinamento nas tarefas de codificação e colaboração para as quais o modelo já estava posicionado. A atualização também adicionou um ranking independente de preferência humana para essa proposta de codificação: o Qwen3.8-Max-0902 estreou em #1 no ranking WebDev do Code Arena com 1.691 pontos, à frente de Claude Opus 5 e Kimi K3, e com um preço médio de ~US$ 5/MToken ele é o modelo de maior pontuação na fronteira de Pareto de custo-desempenho desse ranking. O resultado do CommerceAgentBench que a equipe Accio da Alibaba publicou na mesma semana — com o Qwen3.8-Max liderando o campo de pesos abertos em um benchmark construído a partir de fluxos de trabalho reais de comércio — dá a essa tese de trabalho colaborativo um ranking concreto próprio, ainda que conduzido pelo fornecedor.

O que mudou é que o árbitro e os pesos finalmente chegaram — e o veredito é majoritariamente bom, com ressalvas reais. A AA coloca o Qwen3.8-Max em 56 no Índice de Inteligência, um salto geracional genuíno que o deixa no mesmo nível do Claude Opus 4.8; ainda assim, o mesmo painel mostra o Kimi K3 um ponto à frente, com custo por tarefa 25% menor, e aponta uma queda de 10 pontos em Omniscience com uma taxa de alucinação em alta. A questão dos parâmetros ativos está resolvida — 95B ativados, confirmados na ficha do modelo — e a licença foi publicada, customizada em vez de Apache 2.0. O que não mudou: a tabela de benchmarks da própria Alibaba continua sem replicação independente; o custo por tarefa segue alto porque o modelo processa muitas etapas; a base aberta servida na DigitalOcean é um modelo ligeiramente diferente dos números de destaque do carro-chefe (contexto de 262K, NVFP4, verificação pontual de GPQA 88 contra 92,6); e as alegações de benchmark do Qwen3.8-27B são informadas pelo próprio fornecedor, embora os pesos já tenham sido disponibilizados. Essa combinação não faz do Qwen3.8-Max uma aposta ruim — a esse preço, ele está perto de ser um experimento obrigatório —, mas significa que a postura correta é avaliar com agressividade, rotear com deliberação e manter uma opção de reserva. O evento a observar agora é se a contagem de etapas agênticas por trás daquele custo de US$ 1,14 por tarefa é algo que sua carga de trabalho consegue absorver; se a liderança do build 0902 no Code Arena: WebDev se mantém à medida que os votos se acumulam; se os ganhos em Coding e Cowork se reproduzem em cargas de trabalho reais; se a liderança de pesos abertos no CommerceAgentBench — duas passadas agregadas no próprio harness da Alibaba — sobrevive a uma execução independente; se as alegações de benchmark do 27B se sustentam; e se a taxa de transferência medida na implantação da DigitalOcean se mantém sob tráfego real — é isso que decidirá se “só perde para o Fable 5” foi posicionamento ou profecia.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente