
Qwen 4 Max vs GLM-5.3: pesos abertos, licenças personalizadas e o nível que realmente é lançado
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O Qwen 4 Max teve sua prévia apresentada na conferência Yunqi, em Hangzhou, em 22 de setembro de 2026, como o carro-chefe de uma linha de quatro modelos que também inclui Qwen 4 Flash, Qwen 4 Plus e um nível Qwen 4 27B de pesos abertos. O GLM-5.3 da Z.ai está listado desde 18 de agosto de 2026, apenas texto, com uma janela de contexto de 1 milhão de tokens e um teto de saída de 128.000 tokens, a US$ 1,26 por milhão de tokens de entrada e US$ 3,96 por milhão de tokens de saída em nosso catálogo, contra as tarifas de tabela de US$ 1,40 e US$ 4,40 que a Z.ai publica. Ambos os laboratórios vêm da tradição de pesos abertos e ambos agora vendem modelos de nível de fronteira por meio de APIs hospedadas, então o enquadramento habitual de fechado versus aberto não se aplica aqui. O eixo que se aplica é aquele que ninguém coloca numa tabela de comparação: o que a licença realmente permite, e qual nível em cada família é aquele com o qual você tem permissão de fazer algo interessante.
Dois laboratórios, duas respostas para a mesma pergunta
A Alibaba e a Z.ai são as duas publicadoras de pesos abertos mais consistentes entre os laboratórios adjacentes à fronteira, e adotaram posturas diferentes quanto a quanto dessa abertura sobrevive na camada de ponta.
A geração Qwen 3.8 da Alibaba publicou os pesos de seu maior modelo — Qwen3.8-2.4T-A95B, em BF16 e FP8 — em 12 de agosto de 2026. Ela os publicou sob uma licença Qwen personalizada, não Apache 2.0. Essa distinção é justamente o ponto central: os pesos existem, o que significa que ajuste fino, quantização e auto-hospedagem são possíveis de uma forma que nunca será o caso para um modelo fechado, mas os termos são da própria Alibaba e não são o padrão permissivo que a expressão "pesos abertos" tende a sugerir.
A linha GLM da Z.ai vem de um laboratório com linhagem de pesos abertos, e o carro-chefe já não é uma exceção a isso. Os próprios pesos do GLM-5.3 foram publicados em 28 de agosto de 2026 — o carro-chefe de 743 bilhões de parâmetros, em 141 fragmentos safetensors — sob uma licença personalizada que a Z.ai escreveu para ele, em vez da MIT. Os termos são basicamente uma concessão da MIT com uma condição de revisão de segurança atrelada para empresas de modelo como serviço acima de um grande limite de receita. Observe o que isso significa para a família: GLM-5.2 e GLM-5.3-Flash têm licença MIT, e o carro-chefe não.
Conforme listado, o GLM-5.3 é um modelo somente de texto com uma janela de contexto publicada, um teto de saída publicado e uso documentado de ferramentas, modo JSON e raciocínio.
Coloque os dois lado a lado e o contraste prático é este:
• Pesos do modelo principal — o modelo principal Qwen 3.8, publicado sob uma licença Qwen personalizada, em comparação com os pesos do GLM-5.3, publicados em 28 de agosto de 2026 sob uma licença Z.ai personalizada
• Preço de entrada — Qwen3.8-Max $2,00 por 1M de tokens contra GLM-5.3 $1,26 por 1M de tokens no nosso catálogo, $1,40 na própria lista da Z.ai
• Preço de saída — Qwen3.8-Max US$ 6,00 por 1M de tokens versus GLM-5.3 US$ 3,96 por 1M de tokens no nosso catálogo, US$ 4,40 na própria lista da Z.ai
• Contexto — Qwen3.8-Max 1M tokens versus GLM-5.3 1M tokens
• Limite de saída — Qwen3.8-Max 128K tokens versus GLM-5.3 128K tokens
• Modalidade — entrada de texto, imagem e vídeo no Qwen3.8-Max versus GLM-5.3 somente texto, documentado como tal
• Etiquetas de capacidade — visão, ferramentas, JSON e raciocínio do Qwen3.8-Max versus ferramentas, JSON e raciocínio do GLM-5.3
• Qwen 4 Max — anunciado em 22 de setembro de 2026, sem preço, sem contexto, sem pesos, sem data, versus GLM-5.3 lançado e servindo tráfego
A linha multimodal é o que paga a diferença de preço. O flagship da Qwen aceita entrada de imagem e vídeo e cobra US$ 2,00 na entrada e US$ 6,00 na saída; o GLM-5.3 aceita texto e cobra US$ 1,26 e US$ 3,96. Se sua carga de trabalho for texto, você está pagando um prêmio de codificador de visão que nunca invoca, e essa é a razão mais concreta pela qual um especialista somente em texto supera um flagship multimodal em custo para trabalho com texto.

O nível 27B é o que decide isso.
Qwen 4 Max é a manchete e a categoria 27B é a história. Cada geração do Qwen lançou sua pequena categoria aberta sob termos que permitem que as pessoas façam coisas, e a evidência subsequente é inequívoca: poucos dias após os pesos do Qwen 3.8 27B chegarem, o ecossistema já havia produzido conversões MLX, quantizações NVFP4 e ajustes finos sem censura, nenhum dos quais exigiu permissão de alguém. É isso que um lançamento permissivo de modelo pequeno proporciona, e é uma forma de distribuição que nenhuma API hospedada consegue igualar.
O nível principal é outra questão. Um modelo de 2,4 trilhões de parâmetros publicado sob uma licença personalizada é aberto no sentido de que os bytes podem ser baixados e fechado no sentido de que o que você pode fazer com eles é definido pelo publicador. As duas coisas são verdadeiras ao mesmo tempo, e o anúncio do Qwen 4 não mudou nenhuma delas. Se o nível 27B do Qwen 4 seguir o padrão de seus antecessores, será o lançamento que importa para o maior número de pessoas, e também é o lançamento com a data de entrega mais previsível, porque níveis pequenos e abertos são a coisa mais fácil de concluir no roteiro.
O que traz a comparação de volta a algo utilizável. O GLM-5.3 é um modelo hospedado, com preço publicado e um conjunto de capacidades documentado, e está disponível agora. O Qwen 4 Max é um nome de nível. Se você quer que o argumento da abertura seja concreto em vez de filosófico, o modelo pelo qual vale a pena esperar é o 27B, não o Max.
A camada de roteamento é onde a questão da licença deixa de importar
Há uma versão desta decisão que evita por completo a questão da licença, e vale a pena ser honesto que é uma opção real, e não um meio-termo. Se o seu requisito é chamar um modelo em vez de possuir um, a licença sobre os pesos é irrelevante e os termos que importam são o preço, a latência e o comportamento em caso de falha.
O OrcaRouter disponibiliza o GLM-5.3 como z-ai/glm-5.3 a $1,26 de entrada e $3,96 de saída por milhão de tokens — abaixo dos $1,40 e $4,40 que a Z.ai publica, com a página do modelo a mostrar essas tarifas de tabela ao lado da tarifa que cobramos, e sem qualquer margem adicionada sobre o que pagamos ao fornecedor. O mesmo endpoint compatível com a OpenAI disponibiliza a família Qwen 3.8, Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B, juntamente com quase 200 outros modelos, com failover automático quando um caminho de fornecedor se degrada e uma DSL de encaminhamento que lhe permite expressar a política de substituição de forma explícita em vez de editar uma string de modelo no código da aplicação. Quando um fornecedor altera a sua tarifa, a alteração aplica-se à sua chave no mesmo dia, porque não há qualquer camada de margem onde possa ficar presa.
O que o OrcaRouter não oferece é o Qwen 4 Max nem qualquer nível do Qwen 4. O catálogo não tem entrada para a família, que é o estado correto para um modelo que foi anunciado em um palco e ainda não foi lançado. O Qwen 4 Max estará acessível, quando estiver acessível, por meio da API do próprio fornecedor e de várias plataformas de terceiros. Até então, o modelo Qwen desta comparação que você pode de fato chamar é o Qwen3.8-Max, e ele está no mesmo catálogo que o GLM-5.3 — o que faz da versão ao vivo deste confronto uma decisão de política de roteamento, e não de aquisição.

O que a questão da licença realmente decide
GLM-5.3 é mais barato nos dois eixos, sua janela de contexto e seu teto de saída equivalem aos do carro-chefe da Qwen, seus limites de modalidade estão documentados em vez de deixados à inferência, e ele já está atendendo tráfego hoje. O Qwen 4 Max tem um espaço em conferência e um nome de nível, e a única parte do roadmap do Qwen 4 com entrega previsível é o nível de 27B.
A decisão que sobrevive ao lançamento não é qual modelo é melhor. É se você precisa possuir a coisa. Se você precisa fazer auto-hospedagem, ajuste fino ou modificação, os pesos do modelo carro-chefe de qualquer um dos laboratórios vêm com termos que você deve ler antes de construir um negócio sobre eles, e a pequena camada aberta é onde as opções permissivas historicamente residiram. Se você precisa chamar um modelo, GLM-5.3 é a resposta mais barata hoje para trabalho com texto, Qwen3.8-Max é a resposta se você precisa de entrada de imagem ou vídeo, e ambos estão a um endpoint e uma fatura de distância. Revisite a questão do modelo carro-chefe quando a Alibaba publicar um cartão de modelo, e leia a licença antes da tabela de benchmarks.

Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
