
GLM-5.3-Flash Revelado: O Anônimo "Ox Alpha" Sempre Foi o Modelo Multimodal de Fronteira Aberto da Zhipu
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
O modelo que passou uma semana no topo dos rankings de uso de plataformas de codificação de terceiros finalmente tem nome e preço. Em 26 de agosto de 2026, a Zhipu AI confirmou que o modelo gratuito "Ox Alpha" que os desenvolvedores vinham usando intensamente desde 20 de agosto é o GLM-5.3-Flash — um modelo mixture-of-experts com 320 bilhões de parâmetros no total e 18 bilhões ativos (320B-A18B), o primeiro lançamento nativamente multimodal da série GLM-5 e um dos modelos de nível frontier mais baratos em qualquer tabela de preços no lançamento. A Zhipu está precificando o GLM-5.3-Flash a um décimo da tarifa da API do seu carro-chefe GLM-5.3, ou a um vigésimo durante um desconto por tempo limitado, e os pesos abertos — com licença MIT — foram para o Hugging Face no mesmo dia. Diferentemente do GLM-5.3, cujos pesos ainda estão previstos para o final do mês, este modelo pode ser auto-hospedado nesta semana, não na próxima.
Aqui está a versão resumida: {{1}}a Zhipu disponibilizou em código aberto seu modelo grande mais barato até agora{{/1}}, {{2}}ele supera o próprio GLM-5.2 em benchmarks, apesar de usar uma fração dos parâmetros ativos{{/2}}, e {{3}}a fornecedora atribui ao modelo uma pontuação de 57 no Artificial Analysis Intelligence Index — igualando o Claude Opus 4.8{{/3}}, segundo os materiais de lançamento da Zhipu. {{4}}Todos os números de benchmark associados a este lançamento são fornecidos pela própria empresa e não foram reproduzidos até o momento desta escrita{{/4}}; {{5}}os preços e as contagens de parâmetros são fatos atuais{{/5}}.
O que realmente foi lançado
{{1}}GLM-5.3-Flash é um MoE de 320B no total / 18B ativos com 45 camadas, o que coloca sua pegada ativa em pouco mais da metade dos ~32B de parâmetros ativos do GLM-5.2.{{/1}} {{2}}A capacidade principal é a modalidade: ele processa nativamente entrada de texto, imagem e vídeo — o primeiro modelo GLM-5 a fazer isso — em vez de rotear a visão por um adaptador separado.{{/2}} {{3}}O contexto chega a 1 milhão de tokens, e a Zhipu afirma que o custo de servir contextos longos fica em aproximadamente um terço do custo do GLM-5.3.{{/3}}
Do lado da arquitetura, a Zhipu a descreve como o primeiro modelo de fronteira de código aberto a usar um design híbrido de atenção esparsa mais atenção linear, combinado com Manifold-Constrained Hyper-Connections (mHC) para escalonamento e um mecanismo IndexPool que comprime quatro vetores-chave do indexador em um pool ponderado para reduzir a latência de contexto longo. O pré-treinamento foi executado em um corpus multimodal de 30 trilhões de tokens. Nada disso foi auditado de forma independente ainda — é a descrição da Zhipu sobre seu próprio modelo — mas as alegações de eficiência de serviço são específicas o suficiente para testar uma vez que os pesos estejam diante da pilha de inferência de código aberto.
A ficha técnica do dia do lançamento, num relance:
• Parâmetros — 320B total / 18B ativos, 45 camadas, MoE.
• Modalidade — entrada nativa de texto, imagem e vídeo; saída de texto.
• Janela de contexto — até 1.000.000 de tokens.
• Licença — MIT, pesos abertos disponíveis no Hugging Face no lançamento.
• Preço — $0,15 / $0,50 por milhão de tokens (entrada / saída), $0,03 por milhão de entrada em cache; uma promoção com 50% de desconto até 9 de setembro de 2026 reduz isso para $0,075 / $0,25 / $0,015. No preço de tabela, isso é aproximadamente um décimo dos $1,40 / $4,40 do GLM-5.3.

A semana Ox Alpha
O anúncio encerra uma semana de especulação. Em 20 de agosto, um modelo anônimo apareceu em uma plataforma de API de IA de terceiros com uma janela de contexto de 1 milhão de tokens, entrada de texto/imagem/vídeo e preço zero, e rapidamente se tornou o modelo com mais chamadas nos rankings semanais da plataforma. A comunidade o identificou como pertencente à família GLM da Zhipu em 48 horas — o mesmo padrão de anonimato seguido de reivindicação que já havia identificado modelos de outros laboratórios chineses — e analistas amplamente adivinharam uma variante Flash do GLM-5.3. O anúncio de 26 de agosto confirmou a suposição e acrescentou o detalhe de que a semana gratuita foi um teste intencional: a Zhipu afirma que a execução anônima estabeleceu recordes de volume de chamadas nas plataformas de codificação onde foi oferecida, com todo o tráfego servido por chips domésticos chineses.
Esse contexto de semana gratuita é relevante para as expectativas de precificação. Um modelo distribuído de graça por US$ 0 durante uma semana, e depois lançado a um décimo da tarifa do carro-chefe com um desconto de um vigésimo do preço por tempo limitado, é uma jogada deliberada de criação de mercado no segmento econômico — e o qualificador "tempo limitado" é a parte a observar. O desconto é uma decisão de precificação que pode ser revertida; os pesos abertos MIT, não.

Quanto custa, em dólares reais.
A tabela de preços da Zhipu foi divulgada em dólares reais, não apenas em proporções: US$ 0,15 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,03 por milhão de tokens de entrada em cache. Em comparação com os US$ 1,40 / US$ 4,40 publicados do GLM-5.3, isso chega a aproximadamente um décimo do preço de lista, e uma promoção de lançamento com 50% de desconto válida até 9 de setembro de 2026 reduz para US$ 0,075 / US$ 0,25 / US$ 0,015 — aproximadamente um vigésimo. A Zhipu também estima o custo por tarefa do índice AA Intelligence Index do modelo em cerca de US$ 0,045, conforme divulgado pelo fornecedor, que é o número por trás da comparação de "1/40 do Opus 4.8". Para um modelo que pontua na mesma faixa de modelos com preços 10 a 40 vezes maiores, a economia anunciada é real; as letras miúdas são que o desconto de lançamento é temporário e o custo por tarefa depende de quão verboso o modelo se mostrar em produção.
A história da eficiência é onde a Zhipu afirma que vem a vantagem de custo. Em comparação com o GLM-5.3, a fornecedora relata computação de atenção 3,0x menor e cache KV 4,4x menor, e afirma ter a menor computação de atenção entre os modelos de camada econômica comparados — GLM-5.3, DeepSeek V4 Flash e Kimi K3 — embora admita que seu cache KV ainda é ligeiramente maior que o do DeepSeek V4 Flash e o do Kimi K3. No lado de servir, a Zhipu relata uma melhoria de 3x no desempenho de servir de ponta a ponta em relação à linha de base em chips chineses domésticos, alcançando um custo por token que considera comparável aos GPUs NVIDIA convencionais. Todos esses números são fornecidos pela própria vendor e nenhum foi reproduzido de forma independente até agora; são os números certos para verificar contra os pesos abertos.
Por que a revelação importa
Deixando os benchmarks de lado, o lançamento ainda muda o cenário dos modelos abertos de duas maneiras. Primeiro, é um modelo multimodal de pesos abertos na faixa de fronteira a um preço acessível — a combinação de licença MIT, contexto de 1M, entrada nativa de imagem/vídeo e custo de centavos por tarefa não tem equivalente direto nos laboratórios de fronteira dos EUA, cujos modelos multimodais equivalentes custam uma ordem de magnitude a mais e são lançados fechados. Segundo, ele enfraquece o próprio carro-chefe da Zhipu: o GLM-5.3 é o modelo de 743B que obteve pontuação de 60 medida de forma independente no AA Intelligence Index neste mês, e o GLM-5.3-Flash é posicionado como "inteligência de fronteira, custo relâmpago" contra essa mesma família. A tese da Zhipu é que um modelo menor e mais barato pode capturar a maior parte da capacidade do carro-chefe — o que, se as alegações de codificação e agênticas do fornecedor se confirmarem, é o mesmo argumento da economia pós-treinamento que a indústria vem debatendo o ano todo.
Uma ressalva mantém isso em perspectiva. A pontuação de 57 no AA Index do GLM-5.3-Flash vem dos materiais de lançamento da própria Zhipu, ainda não do leaderboard da Artificial Analysis, e a comparação de codificação com o Claude Opus 4.8 é a avaliação interna Z.ai Code Bench da Zhipu. Trate o 57 e a paridade de codificação como alegações até que uma medição independente chegue — o modelo foi amplamente testado anonimamente, então números de terceiros devem chegar rapidamente.
Experimente e veja como a camada de roteamento se encaixa.
O acesso no primeiro dia é feito pela própria API da Zhipu, pelos pesos abertos no Hugging Face (zai-org/GLM-5.3-Flash, MIT) e pelos produtos de codificação da Zhipu — ZCode e o GLM Coding Plan, que inclui um lote de cartões de experiência diários. Para auto-hospedagem, a licença MIT, aliada ao suporte a vLLM e SGLang, significa que as alegações de eficiência de serviço acima são diretamente verificáveis.
No lado do roteamento, o próprio GLM-5.3-Flash ainda não está na lista do OrcaRouter nesta atualização. O restante da família GLM está: o GLM-5.3 entrou no ar em nosso lado no mesmo dia em que a API da Zhipu foi aberta, pelo preço de tabela da Zhipu com repasse de margem de 0%. Esse repasse é exatamente o mecanismo que importa para um lançamento como este — uma alteração de preço do fornecedor, seja o desconto mantido ou a tabela de preços alterada depois, aparece do nosso lado no mesmo dia, sem renegociação. Se você quiser executar o Flash contra o restante da linha GLM em uma única chave assim que ele for disponibilizado, essa é a configuração; até lá, os pesos no Hugging Face são a maneira mais rápida de testá-lo você mesmo.

O que assistir em seguida
Três coisas definem a história real nas próximas duas semanas. Primeiro, uma medição independente da Artificial Analysis do 57 — o modelo já estava rodando publicamente como Ox Alpha, então o leaderboard deve atualizar rapidamente. Segundo, se a promoção de 50% de desconto — atualmente com término previsto para 9 de setembro de 2026 — será estendida para além dessa data, já que isso decide o custo de estado estacionário do Flash. Terceiro, os pesos do GLM-5.3, ainda prometidos para por volta de 28 de agosto — na mesma semana em que os pesos MIT do Flash foram disponibilizados, o que daria à comunidade de pesos abertos dois níveis da mesma família para comparar de uma só vez.
Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
