Cartão de título principal para o artigo «Ox Alpha», com o subtítulo «A página de referência canónica para o alias furtivo por trás do GLM-5.3-Flash da Z.ai», etiquetas com o texto «Pré-visualizado como Ox Alpha a partir de 20 de agosto de 2026», «Revelado em 26 de agosto de 2026», «320B no total / 18B ativos, contexto de 1M» e «Licença MIT, pesos abertos», e uma linha de rodapé com o texto «Envelope, modalidades, tabela de preços, superfície de endpoints e benchmarks — verificada em 2026-09-28». O logótipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

Ox Alpha: A Ficha Técnica Completa do Modelo Stealth, Agora Disponível como GLM-5.3-Flash

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ox Alpha é o nome anônimo sob o qual GLM-5.3-Flash foi pré-visualizado, ele foi revelado em 26 de agosto de 2026, e não é um modelo que você possa chamar hoje. A listagem de pré-visualização que carregava o nome Ox Alpha não o disponibiliza mais; o modelo por trás tem uma página do fornecedor, pesos sob licença MIT, uma tabela de preços publicada e uma superfície de API documentada, e todos pertencem à Z.ai. Esta página é a referência para esse modelo — o envelope, as modalidades, a tabela de preços, a superfície de endpoints, cada número de benchmark publicado com a revisão ou o harness associado a ele e, como o alias ainda retorna um resultado de busca escasso e confuso, uma declaração clara do que não está documentado em lugar nenhum. Tudo abaixo foi lido em 2026-09-28 na documentação do modelo e na página de preços da própria Z.ai, no model card da Z.ai no Hugging Face, na Artificial Analysis e em nosso próprio catálogo; números que o fornecedor publica e números que um terceiro independente mede são rotulados separadamente, e nada aqui é inferido a partir de uma semelhança.

A que se refere hoje o nome Ox Alpha

O alias foi desativado, e foi o próprio fornecedor que o desativou. A documentação da própria Z.ai para o GLM-5.3-Flash diz que o modelo foi testado anonimamente sob o nome ox-alpha antes do lançamento, para coletar feedback dos usuários, e que a execução anônima se tornou o modelo mais popular daquela semana. As âncoras datáveis são curtas e específicas: a listagem furtiva mostrava o Ox Alpha como lançado em 20 de agosto de 2026, e a revelação ocorreu em 26 de agosto — a mesma data que a página de documentação da Z.ai traz e a mesma data de lançamento que nosso próprio catálogo registra para z-ai/glm-5.3-flash.

Duas coisas decorrem disso, e ambas importam para um leitor que pesquisou o nome.

• O alias não é uma rota. Nosso catálogo devolve "model not found" para uma consulta stealth/ox-alpha, leitura de 2026-09-28. Não há nada a chamar sob esse nome, porque o produto do fornecedor carrega o nome do fornecedor.

• Também não existe nenhum repositório de pesos pertencente ao fornecedor sob esse alias. Pesquisar "ox-alpha" no Hugging Face retorna uploads da comunidade criados durante a janela de sigilo no final de agosto de 2026, além de um repositório apenas com model card, de 27 de setembro de 2026, que não contém pesos e aponta para o lançamento oficial da Z.ai. O nome de um repositório é um rótulo escolhido por quem o enviou; não é documentação de nada. A própria organização da Z.ai publica o modelo como zai-org/GLM-5.3-Flash, com o repositório criado em 2026-08-25 em UTC.

A questão do fornecedor que dominou a semana anónima está encerrada, e encerrou-se da forma habitual: um deu um passo à frente e colocou o seu nome no modelo. O que resta é uma especificação, que é o que esta página aborda. A história da descoberta — a identificação por impressão digital que precedeu a revelação, a linhagem de modelos anónimos a que pertence e a divulgação do hardware de serviço que a acompanhou — está em o nosso artigo anterior sobre a investigação Ox Alpha, e esta página não reabre nada disso.

O envelope, como o fornecedor o documenta

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

Estes são números reportados pela Z.ai, lidos na própria página de documentação do fornecedor em 2026-09-28, e três das quatro dimensões do envelope são corroboradas de forma independente — o registro do modelo da Artificial Analysis traz os mesmos 320B no total, 18B ativos, contexto de 1.000.000 de tokens e licença MIT, e a nossa própria ficha de catálogo traz o contexto e os limites de saída.

• Janela de contexto — 1.000.000 de tokens (documentação da Z.ai; Artificial Analysis; nossa própria ficha de catálogo, que lista 1.000.000)

• Saída máxima — 128K tokens (documentação do Z.ai); nosso cartão registra 128.000

• Entrada — texto, imagem, vídeo e arquivo (documentação do Z.ai, consultada em 2026-09-28); nosso cartão lista texto, imagem e vídeo, e não afirma entrada de arquivo

• Saída — apenas texto, em todas as fontes

• Parâmetros — 320B no total com 18B ativados por token (documentação da Z.ai e ficha do modelo; a Artificial Analysis registra independentemente 320B e 18B)

• Licença — MIT, com pesos publicados no Hugging Face (cartão de modelo do fornecedor; a Artificial Analysis classifica o modelo como pesos abertos sob uma licença permissiva)

• Arquitetura — um híbrido de atenção esparsa e linear, que a Z.ai descreve como o primeiro modelo de fronteira de código aberto a combinar as duas, reduzindo o cálculo de atenção em 3,01× e o cache KV em 4,44× em relação ao GLM-5.3, além de uma etapa IndexPool que comprime quatro vetores de chave do indexador em um só em contexto longo, e Manifold-Constrained Hyper-Connections para eficiência de escalabilidade. Tudo declarado pelo fornecedor; não há auditoria arquitetural independente para citar.

• Pré-treinamento — um corpus multimodal de 30 trilhões de tokens (declarado pela Z.ai). O fornecedor não publica nenhuma cifra total de computação de treinamento nem nenhum detalhamento de parâmetros por camada além do número de destaque 320B/18B.

Uma alegação sobre o envelope foi reduzida desde o lançamento, e a documentação atual é a que deve ser citada. A divulgação do hardware de serviço que circulou em agosto situava a capacidade da semana anônima em cerca de 100.000 chips chineses domésticos. A documentação da Z.ai como se lê hoje diz que o modelo foi servido “em dezenas de milhares de aceleradores desenvolvidos domesticamente”, com uma melhoria de 3× no serviço ponta a ponta em relação à própria linha de base do fornecedor no mesmo hardware e um custo por token que o fornecedor descreve como comparável ao de GPUs NVIDIA convencionais. Dezenas de milhares é o que a página diz agora; o número maior é o da época do lançamento. Ambas são alegações da empresa, nenhuma foi auditada de forma independente, e a direção da revisão é para baixo.

A tabela de tarifas, e por que o número servido é o que importa

A página da Z.ai lista o GLM-5.3-Flash a $0,15 por milhão de tokens de entrada, $0,03 por milhão de tokens de entrada em cache e $0,50 por milhão de tokens de saída, e o nível irmão FlashX a $0,37 / $0,075 / $1,25. Esse é o preço de tabela do fornecedor, lido na própria página do fornecedor em 28/09/2026.

A tarifa efetivamente aplicada em nossa rota hoje é menor, e este é o ponto prático da seção. Lido em 2026-09-28, o cartão do OrcaRouter para z-ai/glm-5.3-flash precifica a entrada em $0.075 por milhão de tokens, a saída em $0.25 por milhão e leituras de cache em $0.0173 por milhão. Isso é metade da tarifa de tabela do fornecedor, no mesmo modelo, no mesmo dia — o valor com desconto em vez da tarifa anunciada, sem rótulo promocional no cartão. Nossa cobertura anterior deste modelo observou a mesma lacuna depois que a janela promocional declarada fechou; a observação continua válida hoje, e ainda não conseguimos apurar o motivo, então relatamos o número aplicado e deixamos a causa em aberto.

A entrada em cache é onde as três fontes divergem visivelmente, o que é um lembrete útil de que um "$0.03" numa tabela não é necessariamente um preço que alguém paga. A página do fornecedor diz $0.03 por milhão de tokens de entrada em cache; o registro do modelo da Artificial Analysis traz um preço de acerto de cache de $0.026; nossa rota fornece leituras de cache a $0.0173. Todas as três foram lidas em ou pouco antes de 2026-09-28, todas reportadas pelo fornecedor ou pela plataforma. Citamos o valor de tabela do fornecedor como o valor de tabela e o valor servido como aquilo que é efetivamente cobrado de quem faz a chamada.

Faça as contas em um trabalho de agente representativo — 100.000 tokens de entrada e 10.000 tokens de saída, sem acertos de cache:

• À tarifa de lista do fornecedor — 100.000 tokens × US$ 0,15/1M = US$ 0,015, mais 10.000 × US$ 0,50/1M = US$ 0,005, então US$ 0,020 por chamada

• À tarifa que nossa rota pratica hoje — $0,0075 mais $0,0025, ou seja, $0,010 por chamada, exatamente metade

Esse é o motivo principal para verificar o preço efetivamente praticado, e não o preço de tabela, antes de dimensionar uma carga de trabalho: em um agente de horizonte longo que executa milhares de chamadas por dia, a diferença entre esses dois números é a diferença entre dois orçamentos. A OrcaRouter repassa o preço de tabela do provedor com 0% de markup, e é por isso que o desconto que o fornecedor está oferecendo aparece no nosso cartão, em vez de ser absorvido em algum ponto intermediário.

Modalidades e superfície do endpoint

O fornecedor documenta um formato de interface e dois códigos de modelo: glm-5.3-flash e glm-5.3-flashx, ambos servidos através da API de Conclusão de Chat. As imagens entram como um bloco de conteúdo com o tipo image_url no array de conteúdo da mensagem, aceitando um URL — que o fornecedor recomenda — ou um URL de dados em base64, e vários blocos de imagem podem ser enviados numa única mensagem. O streaming é suportado, e a Z.ai recomenda ativar stream e tool_stream em conjunto para pedidos de streaming. A chamada de ferramentas, a cache de contexto e a saída JSON estruturada são todas capacidades documentadas; o raciocínio é suportado mas, como explica a secção seguinte, não é opcional.

O FlashX é um nível de serviço separado do mesmo modelo, e não uma capacidade separada: a Z.ai documenta-o a 200 tokens por segundo e afirma que ainda não está disponível no GLM Coding Plan. Não é o nível que o nosso catálogo apresenta, nem é o que os números desta página descrevem.

Na nossa rota, a superfície do endpoint é mais restrita e vale a pena declarar exatamente. A ficha de z-ai/glm-5.3-flash expõe POST /v1/chat/completions — apenas chat completions, sem um segundo endpoint de protocolo — e aceita reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens e stop. Os chips de capacidade na ficha são visão, ferramentas, JSON e raciocínio. O contexto é de 1.000.000 de tokens e a saída máxima é de 128.000, correspondendo à documentação do fornecedor.

Esforço e raciocínio: as configurações que fixam cada número de benchmark

Esta é a parte da especificação que mais muda a forma como você lê as pontuações, e o fornecedor a documenta com precisão. O GLM-5.3-Flash aceita um reasoning_effort com três níveis — low, high, max — e o padrão é max se você não passar nada, ou se passar qualquer coisa que não seja low. O pensamento não pode ser desativado: o fornecedor afirma que thinking.type suporta thinking.type, e o clear_thinking do template de chat tem como padrão, e a Z.ai recomenda explicitamente como true. As configurações de amostragem recomendadas pelo fornecedor são temperature 1 e top_p 0.95, e ele afirma claramente que a reprodução de benchmark e leaderboard deve usar esforço máximo.

Leia esses dois fatos em conjunto e a consequência para quem compara números é inevitável: uma pontuação citada sem um nível de esforço não é uma medição completa, porque as configurações low, high e max são pontos de operação diferentes do mesmo modelo, e o padrão é o mais caro dos três. Nosso cartão expõe reasoning e reasoning_effort entre seus parâmetros suportados, então a configuração é acessível pela rota, e não apenas pelo fornecedor.

A folha de benchmark, com a revisão em anexo

A Z.ai publica uma tabela de benchmarks para o GLM-5.3-Flash, e ela é inteiramente informada pelo fornecedor — o registo independente da Artificial Analysis não reproduz estas linhas. Os valores de destaque do fornecedor para codificação e agentes são DeepSWE v1.1 em 63,4 contra os 46,2 do GLM-5.2, e AutomationBench v1.0.6 em 48,8 contra os 26,2 do GLM-5.2. O resto da tabela, tal como o nosso próprio catálogo a apresenta, com a Z.ai como fonte nomeada: Humanity's Last Exam com ferramentas 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography com ferramentas 78, raciocínio CharXiv com ferramentas 89,4 e, do lado da visão, MMVU 80,5, MVBench 77,8 e BabyVision 53,4.

Duas linhas de fornecedores merecem que suas notas de rodapé sejam incluídas na frase, porque são aquelas que um leitor tem maior probabilidade de citar sem elas. A avaliação interna de codificação da Z.ai, Z.ai Code Bench v1.0, coloca o GLM-5.3-Flash em 29,0 no esforço máximo contra o Claude Opus 4.8 em 29,5 — um quase empate no próprio harness do fornecedor, executado no Claude Code 2.1.207, relatado pelo fornecedor. Isso não é uma comparação independente e não é uma comparação de esforço equiparado executada por um terceiro; é a Z.ai avaliando seu modelo contra um concorrente em sua própria avaliação. E o fornecedor cita um Artificial Analysis Intelligence Index de 57 a US$ 0,045 por tarefa, nomeando a revisão como v4.1.1.

Esse último número precisa ser separado do que a Artificial Analysis publica hoje, porque os dois não podem ser colocados lado a lado como um movimento. A própria página da Artificial Analysis para o GLM-5.3-Flash, consultada em 28/09/2026, informa um Intelligence Index de 41.8 no Índice v4.3.2, registrado em esforço máximo. A v4.3.2 incorpora dez avaliações — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR v1.1 — e a v4.1.1 não. Duas revisões de índice, dois conjuntos de tarefas, dois números. Nenhum dos dois está errado; não são a mesma medição, e citar o 57 ao lado do 41.8 como se o modelo tivesse se deslocado seria um erro em qualquer direção.

O que o registro independente corrobora é o envelope, e não as pontuações: a Artificial Analysis registra de forma independente 320B de parâmetros totais, 18B ativados, uma janela de contexto de 1.000.000 de tokens, licenciamento MIT, pesos abertos e uma data de lançamento em 2026-08-26, e lista preços do fornecedor de $0.15 de entrada e $0.50 de saída por milhão de tokens, com um preço de acerto de cache de $0.026. Onde o fornecedor publica uma pontuação e a parte independente não o faz, nós o dizemos; onde a parte independente confirma uma especificação, essa é a classe mais forte de fato nesta página.

Não há aqui um confronto direto emparelhado, e dizê-lo é mais útil do que produzir um. Ninguém publicou uma execução do GLM-5.3-Flash contra o Claude Opus 4.8, o GPT-6 Sol ou o Grok 4.7 com um esforço declarado num harness compartilhado — a comparação da própria Z.ai é no seu próprio bench, com esforço máximo, contra o padrão de um concorrente. Até que isso mude, a comparação honesta entre este modelo e qualquer outro é em preço, envelope e superfície de endpoint, que são as três coisas nesta página que todos podem ler a partir dos mesmos números.

O que não está documentado, dito claramente

Uma página de referência para um modelo com uma superfície informacional escassa só é útil se for honesta quanto às lacunas, e esta tem várias.

• Não há data de corte de conhecimento do fornecedor. A documentação da Z.ai e o model card do Hugging Face não declaram nenhuma, e o registro da Artificial Analysis deixa o campo nulo. As estimativas da janela stealth são trabalho da comunidade, não um valor do fornecedor, e esta página não repete nenhuma como se fosse.

• Sem notas de rodapé sobre o harness para a maior parte da planilha de benchmark. O model card, porém, traz notas de rodapé para a execução do HLE com ferramentas — temperatura 1.0, top_p 0.95, comprimento máximo de geração de 163.840 tokens, avaliação com até 300.000 tokens de contexto com uma estratégia de gerenciamento de contexto, e GPT-5.6 Luna em esforço médio como modelo juiz — e para NL2Repo e DeepSWE, que, segundo o fornecedor, foram executados com o harness mini-swe-agent. As linhas restantes são porcentagens puras, sem harness ou esforço associado.

• Nenhuma explicação para a disparidade de preços de entrada em cache. Três valores para a mesma quantidade no mesmo modelo, e nenhuma fonte informa por que diferem.

• Nenhum benchmark independente do período de serviço anônimo. A listagem sigilosa se foi; o que quer que ela tenha medido não pode ser medido de novo, e nenhum terceiro publicou uma execução contra o alias enquanto ele estava no ar.

• Nenhuma comparação de terceiros com esforço equiparado, pelo motivo apresentado acima.

• Nenhuma confirmação do fornecedor sobre a contagem de chips da época do lançamento. A documentação menciona dezenas de milhares de aceleradores nacionais; o número de 100.000 não consta na página.

Resumindo: o que o nosso catálogo oferece, verificado hoje

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

O modelo por trás do Ox Alpha está disponível em nosso catálogo sob seu próprio nome, verificado hoje em vez de presumido. Uma leitura da API de modelos do OrcaRouter para z-ai/glm-5.3-flash em 2026-09-28 retornou a ficha completa: contexto de 1.000.000 de tokens, saída máxima de 128.000, entrada de texto, imagem e vídeo com saída de texto, os chips de capacidade visão, ferramentas, JSON e raciocínio, data de lançamento em 2026-08-26, não obsoleto e não retirado da lista, com preço de $0,075 por milhão de tokens de entrada, $0,25 por milhão de tokens de saída e $0,0173 por milhão de tokens de entrada em cache, por meio do único endpoint POST /v1/chat/completions.

Nossa própria medição de sete dias no playground naquele cartão, para o mesmo período, registra 61,8 tokens de saída por segundo, um tempo p50 até o primeiro token de 7,39 segundos e uma taxa de erro de 1,47%. Esses são números próprios sobre nosso serviço de inferência, não números de fornecedores nem benchmarks independentes, e são os únicos números de velocidade nesta página por esse motivo.

O alias em si não está na rota. Se você chegou aqui depois de pesquisar por Ox Alpha, o modelo a chamar é z-ai/glm-5.3-flash, e o formato da requisição é o descrito acima. Ele fica na mesma chave que todo o resto do catálogo — uma API para mais de 200 modelos, o preço do provedor repassado sem markup adicional, e failover automático se um provedor travar, então um modelo que você está testando não precisa ser um modelo do qual seu caminho de produção depende.

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

Um esclarecimento sobre o que é esta página, já que um leitor que chega pelo próprio nome do modelo merece isso. Esta é uma página de referência para um modelo que já está no catálogo, não um relatório de lançamento: o GLM-5.3-Flash é de 26 de agosto de 2026, e seu lugar aqui se baseia no fato de que o nome Ox Alpha continua sendo pesquisado sem uma página dedicada para onde aterrissar, e não na novidade do lançamento. A data acima é usada para datar o modelo, não como notícia. O que mudaria esta página é uma de quatro coisas — uma execução independente de benchmark com um nível de esforço declarado, um corte de conhecimento declarado pelo fornecedor, uma mudança na tarifa cobrada ou uma decisão da Z.ai de declarar qual era de fato o número de chips da época do lançamento. Até que uma dessas coisas aconteça, a especificação acima é tudo o que o fornecedor documenta, e as lacunas listadas na seção anterior são tanto parte da resposta quanto os números.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente