
GLM 5.3 Prime: Os mesmos pesos do GLM-5.3, por exatamente o dobro da tabela de preços
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O GLM 5.3 Prime custa US$ 2,80 por milhão de tokens de entrada e US$ 8,80 por milhão de tokens de saída. O GLM-5.3, o modelo em que ele roda, custa US$ 1,40 e US$ 4,40. Isso não é uma diferença de arredondamento nem uma margem promocional — é exatamente 2,0× nas duas linhas, e é a única coisa em que os dois produtos divergem. O GLM 5.3 Prime não é um modelo novo. Ele carrega os próprios pesos do GLM-5.3, os que a Z.ai abriu em 25 de agosto de 2026, por trás de uma stack de serviço mais rápida. O próprio GLM-5.3 foi anunciado em 14 de agosto de 2026 e chegou à API em 18 de agosto. Nada no modelo subjacente mudou quando o ID Prime apareceu no final de setembro. O que mudou foi que alguém colocou uma segunda etiqueta de preço nele.
Se você está lendo isto porque uma lista de modelos mostrou um nome desconhecido ao lado de um familiar, a resposta curta é: você está olhando para um nível de serviço, não para um lançamento. A resposta longa vale dois minutos, porque a aritmética é incomumente limpa e a proveniência é incomumente obscura.
O que é um nível "Prime", em um parágrafo.
Uma camada de serviço é um segundo ID de produto apontado para os mesmos pesos, ajustado para taxa de transferência em vez de para custo. Você não obtém um modelo maior, um contexto mais longo, um modo de raciocínio melhor ou uma superfície de ferramentas mais ampla. Você obtém tokens saindo mais rápido, e paga por esse privilégio em cada token, em vez de pagar pelo tempo de relógio que economizou. Essa troca é real e às vezes correta — um loop de agente de várias etapas que faz dez chamadas sequenciais realmente se beneficia de cada chamada retornar mais cedo —, mas é uma compra de latência, não uma compra de capacidade, e deveria ser precificada como tal.
A descrição do fornecedor do GLM 5.3 Prime diz diretamente o que normalmente fica subentendido: ele é "a variante de alta velocidade do GLM-5.3 da Z.ai, herdando todas as suas capacidades e proporcionando 1,5–2× de throughput de saída por meio de aceleração de inferência". Capacidades completas. Mesma janela de contexto de 1.000.000 de tokens. Mesmo teto de saída de 131.072 tokens. Texto entra, texto sai. Raciocínio obrigatório, com baixo, alto e máximo níveis de esforço e máximo como padrão — idêntico ao modelo base.
A tabela de preços, lado a lado
• Entrada — GLM 5.3 Prime US$ 2,80 por 1M vs. GLM-5.3 US$ 1,40 por 1M
• Saída — GLM 5.3 Prime US$ 8,80 por 1M vs. GLM-5.3 US$ 4,40 por 1M
• Entrada em cache — GLM 5.3 Prime US$ 0,56 por 1M vs. GLM-5.3 US$ 0,26 por 1M
• Multiplicador — 2,0× em todas as três linhas, nas duas direções
• Contexto — 1.000.000 de tokens em ambos
• Saída máxima — 131.072 tokens em ambos
• Raciocínio — obrigatório em ambos, os mesmos três níveis de esforço, o mesmo padrão
A linha de cache é a que as pessoas deixam passar. Uma leitura de cache é o token mais barato que você vai comprar de um modelo de fronteira, e é onde as cargas de trabalho de agentes realmente gastam seu orçamento — o prompt de sistema, as definições de ferramentas e o transcript crescente são relidos a cada turno. Dobrar a taxa de cache dobra o maior item de custo em uma sessão longa de agente, o que significa que o prêmio efetivo sobre uma carga de trabalho real fica mais próximo de 2× do que sugere a diferença anunciada nos tokens de entrada novos. Se você esperava que a via rápida fosse mais barata na prática porque você faz cache de forma agressiva, não é o caso.
Quem está realmente vendendo isso?
É aqui que a listagem fica interessante, e é aqui que um leitor atento deveria diminuir o ritmo. A própria documentação da Z.ai, sua visão geral de modelos e sua página de preços publicada não listam nenhum SKU Prime. Pesquise os IDs de modelo do fornecedor por glm-5.3-prime e você não encontra nada. O próprio nível de velocidade da Z.ai é um produto diferente, em uma linha totalmente diferente — o GLM-5.3-FlashX, que fica na família Flash, mais barata, foi lançado em 18 de setembro de 2026 e tem preço de US$ 0,37 e US$ 1,25 por milhão de tokens.
Então o Prime é um produto do lado da plataforma, construído sobre os pesos da Z.ai. Dois detalhes apontam de quem é a plataforma. O primeiro é a expressão "throughput de saída de 1,5–2×", que é exatamente o mesmo texto que um grande provedor de nuvem usa para o seu próprio modo de serviço acelerado — um modo que você ativa trocando o ID do modelo, com capacidades e limites de uso explicitamente inalterados. O segundo é que a listagem nomeia exatamente um provedor upstream por trás do endpoint. Um único provedor por trás de um SKU de camada rápida não é como um modelo de pesos abertos é servido; é como a implantação acelerada de uma própria plataforma se parece vista de fora.
Nada disso faz do GLM 5.3 Prime um produto ruim. Isso o torna um produto com um único fornecedor, o que é uma questão de resiliência que você deve considerar antes de direcionar o tráfego de produção por ele.
Quanto vale a alegação de velocidade

A cifra de 1,5–2× é uma alegação de throughput medida nas condições do próprio fornecedor, e o throughput é a métrica mais sensível a essas condições. A taxa de tokens de saída por segundo com cache quente, um prompt curto e um cluster ocioso não é o número que um agente de contexto longo vê. A medição independente do modelo base coloca o GLM-5.3 em cerca de 61 tokens de saída por segundo e o GLM-5.3-Flash em torno de 46, num conjunto em que a média da classe é 67 — portanto, a opção mais barata também é a mais lenta, o que é o oposto do que os nomes sugerem. Essas são medianas de um conjunto de avaliação padronizado, não picos.
Há também um custo mais sutil. O padrão de esforço de raciocínio em ambos os IDs é max, que é a configuração que produz as cadeias de pensamento mais longas. Velocidade e verbosidade puxam em direções opostas aqui: uma camada rápida que também raciocina com comprimento máximo ainda pode ser lenta de ponta a ponta em um problema difícil, porque o gargalo é o número de tokens que o modelo decide gerar, não a taxa com que os gera. Se sua carga de trabalho for intensiva em raciocínio, reduza para high ou low antes de pagar 2× pela aceleração — o nível de esforço moverá sua latência mais do que a camada de serviço.
Três maneiras de comprar o mesmo modelo

O GLM-5.3 agora existe em três formas compráveis, e não são três modelos:
• GLM-5.3 a $1,40 / $4,40 — a tabela de preços base, capacidade total, a versão com pesos abertos publicados que você pode hospedar você mesmo
• GLM 5.3 Prime a $2,80 / $8,80 — os mesmos pesos por meio de uma pilha acelerada, um único fornecedor upstream, sem pesos envolvidos
• GLM-5.3-FlashX a $0,37 / $1,25 — não é GLM-5.3 de forma alguma, mas sim o nível de velocidade da família Flash mais barata, e de longe a maneira mais barata de comprar latência
É nessa terceira linha que vale a pena prestar atenção. Se o que você realmente quer são tokens mais rápidos e não faz questão de qual GLM eles vêm, o FlashX oferece aceleração em um modelo que já custa cerca de um décimo do modelo principal, por menos da metade do que o modelo principal custa sem aceleração. O Prime só faz sentido se você precisar especificamente da qualidade de raciocínio do GLM-5.3 e precisar dele especificamente mais cedo.
Onde isto se encaixa do nosso lado

Devemos ser claros sobre uma coisa: a OrcaRouter não hospeda o GLM 5.3 Prime, e também não hospedamos o GLM-5.3-FlashX. Ambas as páginas desses modelos retornam um 404 em nosso site. Se você quiser o nível acelerado, terá de comprá-lo da plataforma que o vende, ou da própria API do fornecedor para o modelo base.
O que nós hospedamos é o GLM-5.3 e o GLM-5.3-Flash, pelo preço de tabela do provedor, sem nenhuma margem nossa — os mesmos US$ 1,40 e US$ 4,40 que você vê na própria tabela de preços da Z.ai, repassados em vez de reprecificados. Isso importa mais do que parece para um modelo cujo preço mudou duas vezes em seis semanas. Como não adicionamos spread, uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia em que entra do lado deles, sem migração nem chamado de suporte. Ambos os IDs ficam atrás de uma única chave de API, ao lado de mais de 200 outros modelos, então um teste A/B entre GLM-5.3 e GLM-5.3-Flash é uma alteração de uma linha no nome do modelo, em vez de um segundo contrato, e o failover automático cobre você se um único provedor upstream degradar — que é o risco específico que uma camada rápida de fornecedor único carrega.
Você deve pagar o 2×
Pague por isso se um humano ou um serviço upstream estiver bloqueado à espera da resposta, se a carga de trabalho for limitada por latência em vez de limitada por throughput, e se você já tiver confirmado que o esforço de raciocínio é o verdadeiro fator determinante da sua latência. Não pague por isso se estiver executando geração em lote durante a noite, se o seu volume for alto o suficiente para que um prêmio de 2× por token ultrapasse o tempo de relógio que você economiza, ou se você estava esperando que o nível fosse, discretamente, um modelo melhor. Não é. É o GLM-5.3 com um cronômetro rodando, e o cronômetro cobra por token.
A forma honesta de enquadrar toda a família GLM-5.3 neste momento é que a Z.ai lançou um modelo em agosto e o mercado passou setembro o reembalando com quatro preços diferentes. O GLM 5.3 Prime é o mais caro desses pacotes. É também o que tem o histórico documental mais escasso, porque a empresa cujo nome está nos pesos não o lista. Isso não é motivo para evitá-lo. É motivo para saber exatamente o que você está comprando antes de colocá-lo em um caminho de produção.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
