GLM-5.3-Flash vs DeepSeek V4 Flash — Qual modelo de fronteira acessível você deve chamar? Ilustração regenerada.
Guides & Insights

GLM-5.3-Flash vs DeepSeek V4 Flash: Qual Modelo de Fronteira Acessível Você Deve Chamar?

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Inteligência no nível frontier costumava começar em cinco dólares por milhão de tokens de entrada; hoje dois modelos entregam isso por trocados, e estão lado a lado na mesma faixa de preço. GLM-5.3-Flash, o modelo multimodal de 18B ativos da Zhipu AI que se tornou open source em 26 de agosto, e DeepSeek V4 Flash, o codificador agêntico de ~13B ativos que a DeepSeek colocou em produção no final de julho, são os dois argumentos mais fortes de que "quase-fronteira por centavos" é agora uma categoria real de produto. Eles diferem mais do que seus preços sugerem: um é um generalista nativamente multimodal com pesos MIT, o outro é um especialista comprovado em codificação e agentes, com pontuações independentes de benchmark por trás.

A resposta curta para a maioria das equipes: se você quer um modelo multimodal barato e aberto para construir em cima, GLM-5.3-Flash; se você quer um modelo de codificação com números de agente medidos de forma independente que você possa defender em uma reunião, DeepSeek V4 Flash. O restante desta página é o raciocínio, o placar por dimensão e as ressalvas — começando pela ressalva honesta de que uma parte das alegações do GLM-5.3-Flash é relatada pelo fornecedor, enquanto os números principais do DeepSeek V4 Flash são medidos de forma independente.

O confronto em uma passada

Ambos os modelos são arquiteturas de mistura de especialistas com cerca de 300B de parâmetros no total e menos de 20B ativos por token; ambos suportam uma janela de contexto de 1M de tokens e ambos têm pesos abertos. É aí que as semelhanças terminam. O GLM-5.3-Flash é o primeiro modelo multimodal nativo da linha GLM-5 da Zhipu — com entrada de texto, imagem e vídeo — e foi lançado com licença MIT, o que significa que você pode hospedá-lo por conta própria hoje mesmo. O DeepSeek V4 Flash é a versão de produção do modelo que a DeepSeek vem iterando desde abril; sua versão principal é de texto e código, sua arquitetura é otimizada para uso agêntico de ferramentas, e a visão é entregue separadamente em uma versão experimental, em vez de nativamente. No índice de inteligência, a Zhipu afirma 57 para o Flash, contra os 50 do DeepSeek V4 Flash, medidos de forma independente — uma diferença significativa, se isso se mantiver, e o número a observar para confirmação por terceiros.

A generated two-column scoreboard titled 'GLM-5.3-Flash vs DeepSeek V4 Flash — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column DeepSeek V4 Flash: AA Index 50 (independent), Active params ~13B, Context 1M tokens, Modality text (vision in exp build), Open weights yes, Price $0.14/$0.28. Footer: GLM figures vendor-reported; DeepSeek figures independently measured where noted.

Inteligência e benchmarks

Esta é a seção onde a disciplina de sourcing importa, porque os dois modelos têm bases de evidência muito diferentes.

• AA Intelligence Index — GLM-5.3-Flash 57, de acordo com os materiais de lançamento da Zhipu (não reproduzidos), vs DeepSeek V4 Flash 50, medido de forma independente pela Artificial Analysis. Para efeito de comparação, Claude Opus 4.8 fica perto de 57 e Kimi K3 em 57 no mesmo índice.

• SWE-bench Verified — nenhum resultado do GLM-5.3-Flash publicado até agora, vs DeepSeek V4 Flash 79,0% (independente).

• LiveCodeBench — ainda não há número publicado para o GLM-5.3-Flash, vs DeepSeek V4 Flash 91,6% (independente).

• Agents' Last Exam — nenhuma pontuação do GLM-5.3-Flash publicada ainda, vs DeepSeek V4 Flash 25.2 (independente).

• Alegação de paridade de codificação — A Zhipu relata que a codificação do GLM-5.3-Flash em seu Z.ai Code Bench interno é comparável ao Claude Opus 4.8 (relatado pelo fornecedor, não reproduzido).

• Contexto familiar — GLM-5.3, o irmão mais velho do Flash, pontua 60 no AA Index de forma independente; no Terminal-Bench 2.1, a linha GLM-5.3 da própria Zhipu varia de 83.1–88.2 em execuções da comunidade. O Terminal-Bench 2.1 do DeepSeek V4 Flash é 82.7 (independente).

A assimetria é o ponto: os números de codificação e agênticos do DeepSeek V4 Flash foram reproduzidos por terceiros desde seu lançamento em julho, enquanto os do GLM-5.3-Flash são afirmações de primeiro dia do fornecedor. Os 57 do Flash são sete pontos acima dos 50 do Deep​Seek, se a Zhipu estiver certa, mas o modelo foi amplamente testado anonimamente antes do lançamento, então pontuações independentes devem chegar rapidamente.

Codificação e agentes: a verdadeira diferenciação

Se você estiver comprando um modelo de baixo custo para uma carga de trabalho de codificação agêntica, a base de evidências importa mais do que o delta bruto do índice. O DeepSeek V4 Flash passou por um novo pós-treinamento especificamente para capacidade agêntica em sua build de produção, e seus números medidos de forma independente — 79.0 SWE-bench Verified, 91.6 LiveCodeBench, 82.7 Terminal-Bench 2.1 — são a referência contra a qual os concorrentes agora são medidos no segmento de baixo custo. A afirmação de codificação da Zhipu para o GLM-5.3-Flash tem força comparável à do Claude Opus 4.8 em seu próprio benchmark interno, o que é uma afirmação forte, mas ainda não independente.

Há também uma diferença comportamental que vale a pena conhecer. Relatos da comunidade sobre o DeepSeek V4 Flash descrevem um pensamento comparativamente contido — cerca de 25–45% dos tokens de saída são tokens de raciocínio, com um fator de expansão de saída em torno de 1.3–1.5x — que é o que mantém baixo o custo por tarefa. A Zhipu não publicou dados comparáveis de verbosidade para o GLM-5.3-Flash, e a verbosidade é a variável que transforma uma tabela de preços barata em uma tarefa cara. Até que a expansão real de tokens do Flash seja medida, a diferença efetiva de custo por tarefa entre esses dois é maior do que a diferença por token.

Multimodal, ou ainda não

Este é o diferenciador mais claro. O GLM-5.3-Flash aceita nativamente imagens e vídeo junto com texto — o primeiro modelo GLM-5 a fazer isso — e a Zhipu afirma que seu custo de serviço de contexto longo é cerca de um terço do custo do GLM-5.3. A versão de produção do DeepSeek V4 Flash é texto e código; a capacidade multimodal do DeepSeek reside em uma versão experimental de visão separada, o que significa que uma carga de trabalho de visão no lado do DeepSeek implica um endpoint de modelo diferente e um histórico de avaliação diferente. Se hoje o seu pipeline precisa de compreensão de imagens ou vídeo de um modelo de baixo custo, o GLM-5.3-Flash é o único dos dois que o oferece nativamente.

Preço: os números reais.

Ambos os modelos subcotam todo o resto em sua faixa de capacidade, mas em cronogramas diferentes.

• GLM-5.3-Flash — A Zhipu o precifica a um décimo dos US$ 1,40 / US$ 4,40 por milhão de tokens do GLM-5.3, o que resulta em aproximadamente US$ 0,14 / US$ 0,44, ou US$ 0,07 / US$ 0,22 durante o desconto de lançamento por tempo limitado. A Zhipu também afirma cerca de US$ 0,045 por tarefa no AA Intelligence Index. Os valores em dólares são derivados das proporções declaradas pela Zhipu; a proporção em si é um fato atual.

• DeepSeek V4 Flash — $0.14 por milhão de tokens de entrada, $0.28 por milhão de tokens de saída, a taxa oficial publicada pela Deep​Seek, com o preço da entrada com cache hit muito mais baixo. Estimativas independentes de custo por teste estimam seu custo em cerca de $0.03 por teste de benchmark — o modelo de grande porte mais barato do mercado.

• Contexto longo — GLM-5.3-Flash a cerca de um terço do custo de contexto longo do GLM-5.3 (afirmação do fornecedor) vs DeepSeek V4 Flash com contexto de 1M a US$ 0,14 / US$ 0,28 com saída máxima de ~393K.

No papel, os dois preços de tabela quase se igualam, e o desconto torna o GLM-5.3-Flash mais barato por token por enquanto. O problema é que o preço por token do DeepSeek V4 Flash é estável e sua verbosidade é medida, enquanto o preço do Flash é um desconto temporário e sua verbosidade ainda não — portanto, a previsão honesta é que a diferença de custo efetivo é menor do que a diferença de tabela, e pode até se inverter assim que ambos forem medidos no mesmo conjunto de tarefas.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Velocidade e custo de serviço

A Zhipu afirma que o GLM-5.3-Flash tem o menor custo computacional de atenção entre os modelos de orçamento comparados — GLM-5.3, DeepSeek V4 Flash e Kimi K3 — com o computo de atenção reduzido em 3,0x e o cache KV reduzido em 4,4x em relação ao GLM-5.3, embora admita que seu cache KV ainda é ligeiramente maior que o do DeepSeek V4 Flash. No lado da inferência, a Zhipu relata uma melhoria de 3x no desempenho de inferência ponta a ponta em chips chineses domésticos, com um custo por token que ela considera comparável ao das GPUs NVIDIA convencionais. Tudo relatado pelo fornecedor. A economia de inferência do DeepSeek V4 Flash, por outro lado, é estabelecida: está em produção desde 31 de julho, é um dos modelos mais baratos de executar por teste, e hosts de terceiros o servem em volume há um mês. Para um caminho de produção, servir comprovado vence servir promissor.

Qual você deve ligar?

A orientação para decisões, em termos claros:

• Você quer um multimodal aberto agora — GLM-5.3-Flash é o único dos dois com entrada nativa de imagem/vídeo, e seus pesos MIT estão no Hugging Face hoje.

• Você quer um modelo de codificação/agente com números independentes — o SWE-bench Verified 79.0 e o Terminal-Bench 2.1 82.7 do DeepSeek V4 Flash são verificados por terceiros; as alegações de codificação do GLM-5.3-Flash ainda não são.

• Você quer o piso absoluto em custo por token — o desconto de lançamento do Flash leva vantagem por enquanto, mas trate o desconto como temporário.

• Você se preocupa com uma taxa de produção estável — o preço de $0.14 / $0.28 da DeepSeek V4 Flash está estável desde julho; a tabela de preços do Flash tem apenas alguns dias.

• Você está em dúvida e quer testar os dois sem um segundo contrato — o DeepSeek V4 Flash está no ar no OrcaRouter hoje pelo preço de tabela da Deep​Seek com 0% de markup, e o lado GLM dessa família (GLM-5.3, o irmão maior do Flash) também está disponível lá, então, quando o próprio Flash entrar no catálogo, os dois lados desse confronto ficarão atrás de uma única chave. Até lá, os pesos MIT do Flash no Hugging Face são a maneira mais barata de você mesmo testá-lo, e o failover automático para um modelo comprovado é como você experimenta o modelo novo sem apostar um caminho de produção nele.

A screenshot of the OrcaRouter model page for DeepSeek V4 Flash showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the tools, JSON and reasoning capability chips.

O resultado final

O GLM-5.3-Flash é o modelo mais interessante — multimodal nativo, licença MIT, uma pontuação de índice reivindicada que rivaliza com modelos muito mais caros — mas também é o menos comprovado, e seus melhores números são relatados pelo fornecedor na data do lançamento. O DeepSeek V4 Flash é a escolha econômica mais segura para codificação e trabalho agêntico: pontuação de inteligência independente mais baixa, porém medida, reproduzível e estável a US$ 0,14 / US$ 0,28. Compre o Flash pelo que ele oferece de único — multimodal aberto a esse preço — e compre o DeepSeek V4 Flash para qualquer coisa em que você precise dos comprovantes de benchmark. A questão genuinamente em aberto, que as próximas duas semanas responderão, é se o 57 do Flash sobrevive à medição independente.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube