
GLM-5.3-FlashX vs DeepSeek V4.1 Flash: O nível de velocidade que é mais lento que o modelo barato
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O nível premium de velocidade da Z.ai tem um problema, e ele se chama DeepSeek V4.1 Flash. Quando a Z.ai lançou GLM-5.3-FlashX em 18 de setembro de 2026, ela vendeu o novo nível com base em um único número: até 200 tokens de saída por segundo, cerca de cinco vezes a vazão do GLM-5.3-Flash no qual é baseado, por 2,5× o preço. Medições independentes já colocam o modelo econômico da DeepSeek a 214,7 tokens por segundo, com 1,15 segundo até o primeiro token — mais rápido nos dois quesitos do que o teto que a Z.ai está anunciando, e a um preço do qual o FlashX não chega nem perto. Se você está comprando velocidade, o mercado mudou antes de o FlashX chegar.
Esse enquadramento é injusto com o FlashX de uma forma específica e justo em todas as outras. Os dois modelos são derivados de pesos abertos com contexto de 1M, projetados com foco em custo, e ambos são genuinamente bons naquilo para que foram criados. Mas foram criados para metades diferentes do mesmo problema, e a diferença de preço entre eles agora é grande o suficiente para que “qual é melhor” tenha uma resposta de uma linha para a maioria das cargas de trabalho.
Onde cada um está realmente à frente
• Preço, tabela — GLM-5.3-FlashX US$ 0,37 / US$ 1,25 por 1M de entrada/saída vs. DeepSeek V4.1 Flash US$ 0,15 / US$ 0,60 fora de pico, US$ 0,30 / US$ 1,20 em picobr> • Entrada em cache — FlashX US$ 0,075 por 1M vs. DeepSeek US$ 0,003 fora de pico, uma diferença de 25× que se acumula rapidamente em loops de agentesbr> • Throughput medido — FlashX até 200 tok/s (pico do fornecedor, nenhum número independente publicado) vs. DeepSeek 214,7 tok/s (Artificial Analysis, na API da DeepSeek)br> • Tempo até o primeiro token — não publicado para o FlashX vs. 1,15 s medidos para o DeepSeek V4.1 Flashbr> • Inteligência independente — o FlashX herda o 42 do GLM-5.3-Flash no Artificial Analysis Intelligence Index vs. DeepSeek V4.1 Flash com 40br> • Arquitetura — MoE de 320B no total / 18B ativos vs. 552B no total, com cerca de 8B ativos no prefill e 16B no decodebr> • Modalidade de entrada — texto, imagem, vídeo e arquivos vs. texto e imagembr> • Limite de saída — 131.072 tokens vs. cerca de 384.000br> • Pesos abertos — GLM-5.3-Flash tem licença MIT; o FlashX é um nível hospedado sem pesos próprios, e o DeepSeek V4.1 Flash tem licença MIT

Leia essa lista duas vezes, porque o formato dela é a história. O FlashX vence exatamente duas linhas, e ambas são estreitas: uma vantagem de dois pontos em um índice independente de inteligência, e entrada de vídeo. O DeepSeek vence em preço, preço com cache, velocidade medida, comprimento de saída e amplitude de modalidades no sentido que importa — ele aceita imagens e produz respostas longas. A diferença de dois pontos no índice está dentro do ruído de uma única execução de benchmark e não deve ser o que decide sua arquitetura.
O nível de velocidade que é mais lento que o modelo barato
É nesta parte que vale a pena nos determos. A Z.ai criou o FlashX para resolver um problema real: o GLM-5.3-Flash é lento. A Artificial Analysis mediu-o em 98 tokens de saída por segundo, o que fica acima da mediana entre pares para modelos de pesos abertos do seu tamanho, mas muito longe de ser interativo. A solução da empresa foi uma reconstrução da pilha de serving — cerca de 100.000 aceleradores domésticos, um motor baseado em SGLang, quantização W8A8, cache KV de precisão mista e uma arquitetura desagregada de encode–prefill–decode — e ela relata cerca de 3× de throughput ponta a ponta em relação à sua linha de base no mesmo hardware.
A DeepSeek resolveu o mesmo problema na camada de arquitetura, e chegou lá primeiro. A divisão Causal Encoder–Decoder do V4.1 Flash ativa cerca de 8B parâmetros no prefill e 16B no decode, em vez de um valor fixo, e o Compressed Sparse Attention 2 com cache KV em FP4 reduz o cache global para 890 bytes por token — aproximadamente um quarto da HBM e um oitavo do armazenamento em SSD de que seu antecessor precisava. O resultado é um modelo que roda a 214,7 tokens por segundo, conforme medido por um laboratório neutro, na mesma API própria, sem exigir um nível premium.
O 200 da Z.ai é um pico de fornecedor, e o 214,7 da DeepSeek é uma mediana independente — o que é a comparação menos favorável possível para a Z.ai e o motivo para encará-la com reservas. É perfeitamente possível que o FlashX supere o DeepSeek em uma requisição aquecida, de saída curta e sem congestionamento. Não é possível saber, porque ninguém fora da Z.ai publicou números de throughput do FlashX. O que dá para saber hoje é que os dois modelos estão na mesma faixa de velocidade, e um deles custa um terço do valor.

Onde a vantagem de preço da DeepSeek se torna estrutural
O DeepSeek V4.1 Flash cobra $0,15 por milhão de tokens de entrada e $0,60 por milhão de tokens de saída fora de pico, dobrando para $0,30 e $1,20 durante duas janelas em dias de semana (01:00–04:00 e 06:00–10:00 UTC). O FlashX custa $0,37 e $1,25 fixos. Compare os dois e o preço fixo que parece um recurso é, na verdade, a estrutura mais cara para qualquer um que consiga agendar o trabalho.
A linha de entrada em cache é a que decide as cargas de trabalho dos agentes. A DeepSeek cobra US$ 0,003 por milhão de tokens de entrada em cache fora de pico; a FlashX cobra US$ 0,075, vinte e cinco vezes mais. Um agente que reenvia um prompt de sistema longo e um esquema de ferramentas a cada etapa paga essa diferença a cada etapa, e é o item de linha com maior probabilidade de dominar uma fatura real. A Z.ai lista o armazenamento em cache como gratuito por tempo limitado, o que é um desconto no armazenamento, e não nas leituras que de fato se acumulam.
Há um contrapeso, e ele é a honestidade sobre o que os próprios números da DeepSeek custam. As avaliações conduzidas pelo fornecedor por trás das pontuações de destaque do V4.1 Flash foram produzidas com esforço máximo de raciocínio, e a DeepSeek documenta que passar do esforço 25 para o esforço 100 eleva o DeepSWE v1.1 de 66,0 para 74,2, consumindo aproximadamente 2,5× os tokens de saída. Com 2,5× os tokens, o custo efetivo da configuração de alto esforço fica muito mais próximo do FlashX do que a etiqueta sugere — e o modelo é documentado como muito prolixo, gerando 250M de tokens de saída no Intelligence Index, contra uma mediana de 130M. Uma taxa barata por token em um modelo tagarela não é o mesmo que uma tarefa barata. Quem comparar esses dois por preço deve comparar o custo por tarefa concluída, não o custo por milhão de tokens, e deve esperar medir em vez de estimar.
Como decidir, concretamente
Se sua carga de trabalho for um agente de longa duração com um prefixo estável, o DeepSeek V4.1 Flash é a escolha, e a proporção de entrada em cache por si só decide isso. Se você precisar de compreensão de vídeo ou entrada de arquivo na mesma chamada, o FlashX é o único dos dois que aceita essas entradas — essa é uma diferença genuína de capacidade, não de ficha técnica. Se você precisar de saídas geradas longas, o limite de saída de aproximadamente 384K do DeepSeek contra os 131.072 do FlashX importa para geração de relatórios, arquivos de código longos e qualquer coisa que sintetize em vez de responder. Se você precisar da pontuação independente mais forte em um único índice de benchmark, o 42 contra 40 do FlashX é real, mas pequeno demais para se basear nisso.
Ambos os modelos estão acessíveis a partir de um único endpoint se a sua stack já estiver encaminhada, o que é a forma mais barata de resolver isto. No OrcaRouter o preço de tabela do fornecedor é repassado com 0% de margem, pelo que o desconto fora de hora do DeepSeek e qualquer futura alteração de preço da Z.ai chegam no mesmo dia em que acontecem, e alternar entre os dois é uma questão de string de modelo em vez de uma integração. O failover automático vale a pena ter especificamente para o FlashX: é um tier de serviço com três semanas de existência num cluster novo, e o modo de falha contra o qual está a proteger-se é um limite de capacidade, não um modelo que deixa de funcionar.
O resumo direto: o DeepSeek V4.1 Flash é a melhor opção padrão para a maioria dos trabalhos de produção — mais barato por token, mais barato por token em cache, medido como mais rápido e capaz de gerar saídas mais longas. O GLM-5.3-FlashX é a escolha certa em uma faixa mais estreita, quando você precisa de entrada de vídeo ou arquivo e quer um índice independente marginalmente mais alto por trás dele. A Z.ai precificou um nível de velocidade com ágio e o lançou em um mercado onde o modelo rápido e barato já existia. Essa é a comparação completa.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
