Cartão de título principal: DeepSeek V4.1 Flash vs GLM-5.2 — dois modelos MIT, uma resposta sem graça
Guides & Insights

DeepSeek V4.1 Flash vs GLM-5.2: Dois Modelos MIT, Uma Resposta Entediante

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

DeepSeek V4.1 Flash e GLM-5.2 são o mesmo tipo de objeto, e essa é a parte que a maioria das comparações ignora. Ambos são modelos de mistura de especialistas, ambos são distribuídos sob a licença MIT com pesos baixáveis, ambos aceitam um milhão de tokens de contexto, e ambos estão disponíveis por meio de uma API hospedada de um fornecedor que não os treinou. O GLM-5.2 chegou primeiro e era, no seu lançamento, o modelo de pesos abertos com maior pontuação no Artificial Analysis Index, com 51. O DeepSeek V4.1 Flash chegou em 10 de setembro de 2026 como o modelo menor, mais novo e mais barato da nova família de arquiteturas da DeepSeek. A comparação que importa entre eles não é qual é mais inteligente. É qual deles você consegue executar, e a que custo, para o trabalho que você realmente tem.

O que eles compartilham, que é a maior parte disso.

Comece pela sobreposição, porque ela elimina a maioria dos critérios de decisão usuais. Se você está escolhendo entre um modelo aberto e um fechado, você pondera o lock-in, pondera a capacidade de ajuste fino, pondera se o fornecedor pode mudar os termos com você. Nada disso se aplica aqui. Tanto o DeepSeek V4.1 Flash quanto o GLM-5.2 têm licença MIT, com pesos que você pode baixar e servir por conta própria. Ambos aceitam 1M de tokens de entrada. Ambos são arquiteturas MoE, o que significa que ambos são baratos de executar em relação à sua contagem total de parâmetros, porque apenas uma fração dos pesos é ativada por token.

Portanto, a comparação não é aberto versus fechado, e não é contexto longo versus curto. É um conjunto de quatro ou cinco números, e os números apontam numa direção em custo e na outra direção em maturidade.

Onde eles realmente divergem

• Preço por 1M de tokens — DeepSeek V4.1 Flash $0.15 de entrada / $0.60 de saída fora de pico vs GLM-5.2 $1.40 de entrada / $4.40 de saída. Isso é um pouco mais de 9 vezes o preço de entrada e um pouco mais de 7 vezes o preço de saída.

• Entrada em cache — V4.1 Flash $0,003 por 1M fora de pico vs GLM-5.2 $0,26 por 1M. Quase 90 vezes, no item de linha que domina a fatura de um loop de agente.

• Parâmetros — V4.1 Flash: 552B no total, com 8B ativos na entrada e 16B na saída, vs. GLM-5.2: aproximadamente 745B no total, com cerca de 40B ativos. O GLM-5.2 ativa cerca de duas vezes e meia mais parâmetros por token.

• Saída máxima — V4.1 Flash 384K tokens vs GLM-5.2 128K tokens. Três vezes o teto.

• Janela de contexto — 1M de tokens cada. Nível.

• Pontuação independente no índice — GLM-5.2 obtém 51 no Artificial Analysis Index, a mais alta entre qualquer modelo de pesos abertos no momento de seu lançamento. O DeepSeek V4.1 Flash ainda não tem um valor publicado no Índice.

• Latência observada até o primeiro token — V4.1 Flash 2,63 s no p50 e 9,05 s no p95 vs GLM-5.2 2,36 s no p50 e 10,00 s no p95, na telemetria de 7 dias da própria OrcaRouter. As medianas estão niveladas. As caudas, não.

A direção de preço e a direção de maturidade são opostas. O GLM-5.2 é o modelo com a pontuação independente e o histórico mais longo. O DeepSeek V4.1 Flash é o modelo com os tokens mais baratos, um nono do preço de entrada e três vezes o teto de saída. Não há leitura desta lista em que um modelo simplesmente domine.

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

A cauda é a linha subestimada

A maioria das comparações de modelos de pesos abertos começa pela pontuação do índice. A telemetria de latência merece atenção, em vez disso, mas não pelo motivo que você esperaria: as medianas estão niveladas. O tempo p50 até o primeiro token do GLM-5.2 é de 2,36 s contra 2,63 s do V4.1 Flash, o que não é uma diferença, é ruído em uma rede compartilhada. Qualquer um que cite uma vantagem de primeiro token para o modelo mais barato está lendo o percentil errado.

O p95 é onde os dois se separam, e a direção é o inverso do que a diferença de preço sugeriria. A espera no pior caso do GLM-5.2 é de 10,00 s; a do V4.1 Flash é de 9,05 s. Isso importa mais do que uma mediana, porque as requisições que um usuário nota são as lentas. Uma ferramenta que costuma ser instantânea e ocasionalmente fica parada por dez segundos parece não confiável de um modo que uma ferramenta uniformemente de três segundos não parece, e, em um loop de agente que dispara dez chamadas por turno, o p95 é o número que decide se o turno é concluído dentro da paciência de uma pessoa. A cauda do GLM-5.2 não é um defeito; é um modelo maior ativando cerca de 40 bilhões de parâmetros por token, e custa o que custa. Mas é a razão pela qual o modelo se adequa a trabalho assíncrono — uma fila, uma tarefa em lote, um agente em segundo plano que ninguém está observando — melhor do que se adequa a uma interface de requisição-resposta.

Nenhum dos modelos publica um valor de throughput nas páginas que conseguimos ver, o que vale a pena dizer claramente em vez de preencher a lacuna. O tempo até o primeiro token é a única dimensão de latência na qual esses dois podem ser comparados com dados em comum e, nessa dimensão, a leitura honesta é que eles estão empatados na mediana e próximos na cauda.

O que uma pontuação de índice resolve e não resolve

O 51 do GLM-5.2 no Artificial Analysis Index é um número real, produzido de forma independente, e é o argumento mais forte a favor do modelo. Também é um composto: um único número que agrega vários conjuntos de avaliação, o que o torna um bom resumo da capacidade geral e um mau preditor de desempenho em qualquer tarefa específica. Um modelo que pontua 51 e um modelo sem pontuação publicada não são o mesmo que um modelo que pontua 51 e um modelo que pontua 40.

A posição honesta sobre o DeepSeek V4.1 Flash é que seu histórico independente é escasso, e o motivo é a idade. Ele está disponível para o público em geral há doze dias. A única avaliação recente de terceiros em que aparece — o quadro de codificação agêntica Agents on Rails publicado em 21 de setembro de 2026 — o colocou em 17% no esforço máximo, no meio da tabela, acima do GLM-5.3 Flash, com 15%, e abaixo do Gemini 3.8 Flash, com 23%. Trata-se de um único quadro que mede uma única coisa restrita, e não substitui uma pontuação do Index. Qualquer pessoa que afirme que o V4.1 Flash supera o GLM-5.2 em capacidade neste momento está extrapolando a partir da arquitetura e do preço, não relatando uma medição.

A justificativa para cada um, dita de forma clara.

DeepSeek V4.1 Flash é o modelo a escolher quando a carga de trabalho é de alto volume, sensível à latência ou com muita produção de resultados. Um nono do preço de entrada e cerca de um nonagésimo do preço de leitura de cache é uma vantagem estrutural num loop de agente que relê o contexto a cada turno, e um teto de saída de 384K é uma categoria de artefacto diferente de 128K. Se a sua tarefa é classificação, extração, geração estruturada longa, ou o executor de alto volume dentro de um pipeline de agente, a diferença de custo não é marginal — é a diferença entre um pipeline viável e um inviável.

GLM-5.2 é o modelo a escolher quando precisa de um número de capacidade publicado e verificado de forma independente para justificar uma decisão, ou quando o trabalho é assíncrono e uma espera de dez segundos no pior caso é invisível. É a escolha madura: a pontuação existe, o comportamento está documentado, o modelo está em produção há tempo suficiente para que outras pessoas tenham encontrado os seus limites. Há valor real nisso, e isso não é capturado por uma coluna de preço.

Quando nenhum dos dois é obviamente o certo — um assistente de uso geral que lida com tráfego misto —, a medida útil não é escolher. É enviar a maior parte do tráfego para o modelo barato e reservar o caro para os pedidos que precisam dele.

Executando ambos como um único sistema

Como ambos os modelos são de pesos abertos e ambos são hospedados, o padrão de dividir e rotear é excepcionalmente barato de configurar aqui, e é onde a camada de roteamento da OrcaRouter justifica seu lugar, em vez de ser um argumento enxertado de última hora. Ambos os modelos ficam atrás de uma única chave, então a decisão de roteamento é configuração, e não uma segunda integração: uma regra que envia requisições curtas e de alto volume para o DeepSeek V4.1 Flash e tarefas assíncronas longas para o GLM-5.2 são algumas linhas, em vez de uma ramificação no código da sua aplicação.

Duas propriedades da plataforma importam especificamente para esse emparelhamento. A OrcaRouter repassa o preço de tabela do provedor com 0% de markup, portanto os valores acima são as tarifas dos próprios fornecedores, e o cronograma de pico do DeepSeek se aplica exatamente como o DeepSeek o define — o pico é das 01:00 às 04:00 e das 06:00 às 10:00 UTC em dias úteis, com os fins de semana inteiramente fora de pico, o que é uma decisão de agendamento que vale a pena tomar explicitamente em um modelo tão barato. E a DSL de roteamento pode compor vários modelos em uma única chamada, que é a forma natural de usar dois modelos de pesos abertos cujos pontos fortes não se sobrepõem: o barato produz, o mais forte revisa, e quem chama vê uma única resposta. O failover automático fica por trás dos dois caminhos, o que importa quando um dos dois modelos tem doze dias de existência e seu comportamento com os seus dados ainda é desconhecido.

A razão pela qual esta é a forma correta, e não um meio-termo, é que os dois modelos diferem em eixos que não competem. Um é rápido e barato; o outro é pontuado e lento. Um pipeline que usa ambos não é hedging; é adequar os instrumentos às tarefas.

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

O que assistir

• Um valor publicado do Artificial Analysis Index para o DeepSeek V4.1 Flash. Até que ele exista, a comparação de capacidades entre esses dois modelos é um argumento, não uma medição — e é o único elemento de prova que a resolveria.

• Se o perfil de latência do GLM-5.2 melhora. Seu p95 de 10,00 s é o número com maior probabilidade de mudar conforme os provedores de hospedagem otimizam, e atualmente é a maior diferença individual medida entre os dois modelos — uma espera na cauda, não um preço.

• Se o cronograma de horário de pico da DeepSeek muda. Em um modelo a US$ 0,15 por milhão de tokens de entrada, o multiplicador de pico é a maior variável isolada do modelo de custos.

Até que o primeiro deles chegue, o resumo preciso é: o DeepSeek V4.1 Flash é cerca de nove vezes mais barato na entrada e quase noventa vezes mais barato na entrada em cache do que o GLM-5.2, e tem o triplo do teto de saída; o GLM-5.2 é o modelo com a pontuação independente e o histórico mais longo, e sua mediana de primeiro token está no mesmo nível da do modelo mais barato, embora seu pior caso não esteja. Ambos são MIT. Ambos estão a uma chave de distância. Escolha pela carga de trabalho, não pelo vencedor.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente