Cartão de título principal para 'Ling-3.1-flash vs GLM-5.3-Flash', com o subtítulo 'Quatro vezes a taxa de transferência contra um ponto de índice'. Dois cartões arredondados ficam lado a lado com uma separação nítida: o da esquerda, rotulado 'Ling-3.1-flash', mostra 'Velocidade: 211 tok/s', 'Índice AA: 41', 'Licença: nenhuma publicada'; o da direita, rotulado 'GLM-5.3-Flash', mostra 'Velocidade: 53 tok/s', 'Índice AA: 42', 'Licença: MIT'. Uma linha de rodapé diz 'Taxa de transferência na API própria de cada fornecedor; índice conforme a Artificial Analysis.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Ling-3.1-flash vs GLM-5.3-Flash: quatro vezes a taxa de transferência contra um ponto de índice

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ling-3.1-flash e GLM-5.3-Flash ficam separados por um ponto no Artificial Analysis Intelligence Index — 41 contra 42 — o que os faz parecer a mesma decisão duas vezes. Não são. O GLM-5.3-Flash gera saída a 53,0 tokens por segundo na própria API da Z.ai; o Ling-3.1-flash gera a 211,0 tokens por segundo na da InclusionAI. Isso é uma diferença de quatro vezes na taxa de transferência, e é muito maior do que qualquer coisa pela qual o índice os separa. Um modelo é o mais capaz dos dois em quase todos os eixos de qualidade e é aberto sob a licença MIT. O outro é o que termina primeiro, é fechado e não tem preço, licença ou checkpoint publicados. Escolher entre eles é uma questão sobre o que sua carga de trabalho está esperando.

O eixo Ling-3.1-flash vence de forma decisiva

A velocidade não é uma nota de rodapé quando você está escolhendo entre modelos no mesmo nível de capacidade, e aqui ela é todo o argumento a favor do modelo Ant.

• Vazão de saída — Ling-3.1-flash 211,0 tokens por segundo na API da InclusionAI vs. GLM-5.3-Flash 53,0 tokens por segundo na da Z.ai. Quatro vezes a taxa de geração.

• Tempo até o primeiro token — Ling-3.1-flash 1,80 segundos vs GLM-5.3-Flash 3,18 segundos. O modelo da Ant começa a responder enquanto o modelo da Z.ai ainda está pensando, o que importa mais do que a taxa de transferência em uso interativo e de streaming.

Tempo por tarefa do Intelligence Index — Ling-3.1-flash cerca de 357 segundos vs GLM-5.3-Flash cerca de 979 segundos. Uma única tarefa de avaliação leva o GLM-5.3-Flash quase três vezes mais tempo de ponta a ponta, porque é mais lento tanto por token quanto para iniciar.

Para um loop de agente que faz uma dúzia de chamadas sequenciais, ou para um produto em que uma pessoa observa os tokens chegando, isso não é um critério de desempate — é a razão completa para preferir um modelo. O GLM-5.3-Flash é o melhor modelo no papel e o mais lento no caminho da requisição.

Onde o GLM-5.3-Flash é simplesmente melhor

Em todos os outros lugares, e a lista é longa o suficiente para que a vantagem de throughput tenha de conquistar o seu lugar.

• Confiabilidade do conhecimento — GLM-5.3-Flash obtém +7,47 no AA-Omniscience, o melhor dos três modelos da categoria Flash, com uma taxa de alucinação de 27,6% nas perguntas respondidas. Ling-3.1-flash obtém +2,22 com uma taxa de alucinação de 37,9%. Numa métrica que penaliza a invenção mais do que a recusa, a diferença é real e aponta na mesma direção que o índice.

• Conhecimento científico — O GLM-5.3-Flash obtém 0,912 no GPQA Diamond. O Ling-3.1-flash não tem linha publicada no GPQA Diamond. O mesmo vale para o DeepSeek V4.1 Flash (Max). Um modelo com 0,91 em questões de ciência de nível de pós-graduação é um instrumento diferente de um que não foi medido nelas.

• Modalidade — GLM-5.3-Flash aceita texto, imagens e vídeo. Ling-3.1-flash aceita apenas texto. Isso não é uma lacuna de desempenho a ser preenchida por um benchmark; é uma capacidade que está ausente.

• Pesos e licença — GLM-5.3-Flash tem pesos abertos sob a licença MIT, é disponibilizado para download e pode ser auto-hospedado. Ling-3.1-flash não publicou nenhum checkpoint, nenhum texto de licença, e está classificada como proprietária.

• Trabalho de conhecimento agêntico — GLM-5.3-Flash com 1.453,73 de Elo no AA-Briefcase v1.1, contra os 1.400,35 do Ling-3.1-flash, em um benchmark criado especificamente em torno de tarefas de trabalho de conhecimento, em vez de operação de terminal.

• Preço — O GLM-5.3-Flash tem preço de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída na API da Z.ai, contra US$ 0,30 e US$ 0,90 do Ling-3.1-flash. Metade da tarifa de entrada e cerca de metade da tarifa de saída, de um modelo com pontuação de índice mais alta e pesos abertos.

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

As linhas em que o modelo Ant responde de volta

Ling-3.1-flash não é superado em todos os pontos. Em trabalho de terminal agêntico, está ligeiramente à frente, e em coding-science, está empatado:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. Efetivamente um empate, e ambos ficam abaixo do nível de fronteira.

• SciCode — Ling-3.1-flash 0,541 vs GLM-5.3-Flash 0,516. Uma vitória apertada.

• AutomationBench-AA — 0,617 vs 0,604. Outra vitória apertada.

• GDPval-AA — Ling-3.1-flash 1.621,75 Elo vs GLM-5.3-Flash 1.646,86. GLM retoma esta.

Leia as quatro linhas em conjunto e o quadro fica claro. Onde os dois modelos podem ser separados, a separação está dentro do ruído de uma única execução de avaliação. A diferença de um ponto no índice entre eles não é uma classificação; é um cara ou coroa levemente inclinado para o GLM pelas linhas de confiabilidade. O que não é cara ou coroa é a diferença de 4× na taxa de transferência e a diferença de 2× no preço, ambas apontando na direção contrária.

Há também um detalhe de disponibilização que vale a pena destacar, porque altera a magnitude dessa diferença de throughput dependendo de onde se chama um modelo. A própria API da Z.ai mede 53,0 tokens por segundo. A medição de sete dias do nosso próprio catálogo para o GLM-5.3-Flash nas nossas rotas mostra 150,6 tokens de saída por segundo, com uma latência mediana de 4,2 segundos para o primeiro token. Os mesmos pesos disponibilizados a partir de uma implantação diferente são executados quase três vezes mais rápido. Os números de throughput de um fornecedor são uma propriedade de um provedor, não de um modelo.

Especificação, linha por linha

Assunto primeiro em cada linha:

• Tamanho — Ling-3.1-flash 560B total / 25B ativos vs GLM-5.3-Flash 320B total / 18B ativos.

• Contexto declarado — 1M tokens em ambos. A linha de raciocínio de contexto longo do GLM-5.3-Flash mede 0,80 no AA-LCR; a do Ling-3.1-flash, 0,83. Ambos estão próximos do 0,84 do DeepSeek V4.1 Flash (Max), ou seja, raciocínio de contexto longo já não é um diferencial nesse nível.

• Teto de saída — GLM-5.3-Flash 128.000 tokens no nosso catálogo vs Ling-3.1-flash sem máximo publicado. Um deles pode ser dimensionado para geração longa e o outro não.

• Índice — 41 vs 42.

• Vazão — 211,0 tokens por segundo vs 53,0 nas APIs do fornecedor, 150,6 medidos em nossas rotas.

• Pesos — proprietários sem licença vs abertos sob MIT.

• Modalidade — somente texto vs texto, imagem e vídeo na entrada.

• Preço — $0.30 / $0.90 por milhão de entrada / saída vs $0.15 / $0.50 na API da Z.ai.

Como realmente executar esta comparação

GLM-5.3-Flash está no catálogo do OrcaRouter agora, listado a $0,075 por milhão de entrada, $0,25 por milhão de saída e $0,0173 por milhão de leituras de cache — leia o card ao vivo em vez deste parágrafo, porque as tarifas de serviço mudam e o arranjo de repassagem significa que uma mudança de preço do fornecedor é refletida do nosso lado no mesmo dia. O valor desse arranjo para este confronto específico é que a abertura e a vantagem de preço do GLM-5.3-Flash são as duas coisas que o tornam o padrão sensato, e uma rota fechada com 0% de margem é como você continua testando o Ling-3.1-flash contra ele sem adicionar um relacionamento com fornecedor.

O Ling-3.1-flash não está no nosso catálogo — uma consulta à nossa API pública de modelos retorna "não encontrado" para o modelo em InclusionAI, e este texto não dará a entender que nós o disponibilizamos. Ele roda pela API própria da Ant e pelas plataformas de terceiros que carregam o lançamento, que é a extensão honesta de sua disponibilidade.

A forma produtiva desta comparação não é uma questão de ou um ou outro. O GLM-5.3-Flash é aberto, o mais barato, multimodal, mais confiável em perguntas de conhecimento e disponível por meio de 23 provedores — esse é o caminho padrão. O argumento a favor do Ling-3.1-flash é a vazão e o TTFT em ciclos agênticos, e seu custo é que ele é fechado, somente texto, mais caro e acessível por menos portas. Encaminhe o trabalho interativo e sensível à latência para o modelo rápido, mantenha o trabalho em lote, intensivo em conhecimento e multimodal no modelo aberto, e coloque um fallback entre eles para que um upstream lento não se torne um produto lento.

Qual escolher

Se os seus critérios de avaliação forem capacidade, custo, abertura e modalidade, o GLM-5.3-Flash vence este confronto e não é por pouco — uma pontuação de índice mais alta, o melhor perfil de confiabilidade de conhecimento da categoria, um GPQA Diamond de 0,912, pesos MIT, entrada de vídeo, metade do preço e 23 provedores por trás dele. Se os seus critérios incluírem quanto tempo um usuário espera ou quantas chamadas sequenciais uma tarefa pode fazer, o Ling-3.1-flash é o modelo que termina, e a sua taxa de geração quatro vezes maior não é um erro de arredondamento num loop de agente.

O que resolveria a questão é um detalhe de serviço que nenhum dos fornecedores publica de forma comparável: a taxa de transferência efetiva na sua carga de trabalho, através do seu provedor. Ambos os modelos respondem ao mesmo formato de chat-completions compatível com OpenAI, o que significa que alternar entre eles é uma mudança de configuração, e não uma migração — e, para dois modelos separados por um ponto de índice e um fator de quatro em velocidade, medir esse único número no seu próprio tráfego é um melhor uso de uma tarde do que ler mais uma linha de benchmark.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente