
Ling-3.1-flash vs GLM-5.3-Flash: quatro vezes a taxa de transferência contra um ponto de índice
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Ling-3.1-flash e GLM-5.3-Flash ficam separados por um ponto no Artificial Analysis Intelligence Index — 41 contra 42 — o que os faz parecer a mesma decisão duas vezes. Não são. O GLM-5.3-Flash gera saída a 53,0 tokens por segundo na própria API da Z.ai; o Ling-3.1-flash gera a 211,0 tokens por segundo na da InclusionAI. Isso é uma diferença de quatro vezes na taxa de transferência, e é muito maior do que qualquer coisa pela qual o índice os separa. Um modelo é o mais capaz dos dois em quase todos os eixos de qualidade e é aberto sob a licença MIT. O outro é o que termina primeiro, é fechado e não tem preço, licença ou checkpoint publicados. Escolher entre eles é uma questão sobre o que sua carga de trabalho está esperando.
O eixo Ling-3.1-flash vence de forma decisiva
A velocidade não é uma nota de rodapé quando você está escolhendo entre modelos no mesmo nível de capacidade, e aqui ela é todo o argumento a favor do modelo Ant.
• Vazão de saída — Ling-3.1-flash 211,0 tokens por segundo na API da InclusionAI vs. GLM-5.3-Flash 53,0 tokens por segundo na da Z.ai. Quatro vezes a taxa de geração.
• Tempo até o primeiro token — Ling-3.1-flash 1,80 segundos vs GLM-5.3-Flash 3,18 segundos. O modelo da Ant começa a responder enquanto o modelo da Z.ai ainda está pensando, o que importa mais do que a taxa de transferência em uso interativo e de streaming.
Tempo por tarefa do Intelligence Index — Ling-3.1-flash cerca de 357 segundos vs GLM-5.3-Flash cerca de 979 segundos. Uma única tarefa de avaliação leva o GLM-5.3-Flash quase três vezes mais tempo de ponta a ponta, porque é mais lento tanto por token quanto para iniciar.
Para um loop de agente que faz uma dúzia de chamadas sequenciais, ou para um produto em que uma pessoa observa os tokens chegando, isso não é um critério de desempate — é a razão completa para preferir um modelo. O GLM-5.3-Flash é o melhor modelo no papel e o mais lento no caminho da requisição.
Onde o GLM-5.3-Flash é simplesmente melhor
Em todos os outros lugares, e a lista é longa o suficiente para que a vantagem de throughput tenha de conquistar o seu lugar.
• Confiabilidade do conhecimento — GLM-5.3-Flash obtém +7,47 no AA-Omniscience, o melhor dos três modelos da categoria Flash, com uma taxa de alucinação de 27,6% nas perguntas respondidas. Ling-3.1-flash obtém +2,22 com uma taxa de alucinação de 37,9%. Numa métrica que penaliza a invenção mais do que a recusa, a diferença é real e aponta na mesma direção que o índice.
• Conhecimento científico — O GLM-5.3-Flash obtém 0,912 no GPQA Diamond. O Ling-3.1-flash não tem linha publicada no GPQA Diamond. O mesmo vale para o DeepSeek V4.1 Flash (Max). Um modelo com 0,91 em questões de ciência de nível de pós-graduação é um instrumento diferente de um que não foi medido nelas.
• Modalidade — GLM-5.3-Flash aceita texto, imagens e vídeo. Ling-3.1-flash aceita apenas texto. Isso não é uma lacuna de desempenho a ser preenchida por um benchmark; é uma capacidade que está ausente.
• Pesos e licença — GLM-5.3-Flash tem pesos abertos sob a licença MIT, é disponibilizado para download e pode ser auto-hospedado. Ling-3.1-flash não publicou nenhum checkpoint, nenhum texto de licença, e está classificada como proprietária.
• Trabalho de conhecimento agêntico — GLM-5.3-Flash com 1.453,73 de Elo no AA-Briefcase v1.1, contra os 1.400,35 do Ling-3.1-flash, em um benchmark criado especificamente em torno de tarefas de trabalho de conhecimento, em vez de operação de terminal.
• Preço — O GLM-5.3-Flash tem preço de US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída na API da Z.ai, contra US$ 0,30 e US$ 0,90 do Ling-3.1-flash. Metade da tarifa de entrada e cerca de metade da tarifa de saída, de um modelo com pontuação de índice mais alta e pesos abertos.

As linhas em que o modelo Ant responde de volta
Ling-3.1-flash não é superado em todos os pontos. Em trabalho de terminal agêntico, está ligeiramente à frente, e em coding-science, está empatado:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. Efetivamente um empate, e ambos ficam abaixo do nível de fronteira.
• SciCode — Ling-3.1-flash 0,541 vs GLM-5.3-Flash 0,516. Uma vitória apertada.
• AutomationBench-AA — 0,617 vs 0,604. Outra vitória apertada.
• GDPval-AA — Ling-3.1-flash 1.621,75 Elo vs GLM-5.3-Flash 1.646,86. GLM retoma esta.
Leia as quatro linhas em conjunto e o quadro fica claro. Onde os dois modelos podem ser separados, a separação está dentro do ruído de uma única execução de avaliação. A diferença de um ponto no índice entre eles não é uma classificação; é um cara ou coroa levemente inclinado para o GLM pelas linhas de confiabilidade. O que não é cara ou coroa é a diferença de 4× na taxa de transferência e a diferença de 2× no preço, ambas apontando na direção contrária.
Há também um detalhe de disponibilização que vale a pena destacar, porque altera a magnitude dessa diferença de throughput dependendo de onde se chama um modelo. A própria API da Z.ai mede 53,0 tokens por segundo. A medição de sete dias do nosso próprio catálogo para o GLM-5.3-Flash nas nossas rotas mostra 150,6 tokens de saída por segundo, com uma latência mediana de 4,2 segundos para o primeiro token. Os mesmos pesos disponibilizados a partir de uma implantação diferente são executados quase três vezes mais rápido. Os números de throughput de um fornecedor são uma propriedade de um provedor, não de um modelo.
Especificação, linha por linha
Assunto primeiro em cada linha:
• Tamanho — Ling-3.1-flash 560B total / 25B ativos vs GLM-5.3-Flash 320B total / 18B ativos.
• Contexto declarado — 1M tokens em ambos. A linha de raciocínio de contexto longo do GLM-5.3-Flash mede 0,80 no AA-LCR; a do Ling-3.1-flash, 0,83. Ambos estão próximos do 0,84 do DeepSeek V4.1 Flash (Max), ou seja, raciocínio de contexto longo já não é um diferencial nesse nível.
• Teto de saída — GLM-5.3-Flash 128.000 tokens no nosso catálogo vs Ling-3.1-flash sem máximo publicado. Um deles pode ser dimensionado para geração longa e o outro não.
• Índice — 41 vs 42.
• Vazão — 211,0 tokens por segundo vs 53,0 nas APIs do fornecedor, 150,6 medidos em nossas rotas.
• Pesos — proprietários sem licença vs abertos sob MIT.
• Modalidade — somente texto vs texto, imagem e vídeo na entrada.
• Preço — $0.30 / $0.90 por milhão de entrada / saída vs $0.15 / $0.50 na API da Z.ai.
Como realmente executar esta comparação
GLM-5.3-Flash está no catálogo do OrcaRouter agora, listado a $0,075 por milhão de entrada, $0,25 por milhão de saída e $0,0173 por milhão de leituras de cache — leia o card ao vivo em vez deste parágrafo, porque as tarifas de serviço mudam e o arranjo de repassagem significa que uma mudança de preço do fornecedor é refletida do nosso lado no mesmo dia. O valor desse arranjo para este confronto específico é que a abertura e a vantagem de preço do GLM-5.3-Flash são as duas coisas que o tornam o padrão sensato, e uma rota fechada com 0% de margem é como você continua testando o Ling-3.1-flash contra ele sem adicionar um relacionamento com fornecedor.
O Ling-3.1-flash não está no nosso catálogo — uma consulta à nossa API pública de modelos retorna "não encontrado" para o modelo em InclusionAI, e este texto não dará a entender que nós o disponibilizamos. Ele roda pela API própria da Ant e pelas plataformas de terceiros que carregam o lançamento, que é a extensão honesta de sua disponibilidade.
A forma produtiva desta comparação não é uma questão de ou um ou outro. O GLM-5.3-Flash é aberto, o mais barato, multimodal, mais confiável em perguntas de conhecimento e disponível por meio de 23 provedores — esse é o caminho padrão. O argumento a favor do Ling-3.1-flash é a vazão e o TTFT em ciclos agênticos, e seu custo é que ele é fechado, somente texto, mais caro e acessível por menos portas. Encaminhe o trabalho interativo e sensível à latência para o modelo rápido, mantenha o trabalho em lote, intensivo em conhecimento e multimodal no modelo aberto, e coloque um fallback entre eles para que um upstream lento não se torne um produto lento.
Qual escolher
Se os seus critérios de avaliação forem capacidade, custo, abertura e modalidade, o GLM-5.3-Flash vence este confronto e não é por pouco — uma pontuação de índice mais alta, o melhor perfil de confiabilidade de conhecimento da categoria, um GPQA Diamond de 0,912, pesos MIT, entrada de vídeo, metade do preço e 23 provedores por trás dele. Se os seus critérios incluírem quanto tempo um usuário espera ou quantas chamadas sequenciais uma tarefa pode fazer, o Ling-3.1-flash é o modelo que termina, e a sua taxa de geração quatro vezes maior não é um erro de arredondamento num loop de agente.
O que resolveria a questão é um detalhe de serviço que nenhum dos fornecedores publica de forma comparável: a taxa de transferência efetiva na sua carga de trabalho, através do seu provedor. Ambos os modelos respondem ao mesmo formato de chat-completions compatível com OpenAI, o que significa que alternar entre eles é uma mudança de configuração, e não uma migração — e, para dois modelos separados por um ponto de índice e um fator de quatro em velocidade, medir esse único número no seu próprio tráfego é um melhor uso de uma tarde do que ler mais uma linha de benchmark.


Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
