
Ling-3.1-flash vs GLM-5.3-Flash: quattro volte il throughput a fronte di un punto di indice
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Ling-3.1-flash e GLM-5.3-Flash distano un solo punto sull'Artificial Analysis Intelligence Index — 41 contro 42 — il che li fa sembrare la stessa decisione presa due volte. Non lo sono. GLM-5.3-Flash genera output a 53,0 token al secondo sull'API di Z.ai; Ling-3.1-flash lo genera a 211,0 token al secondo su quella di InclusionAI. È una differenza di throughput di quattro volte, e è molto più ampia di qualsiasi cosa per cui l'indice li separi. Uno dei due modelli è il più capace su quasi ogni asse di qualità ed è aperto con licenza MIT. L'altro è quello che finisce prima, è chiuso e non ha prezzo, licenza o checkpoint pubblicati. Scegliere tra loro è una questione di ciò che il tuo carico di lavoro sta aspettando.
L'asse Ling-3.1-flash vince nettamente
La velocità non è una nota a piè di pagina quando si sceglie tra modelli dello stesso livello di capacità, e qui rappresenta l'intera argomentazione a favore del modello Ant.
• Throughput in output — Ling-3.1-flash 211,0 token al secondo sull'API di InclusionAI contro GLM-5.3-Flash 53,0 token al secondo su quella di Z.ai. Quattro volte la velocità di generazione.
• Tempo al primo token — Ling-3.1-flash 1,80 secondi vs GLM-5.3-Flash 3,18 secondi. Il modello Ant parte mentre il modello Z.ai sta ancora pensando, il che conta più del throughput nell'uso interattivo e in streaming.
• Tempo per attività dell'Indice di Intelligenza — Ling-3.1-flash circa 357 secondi contro GLM-5.3-Flash circa 979 secondi. Una singola attività di valutazione richiede a GLM-5.3-Flash quasi tre volte il tempo, dall'inizio alla fine, perché è sia più lento per token sia più lento ad avviarsi.
Per un ciclo di un agente che effettua una dozzina di chiamate sequenziali, o per un prodotto in cui una persona guarda arrivare i token, non è un fattore decisivo: è l'intera ragione per preferire un modello. GLM-5.3-Flash è il modello migliore sulla carta e quello più lento nel percorso della richiesta.
Dove GLM-5.3-Flash è semplicemente migliore
Ovunque altrove, e la lista è abbastanza lunga da far sì che il vantaggio di throughput debba guadagnarsi il suo posto.
• Affidabilità della conoscenza — GLM-5.3-Flash ottiene +7,47 su AA-Omniscience, il migliore dei tre modelli di livello Flash, con un tasso di allucinazione del 27,6% sulle domande a cui ha risposto. Ling-3.1-flash ottiene +2,22 con un tasso di allucinazione del 37,9%. Su una misura che penalizza l'invenzione più del rifiuto, il divario è reale e punta nella stessa direzione dell'indice.
• Conoscenza scientifica — GLM-5.3-Flash registra 0,912 su GPQA Diamond. Ling-3.1-flash non ha pubblicato alcuna riga per GPQA Diamond. Lo stesso vale per DeepSeek V4.1 Flash (Max). Un modello con 0,91 su domande scientifiche di livello post-laurea è uno strumento diverso da uno che non è stato misurato su di esse.
• Modalità — GLM-5.3-Flash accetta testo, immagini e video. Ling-3.1-flash accetta solo testo. Non è un divario di prestazioni da colmare con un benchmark; è una capacità assente.
• Pesi e licenza GLM-5.5-Flash è a pesi aperti con licenza MIT, scaricabile e ospitabile in autonomia. Ling-3.1-flash non ha pubblicato alcun checkpoint, né testo di licenza, ed è classificato come proprietario.
• Lavoro di conoscenza agentico — GLM-5.3-Flash 1.453,73 Elo su AA-Briefcase v1.1 contro i 1.400,35 di Ling-3.1-flash, su un benchmark costruito specificamente attorno a compiti di knowledge work anziché all'uso del terminale.
• Prezzo — GLM-5.3-Flash è pubblicato a $0,15 per milione di input e $0,50 per milione di output sull'API di Z.ai, contro i $0,30 e $0,90 di Ling-3.1-flash. Metà della tariffa di input e circa metà della tariffa di output, da un modello con un punteggio di indice più alto e pesi aperti.

Le righe in cui il modello Ant risponde a sua volta
Ling-3.1-flash non viene superato su tutto. Nel lavoro agentico da terminale è marginalmente in vantaggio e su coding-science è alla pari:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. Di fatto un pareggio, ed entrambi si collocano al di sotto della fascia di frontiera.
• SciCode — Ling-3.1-flash 0.541 contro GLM-5.3-Flash 0.516. Una vittoria risicata.
• AutomationBench-AA — 0,617 vs 0,604. Ancora una vittoria di stretta misura.
• GDPval-AA — Ling-3.1-flash 1.621,75 Elo contro GLM-5.3-Flash 1.646,86. GLM si riprende questo.
Leggi le quattro righe nel loro insieme e il quadro è chiaro. Laddove i due modelli siano distinguibili anche solo minimamente, la distinzione rientra nel rumore di una singola esecuzione di valutazione. La differenza di un punto nell'indice tra loro non è una classifica; è un lancio di moneta leggermente sbilanciato verso GLM dalle righe di affidabilità. Ciò che non è un lancio di moneta è il divario di throughput di 4× e il divario di prezzo di 2×, entrambi orientati nella direzione opposta.
C'è anche un dettaglio di serving che vale la pena segnalare, perché cambia l'entità di quel divario di throughput a seconda di dove chiami un modello. L'API di Z.ai stessa misura 53,0 token al secondo. La misurazione su sette giorni del nostro catalogo per GLM-5.3-Flash sulle nostre rotte mostra 150,6 token al secondo di output con una latenza mediana al primo token di 4,2 secondi. Gli stessi pesi serviti da un deployment diverso vengono eseguiti quasi tre volte più velocemente. I valori di throughput di un fornitore sono una proprietà di un provider, non di un modello.
Specifica, riga per riga
Soggetto all'inizio di ogni riga:
• Dimensione — Ling-3.1-flash 560B totali / 25B attivi vs GLM-5.3-Flash 320B totali / 18B attivi.
• Contesto dichiarato — 1M token su entrambi. La riga di ragionamento su contesto lungo di GLM-5.3-Flash misura 0,80 su AA-LCR; quella di Ling-3.1-flash 0,83. Entrambi sono vicini allo 0,84 di DeepSeek V4.1 Flash (Max), il che equivale a dire che il ragionamento su contesto lungo non è più un fattore differenziante a questo livello.
• Limite di output — GLM-5.3-Flash 128.000 token nel nostro catalogo vs Ling-3.1-flash senza un massimo pubblicato. Uno di questi può essere dimensionato per generazioni lunghe e l'altro no.
• Indice — 41 vs 42.
• Throughput — 211,0 token al secondo rispetto a 53,0 sulle API del fornitore, 150,6 misurato sulle nostre route.
• Pesi — proprietari senza licenza vs aperti con licenza MIT.
• Modalità — solo testo vs testo, immagine e video in ingresso.
• Prezzo — $0.30 / $0.90 per milione di input / output rispetto a $0.15 / $0.50 sull'API di Z.ai.
Come eseguire effettivamente questo confronto
GLM-5.3-Flash è ora nel catalogo OrcaRouter, elencato a $0,075 per milione di input, $0,25 per milione di output e $0,0173 per milione di letture dalla cache — leggi la scheda live invece di questo paragrafo, perché le tariffe di servizio cambiano e il meccanismo di ripercutimento dell'accordo comporta che una variazione di prezzo del fornitore si riflette dalla nostra parte lo stesso giorno. Il valore di questo accordo per questo specifico confronto è che l'apertura e il vantaggio di prezzo di GLM-5.3-Flash sono le due cose che lo rendono il default sensato, e una rotta chiusa a markup 0% è il modo in cui continui a testare Ling-3.1-flash contro di esso senza aggiungere un rapporto con un fornitore.
Ling-3.1-flash non è nel nostro catalogo — una ricerca sulla nostra API pubblica dei modelli restituisce not-found per il modello sotto InclusionAI, e questo articolo non lascerà intendere che lo forniamo. Viene eseguito tramite l'API proprietaria di Ant e le piattaforme di terze parti che distribuiscono la release, che è l'effettiva portata della sua disponibilità.
La forma produttiva di questo confronto non è un aut aut. GLM-5.3-Flash è aperto, il più economico, multimodale, più affidabile sulle domande di conoscenza e disponibile tramite 23 fornitori — questo è un percorso predefinito. Il punto di forza di Ling-3.1-flash è il throughput e il TTFT nei loop agentici, e il suo costo è che è chiuso, solo testo, più costoso e raggiungibile attraverso meno porte. Indirizza il lavoro interattivo e sensibile alla latenza verso il modello veloce, mantieni il lavoro batch, ad alta intensità di conoscenza e multimodale su quello aperto, e metti un fallback tra loro così un upstream lento non diventa un prodotto lento.
Quale scegliere?
Se i tuoi criteri di valutazione sono capacità, costo, apertura e modalità, GLM-5.3-Flash vince questo confronto e non è una vittoria di misura — un punteggio di indice più alto, il miglior profilo di affidabilità delle conoscenze della categoria, un GPQA Diamond di 0,912, pesi MIT, input video, metà del prezzo e 23 provider alle spalle. Se i tuoi criteri includono quanto a lungo attende un utente o quante chiamate sequenziali può fare un compito, Ling-3.1-flash è il modello che porta a termine, e il suo tasso di generazione quadruplo non è un errore di arrotondamento in un loop di agente.
Ciò che risolverebbe la questione è un dettaglio di servizio che nessuno dei due fornitori pubblica in una forma comparabile: il throughput effettivo sul tuo carico di lavoro, attraverso il tuo provider. Entrambi i modelli rispondono allo stesso formato chat-completions compatibile con OpenAI, il che significa che passare dall'uno all'altro è un cambio di configurazione anziché una migrazione — e per due modelli separati da un punto di indice e da un fattore quattro in velocità, misurare quell'unico numero sul tuo traffico è un uso migliore di un pomeriggio che leggere un'altra riga di benchmark.


Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
