
Ling-3.1-flash vs GLM-5.3-Flash : quatre fois le débit contre un point d'indice
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Ling-3.1-flash et GLM-5.3-Flash se situent à un point d'écart sur l'Artificial Analysis Intelligence Index — 41 contre 42 — ce qui les fait ressembler à la même décision prise deux fois. Ce n'est pas le cas. GLM-5.3-Flash génère sa sortie à 53,0 jetons par seconde sur l'API propre à Z.ai ; Ling-3.1-flash génère la sienne à 211,0 jetons par seconde sur celle d'InclusionAI. C'est une différence de débit d'un facteur quatre, et elle est bien plus grande que n'importe quel écart que l'index relève entre eux. L'un des modèles est le plus capable des deux sur presque tous les axes de qualité et est ouvert sous licence MIT. L'autre est celui qui termine en premier, qui est fermé et dont le prix, la licence et le checkpoint ne sont pas publiés. Choisir entre les deux revient à se demander ce que votre charge de travail attend.
L'axe Ling-3.1-flash l'emporte haut la main
La vitesse n'est pas un détail lorsqu'on choisit entre des modèles de même niveau de capacité, et ici, elle constitue à elle seule tout l'argument en faveur du modèle Ant.
• Débit de sortie — Ling-3.1-flash 211,0 jetons par seconde sur l'API d'InclusionAI contre GLM-5.3-Flash 53,0 jetons par seconde sur celle de Z.ai. Quatre fois le taux de génération.
• Temps jusqu’au premier token — Ling-3.1-flash 1,80 seconde contre GLM-5.3-Flash 3,18 secondes. Le modèle d’Ant commence à répondre pendant que le modèle de Z.ai réfléchit encore, ce qui compte davantage que le débit dans les usages interactifs et en streaming.
• Temps par tâche de l'Intelligence Index — Ling-3.1-flash environ 357 secondes contre GLM-5.3-Flash environ 979 secondes. Une seule tâche d'évaluation prend à GLM-5.3-Flash près de trois fois plus de temps de bout en bout, car il est à la fois plus lent par token et plus lent à démarrer.
Pour une boucle d’agent qui enchaîne une douzaine d’appels séquentiels, ou pour un produit où quelqu’un regarde les tokens arriver, ce n’est pas un simple critère de départage — c’est la raison même de préférer un modèle. GLM-5.3-Flash est le meilleur modèle sur le papier et le plus lent dans le chemin de la requête.
Là où GLM-5.3-Flash est tout simplement meilleur
Partout ailleurs, et la liste est suffisamment longue pour que l'avantage en débit doive mériter sa place.
• Fiabilité des connaissances — GLM-5.3-Flash obtient +7,47 sur AA-Omniscience, le meilleur des trois modèles de la gamme Flash, avec un taux d’hallucination de 27,6 % sur les questions auxquelles il a répondu. Ling-3.1-flash obtient +2,22 avec un taux d’hallucination de 37,9 %. Sur une mesure qui pénalise davantage l’invention que le refus, l’écart est réel et va dans le même sens que l’indice.
• Connaissances scientifiques — GLM-5.3-Flash obtient 0,912 sur GPQA Diamond. Ling-3.1-flash n’a aucune ligne GPQA Diamond publiée. Il en va de même pour DeepSeek V4.1 Flash (Max). Un modèle qui affiche 0,91 à des questions scientifiques de niveau cycle supérieur est un instrument différent d’un modèle qui n’a pas été mesuré sur celles-ci.
• Modalité — GLM-5.3-Flash prend en charge le texte, les images et la vidéo. Ling-3.1-flash ne prend en charge que le texte. Il ne s'agit pas d'un écart de performance à combler par un benchmark ; c'est une capacité qui est absente.
• Poids et licence — GLM-5.3-Flash est à poids ouverts sous licence MIT, téléchargeable et auto-hébergeable. Ling-3.1-flash n'a publié aucun checkpoint, aucun texte de licence, et est classé comme propriétaire.
• Travail intellectuel agentique — GLM-5.3-Flash 1 453,73 Elo sur AA-Briefcase v1.1, contre les 1 400,35 de Ling-3.1-flash, sur un benchmark conçu spécifiquement autour de tâches de travail intellectuel plutôt que de pilotage de terminal.
• Prix — GLM-5.3-Flash est publié à 0,15 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie sur l'API de Z.ai, contre 0,30 $ et 0,90 $ pour Ling-3.1-flash. Soit la moitié du tarif d'entrée et environ la moitié du tarif de sortie, pour un modèle doté d'un score d'indice plus élevé et de poids ouverts.

Les lignes où le modèle Ant répond en retour
Ling-3.1-flash n'est pas battu sur tous les aspects. Sur le travail en terminal agentique, il est légèrement en avance et sur coding-science, il est à égalité :
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. En pratique, une égalité, et les deux se situent en dessous du niveau de pointe.
• SciCode — Ling-3.1-flash 0,541 contre GLM-5.3-Flash 0,516. Une victoire étroite.
• AutomationBench-AA — 0,617 contre 0,604. Encore une victoire de justesse.
• GDPval-AA — Ling-3.1-flash 1 621,75 Elo vs GLM-5.3-Flash 1 646,86. GLM reprend celle-ci.
Si l’on lit les quatre lignes ensemble, la configuration est claire. Là où l’on peut tant soit peu séparer les deux modèles, cette séparation tient dans le bruit d’une seule exécution d’évaluation. L’écart d’un point d’indice entre eux n’est pas un classement ; c’est un pile ou face légèrement pondéré en faveur de GLM par les lignes de fiabilité. Ce qui n’est pas un pile ou face, c’est l’écart de débit de 4× et l’écart de prix de 2×, qui pointent tous les deux dans l’autre sens.
Il y a aussi un détail de service qui mérite d’être signalé, car il modifie l’ampleur de cet écart de débit selon l’endroit d’où vous appelez un modèle. L’API de Z.ai elle-même mesure 53,0 jetons par seconde. La mesure sur sept jours de notre propre catalogue pour GLM-5.3-Flash sur nos routes indique 150,6 jetons par seconde en sortie, avec une latence médiane de 4,2 secondes pour le premier jeton. Les mêmes poids servis depuis un déploiement différent s’exécutent près de trois fois plus vite. Les chiffres de débit d’un vendeur sont une propriété d’un fournisseur, pas d’un modèle.
Spécification, ligne par ligne
Sujet en premier sur chaque ligne :
• Taille — Ling-3.1-flash 560B au total / 25B actifs vs GLM-5.3-Flash 320B au total / 18B actifs.
Contexte déclaré — 1 M de tokens pour les deux. La ligne de raisonnement à long contexte de GLM-5.3-Flash obtient 0,80 sur AA-LCR ; celle de Ling-3.1-flash, 0,83. Toutes deux sont proches du 0,84 de DeepSeek V4.1 Flash (Max), autrement dit le raisonnement à long contexte n'est plus un facteur différenciant à ce niveau.
• Plafond de sortie — GLM-5.3-Flash 128 000 tokens sur notre catalogue, contre Ling-3.1-flash sans maximum publié. L'un d'eux peut être dimensionné pour la génération longue, et l'autre non.
• Index — 41 vs 42.
• Débit — 211,0 jetons par seconde contre 53,0 sur les API du fournisseur, 150,6 mesuré sur nos routes.
• Poids — propriétaires sans licence vs ouverts sous licence MIT.
• Modalité — texte uniquement ; texte, image et vidéo en entrée.
• Prix — 0,30 $ / 0,90 $ par million en entrée / sortie contre 0,15 $ / 0,50 $ sur l'API de Z.ai.
Comment effectuer réellement cette comparaison
GLM-5.3-Flash figure désormais au catalogue d'OrcaRouter, à 0,075 $ par million de tokens en entrée, 0,25 $ par million de tokens en sortie et 0,0173 $ par million de lectures de cache — consultez la fiche en direct plutôt que ce paragraphe, car les tarifs de service évoluent et le dispositif de pass-through signifie qu'un changement de prix chez un fournisseur est répercuté de notre côté le jour même. L'intérêt de ce dispositif pour cette confrontation précise, c'est que l'ouverture et l'avantage tarifaire de GLM-5.3-Flash sont les deux éléments qui en font la valeur par défaut raisonnable, et une route fermée à 0 % de marge est ce qui vous permet de continuer à tester Ling-3.1-flash face à lui sans ajouter de relation fournisseur.
Ling-3.1-flash n'est pas dans notre catalogue — une recherche dans notre API publique de modèles renvoie not-found pour le modèle sous InclusionAI, et cet article ne laissera pas entendre que nous le servons. Il passe par l'API propre d'Ant et les plateformes tierces qui portent la sortie, ce qui constitue l'étendue honnête de sa disponibilité.
La forme productive de cette comparaison n’est pas un choix binaire. GLM-5.3-Flash est ouvert, le moins cher, multimodal, plus fiable sur les questions de connaissances et disponible via 23 fournisseurs — c’est un chemin par défaut. L’argument de Ling-3.1-flash repose sur le débit et le TTFT dans les boucles agentiques, et son coût est qu’il est fermé, texte uniquement, plus cher et accessible par moins de portes. Orientez le travail interactif et sensible à la latence vers le modèle rapide, gardez le travail par lots, riche en connaissances et multimodal sur le modèle ouvert, et placez un repli entre les deux afin qu’un amont lent ne devienne pas un produit lent.
Lequel choisir
Si vos critères d’évaluation sont la capacité, le coût, l’ouverture et la modalité, GLM-5.3-Flash remporte ce match, et ce n’est pas particulièrement serré — un score d’indice plus élevé, le meilleur profil de fiabilité des connaissances de sa catégorie, un score de 0,912 à GPQA Diamond, des poids sous licence MIT, une entrée vidéo, un prix deux fois inférieur, et 23 fournisseurs derrière lui. Si vos critères incluent le temps d’attente d’un utilisateur ou le nombre d’appels séquentiels qu’une tâche peut effectuer, Ling-3.1-flash est le modèle qui termine, et son taux de génération quatre fois supérieur n’est pas une erreur d’arrondi dans une boucle d’agent.
Ce qui trancherait, c’est un détail de service qu’aucun des deux fournisseurs ne publie sous une forme comparable : le débit réellement livré sur votre charge de travail, via votre fournisseur. Les deux modèles répondent au même format chat-completions compatible OpenAI, ce qui signifie que passer de l’un à l’autre relève d’un changement de configuration plutôt que d’une migration — et pour deux modèles séparés par un point d’indice et un facteur quatre en vitesse, mesurer ce seul chiffre sur votre propre trafic est un meilleur usage d’un après-midi que de lire une ligne de benchmark supplémentaire.


Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
