
Ling-3.1-flash vs Gemini 3.8 Flash : un modèle d’essai 256K contre un modèle en production de 1 M de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Mettez Ling-3.1-flash et Gemini 3.8 Flash côte à côte et le décalage n’est pas une question d’intelligence — c’est une question d’état. Ling-3.1-flash, le mélange d’experts d’environ 560 milliards de paramètres d’Ant Group annoncé les 29 et 30 septembre 2026, est un essai gratuit de deux semaines avec un contexte servi de 256 K, un plafond de sortie de 32 768 tokens, une entrée texte uniquement, et aucun poids, licence ou prix publiés. Gemini 3.8 Flash, le modèle de raisonnement de niveau Flash de Google publié le 2 septembre 2026, est une API en disponibilité générale avec une fenêtre complète de 1 048 576 tokens, une sortie de 65 536 tokens, une entrée multimodale et une grille tarifaire publique. Sur le papier, c’est une comparaison entre deux modèles ; en pratique, c’est la comparaison entre un modèle sur lequel vous pouvez bâtir dès aujourd’hui et un modèle que vous ne pouvez tester que ce mois-ci.
Ce n'est pas une raison pour écarter Ling-3.1-flash. Un MoE gratuit de 560B avec un penchant agentique vaut deux semaines du temps d'évaluation de n'importe qui. Mais cela change l'objet d'un face-à-face : non pas « sur lequel devrais-je me standardiser », mais « le modèle d'essai est-il assez bon pour que je doive me couvrir sur la réponse dans quinze jours ». Ce sont des questions différentes, et elles ont des réponses différentes sur chaque axe ci-dessous.
Les trois choses qui font pencher la balance avant même qu’un benchmark ne le fasse
La plupart des comparaisons commencent par les scores. Celle-ci devrait commencer par la disponibilité, car l’écart à ce niveau n’est pas une question de degré.
• Tarification — Ling-3.1-flash est gratuit pendant toute la durée de son essai et ne dispose d’absolument aucune grille tarifaire publiée pour l’après-essai. Gemini 3.8 Flash est affiché à 0,75 $ par million de tokens d’entrée et 3,75 $ par million de tokens de sortie pendant sa période promotionnelle, puis à 1,50 $ / 7,50 $ à compter du 1er janvier 2027. Prix catalogue communiqués par le fournisseur ; les deux sont susceptibles d’être modifiés.
• Contexte — Ling-3.1-flash prend en charge 262 144 tokens dans l’essai, avec 1 000 000 cités comme objectif à terme. Gemini 3.8 Flash prend en charge la totalité des 1 048 576 tokens dès aujourd’hui. Si votre charge de travail dépend de la fenêtre d’un million de tokens, un seul de ces deux modèles en dispose dès maintenant.
• Poids — Ling-3.1-flash n'en a publié aucun : pas de dépôt, pas de licence, pas de point de contrôle, juste une intention déclarée d'ouvrir le code source après l'essai. Gemini 3.8 Flash est fermé et le restera toujours, mais c'est une API gérée que vous pouvez appeler sans ambiguïté dès aujourd'hui.
Lus ensemble, ces trois éléments convergent vers un seul point : les avantages phares du modèle Ling sont soit promotionnels (gratuit), soit prospectifs (contexte de 1 M, poids ouverts), tandis que les avantages du modèle Gemini sont contractuels. Cette asymétrie traverse tout ce qui suit.
Là où le modèle Ling l’emporte véritablement
Deux endroits, et les deux sont réels.
Le premier point, c’est le coût pendant l’évaluation. Un essai gratuit de deux semaines sur un modèle de cette taille n’est pas un gadget marketing à balayer d’un revers de main — c’est le moyen le moins cher de savoir si un mixture-of-experts de 560B gère vos prompts. Gemini 3.8 Flash, quel que soit son prix, n’est pas gratuit, et une évaluation sérieuse sur quelques milliers d’appels coûte vraiment de l’argent.
Le deuxième, c’est la trajectoire d’ouverture. Ling-3.1-flash succède à un modèle qui a bel et bien été livré avec des poids sous licence MIT, et Ant a déclaré publiquement qu’il comptait publier celui-ci en open source, lui aussi. Si cela se concrétise avec une licence permissive, vous obtenez quelque chose que Gemini 3.8 Flash ne pourra jamais offrir : la possibilité d’auto-héberger, de fine-tuner ou de distiller un modèle de base de 560 B. Le hic, c’est celui qui compte le plus — vous pariez sur une promesse, et la promesse de la génération précédente a été tenue avec deux semaines de retard, pas une garantie.
Là où Gemini 3.8 Flash est loin de perdre
Écartez le procès et la question de l'ouverture, et la comparaison opérationnelle penche nettement en faveur de Google.
• Entrée — Gemini 3.8 Flash accepte le texte, les images, la vidéo, les fichiers et l'audio. Ling-3.1-flash accepte le texte et renvoie du texte. Pour les flux de travail sur documents, captures d'écran ou vidéos, il ne s'agit pas d'une préférence, mais d'une limite de capacités.
• Plafond de sortie — 65 536 tokens contre 32 768. Pertinent dès l'instant où vous générez des rapports, des fichiers de code ou une sortie structurée longue en une seule passe.
• Débit — des tests indépendants situent la vitesse de sortie médiane de Gemini 3.8 Flash à près de 249 tokens par seconde, la télémétrie sur sept jours d’OrcaRouter mesurant 552 tokens par seconde avec un p50 de 4,95 secondes jusqu’au premier token. L’hébergement d’essai de Ling-3.1-flash aurait été rapporté autour de 63 tokens par seconde. Le modèle Gemini appartient à une autre classe de vitesse.
• Profondeur de référence — Gemini 3.8 Flash s’appuie sur un ensemble de mesures indépendantes ; les chiffres de Ling-3.1-flash sont tous des données first-party, sur un endpoint flambant neuf, sans qu’aucun tiers ne les ait encore reproduits.
• Agents multimodaux — tout ce qui doit lire une capture d’écran, un PDF ou un appel enregistré est une tâche Gemini par construction, pas par qualité.

Benchmarks, et pourquoi les deux ensembles ne sont pas vraiment comparables
Le bilan rapporté par le fournisseur pour Ling-3.1-flash est un score agrégé de 81,0 sur cinq benchmarks d'agents, avec 40,4 % sur Terminal-Bench 4.0, 55,9 % sur SWE-Atlas et 65,35 % sur HealthBench Professional ; le propre décompte d'Ant ajoute 1 673 Elo sur GDPVal-AA v2.1 et 75,16 sur FrontierSWE. Chacun de ces chiffres est une mesure d'Ant lui-même. Aucun harnais n'est publié et, plus important encore, aucun poids n'est disponible pour permettre à quiconque de réexécuter la suite.
Le portrait de Gemini 3.8 Flash est d'une autre nature. Sur la version actuelle de l'Intelligence Index d'Artificial Analysis (v4.3.2), il obtient 40,9 avec un effort de raisonnement élevé, 39,8 avec un effort moyen et 33,5 avec un effort faible — et il convient de souligner que l'indice a été révisé récemment, de sorte que les chiffres publiés au sujet de ce modèle plus tôt dans l'automne ont été calculés sur une autre version et ne sont pas directement comparables à ceux-ci. Les chiffres avancés par Google pour ce modèle incluent 54,9 sur HLE-Verif et de solides résultats sur Terminal-Bench 2.1, dans le haut de la fourchette des 80. Indépendant et fournisseur, côte à côte, tous deux légitimes, aucun interchangeable avec l'autre.
Il y a une comparaison croisée limpide qui mérite d’être faite, car tous deux se situent dans la même famille de benchmarks. Sur Terminal-Bench 4.0, le chiffre du fournisseur pour Ling-3.1-flash est de 40,4 %. Claude Sonnet 5.5 — un modèle de milieu de gamme, pas un modèle phare — obtient 70,6 % sur cette même version. Cette seule ligne constitue l’argument le plus fort contre le fait d’interpréter la fiche d’Ant comme « proche de la frontière » : le modèle est compétitif sur les mesures agentiques qu’Ant a choisi de mettre en avant et nettement en retrait sur la mesure de codage en terminal pour laquelle un chiffre externe existe.

La forme pratique du choix
Si vous devez construire quelque chose dans les deux prochaines semaines, la réponse est sans appel, et ce n'est pas un reproche envers Ling-3.1-flash. Gemini 3.8 Flash est le seul des deux à vous offrir un point de terminaison stable, un prix publié, une fenêtre complète d'un million de tokens, une entrée multimodale et une licence que vous pouvez lire. C'est un modèle de production de la gamme Flash.
Ling-3.1-flash est une cible d'évaluation. Sa valeur actuelle tient à ce que l'évaluation est gratuite et que le modèle est intéressant : un MoE de 560B avec seulement ~25B actifs par token est un pari sur la parcimonie, et Ant l'a positionné exactement pour les charges de travail d'agent, de recherche et d'automatisation de bureau que se disputent les modèles de la gamme Flash. Faire tourner vos propres prompts dessus pendant la fenêtre d'essai vaut le coup précisément parce que personne en dehors d'Ant ne l'a encore fait — vous seriez parmi les premiers à avoir un avis indépendant du fournisseur.
L'arbre de décision qui a du sens ce mois-ci : acheminez la production vers Gemini 3.8 Flash, passez l'essai gratuit à exécuter Ling-3.1-flash sur vos prompts les plus difficiles, et considérez la question des poids ouverts comme la véritable bifurcation. Si les poids arrivent sous une licence permissive et qu'un prix se situe près du palier de Flash, Ling-3.1-flash devient une véritable deuxième option — que vous pouvez auto-héberger, ce que Gemini ne sera jamais. S'ils arrivent avec des conditions restrictives, l'essai se termine, et la comparaison aussi.
Faire tourner les deux à partir d’une seule clé, et être franc sur ce qui manque
Gemini 3.8 Flash figure dès aujourd'hui au catalogue d'OrcaRouter sous l'ID de modèle google/gemini-3.8-flash, au prix catalogue de Google lui-même, sans aucune marge — ainsi, lorsque le tarif promotionnel prendra fin en janvier, le prix que vous payez ici le suivra automatiquement, sans qu'il faille un nouveau contrat. DeepSeek-V4.1-Flash, l'autre modèle abordable de la gamme Flash qu'il vaut la peine de mesurer dans la même expérience, se trouve dans le même catalogue au prix catalogue de son fournisseur, de sorte qu'un test à trois volets, comparant un modèle d'essai à des options établies de la gamme Flash, s'exécute derrière une seule clé API avec basculement automatique entre eux.
Ling-3.1-flash ne figure pas dans notre catalogue, et une requête à notre API publique de modèles renvoie not-found pour lui comme pour la génération précédente — donc la formulation honnête est que l'essai se déroule là où il se déroule, via l'interface propre du fournisseur et des plateformes d'inférence tierces, et nous ne prétendons pas l'héberger. C'est la partie de cette comparaison qui pourrait changer le plus vite : un modèle en essai gratuit avec un prix non annoncé est précisément le genre de chose qui atterrit sur une couche de routage dès qu'Ant et ses hôtes publient une grille tarifaire, et une répercussion à marge nulle signifie que le jour où cela se produit, le prix ici est le prix là-bas.
Donc, le verdict est plus limité que ne le suggère le nombre de paramètres. Ling-3.1-flash est le modèle le plus ambitieux et le résultat de recherche le plus intéressant ; Gemini 3.8 Flash est celui que vous pouvez réellement livrer. Tant qu’il n’existe pas de licence ni de prix, c’est là toute la différence — et ce n’est pas une différence qu’une ligne de benchmark tranchera.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
