Carte hero éditoriale générée intitulée « Ling-3.1-flash vs Gemini 3.8 Flash », avec le sous-titre « Un essai gratuit de 256K contre une API de production de 1M de tokens ». Deux lignes de comparaison indiquent « Ling-3.1-flash : essai gratuit de deux semaines, contexte de 262 144 tokens, aucun poids publié » et « Gemini 3.8 Flash : 0,75 $ / 3,75 $ par million de tokens, contexte de 1 048 576 tokens, entrée multimodale », au-dessus d'un pied de page indiquant « Chiffres de Ling déclarés par le fournisseur ; chiffres de Gemini selon OrcaRouter et Artificial Analysis. »
Guides & Insights

Ling-3.1-flash vs Gemini 3.8 Flash : un modèle d’essai 256K contre un modèle en production de 1 M de tokens

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez Ling-3.1-flash et Gemini 3.8 Flash côte à côte et le décalage n’est pas une question d’intelligence — c’est une question d’état. Ling-3.1-flash, le mélange d’experts d’environ 560 milliards de paramètres d’Ant Group annoncé les 29 et 30 septembre 2026, est un essai gratuit de deux semaines avec un contexte servi de 256 K, un plafond de sortie de 32 768 tokens, une entrée texte uniquement, et aucun poids, licence ou prix publiés. Gemini 3.8 Flash, le modèle de raisonnement de niveau Flash de Google publié le 2 septembre 2026, est une API en disponibilité générale avec une fenêtre complète de 1 048 576 tokens, une sortie de 65 536 tokens, une entrée multimodale et une grille tarifaire publique. Sur le papier, c’est une comparaison entre deux modèles ; en pratique, c’est la comparaison entre un modèle sur lequel vous pouvez bâtir dès aujourd’hui et un modèle que vous ne pouvez tester que ce mois-ci.

Ce n'est pas une raison pour écarter Ling-3.1-flash. Un MoE gratuit de 560B avec un penchant agentique vaut deux semaines du temps d'évaluation de n'importe qui. Mais cela change l'objet d'un face-à-face : non pas « sur lequel devrais-je me standardiser », mais « le modèle d'essai est-il assez bon pour que je doive me couvrir sur la réponse dans quinze jours ». Ce sont des questions différentes, et elles ont des réponses différentes sur chaque axe ci-dessous.

Les trois choses qui font pencher la balance avant même qu’un benchmark ne le fasse

La plupart des comparaisons commencent par les scores. Celle-ci devrait commencer par la disponibilité, car l’écart à ce niveau n’est pas une question de degré.

• Tarification — Ling-3.1-flash est gratuit pendant toute la durée de son essai et ne dispose d’absolument aucune grille tarifaire publiée pour l’après-essai. Gemini 3.8 Flash est affiché à 0,75 $ par million de tokens d’entrée et 3,75 $ par million de tokens de sortie pendant sa période promotionnelle, puis à 1,50 $ / 7,50 $ à compter du 1er janvier 2027. Prix catalogue communiqués par le fournisseur ; les deux sont susceptibles d’être modifiés.

• Contexte — Ling-3.1-flash prend en charge 262 144 tokens dans l’essai, avec 1 000 000 cités comme objectif à terme. Gemini 3.8 Flash prend en charge la totalité des 1 048 576 tokens dès aujourd’hui. Si votre charge de travail dépend de la fenêtre d’un million de tokens, un seul de ces deux modèles en dispose dès maintenant.

• Poids — Ling-3.1-flash n'en a publié aucun : pas de dépôt, pas de licence, pas de point de contrôle, juste une intention déclarée d'ouvrir le code source après l'essai. Gemini 3.8 Flash est fermé et le restera toujours, mais c'est une API gérée que vous pouvez appeler sans ambiguïté dès aujourd'hui.

Lus ensemble, ces trois éléments convergent vers un seul point : les avantages phares du modèle Ling sont soit promotionnels (gratuit), soit prospectifs (contexte de 1 M, poids ouverts), tandis que les avantages du modèle Gemini sont contractuels. Cette asymétrie traverse tout ce qui suit.

Là où le modèle Ling l’emporte véritablement

Deux endroits, et les deux sont réels.

Le premier point, c’est le coût pendant l’évaluation. Un essai gratuit de deux semaines sur un modèle de cette taille n’est pas un gadget marketing à balayer d’un revers de main — c’est le moyen le moins cher de savoir si un mixture-of-experts de 560B gère vos prompts. Gemini 3.8 Flash, quel que soit son prix, n’est pas gratuit, et une évaluation sérieuse sur quelques milliers d’appels coûte vraiment de l’argent.

Le deuxième, c’est la trajectoire d’ouverture. Ling-3.1-flash succède à un modèle qui a bel et bien été livré avec des poids sous licence MIT, et Ant a déclaré publiquement qu’il comptait publier celui-ci en open source, lui aussi. Si cela se concrétise avec une licence permissive, vous obtenez quelque chose que Gemini 3.8 Flash ne pourra jamais offrir : la possibilité d’auto-héberger, de fine-tuner ou de distiller un modèle de base de 560 B. Le hic, c’est celui qui compte le plus — vous pariez sur une promesse, et la promesse de la génération précédente a été tenue avec deux semaines de retard, pas une garantie.

Là où Gemini 3.8 Flash est loin de perdre

Écartez le procès et la question de l'ouverture, et la comparaison opérationnelle penche nettement en faveur de Google.

• Entrée — Gemini 3.8 Flash accepte le texte, les images, la vidéo, les fichiers et l'audio. Ling-3.1-flash accepte le texte et renvoie du texte. Pour les flux de travail sur documents, captures d'écran ou vidéos, il ne s'agit pas d'une préférence, mais d'une limite de capacités.

• Plafond de sortie — 65 536 tokens contre 32 768. Pertinent dès l'instant où vous générez des rapports, des fichiers de code ou une sortie structurée longue en une seule passe.

• Débit — des tests indépendants situent la vitesse de sortie médiane de Gemini 3.8 Flash à près de 249 tokens par seconde, la télémétrie sur sept jours d’OrcaRouter mesurant 552 tokens par seconde avec un p50 de 4,95 secondes jusqu’au premier token. L’hébergement d’essai de Ling-3.1-flash aurait été rapporté autour de 63 tokens par seconde. Le modèle Gemini appartient à une autre classe de vitesse.

• Profondeur de référence — Gemini 3.8 Flash s’appuie sur un ensemble de mesures indépendantes ; les chiffres de Ling-3.1-flash sont tous des données first-party, sur un endpoint flambant neuf, sans qu’aucun tiers ne les ait encore reproduits.

• Agents multimodaux — tout ce qui doit lire une capture d’écran, un PDF ou un appel enregistré est une tâche Gemini par construction, pas par qualité.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmarks, et pourquoi les deux ensembles ne sont pas vraiment comparables

Le bilan rapporté par le fournisseur pour Ling-3.1-flash est un score agrégé de 81,0 sur cinq benchmarks d'agents, avec 40,4 % sur Terminal-Bench 4.0, 55,9 % sur SWE-Atlas et 65,35 % sur HealthBench Professional ; le propre décompte d'Ant ajoute 1 673 Elo sur GDPVal-AA v2.1 et 75,16 sur FrontierSWE. Chacun de ces chiffres est une mesure d'Ant lui-même. Aucun harnais n'est publié et, plus important encore, aucun poids n'est disponible pour permettre à quiconque de réexécuter la suite.

Le portrait de Gemini 3.8 Flash est d'une autre nature. Sur la version actuelle de l'Intelligence Index d'Artificial Analysis (v4.3.2), il obtient 40,9 avec un effort de raisonnement élevé, 39,8 avec un effort moyen et 33,5 avec un effort faible — et il convient de souligner que l'indice a été révisé récemment, de sorte que les chiffres publiés au sujet de ce modèle plus tôt dans l'automne ont été calculés sur une autre version et ne sont pas directement comparables à ceux-ci. Les chiffres avancés par Google pour ce modèle incluent 54,9 sur HLE-Verif et de solides résultats sur Terminal-Bench 2.1, dans le haut de la fourchette des 80. Indépendant et fournisseur, côte à côte, tous deux légitimes, aucun interchangeable avec l'autre.

Il y a une comparaison croisée limpide qui mérite d’être faite, car tous deux se situent dans la même famille de benchmarks. Sur Terminal-Bench 4.0, le chiffre du fournisseur pour Ling-3.1-flash est de 40,4 %. Claude Sonnet 5.5 — un modèle de milieu de gamme, pas un modèle phare — obtient 70,6 % sur cette même version. Cette seule ligne constitue l’argument le plus fort contre le fait d’interpréter la fiche d’Ant comme « proche de la frontière » : le modèle est compétitif sur les mesures agentiques qu’Ant a choisi de mettre en avant et nettement en retrait sur la mesure de codage en terminal pour laquelle un chiffre externe existe.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

La forme pratique du choix

Si vous devez construire quelque chose dans les deux prochaines semaines, la réponse est sans appel, et ce n'est pas un reproche envers Ling-3.1-flash. Gemini 3.8 Flash est le seul des deux à vous offrir un point de terminaison stable, un prix publié, une fenêtre complète d'un million de tokens, une entrée multimodale et une licence que vous pouvez lire. C'est un modèle de production de la gamme Flash.

Ling-3.1-flash est une cible d'évaluation. Sa valeur actuelle tient à ce que l'évaluation est gratuite et que le modèle est intéressant : un MoE de 560B avec seulement ~25B actifs par token est un pari sur la parcimonie, et Ant l'a positionné exactement pour les charges de travail d'agent, de recherche et d'automatisation de bureau que se disputent les modèles de la gamme Flash. Faire tourner vos propres prompts dessus pendant la fenêtre d'essai vaut le coup précisément parce que personne en dehors d'Ant ne l'a encore fait — vous seriez parmi les premiers à avoir un avis indépendant du fournisseur.

L'arbre de décision qui a du sens ce mois-ci : acheminez la production vers Gemini 3.8 Flash, passez l'essai gratuit à exécuter Ling-3.1-flash sur vos prompts les plus difficiles, et considérez la question des poids ouverts comme la véritable bifurcation. Si les poids arrivent sous une licence permissive et qu'un prix se situe près du palier de Flash, Ling-3.1-flash devient une véritable deuxième option — que vous pouvez auto-héberger, ce que Gemini ne sera jamais. S'ils arrivent avec des conditions restrictives, l'essai se termine, et la comparaison aussi.

Faire tourner les deux à partir d’une seule clé, et être franc sur ce qui manque

Gemini 3.8 Flash figure dès aujourd'hui au catalogue d'OrcaRouter sous l'ID de modèle google/gemini-3.8-flash, au prix catalogue de Google lui-même, sans aucune marge — ainsi, lorsque le tarif promotionnel prendra fin en janvier, le prix que vous payez ici le suivra automatiquement, sans qu'il faille un nouveau contrat. DeepSeek-V4.1-Flash, l'autre modèle abordable de la gamme Flash qu'il vaut la peine de mesurer dans la même expérience, se trouve dans le même catalogue au prix catalogue de son fournisseur, de sorte qu'un test à trois volets, comparant un modèle d'essai à des options établies de la gamme Flash, s'exécute derrière une seule clé API avec basculement automatique entre eux.

Ling-3.1-flash ne figure pas dans notre catalogue, et une requête à notre API publique de modèles renvoie not-found pour lui comme pour la génération précédente — donc la formulation honnête est que l'essai se déroule là où il se déroule, via l'interface propre du fournisseur et des plateformes d'inférence tierces, et nous ne prétendons pas l'héberger. C'est la partie de cette comparaison qui pourrait changer le plus vite : un modèle en essai gratuit avec un prix non annoncé est précisément le genre de chose qui atterrit sur une couche de routage dès qu'Ant et ses hôtes publient une grille tarifaire, et une répercussion à marge nulle signifie que le jour où cela se produit, le prix ici est le prix là-bas.

Donc, le verdict est plus limité que ne le suggère le nombre de paramètres. Ling-3.1-flash est le modèle le plus ambitieux et le résultat de recherche le plus intéressant ; Gemini 3.8 Flash est celui que vous pouvez réellement livrer. Tant qu’il n’existe pas de licence ni de prix, c’est là toute la différence — et ce n’est pas une différence qu’une ligne de benchmark tranchera.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement