Carte d'accroche éditoriale générée intitulée « Ling-3.1-flash est en ligne et gratuit pendant deux semaines », avec le sous-titre « Ce que le MoE 560B sert réellement aujourd'hui ». Quatre cartes arrondies indiquent « Paramètres : 560B au total / ~25B actifs », « Contexte : 262 144 jetons », « Plafond de sortie : 32 768 jetons » et « Poids : non publiés », au-dessus d'une ligne de pied de page indiquant « Spécifications déclarées par le fournisseur ; aucun tarif post-essai publié. »
Guides & Insights

Ling-3.1-flash est en ligne et gratuit pendant deux semaines : ce que le MoE 560B propose réellement

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ling-3.1-flash, le mélange d'experts d'environ 560 milliards de paramètres que le laboratoire inclusionAI d'Ant Group a annoncé les 29 et 30 septembre 2026, a cessé d'être un simple communiqué de presse cette semaine : il répond désormais aux requêtes sur une API commerciale en production. Le modèle est en essai gratuit de deux semaines sur une passerelle d'inférence tierce, et il apparaît aussi dans le produit Ling Studio d'Ant — ce qui déplace la question de « existe-t-il » à « que sert-il réellement ». La réponse est plus restreinte que ne le laissent penser les grands chiffres annoncés. Ling-3.1-flash fonctionne en entrée texte, sortie texte ; il sert un contexte de 262 144 jetons (256K) alors même que l'annonce cite 1M comme objectif à terme ; sa sortie est plafonnée à 32 768 jetons ; et personne n'a publié le prix que vous paierez au quinzième jour, lorsque la fenêtre gratuite se refermera et que les poids sont censés suivre.

Cet écart entre la fiche d'annonce et le point de terminaison actif est ce qu'il faut retenir, car la plupart des articles consacrés à cette sortie lisent les spécifications comme si le modèle les livrait aujourd'hui. Ce n'est pas le cas. Ling-3.1-flash est le deuxième modèle de ce laboratoire en trois mois à arriver sous la forme de ce que le traqueur indépendant LLM Releases classe sans détour sous « poids non publiés », et la différence entre ce qu'Ant dit que le modèle est et ce qu'un développeur peut réellement appeler dès maintenant est précisément là où un budget ou un projet pilote peut discrètement mal tourner.

Qu’est-ce qui a changé entre l’annonce et aujourd’hui ?

L’annonce elle-même était un post de spécification : ~560B paramètres au total, ~25B actifs par token, jusqu’à 1M de tokens de contexte, trois chiffres clés d’évaluation, et une promesse — « nous prévoyons d’ouvrir le modèle en open source bientôt. » Rien de tout cela n’a changé. Ce qui a changé, c’est la disponibilité. En l’espace d’un jour après l’annonce, le modèle était accessible sur une offre edge commerciale, et l’essai gratuit expose le même point de terminaison réel qu’une offre payante : même surface d’API, même modalité texte uniquement, même bascule en mode réflexion pour le travail d’agent sur un horizon long.

Pour quiconque doit décider s'il vaut la peine d'y consacrer du temps d'ingénierie, l'essai est tout ce qui compte cette semaine, et il est à double tranchant. L'inférence gratuite pendant deux semaines est un moyen vraiment bon marché de voir comment le modèle se comporte sur vos propres prompts — une rareté pour un modèle de cette taille. Mais la gratuité est un état promotionnel, pas un prix. Il n'existe encore nulle part de grille tarifaire publiée pour Ling-3.1-flash après l'essai, donc tout modèle de coût que vous construisez sur l'offre gratuite n'est qu'une valeur provisoire tant qu'Ant et ses hébergeurs n'y mettent pas des chiffres.

La fiche technique, et les trois chiffres qui ne sont encore que des promesses

• Paramètres — 560 B au total, ~25 B actifs par token. Annoncé par le fournisseur, et environ le quadruple des 124 B au total / 5,1 B actifs de la génération précédente. Le ratio de parcimonie reste proche de 1 sur 22, donc l’activation n’est pas radicalement plus légère — le modèle est simplement bien plus grand que celui auquel il succède.

• Contexte — servi à 262 144 tokens aujourd’hui. « Jusqu’à 1 M » est l’objectif une fois la fenêtre activée ; ce n’est pas ce que le point de terminaison d’essai vous donne, et c’est l’interprétation erronée la plus courante de cette version.

• Sortie — 32 768 jetons maximum. Raisonnable pour les boucles d'agents, serré si vous comptez générer de longs documents en une seule passe.

• Modalité — entrée texte, sortie texte. Il s’agit d’un modèle textuel. La vision, l’audio et l’import de fichiers ne font pas partie du lancement, et aucune date n’a été donnée pour leur disponibilité.

• Raisonnement — une pile hybride avec un commutateur explicite de mode de réflexion, le même schéma que celui utilisé par la génération précédente, destinée aux tâches multi-étapes d’agent et d’appel d’outils plutôt qu’au chat en un seul tour.

• Poids et licence — non publiés. C'est le chiffre qui compte le plus, et celui qui n'a encore aucune valeur : à ce jour, il n'existe aucun dépôt Hugging Face, aucun texte de licence ni aucun checkpoint téléchargeable.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

La carte de référence, lue avec la remise dont elle a besoin

Les propres rapports d’Ant placent Ling-3.1-flash à un score agrégé de 81,0 sur cinq benchmarks d’agents, avec 40,4 % sur Terminal-Bench 4.0, 55,9 % sur SWE-Atlas et 65,35 % sur HealthBench Professional ; le propre bilan de l’entreprise ajoute 1 673 Elo sur GDPVal-AA v2.1 et 75,16 sur FrontierSWE. Chacun de ces chiffres provient du fournisseur lui-même. Il n’existe ni harnais, ni jeu de prompts, ni poids permettant à quiconque de réexécuter la suite, ce qui est la mise en garde habituelle pour un modèle à ce stade — et ici, il vaut la peine de le dire clairement : un score de fournisseur non reproduit est une affirmation sur un modèle, pas une mesure de celui-ci.

La fiche est aussi instructive d'une manière que ses auteurs n'avaient peut-être pas prévue. Le résultat de 40,4 % à Terminal-Bench 4.0 se situe largement en retrait du niveau des modèles de frontière ; Claude Sonnet 5.5, un modèle de milieu de gamme plutôt qu'un modèle phare, obtient 70,6 % sur la même version de ce benchmark. L'interprétation honnête n'est pas que Ling-3.1-flash est faible — 40,4 % est un résultat respectable en terminal agentique pour un modèle positionné sur le coût — mais que la formulation « proche de la frontière sur les benchmarks clés » qui a circulé sur les réseaux sociaux le jour de l'annonce ne survit pas au contact des lignes précises. Le benchmark sur lequel le modèle semble le plus fort, HealthBench Professional, à 65,35, est aussi celui qui porte la note de bas de page embarrassante : Ant déclare que le modèle a été évalué dans un environnement qu'Ant appelle AQ et que la capacité du modèle en matière de santé « ne peut actuellement être expérimentée que dans AQ », sans définir publiquement ce qu'est AQ. Un score mis en avant, assorti d'un environnement non nommé, est une démo, pas un résultat reproductible.

Pourquoi un grand modèle qui arrive en version d’essai constitue la véritable actualité

Ce qui est plus intéressant ici, c'est la séquence, pas les paramètres. Ling-3.0-flash est passé directement aux poids ouverts. Celui-ci débarque d'abord en phase d'essai, avec les poids, la licence et la tarification officielle tous retenus, et un engagement public d'open source seulement après la fin de la période gratuite. C'est un manuel de lancement commercial portant les habits d'une annonce de modèle ouvert, et c'est un vrai changement qui mérite d'être suivi : si les poids arrivent sous une licence permissive, la communauté obtient un modèle de base de 560B à affiner et à distiller ; s'ils arrivent avec des conditions commerciales attachées, l'essai de deux semaines était le produit et la mention « open source » était du marketing. Dans un cas comme dans l'autre, le choix tombe dans la fenêtre d'essai, et c'est ce qu'il faut surveiller plutôt que n'importe quelle ligne de benchmark prise isolément.

Où il s'exécute, et le tableau honnête du routage

Pour l'instant, Ling-3.1-flash est accessible via la propre interface produit du fournisseur et via des plateformes d'inférence tierces exploitant la version d'essai — et c'est tout. Il ne figure pas au catalogue d'OrcaRouter aujourd'hui ; une requête sur notre API publique de modèles pour Ling-3.1-flash, Ling-3.0-flash et la variante vision de Ling-3.0 renvoie « not-found » dans tous les cas, et nous ne prétendrons pas le contraire. Lorsqu'un endpoint Ant atteindra la disponibilité générale avec un prix catalogue publié, le modèle de pass-through sur lequel OrcaRouter repose — le prix catalogue du fournisseur relayé sans marge, de sorte qu'une baisse de prix du fournisseur est effective de notre côté le jour même — est exactement l'arrangement qui convient à un modèle dont la tarification reste à écrire.

Ce que vous pouvez faire dès aujourd'hui, sans attendre la décision de licence, c'est lancer la comparaison qui compte vraiment pour un modèle non éprouvé : le mesurer face aux modèles de la gamme Flash que vous pouvez appeler dès maintenant. Gemini 3.8 Flash et DeepSeek-V4.1-Flash figurent tous les deux dans notre catalogue aux tarifs catalogue de leurs fournisseurs, derrière une seule clé API, avec bascule automatique entre eux. Pour un modèle en essai gratuit dont les poids et la grille tarifaire sont tous deux inconnus, c'est la manière saine de le garder — un candidat de plus vers lequel router tant que l'essai dure, et un chemin de production qui ne dépend pas de ce qui se passe le quinzième jour.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Que faire cette semaine

Si le modèle est pertinent pour votre travail, l'essai est la raison d'agir maintenant plutôt que d'attendre que la question des poids ouverts soit résolue — deux semaines d'inférence gratuite sur un MoE de 560B constituent l'évaluation la moins chère que vous obtiendrez, et la réponse à « tient-il la route sur mes prompts » est disponible aujourd'hui, même si la réponse à « puis-je l'auto-héberger » ne l'est pas. Trois choses à vérifier pendant que la fenêtre est ouverte, dans l'ordre :

• Exécutez votre propre charge de travail, pas la fiche de benchmark. Les chiffres publiés correspondent à la sélection de tâches d'Ant ; ce sont vos prompts qui décident de votre stack.

• Testez le contexte que vous utiliserez réellement. Le point de terminaison sert 262 144 jetons, pas 1 M. Si votre conception dépend de la fenêtre plus grande, vous concevez en vous appuyant sur une promesse.

• Ne construisez pas un modèle de coûts sur le « gratuit ». Le gratuit est un état qui ne dure que deux semaines. Tant qu’une grille tarifaire n’a pas été publiée, prévoyez de revenir par défaut à un modèle Flash-tier payant et considérez Ling-3.1-flash comme une capacité additionnelle.

L'annonce est réelle et le modèle tourne, ce qui est plus qu'on ne pouvait en dire il y a une semaine. Mais « publié et ouvert » et « en cours d'essai » sont deux états différents, et celui-ci relève fermement du second — une spécification de 560B, un endpoint de 256K, une fiche de benchmarks fournie uniquement par le fournisseur, et un compte à rebours de deux semaines qui est la seule échéance ferme de tout le lancement.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement