
Ling-3.0-flash-base : la sortie discrète de checkpoint d'Ant Group, désormais officielle
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
Le laboratoire inclusionAI d'Ant Group a publié Ling-3.0-flash-base et cinq autres points de contrôle associés sur Hugging Face le 11 août 2026, sans annonce jointe, et pendant une semaine complète, les six dépôts sont restés à zéro téléchargement — personne en dehors du laboratoire ne semblait l’avoir remarqué. Puis, le 19 août, le compte officiel du laboratoire a présenté publiquement la collection, et chaque fiche de modèle de la collection a été mise à jour en quelques minutes. Ceci est un article qui fait le point sur ce que nous savons à ce jour de cette publication. La version courte d’abord : Ling-3.0-flash-base n’est pas un modèle de chat, et n’a pas vocation à l’être. Il s’agit du point de contrôle de base brut, pré-alignement, de Ling-3.0-flash, le modèle Mixture-of-Experts de 124 milliards de paramètres avec 5,1 milliards de paramètres actifs, publié sous licence MIT pour ceux qui veulent continuer à l’entraîner plutôt que de l’appeler.
La chronologie : une semaine de silence, puis une annonce.
L’ordre compte, car il vous indique comment lire tout le reste de cet article. Les six dépôts ont tous été créés le 11 août, et les poids pour Ling-3.0-flash-base — le point de contrôle fusionné, celui qui donne son nom à cet article — sont arrivés avec un commit « initial model release » le 12 août. Aucun article de blog, aucun fil social, aucune annonce n’a accompagné tout cela. Au moment de la recherche, une semaine plus tard, chacun des six dépôts affichait toujours zéro téléchargement.
Ce silence a pris fin le 19 août. Le compte officiel Ant Ling a annoncé publiquement la collection de checkpoints, et les fiches Hugging Face des six dépôts ont été mises à jour à quelques minutes d'intervalle — les horodatages correspondent presque exactement. Donc, pour être honnête : les poids ont été publiés discrètement, l'annonce est arrivée avec une semaine de retard, et tout ce que l'on peut actuellement savoir sur cette publication provient des fiches des modèles elles-mêmes, ainsi que d'un court dépôt de type carnet de recettes d'entraînement. Rien d'autre n'a encore été vérifié de manière indépendante.
Ce qui a été réellement livré : six checkpoints, trois étapes d’entraînement.
InclusionAI décrit cette publication comme « un ensemble de points de contrôle au cours du processus d’entraînement » pour la série Ling-3.0, sa famille de modèles de fondation linguistique la plus efficace à ce jour. Pour chacune des deux plus petites tailles — Ling-3.0-tiny et Ling-3.0-flash — le laboratoire a publié trois points de contrôle, un par étape d’entraînement :
• Pré-entraînés — Ling-3.0-flash-base-30T et Ling-3.0-tiny-base-30T : ont terminé le pré-entraînement à grande échelle ; pas d’entraînement intermédiaire, pas de fusion, pas de post-entraînement.
• Mi-entraînés — Ling-3.0-flash-base-midtrain et Ling-3.0-tiny-base-midtrain : ont terminé la phase d’entraînement intermédiaire ; aucun fusionnement de points de contrôle et aucun post-entraînement.
• Fusion — Ling-3.0-flash-base et Ling-3.0-tiny-base : les points de contrôle de base fusionnés WSM, produits à partir des poids mi-entraînés et représentant l'état de base final avant le post-entraînement.
Tous les six sont des checkpoints de base. Aucun n'a subi l'étape d'alignement — fine-tuning supervisé, optimisation des préférences, RL — qui transforme un modèle de base en quelque chose que l'on peut proposer directement aux utilisateurs. La fiche du modèle le dit clairement : non recommandé pour un déploiement en chat direct auprès des utilisateurs finaux, pour des applications critiques en matière de sécurité sans alignement et évaluation supplémentaires, ou pour une utilisation en production sans post-entraînement et validation spécifique à la tâche.
Ce qu'est un checkpoint de base — et pourquoi la particularité WSM compte
Si vous n'avez jamais utilisé de modèles qu'à travers une API, un « checkpoint de base » peut sembler être une version plus petite ou plus ancienne d'un modèle que vous connaissez déjà. Il n'en est rien. Un checkpoint de base est le fichier de poids du réseau de neurones non aligné issu du pré-entraînement ; le comportement de suivi d'instructions et d'appel d'outils que vous utilisez réellement est ajouté par-dessus ensuite. La publication de checkpoints de base est la façon dont un laboratoire remet à la communauté de recherche la matière première pour effectuer son propre pré-entraînement continu, son fine-tuning, sa distillation et son RL.
Ce qui rend cette version plus intéressante qu'un dépôt de poids de base classique, c'est la recette d'entraînement qui se cache derrière. InclusionAI utilise une technique qu'elle appelle Warmup-Stable and Merge (WSM), et elle remplace la décroissance conventionnelle du taux d'apprentissage en fin d'entraînement par une fusion pondérée de points de contrôle. En termes simples : au lieu de laisser le taux d'apprentissage décroître pour terminer l'exécution, le laboratoire maintient un taux d'apprentissage stable, sauvegarde des points de contrôle dans la dernière ligne droite, puis les fusionne avec des poids appris. Les motivations déclarées du fournisseur, issues de la fiche du modèle :
• Comme il n'y a pas de phase de décroissance pour « intégrer » le mélange de données final, le modèle de base résultant est mieux adapté à la poursuite du pré-entraînement et à l'expansion dynamique des données.
• Comme la recette de fusion peut être explorée hors ligne, une équipe peut comparer différents profils de décroissance sans relancer l’entraînement coûteux pour chacun d’eux.
Ce deuxième point est celui qui fait de cette publication un artefact de recherche plutôt qu'une curiosité : tout l'intérêt de ces points de contrôle est qu'ils sont destinés à être encore entraînés, et la recette est conçue pour tolérer cela.
Qu'y a-t-il dans Ling-3.0-flash-base
L'architecture est identique à celle du Ling-3.0-flash post-entraîné, qui devrait déjà être familier grâce à la couverture plus large de ce modèle. D'après la fiche du modèle et config.json:
• Taille — 124B de paramètres au total selon le fournisseur (le checkpoint complet sur disque, y compris les embeddings, compte environ 127B sur Hugging Face), avec 5.1B activés par token.
• Sparsité — un MoE épars 1/64 : 512 experts routés, avec 8 experts routés et 1 expert partagé activés pour chaque jeton.
• Attention — a native hybrid-linear design: 35 Kimi Delta Attention (KDA) layers and 7 Gated MLA layers in a 5:1 repeating pattern across 42 transformer layers.
• Contexte — la configuration comporte un plongement positionnel de 256K jetons (262 144), le même contexte natif que le jumeau post-entraîné.
• Poids — BF16, fourni sous forme de 28 fragments safetensors (~255 Go sur disque), avec le personnalisé bailing_hybrid code de modélisation inclus dans le dépôt.
• Licence — MIT, sans clause d'utilisation acceptable.

Une réserve honnête concernant le chiffre de taille : la fiche du modèle du fournisseur indique « Total 124B », et c'est ce nombre qui circule partout — mais le nombre total de paramètres safetensors sur le dépôt est d'environ 127,5B une fois la couche d'embedding incluse. Le chiffre de 124B correspond au total hors embedding, et les deux nombres ne sont pas en conflit ; il vaut la peine de savoir lequel on regarde quand on voit « 127B » dans une barre latérale ou un téléchargeur.
À quoi ça sert, et à quoi ça ne sert pas
Les cas d'utilisation recommandés par la fiche modèle sont sans ambiguïté :
• Poursuite du pré-entraînement
• Formation intermédiaire
• Ajustement supervisé pour l'adaptation au domaine
• Optimisation des préférences et post-entraînement RL
• Recherche sur la distillation
• Recherche sur les systèmes à long contexte et MoE
Et sa liste « non recommandé tel quel » est tout aussi explicite : déploiement direct de chat pour l’utilisateur final, applications critiques pour la sécurité sans alignement, utilisation en production sans post-entraînement. En d’autres termes, c’est une matière première pour ceux qui entraînent des modèles, pas un modèle que l’on déploie. Si vous n’avez pas l’intention d’affiner ou de pré-entraîner quoi que ce soit, il n’y a rien à télécharger ici — et il n’y a rien de mal à cela.
L'autre moitié de l'histoire, c'est le scale-seamlessly design. InclusionAI affirme que Ling-3.0-tiny-base et Ling-3.0-flash-base partagent la même recette d'entraînement, de sorte que la communauté peut d'abord valider une stratégie de pré-entraînement continu ou de réglage fin sur le petit checkpoint — qui nécessite beaucoup moins de mémoire GPU — puis appliquer à plus grande échelle cette même recette validée au checkpoint flash plus grand. C'est un choix de workflow délibéré, pas un accident de logistique de publication, et c'est la propriété la plus utile de la collection pour quiconque souhaite réellement expérimenter.
La réalité du matériel, et la voie que la plupart des gens veulent réellement
La taille des poids de base flash est incontournable. Le BF16 à ~255 Go implique un nœud multi-GPU conséquent (ou une configuration d’entraînement optimisée pour la mémoire) avant même de commencer ; il n’existe pas de quantification officielle FP8 ou FP4 du checkpoint de base — les variantes quantifiées présentes dans le catalogue de l’organisation sont destinées au modèle post-entraîné. Les exemples de fine-tuning se trouvent dans inclusionAI/ling-cookbook, le dépôt GitHub, qui est explicitement un travail en cours. Si le pré-entraînement continu n’est pas la priorité de votre équipe, les checkpoints de base ne sont pas votre point d’entrée.
La plupart des personnes qui lisent au sujet de la famille Ling-3.0 ne veulent pas du tout d'un checkpoint de base — elles veulent le modèle qui parle. C'est le modèle post-entraîné Ling-3.0-flash, disponible via l'API du fournisseur lui-même et sur plusieurs plateformes tierces. Lorsqu'un modèle open-weights rapide et récemment publié comme celui-ci apparaît, le moyen le moins coûteux de l'évaluer par rapport à votre stack actuelle est de l'exécuter côte à côte avec ce que vous utilisez déjà — et c'est exactement à cela que sert un routeur : une API, une clé, et un basculement automatique pour qu'un incident du fournisseur ne mette pas fin à l'essai. OrcaRouter se connecte ainsi à plus de 200 modèles et transmet directement les prix catalogue des fournisseurs avec une marge de 0 %, donc le prix que vous voyez est le prix du fournisseur lui-même, et une commission du fournisseur arrive de notre côté le jour même.

Ce qui n'est pas encore confirmé
Comme cette version n'a été annoncée qu'hier, la liste des éléments non confirmés est longue et doit être lue comme une liste de tâches, et non comme une critique :
• Aucun benchmark indépendant du checkpoint de base.La fiche modèle intègre un graphique de benchmark du fournisseur comparant Ling-3.0-flash-base à des modèles pré-entraînés comparables sur des suites dédiées aux mathématiques, au codage, au raisonnement, au multilingue et au long contexte — mais il s’agit de la propre évaluation du fournisseur, hébergée sur un serveur d’images interne, sans section méthodologie ni reproduction par un tiers.
• Pas encore de reproductions de la communauté. Au moment de la recherche, les six dépôts affichaient zéro téléchargement et pratiquement aucun engagement. La sortie est trop récente pour que quiconque ait publié un fine-tuning indépendant ou un run de pré-entraînement continu à partir de ces poids.
• L'outillage est encore à un stade précoce.L'bailing_hybridarchitecture est livrée avec du code de modélisation personnalisé, vous dépendez donc de trust_remote_code ou d'un framework qui a ajouté la prise en charge. Le cookbook de fine-tuning est explicitement en cours de développement.
• L'annonce en elle-même est mince. La présentation publique s'est faite sous la forme d'un fil X et de fiches de modèle ; il n'existe pas de document de lancement autonome décrivant les données d'entraînement, la puissance de calcul ou la recette de fusion exacte au-delà de ce qu'indiquent les fiches.
En revanche, le jumeau post-entraîné dispose bien d'un historique indépendant : Ling-3.0-flash est suivi par Artificial Analysis avec un Intelligence Index de 38 — un chiffre qui provient du classement, et non du fournisseur. Rien de tout cela n'existe encore pour Ling-3.0-flash-base; un checkpoint de base n'est servi nulle part, il ne figure donc sur aucun classement. Les deux artefacts en sont à des étapes de vérification complètement différentes, et il vaut mieux ne pas les confondre.

Qui devrait agir maintenant
Trois groupes devraient lire ceci différemment :
• Chercheurs effectuant un pré-entraînement continu, un SFT de domaine ou une distillation — cette version est faite pour vous. Le point de contrôle de base WSM-merged est spécifiquement conçu pour être entraîné davantage, et la recette tiny-then-flash offre un moyen peu coûteux de valider une approche avant de la passer à l’échelle. Commencez avec Ling-3.0-tiny-base, prouvez la recette, puis passez à Ling-3.0-flash-base.
• Ingénieurs qui veulent un modèle fonctionnel — vous voulez le Ling-3.0-flash post-entraîné, pas cette version. Les checkpoints de base ne suivront pas les instructions et ne sont servis nulle part ; ne pointez pas un client API vers eux.
• Tous les autres — la bonne décision est d'observer. Les signaux intéressants des prochaines semaines sont un premier affinage indépendant construit à partir de ces poids, une reproduction communautaire du tableau de référence du fournisseur, et la question de savoir si une pile d'entraînement tierce ajoute une prise en charge de première classe pour l'bailing_hybrid architecture.
FAQ
Quelle est la différence entre Ling-3.0-flash-base et Ling-3.0-flash ?
Ling-3.0-flash est le modèle post-entraîné — aligné par fine-tuning supervisé et RL, il suit les instructions, effectue des appels d’outils et est servi via des API. Ling-3.0-flash-base est la même architecture à un stade antérieur : c’est le checkpoint de base fusionné final avant tout post-entraînement, et il ne se comportera pas comme un modèle conversationnel. La base existe pour que les chercheurs puissent réaliser leur propre pré-entraînement continu, fine-tuning ou distillation plutôt que de partir de zéro.
Pourquoi un laboratoire publierait-il des checkpoints qui n'ont pas été post-entraînés ?
Parce que le post-entraînement est exactement ce que la plupart des chercheurs veulent faire eux-mêmes, et qu'un checkpoint de base est le point de départ correct pour cela. Publier séparément les checkpoints pré-entraînés, mi-entraînés et fusionnés permet à une équipe de choisir l'étape qui correspond à son travail : poursuivre le pré-entraînement à partir du poids pré-entraîné, ou faire du fine-tuning et du RL à partir de la base fusionnée — et, grâce à WSM, sans les contraintes de décroissance du taux d'apprentissage qui rendent un modèle de base fragile lorsqu'on l'entraîne davantage.
Puis-je exécuter Ling-3.0-flash-base sur du matériel grand public ?
Pas vraiment. Les poids BF16 représentent environ 255 Go répartis sur 28 shards, sans variante quantifiée officielle du checkpoint de base. Le modèle frère plus petit, Ling-3.0-tiny-base, est celui destiné à l'expérimentation sur du matériel plus modeste — et il partage la recette d'entraînement du checkpoint flash, de sorte que les expériences validées passent à l'échelle.
Est-ce que l'utilisation commerciale de Ling-3.0-flash-base est gratuite ?
Oui — il est publié sous licence MIT sans clause d’utilisation acceptable. Cela couvre à la fois l’utilisation en recherche et, en principe, l’utilisation commerciale des poids et de tout affinage construit à partir de ceux-ci. Il s’agit d’un point de contrôle de base, donc « utilisation » signifie ici entraînement sur celui-ci ; la licence ne dit rien à propos d’une API hébergée, car il n’en existe pas pour le modèle de base.
En résumé
Pour la plupart des lecteurs, Ling-3.0-flash-base est un indicateur, pas un produit : il vous indique où va la famille Ling-3.0 et comment le laboratoire entend que la communauté construise à partir de là, mais il n'y a rien ici à appeler via une API. Pour le groupe plus restreint qui fait réellement du pré-entraînement continu, du fine-tuning ou de la distillation, c'est une version vraiment utile — six checkpoints, sous licence MIT, délibérément conçus pour être entraînés davantage, avec un chemin « tiny-first » qui rend l'expérimentation abordable. Ce qui la ferait passer de « version utile » à « recette éprouvée », c'est exactement ce qui manque aujourd'hui : une reproduction indépendante, par quelqu'un en dehors du laboratoire, de ce que les checkpoints WSM peuvent faire lorsqu'on continue de les entraîner.
