Carte hero de titre pour l'article 'Qwen3.8-Flash-Next — RAPPORT DE FUITE' avec un badge 'NON VÉRIFIÉ — APERÇU DE L'ARCHITECTURE QWEN4', le sous-titre 'Alibaba publie l'architecture Qwen4 avant le modèle', trois chips indiquant 'Source : @kimmonismus', '25 août 2026' et 'Sortie : 26 août 23:00 UTC+08', une carte à gauche indiquant 'L'affirmation : un MoE multimodal open-weight présentant l'architecture Qwen4' et une carte à droite indiquant 'Statut : poids non publiés, ~24h avant la sortie'. Le logo OrcaRouter est composé dans le coin inférieur droit.
Guides & Insights

Qwen3.8-Flash-Next Est Disponible : Alibaba Déploie l'Architecture Qwen4 Avant Que Qwen4 N'existe

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen3.8-Flash-Next dispose enfin de chiffres qu'Alibaba n'a pas produits — et ils ne disent pas ce que raconte la version la plus bruyante de l'histoire. Sur l'Artificial Analysis Intelligence Index, remis à jour en v4.3 le 7 septembre, l'aperçu à poids ouverts d'Alibaba obtient 40 points et se classe cinquième parmi les 113 modèles de sa classe de comparaison. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — le modèle auquel on ne cesse de le comparer — obtient 35 points et se classe neuvième. Ce n'est pas une parité ; c'est une avance de cinq points pour le modèle le plus petit. C'est aussi le premier tableau de scores large et indépendant à évaluer un modèle dont les seuls chiffres publiés, jusqu'à ce mois-ci, étaient ceux de son propre fournisseur. Le modèle lui-même n'est pas nouveau : les poids ont été mis en ligne sur Hugging Face le 24 août et la sortie officielle sur ModelScope a eu lieu le 26 août. Ce qui a changé ce mois-ci, c'est qu'un lecteur peut désormais vérifier les affirmations au lieu de les prendre pour argent comptant.

L'incitation à revenir sur ce post vient de @teortaxesTex sur X, qui a demandé si l'aperçu n'est pas discrètement sous-valorisé : censément au même palier Artificial Analysis que DeepSeek V4 Flash 0731, « presque 4 fois plus petit », avec « presque 3 fois moins de paramètres actifs ». Deux de ces trois affirmations ne résistent pas au contact des données publiées — et la correction tourne à l'avantage du modèle, car sur les chiffres qui comptent, l'aperçu devance son comparateur au lieu de faire jeu égal avec lui.

Commençons par la taille, où les chiffres sont sans ambiguïté. Qwen3.8-Flash-Next stocke environ 180 Md de paramètres — un corps de mélange d'experts de 125 Md, une table d'embeddings de n-grammes séparée de 51 Md, et environ 4 Md de couches de prédiction multi-tokens — et en active 6 Md par token. DeepSeek V4 Flash 0731 stocke 284 Md et en active 13 Md. Ce sont les chiffres figurant sur la fiche de modèle de Qwen et dans la documentation de DeepSeek, et ce sont ceux qu'Artificial Analysis indique sur les pages de ces deux modèles. Les ratios qui en découlent sont de 1,6x sur les paramètres stockés et de 2,2x sur les paramètres actifs. C'est un véritable argument d'efficacité, et c'est la raison pour laquelle cette architecture compte — mais ce n'est ni 4x ni 3x. Nous n'avons trouvé nulle part de chiffre publié qui étaye les multiplicateurs plus élevés. Si l'intention était l'empreinte mémoire en service plutôt que le nombre de paramètres, ce chiffre n'est pas publié non plus.

Qu'est-ce qui a été annoncé ?

Alibaba a publié l'architecture Qwen4 avant de publier un modèle Qwen4. Qwen3.8-Flash-Next — un modèle multimodal à mélange d'experts, à poids ouverts, construit sur l'architecture de nouvelle génération qui alimentera la famille Qwen4 — est sorti en deux étapes : le dépôt officiel Qwen/Qwen3.8-Flash-Next a été mis en ligne sur Hugging Face le 24 août, deux jours avant la publication sur ModelScope que visait le compte à rebours de l'aperçu. La sortie officielle sur ModelScope a eu lieu le 26 août à 23 h 00 UTC+08:00, la variante Qwen3.8-Flash servie étant tarifée au même moment. L'affirmation phare de la fiche, qui circule depuis lors, est qu'un modèle activant 6B de paramètres par token surpasse Claude Opus 4.6 Max sur 8 des 9 benchmarks comparables du tableau d'Alibaba. La famille Qwen4 complète, ne cesse de répéter Alibaba, viendra plus tard.

Si vous n'avez pas suivi la cadence d'Aliba​ba ce mois-ci, l'élément d'ancrage est Qwen3.8-Max — le modèle phare de 2,4 billions de paramètres publié le 3 août et rendu open source sous le nom Qwen3.8-2.4T-A95B moins de deux semaines plus tard. Les poids de Qwen3.8-Flash-Next sont disponibles moins d'un mois après. Le même laboratoire qui a publié un modèle à poids ouverts de 2,4 billions de paramètres distribue désormais l'architecture de la génération suivante, avant même que le modèle phare de cette génération ne soit nommé.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Le passage qui mérite d'être relu, c'est la présentation qu'Aliba​ba fait. Le modèle est décrit comme construit sur l'architecture de nouvelle génération « qui propulsera la prochaine famille Qwen4 » — et explicitement pas comme Qwen4 lui-même. La raison invoquée par Aliba​ba est que les changements architecturaux devraient être entre les mains de la communauté avant l'arrivée de la famille, afin que les runtimes, les quantifications et les applications soient prêts lorsque le vrai produit sortira. C'est une position marketing, mais c'est aussi un engagement technique : dévoiler d'abord la partie difficile, embarquer la communauté.

Ce que la fiche de modèle règle, et ce qu'elle ne règle pas :

• Confirmé, selon la fiche officielle du modèle : Qwen3.8-Flash-Next est un modèle à poids ouverts, multimodal, et un mélange d’experts basé sur l’architecture Qwen4 — la fiche le qualifie d’« aperçu expérimental de l’architecture qui sous-tendra Qwen4 ».

• Confirmé, d’après la fiche modèle et la configuration : deux changements architecturaux majeurs — Gated Delta Network (GDN) et Qw​en Sparse Attention (QSA) — dans un hybride de 48 couches qui comprend 36 couches d’attention linéaire et 12 couches d’attention complète.

• Confirmé depuis le dépôt : 125B paramètres totaux avec 6B activés par token (512 experts, 10 routés plus un partagé) — Artificial Analysis indique 180B une fois que la table d'embedding n-gramme distincte de 51B et les couches MTP sont comptabilisées — avec un contexte natif de 262 144 tokens extensible à 1 000 000 sous la licence Qw​en Community License 1.0.

• Ce n'est plus une information non confirmée : le modèle a désormais été évalué de manière indépendante, et même à deux reprises. Le tableau d'Aliba​ba reste celui du fournisseur et n'a toujours pas été reproduit, mais ce n'est plus la seule preuve en présence.

Les premiers résultats indépendants sont tombés — et ils disent « en avance », pas « à égalité »

Artificial Analysis a publié l'Intelligence Index v4.3 le 7 septembre, et ce recalcul est la seule raison pour laquelle tout cela est comparable. La mise à jour v4.3 a remplacé Terminal-Bench v2.1 par le bien plus difficile Terminal-Bench v4.0 et a substitué AutomationBench-AA à τ³-Banking, un benchmark de workflows agentiques construit avec Zapier sur un ensemble de test privé et tenu à l'écart de 657 tâches. La pondération des données privées tenues à l'écart est passée à 45 %. L'objectif annoncé était d'empêcher les modèles de pointe de manipuler l'indice, et l'effet sur les scores a été considérable : GPT-6 Astra et Claude Fable 5.1, les deux leaders, ont tous deux obtenu 53 alors qu'ils étaient notés dans les 60 sur l'ancienne échelle.

Cela compte lorsque vous lisez les chiffres de la communauté. Les chiffres « 56 contre 52 » qui ont circulé pour Qwen3.8-Flash-Next et DeepSeek V4 Flash 0731 au début de septembre ont été calculés sur l’indice pré-v4.3 ; avec v4.3, le duo se situe à 40 et 35. Citer l’un de ces ensembles face à l’autre revient à comparer deux examens différents.

Sur l’indice actuel, voici comment les deux modèles se comparent réellement dans les propres évaluations d’Artificial Analysis :

• Indice d'intelligence — Qwen3.8-Flash-Next 40 (5e sur 113 de sa catégorie) vs DeepSeek V4 Flash 0731 (Raisonnement, effort maximal) 35 (9e sur 113).

• Travail intellectuel agentique — AA-Briefcase 1587 vs 1259 ; GDPval-AA v2 1647 vs 1468 ; AutomationBench-AA 56 % vs 54 %.

• Terminal et programmation — Terminal-Bench v4.0 25 % contre 12 % ; SciCode 51 % contre 50 %.

• Raisonnement général et scientifique — Humanity's Last Exam 38 % vs 39 % ; CritPt 11 % vs 17 % ; GDP.pdf 16 % vs 11 % ; AA-LCR v1.1 80 % vs 80 %.

• Rappel factuel versus confabulation — AA-Omniscience −10 vs −14, un avantage de quatre points pour la preview Qwen.

• Prix — 0,15 $ par million de tokens en entrée / 0,47 $ par million de tokens en sortie contre 0,44 $ / 1,32 $ ; tarif mixte de 0,0882 $ par million de tokens contre 0,2298 $. Coût par tâche de l’Intelligence Index : 0,37 $ contre 0,22 $.

• Vitesse et latence — 53 jetons de sortie par seconde contre 210 ; temps jusqu’au premier jeton 2,80 s contre 0,98 s ; réponse de bout en bout 49,76 s contre 12,88 s ; temps par tâche 1 572,60 s contre 221,65 s.

• Utilisation de tokens — 108 k tokens de sortie par tâche contre 62 k, dont 72 k de tokens de raisonnement contre 45 k. Artificial Analysis qualifie l’aperçu de « très verbeux » et de « plus lent que la moyenne ».

• Contexte et taille — 256k jetons vs 1 000k ; 180B au total / 6B actifs vs 284B / 13B.

Lus ensemble, c'est une réponse plus tranchée que « même niveau ». Qwen3.8-Flash-Next remporte l'argument de la précision et de l'efficacité sur presque tous les axes mesurés par Artificial Analysis — c'est le modèle au meilleur score, il est plus petit, et il coûte environ trois fois moins par token. DeepSeek V4 Flash 0731 remporte quant à lui l'argument de la production, sans conteste : quatre fois le débit, un quart de la latence de bout en bout, sept fois moins de temps réel par tâche accomplie, et quatre fois la fenêtre de contexte. Et côté coût par tâche accomplie — le chiffre qui résiste à la verbosité des tokens — DeepSeek est le modèle le moins cher, à 0,22 $ contre 0,37 $, malgré un prix affiché plus élevé. Si « sous-estimé » signifie « meilleur que sa réputation en matière de qualité par paramètre », l'étiquette est justifiée. Si cela signifie « c'est celui-ci que vous devriez utiliser à la place », les colonnes vitesse et latence disent le contraire.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Il existe aussi des preuves indépendantes en dehors d’Artificial Analysis. Un banc d’essai tiers, smf-bench, a publié une exécution « Official A » le 5 septembre : Qwen3.8-Flash-Next dans la quantification NVFP4 de NVIDIA sur un seul DGX Spark, réflexion désactivée, a obtenu 137 sur 157 (87,3 %), avec un sans-faute de 30 sur 30 à sa section de codage, contre 117 sur 157 pour une exécution de DeepSeek V4 Flash Vision-Exp sur deux Spark avec le même banc d’essai de 157 tests. Cela ne représente qu’un banc d’essai sur une seule classe de machine, et ce n’est pas un substitut à une évaluation large — mais c’est un deuxième point de données qui pointe dans la même direction, et il provient de quelqu’un qui n’a aucun intérêt chez l’un ou l’autre des fournisseurs.

Ce qu'est réellement l'architecture Qwen4

Deux mécanismes portent le récit. Le premier, GDN — Gated Delta Network — est la couche d’attention linéaire d’Aliba​ba. Là où un transformeur standard conserve un cache clé-valeur qui grandit avec la longueur de séquence, une couche GDN maintient un état récurrent de taille fixe et le met à jour à l’aide d’une règle de gating apprise ; la filiation passe par DeltaNet et Mamba-2. Le gain, c’est celui qui alimente discrètement la gamme Qw​en depuis Qwen3-Next : les contextes longs restent peu coûteux parce que l’état ne grandit pas, tandis qu’une minorité de couches d’attention complète reste intégrée à l’ensemble pour effectuer la récupération précise que l’attention linéaire maîtrise mal. Dans la génération actuelle, ce mélange s’établit à environ trois couches GDN pour chaque couche d’attention complète — l’analyse communautaire du checkpoint Qwen3.8-2.4T-A95B compte 69 couches GDN contre 23 couches d’attention. Qwen3.8-Flash-Next présente la même répartition de trois pour un : 36 couches d’attention linéaire contre 12 couches d’attention complète.

Le deuxième, QSA — Qwen Sparse Attention — est la pièce véritablement nouvelle, et sa description publique reste encore mince : la fiche modèle précise qu’il fonctionne au niveau des micro-blocs avec un budget de 512 blocs / 2048 tokens, mais aucune rédaction technique complète n’existe encore. Cette rareté de détails fait elle-même partie du motif. L’aperçu de Qwen3-Next fin 2025 introduisait Gated DeltaNet avec la même documentation mince, et l’architecture n’a été entièrement spécifiée qu’une fois que la série Qwen3.5 l’a adoptée. Pour un lecteur, l’enseignement pratique est le même dans les deux cas : le canari d’architecture apparaît en premier, la documentation et les modèles de production apparaissent ensuite.

Le playbook qui a déjà fonctionné une fois.

Alibaba a déjà exécuté exactement ce scénario, et cela a fonctionné. Fin 2025, Qwen3-Next a présenté en avant-première Gated DeltaNet et un hybride d’attention linéaire et complète. Lorsque la série Qwen3.5 est sortie, elle a adopté ce plan à grande échelle — et l’hybride s’est maintenu à travers la génération Qwen3.8 depuis, y compris le modèle phare de 2,4 T. Ce qui rend ce précédent important ici, c’est le calendrier qu’il implique. Il faut s’attendre à ce que la famille Qwen4 complète arrive au-delà de cet aperçu, et non à l’intérieur de celui-ci ; si l’écart Qwen3-Next est un indicateur, la distance entre « voici l’architecture » et « voici la famille » se mesure en mois. Rien dans la fiche du modèle ne le confirme — c’est une déduction à partir d’un schéma qu’Alibaba a désormais suivi deux fois.

Ce que nous ne savons toujours pas

Les inconnues ont diminué, mais elles n'ont pas disparu :

• Le tableau de benchmarks du fournisseur reste celui du fournisseur. Artificial Analysis a désormais évalué le modèle de manière indépendante, ce qui comble la principale lacune de la couverture du lancement — mais l’affirmation phare d’Alibaba elle-même, selon laquelle le modèle surpasse Claude Opus 4.6 Max sur 8 des 9 benchmarks comparables, repose sur les propres évaluations internes d’Alibaba (CoWorkBench, JobBench, AndroidWorld) ainsi que sur des évaluations publiques, et aucune d’entre elles n’a été reproduite par un tiers.

• Si l'aperçu correspond au même modèle que celui effectivement servi. La fiche présente Qwen3.8-Flash-Next comme l'aperçu expérimental à poids ouverts, tandis que la variante servie en production — Qwen3.8-Flash de Qwen Cloud — ajoute une fenêtre de contexte par défaut de 1 000 000 de tokens et des outils intégrés. On ignore toujours si ce modèle servi repose sur la même architecture avec une fenêtre de contexte plus large, et les scores indépendants ci-dessus concernent l'aperçu à poids ouverts, et non le modèle d'API servi.

• La licence est connue et il s'agit d'une véritable licence : la Qw​en Community License 1.0 autorise l'usage commercial, y compris la vente d'œuvres dérivées, mais exige un accord commercial distinct avec Aliba​ba si vous exercez une activité de type Model-as-a-Service ou d'assistant de travail IA au-delà d'un seuil défini de chiffre d'affaires et d'utilisateurs actifs mensuels. Elle n'est pas identique à la licence Qwen3.8-Max soumise à un seuil de chiffre d'affaires, mais elle vaut la peine d'être lue avant de construire sur les poids.

• Un rapport de terrain à signaler : un compte rendu du 6 septembre d’un build communautaire NVFP4 signale un échec d’appel d’outils contraints par grammaire lorsque la réflexion et la prédiction multi-jetons sont toutes deux activées, imputé au chemin de décodage contraint de xgrammar. Il s’agit d’un bug d’exécution dans un build communautaire quantifié plutôt que d’une propriété du modèle — mais si votre harnais d’évaluation s’appuie sur des appels d’outils contraints par grammaire, c’est la première chose à tester.

Une famille qui itère sur un rythme de deux semaines

La cadence environnante est une histoire en soi. Qwen3.8-Max, le modèle phare à 2,4 billions de paramètres, est sorti le 3 août ; le Qwen3.8-2.4T-A95B à poids ouverts a suivi les 12–13 août ; le Qwen3.8-27B gratuit sous Apache-2.0 est arrivé quelques jours plus tard ; et maintenant, avant la fin du mois, l’architecture de la génération suivante est dévoilée en avant-première — puis évaluée indépendamment une semaine plus tard. Aucun autre laboratoire n’itère actuellement à cette cadence. Pour un lecteur qui choisit des modèles, la conséquence pratique est que « le meilleur Qwen » est une cible mouvante — et l’écart entre les générations arrive plus vite que l’écosystème environnant ne s’y adapte habituellement. Acheter une décision plutôt qu’un modèle est de plus en plus le choix défendable.

Ce qu'un développeur devrait faire maintenant

Les chiffres d’efficacité changent davantage le calcul de service local que le lancement lui-même. Un modèle à 6B de paramètres actifs qui obtient 40 sur l’indice actuel est compressible : la quantification NVFP4 officielle de NVIDIA est celle qu’a utilisée l’exécution smf-bench du 5 septembre, et d’autres builds communautaires NVFP4 et FP8 sont déjà en circulation, ce qui rend tout simplement envisageable un déploiement de classe GPU unique pour un modèle stocké en 180B. La mise en garde reste inchangée — il s’agit d’un aperçu non éprouvé, le tableau du fournisseur n’a pas été reproduit, et la forme des scores indépendants (solides sur le travail de connaissance et les tâches de terminal, plus faibles sur la génération de dépôts à long horizon et les taux de réussite d’agents en un seul essai) signifie que les faiblesses du modèle apparaissent exactement là où vivent les modifications de code de production. Exécutez une copie à faible enjeu d’une charge de travail réelle dessus avant qu’il ne touche à quoi que ce soit d’important, et laissez le basculement automatique absorber les moments où un aperçu se comporte mal.

Sur le plan tarifaire, le tableau qui était flou au lancement est désormais concret. Artificial Analysis indique un tarif servi de 0,15 $ par million de tokens d'entrée et de 0,47 $ par million de tokens de sortie pour la preview, contre 0,44 $ et 1,32 $ pour DeepSeek V4 Flash 0731 — du même ordre de grandeur que la variante Qwen3.8-Flash servie, que Qwen Cloud affiche à 1 ¥ et 3 ¥ (environ 0,16 $ et 0,47 $). La variante de production est celle que vous pouvez réellement appeler aujourd'hui : elle est routée ici sous qwen/qwen3.8-flash, et OrcaRouter répercute le prix catalogue du fournisseur avec 0 % de marge, donc quand Alibaba modifie ce chiffre, l'endpoint suit le même jour. Il en va de même pour le modèle de comparaison de cet article — DeepSeek V4 Flash 0731 est routé sous deepseek/deepseek-v4-flash-0731 au prix catalogue du fournisseur, ce qui rend la moitié « coût par token » de la comparaison ci-dessus testable sur votre propre trafic plutôt que sur les comptages de tokens d'un benchmark. Ce qui n'est pas routé ici, c'est la preview Flash-Next à poids ouverts elle-même : pour l'utiliser aujourd'hui, vous téléchargez les poids et les servez vous-même, ce qui explique précisément pourquoi l'enjeu de quantification ci-dessus compte plus que le prix catalogue. Le plafond que cette génération doit franchir reste visible sur le même endpoint : Qwen3.8-Max (qwen/qwen3.8-max) se situe à 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie, également répercuté au prix catalogue du fournisseur.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Le séquencement pratique n'a pas beaucoup changé, mais la confiance qui l'accompagne, oui. Si vous voulez la variante de production servie sans télécharger 100 Go de poids, Qwen3.8-Flash est déjà appelable au prix catalogue. Si vous voulez l'architecture — GDN, QSA, la table de n-grammes, les astuces d'offload —, les poids sont téléchargeables et les runtimes sont prêts : vLLM le sert dès le premier jour avec un chemin d'offload qui garde la table d'embeddings de n-grammes de 51 milliards de paramètres en mémoire hôte plutôt qu'en VRAM permanente, SGLang et TensorRT-LLM figurent dans la liste Day 0 de NVIDIA, et la bibliothèque d'Ollama propose une build MLX que vous pouvez télécharger sur Apple Silicon. La seule chose à cesser de faire, c'est de traiter le modèle comme une inconnue en matière de qualité. Il a désormais été mesuré, et les mesures sont bonnes.

Que regarder ensuite

• Savoir si les chiffres indépendants se maintiennent à mesure que l’indice mûrit. Le 40 de Qwen3.8-Flash-Next s’accompagne d’une facture de tokens inhabituellement élevée — il a brûlé 245 M de tokens lors de l’exécution de l’indice, contre une médiane de 140 M — et la note d’Artificial Analysis elle-même le qualifie de « très verbeux ». Un score produit en raisonnant plus longtemps reste un score, mais c’est le genre de chose qui bouge lorsque l’évaluation change. La prochaine révision de l’indice constituera le véritable test pour savoir si 40 était un niveau ou un maximum local.

• Faut-il que le Qwen3.8-Flash servi soit évalué séparément. Chaque chiffre indépendant dans cet article concerne l’aperçu à poids ouverts. La variante de production avec le contexte de 1 M et les outils intégrés n’a pas de score indépendant qui lui soit propre, et s’il s’agit de la même architecture dans un contexte plus long, c’est une évaluation peu coûteuse que quelqu’un devrait publier.

• Comment la prise en charge du serving dès le jour 0 tient-elle la route en pratique — les chiffres de débit GB300 annoncés par le fournisseur restent des chiffres annoncés par le fournisseur, et les configurations de parallélisme d'experts TP4 et de déport du cache KV sont encore assez récentes pour être fragiles.

• Combien de temps Aliba​ba attend-il avant que toute la famille Qwen4 ne suive l’aperçu ?

La partie « ce que nous savons jusqu’ici » de cette histoire est désormais en grande partie close. La fiche technique est publique, les poids sont téléchargeables, l’architecture est confirmée, la variante Qwen3.8-Flash servie est en ligne sur les API hébergées au prix catalogue, et le modèle a été évalué de manière indépendante par deux parties distinctes — le plus petit modèle l’emportant sur l’argument de la qualité et le plus grand sur celui du débit. Ce qui reste en suspens, c’est de savoir si un aperçu à 6B actifs généralise au-delà des benchmarks sur lesquels il a été ajusté, et combien de temps Aliba​ba attend avant que toute la famille Qwen4 ne suive. Cette dernière question est encore celle à laquelle la sortie ne répond pas, et c’est encore celle qui comptera le plus.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement