Qwen3.8-Max Test : le fleuron 2,4T d'Alibaba à 2$/6$ — la build 0902 en tête de Code Arena WebDev.
Guides & Insights

Qwen3.8-Max Test : le fleuron 2,4T d'Alibaba à 2$/6$ — la build 0902 en tête de Code Arena WebDev.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Alibaba Qw​en a dévoilé Qwen3.8-Max lors de la Conférence mondiale sur l’IA à Shanghai le 19 juillet 2026, et pendant deux semaines, ce fut le modèle dont tout le monde parlait et que personne ne pouvait réellement tarifer. Il n’y avait ni grille tarifaire, ni tableau de référence, ni fiche modèle, ni licence, ni nombre de paramètres actifs — seulement un titre annonçant 2,4 billions de paramètres et l’affirmation que le modèle se classait « juste derrière Claude Fable 5. »

Le 3 août 2026, cela a changé. Qwen3.8-Max est généralement disponible : une grille tarifaire publiée à 2 $ par million de tokens en entrée et 6 $ par million en sortie, un endpoint compatible OpenAI et DashScope, un tableau de benchmarks complet, et des poids ouverts arrivés le 12 août. Une semaine plus tard, le 14 août, le modèle est devenu disponible sur DigitalOcean Serverless Inference, avec Alibaba comme « partenaire de lancement Day 0 » — le premier grand cloud occidental à le servir. Le 2 septembre, Alibaba a publié une mise à jour nommée, Qwen3.8-Max-0902, encore post-entraînée sur Coding et Cowork, ce qui, selon Qwen, renforce les performances sur les travaux complexes d'entreprise et scientifiques. Cette revue s’appuie sur les faits de la disponibilité générale, en intégrant ce lancement day-zero et la version 0902, et répond à la question que les équipes se posent réellement maintenant que le modèle est achetable : Qwen3.8-Max est-il prêt à absorber du trafic de production, ou reste-t-il un modèle à surveiller ?

La réponse courte est qu'il a dépassé ce que la plupart des gens attendaient — la tarification, en particulier, est agressive au point de redéfinir les prix de référence, et la mise à jour du 2 septembre renforce encore les deux domaines dans lesquels le modèle excellait déjà : le codage et le travail collaboratif. La grille d'évaluation indépendante publiée depuis est réellement bonne, mais elle comporte une réserve qu'il faut lire avant de lui envoyer du trafic.

En bref. Qwen3.8-Max est désormais en disponibilité générale (GA) à 2 $ / 6 $ par million de tokens, un prix fixe sur l'ensemble du contexte de 1M de tokens, sans surcoût pour les prompts longs — de quoi sous-coter Kimi K3 (3 $ / 15 $) et Claude Opus 5 (5 $ / 25 $) sur la sortie, le principal poste de coût des tâches de raisonnement. Alibaba publie un solide tableau de benchmarks (Terminal-Bench 2.1 : 86,6 ; GPQA Diamond : 92,6 ; OSWorld-Verified : 86,1), et le bond en codage est spectaculaire par rapport au prédécesseur : 73,5 sur FrontierSWE contre 40,7. Mais ce tableau de performances est signé Alibaba, et le premier arbitre indépendant, l'Artificial Analysis Intelligence Index, s'est prononcé : Qwen3.8-Max obtient 56, à 1,14 $ par tâche, à égalité avec Claude Opus 4.8 (56), et à un point du leader open-weight Kimi K3 (57), au prix d'un coût par tâche supérieur de 25 %. Le nombre de paramètres actifs n'est plus un point d'interrogation : 95B sur 2,4T au total, confirmé sur la fiche officielle du modèle — ce qui permet enfin aux observateurs externes de raisonner sur l'économie du service d'inférence. Depuis la première mise en ligne de cet article, une deuxième offre managée a vu le jour : Qwen3.8-Max a été lancé le 14 août sur DigitalOcean Serverless Inference, avec DigitalOcean comme partenaire Day 0 d'Alibaba. Les métriques de service publiées par DigitalOcean — prefill atteignant ~16 000 tokens/s et ~1 937 tokens de sortie/s à 256 requêtes simultanées, zéro erreur — constituent les premières données de latence concrètes émanant d'un fournisseur autre qu'Alibaba. Le 2 septembre, Alibaba a actualisé son modèle phare en Qwen3.8-Max-0902, enrichi d'un post-entraînement supplémentaire sur Coding et Cowork ; selon Qwen, cette nouvelle mouture est plus performante sur les charges de travail complexes d'entreprise et scientifiques — une affirmation du fournisseur, sans chiffres indépendants à ce jour sur ces domaines. Côté codage, la version 0902 a désormais son propre résultat d'arène indépendant : Qwen3.8-Max-0902 a fait ses débuts en tête du classement Code Arena: WebDev avec 1 691 points, soit 22 de plus que la version précédente — devant Claude Opus 5 et Kimi K3 — d'après Alibaba, qui cite le classement d'arène tiers en direct. La même semaine, le volet commerce agentique s'est doté d'un tableau de scores : sur CommerceAgentBench, un nouveau benchmark de l'équipe Accio d'Alibaba fondé sur des répliques à état de logiciels de commerce réels, Qwen3.8-Max affiche le meilleur résultat open-weight — 156 essais réussis au total sur trois bancs de test, soit deux de plus que DeepSeek V4 Pro — un tableau réalisé par le fournisseur, et non par un arbitre indépendant. Verdict : le modèle est réellement achetable dès maintenant, et assez abordable pour justifier une véritable évaluation — mais à utiliser avec discernement, pas en bloc.

Points clés

GA depuis le 3 août 2026. L'ère des aperçus et des campagnes de crédits est révolue ; il existe désormais une véritable grille tarifaire et un véritable point de terminaison.

$2 / $6 par 1M de jetons, un palier unique sur 1M de contexte. La plupart des concurrents facturent un supplément pour les longues invites. Alibaba ne le fait pas, ce qui compte énormément pour les longs documents et les grands dépôts de code.

Le tableau de référence d'Alibaba est solide mais non audité : Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

Le vrai sujet, c'est le saut générationnel en codage : FrontierSWE 73,5 (contre 40,7) et DeepSWE 1.1 56,6 (contre 21,6) — un quasi-doublement pour les deux.

Le premier score indépendant est arrivé : Qwen3.8-Max obtient 56 sur l'AA Intelligence Index à 1,14 $/tâche — un bond de 10 points par rapport à Qwen3.7-Max (46), à égalité avec Claude Opus 4.8 (56), à un point de Kimi K3 (57). Le classement général de LMArena n'a toujours pas de score public.

• Paramètres actifs confirmés à 95B — la fiche officielle du modèle indique 2,4T au total et 95B activés, ce qui clôt la plus grande question ouverte dans le calcul des coûts de service.

Les poids ouverts sont sortis — Qwen3.8-2.4T-A95B (BF16) et Qwen3.8-2.4T-A95B-FP8 sont arrivés sur Hugging Face le 12 août sous une licence Qwen3.8-Max personnalisée, et non sous Apache 2.0. Le chemin sur site Qwen3.8-27B a été publié le 14 août sous Apache 2.0.

Un deuxième chemin géré a ouvert le 14 août. Qwen3.8-Max est en ligne sur DigitalOcean Serverless Inference en tant que « partenaire de lancement Day 0 » d'Alibaba — NVFP4 sur NVIDIA HGX B300, 2 $ / 6 $ avec 0,20 $ d'entrée en cache, servi avec le contexte natif de 262K du point de contrôle ouvert. Les chiffres mesurés par DigitalOcean (prefill ~16K tokens/seconde, zéro erreur à 256 de concurrence) sont les premières données de performance de service sur une plateforme gérée en dehors d'Alibaba.

Rafraîchissement du 2 septembre : Qwen3.8-Max-0902. Alibaba a poursuivi le post-entraînement du modèle phare sur Coding et Cowork et le propose sur QwenCloud aux mêmes tarifs de 2 $/6 $ et avec un contexte de 1M. Qwen affirme que les performances pour les entreprises et la recherche sont meilleures — toujours des affirmations du fournisseur — tandis que le volet coding a obtenu le même jour un résultat indépendant en arène : le modèle a fait ses débuts à la première place de Code Arena : WebDev avec 1 691 (voir le point Code Arena ci-dessous).

CommerceAgentBench : leader open-weight, opéré par le fournisseur. L'équipe Accio d'Alibaba a publié CommerceAgentBench cette semaine — 107 tâches à long horizon dans des répliques avec état de vrais logiciels de commerce et de gestion, évaluées en fonction de l'état atteint via les harnais d'évaluation Accio, OpenClaw et Pi. Qwen3.8-Max mène les modèles open-weight avec 156 réussites cumulées, deux de plus que DeepSeek V4 Pro ; le modèle fermé Claude Opus 5 est en tête du classement général avec 191, et ce tableau est celui d'Alibaba, non celui d'un arbitre indépendant.

Code Arena: WebDev #1 — le résultat de la build 0902 en arène indépendante. Qwen3.8-Max-0902 a fait ses débuts en tête du classement Code Arena: WebDev avec 1 691 points — soit 22 de plus que la build précédente et devant Claude Opus 5 et Kimi K3 — et il est en tête de la frontière de Pareto coût-performance de ce classement, avec un prix moyen pondéré d’environ 5 $/MToken, soit environ le quart du prix moyen pondéré de Claude Opus 5. Le compte QwenCloud officiel de Qwen a confirmé cette première place. Contrairement à CommerceAgentBench, ce classement émane d’un tiers : c’est une arène de vote humain en aveugle, et non un classement d’Alibaba, même si « débuter en tête » est l’annonce par Alibaba d’un classement à un instant donné.

Note d'exactitude : le tableau de benchmarks de Qwen3.8-Max utilisé dans cet examen est rapporté par Alibaba et n'a pas fait l'objet d'une reproduction indépendante. Le score de l'Artificial Analysis Intelligence Index (56 à 1,14 $/tâche) est mesuré indépendamment par AA sur l'API officielle d'Alibaba — le premier arbitre indépendant du modèle. Les prix proviennent de la grille tarifaire GA d'Alibaba Model Studio. Les dépôts de poids ouverts (Qwen3.8-2.4T-A95B et Qwen3.8-2.4T-A95B-FP8), le chiffre de 95B de paramètres actifs et le texte de licence sont des sources de première partie : ils proviennent de l'organisation Hugging Face de Qwen et ont été vérifiés le 13 août 2026. La disponibilité chez DigitalOcean, sa grille tarifaire, les mesures de performance de serving et le contrôle ponctuel GPQA de 88 sur la version quantifiée proviennent de la documentation et du tutoriel communautaire de DigitalOcean, publiés parallèlement à l'annonce du 14 août ; la caractérisation « Day 0 launch partner » relève de la formulation de l'annonce d'Alibaba. Lorsque nous citons des chiffres de concurrents, ils proviennent d'Artificial Analysis ou du fournisseur nommé dans le texte. La mise à jour Qwen3.8-Max-0902 annoncée le 2 septembre repose entièrement sur les déclarations du fournisseur : ses spécifications, la description de son post-entraînement Coding-and-Cowork et les gains revendiqués pour les entreprises et la science proviennent tous de l'annonce de Qwen et de sa page de modèle QwenCloud, et aucun de ses chiffres n'a été reproduit de manière indépendante. La position Code Arena: WebDev couverte dans la section des benchmarks est la seule exception : ce classement est une arène tierce à vote à l'aveugle, et non un tableau d'Alibaba — même si le fait de « débuter à la première place avec 1 691 » est l'annonce par Alibaba d'un classement à un instant donné, et que les scores de l'arène continuent d'évoluer à mesure que les votes s'accumulent. Le résultat CommerceAgentBench présenté ci-dessous appartient à la même catégorie : le benchmark a été conçu et publié par Accio, l'équipe d'Alibaba International, si bien que ses tableaux sont rapportés par Alibaba — un benchmark open source, mais pas un arbitre indépendant à la manière d'Artificial Analysis. Les tableaux de benchmarks des fournisseurs sont par principe optimistes — traitez-les comme une hypothèse à tester sur votre propre charge de travail, et non comme un classement arrêté.

Qu'est-ce que Qwen3.8-Max ?

Qwen3.8-Max est le fleuron de la famille Qwen d'Alibaba : un modèle de type mélange d'experts épars avec 2,4 billions de paramètres au total, une fenêtre contextuelle d'un million de jetons et une entrée multimodale native. Il accepte du texte, des images et des vidéos, et renvoie du texte. Il prend en charge le mode de réflexion, l'appel de fonctions, les outils intégrés et les sorties structurées, et il est servi via un point de terminaison /v1/chat/completions compatible OpenAI, ce qui signifie que la plupart des intégrations existantes nécessitent un changement d'URL de base plutôt qu'une réécriture. L'instantané de production actuel, publié le 2 septembre, est Qwen3.8-Max-0902, post-entraîné en outre sur Coding et Cowork.

En pratique, les chiffres de contexte sont un peu plus précis que le « 1M » marketing. Les métadonnées cloud d'Alibaba listent une fenêtre de 983 616 tokens avec le raisonnement activé, une entrée maximale d'environ 991K tokens, et une sortie maximale de 131 072 tokens. Ce plafond de sortie est inhabituellement généreux et compte pour des tâches comme la génération de code sur fichier complet ou la rédaction de longs rapports, où des plafonds plus bas vous obligent à découper et recoudre. Le checkpoint ouvert que DigitalOcean sert désormais est une configuration différente : sa fiche modèle liste 262 144 tokens nativement, extensible jusqu'à environ 1 010 000, donc un service tiers qui fait tourner la base ouverte aboutira généralement au nombre natif le plus petit.

Le nombre de paramètres actifs est désormais public, et le nom du dépôt le porte : A95B signifie 95 milliards de paramètres activés. La fiche officielle du modèle Qwen3.8-2.4T-A95B indique « 2,4T au total et 95B activés », un mélange d'experts à granularité fine avec 512 experts, dont 10 routés et un partagé sont actifs par jeton. Ce chiffre importe davantage que le 2,4T mis en avant. Pour un modèle dense, le nombre total de paramètres donne une approximation du coût d'inférence ; pour un modèle MoE, il ne dit presque rien — seul le nombre de paramètres actifs compte, car c'est ce qui s'exécute réellement à chaque jeton. Un modèle de 2,4T activant 30B se comporte de façon radicalement différente, en latence comme en économie de service, d'un modèle qui en active 200B. Avec 95B actifs, le calcul par jeton se situe dans le même ordre de grandeur qu'un modèle dense autour de 90B — une fraction de ce qu'exigerait un modèle dense de 2,4T — c'est ce nombre qui permet enfin de répondre à la question de l'auto-hébergement ci-dessous.

La mise à jour du 2 septembre : Qwen3.8-Max-0902

Le 2 septembre 2026, Qwen a lancé sa première mise à jour de production nommée. Qwen3.8-Max-0902 conserve la même architecture sparse-MoE de 2,4 T de paramètres, les mêmes 95 B de paramètres actifs et la même fenêtre de contexte de 1 M de tokens, mais il a été davantage post-entraîné sur deux capacités — Coding et Cowork — et il est disponible sur l'API de QwenCloud sous le nom qwen3.8-max-0902 (également répertorié comme qwen3.8-max-2026-09-02). Il s'agit de la version actuellement recommandée, et non d'une branche secondaire : le point de terminaison qwen3.8-max sans date d'Alibaba sert désormais l'instantané 0902, de sorte qu'un appel au nom de modèle standard aboutit sur la mise à jour, tandis que l'identifiant daté est là pour les équipes qui souhaitent épingler la version exacte. À partir du 3 septembre, l'instantané a également été répertorié comme identifiant de modèle routable propre sur les API gérées par des tiers. La grille tarifaire n'a pas changé : 2 $ pour 1 M d'entrées, 6 $ pour 1 M de sorties, avec les mêmes tarifs de cache.

Les allégations de performance proviennent de Qwen. L'annonce et la page du modèle QwenCloud décrivent une capacité de codage qui « ouvre de nouvelles voies » sur les projets d'ingénierie à grande échelle et le développement autonome à long horizon, une expérience d'agent collaboratif « considérablement améliorée » dans l'orchestration multi-outils et la réalisation de tâches de bout en bout, et — comme le dit l'entreprise — de meilleures performances sur les tâches d'entreprise complexes, la recherche scientifique et les workflows à cycle long. La première vérification indépendante est tombée le jour même. Qwen3.8-Max-0902 a fait ses débuts en tête du classement Code Arena: WebDev — une arène tierce de vote à l'aveugle pour le développement web agentique, le projet anciennement connu sous le nom de WebDev Arena — avec 1 691 points, soit 22 de plus que la version précédente et devant Claude Opus 5 et Kimi K3, selon Alibaba, qui cite le classement en direct — un positionnement que le compte officiel de Qwen a confirmé le jour même, en pointant vers l'API QwenCloud. Ce que cela prouve ou ne prouve pas est décortiqué dans la section des benchmarks ci-dessous. Les autres affirmations de la mise à jour — raisonnement d'entreprise, travail scientifique et autonomie générale à long horizon — restent des déclarations du fournisseur ; conservez donc la discipline appliquée au tableau d'août : traitez-les comme une hypothèse jusqu'à ce qu'une évaluation d'Artificial Analysis ou une charge de travail réelle les confirme.

Ce que « Cowork » signifie concrètement, c’est là que la mise à jour devient intéressante. La Qwen3.8-Max de l’ère GA s’appuyait déjà sur l’autonomie à long horizon — le build oh-my-cli de 16 jours, l’activité commerciale virtuelle de plus de 2 000 tours — et le build 0902 voit Alibaba miser encore plus sur cet axe : des agents qui orchestrent plusieurs outils et mènent une tâche à bien de bout en bout, plutôt que de fournir des réponses ponctuelles. La même semaine, l’équipe Accio d’Alibaba a publié CommerceAgentBench, un benchmark conçu pour mesurer directement cet axe : 107 tâches à long horizon dans des répliques avec état de logiciels réels de commerce et de gestion, où Qwen3.8-Max mène la catégorie open-weight — détaillé dans la section benchmark ci-dessous. Pour les équipes qui évaluent le modèle pour un usage en entreprise, c’est l’affirmation à tester en premier, car c’est aussi la plus difficile à vérifier à partir d’un tableau de benchmark.

Tarification : la chose la plus agressive de ce lancement.

Alibaba Model Studio répertorie Qwen3.8-Max à $2.00 par 1M de jetons d'entrée et $6.00 par 1M de jetons de sortie. La sortie inclut les jetons de réflexion, ce qui importe car les configurations à forte intensité de raisonnement facturent leur délibération interne au tarif de sortie. Économie du cache : les accès au cache d'entrée coûtent $0.25 par 1M, la création explicite de cache $2.50, et les lectures explicites du cache $0.17.

Ce qui est structurellement intéressant n'est pas le chiffre principal, c'est le palier fixe. Alibaba facture les mêmes 2 $/6 $, que votre prompt fasse 5 000 ou 900 000 jetons. La plupart des concurrents appliquent une surcharge pour contexte long précisément parce que servir un prompt de près d'un million de jetons coûte cher. Le fait qu'Alibaba absorbe ce coût est une conquête de marché délibérée, visant exactement les charges de travail où le contexte long est l'essentiel : la revue de code de l'ensemble du dépôt, l'analyse de contrats et de documents déposés, la synthèse de recherche multi-documents.

Exemple détaillé. Disons que vous lancez un agent d'analyse de dépôt : 200 000 tokens d'entrée pour le contexte de code et 8 000 tokens de sortie par appel.

Par appel : 0.2M × $2 = $0.40 en entrée, plus 0.008M × $6 = $0.048 en sortie. ≈ $0.45 par appel.

À 1 000 appels/jour : ≈ 448 $/jour, soit environ 13 400 $/mois.

Le même appel avec Claude Opus 5 à 5 $ / 25 $ : 1,00 $ + 0,20 $ = 1,20 $ — soit environ 2,7× plus.

Avec la mise en cache des prompts sur un contexte de code stable, l’entrée mise en cache à 0,25 $ fait passer le coût d’entrée de 0,40 $ à 0,05 $, ramenant l’appel à ≈ 0,10 $ — soit une réduction de près de 4,5× sur le trafic répété.

C'est là, dans cette différence de cache, que se trouve le vrai budget. Si votre agent relit un contexte quasi inchangé à chaque tour — ce qui décrit la plupart des agents de codage et de support — le prix effectif est bien plus proche de 0,25 $/6 $ que de 2 $/6 $. Les équipes qui omettent la configuration du cache paient régulièrement 3 à 4 fois trop cher sur ce modèle.

À titre de comparaison, aux prix catalogue : Qwen3.8-Max 2 $/6 $ ; son prédécesseur Qwen3.7-Max 2,50 $/7,50 $ ; Kimi K3 3 $/15 $ ; GPT-5.6 Terra 2 $/12 $ ; Claude Opus 5 5 $/25 $. Côté entrée, Qwen est simplement compétitif. Côté sortie — le poste qui domine les dépenses dans le raisonnement et le travail agentique — c'est le moins cher des modèles de cette liste qui se réclament de la pointe.

La mesure indépendante d'Artificial Analysis révèle l'envers de ces jetons bon marché. Sur son Intelligence Index, Qwen3.8-Max coûte 1,14 $ par tâche — plus du double des 0,53 $ du prédécesseur, et 25 % de plus que les 0,86 $ de Kimi K3 bien que Kimi K3 soit listé à 3 $/15 $ par jeton. L'écart est comportemental, pas une hausse de prix : le modèle a effectué en moyenne 64 étapes par tâche GDPval-AA contre 14 pour Qwen3.7-Max, et parce que le harnais renvoie la conversation complète à chaque étape, les jetons d'entrée ont augmenté d'environ 15× et les jetons de sortie d'environ 45 %. Les jetons bon marché ne signifient pas des agents bon marché — la verbosité que les testeurs de l'aperçu ont signalée a maintenant un prix mesuré. Parce qu'OrcaRouter répercute les prix catalogue sans marge (0 %) derrière un point de terminaison compatible OpenAI, cette question de 1,14 $ contre 0,86 $ peut être mesurée avec des invites identiques sans deuxième contrat.

Le tableau de référence, et ce que chaque nombre mesure réellement

Lors de la GA, Alibaba a publié le tableau qu'il avait retenu lors de l'aperçu. Scores rapportés :

Terminal-Bench 2.1 — 86.6. Mesure si un modèle peut utiliser un véritable shell de bout en bout : exécuter des commandes, lire la sortie, récupérer après des erreurs. C'est l'indicateur le plus proche de la capacité à « fonctionner comme un agent de codage plutôt que comme un simple suggérateur de code ».

GPQA Diamond — 92.6.Des questions de physique, chimie et biologie de niveau avancé, conçues pour résister à la recherche d'informations. Un score élevé indique un véritable raisonnement scientifique plutôt que la mémorisation. 92.6 est au sommet du domaine actuel.

PaperBench — 93.0. Reproduire les résultats d'articles de recherche — lire une méthodologie et la réimplémenter. Récompense une compréhension soutenue en plusieurs étapes.

IFBench — 82.8.Suivi d'instructions sous contraintes : format, longueur et instructions négatives. Notamment le score le plus bas dans le propre tableau d'Alibaba, ce qui correspond à la critique de l'ère de l'aperçu selon laquelle le modèle est si minutieux qu'il ignore les limites de portée.

OSWorld-Verified — 86,1.Utilisation de l'ordinateur : piloter une véritable interface graphique de bureau pour accomplir des tâches. Une performance solide ici soutient le positionnement agentique.

OmniDocBench 1.5 — 92.1.Analyse de documents — tableaux, mise en page, mélange de texte et de figures. Se combine avec le contexte forfaitaire de 1M pour démontrer l'intérêt des pipelines documentaires.

FrontierSWE — 73.5, contre 40.7 pour son prédécesseur. DeepSWE 1.1 — 56.6, contre 21.6.

Ces deux derniers méritent d'être soulignés. Des quasi-doublements sur des benchmarks exigeants de génie logiciel en une seule génération ne sont pas des gains incrémentaux normaux, et ils sont cohérents avec la décision d'Alibaba de commercialiser ce modèle auprès des développeurs plutôt que des utilisateurs de chat. Si le chiffre FrontierSWE survit à une réplication indépendante, Qwen3.8-Max est un modèle de codage sérieux, et pas seulement un grand modèle.

La réserve émise dans l'aperçu s'est réduite mais n'a pas disparu. Le tableau ci-dessus a été produit par Alibaba, sur son propre banc d'essai, dans des conditions que personne d'autre ne peut inspecter. Les tableaux des fournisseurs sont choisis, non échantillonnés — les laboratoires publient les benchmarks sur lesquels ils obtiennent de bons résultats. Mais depuis le 6 août, il existe désormais un véritable arbitre indépendant : Artificial Analysis a attribué à Qwen3.8-Max un score de 56 sur l'Intelligence Index à 1,14 $ par tâche, mesuré sur l'API officielle d'Alibaba — un bond de 10 points par rapport aux 46 de son prédécesseur, à égalité avec Claude Opus 4.8 (56), et à un point de Kimi K3 (57). Sur le leaderboard agentique GDPval-AA d'Artificial Analysis, le modèle atteint 1 739 Elo, dépassant Kimi K3 (1 685) et GPT-5.6 Sol (1 730), avec seulement Claude Opus 5 (1 852) devant. Les réserves d'AA méritent qu'on leur accorde le même poids : une exécution antérieure avait obtenu 53 avant que les problèmes d'endpoint ne soient résolus, et le nouveau test sur l'API officielle a donné 56 ; AA-Omniscience a chuté de 10 points, son taux d'hallucination étant passé de 23 % à 40 % ; et le coût par tâche est élevé précisément parce que le modèle passe par beaucoup plus d'étapes. Le classement général de LMArena ne présente toujours aucun score public.

Le lancement de DigitalOcean a ajouté un troisième point de données, cette fois sur la version quantifiée plutôt que sur le modèle phare. Le propre contrôle ponctuel interne de DigitalOcean sur les poids NVFP4 qu'elle sert a obtenu 88 sur GPQA Diamond, contre les 92,6 publiés par Alibaba pour le modèle phare non quantifié. DigitalOcean elle-même qualifie la comparaison de « point de données indicatif plutôt que comparaison contrôlée » — les différences portent sur trois axes (base à poids ouverts plutôt que modèle phare hébergé, NVFP4 plutôt que BF16, et une pile d’évaluation différente) — mais c’est la première vérification indépendante sur un déploiement réel de ces poids, et un rappel que le point de contrôle ouvert n’est pas, octet pour octet, le nombre du tableau d’Alibaba.

CommerceAgentBench : le tableau de bord du commerce agentique

Parallèlement à cette mise à jour, l'équipe Accio d'Alibaba International a publié CommerceAgentBench, un benchmark conçu pour mesurer précisément le travail à long horizon que Qwen ne cesse de mettre en avant. Un agent démarre chaque tâche dans un conteneur vierge, au sein de l'une des 14 répliques hors ligne de logiciels réels de commerce et de gestion — publication de produits, réservation de fret, administration de boutique en ligne, opérations de paiement, analyse fournisseurs — et la notation repose sur l'état : une tâche n'est validée que lorsque les services simulés sous-jacents et les fichiers produits changent réellement ; un agent qui décrit un flux de travail plausible sans modifier l'état n'obtient aucun point. La suite exécute 107 tâches sur les surfaces CLI, navigateur, fichiers/documents et API/MCP, via trois harnais — Accio, OpenClaw et Pi — et le code des harnais (Apache 2.0) ainsi que les données des tâches (CC BY 4.0) sont ouverts à l'inspection ou à la réexécution.

Dans les tableaux publiés, Qwen3.8-Max affiche le meilleur résultat open-weight : 56 des 107 tâches sur le harnais Accio, 47 sur OpenClaw et 53 sur Pi — soit 156 réussites agrégées, deux de plus que les 154 de DeepSeek V4 Pro. Tout l'avantage open-weight provient du harnais Accio ; les deux modèles font jeu égal sur OpenClaw et Pi. Le leader open-weight n'est pas pour autant le leader absolu : le modèle fermé Claude Opus 5 surclasse tout le monde avec 191 réussites agrégées, soit 35 de plus. Et ce tableau est celui d'Alibaba lui-même — Accio est l'équipe d'Alibaba, et le dépôt lui-même signale les limites de l'audit : le harnais Accio n'est fourni qu'à titre de référence et n'est pas reproductible à partir d'un checkout (OpenClaw étant la voie réexécutable) ; les résultats par tâche ne sont assortis d'aucune somme de contrôle publique immuable ; et les lignes de Qwen reposaient sur un protocole de rejeu du contenu de raisonnement pour rester comparables. Traitez-le comme une donnée déclarée par le fournisseur sur le même axe agentique qu'OSWorld-Verified et le GDPval-AA d'AA abordent sous des angles différents — à éprouver contre vos propres workflows, plutôt que comme un classement établi.

Code Arena WebDev : l'arbitre indépendant de la build 0902

Code Arena est l’élément de preuve indépendant qui manquait à la mise à jour. Il s’agit d’un classement tiers pour le développement web agentique — le projet anciennement connu sous le nom de WebDev Arena — où des votes humains anonymes, par paires, sur la sortie de modèle qu’un utilisateur préférerait livrer sont convertis en un classement de type Elo. Sur son tableau WebDev, Qwen3.8-Max-0902 a fait ses débuts en tête avec 1 691 points, soit 22 de plus que la version précédente et devant Claude Opus 5 et Kimi K3. Cette position présente aussi un avantage en termes de rapport coût-efficacité : à un tarif mixte d’environ 5 $ par million de jetons — le tarif catalogue de 2 $/6 $ pondéré en faveur du mélange à forte proportion de sortie que produit réellement la génération d’applications web — la version 0902 est le modèle le mieux noté sur la frontière de Pareto du classement, avec un coût équivalant à environ un quart du prix mixte d’environ 20 $/M de Claude Opus 5 et bien en dessous des ~12 $/M de Kimi K3, ce qui explique pourquoi ces deux-là se situent hors de la frontière malgré leurs rangs #2 et #3 en score. Alibaba a annoncé cette position le 2 septembre et le compte officiel de Qwen l’a confirmée, en orientant les utilisateurs vers QwenCloud ; la mesure n’est pas celle d’Alibaba : contrairement au tableau de benchmarks ci-dessus ou à l’exécution de CommerceAgentBench juste au-dessus, ce score est produit par une arène tierce à partir de votes de préférence humaine.

Deux réserves permettent de garder les choses honnêtes. Premièrement, les classements de l’arène sont des instantanés : 1 691 correspond à ce qu’affichait le tableau de bord lorsque Alibaba a annoncé la sortie, et cette note évoluera au fil des votes. Il faut donc y voir un signal fort sur le codage de développement web plutôt qu’une couronne permanente. Deuxièmement, cette note ne couvre qu’un seul axe. Les affirmations de la mise à jour concernant les usages professionnels, scientifiques et généralistes à long horizon n’ont toujours pas d’arbitre indépendant, c’est pourquoi le tableau des fournisseurs et l’indice AA 56 du modèle de base restent les points de référence pour tout ce qui sort du travail front-end agentique. Troisièmement, le prix frontière est un choix de modélisation, pas une nouvelle grille tarifaire : le montant d’environ 5 $/MToken combine la liste inchangée de 2 $/6 $ avec une hypothèse d’utilisation à forte proportion de sorties. Il faut donc le considérer comme un classement de rentabilité selon les termes propres de l’arène, et non comme une nouvelle tarification de la part d’Alibaba.

Poids ouverts, Qwen3.8-27B, et la question du sur site

La promesse d'Alibaba concernant les poids ouverts est désormais tenue. Le 12 août 2026, Qwen a publié deux dépôts sur Hugging Face — Qwen3.8-2.4T-A95B en BF16 et Qwen3.8-2.4T-A95B-FP8 — chacun avec 213 fichiers de poids. La licence est une licence personnalisée Qwen3.8-Max, pas Apache 2.0 ; le champ licence de Hugging Face indique « other ». Les conditions autorisent l'utilisation, la modification, la distribution et le fine-tuning, y compris à des fins commerciales, avec attribution, ainsi que deux seuils basés sur l'échelle : les produits dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels doivent afficher le nom du modèle de manière bien visible, et les entreprises de Model-as-a-Service ou d'AI-Work-Assistant réalisant plus de 50 millions de dollars de revenus cumulés sur les douze derniers mois doivent obtenir une licence séparée auprès de Qwen. La plupart des équipes sont en dessous de ces seuils ; si votre entreprise les dépasse, lisez le texte de la licence avant de vous appuyer dessus. Les compteurs de téléchargement confirment la fraîcheur de la publication — 978 sur le dépôt BF16 et 3 851 sur le dépôt FP8 au moment où j'écris, des chiffres faibles pour une sortie de pointe et cohérents avec un dépôt créé le 8 août et rendu public seulement le 12 août, pas avec un dépôt qui serait resté visible pendant une semaine. Encore une note d'honnêteté : le checkpoint ouvert est le modèle de base, texte uniquement avec la réflexion toujours activée, tandis que l'API hébergée Qwen3.8-Max ajoute la prise en charge de la vision, un mode sans réflexion optionnel et le contexte complet de 1M — télécharger les poids vous donne le modèle, pas toutes les fonctionnalités de l'API.

L'auto-hébergement du modèle phare reste hors de portée pour la plupart des équipes, mais c'est désormais hors de portée avec une mathématique connue. Le jeu complet de poids du modèle à 2.4T de paramètres représente environ 4,9 To en BF16 et environ 2,4 To en FP8, car chaque expert doit rester résident en mémoire même si seulement 95B sont activés par jeton. En quantification 4 bits, cela donne de l'ordre de 1,2 To, contre environ 141 Go par H200 ; il faut donc huit accélérateurs haut de gamme ou plus avant de servir un seul jeton. Ce que le nombre désormais public de paramètres actifs apporte, c'est la dimension débit : avec 95B activés par jeton, la charge de calcul par jeton est comparable à celle d'un modèle dense de la classe ~90B — une fraction du coût qu'imposerait un modèle dense de 2.4T — donc une fois les poids résidents en mémoire, le coût par jeton n'est pas le cauchemar que suggère le nombre total de paramètres. Cette combinaison d'une empreinte mémoire importante et d'une charge de calcul par jeton modeste est précisément la raison pour laquelle Alibaba peut facturer la sortie à 6 $/1M, et elle oriente les équipes d'auto-hébergement vers des nœuds multi-GPU exécutant les checkpoints FP8 plutôt que vers toute solution mono-GPU.

Le choix de déploiement de DigitalOcean est un exemple concret de ces calculs en production. Il exécute le modèle quantisé en NVFP4 sur des GPU NVIDIA HGX B300, précisément pour que les 2,4 T de poids tiennent sur un seul nœud, évitant ainsi le routage d'experts entre nœuds — un déploiement réel de l'économie 4 bits que cette section a explorée sur le papier. Le compromis est exactement celui que le contrôle ponctuel GPQA ci-dessus quantifie : une empreinte plus réduite, au prix d'une perte de qualité mesurable par rapport au modèle phare non quantisé.

C'est ce qui fait de Qwen3.8-27B la sortie la plus décisive pour la plupart des lecteurs — et contrairement au modèle phare, ses poids sont arrivés à temps. Le 14 août 2026, Qwen a publié Qwen/Qwen3.8-27B sur Hugging Face et ModelScope sous licence Apache 2.0 : un modèle dense de 27B, nativement multimodal, avec un contexte natif de 262K jetons extensible à 1M et un mode reasoning_effort configurable. Daniel Han, d'Unsloth, avait estimé qu'il fonctionnerait dans environ 17 Go de VRAM — une carte prosumer unique — et c'est désormais testable : le dépôt officiel fournit des safetensors BF16 (environ 55,6 Go répartis sur 18 shards), et les quantifications GGUF suivent dans les dépôts communautaires. Le schéma de sortie de cette génération est donc désormais complet : les poids du modèle phare de 2,4T sont arrivés en premier le 12 août, et le petit modèle pour la voie on‑premise est arrivé deux jours plus tard. Nous avons suivi sa sortie dans notre article sur la date de sortie de Qwen3.8-27B.

Où Qwen3.8-Max trouve sa place : quatre scénarios

1. Analyse de documents longs et de contrats. C'est la meilleure adéquation. Le tarif forfaitaire sur 1 million de jetons, associé au score OmniDocBench de 92,1, signifie que vous pouvez traiter un document de 400 pages en un seul appel, sans supplément et sans découpage. Les concurrents qui facturent des suppléments pour les contextes longs rendent la même tâche nettement plus coûteuse. Sur le parcours DigitalOcean, rappelez-vous que ce parcours donne accès au modèle de base ouvert avec un contexte de 262 K — il s'agit toujours d'un grand document, mais pas du million complet.

2. Agents de codage à l'échelle des dépôts. Terminal-Bench 86,6 et FrontierSWE 73,5 le confirment, et la tarification du cache rend le travail itératif sur une base de code stable peu coûteux. La première chose à tester est la latence avec votre propre niveau de concurrence, car les évaluateurs de la phase preview ont trouvé le modèle minutieux mais lent sur les longues exécutions agentiques, et le service GA est une tout autre affaire que le service preview. Le résultat d'AA à GDPval-AA — un Elo de pointe de 1 739 au prix de 64 étapes par tâche — est la confirmation indépendante des deux facettes de ce compromis. Les mesures de DigitalOcean du 12 août — un débit agrégé évoluant quasi linéairement jusqu'à ~1 937 tokens de sortie par seconde à 256 requêtes concurrentes, avec zéro erreur et aucune saturation constatée — constituent le premier point de données de plateforme managée sur cette question, même s'il s'agit de ses propres chiffres sur son propre service, et non d'une comparaison directe avec ceux d'Alibaba.

3. Pipelines de documents et de captures d'écran. L'entrée vidéo et image, plus OSWorld-Verified 86.1, le rendent crédible pour les workflows qui lisent des écrans — automatisation de l'assurance qualité, tri du support à partir de captures d'écran, tâches adjacentes à la RPA. Encore une fois, l'entrée multimodale est une fonctionnalité d'API hébergée ; le chemin open-base de DigitalOcean est en texte seul.

4. Là où nous ne le mettrions pas encore. L'UX interactive à latence critique et toute charge de travail réglementée exigeant une évaluation reproductible. Pour la première, vous voulez un débit mesuré que vous contrôlez. Pour la seconde, la reproductibilité dispose désormais d'une fiche de modèle et d'une licence de citation, mais le tableau de référence d'Alibaba n'est toujours pas répliqué — et la régression d'Omniscience d'AA (taux d'hallucination jusqu'à 40 %) rappelle que le score indépendant va dans les deux sens.

Comment accéder à Qwen3.8-Max

Il existe plusieurs voies pratiques. Directement via Alibaba Model Studio / DashScope — ou l'API QwenCloud de Qwen elle-même — vous obtenez la grille tarifaire ci-dessus et l'accès le plus précoce aux nouvelles versions datées — la version Qwen3.8-Max-0902 du 2 septembre est apparue d'abord sur cette plateforme avant d'être déployée sur d'autres points de terminaison — au prix de l'intégration d'un nouveau fournisseur et de la gestion d'une clé supplémentaire. Qwen Chat et l'application Qwen sont le moyen le plus rapide de jauger le comportement avant d'écrire du code. Télécharger les poids ouverts depuis Hugging Face est une quatrième voie pour les équipes qui souhaitent gérer leur propre infrastructure — avec les mises en garde sur la taille et la licence mentionnées ci-dessus. Passer par un routeur est l'option que la plupart des équipes de production devraient envisager, car cela dissocie la décision de migration de la décision d'évaluation.

Depuis le 14 août 2026, il existe une option véritablement nouvelle : Qwen3.8-Max est disponible sur DigitalOcean Serverless Inference, ce qu'Alibaba a présenté comme son « partenaire de lancement Day 0 » — la formulation est celle d'Alibaba, mais l'offre est celle de DigitalOcean et se suffit à elle-même. DigitalOcean sert le checkpoint open-weights (identifiant de modèle de plateforme qwen3.8-max), quantifié NVFP4 sur GPU NVIDIA HGX B300 en collaboration technique avec Inferact, en tant qu'API serverless entièrement gérée : un seul endpoint, une tarification à l'usage, aucune infrastructure à gérer. Sa grille tarifaire est alignée sur celle d'Alibaba — 2,00 $ en entrée / 6,00 $ en sortie par million, avec l'entrée en cache à 0,20 $ — et il sert le contexte natif de 262K de la base ouverte, avec la réflexion toujours active, plutôt que le mode multimodal d'environ 1M de jetons du modèle phare hébergé. Ce plafond de contexte a son importance si votre charge de travail privilégie les longs contextes : le mode complet d'un million de jetons reste exclusif à l'API d'Alibaba.

Ce que l'approche DigitalOcean apporte au-delà de la géographie, ce sont les premières données de service concrètes provenant d'un fournisseur autre qu'Alibaba. Les propres mesures de DigitalOcean sur son endpoint de production, prises le 12 août, montrent un préremplissage évoluant linéairement à environ 16,000 tokens/sec — règle empirique : TTFT ≈ (input ÷ 16,000) + 0.7s, donc ~1.1s pour ~1,080 tokens et ~15.8s pour ~254K — et le débit agrégé atteignant ~1,937 tokens de sortie/sec pour 256 requêtes concurrentes avec zéro erreur et aucun point de saturation trouvé. Ce sont les chiffres de DigitalOcean sur son propre déploiement, et non un comparatif contrôlé, mais ce sont les premières données de latence et de concurrence sur ce modèle en dehors du cloud d'Alibaba, et elles répondent directement à l'inquiétude « exhaustif mais lent » de l'ère de l'aperçu.

Qwen3.8-Max est disponible sur OrcaRouter sous le nom qwen/qwen3.8-max, et la version actualisée du 2 septembre est routable sous son propre identifiant daté — qwen/qwen3.8-max-0902 — tous deux au même tarif catalogue de 2,00 $ / 6,00 $. OrcaRouter applique une marge de 0 % et transmet directement les prix du fournisseur, donc les deux routes coûtent le même prix qu'en accès direct. Notre propre télémétrie de service affiche actuellement un p50 du temps jusqu'au premier jeton de 1,64 seconde sur une fenêtre de 7 jours. Il s'agit d'une mesure de latence de première partie, et non d'une affirmation du fournisseur, et elle mérite d'être mise en balance avec les rapports de l'ère de l'aperçu qualifiant le modèle de « modèle le plus lent que j'aie utilisé » : ceux-ci proviennent d'un seul évaluateur exécutant des builds agentiques d'une heure sur l'infrastructure d'aperçu, et ils devraient être retestés sur le service GA plutôt que répétés comme un fait actuel.

La valeur pratique du chemin de routage est que Qwen3.8-Max se trouve derrière le même point de terminaison compatible OpenAI que les modèles que vous exécutez déjà, si bien qu'une évaluation se résume à un changement de chaîne de modèle. Vous pouvez lui envoyer 5 % du trafic de production, le comparer à votre modèle actuel sur des invites identiques et conserver un mécanisme de secours — ce qui est exactement la posture que mérite un modèle dont la table du fournisseur n'est pas répliquée. Cette même posture est la bonne façon de tester le déploiement DigitalOcean : faire passer une tranche de trafic dessus avec un mécanisme de secours en place, plutôt que de miser un chemin de production sur une pile de service vieille de deux semaines.

Limites et risques réels

Le tableau des fournisseurs n'est toujours pas audité.Le score indépendant est arrivé (AA Index 56), mais le propre tableau de référence d'Alibaba n'a toujours pas été reproduit, et la mesure d'AA signale une régression d'Omniscience avec un taux d'hallucination allant jusqu'à 40 %. La notation indépendante aide ; elle ne rend pas le tableau des fournisseurs auditable.

La voie DigitalOcean est la base ouverte, pas le produit phare. Elle sert le point de contrôle avec un contexte de 262K, texte uniquement, raisonnement toujours activé, quantifié en NVFP4 — et les propres tests ponctuels de DigitalOcean qui donnent 88 sur GPQA Diamond contre les 92,6 publiés par Alibaba, un écart que DigitalOcean qualifie d’indicatif plutôt que contrôlé. Si vous avez besoin de l’API multimodale complète d’un million de jetons, elle est toujours hébergée par Alibaba.

Qwen3.8-27B publié, mais numéroté par le fournisseur. Les poids du 27B sont arrivés le 14 août sous licence Apache 2.0, comblant le vide sur site — mais ses scores de benchmark, rapportés par Alibaba, n'ont pas été répliqués, et les quantifications communautaires étaient encore en cours de déploiement au moment de cette mise à jour.

• Licence personnalisée, pas Apache 2.0. La licence Qwen3.8-Max autorise une utilisation commerciale avec attribution, mais comporte deux seuils d’échelle — affichage bien visible du nom du modèle au-delà de 100 M de MAU ou 20 M$ de revenus mensuels, et une licence distincte pour les entreprises MaaS/assistant de travail IA au-delà de 50 M$ de revenus sur les douze derniers mois. Lisez-la avant de dépasser ces seuils.

Verbosité et dérive des instructions.IFBench 82,8 est le chiffre le plus faible dans le propre tableau d'Alibaba, et les testeurs en avant-première ont constaté à plusieurs reprises que le modèle dépassait son périmètre — en ajoutant des fonctionnalités non demandées. Les chiffres d'AA permettent désormais de le quantifier : 64 étapes par tâche GDPval-AA, c'est ce qui fait grimper le coût à 1,14 $, soit 25 % de plus que Kimi K3. Charmant dans une démo, coûteux lorsque la sortie est facturée à 6 $/1M et déstabilisant lorsque vous avez besoin de formats précis.

Garde-fous de contenu.Comme les autres modèles de pointe hébergés en Chine, les réponses sur des sujets politiquement sensibles sont limitées. Pertinent si votre produit répond à des requêtes ouvertes.

Les jetons de réflexion sont facturés comme sortie. Avec le raisonnement activé, les coûts réels dépassent les estimations naïves. Mesurez avec le raisonnement configuré de la manière dont vous le déploierez réellement.

FAQ

Est-ce que Qwen3.8-Max est disponible maintenant ?

Oui. Il est devenu disponible en disponibilité générale le 3 août 2026, avec une grille tarifaire publiée et une API compatible OpenAI et DashScope. L'instantané de production actuel — Qwen3.8-Max-0902, livré le 2 septembre — est en ligne sur l'API de QwenCloud et c'est ce que sert désormais le endpoint standard qwen3.8-max. Il s'agit d'un changement par rapport à son statut d'aperçu du 19 juillet, où l'accès était limité à Qwen Chat, à l'application Qwen et à la campagne de crédits de Qoder.

Qu'est-ce que Qwen3.8-Max-0902 ?

Qwen3.8-Max-0902 est la mise à jour de production du 2 septembre 2026 de Qwen3.8-Max : le même fleuron sparse-MoE de 2,4T de paramètres et le même contexte de 1M de jetons, post-entraîné sur Coding et Cowork, et disponible sur l'API de QwenCloud au même tarif de 2$/6$. Qwen affirme que la nouvelle version est plus performante sur les tâches complexes d'entreprise et scientifiques — une déclaration du fournisseur, non encore évaluée de manière indépendante — alors que sur le plan du codage, elle détient déjà un résultat indépendant : n°1 du classement Code Arena : WebDev avec 1 691 points et au sommet de sa frontière de Pareto coût-performance à un tarif mixte d'environ 5$/MToken, selon l'annonce d'Alibaba concernant le classement en direct de l'arène, confirmée par le compte QwenCloud de Qwen.

Combien coûte le Qwen3.8-Max ?

2,00 $ par million de jetons d’entrée et 6,00 $ par million de jetons de sortie, de manière uniforme sur l’ensemble du contexte de 1 million de jetons, sans supplément pour les invites longues. Les accès au cache d’entrée sont facturés 0,25 $ par million, la création explicite de cache 2,50 $, et les lectures de cache 0,17 $. Les jetons de réflexion sont facturés au tarif de sortie. Sur l’indice d’intelligence d’Artificial Analysis, le coût mesuré du modèle est de 1,14 $ par tâche — voir la section des prix pour comprendre pourquoi cela dépasse le calcul par jetons. Le chemin serverless de DigitalOcean affiche les mêmes 2 $/6 $ avec une entrée en cache à 0,20 $.

Combien de paramètres Qwen3.8-Max a-t-il ?

2,4 billions au total, dans une configuration de Mixture-of-Experts éparse. Le nombre de paramètres actifs — le chiffre qui détermine réellement le coût de service et la latence — est désormais confirmé à 95 milliards activés, selon la fiche technique officielle du modèle Qwen3.8-2.4T-A95B (512 experts ; 10 routés plus un expert partagé actif par jeton).

Les poids de Qwen3.8-Max sont-ils ouverts ?

Oui — depuis le 12 août 2026. Qwen a publié Qwen3.8-2.4T-A95B (BF16) et Qwen3.8-2.4T-A95B-FP8 sur Hugging Face, chacun avec 213 fichiers de poids. La licence est une licence personnalisée Qwen3.8-Max (Hugging Face la répertorie comme « other »), pas Apache 2.0 : elle permet une utilisation commerciale avec attribution et comporte deux seuils basés sur l’échelle. Le checkpoint ouvert est texte uniquement, avec le raisonnement toujours activé ; l’API hébergée ajoute la vision, un mode sans raisonnement optionnel et le contexte complet de 1M.

Qwen3.8-Max a-t-il été soumis à des benchmarks indépendants ?

Oui — en date du 6 août 2026. Artificial Analysis lui attribue un score de 56 sur son Intelligence Index à 1,14 $ par tâche, mesuré sur l'API officielle d'Alibaba : un bond de 10 points par rapport à Qwen3.7-Max (46), à égalité avec Claude Opus 4.8 (56), et un point derrière Kimi K3 (57). Le tableau de référence ci-dessus, toutefois, reste publié par Alibaba et non reproduit de manière indépendante, et le classement général de LMArena ne comporte toujours aucun score public. Le tableau des arènes indépendantes a changé le 2 septembre : la mise à jour 0902 a fait ses débuts à la première place sur le classement Code Arena : WebDev de la même plateforme, avec 1 691 points — un résultat tiers à vote aveugle, et non un tableau d'Alibaba — et la frontière coût-performance de Code Arena la liste comme la valeur la plus performante du classement, à un coût mixte d'environ 5 $/MToken. Le contrôle ponctuel de DigitalOcean sur sa version quantifiée (88 sur GPQA Diamond) est le premier contrôle tiers sur un déploiement serveur, et il est explicitement indicatif plutôt que contrôlé. Une mise en garde pour la colonne « indépendant » : CommerceAgentBench, où Qwen3.8-Max domine les modèles open-weight, n'est pas un second arbitre indépendant — Accio, qui l'a conçu et publié, est la propre équipe d'Alibaba.

Est-ce que Qwen3.8-Max est meilleur que Qwen3.7-Max ?

Selon les chiffres d'Alibaba eux-mêmes, de manière substantielle — FrontierSWE 73,5 contre 40,7 et DeepSWE 1.1 56,6 contre 21,6 sont des quasi-doublements sur des tâches difficiles de génie logiciel. Il est également moins cher que les 2,50 $ / 7,50 $ de son prédécesseur. De manière indépendante, AA situe le saut générationnel à 10 points sur son Intelligence Index (56 contre 46). Les deux affirmations du fournisseur doivent encore être vérifiées sur votre charge de travail.

Puis-je auto-héberger Qwen3.8-Max ?

Pas vraiment. L'ensemble complet des poids de 2,4 billions représente environ 4,9 To en BF16 et environ 2,4 To en FP8, soit environ 1,2 To en précision 4 bits — par rapport à environ 141 Go par H200, cela représente huit GPU haut de gamme ou plus. Avec 95 milliards de paramètres actifs par jeton, le calcul par jeton est relativement modeste, mais l’empreinte mémoire est la contrainte limitante. Le service NVFP4 de DigitalOcean sur les B300 est la preuve concrète que la précision 4 bits permet de faire tenir le modèle sur un seul nœud. Le Qwen3.8-27B — environ 17 Go de VRAM d’après les rapports — est l’option réaliste en local, et ses poids ont été publiés le 14 août 2026 sous licence Apache 2.0 — désormais téléchargeables plutôt qu’une simple promesse.

Qu'est-ce que Qwen3.8-27B ?

Un modèle bien plus petit annoncé aux côtés du modèle phare, positionné comme la voie pratique pour un déploiement sur site. Il s'agit d'un modèle dense de 27B, nativement multimodal, avec un contexte natif de 262 000 jetons extensible à 1M, et il est publié sous licence Apache 2.0. Ses poids ont été mis en ligne sur Hugging Face et ModelScope le 14 août 2026 ; Daniel Han d'Unsloth rapporte qu'il fonctionne dans environ 17 Go de VRAM — une seule carte grand public haut de gamme. Ses résultats de référence sont rapportés par Alibaba et n'ont pas été reproduits de manière indépendante.

Qwen3.8-Max est-il multimodal ?

Oui — il accepte les entrées texte, image et vidéo et renvoie du texte. Il prend également en charge le mode de réflexion, l'appel de fonctions, les outils intégrés et les sorties structurées. Le checkpoint à poids ouverts est limité au texte ; l'entrée multimodale est une fonctionnalité de l'API hébergée, ce que ne comporte pas le parcours DigitalOcean.

Qwen3.8-Max est-il disponible sur DigitalOcean ?

Oui — depuis le 14 août 2026. DigitalOcean Serverless Inference sert le checkpoint open-weights (NVFP4 sur NVIDIA HGX B300) à 2,00 $/6,00 $ par million avec 0,20 $ pour l’entrée en cache, un contexte de 262 000 jetons, texte uniquement, raisonnement toujours activé. Alibaba qualifie DigitalOcean de « partenaire de lancement Day 0 » ; la fiche elle-même appartient à DigitalOcean et est indépendante de ce langage. Les chiffres mesurés par DigitalOcean : prefill ~16 000 jetons/s et environ 1 937 jetons de sortie/s à 256 requêtes simultanées avec zéro erreur.

Puis-je utiliser Qwen3.8-Max via OrcaRouter ?

Oui. Il est disponible en tant que qwen/qwen3.8-max, et l'instantané du 2 septembre est publié sous son propre identifiant daté — qwen/qwen3.8-max-0902 — au même prix catalogue de $2.00/$6.00, avec une marge de 0 %. Le routage coûte le même prix qu'un accès direct et passe par le point de terminaison compatible OpenAI que vous utilisez déjà. Notre télémétrie sur 7 jours montre un p50 time-to-first-token de 1,64 seconde.

Devrais-je déplacer le trafic de production dessus aujourd'hui ?

Pas en bloc. Le prix et le premier score indépendant rendent une évaluation sérieuse peu coûteuse et utile à faire maintenant, mais avec un coût par tâche supérieur de 25 % à celui du Kimi K3, la démarche disciplinée consiste à répartir le trafic entre votre solution actuelle et celle-ci sur des prompts identiques, avec un plan de repli en place — pas une migration. La voie DigitalOcean ajoute un second déploiement géré à tester en comparaison, ce qui rend l'évaluation encore moins chère.

En résumé

Qwen3.8-Max a passé deux semaines en tant que modèle le plus intéressant que personne ne pouvait acheter. À la GA, c'est une proposition véritablement différente : un tarif fixe de 2 $/6 $ sur un million de jetons est un prix agressif, les taux de cache rendent le travail itératif des agents peu coûteux, et le saut générationnel sur FrontierSWE et DeepSWE — s'il se reproduit — en fait un véritable modèle de codage plutôt qu'un simple exercice d'échelle. L'arrivée des poids ouverts sous une véritable licence le 12 août a transformé la promesse « des poids ouverts à venir » en un fait, et le parcours DigitalOcean lancé dès le premier jour, annoncé le 14 août — avec des chiffres de service mesurés et une lecture de cache à 0,20 $ — renforce l'argument « essayez-le à moindre coût » et offre aux équipes un déploiement managé par un tiers à comparer avec l'API d'Alibaba. La mise à jour Qwen3.8-Max-0902 du 2 septembre conserve cette thèse intacte : les mêmes tarifs de 2 $/6 $ et le contexte d'un million de jetons, avec davantage de post-entraînement sur le codage et le travail collaboratif pour lesquels le modèle était déjà positionné. Cette mise à jour a également ajouté un classement indépendant basé sur les préférences humaines pour ce discours sur le codage : Qwen3.8-Max-0902 a fait ses débuts à la première place du classement WebDev de Code Arena avec 1 691 points, devant Claude Opus 5 et Kimi K3, et avec un coût moyen d'environ 5 $/MToken, il est le modèle le mieux noté sur la frontière de Pareto coût-performance de ce classement. Le résultat CommerceAgentBench publié par l'équipe Accio d'Alibaba la même semaine — Qwen3.8-Max en tête du classement des modèles à poids ouverts sur un benchmark construit à partir de flux de travail commerciaux réels — donne à cette thèse du travail collaboratif un tableau de bord concret qui lui est propre, quoique géré par le fournisseur.

Ce qui a changé, c'est que l'arbitre et les poids sont tous deux arrivés — et le verdict est globalement bon, avec de réels bémols. AA attribue à Qwen3.8-Max un score de 56 sur l'Intelligence Index, un véritable saut générationnel qui le place au niveau de Claude Opus 4.8 ; la même grille place pourtant Kimi K3 un point devant, avec un coût par tâche inférieur de 25 %, et signale une baisse de 10 points sur l'Omniscience, sur fond de taux d'hallucination en hausse. La question des paramètres actifs est réglée — 95B de paramètres activés, confirmé sur la fiche du modèle — et la licence est publiée : personnalisée, et non Apache 2.0. Ce qui n'a pas changé : le tableau de benchmarks d'Alibaba n'a toujours pas été reproduit, le coût par tâche reste élevé parce que le modèle enchaîne un très grand nombre d'étapes, la base ouverte hébergée sur DigitalOcean affiche des caractéristiques légèrement différentes de celles annoncées pour le modèle phare (contexte de 262K, NVFP4, contrôle ponctuel GPQA de 88 contre 92,6), et les performances de benchmark annoncées pour Qwen3.8-27B proviennent du fournisseur, même si ses poids ont été publiés. Cette combinaison ne fait pas de Qwen3.8-Max un mauvais pari — à ce prix, c'est presque une expérience obligatoire — mais elle impose la bonne posture : évaluer agressivement, router délibérément, garder une solution de repli. Ce qu'il faut maintenant surveiller, c'est de savoir si le nombre d'étapes agentiques qui explique ce coût de 1,14 $ par tâche peut être absorbé par votre charge de travail, si l'avance de la build 0902 dans Code Arena : WebDev se maintient à mesure que les votes s'accumulent, si ses gains en Coding et en Cowork se reproduisent sur des charges de travail réelles, si l'avance open-weight sur CommerceAgentBench — deux passes agrégées sur le propre banc d'essai d'Alibaba — résiste à une exécution indépendante, si les scores de la version 27B tiennent la route, et si le débit mesuré du déploiement DigitalOcean se maintient sous un trafic réel. C'est ce qui décidera si « deuxième seulement derrière Fable 5 » relevait du positionnement ou de la prophétie.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement