Une carte de titre principale pour la comparaison « Qwen3.8-Omni-Flash vs Qwen 3.8 » avec le sur-titre « Duel - même famille, briefs opposés », le sous-titre « Un spécialiste conçu pour des heures de médias face au noyau ouvert de 2,4 billions de paramètres conçu pour la profondeur par token », et trois puces de stats indiquant « Prix par million de tokens : 13 fois d'écart », « Contexte : 1 M des deux côtés », et « Poids ouverts : d'un seul côté ».
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen 3.8 : une offre spécialisée contre un modèle phare

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous voulez la version courte : Qwen3.8-Omni-Flash est environ treize fois moins cher par token que Qwen 3.8 et est le seul des deux conçu pour tenir dans une heure d'audio-vidéo sans étouffer — tandis que Qwen 3.8, le cœur ouvert de 2,4 billions de paramètres au sommet de la gamme Qwen3.8, est celui que vous utilisez lorsque la réponse doit être correcte plutôt que bon marché, et le seul des deux dont vous pouvez télécharger les poids. Ils partagent une longueur de contexte, un nom de famille et une fenêtre de lancement d'août à septembre. Ils ne sont pas des substituts, et toute la valeur de cette comparaison réside dans le fait de savoir quelle question vous posez réellement.

Pour être précis sur les noms, car la famille est nombreuse. Qwen 3.8 désigne ici le cœur ouvert à mélange d'experts 2,4T-A95B — le modèle derrière le point de terminaison Qwen3.8-Max, qu'Alibaba a dévoilé le 3 août 2026 et dont il a publié les poids le 12 août, et qu'Artificial Analysis indexe à 40 sur son Intelligence Index. Qwen3.8-Omni-Flash est le modèle omni-modal natif qu'Alibaba a mis en service via API le 18 septembre 2026, construit sur la lignée d'architecture Qwen3.8-Flash, qui prend en entrée du texte, des images, de l'audio et de la vidéo et renvoie du texte. Tout ce qui concerne le modèle phare est rapporté par le fournisseur ou indexé de manière indépendante, comme indiqué ; tout ce qui concerne le modèle omni n'est rapporté que par le fournisseur, car il n'a que quelques heures et personne en dehors d'Alibaba ne l'a mesuré.

Deux modèles, une famille, des orientations de design opposées

La tentation est de voir ici un grand modèle et un petit modèle de la même génération, comme on lirait Qwen3.8-Max face à Qwen3.8-Flash. Cette lecture est erronée d'une manière qui coûte cher. Le noyau de Qwen 3.8 est un moteur de raisonnement qui se trouve accepter des images et de la vidéo ; son débit se mesure en tokens par seconde sur des problèmes difficiles, son prix est fixé pour refléter le coût de calcul d'une passe avant à 95 milliards de paramètres actifs, et sa fiche d'évaluation est une liste de benchmarks de raisonnement et de codage. Qwen3.8-Omni-Flash est un moteur de perception et d'action qui se trouve raisonner ; son prix est fixé en fonction du coût d'ingestion d'heures de médias, et sa fiche d'évaluation est une liste de benchmarks audio, vidéo et d'appel d'outils. L'un est optimisé pour la profondeur par token. L'autre est optimisé pour les tokens par heure de contenu.

Cette différence apparaît le plus nettement là où le marketing n'en dit mot. Les deux modèles acceptent environ un million de tokens et tous deux acceptent la vidéo. Mais Qwen3.8-Omni-Flash est explicitement conçu autour du problème de la durée — jusqu'à une heure d'audio-vidéo continu en un seul appel, avec un mode Agentic Understanding dans lequel le modèle choisit ce qu'il échantillonne au lieu de traiter chaque image, réduisant le nombre de tokens par requête de 145 736 à 79 117 tout en faisant passer la précision sur OmniVideoBench de 63,4 à 67,8. Qwen 3.8 ne dispose d'aucun mécanisme publié équivalent. Lui fournir deux heures de vidéo est possible sur le papier ; le faire à un prix qui survive au contact d'une équipe financière est une autre question, et c'est la question à laquelle le modèle omni a été conçu pour répondre.

Les dimensions qui le décident réellement

• Prix — Qwen3.8-Omni-Flash 0,15 $ par million de jetons en entrée et 0,47 $ par million de jetons en sortie, contre 2,00 $ et 6,00 $ pour Qwen 3.8. Lecture du cache : 0,016 $ contre 0,25 $.

• Poids ouverts — Qwen 3.8 a publié ses poids le 12 août 2026 sous une licence personnalisée ; Qwen3.8-Omni-Flash est uniquement disponible via API et Alibaba n'a pas dit qu'il serait publié.

• Contexte — un million de tokens des deux côtés ; 991 K d'entrée maximum sur le modèle omni, avec 131 K de sortie maximum et un budget de raisonnement de 262 K.

• Durée des médias — jusqu'à une heure d'audio-vidéo en continu dans un seul appel omni ; le modèle phare est documenté pour l'entrée vidéo, sans aucune information sur les coûts horaires associés.

• Modalité de sortie — du texte des deux côtés. Ni l’un ni l’autre ne génère de parole, malgré la lignée du modèle omni.

• Score indépendant — Qwen 3.8 se situe à 40 sur l’Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash n’a encore aucun score indépendant, quel qu’il soit.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Pourquoi les tableaux de benchmark ne peuvent pas trancher cette question

Il n'existe pas de comparatif direct, et il n'y en aura pas de sitôt. Les documents de lancement d'Alibaba pour Qwen3.8-Omni-Flashne le comparent qu'àQwen3.5-Omni-Plus, son prédécesseur direct, et à Gemini 3.8 Flash ; les chiffres du modèle phare proviennent d'un ensemble d'évaluations de raisonnement et de codage entièrement différent. Les deux tableaux n'ont pas une seule ligne en commun. Quiconque publie un tableau qui les place côte à côte sur un même axe a construit cet axe lui-même.

Ce qu’on peut dire honnêtement est directionnel. D’après les chiffres du fournisseur lui-même, le modèle omni constitue un grand pas par rapport à la gamme omni qu’il remplace — un gain moyen supérieur à 26 % sur une trentaine d’évaluations, avec WildClawBench-MM à 71,0, UniClawBench à 69,6, LongAudioSpan à 82,7 — et un gain réel mais partiel face à Gemini 3.8 Flash, où il devance les tableaux centrés sur l’audio tels que SpotSoundBench (67,2 contre 39,7) et MMAU (81,8 contre 76,9), et se fait devancer sur AgenticVBench, purement axé sur le raisonnement vidéo (36,8 contre 45,0). Du côté des modèles phares, le score Index de 40 de Qwen 3.8 est une mesure indépendante et vaut plus que tout ce qui précède. Ce sont des preuves de nature différente, qu’il ne faut pas mélanger dans une moyenne.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Une comparaison de coûts chiffrée, avec l'hypothèse énoncée

Prenons une tâche d'analyse de longs documents et de vidéos : 300 000 jetons d'entrée et 20 000 jetons de sortie, une configuration plausible pour une réunion enregistrée de quatre-vingt-dix minutes avec des diapositives. Sur Qwen3.8-Omni-Flash, cela représente 300 000 × 0,15 $ par million = 0,045 $ d'entrée et 20 000 × 0,47 $ par million = 0,0094 $ de sortie, soit environ 5,4 cents. Sur Qwen 3.8, le même appel coûte 300 000 × 2,00 $ par million = 0,60 $ et 20 000 × 6,00 $ par million = 0,12 $, soit environ 72 cents. Un peu plus de treize fois le coût pour le même nombre de jetons.

Le nombre qui change la décision n’est pas le ratio mais le volume. À cent tâches de ce type par jour, cela représente environ 5 $ par jour contre environ 72 $ par jour — la différence entre une fonctionnalité que vous livrez et une fonctionnalité dont vous réduisez la portée. Mais si la tâche est une extraction difficile unique à partir d’un contrat de 300 K tokens où une mauvaise réponse coûte une heure de révision humaine, le surcoût de 13x est sans importance et le modèle de raisonnement plus puissant l’emporte dès la première erreur qu’il ne commet pas. Définissez l’hypothèse avant de regarder la ligne de prix, pas après.

Là où chacun gagne réellement

Qwen3.8-Omni-Flash l'emporte sur tout ce qui se mesure en heures. La transcription de réunions avec diarisation et extraction des tâches de suivi, le résumé de longues vidéos, les rapports de recherche audiovisuels, les pipelines de sous-titrage, et tout agent qui doit décider par lui-même quelle minute d'un enregistrement compte. L'amélioration de la diarisation rapportée par le fournisseur — le taux d'erreur de locuteur d'AliMeeting passant de 88,11 à 3,35 — est le genre d'écart qui transforme un pipeline à révision manuelle en un pipeline automatisé, bien qu'une analyse technique chinoise du lancement soutienne qu'une grande partie de ce gain provient de l'ingénierie front-end et de diarisation entourant le modèle plutôt que du modèle lui-même, donc évaluez-le sur votre propre audio avant de retirer l'étape de révision humaine. Le modèle omni l'emporte également sans conteste sur le prix pour toute charge de travail textuelle à grand volume où sa qualité de texte est adéquate, ce qu'Alibaba affirme être comparable aux modèles uniquement textuels de même taille — une affirmation non reproduite, et qui mérite d'être testée plutôt que supposée.

Qwen 3.8 l'emporte là où la sortie est jugée plutôt que comptée : raisonnement complexe, travail agentique à long horizon, travail sur du code à grande échelle, analyse de documents d'un million de tokens où la synthèse est le produit. Il l'emporte aussi sur une dimension qui n'a rien à voir avec les benchmarks — il est à poids ouverts. Si votre contrainte est la résidence des données, le déploiement sur site, le fine-tuning, ou simplement le fait de ne pas vouloir d'un fournisseur dans le chemin d'inférence, le modèle omni n'est pas du tout un candidat, et aucun avantage de prix ne comble cet écart. Cette seule contrainte détermine plus de déploiements réels que tous les chiffres ci-dessus.

Les exécuter sans deux contrats

La friction pratique dans une comparaison comme celle-ci réside rarement dans le choix du modèle ; c'est plutôt que vous finissez par intégrer deux fournisseurs, deux relations de facturation et deux ensembles de code client pour découvrir lequel vous vouliez. Qwen3.8-Max — le point de terminaison qui porte le cœur ouvert de 2,4 billions de paramètres — est disponible sur OrcaRouter sous l'identifiant de modèle qwen/qwen3.8-max, à 2,00 $ par million de jetons d'entrée et 6,00 $ par million en sortie, avec un contexte d'un million de jetons et une entrée texte, image et vidéo, aux côtés de plus de 200 autres modèles sur une seule clé au prix catalogue du fournisseur avec 0 % de marge et un basculement automatique entre fournisseurs si un point de terminaison se dégrade. Qwen3.8-Omni-Flash ne figure pas dans ce catalogue — il fonctionne sur les propres plateformes d'Alibaba — donc la configuration honnête aujourd'hui consiste à utiliser le modèle phare sur notre route et le modèle omni appelé directement, la couche de routage vous donnant un endroit où placer le perdant du test une fois que vous l'avez exécuté.

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

Le verdict

Choisissez Qwen3.8-Omni-Flash lorsque l'entrée est longue, que la sortie est courte et que le volume fait du prix unitaire la contrainte déterminante. Choisissez Qwen 3.8 lorsque l'entrée est dense, que la sortie est le produit et que l'exactitude ou le contrôle du déploiement n'est pas négociable. La zone de chevauchement — la compréhension vidéo — est le seul endroit où une véritable confrontation directe existe, et dans cette zone le modèle omni détient l'argument du coût et de la durée, tandis que le modèle phare détient celui du raisonnement et des poids ouverts. Testez les deux sur vos propres données avant de vous engager ; le modèle omni n'a pas encore d'évaluation indépendante, et un avantage tarifaire au jour du lancement est exactement le genre de chose qui mérite d'être confirmé sur une facture plutôt que sur une annonce.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement