
Qwen3.8-Omni-Flash est là : contexte de 1 M de tokens, audio 98 % moins cher, sortie texte uniquement
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Le lancement a ouvert Qwen3.8-Omni-Flash aux clients de l'API aujourd'hui, le 18 septembre 2026, et le chiffre mis en avant est une facture plutôt qu'un score. Par heure d'audio en entrée, Qwen indique que le nouveau modèle coûte 98 % de moins que son prédécesseur Qwen3.5-Omni-Plus ; par heure d'audio et de vidéo combinés, 93 % de moins. Tout le reste de l'annonce découle de ce cadrage. Qwen3.8-Omni-Flash est un modèle omni-modal natif — texte, image, audio et vidéo en entrée, un million de tokens de contexte, jusqu'à une heure entière d'audio-vidéo en continu au sein d'un seul appel — et Alibaba ne le vend pas comme un meilleur descripteur de médias, mais comme le premier modèle Qwen conçu pour agir sur eux. Le slogan est « Omni Senses. Agentic Delivery. » Le hic, énoncé sans détour dans les mêmes documents, est que le modèle ne répond qu'en texte : il entend et il regarde, mais il ne parle pas.
Rien de ce qui suit n'a été reproduit de manière indépendante. Le modèle a quelques heures, aucune évaluation tierce n'en existe encore, et chaque benchmark et chaque chiffre de prix dans les documents de lancement provient d'Alibaba lui-même. Lorsqu'un chiffre est rapporté par le fournisseur, cet article le précise dans la phrase qui le contient ; lorsqu'une lecture provient d'un critique plutôt que du fournisseur, elle est attribuée. La seule chose qui est vérifiable indépendamment aujourd'hui — que le modèle est disponible sur les plateformes d'Alibaba et non dans le catalogue de quiconque d'autre — est ce dont le lancement a le moins envie de parler.
Ce qui a réellement été livré
La fiche technique est inhabituellement épurée pour un lancement omni-modal, ce qui est en soi l'essentiel : la génération précédente de modèles omni de cette famille était assemblée à partir d'encodeurs de perception distincts greffés sur un LLM textuel, et celui-ci est construit directement sur la Qwen3.8-Flash gamme d'architecture, avec des modalités traitées nativement plutôt que greffées.
• Entrée — texte, image, audio et vidéo, avec audio spatial stéréo et à quatre canaux accepté ; la sortie est uniquement du texte.
• Contexte — un million de jetons, avec une entrée maximale d'environ 991 K (environ 983 K en mode réflexion), une sortie maximale de 131 K et un budget de raisonnement pouvant atteindre 262 K.
• Durée — jusqu'à une heure d'audio ou d'audio-vidéo en continu par appel, soit le chiffre qui rend possibles les cas d'usage de réunion et de vidéo longue sans découpage.
• Couverture vocale — reconnaissance dans 74 langues et génération vocale dans 29 langues dans l’outillage environnant ; un compte rendu en langue chinoise de la version indique 113 langues et dialectes pour l’entrée audio.
• Disponibilité — la plateforme d'IA Qianwen et Alibaba Cloud Model Studio (Bailian), sous l'identifiant d'API qwen3-8-omni-flash. Les poids ne sont pas publiés. Une variante Realtime est décrite comme le premier modèle omni-modal doté d'une localisation des sources sonores.

Le 98 % est une affirmation sur les coûts, et l’arithmétique qui la sous-tend mérite d’être examinée
Une réduction de 98 % du coût d'une heure d'audio est un chiffre bien plus important qu'une réduction de 98 % du prix d'un token, et c'est dans l'écart entre ces deux choses que l'annonce opère. Le chiffre par heure est obtenu en tarifant un échantillon de deux minutes et en multipliant par trente, avec une vidéo échantillonnée en 720p et une image par seconde. C'est une manière légitime de citer une charge de travail de production, et c'est aussi une description de ce que le modèle est invité à examiner : une image par seconde suffit à savoir ce qui a été dit et globalement ce qui s'est passé à l'écran, et est très loin de suffire pour inspecter des opérations au niveau de l'image, juger la qualité du montage ou repérer un artefact sur une seule image. Deux changements se multiplient — une véritable baisse du prix unitaire, et une politique d'échantillonnage bien plus agressive — et seul le premier est une amélioration du modèle.
Les prix unitaires eux-mêmes sont concrets. La tarification internationale est indiquée à 0,15 $ par million de jetons d'entrée, 0,016 $ par million de jetons d'entrée mis en cache, et 0,47 $ par million de jetons de sortie. La tarification nationale Bailian est indiquée à 0,8 ¥ par million pour l'entrée multimodale, contre environ 18 ¥ auparavant. Notez que les systèmes de facturation international et continental sont distincts et que les chiffres ne sont pas interchangeables ; toute personne qui les compare directement obtiendra une réponse erronée.
C'est la partie de l'annonce où le routage compte plus que d'habitude. OrcaRouter répercute le prix catalogue du fournisseur à 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur de ce type parvient à nos clients le jour même où elle est appliquée, plutôt qu'au prochain renouvellement de contrat. Une comparaison réellement vérifiable figure déjà dans notre propre catalogue : Qwen3.8-Flash, le modèle multimodal aux côtés duquel celui-ci est développé, est routable dès aujourd'hui à 0,15 $ par million de jetons d'entrée et 0,47 $ par million de jetons de sortie — le même prix catalogue qu'Alibaba annonce pour le nouveau modèle omni — et il a acheminé 2,47 milliards de jetons de trafic via notre API dans les sept jours précédant la rédaction de ce texte, ce qui donne une bonne mesure de l'appétit que ce segment a déjà. Le modèle omni lui-même n'est pas encore dans notre catalogue, et tant qu'il ne l'est pas, il tourne sur les propres plateformes d'Alibaba et nulle part ailleurs. Nous n'allons pas prétendre le contraire.
Chaque benchmark du lancement compare une seule chose
Le chiffre phare est une amélioration moyenne de plus de 26 % sur environ 30 évaluations — et chacune de ces évaluations est comparée à Qwen3.5-Omni-Plus. C'est la bonne référence pour un lancement, et une référence étroite : elle vous dit que la famille a progressé, pas où elle se situe par rapport à ce que vous payez peut-être déjà.
Les chiffres individuels, tous déclarés par les fournisseurs : WildClawBench-MM 71,0, en hausse de 36,5 points et la progression la plus importante de l'ensemble ; UniClawBench 69,6 ; AgenticVBench en hausse de 22,3 points pour atteindre 36,8 ; LongAudioSpan 82,7, en hausse de 8,3 ; OmniVideoBench 63,4, en hausse de 9,6 ; OmniCap-IF 28,2. La paire la plus frappante est la diarisation des locuteurs sur AliMeeting, où le taux d'erreur passe de 88,11 à 3,35 et le cpWER de 89,61 à 17,18 — un bond suffisamment important pour mériter un examen critique plutôt que des applaudissements. Une analyse technique chinoise du lancement soutient exactement cela, attribuant l'amélioration en grande partie à l'ingénierie du front-end et de la diarisation entourant le modèle plutôt qu'au raisonnement propre du modèle, et avertissant que le système donne l'impression d'être spécialisé dans l'écoute, avec un raisonnement vidéo approfondi comparativement plus faible. C'est l'interprétation d'un critique, et non une réplication mesurée, mais l'ampleur de l'écart justifie de garder cela à l'esprit.

L’autre chiffre à retenir n’est pas un score du tout. Dans ce qu’Alibaba appelle le mode Agentic Understanding, le modèle décide lui-même ce qu’il doit regarder et écouter plutôt que de traiter chaque image, en rassemblant des preuves par passes successives, du plus grossier au plus fin. Sur OmniVideoBench, ce mode fait passer la précision de 63,4 à 67,8 tout en réduisant le nombre de tokens par requête de 145 736 à 79 117 — soit une réduction de 45,7 %. Une précision en hausse et un coût en baisse simultanément : c’est l’affirmation la plus forte de cette annonce, et celle qui soutient le plus directement l’argumentaire agentique.
La comparaison avec Gemini est plus étroite que ne le suggère la couverture.
Le positionnement d'Alibaba est que sa capacité audio-vidéo « approche » Gemini 3.8 Flash, tandis que sa performance audio globale la surpasse. Dépouillées de leur mise en scène, les comparaisons rapportées par le fournisseur se présentent comme suit. WildClawBench-MM : 71,0 contre 58,9. SpotSoundBench : 67,2 contre 39,7. MMAU : 81,8 contre 76,9. DailyOmni : 85,1 contre 84,0. Ce sont de véritables écarts sur l'audio et sur l'usage d'outils centrés sur l'audio. Ils sont aussi sélectifs. Sur AgenticVBench, le tableau de pur raisonnement vidéo, l'ordre s'inverse — Gemini à 45,0 contre 36,8 pour Qwen — et le propre compte rendu d'Alibaba concède que Gemini mène encore plusieurs tests de compréhension vidéo. Un résumé raisonnable est que Qwen a conquis la moitié audio de l'omni et reste en retard sur la moitié vidéo, ce qui est une affirmation différente de celle que les gros titres ont reprise.
« Le premier modèle omni-modal de Qwen » a besoin d’un qualificatif
L'idée selon laquelle Qwen3.8-Omni-Flash est le premier modèle omni-modal de Qwen a largement circulé aujourd'hui et mérite qu'on soit précis, car la famille compte une entrée antérieure qui peut légitimement prétendre à ce titre. Qwen2.5-Omni, un modèle open-weight de 7B publié en mars 2025 selon une architecture Thinker-Talker, acceptait aussi en entrée du texte, des images, de l'audio et de la vidéo — et il générait de la parole ainsi que du texte. Ce qui est véritablement une première ici, c'est la native omni-modalité : un seul modèle construit sur la base Qwen3.8-Flash plutôt qu'un LLM textuel auquel sont attachés des encodeurs de perception, plus un brief de conception axé agent. Les deux affirmations sont vraies ; une seule est celle qui a été répétée. Si vous évaluez le modèle en partant du principe qu'aucun modèle omni de Qwen n'existait avant cette semaine, vous estimerez mal le chemin de mise à niveau depuis Qwen2.5-Omni, une comparaison que nous avons détaillée séparément.
C’est dans l’outillage que réside réellement l’affirmation agentique.
Deux choses ont été livrées en même temps que le modèle, et elles importent davantage que ne le suggère la fiche du modèle, car c'est elles qui transforment la perception en livraison. Qwen-MM-Pluginsest une suite de plugins multimodaux destinée aux harnais d'agents, qui offre à un agent externe la compréhension des images, de l'audio, de la vidéo et des documents, ainsi que la mémoire de longues vidéos et le montage vidéo ; elle annonce la prise en charge de Codex, Claude Code, Qwen Code, Gemini CLI et plusieurs autres, et embarque des outils nommés, dont Video2Note, qui transforme des heures de vidéo en notes PDF illustrées. Qwen-Live Harnessest un environnement d'exécution open source pour une interaction omni-modale continue en temps réel, agissant comme une couche d'ordonnancement où un utilisateur converse en direct et délègue les tâches plus lourdes à des agents en arrière-plan. Une réserve tirée de la couverture du jour du lancement : la page GitHub de Qwen-Live Harness renvoyait une erreur 404 lorsque Gigazine l'a vérifiée ; il faut donc considérer ces outils comme annoncés plutôt que vérifiés jusqu'à ce que les dépôts soient accessibles.
La phrase que le lancement enterre : elle ne parle pas.
Pour un modèle dont le prédécesseur générait de la parole, le fait que Qwen3.8-Omni-Flash soit multimodal en entrée et textuel en sortie constitue la ligne la plus lourde de conséquences de la fiche technique, et elle n'apparaît dans les documents que sous la forme d'une note de bas de page. Cela signifie que le modèle ne peut pas être intégré tel quel dans un produit parole-vers-parole. Tout doublage, agent vocal ou conversation en temps réel bâti sur lui nécessite une étape externe de synthèse vocale et, pour la vidéo, un moteur de rendu externe — c'est précisément pour cela que la suite de plugins et le banc d'essai en direct existent. La conséquence pratique, c'est un pipeline comportant plus de pièces mobiles qu'« un seul modèle omni », et une latence qu'il faut budgéter sur l'ensemble de ces éléments.
Il y a une belle démonstration de l'écart, et de ce à quoi le modèle est bon, enfouie dans la publication. Dans une expérience « modèle optimisant modèle », Qwen3.8-Omni-Flash a amélioré de manière autonome la reconnaissance du dialecte du Sichuan de Qwen2.5-Omni-3B, réduisant le taux d'erreur sur les caractères de 25,79 % à 15,30 % en l'espace de douze heures et en construisant 3 413 échantillons d'entraînement sur quatre tours. Un modèle capable de diagnostiquer et de réparer la prise en charge des dialectes d'un modèle frère plus petit fait quelque chose qu'une API de transcription ne peut pas faire. C'est cela, plutôt que le tableau des benchmarks, qui constitue l'argument le plus clair de ce que « agentique » est censé signifier ici.

Qu'est-ce qui changerait notre lecture
L’état des lieux honnête est le suivant : il s’agit d’un lancement bien spécifié, avec un argumentaire de prix convaincant, aucune évaluation indépendante, et au moins une limitation structurelle que l’annonce minimise. Trois éléments permettraient de trancher. Une entrée dans Artificial Analysis ou LMArena transformerait les chiffres du fournisseur en chiffres comparables, et il n’en existe encore aucune. Un test tiers de la réduction de 45,7 % des tokens — l’affirmation selon laquelle la précision augmente tandis que le coût baisse — confirmerait le résultat le plus utile et le moins glamour de la publication. Et une mesure indépendante de la diarisation d’AliMeeting montrerait si la baisse de 88 points est imputable au modèle ou au pipeline qui l’entoure.
D'ici là, la posture raisonnable est celle qui vaut pour tout modèle le jour de son lancement : à tester, mais pas au point de miser un chemin de production dessus. Si vous passez déjà par OrcaRouter, la démarche pratique consiste à laisser la charge de travail sur les modèles que vous avez mesurés, et à considérer Qwen3.8-Omni-Flash comme un candidat à mettre à l'épreuve face à eux sur vos propres contenus audio et vidéo plutôt que sur le tableau de benchmarks de l'un ou l'autre fournisseur. Si votre cas d'usage est l'analyse de réunions ou de médias de longue durée en chinois et en anglais, l'économie de tokens est ici suffisamment favorable pour justifier le test dès maintenant.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
