Une carte de titre principale pour la comparaison « Qwen3.8-Omni-Flash vs Qwen2.5-Omni », avec le surtitre « Dix-huit mois d’écart - mars 2025 à septembre 2026 », le sous-titre « Trente fois plus de contexte, une heure de médias au lieu de quelques secondes - et la seule chose que l’ancien modèle pouvait faire que le nouveau ne peut pas », et trois puces statistiques indiquant « Contexte : 32K à 1M », « Médias par appel : de quelques secondes à 1 heure » et « Sortie vocale : modèle 2025 uniquement ».
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni : 18 mois plus tard, la mise à niveau a perdu sa voix

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici le fait qui rend cette comparaison plus intéressante qu'une simple mise à jour générationnelle. L'ancien modèle peut parler, et le nouveau ne le peut pas. Qwen2.5-Omni, sorti en mars 2025, prenait en entrée du texte, des images, de l'audio et de la vidéo, et répondait en texte ou en parole naturelle en flux continu, au sein d'un seul modèle de bout en bout qu'il était possible de télécharger. Qwen3.8-Omni-Flash, publié le 18 septembre 2026, prend en charge ces mêmes quatre modalités sur une fenêtre de contexte trente fois plus grande, ingère une heure d'audio-vidéo en continu là où son ancêtre n'en traitait que quelques secondes, et ne renvoie que du texte. Dix-huit mois de travail ont permis d'absorber beaucoup plus de données en entrée, au prix de l'abandon du canal de sortie. Savoir s'il s'agit d'un progrès ou d'un compromis dépend entièrement de l'usage que vous faisiez de l'ancien modèle — et la réponse se divise nettement en deux.

Les chiffres pour Qwen2.5-Omni sont ceux du fournisseur, issus de ses documents de lancement de mars 2025, et dix-huit mois de large déploiement les ont partiellement validés. Les chiffres pour Qwen3.8-Omni-Flash sont également ceux d'Alibaba, issus de documents de lancement publiés quelques heures avant la rédaction de cet article, et rien en eux n'a été reproduit de manière indépendante. Lorsqu'une affirmation provient d'un critique plutôt que du fournisseur, elle est attribuée comme telle. Le seul fait structurel qui n'a pas besoin d'être vérifié est aussi le plus lourd de conséquences : Qwen2.5-Omni est à poids ouverts et téléchargeable, et Qwen3.8-Omni-Flash ne l'est pas.

Ce qu’était Qwen2.5-Omni, et pourquoi c’était important

Lors de sa sortie le 26 mars 2025, Qwen2.5-Omni était le premier modèle omni-modal de bout en bout de la famille — la publication le présentait comme la réponse au problème du « zoo de spécialistes », où la transcription, la vision et la voix nécessitaient chacune un modèle distinct et une couche de liaison distincte. Le modèle 7B gérait les quatre modalités d'entrée ainsi que la sortie texte et parole, revendiquait des résultats de pointe sur le benchmark de fusion OmniBench, devant Gemini-1.5-Pro, et rapportait un score de qualité de génération de parole de 4,51 qu'Alibaba qualifiait de niveau humain. Une variante 3B reprenait la même architecture.

L'ingénierie qui l'a fait fonctionner mérite d'être nommée, car le nouveau modèle ne l'utilise pas. Thinker-Talker répartissait le travail en deux : un transformer Thinker fusionnait les encodeurs audio et image et produisait la sémantique et le texte, tandis qu'un Talker diffusait en flux des tokens vocaux à partir des états cachés du Thinker, en partageant l'intégralité de l'historique conversationnel. Le RoPE multimodal aligné dans le temps (TMRoPE) entrelaçait les positions vidéo et audio afin que les deux flux restent synchronisés. Le streaming par blocs permettait aux encodeurs d'effectuer la perception pendant que le modèle de langage traitait de longues séquences, ce qui rendait possibles des réponses vocales à faible latence. Deux voix fixes étaient fournies avec : Chelsie et Ethan.

Les contraintes étaient tout aussi réelles. Le contexte était de 32 768 jetons. La mémoire était la limite contraignante bien plus que le calcul : les tableaux d'Alibaba eux-mêmes chiffrent l'inférence BF16 avec FlashAttention-2 à environ 31 Go de mémoire GPU pour une vidéo de 15 secondes, 42 Go pour 30 secondes et 60 Go pour une minute complète. Une minute de vidéo, sur un modèle 7B, sur l'un des plus grands GPU individuels que l'on pouvait louer. C'est ce chiffre qu'il faut garder en vue, car c'est le chiffre que le modèle de 2026 a été conçu pour détruire.

Ce qu'est Qwen3.8-Omni-Flash

Le nouveau modèle est nativement omni-modal plutôt qu'assemblé — construit directement sur la base Qwen3.8-Flash, une gamme d'architecture, plutôt que comme un LLM textuel auquel on a greffé des encodeurs de perception, ce qui constitue une différence structurelle et non une simple étiquette de génération. Il accepte du texte, des images, de l'audio et de la vidéo, y compris l'audio stéréo et spatial à quatre canaux, et renvoie du texte sur un contexte d'un million de jetons avec environ 991 K d'entrée maximale, 131 K de sortie maximale et un budget de raisonnement de 262 K. Il gère jusqu'à une heure d'audio-vidéo continue par appel. La reconnaissance vocale couvre 74 langues, la génération vocale sur 29 langues étant prise en charge dans l'outillage environnant plutôt que par le modèle. Il est disponible sur la plateforme Qianwen AI et Alibaba Cloud Model Studio sous l'identifiant qwen3-8-omni-flash, à 0,15 $ par million de jetons d'entrée et 0,47 $ par million de jetons de sortie, avec l'entrée mise en cache à 0,016 $.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Dix-huit mois, dimension par dimension

• Contexte — Qwen2.5-Omni 32 768 tokens contre Qwen3.8-Omni-Flash à un million, soit environ trente fois plus.

Durée des médias — secondes de vidéo, limitée par la mémoire GPU, contre une heure d’audio-vidéo en continu dans un seul appel hébergé.

• Sortie — texte plus parole naturelle en streaming sur l'ancien modèle ; texte uniquement sur le nouveau.

• Déploiement — Qwen2.5-Omni est proposé en poids ouverts sous Apache-2.0, téléchargeable depuis Hugging Face et ModelScope ; Qwen3.8-Omni-Flash est uniquement accessible via API, aucune publication de poids n'ayant été annoncée.

• Matériel — 7 milliards de paramètres nécessitant jusqu'à ~60 Go de mémoire GPU pour une minute de vidéo, par rapport à un point de terminaison hébergé que vous ne provisionnez pas du tout.

• Prix — l’ancien modèle vous coûte un GPU ; le nouveau coûte 0,15 $ par million de jetons d’entrée, et Alibaba affirme que l’entrée audio par heure est 98 % moins chère que la génération Qwen3.5-Omni-Plus qu’il remplace.

• Génération vocale — deux voix fixes en 2025, contre 29 langues de génération vocale dans les outils de 2026, sans qu’aucune ne soit produite par le modèle lui-même.

Le trade dont personne n'a fait la promotion

Lisez les deux fiches techniques ensemble et la silhouette des dix-huit derniers mois devient claire. Alibaba a passé l'intervalle à résoudre l'ingestion — quelle quantité de médias un modèle peut absorber, à quel coût, et quelle part de la décision il peut prendre lui-même. Qwen3.8-Omni-Flash est un triomphe sur cet axe. Le mode Agentic Understanding, dans lequel le modèle choisit ce qu'il échantillonne au lieu de traiter chaque image, réduit le nombre de tokens par requête de 145 736 à 79 117 tout en faisant passer la précision sur OmniVideoBench de 63,4 à 67,8, et le fournisseur rapporte que l'erreur de diarisation des locuteurs sur AliMeeting s'effondre de 88,11 à 3,35.

Ce que l’intervalle n’a pas priorisé, c’est la sortie. La prouesse caractéristique du modèle 2025 — un seul modèle qui vous entend et vous répond à voix haute, de bout en bout, sans synthétiseur vocal séparé — n’a pas de successeur ici. Si vous avez bâti un agent vocal, un pipeline de doublage ou un outil d’accessibilité sur le Talker de Qwen2.5-Omni, le modèle 2026 n’est pas une mise à niveau de celui-ci ; c’est un composant auquel il vous faudrait greffer une nouvelle étape de synthèse vocale, ce qui ajoute de la latence et un fournisseur à un pipeline qui n’avait ni l’un ni l’autre. Les documents de lancement sont honnêtes à ce sujet si vous lisez attentivement la ligne des modalités, mais ce n’est pas le titre principal, et quiconque migre en supposant que « omni » signifie la même chose dans les deux versions découvrira la différence en production.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Pourquoi le modèle 2025 a encore un emploi

Trois raisons, et aucune n'est de la nostalgie. La première, c'est la voix, comme ci-dessus. La deuxième, ce sont poids ouverts : 32K de contexte et une empreinte de 7B tourneront sur du matériel que vous contrôlez, hors ligne, sans qu'aucune donnée ne quitte les locaux et sans compteur par token — la seule option si votre audio est soumis à une règle de résidence des données ou si votre budget de latence interdit un aller-retour. La troisième, c'est le coût à très faible volume. Un GPU que vous possédez déjà est gratuit à la marge ; le modèle hébergé à 0,15 $ par million de tokens est bon marché, mais pas gratuit, et le coût fixe de provisionnement pour l'exploiter est bien réel pour une charge de travail qui ne tourne que deux fois par semaine.

L'objection est que les contraintes de l'ancien modèle se font plus durement sentir chaque année. Une minute de vidéo, 32 K de contexte, et l'absence d'appel d'outils ou de sortie structurée dans un monde où les agents sont la forme de déploiement par défaut constituent une enveloppe étroite. Pour un pipeline qui doit ingérer des réunions enregistrées, Qwen3.8-Omni-Flash n'est pas seulement meilleur — c'est la différence entre possible et impossible, car le modèle de 2025 ne peut physiquement pas contenir l'entrée.

Il vaut la peine d’être concret sur la vitalité qui reste aux anciens poids, car « legacy » les sous-estime. Le Qwen2.5-Omni-7B a enregistré, selon le dépôt, 343 676 téléchargements au cours du dernier mois lorsque nous l’avons consulté le 18 septembre 2026, avec environ une centaine de Spaces communautaires et des dizaines de fine-tunes, d’adaptateurs et de quantifications construits par-dessus. Quoi que fasse le modèle phare, une large population de personnes continue de livrer sur le modèle 2025 — et, notamment, Hugging Face ne listait aucun fournisseur d’inférence le déployant, ce qui signifie que presque tout cet usage est auto-hébergé.

Le nouveau modèle améliore l'ancien

Le détail le plus étrange et le plus convaincant de ce lancement est enfoui près de la fin des documents. Dans une expérience qu'Alibaba décrit comme un modèle optimisant un modèle, Qwen3.8-Omni-Flash a amélioré de manière autonome la reconnaissance vocale du dialecte du Sichuan de Qwen2.5-Omni-3B — le petit frère du modèle qu'il est censé remplacer — réduisant le taux d'erreur sur les caractères de 25,79 % à 15,30 % en douze heures et en construisant 3 413 échantillons d'entraînement en quatre cycles.

C'est un meilleur argument en faveur du modèle le plus récent que n'importe quel benchmark de la version publiée, et cela recadre la relation entre les deux. Le modèle 2026 n'est pas seulement un remplacement de celui de 2025 ; c'est un outil qui améliore les poids de 2025. Si vous exécutez Qwen2.5-Omni en production pour une langue ou un dialecte qu'il gère mal, la voie pratique peut être de conserver le déploiement et d'utiliser le nouveau modèle pour générer les données d'entraînement, plutôt que de migrer la charge de travail. Notez toutefois qu'il s'agit d'une démonstration rapportée par le fournisseur, sans méthodologie publiée, et qu'elle doit être traitée comme une anecdote encourageante plutôt que comme une recette reproductible.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Si vous migrez

La décision se résume rarement à un seul modèle. Une équipe qui quitte un modèle omni auto-hébergé choisit entre trois configurations : rester sur des poids ouverts et continuer à provisionner, passer à une API de fournisseur et renoncer au contrôle, ou répartir la charge de travail pour que seule la partie qui nécessite une entrée d’un million de jetons aille au modèle hébergé. Cette troisième option est généralement la bonne, et c’est aussi celle que les gens oublient, parce qu’elle semble demander plus de travail qu’elle n’en demande réellement — le fine-tuning dialectal sur lequel vous avez passé un mois n’a pas à être jeté parce que l’étape de résumé de réunion a migré.

Là où le routage est utile, c'est aux jointures. OrcaRouter vous donne une seule clé pour plus de 200 modèles, avec 0 % de marge sur le prix catalogue des fournisseurs et un basculement automatique en cas de dégradation d'un endpoint, ce qui signifie que la moitié hébergée d'un pipeline scindé n'a pas besoin de son propre contrat, de son propre code client ni de sa propre supervision avant même de savoir si la charge de travail justifie tout cela. Soyons clairs sur ce que nous ne faisons pas : aucun des deux modèles omni ne figure dans notre catalogue — tous deux s'exécutent sur les plateformes d'Alibaba ou sur votre propre matériel — il s'agit donc d'une décision de routage que vous prenez autour des modèles, et non par notre intermédiaire.

Qui devrait bouger, et qui ne devrait pas

Migrez si votre charge de travail porte sur de l’audio ou de la vidéo de longue durée, si 32K de contexte est ce qui empêche un pipeline d’exister, si vous avez besoin d’un comportement agentique sur des médias, ou si la diarisation des locuteurs à grande échelle est le problème auquel vous êtes confronté. Restez si vous avez besoin que le modèle parle, si votre audio ne peut pas quitter votre infrastructure, si vous dépendez des poids spécifiques de Qwen2.5-Omni que vous avez déjà ajustés, ou si votre volume d’appels est suffisamment faible pour qu’un GPU que vous possédez l’emporte sur une facturation à l’usage.

Le résumé inconfortable, c'est qu'il s'agit moins d'un remplacement que d'une bifurcation au sein de la gamme de produits. Alibaba a passé dix-huit mois à construire le meilleur modèle d'entrée possible et n'a pas construit de successeur pour la moitié consacrée à la sortie. Si votre travail se situe du côté de l'entrée, la mise à niveau est quasi obligatoire. S'il se situe du côté de la sortie, le modèle 2025 reste la chose la plus récente qui fasse ce dont vous avez besoin — et cela vaut la peine de le savoir avant de planifier une migration qui supprimerait discrètement une capacité dont vous dépendez.