
Qwen3.8-Omni-Flash, cinq jours après : une porte, aucun poids, et les premiers scores qui ne sont pas ceux d'Alibaba
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cinq jours après que le fournisseur a ouvert Qwen3.8-Omni-Flash aux clients de l’API, le modèle n’a toujours qu’un seul foyer. Il tourne sur la plateforme Qianwen du fournisseur et sur son service cloud Bailian ; les fiches tierces apparues depuis le lancement sont des proxys devant ces mêmes points de terminaison, pas un second lieu où le modèle réside. Aucun poids n’a été publié. Les chiffres du jour du lancement — une réduction de 98 % du coût d’une heure d’audio, un gain moyen de 26 % par rapport à Qwen3.5-Omni-Plus, un million de jetons de contexte, une sortie texte uniquement — restent ceux du fournisseur et ne sont pas reproduits. Ce qui a réellement changé en cinq jours n’est pas le modèle mais le terrain autour de lui : une fine couche de scores tiers est apparue, le support des frameworks a été livré dès le jour zéro, et la comparaison que tout le monde cherche à faire se fait avec Gemini 3.8 Flash plutôt qu’avec le Qwen3.8-Flash aux côtés duquel ce modèle a été développé. Chacun de ces points mérite un examen plus attentif que celui que la couverture du lancement lui a accordé.
La porte est une bonne porte, et c'est la seule.
La disponibilité s'est élargie sans devenir plurielle. Le modèle répond à une requête au format OpenAI sans modification, ce qui signifie que le code client existant fonctionne en grande partie ; ce qui casse, c'est le point de terminaison, car les hôtes international et continental sont des services distincts avec une facturation distincte. Un code pointé vers la valeur par défaut échouera ou sera facturé dans la mauvaise devise, et l'histoire du prix à l'heure ne tient que du côté international. Les bibliothèques clientes open source ont livré un support dès le jour zéro pour le modèle, ce qui est véritablement utile et ne constitue pas non plus un second fournisseur : une bibliothèque qui parle à Bailian est un wrapper de commodité autour de la même source unique d'approvisionnement.
C'est là le risque structurel qu'il vaut la peine de nommer. Un modèle à source unique n'a aucune voie de secours. Si le point de terminaison limite le débit, se dégrade, ou qu'une région tombe en panne, il n'y a nulle part où aller, et aucun niveau de prise en charge de bibliothèque cliente n'y changera quoi que ce soit. C'est aussi pourquoi nous exposons clairement notre propre position plutôt que de laisser entendre le contraire : Qwen3.8-Omni-Flash ne figure pas dans notre catalogue. Nous ne l'hébergeons pas, et un lecteur qui s'inscrirait en s'attendant à pouvoir le router serait induit en erreur. Ce qui est routable, c'est le reste de la famille — Qwen3.8-Flash et Qwen3.8-Max sont tous deux disponibles sur notre API — et OrcaRouter répercute le prix catalogue du fournisseur avec 0 % de marge, donc lorsque la tarification omni d'Alibaba évolue, ou le jour où le modèle omni devient routable, le changement parvient aux clients le jour même plutôt qu'à la prochaine reconduction de contrat.

Les premiers scores qui ne sont pas ceux d'Alibaba sont rares, et ils ne sont pas flatteurs
Rien sur Artificial Analysis n’existe pour ce modèle, et cette absence est le titre honnête cinq jours après : les classements que tout le monde cite pour les modèles adjacents n’ont pas encore de ligne pour le modèle omni. Le vide a été comblé par autre chose. Une plateforme d’évaluation tierce a commencé à publier des exécutions sur le modèle, et son résumé vaut la peine d’être lu précisément en raison de tout ce qu’il ne dit pas. Elle rapporte une classification des e-mails avec une précision de 99,0 % (86e percentile), l’éthique à 95,0 % (23e percentile), et le raisonnement à 56,0 %, qu’elle place dans le 28e percentile et qualifie de faiblesse notable ; la vitesse se situe dans le 21e percentile, le coût dans le 58e, avec un taux de réussite global de 89 %.
Traitez ces données avec une véritable prudence, et pas seulement parce que l’échantillon est petit. La même page date la sortie du modèle au 20 septembre, deux jours après qu’Alibaba l’a rendu disponible, ne donne aucune date d’exécution pour aucun des résultats et affiche un tableau de référence vide sous un résumé qui décrit des chiffres que ce tableau ne contient pas. C’est le profil d’un harnais précoce et peu supervisé plutôt que celui d’une évaluation mesurée, et la lecture honnête est qu’il s’agit des premiers points de données non issus du fournisseur, et non des premiers fiables. Ils constituent une raison de tester le modèle vous-même, et non une raison d’en conclure quoi que ce soit. L’orientation, toutefois, concorde avec ce que les propres documents du fournisseur laissent entendre par omission : il s’agit d’un modèle de perception et de médias longs, et les classements à forte composante de raisonnement ne sont pas ce qu’il visait.
Il y a aussi un piège dans les résultats de recherche qui piégera des gens pendant les quelques prochaines semaines. Qwen 3.8, le modèle textuel, affiche un indice d'intelligence Artificial Analysis dans les quarante, et ce chiffre a été cité dans plus d'un résumé comme s'il décrivait le modèle omni. Ce n'est pas le cas. Ce sont des modèles différents qui ont des rôles différents, et le modèle omni n'a encore aucun indice du tout.

Le tableau comparatif reste un seul fournisseur qui se compare à lui-même
Le chiffre de lancement — une amélioration moyenne de plus de 26 % sur environ trente évaluations — est entièrement mesuré par rapport à Qwen3.5-Omni-Plus. Cela vous dit que la famille a progressé. Cela ne vous dit pas où se situe le modèle par rapport à tout ce que vous payez peut-être déjà, et les comparaisons sélectives qui ont circulé à côté ne comblent pas l'écart non plus. Le tableau rapporté par le fournisseur face à Gemini 3.8 Flash est une véritable victoire sur les classements audio et une défaite sur ceux qui mesurent le travail vidéo agentique : WildClawBench-MM 71,0 contre 58,9 et SpotSoundBench 67,2 contre 39,7 d'un côté, AgenticVBench 36,8 contre 45,0 et OmniGAIA 74,0 contre 78,6 de l'autre. La formulation de synthèse d'Alibaba elle-même — performance audio-vidéo « approchant » Gemini, performance audio globale la dépassant — est plus prudente que les gros titres qu'elle a produits, et la version prudente est la version exacte.
• Contexte — 1 M de tokens, avec environ 991 K d’entrée maximale (environ 983 K en mode réflexion) et 131 K de sortie maximale.
• Modalité — texte, image, audio et vidéo en entrée ; texte en sortie uniquement. Pas de génération de parole dans le modèle de base.
• Durée — jusqu'à une heure d'audio ou d'audio-vidéo en continu par appel, ce qui rend possible le traitement de réunions et de médias longs sans segmentation.
• Couverture linguistique — reconnaissance de 74 langues ainsi que de 39 dialectes chinois dans les supports de lancement, avec des chiffres plus larges (113 langues et dialectes) cités ailleurs pour l’entrée audio.
• Détail d’entrée — audio spatial stéréo et à quatre canaux accepté, la variante Realtime étant décrite comme le premier modèle omni-modal capable de localiser une cible grâce au son qu’elle émet.
• Prix — 0,15 $ par million de jetons d'entrée, 0,016 $ en cache, 0,47 $ en sortie côté international, et une grille tarifaire distincte pour la Chine continentale qui n'est pas comparable.
Les 98 % sont réels, et ce n’est pas votre facture.
Selon la propre méthodologie d'Alibaba — un échantillon de deux minutes multiplié par trente, vidéo échantillonnée en 720p et à une image par seconde —, une heure d'entrée audio passe de 0,28 $ à moins de 0,01 $, et une heure d'audio et de vidéo combinés, de 3,27 $ à 0,20 $. Ce sont des réductions importantes, précises et rapportées par le fournisseur, et elles portent sur un seul poste de dépense. Le calcul qui compte, c'est la part que ce poste représente dans votre charge de travail. Un pipeline qui dépense la majeure partie de ses tokens en sortie, en contexte mis en cache ou en images vidéo échantillonnées plus densément qu'une par seconde verra une variation en pourcentage bien plus faible sur la facture que ce que promet le titre, et le titre concerne l'audio en entrée, pas le total. Ajoutez la sortie texte seule et l'écart se creuse encore : tout ce qui doit répondre par la voix nécessite un second modèle, et ce modèle est facturé séparément.
Voici la partie du tableau où le routage justifie sa place. La valeur d'un routeur pass-through ne réside pas dans une remise — elle réside dans le fait que c'est la grille tarifaire du fournisseur lui-même que vous payez, et qu'une charge de travail peut être répartie sur plusieurs modèles, de sorte qu'un modèle à source unique soit un composant plutôt qu'une dépendance. Un modèle omni qui est la seule chose que vous pouvez appeler constitue un point de défaillance unique, tant au niveau de la disponibilité que de la tarification.

Ce que cinq jours de production vous diraient réellement
Trois choses permettraient de trancher les questions en suspens. Une mesure indépendante du résultat de diarisation sur AliMeeting — un taux d'erreur passant de 88,11 à 3,35 et un cpWER de 89,61 à 17,18 — montrerait si cela revient au modèle ou à l'ingénierie de diarisation et de front-end qui l'entoure, à laquelle au moins une analyse technique chinoise attribue l'essentiel du gain. Un test reproduit de la réduction des tokens du mode agentique, où la précision est passée de 63,4 à 67,8 sur OmniVideoBench tandis que les tokens par requête tombaient de 145 736 à 79 117, confirmerait l'affirmation la plus utile de la publication : que le modèle peut devenir meilleur et moins cher en même temps. Et une ligne dans Artificial Analysis ou dans une arène transformerait chaque chiffre fournisseur ci-dessus en quelque chose de comparable, ce qui est la condition préalable pour que le modèle soit choisi plutôt qu'essayé.
D'ici là, la position qui a du sens est celle qui s'applique à tout modèle vieux de cinq jours avec un seul hôte et aucune évaluation indépendante : il vaut la peine de le mesurer sur vos propres contenus audio et vidéo, mais pas d'en faire le seul chemin à travers votre pipeline. Si votre charge de travail correspond à l'analyse de réunions ou de médias de longue durée en chinois ou en anglais et que vos coûts sont dominés par les heures d'entrée plutôt que par les tokens de sortie, l'économie ici est suffisamment solide pour justifier un test cette semaine. Si votre charge de travail nécessite une sortie vocale, ou nécessite une solution de repli lorsqu'un fournisseur se dégrade, le modèle tel qu'il est aujourd'hui ne peut pas être la réponse complète — et aucune prise en charge de framework au jour zéro, quelle qu'en soit l'ampleur, n'y changera rien.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
