
Qwen3.8-Omni-Flash vs InternLumina U2 : Sens loués contre poids possédés
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La bonne façon de comparer Qwen3.8-Omni-Flash et InternLumina U2 n'est pas de comparer des lignes de benchmarks, car ils ne figurent pas dans les mêmes. C'est de se demander à qui il est permis de les exécuter. Celui du fournisseur, Qwen3.8-Omni-Flash, ouvert aux clients de l'API depuis le 18 septembre 2026, est un modèle fermé sur les plateformes propres du fournisseur : un million de jetons de contexte, jusqu'à une heure d'audio et de vidéo en continu par appel, une sortie texte uniquement, et aucun poids. Quant à celui du Shanghai AI Laboratory, InternLumina U2, c'est un modèle de diffusion à mélange d'experts 16B-A1B sous Apache 2.0, dont les checkpoints Ascend sont téléchargeables dès maintenant depuis Hugging Face, les checkpoints NVIDIA et le rapport technique étant toujours annoncés comme à venir. L'un est un service que l'on loue au jeton. L'autre est un fichier que l'on peut détenir, avec une réserve quant au matériel sur lequel il tourne actuellement. Cette différence détermine plus de déploiements réels que n'importe quel score dans le tableau de l'un ou l'autre fournisseur.
Ce qu'est réellement InternLumina U2
L'architecture est la partie intéressante, et elle est véritablement inhabituelle. InternLumina U2 est un MoE clairsemé avec 16 milliards de paramètres au total et 1 milliard actifs, et c'est un modèle de langage à diffusion plutôt qu'autorégressif — il affine une séquence entière en parallèle au lieu d'émettre des tokens de gauche à droite. Sa représentation visuelle est entièrement discrète : huit codebooks de tokens visuels construits sur l'AToken d'Apple, ce qui permet à un seul modèle à la fois de lire une image et d'en produire une sans décodeur séparé greffé à la fin. La réponse à des questions textuelles, la génération texte-vers-image, la compréhension d'images, l'édition d'images, la compréhension vidéo et la compréhension 3D sont toutes le même modèle effectuant le même type de travail sur le même vocabulaire.
• Taille et forme — InternLumina U2 totalise 16B de paramètres, dont 1B actifs, en MoE clairsemé ; le nombre de paramètres de Qwen3.8-Omni-Flash n’est pas divulgué.
• Génération — InternLumina U2 génère et édite des images et gère la compréhension 3D ; Qwen3.8-Omni-Flash ne génère aucun média du tout et renvoie du texte.
• Décodage — InternLumina U2 est un LLM de diffusion qui décode en parallèle ; Qwen3.8-Omni-Flash est autorégressif.
• Contexte et durée — Qwen3.8-Omni-Flash dispose d'une fenêtre de 1M de tokens et peut traiter jusqu'à une heure d'audio-vidéo continu en un seul appel ; les documents publiés d'InternLumina U2 ne mentionnent rien de tout cela, et l'audio long format ne figure pas parmi ses capacités répertoriées.
• Poids — InternLumina U2 est sous Apache 2.0, avec des checkpoints Ascend publiés et des checkpoints NVIDIA en attente ; Qwen3.8-Omni-Flash n’a pas de poids et aucun plan annoncé pour en proposer.
• Comment l’obtenir — InternLumina U2 est un téléchargement depuis Hugging Face avec le code d’inférence sur GitHub ; Qwen3.8-Omni-Flash est un appel API à Alibaba Cloud Model Studio ou à la plateforme Qianwen.
• Scores indépendants — aucun pour l’un ou l’autre. La fiche d’InternLumina U2 elle-même qualifie son tableau de benchmarks de « résultats préliminaires, partiels » ; ceux de Qwen sont tous comparés à son propre prédécesseur et non reproduits.

La question des poids a évolué depuis la couverture de l’aperçu.
Si vous avez lu notre précédent article sur InternLumina U2 au moment où le code est apparu pour la première fois, la situation a évolué dans un sens et est restée inchangée dans un autre, et ces deux aspects comptent. Le dépôt Hugging Face n'est plus un simple squelette : le ascend/ dossier contient désormais sept shards safetensors ainsi que la configuration, le tokenizer et le code de modélisation, ce qui signifie que le modèle est réellement téléchargeable et exécutable par quiconque dispose du matériel adéquat. Le nvidia/ dossier, lui, est toujours annoncé comme « bientôt disponible », le rapport technique est toujours à venir, et la section des benchmarks du dépôt lui-même indique encore « résultats préliminaires et partiels ». L'affirmation exacte aujourd'hui n'est donc pas « les poids sont disponibles » ni « les poids sont absents » — c'est que les checkpoints d'une pile matérielle sont publiés et pas ceux de l'autre, ce qui constitue une véritable contrainte pour quiconque travaille sur un cluster NVIDIA.
Deux autres choses ont évolué discrètement. Le dépôt GitHub a continué de recevoir des commits bien après la sortie initiale du 1er septembre, ce qui signifie que le code publié est maintenu plutôt que laissé à l’abandon. Et le compteur de téléchargements du dépôt Hugging Face affiche toujours zéro, ce qui en dit moins sur le modèle que sur le public visé : un modèle de diffusion 16B-A1B avec des checkpoints Ascend-first s’adresse à un laboratoire, pas à une équipe produit à la recherche d’un point de terminaison hébergé ce trimestre.
Là où les deux se recoupent véritablement, et là où ils ne se recoupent pas.
La compréhension d'images est le point d'intersection, et elle est plus étroite qu'elle n'y paraît. Les deux modèles peuvent regarder une image et répondre à des questions à son sujet, ce qui constitue l'intégralité du travail de Qwen3.8-Omni-Flash et l'une des six tâches de InternLumina U2. Tout ce qui va au-delà diverge radicalement. InternLumina U2 peut ensuite modifier cette image ou en générer une nouvelle à partir d'une invite, au sein du même modèle, en utilisant le même vocabulaire visuel que celui qu'il a employé pour la lire. Qwen3.8-Omni-Flash ne peut pas produire un seul pixel, mais il acceptera une heure d'audio et de vidéo en un seul appel et vous dira qui a parlé, quand, et ce qui a été décidé — ce que les documents publiés d'InternLumina U2 ne prétendent pas faire du tout.
Le chevauchement qui compte moins qu’on ne le suppose est la vidéo. Les deux sont décrits comme traitant de la vidéo, mais ils en font des choses différentes : l’un consiste à comprendre un long enregistrement comme un document, l’autre à traiter la vidéo comme une modalité visuelle aux côtés de la 3D. Une équipe qui a besoin qu’une heure de séquences soit résumée n’est pas servie par le second, et une équipe qui a besoin qu’une image soit générée n’est pas servie par le premier.

Coût, contrôle et ce que vous achetez réellement
La comparaison des prix ne porte pas sur des choses de même nature. Qwen3.8-Omni-Flashfacture au token — 0,15 $ par million en entrée, 0,016 $ en cache, 0,47 $ en sortie sur la grille internationale, avec une grille tarifaire distincte pour la Chine continentale qui n'est pas comparable — et son annonce de lancement était une réduction de plus de 98 % rapportée par le fournisseur sur le coût d'une heure d'entrée audio, calculée en tarifant un échantillon de deux minutes et en le multipliant par trente, avec une vidéo échantillonnée en 720p et une image par seconde. InternLumina U2ne facture rien, parce qu'il n'y a rien à facturer : le coût, c'est votre matériel et votre temps, et la fiche du modèle lui-même ne publie pas de chiffre de débit qui vous permettrait de convertir cela en un nombre par token.
Voilà le compromis en une ligne. L’API vous offre une capacité que vous ne pouvez pas héberger et un coût horaire qui évolue avec l’usage ; les poids ouverts vous donnent un coût fixe et un contrôle total sur le chemin des données, au prix d’une pile d’inférence que vous devez construire et d’un ensemble de checkpoints qui, aujourd’hui, implique du matériel Ascend. Pour les charges de travail réglementées où les contenus multimédias ne peuvent pas quitter le bâtiment, la seconde n’est pas une préférence — c’est la seule option sur cette page. Pour une équipe qui a besoin d’analyser de longs contenus audio ce mois-ci, la première est la seule option sur cette page.
OrcaRouter n'héberge aujourd'hui aucun de ces deux modèles, et nous préférons le dire franchement plutôt que de laisser entendre qu'il existe une route qui n'existe pas : Qwen3.8-Omni-Flash ne tourne que sur les plateformes propres d'Alibaba, et InternLumina U2 est un téléchargement plutôt qu'un endpoint. Ce que nous faisons tourner, c'est le reste de la gamme Qwen3.8 — Qwen3.8-Flash et Qwen3.8-Max — via une seule API au prix catalogue du fournisseur avec 0 % de marge, ce qui est la façon pratique de conserver une base de référence fonctionnelle pour le versant à modèles fermés de cette comparaison, pendant que le versant à poids ouverts met encore de l'ordre dans ses checkpoints NVIDIA.

Lequel vous devriez réellement choisir
Choisissez InternLumina U2 si vous avez besoin d'un seul modèle qui lit, génère et édite des images et que vous êtes prêt à assumer vous-même la pile d'inférence — et si vos accélérateurs sont Ascend, ou si vous pouvez attendre les checkpoints NVIDIA. C'est le seul des deux modèles capable de créer une image, et le seul que vous pouvez exécuter sans envoyer de données à un fournisseur. Considérez ses chiffres de benchmark comme non prouvés jusqu'à la publication du rapport technique, car la fiche du modèle dit exactement cela.
Choisissez Qwen3.8-Omni-Flash si votre problème porte sur des heures d'audio et de vidéo plutôt que sur des pixels en sortie — intelligence de réunion, analyse de longs enregistrements, travail agentique à forte composante audio en chinois et en anglais — et si vous pouvez accepter une dépendance à une source unique et une sortie texte uniquement. Son argumentaire de coût est solide sur les heures d'audio en entrée et bien plus faible sur la facture totale, ses benchmarks sont rapportés par le fournisseur et non reproduits, et les premiers essais tiers à paraître le situent au 28e percentile en raisonnement, sur un échantillon suffisamment petit pour qu'il incite à un test plutôt qu'à une décision.
Si vous avez besoin des deux, ils sont complémentaires, pas alternatifs : un modèle d'image à poids ouverts que vous hébergez et un modèle fermé pour médias longs que vous appelez. Aucun des deux n'est routable via nous aujourd'hui. Ce qu'il faut surveiller, d'un côté, c'est le checkpoint NVIDIA et le rapport technique ; de l'autre, la première évaluation indépendante, qui n'existe pas encore et qui constitue la plus grande lacune dans tout ce qui a été écrit sur Qwen3.8-Omni-Flash jusqu'à présent.
