
Qwen3.8-LiveTranslate vs Qwen 3.8 : une collision de dénomination, pas un combat équitable
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Recherchez l'un de ces modèles et l'autre vous sera proposé. Qwen3.8-LiveTranslate, publié le 19 septembre 2026, et Qwen3.8-Max — le modèle que la plupart des gens désignent lorsqu'ils écrivent « Qwen 3.8 » sans suffixe, généralement disponible depuis le 3 août 2026 et actualisé sous le nom de Qwen3.8-Max-0902 le 2 septembre — partagent un préfixe de génération et presque rien d'autre. L'un est un système d'interprétation simultanée qui prend de l'audio en entrée et renvoie de l'audio traduit et du texte en sortie, facturé via WebSocket sous l'ID qwen3.8-livetranslate-flash-realtime. L'autre est un généraliste à mélange d'experts clairsemé de 2,4 billions de paramètres, doté d'une fenêtre de contexte de 1 M de jetons, qui ne peut rien entendre du tout. Les comparer frontalement relève de l'erreur de catégorie, et le fait que tant de gens commettent cette erreur est le véritable sujet ici : l'éditeur propose désormais au moins quatre choses distinctes sous le nom Qwen 3.8, et le schéma de nommage ne vous dit pas laquelle vous voulez.
Ce que chacun est réellement
La génération Qwen 3.8 a été déployée par couches tout au long du second semestre 2026, et ces couches ne sont pas interchangeables.
Qwen3.8-Max est le modèle phare hébergé : un modèle MoE creux totalisant environ 2,4 billions de paramètres, dont environ 95 milliards actifs par passe avant, avec un contexte d'un million de tokens et une entrée texte, image et vidéo pour une sortie texte uniquement. Il est facturé 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie, les lectures de cache étant à 0,250 $ par million. Les scores rapportés par le fournisseur le placent à 86,6 sur Terminal-Bench 2.1, 92,6 sur GPQA Diamond, 67,7 sur SWE-bench Pro et 43,6 sur Humanity's Last Exam.
Qwen3.8-2.4T-A95B est la version open-weight de la même génération, publiée le 12 août 2026 : 512 experts routés répartis sur 92 couches, dont 69 de ces couches utilisant l'attention linéaire, et environ 4,89 To de poids. C'est le modèle que la plupart des gens désignent par « Qwen 3.8 » lorsqu'ils parlent d'exécuter quelque chose eux-mêmes plutôt que d'appeler une API.
Qwen3.8-27B est le petit checkpoint ouvert de la même famille, et Qwen3.8-LiveTranslate est le spécialiste — un interprète à architecture Interleave, construit sur une conception hybride MoE Thinker–Talker, avec 60 langues sources reconnues et 29 disponibles pour la restitution vocale.
L’axe qui les sépare n’est pas la taille. C’est la modalité. Qwen3.8-Max n’a aucune voie d’entrée audio et absolument aucune sortie audio. Lui demander d’interpréter une conversation en direct ne relève pas d’une meilleure formulation de la consigne ; la capacité ne se trouve pas dans le modèle.
Le contraste de spécification
Placés côte à côte, les deux modèles ne se recoupent sur presque aucune des dimensions qui comptent pour un acheteur :
• Tâche principale — Qwen3.8-LiveTranslate : interprétation simultanée de parole à parole. Qwen3.8-Max : raisonnement général, programmation, travail textuel agentique et multimodal.
• Modalité d'entrée — Qwen3.8-LiveTranslate : audio et image. Qwen3.8-Max : texte, image et vidéo.
• Modalité de sortie — Qwen3.8-LiveTranslate : texte et audio synthétisé. Qwen3.8-Max : texte uniquement.
• Fenêtre de contexte — Qwen3.8-LiveTranslate : 53 248 jetons (49 152 en entrée / 4 096 en sortie). Qwen3.8-Max : 1 000 000 jetons.
• Poids — Qwen3.8-LiveTranslate : fermé, API uniquement. Qwen3.8-Max : hébergé, avec son pendant ouvert Qwen3.8-2.4T-A95B publié dans la même génération.
• Limites de débit — Qwen3.8-LiveTranslate : 10 requêtes et 100 000 jetons par minute. Qwen3.8-Max : débit hébergé standard, aucun plafond temps réel par requête.
C’est la disparité de contexte qui surprend les gens. Qwen3.8-Max dispose d’un million de tokens ; l’interprète n’en a qu’environ cinq pour cent. Mais un interprète en temps réel n’a pas besoin d’un contexte long — il a besoin d’une mémoire courte et très rapide. Son plafond d’entrée de 49 152 tokens est calibré pour conserver les dernières minutes d’une conversation et ainsi garder les noms et la terminologie cohérents, ce qui est exactement le travail que fait la « désambiguïsation à long contexte ». Juger l’interprète sur son chiffre de contexte revient à juger un moteur de course sur son réservoir de carburant.

Pourquoi la comparaison des prix est un piège
Rapporté au million de tokens, l’interprète semble nettement plus cher que le modèle phare : 7,50 $ par million de tokens d’entrée audio contre 2,00 $ par million de tokens d’entrée texte, et 30,00 $ par million de tokens de sortie audio contre 6,00 $ par million de tokens de sortie texte.
Cette comparaison n’a aucun sens, et c’est de loin l’erreur la plus fréquente commise à propos de cette classe de modèles. Les jetons audio et texte ne sont pas la même unité. La parole est encodée en jetons audio à une densité qui n’a aucun rapport avec celle du même contenu à l’écrit — une minute de conversation consomme bien plus de jetons audio que sa transcription ne consomme de jetons texte, et l’audio de sortie ajoute un second flux par-dessus. Présenter les deux taux côte à côte implique un rapport de coûts qui n’existe pas en pratique.
La différence structurelle compte davantage que la différence de prix. Qwen facture l’interprète au token, tandis qu’une grande partie du marché de la parole en temps réel facture à la minute de session. Ces deux modèles de tarification se comportent de manière totalement différente lorsque le volume de votre audio baisse, que vos sessions raccourcissent ou que vos intervenants marquent des pauses — un compteur à la minute facture le silence, et un compteur au token non. Si vous élaborez un modèle de coûts, la question n’est pas de savoir quel tarif est le plus bas ; c’est de savoir quel compteur pénalise la forme de votre usage. Et notez la répartition par région : la tarification de Pékin est de ¥40 / ¥3,3 / ¥100 / ¥160 par million pour l’entrée audio, l’entrée image, la sortie texte et la sortie audio respectivement, nettement inférieure aux tarifs de Singapour, une différence qui ne devient visible que lorsque l’on compare les deux ligne par ligne.
Un autre point en faveur de l’interprète en matière de coût : Qwen a maintenu ces tarifs pratiquement stables par rapport à Qwen3.5-LiveTranslate, avec Pékin inchangé et Singapour légèrement moins cher. L’arrivée d’une nouvelle génération sans hausse de prix n’est pas la norme sur ce marché.
Les poids ouverts face à l’API uniquement constituent la véritable ligne de démarcation.
Si vous choisissez entre ces deux sur le principe plutôt que sur la capacité, le fait décisif est la licence.
Qwen3.8-Max est disponible en version hébergée, et les poids de classe Max de cette génération ont été publiés en open source sous le nom de Qwen3.8-2.4T-A95B en août. Cette voie existe, mais ce n'est pas une voie anodine : 4,89 To de poids, c'est du matériel de centre de données, et la licence open-weight oblige les organisations réalisant plus de 50 millions de dollars sur une période de douze mois à obtenir une licence commerciale auprès d'Alibaba Cloud.
Qwen3.8-LiveTranslate n’a pas de telle voie. Il est à poids fermés et accessible uniquement via API, joignable via une API WebSocket Realtime qui exige que target_language soit défini dans un événement session.update avant que tout audio ne circule, ne prend en charge aucun appel de fonction, aucune sortie structurée, aucune mise en cache de contexte, aucune inférence par lots et aucun fine-tuning. Si votre besoin est d’exécuter l’interpréteur sur votre propre matériel, ce modèle ne le satisfait pas et aucun travail d’ingénierie n’y changera quoi que ce soit.
Cela compte pour un type d’acheteur bien précis : celui qui ne peut pas envoyer d’audio à un tiers — un hôpital, un cabinet d’avocats, un contractant gouvernemental. Pour tous les autres, la question pratique est de savoir si l’interprète est suffisamment bon pour justifier la dépendance, et la réponse à cela est une mesure que Qwen n’a pas encore permis à quiconque de faire.

Choisir par métier, pas par nom
La bonne réponse à « Qwen3.8-LiveTranslate ou Qwen 3.8 » est que vous avez probablement besoin de la réponse à une autre question.
• S’il s’agit d’interprétation en direct — une réunion, un appel, une diffusion — un seul d’entre eux peut le faire, et ce n’est pas le produit phare.
• Si la tâche consiste à résumer ce qui a été dit, à extraire les points d’action, à répondre à des questions sur la transcription ou à rédiger le suivi — seul le modèle phare peut le faire, et ce n’est pas l’interprète.
• Si la mission est double, vous construisez un pipeline, et vous paierez deux fournisseurs avec deux contrats et deux ensembles d’identifiants, à moins de consolider délibérément.
Ce troisième cas est le plus courant, et c'est là que faire tourner les deux moitiés derrière un point de terminaison unique cesse d'être une commodité pour devenir une architecture. Qwen3.8-Max est disponible sur OrcaRouter au prix catalogue du fournisseur, soit 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, avec zéro marge ajoutée, de sorte qu'une baisse de prix de Qwen se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement de contrat, et le basculement automatique signifie que la moitié du pipeline dédiée au résumé ne s'éteint pas lorsqu'un fournisseur traverse une mauvaise heure.
Pour être explicite sur l'autre moitié, car la distinction compte : Qwen3.8-LiveTranslate ne figure pas dans notre catalogue. Il est disponible via l'API Model Studio d'Alibaba elle-même et le point de terminaison d'essai du fournisseur à omni.qwen.ai/live-translate, et nous n'allons pas laisser entendre que nous acheminons un modèle que nous n'acheminons pas. Ce que vous pouvez placer derrière une seule clé aujourd'hui, c'est la pile en aval — les modèles qui consomment ce que produit l'interpréteur.

Le problème de nommage est la véritable conclusion
Quatre modèles, un préfixe, aucune convention de suffixe sur laquelle un lecteur peut s’appuyer. « Qwen 3.8 » désigne le modèle phare hébergé, le checkpoint ouvert de 2,4 T, le petit modèle de 27 B ou l’interprète selon qui est en train de taper et ce qu’il a lu en dernier. Les tableaux de benchmarks publiés n’aident pas, parce que le modèle phare en dispose et que l’interprète, le plus souvent, non : Qwen3.8-Max peut être placé sur Terminal-Bench ou GPQA Diamond, tandis que les éléments de preuve relatifs à Qwen3.8-LiveTranslate sont un retard moyen de 2,3 secondes, un score de 85,7 xCOMET-XXL déclaré par le fournisseur sur FLEURS, et un taux d’erreur de diarisation auto-déclaré de 9,7 %, sans réplication indépendante.
Donc, la comparaison à laquelle cette page doit répondre est en réalité un avertissement. Avant de comparer Qwen 3.8 à quoi que ce soit, déterminez de quel Qwen 3.8 vous parlez. S'il prend en charge l'audio, c'est l'interprète, et c'est un spécialiste que vous achetez pour une seule tâche. S'il prend en charge la vidéo, c'est le produit phare, et c'est un généraliste que vous achetez pour les vingt autres. Toute évaluation qui les mélange produira une conclusion qui ne concerne ni l'un ni l'autre.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
