
Gemini 3.5 Flash-Lite vs Qwen 3.8 : le cheval de trait abordable vs le vaisseau amiral 2,4 T
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 200 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
Quand cette comparaison a été écrite pour la première fois, elle était déséquilibrée d'une manière inhabituelle : Gemini 3.5 Flash-Lite était un produit réel et achetable, et Qwen 3.8 était un aperçu sous restriction sans prix, sans benchmark et sans poids. Il y avait très peu de choses à comparer.
Ce n'est plus le cas. Qwen3.8-Max est devenu généralement disponible le 3 août 2026 avec une grille tarifaire publiée de 2 $ / 6 $ par million de jetons, un endpoint compatible OpenAI et DashScope, et un tableau de benchmarks complet. Il est en libre-service, budgétisable et en direct — y compris sur OrcaRouter. Cet article a donc été entièrement réécrit, car la comparaison honnête aujourd'hui n'est pas « modèle commercialisé contre vapeur ». C'est vraiment par niveau que se fait la comparaison : le cheval de trait le moins cher et à haut débit de Google contre le plus grand vaisseau amiral d'Alibaba.
Une note pour les constructeurs — ces deux modèles se situent aux extrémités opposées de la courbe des coûts, donc la bonne question est de savoir à quel niveau appartient votre charge de travail. OrcaRouter regroupe plus de 200 modèles derrière un seul endpoint compatible OpenAI, vous permettant ainsi de tester les deux sur la même tâche sans avoir à configurer deux SDK.
En bref : le verdict. Ces modèles ne sont pas vraiment en concurrence — ils répondent à des questions différentes. Flash-Lite est un modèle axé sur l'efficacité : Artificial Analysis Index 36, 0,30 $ / 2,50 $ par million, environ 490 tokens/s, généralement disponible. Il est conçu pour s'exécuter à chaque requête à un coût négligeable. Qwen3.8-Max est un modèle phare : ~2,4 T de paramètres, un contexte à tarif forfaitaire de 1M de tokens, une entrée native d'images et de vidéos, et des scores autodéclarés de niveau frontière (GPQA Diamond 92,6, Terminal-Bench 2.1 86,6) — à 2 $ / 6 $, soit 6,7× le tarif d'entrée de Flash-Lite. Flash-Lite est le bon choix par défaut pour la classification, le routage et l'extraction à haut volume. Qwen3.8-Max est le modèle vers lequel vous vous tournez lorsqu'une tâche nécessite réellement un raisonnement de pointe, un million de jetons de contexte, ou une entrée non textuelle. La seule réserve qui n'a pas changé : Qwen n'a toujours pas de score de référence indépendant.
Points clés
• Qwen 3.8 est désormais en disponibilité générale — à compter du 3 août 2026, il a publié des tarifs, un accès en libre-service et un tableau de benchmarks. Le cadrage antérieur d’une préversion restreinte et non budgétisable est obsolète.
• Flash-Lite est nettement moins cher : 0,30 $ / 2,50 $ par 1M contre les prix de Qwen à 2 $ / 6 $ — environ 6,7× en entrée et 2,4× en sortie.
• Flash-Lite est beaucoup plus rapide : environ 490 tokens/sec, conçu pour un travail à haut débit. Qwen3.8-Max affiche un p50 time-to-first-token de 1,64 s dans la télémétrie de 7 jours d'OrcaRouter mais est un modèle vaste et complet.
• Flash-Lite a le seul score audité : Artificial Analysis Index 36. Qwen3.8-Max reste non noté par tous les évaluateurs indépendants, bien qu'Alibaba publie maintenant ses propres chiffres.
• Qwen gagne nettement en termes de capacités : un contexte de 1M de tokens facturé à plat sans supplément pour les longues invites, plus une entrée texte/image/vidéo et un score OmniDocBench 1.5 de 92.1 pour l’analyse de documents. Flash-Lite est un petit modèle efficace.
• Poids ouverts : Les Qwen sont promis dans la semaine (pas encore de licence), plus un Qwen3.8-27B qui tournerait dans ~17 Go de VRAM. Flash-Lite est définitivement fermé.
Note de précision : tous les chiffres de qualité de Qwen3.8-Max sont rapportés par Alibaba et non vérifiés par des tiers. Les chiffres de Gemini 3.5 Flash-Lite proviennent d'Artificial Analysis. Le prix de Qwen est basé sur la carte tarifaire GA d'Alibaba Model Studio et remplace l'accès en version préliminaire décrit dans les versions antérieures de cet article.
Les spécifications et le prix, côte à côte
• Fabricant / statut — Flash-Lite : Google ; généralement disponible ; Qwen3.8-Max : Alibaba ; GA (3 août 2026)
• Positionnement — Flash-Lite : palier d'efficacité à haut débit et à faible coût ; Qwen3.8-Max : ambition de vaisseau amiral / de frontière
• Indice d'intelligence AA — Flash-Lite : 36 (Artificial Analysis) ; Qwen3.8-Max : Toujours non noté
• Scores rapportés par les fournisseurs — Flash-Lite : le classement est mesuré par un tiers ; Qwen3.8-Max : GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tous rapportés par Alibaba)
• Prix (par 1M, entrée / sortie) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, fixe sur 1M de contexte ; entrée en cache $0.25
• Vitesse — Flash-Lite : ~490 tok/s (Artificial Analysis) ; Qwen3.8-Max : p50 TTFT 1,64 s (télémétrie OrcaRouter sur 7 jours)
• Contexte — Flash-Lite: contexte de niveau efficacité; Qwen3.8-Max: 1M tokens (983,616 avec réflexion; sortie maximale 131,072)
• Modalité — Flash-Lite : modèle d'efficacité axé sur le texte ; Qwen3.8-Max : texte, image, vidéo en entrée → texte en sortie
• Poids — Flash-Lite : fermé, API uniquement ; Qwen3.8-Max : promis dans la semaine, pas encore de licence
• Accès dès aujourd'hui — Flash-Lite : API standard, libre-service ; Qwen3.8-Max: API standard, libre-service (Model Studio, DashScope, OrcaRouter)
Disposé de cette façon, le constat est complètement différent de ce qu'il était auparavant. La colonne de Qwen n'est plus vide — elle est pleine, et sur plusieurs lignes, elle est l'entrée la plus forte. Ce qui remplace l'ancien cadre "quantité connue contre promesse" est un simple écart de niveau : Flash-Lite est environ 6,7× moins cher en entrée et environ 13× plus rapide en termes de débit, tandis que Qwen offre un contexte multimodal d'un million de tokens et un raisonnement revendiqué de niveau avancé. Ce sont tous deux des produits légitimes ; ils remplissent simplement des tâches différentes.
La seule ligne où l’ancienne mise en garde s’applique encore est celle des benchmarks. L’Index 36 de Flash-Lite a été mesuré par Artificial Analysis sur un classement public. Chaque chiffre de Qwen — GPQA Diamond 92.6, Terminal-Bench 86.6, et les autres — a été produit par Alibaba sur son propre banc d’essai. C’est une réelle amélioration par rapport au fait de ne rien publier, mais ce n’est pas une vérification par un tiers, et les laboratoires publient les benchmarks qu’ils remportent.

Index 36 face à un flagship non noté : en lisant cela honnêtement
Il est tentant de mettre l'Index 36 de Flash-Lite face au GPQA Diamond 92.6 de Qwen et de déclarer une déroute. Ce serait une erreur de catégorie à double titre.
Premièrement, l'indice Artificial Analysis Intelligence est un composite de nombreuses tâches ; GPQA Diamond est un test de sciences de niveau graduate. Ils ne sont pas sur la même échelle et ne peuvent pas être soustraits l'un de l'autre.
Deuxièmement, et plus important encore, Flash-Lite n'a jamais été conçu pour obtenir un score élevé. Un Index of 36 est ce à quoi ressemble un modèle d'efficacité. L'objectif d'ingénierie de Google était un modèle suffisamment bon marché et rapide pour être placé devant chaque requête entrante — routage de tickets, classification, extraction, résumé en volume — là où un modèle de frontière serait économiquement absurde. Le juger par rapport à un vaisseau amiral de 2,4T sur le plafond de raisonnement passe à côté de son objectif.
Ce que nous pouvons dire est plus restreint et plus utile. Qwen3.8-Max est très probablement le modèle nettement plus performant — ses scores autodéclarés sont bien supérieurs à ce qu'un modèle Index-36 produirait, et le saut FrontierSWE de 40,7 à 73,5 par rapport à son prédécesseur suggère un réel progrès. Mais « très probablement » reste une déduction, car aucun évaluateur indépendant ne l'a noté. Pour contexte, le prédécesseur Qwen3.7-Max a obtenu 46 sur l'indice AA — soit plus que les 36 de Flash-Lite, mais très loin des modèles de pointe — le bond générationnel implicite d'Alibaba est donc important et non vérifié.
La conséquence pratique : si votre tâche est une tâche que Flash-Lite accomplit déjà correctement, le plafond plus élevé de Qwen ne vaut rien pour vous et vous le paieriez 6,7×. Le plafond n'a d'importance que lorsque Flash-Lite échoue réellement.
Coût en pratique : l'écart entre les paliers en chiffres
Prenons une tâche de classification à haut volume : 2 000 tokens en entrée, 200 tokens en sortie, exécutée 500 000 fois par jour — une configuration réaliste de triage du support ou de routage de contenu.
• Flash-Lite: par appel, 0.002M × $0.30 = $0.0006, plus 0.0002M × $2.50 = $0.0005. ≈ $0.0011 par appel → ~$550/jour.
• Qwen3.8-Max: par appel, 0.002M × $2 = $0.004, plus 0.0002M × $6 = $0.0012. ≈ $0.0052 par appel → ~$2,600/jour.
• Mensuel: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — une différence de 61 500 $ pour le même volume de tâches.
À cette échelle, le choix du niveau est de loin le plus gros poste du système, et il est très difficile de justifier un modèle phare pour un travail qu'un modèle d'efficacité gère. C'est exactement le scénario pour lequel Flash-Lite existe.
Maintenant, inversez-le. Prenez une tâche de document long : 600 000 jetons de contexte, 5 000 jetons de sortie, 200 fois par jour.
• Qwen3.8-Max: 0.6M × $2 = $1.20, plus 0.005M × $6 = $0.03. ≈ $1.23 par appel, sans supplément pour long prompt — et environ $0.18 si le contexte est mis en cache à $0.25/1M.
• Flash-Litene peut pas du tout être tarifé pour cette forme, car un contexte d'appel unique de 600 000 tokens n'est pas ce qu'un modèle de niveau efficacité est conçu pour contenir.
Ainsi, la réponse change complètement selon la forme de la charge de travail, ce qui est la vraie leçon. Flash-Lite remporte de loin les travaux à volume élevé et à contexte court. Qwen gagne pour tout ce qui nécessite un million de jetons ou une entrée non textuelle, où Flash-Lite n'est pas une option moins chère, mais simplement pas une option.

Scénarios : quel niveau convient
Assurer le triage et le routage à grande échelle. Flash-Lite, clairement. L'index 36 est suffisant pour la classification, et à environ 0,0011 $ par appel, vous pouvez l'exécuter sur chaque ticket. Ne faites remonter vers un modèle plus grand que la minorité des cas ambigus.
Analyse intégrale de contrats ou de documents déposés. Qwen3.8-Max. Le contexte de 1M à prix forfaitaire signifie qu'un document de 400 pages passe en un seul appel, sans surcoût ni découpage, et son score auto-déclaré de 92,1 sur OmniDocBench 1.5 vise exactement ce type de travail.
Pipelines de captures d'écran, de graphiques ou de vidéos. Qwen3.8-Max, par défaut — il accepte les entrées image et vidéo et obtient un score OSWorld-Verified de 86.1 sur le pilotage d'une véritable interface graphique. Flash-Lite n'est pas un candidat pour les entrées non textuelles.
Codage agentique. Qwen3.8-Max sur les chiffres revendiqués (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), avec la réserve qu'aucun n'est vérifié indépendamment et son score auto-déclaré le plus faible est IFBench 82.8 sur le suivi d'instructions — un risque réel pour les pipelines qui analysent la sortie de chaque étape.
Une architecture à deux niveaux. Souvent, la bonne réponse est les deux : Flash-Lite comme première passe peu coûteuse sur chaque requête, Qwen3.8-Max comme voie d'escalade pour la petite fraction qui nécessite un million de jetons, une image, ou un véritable raisonnement. Ce schéma capture une grande partie de l'avantage de coût de Flash-Lite tout en gardant une option de pointe disponible.
Self-hosting et ouverture
Flash-Lite est fermé et uniquement API, définitivement — il n'y a aucune possibilité d'auto-hébergement.
Les poids de Qwen3.8-Max sont promis dans la semaine, mais le modèle phare n'est pas une cible réaliste : environ 1.2TB en 4-bit contre environ 141GB par H200 signifie huit accélérateurs haut de gamme ou plus, et Alibaba n'a toujours pas divulgué le nombre de paramètres actifs, donc le débit que cet investissement permettrait d'acheter est non modélisable. Il n'y a pas non plus de texte de licence pour l'instant, ce qui signifie que l'utilisabilité commerciale est formellement indéterminée.
Le modèle Qwen3.8-27B, annoncé en parallèle, est la sortie qui compte vraiment pour les déploiements sur site. Également publié en open weights et fonctionnant, selon les rapports, dans environ 17 Go de VRAM, c'est une véritable option d'auto-hébergement — et surtout, un concurrent bien plus proche du créneau d'efficacité de Flash-Lite que ne l'est le fleuron de 2.4T.
FAQ
Puis-je utiliser Qwen 3.8 aujourd'hui ?
Oui. Qwen3.8-Max est devenu généralement disponible le 3 août 2026, avec des tarifs publiés de 2 $ / 6 $ pour 1 million de jetons et un point de terminaison compatible OpenAI et DashScope. Il est en libre-service via Alibaba Model Studio, DashScope et OrcaRouter. Les versions antérieures de cet article décrivaient un aperçu à accès contrôlé ; cette information est obsolète.
Lequel est moins cher ?
Gemini 3.5 Flash-Lite, avec une large avance : 0,30 $ / 2,50 $ par 1 M contre 2 $ / 6 $ pour Qwen3.8-Max — soit environ 6,7× moins cher en entrée et 2,4× en sortie. Pour les travaux à volume élevé et à contexte court, cette différence domine toutes les autres considérations.
Lequel est le meilleur ?
Ce sont des niveaux différents. Flash-Lite possède le seul score audité (AA Index 36) mais a été conçu pour un débit bon marché, pas pour le raisonnement. Qwen3.8-Max est très probablement bien plus performant — ses auto-évaluations GPQA Diamond 92.6 et Terminal-Bench 2.1 86.6 sont de niveau frontière — mais il n'a pas de benchmark indépendant, donc cela reste une inférence plutôt qu'un résultat mesuré.
Lequel est le plus rapide ?
Flash-Lite, substantiellement. Artificial Analysis mesure environ 490 tokens par seconde, ce qui est l'objectif de sa conception de niveau efficacité. Qwen3.8-Max affiche un temps jusqu'au premier token (p50) de 1,64 seconde dans la télémétrie sur 7 jours d'OrcaRouter, mais c'est un modèle volumineux et approfondi, et les évaluateurs de la période d'aperçu l'ont trouvé lent sur les constructions agentiques longues.
Est-ce que Qwen 3.8 a maintenant des poids ouverts ?
Pas encore. Alibaba affirme que les poids du modèle phare arrivent d'ici la semaine, mais il n'y a toujours ni licence, ni fiche modèle, ni dépôt. Même une fois publié, un modèle de 2,4 T nécessite huit GPU ou plus de classe H200. Le Qwen3.8-27B, annoncé en parallèle, avec environ 17 Go de VRAM, est l'option pratique pour un auto-hébergement.
Devrais-je utiliser les deux ?
Souvent oui. Une configuration à deux niveaux — Flash-Lite comme premier passage économique sur chaque requête, Qwen3.8-Max comme voie d'escalade pour les tâches à long contexte, multimodales ou vraiment difficiles — conserve la plupart des avantages de coût de Flash-Lite tout en vous offrant une option de pointe là où elle mérite son prix.
Lequel devrais-je choisir pour la production aujourd'hui ?
Flash-Lite pour les travaux à volume élevé, contexte court, texte seul, où Index 36 suffit — c'est peu coûteux, rapide, audité et éprouvé. Qwen3.8-Max lorsque la charge de travail nécessite un contexte d'un million de jetons, une entrée image ou vidéo, ou un raisonnement que Flash-Lite échoue manifestement à fournir. Les deux sont désormais réellement déployables, ce qui n'était pas vrai lors de la rédaction de cette comparaison.
En résumé
Gemini 3.5 Flash-Lite vs Qwen 3.8 était une comparaison entre un produit et une annonce. Ce n'est plus le cas. Depuis le 3 août 2026, Qwen3.8-Max est généralement disponible, tarifé, en libre-service et documenté — le cadrage honnête est donc une décision de niveau plutôt qu'une décision de disponibilité.
Flash-Lite reste le choix par défaut approprié pour le travail pour lequel il a été conçu : à 0,30 $ / 2,50 $ et environ 490 tokens/seconde, il s'exécute sur chaque requête pour un coût négligeable, et son Index 36 audité est tout à fait adéquat pour la classification, le routage et l'extraction. Qwen3.8-Max constitue le palier d'escalade — un contexte à tarif forfaitaire d'un million de tokens, une entrée native d'images et de vidéos, et un raisonnement de pointe revendiqué — pour un coût d'entrée environ 6,7 fois supérieur. Sa seule faiblesse non résolue reste la même qu'avant : aucun évaluateur indépendant ne l'a noté, de sorte que son argument de qualité repose sur les propres résultats d'Alibaba. Surveillez le premier score indépendant de l'Intelligence Index et les poids Qwen3.8-27B, qui concurrenceront beaucoup plus directement la niche de Flash-Lite. En attendant, choisissez en fonction de la forme de la charge de travail — et envisagez d'exécuter les deux.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
