
GPT-6 Luna vs Qwen3.8-Max : le modèle le moins cher de cette comparaison est aussi le seul qui regarde des vidéos
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
L'angle évident pour cette comparaison est le mauvais. Qwen3.8-Maxest proposé à 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, avec les lectures de cache à 0,25 $. GPT-6 Lunaest proposé à 0,10 $ et 0,50 $, avec les lectures de cache à un centime. Vingt fois sur l'entrée, douze fois sur la sortie, cinquante fois sur l'entrée mise en cache — un écart de prix si large que la comparaison semble jouée d'avance.
Ce n'est pas tranché, parce que les deux modèles ne sont pas en concurrence pour la même requête. Qwen3.8-Max accepte le texte, l'image et la vidéo, et son plafond de sortie de 131 072 tokens est légèrement supérieur à celui de GPT-6 Luna, 128 000. GPT-6 Luna n'accepte que le texte et l'image. Le modèle d'Alibaba obtient 58 sur l'indépendant Intelligence Index — premier de sa catégorie au classement agentique — et GPT-6 Luna obtient 37 à effort maximal, 29 par défaut. L'un est un modèle phare avec une lignée à poids ouverts et une modalité d'entrée vidéo. L'autre est une offre de volume avec un chiffre de vitesse et un tarif de cache d'un cent. L'écart de prix n'est pas une réduction sur la même chose ; c'est la description de deux choses différentes.
Ce qu'est chacun de ces deux
Qwen3.8-Max est le modèle phare d'Alibaba de la génération 3.8, un checkpoint de classe Max dont le modèle sous-jacent — Qwen3.8-2.4T-A95B — a été publié publiquement sous une licence personnalisée le 12 août 2026, ce qui en fait le premier Qwen de classe Max à disposer de poids ouverts. Le modèle phare hébergé lui-même est toujours répertorié par l'organisme indépendant comme propriétaire. Il dispose d'une fenêtre de contexte de 1 000 000 de tokens, d'un plafond de sortie de 131 072 tokens, accepte du texte, des images et de la vidéo en entrée, et propose un effort de raisonnement sélectionnable entre faible, moyen et très élevé. Une révision épinglée Qwen3.8-Max-0902 est disponible au même prix, un petit détail qui a une réelle valeur opérationnelle.
GPT-6 Luna est le modèle d’efficacité d’OpenAI du 22 septembre 2026, situé sous GPT-6 Sol à 2,00 $/10,00 $ et sous le modèle phare GPT-6 Astra à 10,00 $/50,00 $. Entrée texte et image, sortie texte, une fenêtre de 1 050 000 tokens avec 922 000 en entrée maximale, un plafond de sortie de 128 000 tokens, et un effort allant de none à max, en passant par low, medium, high et xhigh, medium étant la valeur par défaut. Fermé, identifiant unique, disponible pour toute personne disposant d’une clé API.
L’un accepte la vidéo et peut être téléchargé dans sa forme de base. L’autre accepte les images et est rapide. Tous deux sont tarifés pour un usage à volume. Le recoupement entre ces deux affirmations est plus faible que ne le suggère le rapport de prix.
Les cartes, ligne par ligne
Une ligne par dimension, les deux côtés sur chacune :
• Entrée par 1M — GPT-6 Luna 0,10 $ vs Qwen3.8-Max 2,00 $
• Sortie pour 1 M — GPT-6 Luna 0,50 $ vs Qwen3.8-Max 6,00 $
• Entrée mise en cache par million — GPT-6 Luna 0,01 $ contre Qwen3.8-Max 0,25 $ pour les lectures de cache implicites, avec une lecture de cache explicite à 0,17 $ et une écriture de cache explicite à 2,50 $
• Clause de contexte long — GPT-6 Luna double l’entrée et le cache et augmente la sortie de 1,5× au-delà de 272 000 jetons d’entrée, appliquée à l’ensemble de la requête, contre Qwen3.8-Max, un palier unique sur toute la fenêtre, ce qui est le seul point où la carte Qwen est structurellement meilleure plutôt que marginalement moins chère
• Fenêtre de contexte — GPT-6 Luna 1 050 000 jetons vs Qwen3.8-Max 1 000 000 jetons
• Sortie maximale — GPT-6 Luna 128 000 tokens vs Qwen3.8-Max 131 072 tokens
Modalités d'entrée — GPT-6 Luna texte et image vs Qwen3.8-Max texte, image et vidéo
• Effort de raisonnement — GPT-6 Luna : aucun, faible, moyen (par défaut), élevé, très élevé, maximal, contre Qwen3.8-Max : faible, moyen et extra-élevé
• Intelligence Index, indépendant — GPT-6 Luna 37 à effort maximal vs Qwen3.8-Max 58
• Agentic Index, indépendant — Qwen3.8-Max 58, premier de sa catégorie ; aucune donnée comparable publiée pour GPT-6 Luna
• Score à effort par défaut — GPT-6 Luna 29 à son réglage moyen par défaut vs Qwen3.8-Max mesuré à son réglage maximal
• Coût par tâche Index, indépendant — GPT-6 Luna environ 0,07 $ contre Qwen3.8-Max 5,41 $
• GDPval, indépendant — Qwen3.8-Max 1 739 Elo à 64 tours par tâche, ce qui revient à environ 1,14 $ par tâche terminée sur cette évaluation ; aucune exécution comparable de GPT-6 Luna n’est publiée
• Taux d'hallucination sur AA-Omniscience — Qwen3.8-Max 40 %, une régression par rapport aux 23 % de la génération précédente ; GPT-6 Luna 77 %, en baisse par rapport à 93 %
• Instantané daté — GPT-6 Luna un identifiant glissant unique vs Qwen3.8-Max-0902 disponible en tant que révision épinglée du 2 septembre 2026 au même prix
• Poids — GPT-6 Luna fermé, API uniquement vs Qwen3.8-Max, le checkpoint de base Qwen3.8-2.4T-A95B public sous une licence personnalisée depuis le 12 août 2026, tandis que le modèle phare hébergé est répertorié comme propriétaire
• Sur OrcaRouter — GPT-6 Luna absent de notre catalogue vs Qwen3.8-Max routable au prix catalogue d'Alibaba

La vidéo n'est pas une ligne de fonctionnalité, c'est une charge de travail différente.
La ligne de modalité est celle qui détermine le plus de comparaisons réelles, davantage que la ligne de prix, et elle est généralement lue comme une case à cocher.
Qwen3.8-Max accepte la vidéo. GPT-6 Luna, non. Si votre pipeline doit raisonner sur un enregistrement d'écran, une démo produit, la captation d'un cours, un segment de caméra de surveillance ou un parcours d'interface utilisateur, la comparaison s'arrête à cette ligne et l'écart de prix de vingt fois devient sans importance — vous ne choisissez pas entre une option coûteuse et une option bon marché, vous choisissez entre une option et aucune option. Extraire des trames et les transmettre comme images est un contournement, pas un équivalent, et quiconque en a déjà construit un connaît la différence, tant sur le coût que sur la qualité.
Si votre pipeline est composé de texte et d'images, la ligne de la modalité reste muette et celle du prix parle. C'est la répartition honnête, et il vaut la peine d'être franc sur le côté où vous vous situez avant de lire quoi que ce soit d'autre sur cette page.
L’écart agentique est réel et il constitue la moitié coûteuse de la différence de prix.
Qwen3.8-Max obtient 58 sur l'Intelligence Index indépendant. GPT-6 Luna obtient 37 à effort maximal et 29 à son niveau moyen par défaut. Vingt et un points à réglages identiques, vingt-neuf aux réglages par défaut — sur un composite où un seul point se situe dans le bruit d'une réexécution, un écart de cette taille n'est pas du bruit.
La position de Qwen3.8-Max se concentre sur le travail agentique. Il obtient 58 sur l'indice Agentic Index indépendant, premier de sa catégorie, et 1 739 Elo sur GDPval à 64 tours par tâche. Ce dernier chiffre est le plus instructif, car il mesure la capacité d'un modèle à maintenir le fil d'une tâche sur soixante-quatre décisions séquentielles, et il s'accompagne d'une étiquette de prix : environ 1,14 $ par tâche menée à bien dans cette évaluation. Comparez cela au coût par tâche d'indice de GPT-6 Luna, d'environ 0,07 $, et la conclusion honnête n'est pas que Qwen est cher. C'est qu'on demande à Qwen de faire quelque chose de bien plus difficile, et qu'il le fait.
Le corollaire est que le déficit de vingt et un points de GPT-6 Luna n'est pas non plus réparti uniformément sur votre charge de travail. Sur une tâche courte, bien spécifiée et consommée par un programme — extraire ce champ, classifier ce ticket, router cette requête — les deux modèles produiront la même réponse exploitable presque tout le temps, et l'écart d'indice sera invisible dans votre évaluation. Sur une tâche nécessitant soixante-quatre actions séquentielles avec un point de contrôle à la fin, l'écart correspond à la différence entre terminer et s'arrêter discrètement à mi-chemin, et c'est la tâche pour laquelle Qwen3.8-Max a été conçu et pas GPT-6 Luna.
Un chiffre va dans l’autre sens et mérite d’être énoncé plutôt qu’enfoui. Le taux d’hallucination de Qwen3.8-Max sur le tableau d’omniscience est de 40 %, contre 23 % pour la génération précédente — une régression substantielle, et le genre qui se manifeste par des réponses fausses mais assurées en production plutôt que par une ligne de benchmark. Celui de GPT-6 Luna est de 77 %, contre 93 %. Les deux chiffres sont élevés en termes absolus, et le modèle le moins cher reste le pire des deux sur cette mesure. Aucun des deux chiffres n’est une raison de préférer un modèle ; tous deux incitent à garder un humain ou un vérificateur dans la boucle pour tout ce où un fait fabriqué coûte cher.
La clause de contexte long est la seule ligne où Qwen l’emporte sur la structure.
GPT-6 Luna comporte une clause que Qwen3.8-Max n’a pas : les requêtes dépassant 272 000 jetons d’entrée sont facturées au double des tarifs d’entrée et de cache et à 1,5× le tarif de sortie, appliqués à l’ensemble de la requête plutôt qu’à la partie dépassant le seuil. Un appel de 300 000 jetons sur GPT-6 Luna est facturé à 0,20 $ par million de jetons d’entrée pour la totalité des 300 000 jetons, parce qu’il a dépassé de 28 000. Divisez le même document en deux appels et le coût est divisé par deux, sans aucune modification du prompt.
Qwen3.8-Max est à tarif constant sur toute sa fenêtre de 1 000 000 de tokens. Pour des requêtes uniques véritablement énormes, cela rend l'écart de douze fois sur le prix de sortie plus petit qu'il n'y paraît, et peut même l'inverser : au-delà de 272 000 tokens d'entrée, le tarif d'entrée effectif de GPT-6 Luna double pour atteindre 0,20 $, et son tarif de sortie monte à 0,75 $, contre 2,00 $ et 6,00 $ constants chez Qwen. L'écart se réduit de vingt fois à dix en entrée, et de douze à huit en sortie. Il reste large — mais les charges de travail les plus susceptibles de nécessiter un contexte de travail de 300 000 tokens sont précisément les charges agentiques sur lesquelles les deux fournisseurs se positionnent, et les équipes qui les exploitent sont celles qui le remarqueront.
L'autre ligne structurelle est la révision épinglée. Qwen3.8-Max-0902 est disponible au même prix que l'identifiant glissant, ce qui signifie qu'une équipe qui a besoin d'un comportement reproductible à travers une mise à jour de modèle peut l'obtenir sans payer de supplément. GPT-6 Luna n'offre pas d'équivalent. C'est une petite ligne sur une grille tarifaire et une grande ligne dans un post-mortem.
Exécuter l'un d'eux, ou les deux
Qwen3.8-Max est disponible sur OrcaRouter au prix catalogue d'Alibaba, dans le cadre d'une tarification en répercussion qui signifie qu'une modification tarifaire d'un fournisseur est effective de notre côté le jour même. Deux éléments de notre couche de routage justifient leur place pour ce modèle en particulier : le basculement automatique, car un modèle phare hébergé dont la base ouverte est publiée compte plus de sources en amont qu'un modèle fermé à fournisseur unique, et donc plus de manières pour l'une d'elles de se dégrader ; et la gestion des révisions épinglées, qui permet à une route de conserver explicitement Qwen3.8-Max-0902 plutôt que d'hériter de ce vers quoi l'identifiant glissant sera résolu la semaine prochaine.
GPT-6 Luna ne figure pas dans notre catalogue au moment de la rédaction et est accessible via l'API propre à OpenAI, de sorte qu'une équipe qui veut les deux utilise une seule clé pour Qwen3.8-Max aux côtés de ce qu'elle utilise déjà pour OpenAI. C'est aussi l'association dans laquelle le DSL de routage vaut plus qu'une répartition statique, car la frontière entre les deux modèles est un contrôle de modalité et un contrôle de longueur plutôt qu'une préférence : les requêtes contenant de la vidéo vont à Qwen3.8-Max parce que rien d'autre ne peut les servir, les requêtes dépassant 272 000 jetons d'entrée vont à Qwen3.8-Max parce que le décrochage de l'autre modèle les rend plus coûteuses là-bas, et tout le reste va au modèle qui coûte un vingtième du prix. C'est une règle, et elle a sa place dans la configuration plutôt que dans une branche applicative.

Lequel, et quand
Choisissez Qwen3.8-Max si l’un des cas suivants est vrai. Votre pipeline nécessite une entrée vidéo. Vos requêtes dépassent régulièrement 272 000 tokens d’entrée, où son palier à tarif fixe bat la nouvelle tarification de GPT-6 Luna. Votre sortie dépasse 128 000 tokens. Votre travail est une exécution agentique à long horizon avec un point de terminaison vérifiable, où son score de 58 au tableau agentique et ses 1 739 Elo sur GDPval à 64 tours par tâche sont les preuves qui comptent. Ou vous avez besoin d’une révision épinglée pour la reproductibilité et êtes prêt à payer pour cela — ce qui, au même prix que l’identifiant glissant, signifie que vous ne l’êtes pas.
Prenez GPT-6 Luna si aucun de ces cas ne s'applique et que votre charge de travail est à gros volume, consommée par des programmes, composée de texte et d'images, et de courte durée. Classification, extraction, routage, synthèse en masse, la boucle interne d'un agent qui a besoin d'une réponse rapide plutôt que d'une réponse soignée. À 0,10 $/0,50 $ avec une lecture en cache à un centime et un coût par tâche terminée d'environ un quinzième de celui de Qwen3.8-Max, le calcul n'est pas serré. Définissez explicitement le paramètre d'effort — la valeur par défaut est medium et le chiffre phare 37 est une valeur d'effort maximal — et gardez les appels longs du bon côté de la limite des 272 000 tokens.
L’erreur que cette comparaison invite à commettre est de lire le prix des entrées vingt fois supérieur comme un verdict. C’est un verdict sur une forme de charge de travail, et il ne dit rien sur les trois lignes qui décident de l’autre : si la requête transporte de la vidéo, si elle dépasse 272 000 jetons, et si la réponse doit survivre à soixante-quatre étapes séquentielles.

Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
