Instantané daté du 2 septembre 2026 de Qwen3.8 Max, le modèle de raisonnement multimodal phare d'Alibaba : texte, image et vidéo en entrée, texte en sortie, contexte de 1 M de tokens. Mêmes capacités et mêmes tarifs que le modèle de base ; épinglez-le pour un comportement reproductible.
Qwen3.8 Max (0902) est un modèle répertorié sur OrcaRouter, provenant du fournisseur qwen, publié sous l'identifiant qwen/qwen3.8-max-0902. La notation 0902 est affichée dans la liste, mais les…
Le modèle prend en charge une fenêtre de contexte de 1 000 000 de tokens. Cela représente la quantité totale d’entrées que le modèle peut traiter dans une requête, y compris le contenu texte, image et vidéo du prompt. Aucune limite supplémentaire n’est fournie dans les faits, donc les limites pratiques dépendent de la manière dont OrcaRouter et le fournisseur appliquent la tokenisation et les délais d’expiration des requêtes. Pour les textes longs, 1 000 000 de tokens permet d’inclure de nombreux documents volumineux dans une seule requête, réduisant ainsi le besoin de découper ou de résumer avant d’appeler le modèle. Pour la vidéo, les faits ne précisent pas combien de tokens sont consommés par seconde, par image ou par fichier vidéo ; vous devez donc estimer à partir des métadonnées ou d’appels de test. Il est également important de se rappeler que la taille de la fenêtre de contexte ne vous dit pas à quel point le modèle est précis sur une requête de 1 000 000 de tokens ; aucune donnée de référence n’est fournie. Si votre application nécessite une qualité de contexte long exacte, évaluez sur un échantillon de vos propres documents avant de passer en production.
Le modèle accepte le texte, l'image et la vidéo comme entrées, et il peut être amené à raisonner sur des contenus sources qui combinent ces types de médias dans une même requête. Il peut s'agir, par exemple, de lire des instructions textuelles, d'examiner une image et de se référer à une vidéo pour produire une réponse. La fiche descriptive du fournisseur ne répertorie pas de capacités spécifiques à des tâches telles que l'OCR, la détection d'objets ou le raisonnement temporel sur vidéo. Ces comportements ne doivent donc pas être présumés. Ce que l'on peut attendre du modèle dépend principalement de ses capacités issues de l'entraînement, lesquelles ne sont pas documentées dans les informations fournies. Une conception prudente consiste à l'utiliser pour des tâches qui exigent une sortie textuelle à partir d'une invite multimodale et qui peuvent tolérer le coût de stockage des images et des vidéos sous forme de jetons d'entrée. Si la charge de travail est exclusivement textuelle, un autre modèle sans entrée d'image ni de vidéo pourrait être plus simple. Si une tâche exige des opérations vidéo précises au niveau des horodatages, la fiche du modèle ne fournit aucune indication quant à la fiabilité d'un tel comportement.
Choisir un modèle moins cher a du sens lorsque la tâche ne requiert pas les fonctionnalités qui définissent cette fiche. Une question textuelle courte n'a pas besoin d'un contexte de 1 000 000 de jetons ni d'un plafond de sortie de 131 072 jetons. Un flux de travail exclusivement textuel n'a pas besoin d'entrées d'images ou de vidéos. OrcaRouter facture ce modèle à 2,00 $ pour 1 000 000 de jetons d'entrée et à 6,00 $ pour 1 000 000 de jetons de sortie. Si une alternative moins chère propose des prix par jeton inférieurs et un support adéquat du contexte et des modalités, elle réduira le coût. Les faits fournis ne contiennent aucun benchmark de qualité ou de vitesse ; choisir ce modèle plutôt que d'autres ne peut donc pas se justifier par une précision mesurée ; cela doit se justifier par des exigences produit explicites : un contexte étendu, des entrées mixtes texte/image/vidéo ou une sortie longue en une seule génération. Comme le prix d'entrée s'applique à chaque jeton du contexte, les appels avec un très grand contexte peuvent coûter plus cher que les appels plus petits, même lorsque la question de l'utilisateur est courte ; évitez donc de gonfler inutilement les prompts.
Les caractéristiques fournies pour le modèle Qwen3.8 Max (0902) n'incluent pas de scores de benchmark, d'ensembles d'évaluation ni de chiffres de précision. Pour cette raison, toute déclaration concernant la qualité du modèle relèverait de la spéculation, et OrcaRouter ne publie pas de scores inférés. Si vous avez besoin d'un chiffre pour comparer les candidats, lancez vos propres tests sur des entrées représentatives, y compris les cas d'images et de vidéos que vous prévoyez d'envoyer. Un benchmark tel qu'un test de connaissances public ne vous dirait pas dans quelle mesure le modèle gère une invite vidéo spécifique de 1 000 000 de jetons. Gardez à l'esprit qu'un nom de modèle comme Max est une étiquette, et non une preuve de qualité. Les éléments mesurables de cette fiche sont la fenêtre de contexte, la longueur de sortie maximale, les modalités d'entrée et le prix. Ces attributs déterminent si une charge de travail est adaptée, mais ils ne décrivent ni la précision, ni la profondeur du raisonnement, ni le respect des instructions, ni le comportement en matière de sécurité. Considérez les capacités dans ces domaines comme non vérifiées, à moins que vous n'effectuiez une évaluation.
Les fiches descriptives du modèle ne fournissent pas de taux de tokens par seconde, de délais avant le premier token, de recommandations sur les délais d'expiration des requêtes, ni aucune autre mesure de performance. OrcaRouter ne revendique aucun chiffre de latence pour ce modèle de fournisseur. La vitesse dépendra de l'infrastructure d'hébergement du fournisseur, de la taille de l'entrée et du volume de sortie demandé. Une entrée de 1 000 000 de tokens et une sortie de 131 072 tokens prendront probablement plus de temps qu'une requête courte, mais la fiche n'établit aucune relation exacte. L'entrée vidéo peut également dégrader la latence, car elle doit être transformée en tokens avant que le modèle puisse y prêter attention ; la fiche ne quantifie pas cette étape. Les évaluateurs ne doivent pas supposer qu'un faible prix par token implique un décodage rapide. La seule décision liée à la vitesse que les faits permettent de prendre est de tester des tailles de requêtes représentatives sous la charge attendue. Ne déduisez pas l'adéquation au temps réel de la taille de la fenêtre de contexte ou du nom du modèle.
Les atouts déclarés sont structurels. Le modèle dispose d'une fenêtre de contexte de 1 000 000 de jetons, d'une sortie maximale élevée de 131 072 jetons, et accepte des entrées texte, image et vidéo. Ces caractéristiques sont utiles pour les applications qui nécessitent un seul appel de modèle afin d'observer un ensemble de matériel volumineux ou mixte avant de rédiger une longue réponse. Par ailleurs, il est plus facile de décrire les limites à partir des faits que les points forts. Aucun benchmark de qualité n'est publié, donc la précision, le raisonnement et la sécurité ne sont pas documentés. Il n'y a pas de liste séparée pour les données d'entraînement, les notes de version ou la méthodologie de mise à jour derrière l'étiquette 0902. Les entrées image et vidéo ne garantissent pas une compréhension visuelle ou temporelle exacte. Les limites de contexte et de sortie sont des maximums, et non une utilisation recommandée ; de très grandes sorties peuvent être coûteuses à $6.00 pour 1 000 000 de jetons de sortie. Une requête qui remplit le contexte de 1 000 000 de jetons consommerait $2.00 de jetons d'entrée avant qu'aucune sortie ne soit générée, ce qui représente un coût opérationnel non négligeable.
Les prix unitaires indiqués sont de 2,00 $ pour chaque tranche de 1 000 000 de tokens d'entrée et de 6,00 $ pour chaque tranche de 1 000 000 de tokens de sortie. OrcaRouter facture le modèle au tarif du fournisseur sans aucune majoration, le prix indiqué étant donc le tarif du fournisseur transmis tel quel. Les tokens d'entrée incluent les tokens de texte, d'image et de vidéo envoyés dans le prompt. Les tokens de sortie sont les tokens de réponse générés. À ces tarifs, 1 000 000 de tokens d'entrée coûtent 2,00 $ ; 1 000 000 de tokens de sortie coûtent 6,00 $. Une requête plus petite coûte proportionnellement moins : 100 000 tokens d'entrée coûteraient 0,20 $ et 100 000 tokens de sortie coûteraient 0,60 $, à condition que ces montants soient mesurés par le fournisseur. La fiche du modèle n'inclut pas de tarification distincte pour les tokens d'entrée mis en cache, les requêtes par lots ou les niveaux interactifs ; aucun prix de ce type ne doit donc être présumé. Les décomptes exacts de tokens facturés doivent être vérifiés à partir de la réponse d'utilisation d'OrcaRouter ou des journaux pour chaque appel.
Quand OrcaRouter dit qu'un modèle est facturé au tarif du fournisseur sans marge ajoutée, cela signifie qu'OrcaRouter n'ajoute pas ses propres frais par jeton en plus du tarif du fournisseur pour cette annonce. Le montant final pour l'utilisation des jetons doit donc reposer sur les prix indiqués de 2,00 $ pour l'entrée et de 6,00 $ pour la sortie par million de jetons. Cela ne signifie pas nécessairement que la facture finale ne comporte pas d'autres frais ; des taxes ou des frais au niveau du compte peuvent s'appliquer selon votre accord, mais aucun frais de ce type n'est documenté dans ces faits. Cela ne signifie pas non plus que le modèle est gratuit à servir, car le tarif par jeton s'applique toujours. Lorsqu'on compare les fournisseurs, le prix affiché par OrcaRouter pour ce modèle devrait représenter les mêmes unités que cette annonce. Si une autre passerelle affiche un autre prix, la différence relève de la structure de facturation, et non d'un changement de la fenêtre de contexte du modèle.
La gestion des coûts devrait commencer par la longueur du prompt. Puisque l'entrée coûte 2,00 $ pour 1 000 000 de jetons, chaque jeton supplémentaire augmente le montant facturé pour l'entrée, et chaque image ou vidéo envoyée dans une requête est convertie en jetons selon des règles non fournies dans cette liste. Réduire le contenu source non pertinent peut faire baisser le coût. La sortie coûte trois fois le prix unitaire de l'entrée, donc limiter la longueur de sortie demandée permet aussi de maîtriser les coûts. Un modèle avec une limite de sortie de 131 072 jetons peut générer des réponses qui ont un coût ; à 6,00 $ pour 1 000 000 de jetons, 131 072 jetons de sortie coûteraient environ 0,79 $ rien qu'en jetons de sortie. Générer autant de jetons n'est pas automatique, car le prompt contrôle la taille de la réponse. Aucun prix de cache n'est publié pour ce modèle, ne supposez donc pas que les contextes répétés bénéficient d'une remise. L'absence de tarification du cache ou par lots dans les informations fournies ne prouve pas que de telles options n'existent pas ; cela signifie simplement qu'elles ne font pas partie de cette liste.
Qwen3.8 Max (0902) est exposé via l’API compatible OpenAI d’OrcaRouter. Définissez l’URL de base du client sur https://api.orcarouter.ai/v1 et utilisez l’identifiant de modèle exact qwen/qwen3.8-max-0902. Avec un SDK compatible OpenAI, la structure de la requête est essentiellement la même que pour tout appel de chat-completions : transmettez une clé API pour OrcaRouter, l’URL de base ci-dessus et l’identifiant de modèle dans le corps. N’utilisez pas un nom générique tel que Qwen3.8 Max ou qwen3.8 ; la liste exige qwen/qwen3.8-max-0902. Le même identifiant de modèle doit être utilisé dans les requêtes HTTP directes vers l’URL de base, où le chemin et la charge utile suivent le contrat compatible OpenAI exposé par OrcaRouter. Parce qu’il est compatible OpenAI, le code existant écrit pour les chat-completions OpenAI peut généralement être migré en modifiant les paramètres base_url et model, bien que les détails d’authentification doivent correspondre aux exigences d’OrcaRouter.
Pour une complétion de chat compatible OpenAI, des paramètres tels que model, messages et la limite de jetons de sortie sont traités comme pour les autres modèles compatibles. Les faits indiquent un maximum de sortie de 131 072 jetons ; par conséquent, si vous définissez une limite de sortie, elle ne doit pas dépasser 131 072. La limite de sortie par défaut n’est pas précisée dans les faits. Temperature, top-p, stop et autres paramètres d’échantillonnage ne sont pas documentés dans les faits du modèle fournis ; suivez donc la documentation de l’API OrcaRouter et la sémantique standard des paramètres OpenAI. Pour l’entrée d’images et de vidéos, utilisez le format de contenu multimodal attendu par l’API OrcaRouter ; les faits ne fournissent pas d’exemple. Si l’API renvoie une erreur concernant des noms de paramètres non pris en charge, vérifiez si votre SDK envoie des paramètres hérités. La fenêtre de contexte est de 1 000 000 de jetons, l’invite doit donc maintenir tous les jetons d’entrée, y compris ceux des images et des vidéos, sous cette limite. Les réponses sont comptées séparément dans le maximum de 131 072 jetons.
Comme OrcaRouter propose une API compatible OpenAI à l'adresse https://api.orcarouter.ai/v1, la migration est surtout un changement de configuration. Remplacez l'URL de base par https://api.orcarouter.ai/v1, remplacez le champ de clé API par une clé OrcaRouter et définissez le modèle sur qwen/qwen3.8-max-0902. Si votre code utilise une bibliothèque cliente compatible OpenAI, mettez à jour base_url et api_key du client et laissez la plupart des structures de messages intactes, en supposant que le format multimodal correspond à ce modèle. Les informations disponibles ne disent pas si ce modèle prend en charge chaque paramètre spécifique à OpenAI ; avant de migrer, examinez donc les paramètres que votre application envoie. De plus, comme la limite de contexte est de 1 000 000 et que la sortie maximale est de 131 072, ajustez la logique de troncature des requêtes à ces limites. Tout code existant qui a codé en dur une longueur de contexte maximale différente devra peut-être être mis à jour. Enfin, confirmez que les attentes de votre application en matière de traitement des données sont conformes aux conditions d'OrcaRouter, car les informations sur le modèle ne traitent pas de la conservation des données.
Le principal critère de comparaison est le contrat d'entrée. Qwen3.8 Max (0902) accepte le texte, l'image et la vidéo ; une alternative texte uniquement supprimerait donc ces modalités. Si votre charge de travail réelle ne contient que du texte, un modèle texte uniquement avec un contexte suffisamment large est probablement un choix plus direct et peut avoir une tarification différente. Les caractéristiques du modèle n'incluent pas de comparaisons de précision ou de vitesse avec d'autres modèles : vous ne pouvez donc pas choisir en fonction de scores de qualité publics. Vous pouvez comparer les attributs structurels : une alternative texte uniquement peut avoir un contexte plus petit, une limite de sortie plus courte ou un prix d'entrée inférieur. OrcaRouter facture ce modèle à 2,00 $ l'entrée et 6,00 $ la sortie pour 1 000 000 de jetons. Le fait qu'il propose des entrées image et vidéo n'est utile que si ces entrées sont effectivement utilisées. Si elles ne le sont pas, vous payez peut-être pour une capacité multimodale sans rapport avec la tâche.
Choisissez Qwen3.8 Max (0902) lorsque le profil de la tâche correspond aux caractéristiques listées. Premièrement, vous avez besoin d’une fenêtre de contexte de 1 000 000 de tokens, car le contenu source ne peut pas être raccourci pour tenir dans une fenêtre plus petite. Deuxièmement, vous avez besoin d’images et de vidéos en entrée dans le même prompt, ou vous prévoyez ces modalités dans de futures requêtes. Troisièmement, vous souhaitez un maximum de sortie pouvant atteindre 131 072 tokens. Si votre charge de travail ne correspond à aucune de ces exigences, de nombreux avantages de cette offre ne seront pas exploités. Ne le choisissez pas parce que le nom Max semble puissant ; cette offre ne présente aucun résultat de benchmark. Comme OrcaRouter expose les modèles via la même API compatible OpenAI, changer l’identifiant du modèle est simple ; vous pouvez donc tester ce modèle contre un autre candidat sur votre propre tâche. N’oubliez pas que les prix d’entrée et de sortie diffèrent et qu’aucun tarif de cache n’est spécifié pour ce modèle.
Lorsque vous comparez les coûts, normalisez d'abord sur la même base de jetons (tokens). Ce modèle facture 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie, répercutés directement depuis le fournisseur sans marge. Un modèle concurrent avec un prix par jeton d'entrée plus bas peut en réalité être moins cher pour une requête utilisant l'ensemble du contexte, mais il faut également tenir compte de la fenêtre de contexte et de la sortie maximale. Par exemple, une requête d'un million de jetons peut utiliser l'intégralité du contexte de ce modèle en un seul appel ; un modèle avec un contexte de 200 000 jetons nécessiterait plusieurs appels, et les passes supplémentaires de sortie ou de résumé peuvent modifier le prix total. Les faits fournis ne contiennent pas de valeurs objectives de précision ou de latence, donc toute comparaison de coût par réponse correcte doit provenir de vos propres tests. Vérifiez également si un modèle concurrent impose des frais séparés pour les jetons d'image ou de vidéo, car ceux-ci ne sont pas décrits ici. En cas de doute, exécutez une charge de travail typique sur OrcaRouter et comparez l'utilisation mesurée des jetons et la qualité des réponses plutôt que de vous fier uniquement aux tarifs affichés.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $2.00 |
| Sortie / 1M tokens | $6.00 |
| Lecture cache / 1M | $0.250 |
| Écriture cache / 1M | $2.50 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/qwen/qwen3.8-max-0902Ouvrir @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902