Qwen3.8-Max est le nouveau modèle phare d'Alibaba dans la gamme Qwen et son niveau de capacité le plus élevé à ce jour. Alibaba le positionne directement contre GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro dans son propre guide de migration, le recommandant chaque fois qu'une tâche nécessite le raisonnement le plus fort disponible — analyse complexe en plusieurs étapes, dérivation logique approfondie et travail d'agent exigeant. Il est nativement multimodal, répertorié par Alibaba à la fois pour la génération de texte et la compréhension d'images/vidéos : il accepte du texte, des images et des vidéos et renvoie du texte, avec une fenêtre de contexte de 1 million de jetons. La matrice de capacités officielle confirme une prise en charge complète du mode de raisonnement, de l'appel de fonction, des outils intégrés et des sorties structurées, ce qui en fait un remplacement direct pour les frameworks d'agents et les pipelines d'appel d'outils. Qwen3.8-Max est servi via trois formats de transmission — compatible OpenAI, compatible Anthropic et DashScope natif — à Pékin, Singapour, Tokyo, Francfort et en Virginie. Le raisonnement est activé/désactivé avec le paramètre enable_thinking (ou reasoning.effort sur l'API Responses). C'est le niveau premium de la famille : choisissez-le lorsque la précision sur des problèmes difficiles prime sur le coût, et passez à Qwen3.7-Plus ou Qwen3.7-Flash pour le volume quotidien.
Qwen3.8 Max est un modèle de langage multimodal de grande taille de la famille Qwen, disponible via OrcaRouter avec l'identifiant de modèle « qwen/qwen3.8-max ». Le fournisseur est qwen. Il dispose…
D'après les faits du catalogue, Qwen3.8 Max est un modèle de langage multimodal qui accepte des entrées de texte, d'image et de vidéo. Cela le rend adapté à des tâches telles que le résumé d'un long document, la réponse à des questions sur une image ou l'analyse de contenu vidéo. Le modèle est censé gérer la génération de texte générale et le raisonnement, car il fait partie de la famille Qwen des grands modèles de langage. Cependant, aucune liste de tâches spécifique ni aucun score de référence n'est inclus dans la liste d'OrcaRouter. Vous devez tester le modèle avec vos propres invites pour confirmer qu'il produit le style et la précision dont vous avez besoin. Comme l'API est compatible OpenAI, vous pouvez envoyer une petite requête via OrcaRouter sans modifier votre code existant. Les jetons de sortie du modèle sont facturés à 6,00 $ pour 1 million de jetons, donc prévoyez des coûts de génération en plus des coûts d'entrée. Pour de meilleurs résultats, fournissez des invites claires et n'incluez que le contexte pertinent.
Pour utiliser des entrées d'image et de vidéo avec Qwen3.8 Max, envoyez-les comme parties de contenu dans un message de chat à l'API compatible OpenAI d'OrcaRouter. Le format de chat OpenAI standard permet un tableau de contenu avec une partie texte et une partie image_url. L'entrée vidéo peut nécessiter un format spécifique, qui n'est pas détaillé dans l'entrée du catalogue ; le fournisseur qwen liste la vidéo comme modalité acceptée. Une approche courante consiste à passer les frames de la vidéo comme une séquence d'images ou à utiliser un encodage vidéo spécifique au fournisseur si OrcaRouter le prend en charge. Le modèle traitera ensuite les informations visuelles avec le prompt texte. N'oubliez pas que toute entrée visuelle est comptée comme des jetons, et les jetons sont facturés à $2.00 pour 1M de jetons d'entrée. Si votre vidéo est longue, le nombre de jetons peut être élevé, alors testez d'abord avec un petit échantillon. Confirmez le schéma de message exact dans la documentation d'OrcaRouter avant de construire le code de production.
Qwen3.8 Max est proposé au prix de 2,00 $ par million de jetons d'entrée et de 6,00 $ par million de jetons de sortie. Si vos prompts sont courts, si vos données sont uniquement textuelles ou si vous n'avez pas besoin d'un contexte de 1 000 000 de jetons, un modèle moins cher vous donnera probablement des résultats similaires à un coût inférieur. De nombreux modèles textuels uniquement sur OrcaRouter proposent des tarifs par jeton plus bas et des temps de réponse plus rapides pour des tâches telles que la classification, l'extraction, le résumé et la conversation ordinaire. Vous devriez choisir Qwen3.8 Max lorsque la tâche bénéficie réellement d'un grand contexte ou de la combinaison de texte avec des images ou des vidéos. Vous devriez également comparer la qualité des résultats sur votre charge de travail spécifique, car le prix n'est pas le seul facteur. Pour les applications à grand volume, un modèle peu coûteux avec une qualité acceptable est souvent la meilleure décision commerciale. Estimez la taille moyenne des entrées par requête et multipliez-la par le tarif pour voir où se situe le seuil de rentabilité.
Les meilleurs cas d'utilisation de Qwen3.8 Max découlent de ses capacités répertoriées : une fenêtre de contexte de 1 000 000 de jetons et une entrée texte, image et vidéo. Cela inclut la réponse à des questions sur des documents longs, le résumé de livres entiers, l'analyse de contrats, la revue de code et les tâches multimodales où vous devez comprendre des captures d'écran, des graphiques ou des images vidéo. Il est également utile pour traiter la transcription complète d'une vidéo en un seul appel, plutôt que de la découper en segments. Étant donné que la sortie coûte 6,00 $ par million de jetons, vous devriez viser des réponses concises même lorsque l'entrée est longue. Si vous n'avez besoin que de répondre à une question courte à partir d'un petit paragraphe, ce modèle est excessif et coûteux. Le modèle est particulièrement adapté lorsque l'entrée est volumineuse, multimodale, ou les deux, et que la réponse dépend de tout ce contenu. Utilisez des modèles plus petits pour les tâches de génération à grand volume.
L'entrée du catalogue pour Qwen3.8 Max sur OrcaRouter ne répertorie aucun score de benchmark. Nous ne fournissons pas de chiffres issus d'évaluations externes car aucun ne s'appuie sur les faits fournis. En général, les scores de benchmark mesurent les performances d'un modèle sur des tâches telles que les connaissances générales, le raisonnement, le codage et la compréhension multimodale, selon le benchmark. Sans scores officiels pour Qwen3.8 Max, vous ne pouvez pas vous fier à une seule métrique. La méthode appropriée pour évaluer le modèle est de l'exécuter sur votre propre ensemble de validation en utilisant l'API compatible OpenAI d'OrcaRouter. Comparez les sorties sur plusieurs prompts et vérifiez la cohérence. Si vous voyez plus tard des scores de benchmark publiés par le fournisseur, traitez-les comme un signal parmi d'autres, et non comme la preuve que votre cas d'utilisation fonctionnera. Un modèle qui obtient des scores élevés sur un benchmark général peut toujours échouer sur des entrées spécifiques à un domaine, donc les tests directs sont importants.
Aucune mesure de latence ou de débit n'est fournie pour Qwen3.8 Max dans la fiche du catalogue sur OrcaRouter. La vitesse de réponse dépend de l'infrastructure du fournisseur qwen, de la taille de votre entrée et de la charge actuelle sur OrcaRouter. Une requête avec 1 000 000 de tokens d'entrée prendra plus de temps qu'une invite courte, car le modèle doit traiter l'intégralité du contexte avant de générer une sortie. La longueur de la sortie affecte également le temps total ; générer de nombreux tokens prend du temps. Si la vitesse est critique, gardez les tailles d'entrée et de sortie aussi réduites que possible. Vous pouvez mesurer le temps jusqu'au premier token en diffusant la réponse via l'API d'OrcaRouter. Comme aucune donnée officielle de vitesse n'existe, ne présumez pas d'un temps de réponse particulier. Effectuez votre propre test avec une taille d'invite réaliste et mesurez-le. La latence peut également varier selon la région et le moment de la journée. Le fournisseur peut limiter les requêtes volumineuses.
Les forces de Qwen3.8 Max reposent sur la fiche catalogue : une fenêtre de contexte de 1 000 000 de jetons et la prise en charge des entrées texte, image et vidéo. Cette combinaison est utile pour les tâches qui nécessitent de lire une grande quantité de contenus diversifiés en une seule requête. Les limites honnêtes sont qu'aucun score de benchmark ni chiffre de vitesse n'est répertorié, vous ne pouvez donc pas vérifier la qualité à partir du catalogue seul. Le prix d'entrée de 2,00 $ par million de jetons est plus élevé que celui de nombreux modèles plus petits, et le prix de sortie de 6,00 $ par million de jetons signifie que les réponses longues ne sont pas bon marché. Le modèle n'est peut-être pas le meilleur choix pour les applications courtes, textuelles uniquement ou sensibles à la latence. Vous devez évaluer Qwen3.8 Max sur vos propres données via OrcaRouter avant d'en faire une dépendance de production. Fiez-vous à l'observation directe plutôt qu'aux allégations marketing. Pour les tâches qui tiennent dans une petite fenêtre, un modèle moins cher est préférable.
Qwen3.8 Max est facturé au tarif du fournisseur, soit 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie. OrcaRouter n'applique aucune marge : le prix du token que vous voyez est celui que vous payez. Aucun frais fixe par requête n'est mentionné dans la fiche du catalogue. Le coût d'une requête est calculé en comptant chaque token d'entrée, y compris les tokens de texte, d'image et de vidéo, et en multipliant par 2,00 $ par million de tokens. Les tokens de sortie sont comptés séparément et multipliés par 6,00 $ par million de tokens. Par exemple, une requête avec 250 000 tokens d'entrée et 5 000 tokens de sortie coûte 0,50 $ pour l'entrée et 0,03 $ pour la sortie. Les frais réels apparaîtront sur votre facture OrcaRouter. Si vous utilisez le contexte complet de 1 million, le coût d'entrée seul est de 2,00 $. Il n'y a aucun autre frais répertorié.
La fenêtre de contexte complète de Qwen3.8 Max est de 1 000 000 de jetons. À 2,00 $ par million de jetons en entrée, une requête qui utilise toute la fenêtre coûte 2,00 $ pour l'entrée avant toute génération de sortie. Si la sortie est importante, vous payez également 6,00 $ par million de jetons en sortie. Les entrées visuelles consomment rapidement des jetons, donc inclure des images ou de nombreuses images vidéo peut faire monter le nombre de jetons d'entrée bien au-delà de ce que vous pourriez attendre d'un texte seul. Ce modèle de tarification signifie qu'il n'y a pas de coût fixe par appel ; vous ne payez que pour les jetons utilisés. Cela signifie également qu'une invite avec 100 000 jetons coûte 0,20 $, tandis qu'une invite avec 1 000 000 de jetons coûte 2,00 $. Si votre tâche ne nécessite que quelques milliers de jetons de contexte, la valeur de Qwen3.8 Max est plus difficile à justifier. Envisagez des modèles plus petits dans ces cas.
L'entrée du catalogue pour Qwen3.8 Max ne mentionne pas la mise en cache. L'API compatible OpenAI d'OrcaRouter peut prendre en charge les cache hits standard rapportés par le fournisseur, mais les caractéristiques du modèle ne le confirment pas. Sans mise en cache confirmée, vous devez supposer que chaque token d'entrée est facturé au tarif standard de 2,00 $ pour 1M de tokens. Certains fournisseurs mettent automatiquement en cache un préfixe de votre prompt et facturent moins pour les tokens répétés, mais cela n'est pas indiqué pour ce modèle. Vous pouvez vérifier l'objet usage dans la réponse de l'API d'OrcaRouter pour les champs cached_token ; si le fournisseur les signale, vous verrez la réduction. Sinon, prévoyez le coût d'entrée complet par requête. Le plan le plus sûr est de tester avec des prompts identiques répétés et d'inspecter l'utilisation des tokens dans la réponse. La mise en cache, si elle est absente, ne réduira pas votre facture.
Pour appeler Qwen3.8 Max, utilisez l'API compatible OpenAI d'OrcaRouter avec l'URL de base https://api.orcarouter.ai/v1. Définissez l'identifiant du modèle sur 'qwen/qwen3.8-max' dans le corps de la requête. L'endpoint est https://api.orcarouter.ai/v1/chat/completions. Vous envoyez un objet JSON avec un tableau de messages, où chaque message possède un rôle et un contenu. Pour une entrée texte uniquement, le contenu est une simple chaîne de caractères. Pour une entrée image ou vidéo, le contenu peut être un tableau de parties, conformément au format de vision d'OpenAI. Authentifiez-vous avec votre clé API OrcaRouter dans l'en-tête Authorization. OrcaRouter achemine la requête vers le fournisseur qwen. Aucune URL de base distincte spécifique au fournisseur n'est nécessaire. Utilisez un SDK OpenAI standard et définissez base_url sur l'URL d'OrcaRouter pour démarrer rapidement. La réponse suit le même format de complétions de chat que vous connaissez déjà.
Grâce à l'API compatible OpenAI d'OrcaRouter, vous pouvez définir des paramètres tels que temperature, top_p, max_tokens et les séquences d'arrêt (stop). Les paramètres pris en charge peuvent dépendre du backend du fournisseur qwen. Qwen3.8 Max dispose d'une fenêtre de contexte de 1 000 000 de tokens, donc le nombre total de tokens d'entrée et de sortie doit rester dans cette limite. La longueur maximale de sortie n'est pas indiquée dans l'entrée du catalogue ; consultez la documentation du modèle ou les messages d'erreur pour connaître cette limite. Vous pouvez utiliser le paramètre stream pour recevoir les tokens au fur et à mesure de leur génération, ce qui peut améliorer la latence perçue. Pour les entrées multimodales, le tableau du contenu du message doit inclure les types de parties corrects. Si un paramètre n'est pas pris en charge, OrcaRouter renverra une erreur et vous pourrez ajuster votre demande. Testez d'abord avec une petite charge utile (payload) pour confirmer le comportement des paramètres. C'est une pratique standard lors de l'intégration de tout nouveau modèle.
Si votre application utilise déjà l'API de chat completions d'OpenAI, la migration vers Qwen3.8 Max sur OrcaRouter est simple. Changez l'URL de base en https://api.orcarouter.ai/v1 et définissez la clé API sur votre clé OrcaRouter. Définissez le champ modèle sur 'qwen/qwen3.8-max'. La structure des messages reste la même, y compris les messages système, utilisateur et assistant. Pour les requêtes multimodales, utilisez le même format de parties de contenu que l'API vision d'OpenAI. Vous devrez peut-être mettre à jour vos prompts car Qwen3.8 Max est un modèle différent et peut répondre différemment. Testez avec quelques exemples de requêtes avant de modifier le trafic de production. Notez également que l'ID du modèle inclut le préfixe 'qwen/', c'est ainsi qu'OrcaRouter identifie le fournisseur. Aucune réécriture de code n'est nécessaire si votre SDK permet une URL de base personnalisée. Cela réduit l'effort de migration. Vous pouvez conserver la même logique de nouvelle tentative et de gestion des erreurs.
Qwen3.8 Max se distingue par sa fenêtre de contexte de 1 000 000 de jetons et sa prise en charge des entrées texte, image et vidéo. Les modèles Qwen plus petits ont généralement des fenêtres de contexte plus courtes et peuvent ne pas accepter les trois modalités. Étant donné qu'aucun score de référence n'est fourni pour Qwen3.8 Max sur OrcaRouter, une comparaison directe de qualité avec les modèles plus petits n'est pas possible à partir des informations du catalogue. La différence de prix est claire : Qwen3.8 Max facture 2,00 $ pour 1 million de jetons d'entrée et 6,00 $ pour 1 million de jetons de sortie. Les modèles plus petits facturent généralement moins par jeton et peuvent être plus rapides, mais leurs limites peuvent vous obliger à découper les entrées ou à abandonner les données visuelles. Si votre projet s'inscrit dans un contexte plus petit et n'a pas besoin d'entrée vidéo, un modèle plus petit est probablement plus économique. Si vous avez besoin de raisonner sur un long document ou une vidéo, Qwen3.8 Max est l'option conçue pour cela.
OrcaRouter héberge plusieurs modèles de différents fournisseurs, et Qwen3.8 Max est l'une des options multimodales. Ses caractéristiques principales sont une fenêtre de contexte de 1 000 000 de jetons et des capacités d'entrée en texte, image et vidéo. D'autres modèles multimodaux peuvent avoir des fenêtres de contexte plus petites ou une tarification différente par jeton. L'entrée de catalogue pour Qwen3.8 Max indique 2,00 $ pour 1 M de jetons d'entrée et 6,00 $ pour 1 M de jetons de sortie, avec une marge nulle sur OrcaRouter. Sans scores de référence, vous ne pouvez pas conclure quel modèle est le plus performant. Vous pouvez les comparer directement en envoyant les mêmes invites à chaque modèle via l'API compatible OpenAI d'OrcaRouter et en comparant la qualité des sorties, le temps de réponse et le coût. Le choix dépend de votre charge de travail spécifique et de la quantité de contexte dont vous avez réellement besoin. La prise en charge vidéo n'est pas universelle, c'est donc un différenciateur clé. Un modèle moins cher peut toujours être meilleur si vos invites sont petites.
Choisissez Qwen3.8 Max lorsque la tâche nécessite une grande fenêtre de contexte allant jusqu'à 1 000 000 de jetons, ou exige une entrée multimodale avec texte, image et vidéo. C'est un choix raisonnable pour l'analyse de documents longs, la compréhension de vidéos entières et le raisonnement image-plus-texte. Choisissez une alternative lorsque vos prompts sont courts, uniquement textuels, ou sensibles à la latence, et lorsqu'un modèle plus petit avec un prix de jeton inférieur peut offrir une qualité acceptable. Envisagez également des alternatives si vous avez besoin de scores de benchmark publiés ou d'un débit garanti, car ceux-ci ne sont pas répertoriés pour Qwen3.8 Max. La bonne décision dépend de votre consommation de jetons attendue, de votre tolérance aux coûts et de vos exigences de qualité. Réalisez une petite évaluation sur OrcaRouter avec les deux modèles et calculez le coût total par réponse réussie avant de passer en production. Il n'existe pas de modèle unique qui soit le meilleur pour chaque tâche.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Entrée / 1M tokens | $2.00 |
| Sortie / 1M tokens | $6.00 |
| Lecture cache / 1M | $0.250 |
| Écriture cache / 1M | $2.50 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/qwen/qwen3.8-maxOuvrir @misc{orcarouter_qwen3_8_max,
title = {Qwen3.8 Max API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max}
}Qwen. (2026). Qwen3.8 Max API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max