Qwen3.5 122B-A10B — MoE multimodal à poids ouvert (texte/image/vidéo), 122B paramètres totaux / 10B paramètres actifs, contexte de 32k (mode vision).
Qwen3.5-122B-A10B est un grand modèle de langage de la série Qwen d'Alibaba Cloud. Il utilise une architecture de mixture-of-experts (MoE) où seulement 10 milliards de paramètres sont activés par…
En fonction de ses architectures et de son score de référence, le Qwen3.5-122B-A10B excelle dans les tâches qui impliquent un raisonnement en plusieurs étapes, l'utilisation d'outils et le suivi d'instructions. Le score τ²-Bench de 93,6 indique une performance solide sur un benchmark qui exige du modèle qu'il planifie et exécute des séquences d'actions à l'aide d'outils (par exemple, calculatrices, moteurs de recherche, interpréteurs de code). Cela le rend adapté à la construction d'agents autonomes qui doivent interagir avec des systèmes externes. Le modèle gère également des entrées multimodales, donc des tâches comme le raisonnement visuel, l'analyse de documents avec images intégrées ou le résumé vidéo font partie de ses points forts. De plus, sa grande limite de sortie lui permet de générer des explications détaillées, des complétions de code ou des données structurées en une seule réponse. Les développeurs travaillant sur des chatbots complexes, des assistants de codage ou des outils d'analyse de recherche pourraient trouver ce modèle efficace.
Bien que Qwen3.5-122B-A10B soit puissant, ce n'est pas le choix le plus rentable pour chaque cas d'utilisation. Si votre tâche est une classification simple, une génération de texte court, ou un Q&A simple qui ne nécessite pas de raisonnement multi-étapes ou de compréhension multimodale, vous pouvez obtenir des résultats satisfaisants avec un modèle plus petit comme Qwen-7B ou un modèle non multimodal. Ces modèles peuvent être plus rapides et moins chers par token. De plus, si vos besoins en contexte sont très petits (par exemple, moins de 1 000 tokens), le surcoût relatif d'utilisation d'un modèle de 122B paramètres peut ne pas en valoir la peine. OrcaRouter propose une gamme de modèles avec différentes caractéristiques de prix et de performance. Vous pouvez d'abord expérimenter avec des modèles plus petits et passer à un modèle supérieur uniquement si la qualité est insuffisante. De plus, si vous n'avez pas besoin de la limite de sortie de 65K, un modèle avec une sortie plus courte peut suffire.
Le modèle dispose d'une fenêtre de contexte de 32,768 jetons et d'une sortie maximale de 65,536 jetons, ce qui lui permet de gérer des chaînes de raisonnement étendues et des instructions longues. Le score élevé τ²-Bench suggère qu'il peut maintenir une cohérence sur plusieurs étapes et suivre correctement des instructions complexes impliquant une logique conditionnelle, des appels d'outils et des ramifications. En pratique, les utilisateurs ont rapporté que les modèles de la série Qwen3.5 sont compétitifs avec d'autres modèles de pointe sur des tâches telles que la résolution de problèmes mathématiques, la génération de code et les énigmes logiques. Cependant, comme tous les grands modèles, la performance peut se dégrader si le contexte est rempli d'informations non pertinentes ou si les instructions sont ambiguës. L'ingénierie des invites est recommandée pour guider le modèle efficacement. Le modèle peut également avoir des difficultés avec des documents très longs (proches de la limite de contexte) où il doit rappeler des détaires du début.
L’entrée multimodale (texte + image/vidéo) permet plusieurs applications pratiques. En analyse documentaire, le modèle peut lire à la fois le texte et les graphiques, diagrammes ou signatures intégrés dans un PDF ou une image. Par exemple, il peut extraire des données d’un tableau scanné ou interpréter un graphique. Dans le cadre du questionnement visuel, le modèle peut répondre à des questions sur une photographie ou une illustration. En analyse vidéo, il peut traiter des images pour décrire des scènes ou suivre des changements au fil du temps. Les développeurs peuvent créer des outils d’accessibilité (par exemple, décrire des images pour les utilisateurs malvoyants) ou d’automatisation (par exemple, analyser des captures d’écran d’interface utilisateur). Comme le modèle est accessible via OrcaRouter, ces capacités peuvent être intégrées dans des applications existantes avec les mêmes appels API que ceux utilisés pour les invites textuelles, simplement en incluant image_url ou video_url dans le contenu du message.
Le seul benchmark publié pour ce modèle est le τ²-Bench, sur lequel il a obtenu un score de 93,6. Le τ²-Bench est conçu pour évaluer la capacité d'un modèle à utiliser des outils et à réaliser des tâches en plusieurs étapes dans un environnement simulé. Un score de 93,6 indique que le modèle peut correctement accomplir une grande proportion de ces tâches. Pour contexte, ce score est compétitif avec d'autres modèles de pointe sur le même benchmark. Cependant, les scores de benchmark ne se traduisent pas toujours par des performances réelles, car les tâches peuvent varier en difficulté et le benchmark peut ne pas couvrir tous les domaines. Les utilisateurs devraient mener leurs propres évaluations sur leurs tâches spécifiques. Aucun autre score de benchmark (par exemple, MMLU, HumanEval ou des benchmarks multimodaux) n'est fourni dans les faits disponibles, il n'est donc pas possible de comparer ce modèle sur un ensemble plus large de métriques standard.
Forces : Le modèle obtient un score élevé sur un benchmark d'utilisation d'outils, ce qui suggère un fort raisonnement et un bon suivi des instructions. Sa capacité multimodale et sa grande limite de sortie le rendent polyvalent. L'architecture MoE peut offrir un bon équilibre entre performance et efficacité (du moins par rapport à un modèle dense de taille totale similaire). Limitations : Le modèle ne dispose que d'une fenêtre de contexte de 32 768 jetons, ce qui est modéré comparé à certains modèles offrant 100K ou plus. Les paramètres activés (10B) sont relativement faibles pour un modèle de cette taille totale, ce qui pourrait limiter les performances sur des tâches très complexes. Aucune information n'est disponible sur la latence, le débit ou les exigences matérielles. De plus, comme le modèle est récent, l'écosystème communautaire (scripts de fine-tuning, outils de quantification, etc.) peut être moins développé que pour des modèles plus établis. Les utilisateurs devraient tester le modèle minutieusement.
Aucun chiffre spécifique de latence ou de débit n'est disponible pour ce modèle sur OrcaRouter. La vitesse d'inférence dépend de facteurs tels que la longueur de l'entrée, la longueur de la sortie, la taille du lot et le matériel sous-jacent alloué par OrcaRouter. Les modèles MoE peuvent avoir une vitesse variable car le mécanisme de routage peut activer différents experts pour différents tokens. En général, les modèles avec 10B paramètres activés peuvent générer à des vitesses modérées sur les GPU modernes, mais le total de 122B paramètres en mémoire peut entraîner une utilisation mémoire plus élevée et des temps de préremplissage plus longs. Si une faible latence est critique, vous voudrez peut-être tester le modèle avec vos prompts typiques. L'API d'OrcaRouter renvoie des horodatages et des métriques de performance dans les en-têtes de réponse qui peuvent vous aider à mesurer la vitesse. Pour les applications sensibles à la latence, envisagez d'utiliser un modèle plus petit si la tâche le permet.
Les faits disponibles incluent uniquement un seul benchmark : τ²-Bench. Les benchmarks courants tels que MMLU (connaissances), HumanEval (code), GSM8K (mathématiques) ou les benchmarks multimodaux comme MMBench ne sont pas fournis. Cela rend difficile l'évaluation des performances du modèle sur des tâches qui ne sont pas liées aux outils. Par exemple, si votre application nécessite une exactitude factuelle, vous souhaiteriez connaître ses performances sur MMLU. De même, pour les tâches multimodales, des scores sur un benchmark de raisonnement visuel seraient utiles. L'absence de ces scores n'implique pas de mauvaises performances, mais signifie que les utilisateurs doivent effectuer leurs propres évaluations. OrcaRouter peut fournir des résultats de benchmark supplémentaires sur demande ou dans la documentation. En attendant que davantage de données soient disponibles, il est conseillé de comparer qualitativement le modèle avec d'autres sur votre domaine spécifique.
Les détails de tarification pour Qwen3.5-122B-A10B sur OrcaRouter ne sont pas explicitement fournis dans les faits disponibles. Généralement, OrcaRouter facture par token pour l'entrée et la sortie, avec des tarifs distincts pour les tokens de prompt et les tokens générés. Les entrées multimodales (images/vidéo) sont facturées comme des équivalents de tokens en fonction du nombre de blocs d'image ou d'images vidéo traités. Certains fournisseurs offrent également des tarifs réduits pour les hits de cache si l'utilisateur répète le même prompt. Pour obtenir une tarification exacte, les utilisateurs doivent se référer à la page de tarification d'OrcaRouter ou contacter leur équipe commerciale. Étant donné que ce modèle a 122B paramètres au total et est multimodal, son prix par token peut être plus élevé que celui des modèles plus petits ou purement textuels. Il est important de prendre en compte le coût des tokens pour les images/vidéo lors de l'estimation des dépenses totales pour une tâche.
Utiliser un modèle plus grand comme Qwen3.5-122B-A10B entraîne généralement des coûts par jeton plus élevés que les modèles plus petits. Cependant, si le modèle peut résoudre une tâche en moins d'étapes ou avec moins de jetons grâce à ses capacités, le coût total peut rester compétitif. La limite de sortie étendue (65 536 jetons) peut être à la fois un avantage et un risque de coût : générer de longues sorties peut rapidement accumuler des coûts de jetons. De plus, les entrées multimodales consomment plus de jetons par invite que les invites textuelles seules. Par exemple, une seule image haute résolution peut coûter des centaines de jetons. Si votre tâche ne nécessite pas toutes les capacités du modèle, vous pouvez économiser de l'argent en choisissant un modèle plus petit. OrcaRouter propose probablement des tableaux de bord d'utilisation et des contrôles de coûts, comme la définition d'un nombre maximum de jetons de sortie ou des alertes de budget, ce qui peut aider à gérer les dépenses.
Les faits disponibles ne mentionnent aucune remise de cache pour ce modèle sur OrcaRouter. De nombreux fournisseurs d'inférence proposent la mise en cache des invites, où le texte répété dans les invites système ou les messages utilisateur est stocké temporairement et facturé à un tarif réduit. Si OrcaRouter prend en charge la mise en cache, cela pourrait réduire les coûts pour les applications qui utilisent de longues invites statiques (par exemple, instructions système, descriptions de personnages). Cependant, sans documentation spécifique, cela ne devrait pas être supposé. Les utilisateurs peuvent vérifier les en-têtes de réponse API pour les indicateurs de succès du cache si la mise en cache est implémentée. Pour minimiser les coûts, vous pouvez concevoir des invites pour éviter de répéter les mêmes longs préfixes en séparant les instructions statiques du contenu dynamique. Envisagez également d'utiliser des fenêtres de contexte plus courtes ou d'omettre les images inutiles lorsque cela est possible.
Pour utiliser Qwen3.5-122B-A10B, envoyez une requête POST à l'endpoint de l'API OrcaRouter à l'adresse https://api.orcarouter.ai/v1/chat/completions. Définissez le paramètre model sur "qwen/qwen3.5-122b-a10b". L'API est entièrement compatible avec le format de chat completions d'OpenAI, vous pouvez donc utiliser les mêmes bibliothèques clientes (par exemple, la bibliothèque Python openai) en modifiant l'URL de base et la clé API. Le corps de la requête inclut des messages (chacun avec un rôle et un contenu), et optionnellement des paramètres comme temperature, max_tokens, top_p, etc. Pour une entrée multimodale, utilisez un bloc de contenu avec type: "image_url" pour les images ou la gestion vidéo spécifique du modèle (probablement via des trames encodées en base64 ou une URL). L'API renverra une réponse JSON avec le texte généré et les métadonnées d'utilisation (comptes de tokens). La documentation d'OrcaRouter fournit plus de détails sur les paramètres pris en charge.
Le modèle prend en charge les paramètres de chat standard : temperature (par défaut 0,7), top_p (par défaut 0,9), max_tokens (jusqu'à la sortie maximale du modèle de 65 536), presence_penalty, frequency_penalty et stop sequences. La limite de la fenêtre de contexte est de 32 768 tokens, ce qui inclut tous les messages, images et trames vidéo. Si le nombre total de tokens dépasse cette limite, l'API renverra une erreur ou tronquera l'entrée (selon les paramètres). Le paramètre max_tokens ne peut pas dépasser 65 536. Pour les requêtes multimodales, notez que les images et les vidéos ajoutent des tokens ; le taux de conversion exact n'est pas fourni, mais les images haute résolution ou les longues vidéos peuvent rapidement consommer la fenêtre de contexte. OrcaRouter peut également prendre en charge le mode de streaming, où les réponses sont diffusées token par token, ce qui est utile pour les applications en temps réel. Consultez la référence de l'API pour des options supplémentaires comme logprobs ou tools.
La migration est simple : remplacez votre URL de base par https://api.orcarouter.ai/v1, utilisez l'ID du modèle "qwen/qwen3.5-122b-a10b", et fournissez votre clé API OrcaRouter. Le format des requêtes est identique à celui de l'API OpenAI chat completions. Par exemple, en Python avec la bibliothèque openai, vous pouvez définir client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Ensuite, appelez client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Si votre application utilise l'appel de fonctions ou des outils, notez que le modèle les prend en charge car il est entraîné sur τ²-Bench qui implique l'utilisation d'outils. Cependant, la syntaxe exacte des appels d'outils peut différer de celle d'OpenAI ; OrcaRouter supporte probablement le format OpenAI, mais testez pour confirmer. Pour les entrées multimodales, votre code existant qui envoie image_url dans les messages peut fonctionner tant que le modèle prend en charge ce format.
Au sein de la famille Qwen, ce modèle se situe entre les petits modèles denses (par exemple, Qwen-7B, Qwen-14B) et les plus grands modèles MoE (par exemple, Qwen3.5-235B). Comparé aux modèles denses, ce modèle MoE peut accéder à un ensemble de paramètres total plus vaste, mais n'en active qu'une fraction par jeton, ce qui peut permettre des experts plus spécialisés. Cela peut conduire à de meilleures performances sur une variété de tâches, en particulier celles nécessitant des connaissances diverses. Cependant, les petits modèles denses peuvent être plus rapides et moins coûteux pour des tâches étroites. Comparé au plus grand Qwen3.5-235B, ce modèle a probablement des performances inférieures mais est plus efficace. Le support multimodal est une caractéristique commune de la génération Qwen3.5 ; les versions antérieures (Qwen2, Qwen1) étaient uniquement textuelles. Les utilisateurs devraient comparer les résultats de référence sur leurs tâches spécifiques pour décider quel modèle convient le mieux.
Les comparaisons directes sont difficiles sans mesures de référence complètes. Qwen3.5-122B-A10B atteint 93,6 sur τ²-Bench, ce qui est un résultat solide pour les tâches d'utilisation d'outils. À titre de référence, les scores similaires sur ce benchmark pour d'autres modèles ne sont pas fournis, mais cela est considéré comme une capacité de haut niveau. En termes d'architecture, les modèles Llama sont denses et plus simples, tandis que les modèles Claude ont des architectures propriétaires différentes. Qwen3.5 offre une entrée multimodale (image/vidéo) que Claude prend en charge, mais Llama 3.2 et 3.1 sont uniquement textuels (à l'exception de certaines variantes vision). La fenêtre de contexte de 32K est inférieure aux 100K ou 200K de Claude, mais comparable aux 128K de Llama 3.1 ? Pas exactement ; il ne faut pas inventer de chiffres. Pour le code et le raisonnement, de nombreux modèles sont compétitifs. L'avantage de ce modèle pourrait être son ajustement spécifique pour l'utilisation d'outils (score élevé sur τ²-Bench) et l'efficacité multimodale MoE. Cependant, Claude et Llama disposent d'écosystèmes plus vastes et d'un plus grand soutien de la communauté.
Peu de modèles combinent entrée multimodale, grande fenêtre de contexte, grande limite de sortie et un score élevé τ²-Bench dans un seul ensemble. La série Qwen3.5 est conçue pour être un modèle polyvalent compétent avec de solides compétences de raisonnement et d'utilisation d'outils. L'architecture MoE avec 122B au total et 10B actifs lui permet de contenir beaucoup de connaissances tout en gardant les coûts d'inférence plus bas qu'un modèle dense de 122B. Cela dit, d'autres modèles MoE comme Mixtral 8x7B (total 47B, actifs 13B) ont des compromis différents. Qwen3.5-122B-A10B a un nombre total de paramètres beaucoup plus grand mais moins de paramètres actifs par jeton (10B contre 13B). Le support multimodal est un différenciateur ; Mixtral est uniquement textuel. Dans le domaine des MoE multimodaux, des modèles comme Qwen-VL ou d'autres existent mais ont souvent des fenêtres de contexte plus petites. Ce modèle est positionné comme une option solide pour les développeurs qui ont besoin d'un seul modèle pour des tâches diverses, multimodales et lourdes en outils sur OrcaRouter.
Choisissez Qwen3.5-122B-A10B si votre application nécessite à la fois une compréhension multimodale et un raisonnement complexe en plusieurs étapes, et si vous avez besoin de la grande limite de sortie pour générer de longues réponses. C'est également un bon choix si vous construisez des systèmes agentiques qui utilisent des outils, compte tenu de son score élevé au τ²-Bench. Si votre tâche est uniquement textuelle et ne nécessite pas de capacité supplémentaire, un modèle moins cher comme Llama 3.1 70B ou Qwen-14B pourrait suffire. Si vous avez besoin d'une fenêtre de contexte plus grande (par exemple, >100K tokens), envisagez des modèles spécialement conçus pour les longs contextes. Si vous avez besoin d'une latence plus faible, un modèle plus petit ou dense pourrait être meilleur. Étant donné qu'OrcaRouter propose de nombreux modèles, vous pouvez en évaluer plusieurs via la même API pour trouver le meilleur rapport coût-qualité pour vos objectifs. L'identifiant du modèle est qwen/qwen3.5-122b-a10b.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Palier | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Palier sélectionné selon le nombre de tokens d'entrée de chaque requête | ||
Estimation basée sur le tarif public
Tarification par paliers — cette estimation utilise les tarifs du palier de base.
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/qwen/qwen3.5-122b-a10bOuvrir @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b