Qwen3-VL 235B-A22B Instruct — un modèle vision-langage à poids ouverts, 235B total / 22B paramètres actifs, contexte de 256k, pas de mode de réflexion.
Qwen3 VL 235B A22B Instruct est une variante vision-langage de la série de modèles Qwen3, développée par Alibaba Cloud. Elle utilise une architecture de mélange d'experts (MoE) avec 235 milliards de…
Le modèle excelle dans les tâches où les images et le texte interagissent. Il peut répondre à des questions sur le contenu d'une image, décrire des scènes en détail, lire du texte à partir de documents ou de panneaux, et raisonner sur les relations entre des objets dans une image. Il gère également plusieurs images dans une seule conversation, permettant l'analyse comparative ou le raisonnement séquentiel. Le réglage par instructions permet au modèle de suivre des prompts multimodaux complexes, tels que 'Explain why this chart shows a trend' ou 'Extract all numerical values from this table.' Ces capacités proviennent du grand backbone MoE et de l'entraînement spécialisé en vision-langage.
Étant une variante Instruct, le modèle a été affiné pour suivre les instructions de l'utilisateur avec une haute fidélité à travers des invites textuelles et multimodales. Il peut gérer des dialogues à plusieurs tours où des images sont introduites progressivement, maintenir le contexte sur plusieurs échanges, et suivre des instructions de formatage (par exemple, sortie en JSON, points de liste, ou étape par étape). Il fonctionne bien sur des tâches nécessitant le respect de contraintes, comme 'Répondre uniquement si l'image contient un chien.' Cela le rend adapté aux applications où un comportement cohérent et respectueux des règles est important.
Pour les tâches purement textuelles, sans composante visuelle, le modèle MoE de 235B peut être excessif ; des modèles denses plus petits ou d'autres variantes textuelles de Qwen seraient plus rentables. De même, si vos images sont simples (par exemple, des logos basiques, des objets uniques) ou si vous avez besoin d'un débit extrêmement élevé avec un budget limité, un modèle de vision plus petit comme Qwen2-VL 7B pourrait suffire. Ce modèle est le plus justifié lorsque vous devez traiter des images complexes et haute résolution, des documents avec du texte dense, ou des tâches nécessitant un raisonnement multimodal approfondi. Sur OrcaRouter, vous pouvez comparer les prix et changer facilement d'ID de modèle.
Non. Qwen3 VL 235B A22B Instruct est un modèle de génération de texte qui accepte uniquement des images en entrée. Il ne génère pas d'images, d'audio ni aucune autre modalité. La sortie est toujours une chaîne de caractères. Si vous avez besoin de génération d'images, vous utiliserez un modèle distinct. La force de ce modèle réside dans la compréhension et le raisonnement à partir d'entrées visuelles. Il peut, par exemple, décrire à quoi ressemble une image ou répondre à des questions à son sujet, mais il ne peut pas créer, modifier ou transformer des images lui-même.
Le score MMLU-Pro rapporté pour ce modèle est de 82,3. MMLU-Pro est une version améliorée du benchmark Massive Multitask Language Understanding, couvrant 57 sujets dans les domaines STEM, des sciences humaines et des sciences sociales. Un score de 82,3 indique une solide connaissance générale et un raisonnement sur des sujets variés. Il s'agit d'une moyenne unique ; les performances peuvent varier par sujet. Ce score place le modèle parmi les meilleurs de sa catégorie en termes de taille, compte tenu notamment de l'architecture MoE qui n'active qu'une fraction de ses paramètres totaux par requête.
Les points forts incluent une haute précision sur les benchmarks de raisonnement multimodal, un bon suivi des instructions, et une efficacité en termes de coût par rapport aux modèles denses avec un nombre total de paramètres similaire. La conception MoE permet de faire évoluer la capacité sans coût de calcul proportionnel. Les limitations incluent un coût absolu plus élevé par rapport aux modèles plus petits, un potentiel de latence accrue en raison du grand nombre total de paramètres (même si seuls 22B sont actifs, le modèle complet doit être chargé en mémoire). Il peut aussi occasionnellement halluciner des détails fins dans les images ou échouer sur des entrées visuelles très ambiguës. Les performances sur des tâches spécifiques à un domaine (par exemple, l'imagerie médicale) ne sont pas garanties.
La vitesse d'inférence dépend du backend matériel utilisé par OrcaRouter et de la charge actuelle. En tant que modèle MoE avec 235 milliards de paramètres au total, il nécessite une mémoire GPU importante même si seuls 22 milliards de paramètres sont activés par token. Cela entraîne généralement une latence par requête plus élevée par rapport aux modèles denses plus petits (par exemple, 7B-70B paramètres). Le débit est également influencé par la taille du lot et la longueur de la séquence. Pour les applications sensibles à la latence, envisagez d'utiliser un modèle plus petit ou d'optimiser pour des prompts plus courts. OrcaRouter ne fournit pas de garanties de latence spécifiques mais vise une réactivité de qualité production.
OrcaRouter facture exactement le tarif indiqué par le fournisseur : 0,40 $ par million de jetons d’entrée et 1,60 $ par million de jetons de sortie. Aucune majoration supplémentaire n’est appliquée. Les jetons d’entrée et de sortie sont comptés selon les règles de tokenisation d’OpenAI, qui peuvent légèrement différer du tokeniseur interne du modèle. Les images sont également facturées en jetons en fonction de leurs dimensions et du niveau de détail, conformément à la politique du fournisseur. Vous pouvez estimer les coûts en multipliant votre utilisation prévue de jetons par ces tarifs.
Le coût par jeton est plus élevé que celui des modèles plus petits ou denses, mais l’architecture MoE offre plus de capacité par paramètre actif qu’un modèle dense de taille active équivalente. Pour des tâches multimodales complexes, ce modèle peut accomplir la tâche en moins de jetons ou avec une précision supérieure, réduisant potentiellement les dépenses totales. Cependant, pour des tâches simples, un modèle moins cher réduirait les coûts. Sur OrcaRouter, vous pouvez changer de modèle à la volée, ce qui vous permet d’utiliser ce modèle uniquement lorsque nécessaire. Il n’y a pas d’engagements mensuels minimum ni de frais cachés.
OrcaRouter ne divulgue actuellement aucune politique de mise en cache spécifique pour ce modèle. Une mise en cache au niveau des tokens peut être appliquée par le fournisseur sous-jacent mais n'est pas garantie. Aucune remise en volume ou tarification par paliers n'est mentionnée ; les tarifs sont fixes par token. Pour les utilisateurs à volume élevé, il peut être utile de contacter le support OrcaRouter pour d'éventuels arrangements personnalisés. En général, la tarification est transparente et basée sur l'utilisation.
Les images sont converties en un nombre de tokens en fonction de leur résolution et du paramètre de détail. La formule exacte est définie par le fournisseur (Qwen) et peut varier. En général, les images de plus haute résolution consomment plus de tokens. OrcaRouter transmet la tokenisation du fournisseur sans modification. Vous pouvez maîtriser les coûts en redimensionnant les images ou en utilisant le mode faible détail si le modèle le prend en charge. Référez-vous toujours à la documentation du fournisseur pour le calcul précis des tokens des images. Les tokens d'entrée pour les images sont comptabilisés au taux de 0,40 $ par million.
Vous envoyez une requête POST à https://api.orcarouter.ai/v1/chat/completions avec une charge utile JSON compatible OpenAI. Définissez le champ model sur "qwen/qwen3-vl-235b-a22b-instruct". Incluez un tableau messages où chaque message peut contenir du texte et/ou du contenu image. Pour les images, utilisez le format de contenu image standard OpenAI (URL ou base64). L'authentification se fait via un jeton Bearer (votre clé API). Les paramètres d'exemple : temperature, max_tokens, top_p, et stop sequences fonctionnent de manière identique à l'API OpenAI. La documentation d'OrcaRouter fournit tous les détails.
Tous les paramètres standard de chat completions sont pris en charge : temperature (0-2, valeur par défaut 1), top_p (0-1, valeur par défaut 1), max_tokens (nombre de tokens en sortie), stop (liste de chaînes de caractères), presence_penalty, frequency_penalty, et seed pour la reproductibilité. Le modèle respecte également les messages système pour définir le comportement. Pour les requêtes multimodales, vous incluez une partie image dans le contenu d'un message utilisateur. Aucun paramètre spécifique au modèle n'est exposé ; l'API est maintenue générique pour la compatibilité. Si vous avez besoin de contrôler le routage MoE, cela est géré en interne.
Oui. Parce qu'OrcaRouter utilise le format de l'API OpenAI, la migration est simple. Remplacez votre URL de base et votre ID de modèle existants par le point d'accès d'OrcaRouter et "qwen/qwen3-vl-235b-a22b-instruct". Assurez-vous que votre clé API est valide et que vous disposez de suffisamment de crédits. Le format des messages pour les images est identique à celui d'OpenAI (utilisant le type de contenu 'image_url'). Vous devrez peut-être ajuster les estimations de nombre de jetons en raison d'une tokenisation différente. Aucune modification de la logique de votre application n'est nécessaire au-delà du point d'accès et du nom du modèle.
Qwen3 VL 235B A22B Instruct et GPT-4V traitent tous deux des entrées multimodales. Différences clés : Qwen3 VL utilise MoE avec 22B paramètres actifs, tandis que GPT-4V est un modèle dense propriétaire de taille non divulguée. Les prix de Qwen3 VL via OrcaRouter sont de $0.40/$1.60 par million de tokens, ce qui est nettement inférieur aux tarifs typiques de GPT-4V. Les scores de benchmark ne sont pas directement comparables car MMLU-Pro et d'autres tests utilisent des sous-ensembles différents. GPT-4V bénéficie d'un support d'écosystème plus large, mais Qwen3 VL offre un avantage de coût pour les charges de travail multimodales à volume élevé sur OrcaRouter.
Claude 3.5 Sonnet est un modèle dense d'Anthropic avec de solides capacités en texte et en vision. Il n'utilise pas MoE, donc sa capacité totale est inférieure aux paramètres totaux de Qwen3 VL, mais sa capacité active par inférence est supérieure à 22B. Le prix de Claude 3.5 Sonnet est généralement plus élevé par token (environ $3.00/$15.00 par million de tokens). Qwen3 VL offre un coût beaucoup plus bas pour les tâches multimodales. Cependant, les modèles Claude ont une fenêtre de contexte plus grande (200K tokens). Le choix dépend du budget, des besoins en longueur de contexte et du fournisseur préféré.
OrcaRouter propose probablement d'autres modèles Qwen tels que Qwen2.5 7B, Qwen2.5 72B, ou des variantes Qwen2-VL. Le Qwen3 VL 235B A22B Instruct est le plus grand modèle MoE multimodal de la gamme Qwen. Comparé au Qwen2-VL 72B, il possède plus de paramètres totaux et une architecture MoE, ce qui peut offrir de meilleures performances sur des tâches complexes tout en maintenant un coût d'inférence raisonnable. Il est plus cher par token que les modèles Qwen plus petits, mais peut être rentable s'il réduit le besoin d'appels multiples ou d'une consommation élevée de tokens.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Entrée / 1M tokens | $0.400 |
| Sortie / 1M tokens | $1.60 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructOuvrir @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct