Qwen3-VL 8B Thinking — modèle de raisonnement vision-langage de petite taille à poids ouverts, 8B paramètres, contexte 128k.
Qwen3 VL 8B Thinking est un modèle de langage multimodal à 8 milliards de paramètres développé par l'équipe Qwen chez Alibaba Cloud, hébergé sur OrcaRouter sous le fournisseur qwen. Il appartient à…
Qwen3 VL 8B Thinking excelle dans le question-réponse visuelle, en particulier lorsque la question implique plusieurs objets, des relations spatiales ou du texte intégré dans des images (par exemple, panneaux de signalisation, reçus). Il peut également gérer des tâches de compréhension vidéo, telles que le résumé d'un court clip, l'identification d'actions ou la réponse à des questions sur des horodatages spécifiques. L'analyse de documents est un cas d'utilisation fort : extraire des informations de PDF contenant à la fois du texte et des graphiques, ou de formulaires scannés. Sa longue fenêtre de contexte le rend adapté au traitement de grands documents (par exemple, des PDF de plus de 100 pages) avec des insertions d'images occasionnelles, tant que l'entrée tokenisée totale reste inférieure à 131K.
Si votre cas d'utilisation est purement textuel et n'implique pas d'images ou de vidéos, un modèle dédié au texte uniquement (par exemple, Qwen3-8B ou une variante Llama de taille similaire) sera probablement plus économique. Les modèles multimodaux impliquent un surcoût pour l'encodage des entrées visuelles, et la tarification par jeton pour Qwen3 VL 8B Thinking (0,18 $ en entrée, 2,10 $ en sortie par million de jetons) peut être plus élevée que celle de nombreuses alternatives purement textuelles. De plus, si votre tâche consiste en une classification ou extraction simple à partir d'images très courtes, un modèle vision-langage plus petit avec une latence et un coût réduits (par exemple, Qwen2 VL 2B) pourrait suffire sans sacrifier les performances.
Oui, le modèle peut accepter plusieurs images entrelacées avec du texte dans un seul appel API, tant que le nombre total de tokens (tokens d'image plus tokens de texte) reste dans la fenêtre de contexte de 131 072. Chaque image est encodée en un nombre variable de tokens selon sa résolution et sa complexité. L'API compatible OpenAI d'OrcaRouter vous permet d'envoyer plusieurs URL d'images ou images encodées en base64 dans le tableau de contenu. Il n'y a pas de limite stricte sur le nombre d'images autre que la contrainte de contexte. Pour la vidéo, vous devrez généralement extraire les images clés et les envoyer en tant qu'images séparées avec une invite textuelle.
Comme tous les modèles multimodaux, Qwen3 VL 8B Thinking peut halluciner des détails dans les images ou vidéos, surtout avec une faible résolution ou un contenu ambigu. Il n’est pas conçu pour le streaming vidéo en temps réel ; il traite des séquences d’images statiques. La taille de 8 milliards de paramètres signifie qu’il peut être moins précis dans des domaines hautement spécialisés (par exemple, imagerie médicale, imagerie satellite) que des modèles plus grands (par exemple, les modèles vision-langage de 70 à 100+ milliards de paramètres). Il ne prend pas en charge l’entrée audio. Le processus de réflexion peut allonger la longueur des sorties, prévoyez donc un budget de tokens de sortie en conséquence. Enfin, il est optimisé pour l’anglais mais peut traiter d’autres langues avec une efficacité variable.
Les scores de benchmark spécifiques pour Qwen3 VL 8B Thinking sur les évaluations multimodales standard (par exemple, MMMU, MathVista, VideoMME) n'ont pas été fournis dans les faits disponibles. Les utilisateurs devraient consulter la fiche officielle du modèle Qwen ou l'article de recherche pour les résultats éventuellement publiés. En général, la série Qwen3 VL a montré des performances compétitives sur les tâches vision-langage par rapport à d'autres modèles à paramètres 7B-8B. La variante "Thinking" devrait améliorer les benchmarks lourds en raisonnement comme le visual chain-of-thought. Sans scores publics, il est conseillé de tester le modèle sur votre propre ensemble de données représentatif pour évaluer son adéquation.
Les données de latence pour ce modèle spécifique sur l'infrastructure d'OrcaRouter n'ont pas été divulguées. En règle générale, un modèle multimodal de 8 milliards de paramètres aura une latence plus élevée qu'un modèle de texte pur de même taille en raison du codage visuel. L'entrée vidéo augmente encore la latence en raison du traitement supplémentaire des images. Sur les clusters GPU haute performance (par exemple A100, H100), le temps typique jusqu'au premier token pour un modèle 8B se situe entre quelques centaines de millisecondes et quelques secondes, selon la longueur de l'entrée et la taille du lot. La vitesse de génération de tokens de sortie est généralement mesurée en dizaines de tokens par seconde. Ces valeurs sont qualitatives ; la performance réelle dépend de l'approvisionnement et de la charge actuels d'OrcaRouter.
Points forts : Le modèle gère de longs contextes multimodaux (131K tokens), permet de grandes sorties (jusqu'à 40K tokens) et traite trois types d'entrées. Sa capacité de réflexion améliore le raisonnement sur les tâches qui nécessitent une déduction étape par étape. Il est proposé à un prix compétitif pour un modèle multimodal de 8B. Limites : Il n'a pas été évalué par rapport aux derniers modèles de pointe sur de nombreux classements publics. Son débit de sortie maximal peut être inférieur à celui de modèles plus petits. Il n'est pas optimisé pour la génération d'images créatives (il ne produit que du texte). Les utilisateurs ne doivent pas supposer une absence d'hallucination dans les tâches visuelles. Le traitement vidéo se limite à une extraction par images plutôt qu'à une analyse continue.
Qwen3 VL 8B Thinking est facturé par token au tarif du fournisseur sans marge. Les tokens d’entrée coûtent $0.18 par million de tokens. Les tokens de sortie coûtent $2.10 par million de tokens. Il n’y a pas de frais d’infrastructure supplémentaires, pas de coût de base par requête et pas d’abonnement mensuel. Le prix s’applique de la même manière à toutes les modalités d’entrée (texte, image, vidéo) ; chaque modalité est tokenisée et facturée au tarif d’entrée. OrcaRouter n’applique aucune majoration par rapport au tarif indiqué. Par exemple, le traitement d’une image qui se tokenise en 2,000 tokens d’entrée coûterait 2,000 * ($0.18 / 1M) = $0.00036 en coût d’entrée. Le coût de sortie est calculé de la même manière.
Chaque image est encodée en un nombre variable de jetons en fonction de ses dimensions et du niveau de compression. Les images haute résolution peuvent consommer des milliers de jetons. La vidéo est traitée en extrayant des images (généralement une image toutes les quelques secondes) et en encodant chaque image comme une image ; ainsi, le coût en jetons augmente linéairement avec la durée de la vidéo et la fréquence d'images. Les utilisateurs peuvent contrôler le coût en redimensionnant les images ou en réduisant le nombre d'images. Il n'y a pas de frais distincts pour l'encodage du support au-delà du coût en jetons. Le coût de sortie dépend uniquement du nombre de jetons de texte générés. Pour les longues vidéos, les jetons d'entrée peuvent rapidement atteindre la limite de 131K, augmentant le coût par requête.
D'après les informations fournies, il n'y a pas de réduction pour une utilisation en volume ou des engagements prépayés. OrcaRouter ne propose actuellement pas de mise en cache des tokens qui réduirait les coûts pour les invites ou images répétées. Toutes les requêtes sont facturées par token en temps réel au tarif standard. Si le fournisseur (qwen) introduit à l'avenir une tarification par paliers avec remise, OrcaRouter répercutera ces économies sans aucune majoration. Les utilisateurs sont invités à consulter la page de tarification d'OrcaRouter pour toute mise à jour. Pour les cas d'utilisation à volume élevé, envisagez de travailler directement avec OrcaRouter pour discuter d'une éventuelle tarification volumétrique.
Comparé à des modèles multimodaux plus grands (par exemple, GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking est nettement moins cher par token : ces modèles coûtent souvent 2 à 10 $ ou plus par million de tokens d'entrée. Parmi les modèles vision-langage de 7 à 8 milliards de paramètres, il est en phase avec les tarifs typiques (Qwen2 VL 7B coûte environ 0,10 à 0,20 $ en entrée, 1 à 2 $ en sortie). Le coût par token de sortie (2,10 $ par million) est plus élevé que celui de certains modèles purement textuels de 8 milliards de paramètres (par exemple, 0,20 $ par million en sortie), ce qui reflète le surcoût lié au raisonnement supplémentaire. Si vous pouvez utiliser un modèle plus petit (par exemple, 2 à 4 milliards de paramètres), les coûts peuvent être réduits de 50 à 90 %, mais avec des capacités réduites.
Vous appelez Qwen3 VL 8B Thinking en envoyant une requête POST au point de terminaison compatible OpenAI d'OrcaRouter à l'adresse https://api.orcarouter.ai/v1/chat/completions. Définissez le paramètre model sur "qwen/qwen3-vl-8b-thinking". Incluez votre clé API dans l'en-tête Authorization en tant que "Bearer <key>". Le corps de la requête suit le schéma de chat completions d'OpenAI. Pour les entrées multimodales, structurez le contenu du message sous forme de tableau d'objets : un avec le type "text" pour l'invite textuelle, et un avec le type "image_url" pour chaque image (avec soit une URL, soit des données base64). La vidéo peut être envoyée sous forme de plusieurs entrées image_url représentant des images. La réponse suit la structure standard d'OpenAI avec tout le texte généré dans le tableau choices.
Tous les paramètres standard de complétion de chat OpenAI sont pris en charge : temperature (0–2, valeur par défaut 1.0), top_p (0–1, valeur par défaut 1.0), max_tokens (jusqu'à 40960), séquences d'arrêt, frequency_penalty, presence_penalty, logprobs et n (nombre de complétions). Le modèle ne prend pas en charge le streaming ? OrcaRouter prend très probablement en charge le streaming lorsque streaming=true est défini ; consultez la documentation du fournisseur. Le paramètre tools (appel de fonctions) peut être pris en charge si le fournisseur sous-jacent l'active ; actuellement, ce n'est pas garanti. Le prompt système est autorisé. Les identifiants utilisateur peuvent être transmis pour la surveillance. Assurez-vous de rester dans la fenêtre de contexte de 131 072 tokens en surveillant le nombre de tokens avant l'envoi.
Si vous utilisez actuellement le même modèle provenant d'un autre fournisseur d'API (par exemple, directement depuis Alibaba Cloud), la migration vers OrcaRouter est simple : remplacez l'URL de base par https://api.orcarouter.ai/v1, mettez à jour la chaîne du modèle pour "qwen/qwen3-vl-8b-thinking", et remplacez la clé API par une clé API OrcaRouter. Aucune autre modification de code n'est nécessaire car OrcaRouter utilise exactement la même interface compatible OpenAI. Notez que l'utilisation des jetons et la tarification seront basées sur les tarifs d'OrcaRouter (qui sont transmis sans majoration). Vous devrez peut-être ajuster vos outils de suivi des coûts pour refléter la nouvelle tarification.
Le streaming est disponible via l'API d'OrcaRouter. Définissez le paramètre stream à true dans votre requête. La réponse sera un flux Server-Sent Events (SSE) avec les deltas des jetons générés. Ceci est utile pour un affichage en temps réel. Notez que pour la variante "Thinking", le processus de réflexion peut introduire des délais plus longs avant le premier jeton, mais le streaming enverra toujours les jetons incrémentiels au fur et à mesure qu'ils sont produits. Le format du flux suit la spécification de streaming d'OpenAI, avec des événements de type "chat.completion.chunk". Chaque bloc contient un delta avec le contenu ou le rôle du jeton.
Qwen3 VL 8B Thinking est le successeur de Qwen2 VL 7B, avec à peu près le même nombre de paramètres (8B vs 7B) mais une architecture améliorée pour un contexte plus long (131K vs 32K pour Qwen2 VL 7B). Il ajoute également la capacité « Thinking » pour un raisonnement étape par étape, qui n'était pas présente dans Qwen2 VL. La longueur maximale de sortie est passée de 2048 tokens (Qwen2 VL 7B) à 40960 tokens. Le prix de Qwen3 VL 8B Thinking est légèrement plus élevé par token que celui de Qwen2 VL 7B (qui coûte environ 0,15 $ en entrée, 1,80 $ en sortie par million de tokens), reflétant les capacités supplémentaires et le contexte plus large. Les utilisateurs qui mettent à niveau peuvent s'attendre à de meilleures performances sur les tâches de raisonnement complexes.
GPT-4o mini est un modèle multimodal phare d'OpenAI avec une fenêtre de contexte de 128K tokens. Il possède beaucoup plus de paramètres (inconnu, mais estimé à >70B) et atteint généralement une précision plus élevée sur les benchmarks standard. Cependant, Qwen3 VL 8B Thinking est nettement moins cher : GPT-4o mini coûte $0.15 par million de tokens en entrée et $0.60 par million de tokens en sortie, ce qui est en fait inférieur aux $0.18 en entrée et $2.10 en sortie de Qwen3 ? Attendez, vérifions : l'entrée de GPT-4o mini est à $0.15, la sortie à $0.60 — moins cher que Qwen3 VL 8B Thinking ? En fait, la sortie est beaucoup moins chère. Donc le coût n'est pas inférieur sur toute la ligne. Mais Qwen3 prend en charge la vidéo et des sorties plus longues (40960 contre 16384 pour GPT-4o mini). Les fenêtres de contexte sont similaires. Le choix dépend de la précision requise et du budget ; Qwen3 est de niche pour les sorties très longues et le déploiement open-source.
Llama 3.2 11B Vision est un modèle multimodal de 11 milliards de paramètres avec une fenêtre de contexte de 128K et un maximum de 8K tokens en sortie. Qwen3 VL 8B Thinking a un nombre de paramètres inférieur mais une sortie maximale beaucoup plus grande (40960 contre 8000) et inclut des capacités de réflexion. Les deux prennent en charge l'entrée de texte et d'images, mais Llama 3.2 11B ne prend pas en charge la vidéo nativement. Le tarif de Llama via les fournisseurs est similaire, environ 0,15 $–0,20 $ pour l'entrée, 0,60 $–1,00 $ pour la sortie par million de tokens, ce qui rend Qwen3 plus cher en sortie. Pour les tâches nécessitant un texte généré très long (par exemple, la rédaction de rapports à partir de vidéos), Qwen3 est mieux adapté. Pour les tâches plus courtes et sensibles aux coûts, Llama 3.2 11B peut être préférable.
Gemini 1.5 Flash est un modèle multimodal rapide et économique avec une fenêtre de contexte de 1M (jusqu'à 2M), prenant en charge les images, les vidéos et l'audio. Il est moins cher que Qwen3 VL 8B Thinking (Gemini Flash coûte 0,075 $ en entrée, 0,30 $ en sortie par million de jetons) et plus rapide. Cependant, Qwen3 VL 8B Thinking propose un processus de réflexion qui peut améliorer le raisonnement sur des tâches visuelles complexes, et sa sortie maximale est beaucoup plus grande (40K contre 8K pour Gemini Flash). Si votre application nécessite un raisonnement étape par étape et des sorties longues, Qwen3 est un meilleur choix. Pour un débit élevé et une faible latence, Gemini Flash est généralement supérieur. De plus, Qwen3 peut être préféré lorsque la souveraineté des données exige un auto-hébergement ou un déploiement indépendant du fournisseur.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Entrée / 1M tokens | $0.180 |
| Sortie / 1M tokens | $2.10 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingOuvrir @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking