Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisionOutilsJSONRaisonnement
par Qwen · 2025-10-14

Qwen3-VL 8B Thinking — modèle de raisonnement vision-langage de petite taille à poids ouverts, 8B paramètres, contexte 128k.

Points de terminaison:/v1/chat/completions
ctx131.1K tokens
Sortie max41K
Entréetext + image + video
Sortietext
p50 TTFT5.00 s
ENTRÉE$0.18/ 1M tokens
SORTIE$2.10/ 1M tokens
p50 TTFT5.00 s7 j
TTFT p958.55 s7 j
TRAFIC108.8Ktokens / 7 j

Qwen3 VL 8B Thinking est un modèle de langage multimodal à 8 milliards de paramètres développé par l'équipe Qwen chez Alibaba Cloud, hébergé sur OrcaRouter sous le fournisseur qwen. Il appartient à…

Qu'est-ce que Qwen3 VL 8B Thinking ?

Qui devrait utiliser ce modèle ?

Quelles modalités prend-il en charge ?

Comment la variante 'Thinking' diffère-t-elle du Qwen3 VL standard ?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Tarifs

Entrée / 1M tokens$0.180
Sortie / 1M tokens$2.10
DeviseUSD

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $7.56

Estimation basée sur le tarif public

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.001053

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
5.00 s
Vitesse de sortie
64.6 tok/s
TTFT p95
8.55 s
Taux d'erreur
0%

Benchmarks publics

Comparatif

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Entrée $/M$0.18$0.86$0.17$0.12
Sortie $/M$2.10$3.44$1.03$0.69
Contexte131K262K33K1.0M
Qualité4/108/108/108/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Quel est le coût par million de tokens pour Qwen3 VL 8B Thinking sur OrcaRouter ?
Jetons d'entrée : $0.18 pour 1 million de jetons. Jetons de sortie : $2.10 pour 1 million de jetons. Ce sont les tarifs du fournisseur transmis sans marge.
Quelle est la fenêtre de contexte et le nombre maximal de jetons de sortie ?
La fenêtre de contexte est de 131,072 tokens. Le nombre maximal de tokens en sortie est de 40,960 tokens.
Quels sont les principaux atouts de ce modèle ?
Il gère trois modalités d'entrée (texte, image, vidéo), offre une grande longueur de contexte et de sortie, et inclut une capacité de réflexion (chaîne de pensée) qui améliore les performances sur les tâches de raisonnement complexes.
Comment ce modèle se compare-t-il à Qwen2 VL 7B ?
Il dispose d'un contexte plus large (131K contre 32K), d'une sortie maximale plus grande (40K contre 2K), et ajoute des capacités de réflexion. Le tarif est légèrement plus élevé mais offre un raisonnement et une compréhension multimodale améliorés.
Est-ce qu'OrcaRouter met en cache des données utilisateur lors de l'utilisation de ce modèle ?
OrcaRouter ne signale aucun mécanisme de mise en cache qui stocke les invites ou les images ; le traitement des données suit les pratiques API standard. Consultez la politique de confidentialité d'OrcaRouter pour plus de détails.
Comment puis-je appeler ce modèle via une API compatible OpenAI ?
Envoyez une requête POST à https://api.orcarouter.ai/v1/chat/completions avec le modèle "qwen/qwen3-vl-8b-thinking" et votre clé API. Utilisez un tableau content avec des entrées text et image_url pour une entrée multimodale.
Le modèle peut-il traiter une entrée vidéo ?
Oui, la vidéo est acceptée en envoyant des images extraites sous forme d'entrées image_url distinctes. Le modèle ne prend pas en charge de codec vidéo natif ; il fonctionne sur des ensembles d'images statiques.
Y a-t-il une restriction sur le nombre d'images par requête ?
Non, excepté que le nombre total de tokens (y compris les tokens de texte et d'image) doit être dans la limite de contexte de 131 072. Il n'y a pas de limite d'image séparée.
Quels langages de programmation ou bibliothèques puis-je utiliser pour accéder à ce modèle via OrcaRouter ?
Tout langage qui prend en charge les requêtes HTTP et le format de l'API OpenAI. Python avec la bibliothèque openai, JavaScript avec fetch, etc. Il suffit de définir l'URL de base et l'ID du modèle.
Non, pas toujours. Elle ne renvoie un raisonnement en chaîne de pensée que lorsqu'elle est explicitement demandée ou jugée nécessaire pour fournir une réponse complète.
Le modèle utilise en interne un raisonnement étape par étape avant de générer la réponse finale, mais la sortie que vous voyez est la réponse complète. Vous ne pouvez pas extraire les jetons de réflexion intermédiaires séparément.

Intégrer ce badge

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking sur OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Fiche du modèle en données

GET /api/public/models/qwen/qwen3-vl-8b-thinkingOuvrir
Lisible par machine:/llms.txt/llms-full.txt