Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisieToolsJSONRedeneren
door Qwen · 2025-10-14

Qwen3-VL 8B Thinking — open-gewichts klein visie-taal redeneermodel, 8B parameters, 128k context.

ctx131.1K tokens
Max. uitvoer41K
Invoertext + image + video
Uitvoertext
p50 TTFT5.00 s
INPUT$0.18/ 1M tokens
OUTPUT$2.10/ 1M tokens
p50 TTFT5.00 s7d
p95 TTFT8.55 s7d
VERKEER108.8Ktokens / 7d

Qwen3 VL 8B Thinking is een multimodaal taalmodel met 8 miljard parameters, ontwikkeld door het Qwen-team van Alibaba Cloud en gehost op OrcaRouter onder de provider qwen. Het behoort tot de…

Wat is Qwen3 VL 8B Thinking?

Wie zou dit model moeten gebruiken?

Welke modaliteiten ondersteunt het?

Hoe verschilt de 'Thinking' variant van de standaard Qwen3 VL?

Codevoorbeelden

Aanroepen vanuit elke SDK

OpenAI-compatibel — behoud je huidige SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Ondersteunde parameters

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Prijzen

Invoer / 1M tokens$0.180
Uitvoer / 1M tokens$2.10
ValutaUSD

Kostencalculator

Tokens / maand10MM
Invoeraandeel70%%
Geschat / maand $7.56

Schatting op basis van catalogusprijs

Token- en kostenschatter

Invoertokens: 20Kosten per verzoek: $0.001054

Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.

Prestaties

p50 TTFT
5.00 s
Outputsnelheid
64.6 tok/s
p95 TTFT
8.55 s
Foutpercentage
0%

Openbare benchmarks

Bron: Design Arena

Vergelijking

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Invoer $/M$0.18$0.86$0.17$0.12
Uitvoer $/M$2.10$3.44$1.03$0.69
Context131K262K33K1.0M
Kwaliteit4/108/108/108/10
Naast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijken

FAQ

Wat zijn de kosten per miljoen tokens voor Qwen3 VL 8B Thinking op OrcaRouter?
Invoertokens: $0,18 per 1 miljoen tokens. Uitvoertokens: $2,10 per 1 miljoen tokens. Dit zijn de tarieven van de aanbieder, die zonder opslag worden doorgegeven.
Wat is het contextvenster en het maximale aantal uitvoertokens?
Contextvenster is 131.072 tokens. Maximum aantal uitvoertokens is 40.960 tokens.
Wat zijn de belangrijkste sterke punten van dit model?
Het verwerkt drie invoermodaliteiten (tekst, afbeelding, video), biedt een grote context en uitvoerlengte, en omvat een denkvermogen (chain-of-thought) dat de prestaties bij complexe redeneertaken verbetert.
Hoe verhoudt dit model zich tot Qwen2 VL 7B?
Het heeft een grotere context (131K vs 32K), een grotere maximale uitvoer (40K vs 2K) en voegt denkcapaciteiten toe. De prijzen zijn iets hoger, maar bieden verbeterde redenering en multimodaal begrip.
Slaat OrcaRouter gebruikersgegevens in de cache bij het gebruik van dit model?
OrcaRouter meldt geen cachingmechanisme dat prompts of afbeeldingen opslaat; gegevensverwerking volgt standaard API-praktijken. Raadpleeg het privacybeleid van OrcaRouter voor details.
Hoe roep ik dit model aan via een OpenAI-compatibele API?
Stuur een POST naar https://api.orcarouter.ai/v1/chat/completions met model "qwen/qwen3-vl-8b-thinking" en jouw API-sleutel. Gebruik een content-array met tekst- en image_url-ingangen voor multimodale invoer.
Kan het model video-invoer verwerken?
Ja, video wordt geaccepteerd door geëxtraheerde frames als afzonderlijke image_url-vermeldingen te sturen. Het model heeft geen native ondersteuning voor videocodecs; het werkt met statische framesets.
Is er een beperking op het aantal afbeeldingen per verzoek?
Nee, behalve dat het totale aantal tokens (inclusief tekst- en afbeeldingstokens) binnen de contextlimiet van 131.072 moet vallen. Er is geen aparte limiet voor afbeeldingen.
Welke programmeertalen of bibliotheken kan ik gebruiken om toegang te krijgen tot dit model via OrcaRouter?
Elke taal die HTTP-verzoeken en de OpenAI API-indeling ondersteunt. Python met de openai-bibliotheek, JavaScript met fetch, enz. Stel gewoon de basis-URL en model-ID in.
Geeft de denkvariant altijd chain-of-thought-redenering terug?
Het model gebruikt intern stapsgewijze redenering voordat het het definitieve antwoord genereert, maar de uitvoer die u ziet is het volledige antwoord. U kunt de tussentijdse denk-tokens niet afzonderlijk extraheren.

Sluit deze badge in

Qwen: Qwen3 VL 8B Thinking$0.18/M in5000ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking op OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Modelkaart als data

GET /api/public/models/qwen/qwen3-vl-8b-thinkingOpenen
Machineleesbaar:/llms.txt/llms-full.txt