Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisieToolsJSONRedeneren
door Qwen · 2025-10-14

Qwen3-VL 8B Thinking — open-gewichts klein visie-taal redeneermodel, 8B parameters, 128k context.

ctx131K tokens
Max. uitvoer40K
Invoertext + image + video
Uitvoertext
p50 TTFT4.45 s
INPUT$0.18/ 1M tokens
OUTPUT$2.10/ 1M tokens
p50 TTFT4.45 s7d
p95 TTFT10.00 s7d
VERKEER295.6Ktokens / 7d

Qwen3 VL 8B Thinking is een multimodaal taalmodel met 8 miljard parameters, ontwikkeld door het Qwen-team van Alibaba Cloud en gehost op OrcaRouter onder de provider qwen. Het behoort tot de…

Wat is Qwen3 VL 8B Thinking?

Wie zou dit model moeten gebruiken?

Welke modaliteiten ondersteunt het?

Hoe verschilt de 'Thinking' variant van de standaard Qwen3 VL?

Codevoorbeelden

Aanroepen vanuit elke SDK

OpenAI-compatibel — behoud je huidige SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Ondersteunde parameters

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Prijzen

Prijzen
Invoer / 1M tokens$0.180
Uitvoer / 1M tokens$2.10
ValutaUSD

Kostencalculator

Tokens / maand10MM
Invoeraandeel70%%
Geschat / maand $7.56

Schatting op basis van catalogusprijs

Token- en kostenschatter

Invoertokens: 20Kosten per verzoek: $0.001054

Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.

Prestaties

p50 TTFT
4.45 s
Outputsnelheid
3907 tok/s
p95 TTFT
10.00 s
Foutpercentage
0%

Openbare benchmarks

Bron: Design Arena

Community-buzz

Waar ontwikkelaars het deze week over hebben

Hacker News0 vermeldingen · 7 d

Vergelijking

Qwen3 VL 8B ThinkingQwen3.8 MaxQwen3.8 Max (0902)qwen/qwen3-max-preview
Invoer $/M$0.18$2.00$2.00$0.86
Uitvoer $/M$2.10$6.00$6.00$3.44
Context131K1.0M1.0M262K
Kwaliteit4/109/109/108/10
Naast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijken

FAQ

Wat zijn de kosten per miljoen tokens voor Qwen3 VL 8B Thinking op OrcaRouter?
Invoertokens: $0,18 per 1 miljoen tokens. Uitvoertokens: $2,10 per 1 miljoen tokens. Dit zijn de tarieven van de aanbieder, die zonder opslag worden doorgegeven.
Wat is het contextvenster en het maximale aantal uitvoertokens?
Contextvenster is 131.072 tokens. Maximum aantal uitvoertokens is 40.960 tokens.
Wat zijn de belangrijkste sterke punten van dit model?
Het verwerkt drie invoermodaliteiten (tekst, afbeelding, video), biedt een grote context en uitvoerlengte, en omvat een denkvermogen (chain-of-thought) dat de prestaties bij complexe redeneertaken verbetert.
Hoe verhoudt dit model zich tot Qwen2 VL 7B?
Het heeft een grotere context (131K vs 32K), een grotere maximale uitvoer (40K vs 2K) en voegt denkcapaciteiten toe. De prijzen zijn iets hoger, maar bieden verbeterde redenering en multimodaal begrip.
Slaat OrcaRouter gebruikersgegevens in de cache bij het gebruik van dit model?
OrcaRouter meldt geen cachingmechanisme dat prompts of afbeeldingen opslaat; gegevensverwerking volgt standaard API-praktijken. Raadpleeg het privacybeleid van OrcaRouter voor details.
Hoe roep ik dit model aan via een OpenAI-compatibele API?
Stuur een POST naar https://api.orcarouter.ai/v1/chat/completions met model "qwen/qwen3-vl-8b-thinking" en jouw API-sleutel. Gebruik een content-array met tekst- en image_url-ingangen voor multimodale invoer.
Kan het model video-invoer verwerken?
Ja, video wordt geaccepteerd door geëxtraheerde frames als afzonderlijke image_url-vermeldingen te sturen. Het model heeft geen native ondersteuning voor videocodecs; het werkt met statische framesets.
Is er een beperking op het aantal afbeeldingen per verzoek?
Nee, behalve dat het totale aantal tokens (inclusief tekst- en afbeeldingstokens) binnen de contextlimiet van 131.072 moet vallen. Er is geen aparte limiet voor afbeeldingen.
Welke programmeertalen of bibliotheken kan ik gebruiken om toegang te krijgen tot dit model via OrcaRouter?
Elke taal die HTTP-verzoeken en de OpenAI API-indeling ondersteunt. Python met de openai-bibliotheek, JavaScript met fetch, enz. Stel gewoon de basis-URL en model-ID in.
Geeft de denkvariant altijd chain-of-thought-redenering terug?
Het model gebruikt intern stapsgewijze redenering voordat het het definitieve antwoord genereert, maar de uitvoer die u ziet is het volledige antwoord. U kunt de tussentijdse denk-tokens niet afzonderlijk extraheren.

Sluit deze badge in

Qwen: Qwen3 VL 8B Thinking$0.18/M in4454ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking op OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Modelkaart als data

GET /api/public/models/qwen/qwen3-vl-8b-thinkingOpenen
Machineleesbaar:/llms.txt/llms-full.txt