Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisionVerktygJSONResonemang
av Qwen · 2025-10-14

Qwen3-VL 8B Thinking — open-vikt liten vision-language-resoneringsmodell, 8B parametrar, 128k kontext.

ctx131K tokens
Max output40K
Inmatningtext + image + video
Utdatatext
p50 TTFT3.95 s
INMATNING$0.18/ 1M token
UTDATA$2.10/ 1M token
p50 TTFT3.95 s7d
p95 TTFT10.00 s7d
TRAFIK1.4Mtokens/7d

Qwen3 VL 8B Thinking är en multimodal språkmodell med 8 miljarder parametrar utvecklad av Qwen-teamet på Alibaba Cloud, värd på OrcaRouter under leverantören qwen. Den tillhör Qwen3-familjen av…

Vad är Qwen3 VL 8B Thinking?

Vem bör använda den här modellen?

Vilka modaliteter stöder den?

Hur skiljer sig varianten 'Thinking' från standard Qwen3 VL?

Kodexempel

Anropa från valfritt SDK

OpenAI-kompatibel — behåll det SDK du redan använder

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametrar som stöds

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Priser

Inmatning / 1M token$0.180
Utdata / 1M tokens$2.10
ValutaUSD

Kostnadskalkylator

Token/månad10MM
Andel input70%%
Uppskattat/månad $7.56

Uppskattning baserad på listpris

Token- och kostnadsberäknare

Input-token: 18Kostnad per förfrågan: $0.001053

Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.

Prestanda

p50 TTFT
3.95 s
Utdatahastighet
56.1 tok/s
p95 TTFT
10.00 s
Felfrekvens
16.1%

Offentliga benchmarks

Källa: Design Arena

Community-buzz

Vad utvecklare säger den här veckan

Hacker News0 omnämnanden · 7d

Så jämför den sig

Qwen3 VL 8B ThinkingQwen3.8 Maxqwen/qwen3-max-previewQwen3.5 397B A17B
Input $/M$0.18$2.00$0.86$0.17
Output $/M$2.10$6.00$3.44$1.03
Kontext131K1.0M262K33K
Kvalitet4/109/108/108/10
Jämför sida vid sidaJämför sida vid sidaJämför sida vid sidaJämför sida vid sida

Vanliga frågor

Vad är kostnaden per miljon tokens för Qwen3 VL 8B Thinking på OrcaRouter?
Input tokens: $0,18 per 1 miljon tokens. Output tokens: $2,10 per 1 miljon tokens. Detta är leverantörens priser som förs vidare utan påslag.
Vad är kontextfönstret och maximala antalet utdatatecken?
Kontextfönstret är 131 072 token. Maximalt antal utdatatoken är 40 960 token.
Vilka är de främsta styrkorna hos denna modell?
Den hanterar tre inputmodaliteter (text, bild, video), erbjuder en stor kontext- och utdatalängd, samt innehåller en tänkande (kedjetänkande) förmåga som förbättrar prestationen vid komplexa resonemangsuppgifter.
Hur jämför sig denna modell med Qwen2 VL 7B?
Den har en större kontext (131K vs 32K), större maxutdata (40K vs 2K) och lägger till tankeförmåga. Priset är något högre men erbjuder förbättrat resonemang och multimodal förståelse.
Cachar OrcaRouter någon användardata när denna modell används?
OrcaRouter rapporterar inte någon cachningsmekanism som lagrar prompts eller bilder; datahantering följer standard API-praxis. Se OrcaRouters integritetspolicy för detaljer.
Hur anropar jag den här modellen via ett OpenAI-kompatibelt API?
Skicka en POST till https://api.orcarouter.ai/v1/chat/completions med modell "qwen/qwen3-vl-8b-thinking" och din API-nyckel. Använd en innehållsarray med text- och image_url-poster för multimodal inmatning.
Kan modellen hantera videoinmatning?
Ja, video accepteras genom att skicka extraherade bildrutor som separata image_url-poster. Modellen har inget inbyggt stöd för videocodec; den arbetar med statiska bildruteuppsättningar.
Finns det någon begränsning för antalet bilder per begäran?
Nej, förutom att det totala tokenantalet (inklusive text- och bildtokens) måste vara inom gränsen på 131,072 tokens. Det finns ingen separat bildgräns.
Vilka programmeringsspråk eller bibliotek kan jag använda för att komma åt denna modell via OrcaRouter?
Alla språk som stödjer HTTP-förfrågningar och OpenAI API-formatet. Python med openai-biblioteket, JavaScript med fetch, osv. Ställ bara in bas-URL och modell-ID.
Returnerar tankevarianten alltid chain-of-thought-resonemang?
Modellen använder internt steg-för-steg-resonemang innan den genererar det slutliga svaret, men utmatningen du ser är det fullständiga svaret. Du kan inte extrahera de mellanliggande tanketoken separat.

Bädda in denna badge

Qwen: Qwen3 VL 8B Thinking$0.18/M in3950ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking på OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Modellkort som data

GET /api/public/models/qwen/qwen3-vl-8b-thinkingÖppna