Qwen3-VL 8B Thinking — open-vikt liten vision-language-resoneringsmodell, 8B parametrar, 128k kontext.
Qwen3 VL 8B Thinking är en multimodal språkmodell med 8 miljarder parametrar utvecklad av Qwen-teamet på Alibaba Cloud, värd på OrcaRouter under leverantören qwen. Den tillhör Qwen3-familjen av…
Qwen3 VL 8B Thinking utmärker sig inom visuell frågebesvarande, särskilt när frågan involverar flera objekt, rumsliga relationer eller text inbäddad i bilder (t.ex. gataskyltar, kvitton). Den kan även hantera videoanalysuppgifter, såsom att sammanfatta en kort klipp, identifiera handlingar eller besvara frågor om specifika tidpunkter. Dokumentanalys är ett starkt användningsområde: extrahera information från PDF-filer som innehåller både text och diagram, eller från skannade formulär. Dess långa kontextfönster gör den lämplig för att bearbeta stora dokument (t.ex. PDF-filer på 100+ sidor) med enstaka bildinfogningar, så länge den totala tokeniserade indatan håller sig under 131K.
Om ditt användningsfall är rent textbaserat och inte involverar bilder eller video, kommer en dedikerad textbaserad modell (t.ex. Qwen3-8B eller en liknande stor Llama-variant) sannolikt att vara mer kostnadseffektiv. Multimodala modeller innebär extra overhead för att koda visuella indata, och prissättningen per token för Qwen3 VL 8B Thinking ($0.18 input, $2.10 output per miljon tokens) kan vara högre än många textbaserade alternativ. Dessutom, om din uppgift är enkel klassificering eller extraktion från mycket korta bilder, kan en mindre vision-språkmodell med lägre latens och kostnad (t.ex. Qwen2 VL 2B) vara tillräcklig utan att offra prestanda.
Ja, modellen kan acceptera flera bilder varvade med text i ett enda API-anrop, så länge som det totala tokenantalet (bildtokens plus texttokens) håller sig inom 131,072 kontextfönstret. Varje bild kodas till ett variabelt antal tokens beroende på dess upplösning och komplexitet. OrcaRouters OpenAI-kompatibla API låter dig skicka flera bild-URL:er eller base64-kodade bilder i innehållsarrayen. Det finns ingen hård gräns för antalet bilder annat än kontextbegränsningen. För video extraherar du vanligtvis nyckelbildrutor och skickar dem som separata bilder tillsammans med en textprompt.
Liksom alla multimodala modeller kan Qwen3 VL 8B Thinking hallucinera detaljer i bilder eller video, särskilt vid låg upplösning eller tvetydigt innehåll. Den är inte utformad för realtidsströmning av video; den bearbetar statiska bildruteuppsättningar. Den 8B stora parametermängden innebär att den kan vara mindre noggrann inom högspecialiserade domäner (t.ex. medicinsk bildbehandling, satellitbilder) än större modeller (t.ex. 70B–100B+ vision-språk-modeller). Den stöder inte ljudinmatning. Tankeprocessen kan öka utdatalängden, så budgetera för utmatningstoken därefter. Slutligen är den optimerad för engelska men kan hantera andra språk med varierande effektivitet.
De specifika benchmarkresultaten för Qwen3 VL 8B Thinking på standard multimodala utvärderingar (t.ex. MMMU, MathVista, VideoMME) har inte tillhandahållits i de tillgängliga fakta. Användare bör konsultera det officiella Qwen-modellkortet eller forskningsartikeln för eventuella publicerade resultat. Generellt sett har Qwen3 VL-serien visat konkurrenskraftig prestanda på vision-språkuppgifter jämfört med andra 7B-8B parameter-modeller. "Thinking"-varianten förväntas förbättra resonemangstunga benchmark som visuell tankekedja. Utan offentliga poäng är det lämpligt att testa modellen på ditt eget representativa dataset för att utvärdera dess passform.
Latensdata för denna specifika modell på OrcaRouters infrastruktur har inte offentliggjorts. Som en generell regel har en multimodal modell med 8B parametrar högre latens än en ren textmodell av samma storlek på grund av visuell kodning. Videoinput ökar latensen ytterligare på grund av extra bildrutehantering. På högpresterande GPU-kluster (t.ex. A100, H100) ligger den typiska tiden-till-första-token för en 8B-modell i intervallet några hundra millisekunder till några sekunder, beroende på inputlängd och batchstorlek. Utmatningshastigheten för token-generering mäts vanligtvis i tiotals token per sekund. Dessa värden är kvalitativa; faktisk prestanda beror på OrcaRouters aktuella provisionering och belastning.
Styrkor: Modellen hanterar långa multimodala kontexter (131K tokens), tillåter stora utmatningar (upp till 40K tokens) och bearbetar tre indatatyper. Dess tankeförmåga förbättrar resonemanget för uppgifter som kräver stegvis deduktion. Den är konkurrenskraftigt prissatt för en 8B multimodal modell. Begränsningar: Den har inte jämförts med de senaste frontlinjemodellerna på många offentliga topplistor. Dess maximala utmatningsgenomströmning kan vara lägre än för mindre modeller. Den är inte optimerad för kreativ bildgenerering (den genererar bara text). Användare bör inte förutsätta noll hallucination i visuella uppgifter. Videobearbetning är begränsad till bildrutebaserad extraktion snarare än kontinuerlig analys.
Qwen3 VL 8B Thinking faktureras per token till leverantörens taxa utan någon påslag. Inmatningstokens kostar $0.18 per 1 miljon tokens. Utmatningstokens kostar $2.10 per 1 miljon tokens. Det finns ingen extra infrastrukturavgift, ingen grundkostnad per begäran och ingen månadsprenumeration. Priset gäller lika för alla inmatningsmodaliteter (text, bild, video); varje modalitet tokeniseras och debiteras till inmatningspriset. OrcaRouter tar inte ut någon premie utöver det angivna priset. Till exempel skulle bearbetning av en bild som tokeniseras till 2,000 inmatningstokens kosta 2,000 * ($0.18 / 1M) = $0.00036 i inmatningskostnad. Utmatningskostnaden beräknas på samma sätt.
Varje bild kodas till ett variabelt antal tokens baserat på dess dimensioner och komprimeringsnivå. Högupplösta bilder kan förbruka tusentals tokens. Video hanteras genom att extrahera bildrutor (vanligtvis en bildruta per några sekunder) och koda varje bildruta som en bild; därmed skalar tokenkostnaden linjärt med videolängd och bildfrekvens. Användare kan kontrollera kostnaden genom att ändra storlek på bilder eller minska antalet bildrutor. Det finns ingen separat avgift för kodning av media utöver tokenkostnaden. Utmatningskostnaden beror endast på antalet texttokens som genereras. För långa videor kan inmatningstokens snabbt närma sig gränsen på 131K, vilket ökar kostnaden per begäran.
Enligt den information som tillhandahållits finns det inga rabatter för batchanvändning eller förbetalda åtaganden. OrcaRouter erbjuder för närvarande inte token-caching som skulle minska kostnaderna för upprepade uppmaningar eller bilder. Alla förfrågningar debiteras per token i realtid till standardpris. Om leverantören (qwen) inför rabatterad nivåprissättning i framtiden kommer OrcaRouter att föra vidare dessa besparingar utan påslag. Användare uppmanas att övervaka OrcaRouters prissättningssida för eventuella uppdateringar. För högvolymanvändningsfall, överväg att arbeta direkt med OrcaRouter för att diskutera potentiell volymprissättning.
Jämfört med större multimodala modeller (t.ex. GPT-4V, Gemini 1.5 Pro) är Qwen3 VL 8B Thinking betydligt billigare per token: de modellerna kostar ofta $2–$10+ per miljon input-tokens. Bland visionspråkmodeller med 7B-8B parametrar ligger den i linje med typisk prissättning (Qwen2 VL 7B är ungefär $0.10–$0.20 input, $1–$2 output). Kostnaden för output-token ($2.10 per miljon) är högre än vissa rena textmodeller på 8B (t.ex. $0.20 per miljon output), vilket återspeglar den extra resoneringskostnaden. Om du kan använda en mindre modell (t.ex. 2B–4B parametrar) kan kostnaderna vara 50–90 % lägre, men med minskad kapacitet.
Du anropar Qwen3 VL 8B Thinking genom att skicka en POST-förfrågan till OrcaRouters OpenAI-kompatibla slutpunkt på https://api.orcarouter.ai/v1/chat/completions. Ställ in model-parametern till "qwen/qwen3-vl-8b-thinking". Inkludera din API-nyckel i Authorization-headern som "Bearer <key>". Begärandets brödtext följer OpenAIs chattkompletteringsschema. För multimodal indata, strukturera meddelandeinnehållet som en array av objekt: ett med typ "text" för textprompten, och ett med typ "image_url" för varje bild (med antingen en URL eller base64-data). Video kan skickas som flera image_url-poster som representerar bildrutor. Svaret följer standard OpenAI-strukturen med all genererad text i choices-arrayen.
Alla standard OpenAI-chattkompletteringsparametrar stöds: temperature (0–2, default 1.0), top_p (0–1, default 1.0), max_tokens (upp till 40960), stop-sekvenser, frequency_penalty, presence_penalty, logprobs och n (antal kompletteringar). Modellen stöder inte strömning? OrcaRouter stöder troligen strömning när streaming=true är inställt; kontrollera leverantörens dokumentation. Parametern tools (funktionsanrop) kan stödjas om den underliggande leverantören aktiverar det; för närvarande är det inte garanterat. Systemprompt är tillåten. Användar-ID:n kan skickas för övervakning. Se till att du håller dig inom kontextfönstret på 131072 tokens genom att övervaka tokenantalet innan du skickar.
Om du för närvarande använder samma modell från en annan API-leverantör (t.ex. direkt från Alibaba Cloud) så är migreringen till OrcaRouter enkel: ändra bas-URL till https://api.orcarouter.ai/v1, uppdatera modellsträngen till "qwen/qwen3-vl-8b-thinking" och ersätt API-nyckeln med en OrcaRouter API-nyckel. Inga andra kodändringar krävs eftersom OrcaRouter använder exakt samma OpenAI-kompatibla gränssnitt. Var medveten om att token-användning och prissättning baseras på OrcaRouters priser (som vidarebefordras utan påslag). Du kan behöva justera dina verktyg för kostnadsövervakning för att återspegla den nya prissättningen.
Streaming är tillgängligt via OrcaRouter's API. Sätt stream-parametern till true i din begäran. Svaret blir en Server-Sent Events (SSE)-ström med deltavärden från de genererade token. Detta är användbart för visning i realtid. Observera att för "Thinking"-varianten kan tankeprocessen introducera längre förseningar innan den första token, men streaming kommer fortfarande att skicka inkrementella token när de produceras. Strömformatet följer OpenAI's streaming-specifikation, med händelser av typen "chat.completion.chunk". Varje chunk innehåller ett delta med tokenets innehåll eller roll.
Qwen3 VL 8B Thinking är efterträdaren till Qwen2 VL 7B, med ungefär samma parametertal (8B jämfört med 7B) men förbättrad arkitektur för längre kontext (131K jämfört med 32K för Qwen2 VL 7B). Den lägger även till funktionen "Thinking" för steg-för-steg-resonemang, vilket inte fanns i Qwen2 VL. Den maximala utdatalängden har ökat från 2048 tokens (Qwen2 VL 7B) till 40960 tokens. Prissättningen för Qwen3 VL 8B Thinking är något högre per token än Qwen2 VL 7B (som kostar ungefär $0,15 input, $1,80 output per miljon tokens), vilket återspeglar de tillagda funktionerna och den större kontexten. Användare som uppgraderar bör förvänta sig bättre prestanda på komplexa resonemangsuppgifter.
GPT-4o mini är en flaggskepps multimodal modell från OpenAI med ett 128K kontextfönster. Den har betydligt fler parametrar (okänt, men uppskattat >70B) och uppnår generellt högre noggrannhet på standardriktmärken. Däremot är Qwen3 VL 8B Thinking betydligt billigare: GPT-4o mini kostar $0.15 per miljon inmatningstokens och $0.60 per miljon utmatningstokens, vilket faktiskt är lägre än Qwen3:s $0.18 inmatning och $2.10 utmatning? Vänta, kolla: GPT-4o mini inmatning är $0.15, utmatning $0.60 — billigare än Qwen3 VL 8B Thinking? Egentligen är utmatningen mycket billigare. Så kostnaden är inte lägre över hela linjen. Men Qwen3 stöder video och längre utmatning (40960 jämfört med 16384 för GPT-4o mini). Kontextfönstren är liknande. Valet beror på önskad noggrannhet och budget; Qwen3 är nischad för mycket långa utmatningar och öppen källkodsdistribution.
Llama 3.2 11B Vision är en multimodal modell med 11B parametrar, ett 128K kontextfönster och 8K maximala utdatatokens. Qwen3 VL 8B Thinking har ett mindre parameterantal men en mycket större maximal utdata (40960 vs 8000) och inkluderar tänkandeförmåga. Båda stöder text- och bildinmatning, men Llama 3.2 11B har inte inbyggt stöd för video. Llamas prissättning via leverantörer är liknande, cirka $0,15–$0,20 per miljon tokens för inmatning och $0,60–$1,00 för utdata, vilket gör Qwen3 dyrare för utdata. För uppgifter som kräver mycket lång genererad text (t.ex. rapportsammanställning från video) är Qwen3 bättre lämpad. För kortare, kostnadskänsliga uppgifter kan Llama 3.2 11B vara att föredra.
Gemini 1.5 Flash är en snabb, kostnadseffektiv multimodal modell med ett kontextfönster på 1M (upp till 2M), som stöder bild, video och ljud. Den är billigare än Qwen3 VL 8B Thinking (Gemini Flash kostar $0,075 för inmatning, $0,30 för utmatning per miljon tokens) och snabbare. Däremot erbjuder Qwen3 VL 8B Thinking en tankeprocess som kan förbättra resonemanget vid utmanande visuella uppgifter, och dess maximala utmatning är mycket större (40K mot 8K för Gemini Flash). Om din applikation kräver stegvis resonemang och långa utmatningar är Qwen3 ett bättre val. För hög genomströmning och låg latens är Gemini Flash vanligtvis överlägsen. Dessutom kan Qwen3 föredras när datasuveränitet kräver självvärd eller leverantörsoberoende distribution.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Inmatning / 1M token | $0.180 |
| Utdata / 1M tokens | $2.10 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/qwen/qwen3-vl-8b-thinkingÖppna @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking