Qwen3-VL 235B-A22B Instruct — öppen vikt vision-språkmodell, 235B totalt / 22B aktiva parametrar, 256k kontext, inget tankeläge.
Qwen3 VL 235B A22B Instruct är en vision-språk-variant av Qwen3-modellserien, byggd av Alibaba Cloud. Den använder en mixture-of-experts-design med 235 miljarder totala parametrar, varav cirka 22…
Modellen utmärker sig vid uppgifter där bilder och text interagerar. Den kan svara på frågor om innehållet i en bild, beskriva scener i detalj, läsa text från dokument eller skyltar och resonera om relationer mellan objekt i en bild. Den hanterar också flera bilder i en enda konversation, vilket möjliggör jämförande analys eller sekventiellt resonemang. Instruktionsjusteringen gör det möjligt för modellen att följa komplexa multimodala uppmaningar, som 'Förklara varför detta diagram visar en trend' eller 'Extrahera alla numeriska värden från denna tabell.' Dessa förmågor härrör från den stora MoE-arkitekturen och specialiserad syn-språkträning.
Som en Instruct-variant har modellen finjusterats för att följa användarinstruktioner med hög noggrannhet både vid textbaserade och multimodala uppmaningar. Den kan hantera flervarvsdialoger där bilder introduceras stegvis, upprätthålla kontext över flera utbyten och följa formateringsinstruktioner (t.ex. utdata som JSON, punktlistor eller steg-för-steg). Den presterar bra på uppgifter som kräver efterlevnad av begränsningar, såsom 'Svara endast om bilden innehåller en hund.' Detta gör den lämplig för applikationer där konsekvent, regelbundet beteende är viktigt.
För textbaserade uppgifter utan visuell komponent kan 235B MoE-modellen vara överdriven; mindre täta modeller eller andra textbaserade Qwen-varianter skulle vara mer kostnadseffektiva. På samma sätt, om dina bilder är enkla (t.ex. enkla logotyper, enstaka objekt) eller om du behöver extremt hög genomströmning på en budget, kan en mindre visionsmodell som Qwen2-VL 7B räcka. Denna modell är mest motiverad när du behöver hantera komplexa, högupplösta bilder, dokument med tät text eller uppgifter som kräver djup multimodal resonemang. På OrcaRouter kan du enkelt jämföra priser och byta modell-ID.
Nej. Qwen3 VL 235B A22B Instruct är en textgenereringsmodell som endast accepterar bilder som indata. Den genererar inte bilder, ljud eller någon annan modalitet. Utdata är alltid en textsträng. Om du behöver bildgenerering skulle du använda en separat modell. Denna modells styrka ligger i att förstå och resonera kring visuell indata. Den kan till exempel beskriva hur en bild ser ut eller svara på frågor om den, men den kan inte själv skapa, redigera eller omvandla bilder.
Den rapporterade MMLU-Pro-poängen för denna modell är 82.3. MMLU-Pro är en förbättrad version av benchmarken Massive Multitask Language Understanding, som täcker 57 ämnen inom STEM, humaniora och samhällsvetenskap. En poäng på 82.3 indikerar stark allmänkunskap och resonemangsförmåga över ett brett spektrum av ämnen. Det är ett sammanfattande mått; prestandan kan variera per ämne. Denna poäng placerar modellen bland de främsta i sin storleksklass, särskilt med tanke på MoE-arkitekturen som endast aktiverar en bråkdel av dess totala parametrar per fråga.
Styrkor inkluderar hög noggrannhet på multimodal resonemangsriktmärken, stark instruktionsföljning och kostnadseffektivitet i förhållande till täta modeller med liknande totalt antal parametrar. MoE-designen gör att den kan skala kapacitet utan proportionerlig beräkningskostnad. Begränsningar inkluderar högre absolut kostnad jämfört med mindre modeller, potential för ökad latens på grund av det stora totala antalet parametrar (även om endast 22B är aktiva måste hela modellen laddas i minnet). Den kan också ibland hallucinera fina detaljer i bilder eller misslyckas med mycket tvetydiga visuella indata. Prestanda för specifika domänuppgifter (t.ex. medicinsk bildbehandling) garanteras inte.
Inferenshastigheten beror på den hårdvarubackend som används av OrcaRouter och den aktuella belastningen. Som en MoE-modell med totalt 235 miljarder parametrar kräver den betydande GPU-minne även om endast 22 miljarder parametrar aktiveras per token. Detta resulterar vanligtvis i högre svarstid per begäran jämfört med mindre täta modeller (t.ex. 7B–70B parametrar). Genomströmningen påverkas också av batchstorlek och sekvenslängd. För latenskänsliga applikationer bör du överväga att använda en mindre modell eller optimera för kortare promptar. OrcaRouter ger inga specifika latensgarantier men strävar efter produktionsklar responsförmåga.
OrcaRouter tar exakt leverantörens angivna pris: $0.40 per 1 miljon indatatokens och $1.60 per 1 miljon utdatatokens. Det tillkommer ingen extra pålaga. Både indata- och utdatatokens räknas enligt OpenAIs tokeniseringsregler, vilka kan skilja sig något från modellens interna tokeniserare. Bilder faktureras också som tokens baserat på deras dimensioner och detaljnivå, enligt leverantörens policy. Du kan uppskatta kostnaderna genom att multiplicera din förväntade tokenanvändning med dessa priser.
Kostnaden per token är högre än för mindre eller täta modeller, men MoE-arkitekturen ger mer kapacitet per aktiv parameter än en tät modell av motsvarande aktiv storlek. För komplexa multimodala uppgifter kan denna modell slutföra uppgiften på färre tokens eller med högre noggrannhet, vilket potentiellt minskar den totala utgiften. För enkla uppgifter skulle dock en billigare modell minska kostnaderna. På OrcaRouter kan du växla modeller i farten, så att du bara använder denna modell när det behövs. Det finns inga minsta månatliga åtaganden eller dolda avgifter.
OrcaRouter avslöjar för närvarande inte specifika cachelagringspolicyer för denna modell. Cachelagring på token-nivå kan tillämpas av den underliggande leverantören men är inte garanterad. Det nämns inga volymrabatter eller pristrappor; priserna är fasta per token. För högvolymanvändare kan det vara värt att kontakta OrcaRouter support för eventuella anpassade arrangemang. I allmänhet är prissättningen transparent och användningsbaserad.
Bilder omvandlas till ett tokenantal baserat på deras upplösning och detaljinställning. Den exakta formeln definieras av leverantören (Qwen) och kan variera. Vanligtvis förbrukar bilder med högre upplösning fler token. OrcaRouter skickar igenom leverantörens tokenisering utan ändringar. Du kan kontrollera kostnaderna genom att ändra storlek på bilder eller använda lågdetaljläget om modellen stöder det. Se alltid leverantörens dokumentation för den exakta bildtokenberäkningen. Inmatningstoken för bilder räknas mot avgiften på $0,40 per miljon.
Du skickar en POST-förfrågan till https://api.orcarouter.ai/v1/chat/completions med en OpenAI-kompatibel JSON-nyttolast. Ställ in fältet model till "qwen/qwen3-vl-235b-a22b-instruct". Inkludera en messages-array där varje meddelande kan innehålla text- och/eller bildinnehåll. För bilder, använd standardformatet OpenAI bildinnehåll (URL eller base64). Autentisering sker via en Bearer-token (din API-nyckel). Exempelparametrar: temperature, max_tokens, top_p och stop-sekvenser fungerar identiskt med OpenAI:s API. OrcaRouters dokumentation ger fullständig information.
Alla standardparametrar för chattkompletteringar stöds: temperature (0–2, standard 1), top_p (0–1, standard 1), max_tokens (antal utdatatokens), stop (lista med strängar), presence_penalty, frequency_penalty och seed för reproducerbarhet. Modellen respekterar även systemmeddelanden för att ställa in beteendet. För multimodala förfrågningar inkluderar du en bilddel i innehållet i ett användarmeddelande. Inga modelspecifika parametrar exponeras; API:t hålls generiskt för kompatibilitet. Om du behöver kontrollera MoE-routningen hanteras den internt.
Ja. Eftersom OrcaRouter använder OpenAI:s API-format är migreringen enkel. Ersätt din befintliga bas-URL och modell-ID med OrcaRouters slutpunkt och "qwen/qwen3-vl-235b-a22b-instruct". Se till att din API-nyckel är giltig och att du har tillräckligt med krediter. Meddelandeformatet för bilder är identiskt med OpenAI:s (med innehållstypen 'image_url'). Du kan behöva justera dina uppskattningar av tokenantal på grund av annorlunda tokenisering. Inga ändringar i din applikationslogik krävs utöver slutpunkt och modellnamn.
Qwen3 VL 235B A22B Instruct och GPT-4V hanterar båda multimodala indata. Viktiga skillnader: Qwen3 VL använder MoE med 22B aktiva parametrar, medan GPT-4V är en proprietär tät modell av okänd storlek. Qwen3 VL-prissättning via OrcaRouter är $0,40/$1,60 per miljon tokens, vilket är betydligt lägre än typiska GPT-4V-priser. Benchmark-resultat är inte direkt jämförbara eftersom MMLU-Pro och andra test använder olika delmängder. GPT-4V har bredare ekosystemstöd, men Qwen3 VL erbjuder en kostnadsfördel för högvolymiga multimodala arbetsbelastningar på OrcaRouter.
Claude 3.5 Sonnet är en tät modell från Anthropic med starka text- och bildförmågor. Den använder inte MoE, så dess totala kapacitet är mindre än Qwen3 VL:s totala parametrar, men dess aktiva kapacitet per inferens är högre än 22B. Prissättningen för Claude 3.5 Sonnet är generellt högre per token (ungefär $3,00/$15,00 per miljon tokens). Qwen3 VL erbjuder en mycket lägre kostnad för multimodala uppgifter. Claude-modellerna har dock ett större kontextfönster (200K tokens). Valet beror på budget, behov av kontextlängd och föredragen leverantör.
OrcaRouter erbjuder troligen andra Qwen-modeller som Qwen2.5 7B, Qwen2.5 72B eller Qwen2-VL-varianter. Qwen3 VL 235B A22B Instruct är den största multimodala MoE-modellen i Qwen-sortimentet. Jämfört med Qwen2-VL 72B har den fler totala parametrar och en MoE-arkitektur, vilket kan ge bättre prestanda på komplexa uppgifter samtidigt som kostnaden för inferens hålls rimlig. Den är dyrare per token än mindre Qwen-modeller men kan vara kostnadseffektiv om den minskar behovet av flera anrop eller hög tokenförbrukning.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Inmatning / 1M token | $0.400 |
| Utdata / 1M tokens | $1.60 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructÖppna @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct