Qwen3-VL 235B-A22B Instruct — open-weight visie-taalmodel, 235B totaal / 22B actieve parameters, 256k context, geen denkmodus.
Qwen3 VL 235B A22B Instruct is een visie-taalvariant van de Qwen3-modelserie, gebouwd door Alibaba Cloud. Het gebruikt een mixture-of-experts-ontwerp met 235 miljard totale parameters, waarvan er per…
Het model blinkt uit in taken waarbij afbeeldingen en tekst samenkomen. Het kan vragen beantwoorden over de inhoud van een afbeelding, scènes gedetailleerd beschrijven, tekst lezen van documenten of borden, en redeneren over relaties tussen objecten in een afbeelding. Het kan ook meerdere afbeeldingen in één gesprek verwerken, wat vergelijkende analyse of sequentieel redeneren mogelijk maakt. De instructie-afstemming stelt het model in staat complexe multimodale prompts te volgen, zoals 'Leg uit waarom deze grafiek een trend laat zien' of 'Extraheer alle numerieke waarden uit deze tabel.' Deze mogelijkheden komen voort uit de grote MoE-architectuur en gespecialiseerde visueel-taaltraining.
Als Instruct-variant is het model fijn afgestemd om gebruikersinstructies met hoge betrouwbaarheid te volgen, zowel bij tekst-only als multimodale prompts. Het kan meerdaagse dialogen aan waarin afbeeldingen stapsgewijs worden geïntroduceerd, context behouden over meerdere uitwisselingen, en opmaakinstructies volgen (bijv. uitvoer als JSON, opsommingstekens of stap-voor-stap). Het presteert goed bij taken die naleving van beperkingen vereisen, zoals 'Antwoord alleen als de afbeelding een hond bevat.' Dit maakt het geschikt voor toepassingen waar consistent, regelvolgend gedrag belangrijk is.
Voor tekst-only taken zonder visuele component kan het 235B MoE-model overkill zijn; kleinere dichte modellen of andere tekst-only Qwen-varianten zijn kosteneffectiever. Evenzo, als uw afbeeldingen eenvoudig zijn (bijv. basale logo's, enkele objecten) of u een extreem hoge doorvoer nodig heeft met een beperkt budget, kan een kleiner visiemodel zoals Qwen2-VL 7B volstaan. Dit model is het meest gerechtvaardigd wanneer u complexe, hoge-resolutie afbeeldingen, documenten met dichte tekst of taken die diep multimodaal redeneren vereisen, moet verwerken. Op OrcaRouter kunt u prijzen vergelijken en eenvoudig model-ID's wisselen.
Nee. Qwen3 VL 235B A22B Instruct is een tekstgeneratiemodel dat alleen afbeeldingen als invoer accepteert. Het genereert geen afbeeldingen, audio of enige andere modaliteit. Uitvoer is altijd een tekstreeks. Als u afbeeldingsgeneratie nodig heeft, gebruikt u een apart model. De kracht van dit model ligt in het begrijpen en redeneren over visuele invoer. Het kan bijvoorbeeld beschrijven hoe een afbeelding eruitziet of vragen erover beantwoorden, maar het kan zelf geen afbeeldingen maken, bewerken of transformeren.
De gerapporteerde MMLU-Pro-score voor dit model is 82,3. MMLU-Pro is een verbeterde versie van de Massive Multitask Language Understanding-benchmark, die 57 onderwerpen bestrijkt op het gebied van STEM, geesteswetenschappen en sociale wetenschappen. Een score van 82,3 duidt op sterke algemene kennis en redeneervaardigheden over uiteenlopende onderwerpen. Het is een enkel getal als samenvatting; de prestaties kunnen per onderwerp variëren. Deze score plaatst het model bij de beste presteerders in zijn grootteklasse, vooral gezien de MoE-architectuur die per query slechts een fractie van de totale parameters activeert.
Sterke punten zijn onder andere hoge nauwkeurigheid op multimodale redeneerbenchmarks, sterke instructieopvolging en kostenefficiëntie ten opzichte van dichte modellen met een vergelijkbaar totaal aantal parameters. Het MoE-ontwerp maakt het mogelijk om capaciteit te schalen zonder evenredige rekenkosten. Beperkingen zijn onder andere hogere absolute kosten in vergelijking met kleinere modellen, mogelijke toegenomen latentie door het grote aantal totale parameters (hoewel slechts 22B actief zijn, moet het volledige model in het geheugen worden geladen). Het kan ook af en toe hallucineren over fijne details in afbeeldingen of falen bij zeer dubbelzinnige visuele invoer. Prestaties op specifieke domeintaken (bijv. medische beeldvorming) zijn niet gegarandeerd.
De inferentiesnelheid hangt af van de hardware-backend die OrcaRouter gebruikt en de huidige belasting. Als een MoE-model met in totaal 235 miljard parameters vereist het aanzienlijk GPU-geheugen, ook al worden er per token slechts 22 miljard parameters geactiveerd. Dit leidt doorgaans tot hogere latentie per verzoek vergeleken met kleinere dichte modellen (bijv. 7B-70B parameters). De doorvoer wordt ook beïnvloed door de batchgrootte en de sequentielengte. Overweeg voor latentiegevoelige toepassingen een kleiner model te gebruiken of te optimaliseren voor kortere prompts. OrcaRouter biedt geen specifieke latentiegaranties, maar streeft naar productierijpe responsiviteit.
OrcaRouter rekent exact het door de provider vermelde tarief: $0.40 per 1 miljoen invoertokens en $1.60 per 1 miljoen uitvoertokens. Er is geen extra opslag. Zowel invoer- als uitvoertokens worden geteld volgens de tokenisatieregels van OpenAI, die iets kunnen afwijken van de interne tokenizer van het model. Afbeeldingen worden ook als tokens gefactureerd op basis van hun afmetingen en detailniveau, volgens het beleid van de provider. U kunt de kosten schatten door uw verwachte tokenverbruik te vermenigvuldigen met deze tarieven.
De kosten per token zijn hoger dan bij kleinere of dichtere modellen, maar de MoE-architectuur biedt meer capaciteit per actieve parameter dan een dicht model van gelijkwaardige actieve omvang. Voor complexe multimodale taken kan dit model de taak in minder tokens of met hogere nauwkeurigheid voltooien, wat de totale uitgaven mogelijk verlaagt. Voor eenvoudige taken zou een goedkoper model echter de kosten verlagen. Op OrcaRouter kunt u modellen ter plekke wisselen, zodat u dit model alleen kunt gebruiken wanneer nodig. Er zijn geen minimale maandelijkse verplichtingen of verborgen kosten.
OrcaRouter geeft momenteel geen specifieke cache-beleidsregels vrij voor dit model. Caching op token-niveau kan worden toegepast door de onderliggende provider, maar is niet gegarandeerd. Er worden geen bulk-kortingen of getrapte prijzen genoemd; tarieven zijn vast per token. Voor gebruikers met een hoog volume kan het de moeite lonen om contact op te nemen met de ondersteuning van OrcaRouter voor mogelijke maatwerkafspraken. Over het algemeen is de prijsstelling transparant en op gebruik gebaseerd.
Afbeeldingen worden omgezet in een tokenaantal op basis van hun resolutie en detailinstelling. De exacte formule wordt gedefinieerd door de provider (Qwen) en kan variëren. Normaal gesproken verbruiken afbeeldingen met een hogere resolutie meer tokens. OrcaRouter geeft de tokenisatie van de provider zonder wijzigingen door. U kunt de kosten beheersen door afbeeldingen te verkleinen of de lage-detailmodus te gebruiken als het model dit ondersteunt. Raadpleeg altijd de documentatie van de provider voor de exacte berekening van beeldtokens. Invoertokens voor afbeeldingen worden meegeteld tegen het tarief van $0.40 per miljoen.
U stuurt een POST-verzoek naar https://api.orcarouter.ai/v1/chat/completions met een OpenAI-compatibele JSON-payload. Stel het modelveld in op "qwen/qwen3-vl-235b-a22b-instruct". Voeg een messages-array toe waarin elk bericht tekst en/of afbeeldingsinhoud kan bevatten. Gebruik voor afbeeldingen de standaard OpenAI-afbeeldingsinhoudindeling (URL of base64). Authenticatie gebeurt via een Bearer-token (uw API-sleutel). Voorbeeldparameters: temperature, max_tokens, top_p en stop-reeksen werken identiek aan de OpenAI API. De documentatie van OrcaRouter biedt volledige details.
Alle standaardparameters voor chatvoltooiingen worden ondersteund: temperatuur (0-2, standaard 1), top_p (0-1, standaard 1), max_tokens (aantal uitvoertokens), stop (lijst van strings), presence_penalty, frequency_penalty en seed voor reproduceerbaarheid. Het model respecteert ook systeemberichten voor het instellen van gedrag. Voor multimodale verzoeken voeg je een afbeeldingsdeel toe aan de inhoud van een gebruikersbericht. Er worden geen modelspecifieke parameters blootgelegd; de API wordt generiek gehouden voor compatibiliteit. Als je de MoE-routering moet regelen, wordt dat intern afgehandeld.
Ja. Omdat OrcaRouter de OpenAI API-indeling gebruikt, is migratie eenvoudig. Vervang uw bestaande basis-URL en model-ID door het eindpunt van OrcaRouter en "qwen/qwen3-vl-235b-a22b-instruct". Zorg ervoor dat uw API-sleutel geldig is en dat u voldoende tegoed heeft. Het berichtformaat voor afbeeldingen is identiek aan dat van OpenAI (met het inhoudstype 'image_url'). Mogelijk moet u de schattingen van het aantal tokens aanpassen vanwege een andere tokenisatie. Er zijn geen wijzigingen in de logica van uw toepassing nodig, behalve het eindpunt en de modelnaam.
Qwen3 VL 235B A22B Instruct en GPT-4V verwerken beide multimodale invoer. Belangrijkste verschillen: Qwen3 VL gebruikt MoE met 22B actieve parameters, terwijl GPT-4V een propriëtair dicht model is van een niet-openbaar gemaakte grootte. De prijs van Qwen3 VL via OrcaRouter is $0.40/$1.60 per miljoen tokens, wat aanzienlijk lager is dan de typische tarieven van GPT-4V. Benchmarkscores zijn niet direct vergelijkbaar omdat MMLU-Pro en andere tests verschillende subsets gebruiken. GPT-4V heeft bredere ecosysteemondersteuning, maar Qwen3 VL biedt een kostenvoordeel voor multimodale workloads met hoge volumes op OrcaRouter.
Claude 3.5 Sonnet is een dicht model van Anthropic met sterke tekst- en visuele mogelijkheden. Het gebruikt geen MoE, dus de totale capaciteit is kleiner dan de totale parameters van Qwen3 VL, maar de actieve capaciteit per inferentie is hoger dan 22B. De prijs voor Claude 3.5 Sonnet is over het algemeen hoger per token (ongeveer $3.00/$15.00 per miljoen tokens). Qwen3 VL biedt een veel lagere kostprijs voor multimodale taken. Claude-modellen hebben echter een groter contextvenster (200K tokens). De keuze hangt af van het budget, de benodigde contextlengte en de voorkeursprovider.
OrcaRouter biedt waarschijnlijk ook andere Qwen-modellen aan, zoals Qwen2.5 7B, Qwen2.5 72B of Qwen2-VL-varianten. De Qwen3 VL 235B A22B Instruct is het grootste multimodale MoE-model in de Qwen-reeks. Vergeleken met Qwen2-VL 72B heeft het meer totale parameters en een MoE-architectuur, wat kan leiden tot betere prestaties bij complexe taken terwijl de inferentiekosten redelijk blijven. Het is duurder per token dan kleinere Qwen-modellen, maar kan kosteneffectief zijn als het de noodzaak voor meerdere aanroepen of een hoog tokenverbruik vermindert.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Invoer / 1M tokens | $0.400 |
| Uitvoer / 1M tokens | $1.60 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructOpenen @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct