Qwen3.5 122B-A10B — open-weight MoE multimodaal (tekst/afbeelding/video), 122B totaal / 10B actieve parameters, 32k context (visuele modus).
Qwen3.5-122B-A10B is een groot taalmodel uit de Qwen-serie van Alibaba Cloud. Het maakt gebruik van een mixture-of-experts (MoE)-architectuur waarbij slechts 10 miljard parameters worden geactiveerd…
Op basis van zijn architecturen en benchmarkscore blinkt Qwen3.5-122B-A10B uit in taken die meerstapsredenering, toolgebruik en het opvolgen van instructies omvatten. De τ²-Bench-score van 93,6 duidt op sterke prestaties op een benchmark die vereist dat het model reeksen acties plant en uitvoert met behulp van tools (bijv. rekenmachines, zoekmachines, code-interpreters). Dit maakt het geschikt voor het bouwen van autonome agenten die moeten interacteren met externe systemen. Het model verwerkt ook multimodale invoer, dus taken zoals visueel redeneren, documentanalyse met ingebedde afbeeldingen of videosamenvatting behoren tot zijn sterke punten. Bovendien stelt de grote uitvoerlimiet het in staat om grondige uitleg, codeaanvullingen of gestructureerde gegevens in één antwoord te genereren. Ontwikkelaars die werken aan complexe chatbots, codeerassistenten of onderzoeksanalysetools, kunnen dit model effectief vinden.
Hoewel Qwen3.5-122B-A10B krachtig is, is het niet de meest kosteneffectieve keuze voor elke gebruikssituatie. Als uw taak een eenvoudige classificatie, korte tekstgeneratie of een eenvoudige Q&A is die geen meerstapsredenering of multimodaal begrip vereist, kunt u bevredigende resultaten behalen met een kleiner model zoals Qwen-7B of een niet-multimodaal model. Die modellen kunnen sneller en goedkoper per token zijn. Ook, als uw contextbehoeften erg klein zijn (bijv. minder dan 1.000 tokens), is de relatieve overhead van het gebruik van een model met 122B parameters mogelijk niet de moeite waard. OrcaRouter biedt een reeks modellen met verschillende prijs- en prestatiekenmerken. U kunt eerst experimenteren met kleinere modellen en alleen upgraden als de kwaliteit onvoldoende is. Daarnaast, als u de 65K uitvoerlimiet niet nodig heeft, kan een model met een kortere uitvoer volstaan.
Het model heeft een contextvenster van 32.768 tokens en een maximale output van 65.536 tokens, waardoor het uitgebreide redeneerketens en lange instructies kan verwerken. De hoge τ²-Bench-score suggereert dat het coherentie over meerdere stappen kan behouden en complexe instructies correct kan volgen die voorwaardelijke logica, toolaanroepen en vertakkingen omvatten. In de praktijk hebben gebruikers gemeld dat de Qwen3.5-serie modellen concurrerend zijn met andere state-of-the-art modellen bij taken zoals wiskundig probleemoplossen, codegeneratie en logische puzzels. Net als bij alle grote modellen kan de prestatie echter afnemen als de context gevuld is met irrelevante informatie of als de instructies dubbelzinnig zijn. Prompt engineering wordt aanbevolen om het model effectief te begeleiden. Het model kan ook moeite hebben met zeer lange documenten (dicht bij de contextlimiet) waarbij het details vanaf het begin moet onthouden.
De multimodale invoer (tekst + afbeelding/video) maakt verschillende praktische toepassingen mogelijk. Bij documentanalyse kan het model zowel de tekst als ingesloten grafieken, diagrammen of handtekeningen in een PDF of afbeelding lezen. Het kan bijvoorbeeld gegevens uit een gescande tabel extraheren of een grafiek interpreteren. Bij visuele vraagbeantwoording kan het model vragen over een foto of illustratie beantwoorden. Bij videoanalyse kan het frames verwerken om scènes te beschrijven of veranderingen in de loop van de tijd te volgen. Ontwikkelaars kunnen hulpmiddelen bouwen voor toegankelijkheid (bijv. afbeeldingen beschrijven voor visueel beperkte gebruikers) of automatisering (bijv. UI-schermafbeeldingen analyseren). Omdat het model via OrcaRouter wordt benaderd, kunnen deze mogelijkheden worden geïntegreerd in bestaande applicaties met dezelfde API-aanroepen die worden gebruikt voor tekst-only prompts, simpelweg door image_url of video_url op te nemen in de berichtinhoud.
De enige gepubliceerde benchmark voor dit model is de τ²-Bench, waar het 93,6 scoorde. τ²-Bench is ontworpen om het vermogen van een model te evalueren om tools te gebruiken en meervoudige stappen te voltooien in een gesimuleerde omgeving. Een score van 93,6 geeft aan dat het model een hoog aandeel van deze taken correct kan voltooien. Ter context: deze score is concurrerend met andere state-of-the-art modellen op dezelfde benchmark. Echter, benchmarkscores vertalen zich niet altijd naar prestaties in de praktijk, omdat taken kunnen variëren in moeilijkheidsgraad en de benchmark mogelijk niet alle domeinen dekt. Gebruikers dienen hun eigen evaluaties uit te voeren op hun specifieke taken. Er worden geen andere benchmarkscores (bijv. MMLU, HumanEval, of multimodale benchmarks) verstrekt in de beschikbare feiten, dus het is niet mogelijk om dit model te vergelijken op een breder scala aan standaardmetingen.
Sterke punten: Het model behaalt een hoge score op een tool-gebruik benchmark, wat wijst op sterk redeneervermogen en het volgen van instructies. De multimodale mogelijkheid en grote outputlimiet maken het veelzijdig. De MoE-architectuur kan een goede balans bieden tussen prestaties en efficiëntie (tenminste vergeleken met een dicht model van vergelijkbare totale parameters). Beperkingen: Het model heeft een contextvenster van slechts 32.768 tokens, wat bescheiden is vergeleken met sommige modellen die 100K of meer bieden. De geactiveerde parameters (10B) zijn relatief laag voor een model van zijn totale grootte, wat de prestaties op zeer complexe taken kan beperken. Er is geen informatie beschikbaar over latentie, doorvoer of hardwarevereisten. Ook, omdat het model nieuw is, kan de gemeenschapsecologie (bijv. finetuning-scripts, kwantisatietools) minder ontwikkeld zijn dan voor meer gevestigde modellen. Gebruikers moeten het model grondig testen.
Er zijn geen specifieke latentie- of doorvoercijfers beschikbaar voor dit model op OrcaRouter. De snelheid van inferentie hangt af van factoren zoals de invoerlengte, uitvoerlengte, batchgrootte en de onderliggende hardware die OrcaRouter toewijst. MoE-modellen kunnen variabele snelheid hebben omdat het routeringsmechanisme verschillende experts kan activeren voor verschillende tokens. Over het algemeen kunnen modellen met 10B geactiveerde parameters met gematigde snelheden genereren op moderne GPU's, maar de totale 122B parameters in het geheugen kunnen leiden tot hoger geheugengebruik en langere prefill-tijden. Als lage latentie cruciaal is, wilt u het model wellicht testen met uw typische prompts. De API van OrcaRouter retourneert tijdstempels en prestatiegegevens in de response-headers die u kunnen helpen de snelheid te meten. Voor latentiegevoelige toepassingen kunt u overwegen een kleiner model te gebruiken als de taak dat toelaat.
De beschikbare feiten omvatten slechts één benchmark: τ²-Bench. Veelvoorkomende benchmarks zoals MMLU (kennis), HumanEval (code), GSM8K (wiskunde) of multimodale benchmarks zoals MMBench worden niet verstrekt. Dit maakt het moeilijk om de prestaties van het model te beoordelen op taken die niet tool-gerelateerd zijn. Als uw applicatie bijvoorbeeld feitelijke nauwkeurigheid vereist, zou u graag de prestaties op MMLU willen weten. Evenzo zouden scores op een visuele redeneerbenchmark nuttig zijn voor multimodale taken. De afwezigheid van deze scores impliceert geen slechte prestaties, maar het betekent dat gebruikers hun eigen evaluaties moeten uitvoeren. OrcaRouter kan op verzoek of in documentatie aanvullende benchmarkresultaten verstrekken. Totdat er meer gegevens beschikbaar zijn, is het raadzaam om het model kwalitatief te vergelijken met andere modellen op uw specifieke domein.
Prijzen voor Qwen3.5-122B-A10B op OrcaRouter worden niet expliciet vermeld in de beschikbare gegevens. Doorgaans rekent OrcaRouter per token voor zowel invoer als uitvoer, met aparte tarieven voor prompt-tokens en gegenereerde tokens. Multimodale invoer (afbeeldingen/video) wordt gefactureerd als tokenequivalenten op basis van het aantal verwerkte afbeeldingsblokken of videoframes. Sommige providers bieden ook kortingstarieven voor cache-hits als de gebruiker dezelfde prompt herhaalt. Voor exacte prijzen moeten gebruikers de prijspagina van OrcaRouter raadplegen of contact opnemen met het verkoopteam. Omdat dit model 122B totale parameters heeft en multimodaal is, kan de prijs per token hoger zijn dan die van kleinere of tekst-only modellen. Het is belangrijk om rekening te houden met de tokencost voor afbeeldingen/video bij het schatten van de totale kosten voor een taak.
Het gebruik van een groter model zoals Qwen3.5-122B-A10B brengt meestal hogere per-token kosten met zich mee dan kleinere modellen. Echter, als het model een taak in minder stappen of met minder tokens kan oplossen vanwege zijn capaciteiten, kunnen de totale kosten nog steeds concurrerend zijn. De grote uitvoerlimiet (65.536 tokens) kan zowel een voordeel als een kostenrisico zijn: het genereren van lange uitvoer kan snel tokennkosten accumuleren. Daarnaast verbruiken multimodale invoer meer tokens per prompt dan alleen-tekst prompts. Een enkele hoge-resolutie afbeelding kan bijvoorbeeld honderden tokens kosten. Als uw taak niet de volledige capaciteiten van het model vereist, kunt u geld besparen door een kleiner model te kiezen. OrcaRouter biedt waarschijnlijk gebruiksdashboarden en kostenregelingen, zoals het instellen van een maximum aantal uitvoertokens of budgetwaarschuwingen, die kunnen helpen bij het beheren van uitgaven.
De beschikbare feiten vermelden geen caching-kortingen voor dit model op OrcaRouter. Veel inferentieproviders bieden prompt caching, waarbij herhaalde tekst in systeemprompts of gebruikersberichten tijdelijk wordt opgeslagen en tegen een lager tarief wordt gefactureerd. Als OrcaRouter caching ondersteunt, kan dit de kosten verlagen voor toepassingen die lange statische prompts gebruiken (bijv. systeeminstructies, karakterbeschrijvingen). Zonder specifieke documentatie mag dit echter niet worden aangenomen. Gebruikers kunnen de API-responsheaders controleren op cache-hit-indicatoren als caching is geïmplementeerd. Om de kosten te minimaliseren, kunt u prompts ontwerpen om het herhalen van dezelfde lange voorvoegsels te vermijden door statische instructies te scheiden van dynamische inhoud. Overweeg ook het gebruik van kortere contextvensters of het weglaten van onnodige afbeeldingen wanneer mogelijk.
Om Qwen3.5-122B-A10B te gebruiken, stuur een POST-verzoek naar het OrcaRouter API-eindpunt op https://api.orcarouter.ai/v1/chat/completions. Stel de modelparameter in op "qwen/qwen3.5-122b-a10b". De API is volledig compatibel met OpenAI's chat completions-formaat, dus je kunt dezelfde clientbibliotheken (bijv. openai Python-bibliotheek) gebruiken door de basis-URL en API-sleutel te wijzigen. De body van het verzoek bevat berichten (elk met een rol en inhoud), en optioneel parameters zoals temperature, max_tokens, top_p, enz. Voor multimodale invoer gebruik je een contentblok met type: "image_url" voor afbeeldingen of de specifieke videoverwerking van het model (waarschijnlijk via base64-gecodeerde frames of een URL). De API retourneert een JSON-antwoord met de gegenereerde tekst en metadata over het gebruik (tokenaantallen). OrcaRouter-documentatie geeft meer details over ondersteunde parameters.
Het model ondersteunt de standaard chatparameters: temperature (standaard doorgaans 0,7), top_p (standaard 0,9), max_tokens (tot de maximale output van het model van 65.536), presence_penalty, frequency_penalty en stop-sequenties. De contextvensterlimiet is 32.768 tokens, wat alle berichten, afbeeldingen en videoframes omvat. Als het totale aantal tokens deze limiet overschrijdt, retourneert de API een foutmelding of wordt de invoer afgekapt (afhankelijk van de instellingen). De parameter max_tokens mag niet hoger zijn dan 65.536. Houd er bij multimodale verzoeken rekening mee dat afbeeldingen en video's tokens toevoegen; de exacte conversieratio wordt niet verstrekt, maar hoge resolutie of lange video's kunnen het contextvenster snel verbruiken. OrcaRouter ondersteunt mogelijk ook streammodus, waarbij antwoorden token voor token worden gestreamd, wat nuttig is voor realtime toepassingen. Raadpleeg de API-referentie voor extra opties zoals logprobs of tools.
Migreren is eenvoudig: vervang je basis-URL door https://api.orcarouter.ai/v1, gebruik de model-ID "qwen/qwen3.5-122b-a10b", en verstrek je OrcaRouter API-sleutel. Het verzoekformaat is identiek aan de OpenAI chat completions API. Bijvoorbeeld, in Python met de openai-bibliotheek kun je `client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key')` instellen. Roep vervolgens `client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)` aan. Als je applicatie function calling of tools gebruikt, let dan op dat het model deze ondersteunt, omdat het getraind is op τ²-Bench dat toolgebruik omvat. De exacte tool call-syntaxis kan echter afwijken van die van OpenAI; OrcaRouter ondersteunt waarschijnlijk het OpenAI-formaat, maar test dit om te bevestigen. Voor multimodale invoer kan je bestaande code die `image_url` in berichten stuurt, werken zolang het model dat formaat ondersteunt.
Binnen de Qwen-familie bevindt dit model zich tussen kleinere dichte modellen (bijv. Qwen-7B, Qwen-14B) en de grootste MoE-modellen (bijv. Qwen3.5-235B). Vergeleken met dichte modellen heeft dit MoE-model toegang tot een grotere totale parameterverzameling, maar activeert het slechts een fractie per token, wat meer gespecialiseerde experts mogelijk maakt. Dit kan leiden tot betere prestaties op een verscheidenheid aan taken, vooral taken die diverse kennis vereisen. Kleinere dichte modellen kunnen echter sneller en goedkoper zijn voor specifieke taken. Vergeleken met de grotere Qwen3.5-235B heeft dit model waarschijnlijk lagere prestaties, maar is het efficiënter. Multimodale ondersteuning is een veelvoorkomende functie van de Qwen3.5-generatie; eerdere versies (Qwen2, Qwen1) waren alleen tekst. Gebruikers moeten benchmarkresultaten op hun specifieke taken vergelijken om te beslissen welk model het beste past.
Directe vergelijkingen zijn moeilijk zonder uitgebreide benchmarks. Qwen3.5-122B-A10B behaalt 93.6 op τ²-Bench, wat een sterk resultaat is voor tool-use taken. Ter referentie: vergelijkbare scores op die benchmark voor andere modellen worden niet gegeven, maar het wordt beschouwd als een hoogwaardige capaciteit. Wat architectuur betreft, zijn Llama-modellen dicht en eenvoudiger, terwijl Claude-modellen andere propriëtaire architecturen hebben. Qwen3.5 biedt multimodale invoer (afbeelding/video) die Claude ondersteunt, maar Llama 3.2 en 3.1 zijn alleen tekst (behalve enkele vision-varianten). Het contextvenster van 32K is kleiner dan Claude's 100K of 200K maar vergelijkbaar met Llama 3.1's 128K? Niet precies; we mogen geen getallen verzinnen. Voor code en redeneren zijn veel modellen concurrerend. Het voordeel van dit model kan de specifieke afstemming voor toolgebruik (hoge score op τ²-Bench) en multimodale MoE-efficiëntie zijn. Claude en Llama hebben echter grotere ecosystemen en meer community-ondersteuning.
Weinig modellen combineren multimodale input, een groot contextvenster, een grote outputlimiet en een hoge τ²-Bench-score in één pakket. De Qwen3.5-serie is ontworpen als een capabel algemeen model met sterke redeneer- en toolgebruikvaardigheden. De MoE-architectuur met 122B in totaal en 10B actief stelt het in staat om veel kennis te bevatten terwijl de inferentiekosten lager blijven dan bij een dicht 122B-model. Dat gezegd hebbende, andere MoE-modellen zoals Mixtral 8x7B (totaal 47B, actief 13B) hebben andere afwegingen. Qwen3.5-122B-A10B heeft een veel groter totaal aantal parameters, maar minder actieve parameters per token (10B vs. 13B). De multimodale ondersteuning is een onderscheidend kenmerk; Mixtral is alleen tekst. In de multimodale MoE-ruimte bestaan modellen zoals Qwen-VL of andere, maar die hebben vaak kleinere contextvensters. Dit model wordt gepositioneerd als een sterke optie voor ontwikkelaars die één model nodig hebben voor diverse, multimodale en tool-intensieve taken op OrcaRouter.
Kies Qwen3.5-122B-A10B als uw applicatie zowel multimodaal begrip als complex meerstapsredeneren vereist, en u de grote uitvoerlimiet nodig heeft voor het genereren van lange antwoorden. Het is ook een goede keuze als u agentische systemen bouwt die tools gebruiken, gezien de hoge τ²-Bench-score. Als uw taak alleen tekst is en de extra capaciteit niet nodig heeft, kan een goedkoper model zoals Llama 3.1 70B of Qwen-14B volstaan. Als u een groter contextvenster nodig heeft (bijv. >100K tokens), overweeg dan modellen die specifiek zijn ontworpen voor lange context. Als u lagere latentie nodig heeft, kan een kleiner of dicht model beter zijn. Aangezien OrcaRouter veel modellen aanbiedt, kunt u meerdere via dezelfde API evalueren om de beste match voor uw kosten- en kwaliteitsdoelen te vinden. De model-ID is qwen/qwen3.5-122b-a10b.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Niveau | Invoer / 1M tokens | Uitvoer / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Niveau bepaald door het aantal invoertokens van elk verzoek | ||
Schatting op basis van catalogusprijs
Gelaagde prijzen — deze schatting gebruikt de basistarieven.
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/qwen/qwen3.5-122b-a10bOpenen @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b