Qwen3.5 122B-A10B — öppen vikt MoE multimodal (text/bild/video), 122B totalt / 10B aktiva parametrar, 32k kontext (visionsläge)
Qwen3.5-122B-A10B är en stor språkmodell från Qwen-serien av Alibaba Cloud. Den använder en mixture-of-experts (MoE)-arkitektur där endast 10 miljarder parametrar aktiveras per framåtpass, medan det…
Baserat på dess arkitekturer och benchmark-poäng utmärker sig Qwen3.5-122B-A10B i uppgifter som involverar flerstegsresonemang, användning av verktyg och efterföljande av instruktioner. τ²-Bench-poängen 93.6 indikerar stark prestanda på ett benchmark som kräver att modellen planerar och utför sekvenser av åtgärder med hjälp av verktyg (t.ex. miniräknare, sökmotorer, kodtolkare). Detta gör den lämplig för att bygga autonoma agenter som behöver interagera med externa system. Modellen hanterar även multimodala indata, så uppgifter som visuellt resonemang, dokumentanalys med inbäddade bilder eller videosammanfattning ligger inom dess styrkor. Dessutom tillåter dess stora utdatagräns att den kan generera noggranna förklaringar, kodkompletteringar eller strukturerad data i ett enda svar. Utvecklare som arbetar med komplexa chattbotar, kodningsassistenter eller forskningsanalysverktyg kan finna denna modell effektiv.
Medan Qwen3.5-122B-A10B är kraftfull, är det inte det mest kostnadseffektiva valet för alla användningsfall. Om din uppgift är en enkel klassificering, kort textgenerering eller en enkel fråga-svar utan multistegsresonemang eller multimodalförståelse, kan du uppnå tillfredsställande resultat med en mindre modell som Qwen-7B eller en icke-multimodal modell. Dessa modeller kan vara snabbare och billigare per token. Om dina sammanhangsbehov är mycket små (till exempel mindre än 1 000 tokens) är den relativa omkostnaden för att använda en 122B parametermodell kanske inte värd besväret. OrcaRouter erbjuder ett urval av modeller med olika pris- och prestandaegenskaper. Du kan experimentera med mindre modeller först och uppgradera endast om kvaliteten är otillräcklig. Dessutom, om du inte behöver 65K-gränsen för utdata, kan en modell med kortare utdata vara tillräcklig.
Modellen har ett kontextfönster på 32 768 tokens och en maximal utdata på 65 536 tokens, vilket gör att den kan hantera utökade resonemangskedjor och långa instruktioner. Den höga τ²-Bench-poängen tyder på att den kan upprätthålla koherens över flera steg och korrekt följa komplexa instruktioner som involverar villkorslogik, verktygsanrop och förgrening. I praktiken har användare rapporterat att Qwen3.5-seriens modeller är konkurrenskraftiga med andra toppmoderna modeller i uppgifter som matematisk problemlösning, kodgenerering och logiska pussel. Men som alla stora modeller kan prestandan försämras om kontexten fylls med irrelevant information eller om instruktionerna är tvetydiga. Promptkonstruktion rekommenderas för att vägleda modellen effektivt. Modellen kan också ha svårigheter med mycket långa dokument (nära kontextgränsen) där den måste återkalla detaljer från början.
Den multimodala inmatningen (text + bild/video) möjliggör flera praktiska tillämpningar. Vid dokumentanalys kan modellen läsa både texten och inbäddade diagram, grafer eller signaturer i en PDF eller bild. Till exempel kan den extrahera data från en skannad tabell eller tolka en graf. Vid visuell frågebesvarande kan modellen svara på frågor om ett fotografi eller en illustration. Vid videoanalys kan den bearbeta bildrutor för att beskriva scener eller spåra förändringar över tid. Utvecklare kan bygga verktyg för tillgänglighet (t.ex. beskriva bilder för synskadade användare) eller automatisering (t.ex. analysera UI-skärmdumpar). Eftersom modellen nås via OrcaRouter kan dessa funktioner integreras i befintliga applikationer med samma API-anrop som används för textbaserade prompts, helt enkelt genom att inkludera image_url eller video_url i meddelandets innehåll.
Den enda offentliggjorda jämförelsen för denna modell är τ²-Bench, där den fick 93,6. τ²-Bench är utformat för att utvärdera en modells förmåga att använda verktyg och slutföra flerstegsuppgifter i en simulerad miljö. En poäng på 93,6 indikerar att modellen kan korrekt slutföra en hög andel av dessa uppgifter. För sammanhang är denna poäng konkurrenskraftig med andra toppmoderna modeller på samma jämförelse. Jämförelsepoäng översätts dock inte alltid till verklig prestanda, eftersom uppgifter kan variera i svårighetsgrad och jämförelsen kanske inte täcker alla domäner. Användare bör göra sina egna utvärderingar på sina specifika uppgifter. Inga andra jämförelsepoäng (t.ex. MMLU, HumanEval eller multimodaljämförelser) tillhandahålls i tillgängliga fakta, så det är inte möjligt att jämföra denna modell på ett bredare spektrum av standardmått.
Styrkor: Modellen uppnår ett högt poäng på ett verktygsanvändningsriktmärke, vilket tyder på starkt resonemang och instruktionsföljning. Dess multimodala förmåga och stora utdatagräns gör den mångsidig. MoE-arkitekturen kan ge en bra balans mellan prestanda och effektivitet (åtminstone jämfört med en tät modell med liknande totala parametrar). Begränsningar: Modellen har ett kontextfönster på endast 32 768 tokens, vilket är måttligt jämfört med vissa modeller som erbjuder 100K eller mer. De aktiverade parametrarna (10B) är relativt låga för en modell av dess totala storlek, vilket kan begränsa prestandan på mycket komplexa uppgifter. Ingen information finns tillgänglig om latens, genomströmning eller hårdvarukrav. Dessutom, eftersom modellen är ny, kan community-ekosystemet (t.ex. finjusteringsskript, kvantiseringsverktyg) vara mindre utvecklat än för mer etablerade modeller. Användare bör testa modellen noggrant.
Inga specifika siffror för latens eller genomströmning finns tillgängliga för denna modell på OrcaRouter. Inferenshastigheten beror på faktorer som indatalängd, utdatalängd, batchstorlek och den underliggande hårdvara som OrcaRouter allokerar. MoE-modeller kan ha variabel hastighet eftersom routningsmekanismen kan aktivera olika experter för olika tokens. Generellt sett kan modeller med 10B aktiverade parametrar generera i måttlig hastighet på moderna GPU:er, men de totala 122B parametrarna i minnet kan leda till högre minnesanvändning och längre prefill-tider. Om låg latens är avgörande kan du vilja testa modellen med dina typiska promptar. OrcaRouters API returnerar tidsstämplar och prestandamått i svarshuvudena som kan hjälpa dig att mäta hastighet. För latenskänsliga applikationer, överväg att använda en mindre modell om uppgiften tillåter.
De tillgängliga fakta innehåller endast ett enda riktmärke: τ²-Bench. Vanliga riktmärken som MMLU (kunskap), HumanEval (kod), GSM8K (matematik) eller multimodala riktmärken som MMBench tillhandahålls inte. Detta gör det svårt att bedöma modellens prestanda på uppgifter som inte är verktygsrelaterade. Till exempel, om din applikation kräver faktagranskning, skulle du vilja veta dess prestanda på MMLU. På samma sätt, för multimodala uppgifter, skulle poäng på ett visuellt resonemangsriktmärke vara användbart. Frånvaron av dessa poäng innebär inte dålig prestanda, men det innebär att användare måste genomföra sina egna utvärderingar. OrcaRouter kan tillhandahålla ytterligare riktmärkesresultat på begäran eller i dokumentation. Tills mer data finns tillgänglig är det lämpligt att jämföra modellen kvalitativt med andra inom ditt specifika domän.
Prisinformation för Qwen3.5-122B-A10B på OrcaRouter anges inte explicit i tillgängliga fakta. Vanligtvis tar OrcaRouter betalt per token för både in- och utdata, med separata priser för prompt-tokens och genererade tokens. Multimodala indata (bilder/video) faktureras som token-ekvivalenter baserat på antalet bildblock eller videoramar som bearbetas. Vissa leverantörer erbjuder även rabatterade priser för cacheträffar om användaren upprepar samma prompt. För att få exakt pris bör användare hänvisa till OrcaRouters prissida eller kontakta deras säljteam. Eftersom denna modell har 122B totala parametrar och är multimodal, kan dess pris per token vara högre än för mindre eller textbaserade modeller. Det är viktigt att ta hänsyn till tokenkostnaden för bilder/video när man uppskattar totala utgifter för en uppgift.
Att använda en större modell som Qwen3.5-122B-A10B medför vanligtvis högre kostnader per token än mindre modeller. Men om modellen kan lösa en uppgift med färre steg eller färre tokens på grund av dess kapacitet, kan den totala kostnaden fortfarande vara konkurrenskraftig. Den stora utdatagränsen (65 536 tokens) kan vara både en fördel och en kostnadsrisk: att generera långa utdata kan snabbt ackumulera tokenkostnader. Dessutom förbrukar multimodala indata fler tokens per prompt än textbaserade prompts. Till exempel kan en enda högupplöst bild kosta hundratals tokens. Om din uppgift inte kräver modellens fulla kapacitet kan du spara pengar genom att välja en mindre modell. OrcaRouter har troligen användningsinstrumentpaneler och kostnadskontroller, som att ställa in ett maximalt antal utdatatokens eller budgetvarningar, vilket kan hjälpa till att hantera utgifterna.
De tillgängliga fakta nämner inga cachningsrabatter för denna modell på OrcaRouter. Många inferensleverantörer erbjuder prompt-cachning, där upprepad text i systemprompter eller användarmeddelanden lagras tillfälligt och debiteras till en lägre taxa. Om OrcaRouter stöder cachning, skulle det kunna minska kostnaderna för applikationer som använder långa statiska prompter (t.ex. systeminstruktioner, karaktärsbeskrivningar). Utan specifik dokumentation bör det dock inte antas. Användare kan kontrollera API-svarshuvuden för cachträffsindikatorer om cachning är implementerad. För att minimera kostnaderna kan du utforma prompter för att undvika att upprepa samma långa prefix genom att separera statiska instruktioner från dynamiskt innehåll. Överväg också att använda kortare kontextfönster eller utelämna onödiga bilder när det är möjligt.
För att använda Qwen3.5-122B-A10B, skicka en POST-begäran till OrcaRouter API-slutpunkten på https://api.orcarouter.ai/v1/chat/completions. Ställ in model-parametern till "qwen/qwen3.5-122b-a10b". API:et är fullt kompatibelt med OpenAIs chat completions-format, så du kan använda samma klientbibliotek (t.ex. openai Python-biblioteket) genom att ändra bas-URL och API-nyckel. Begäran innehåller meddelanden (varje med en role och content) samt valfria parametrar som temperature, max_tokens, top_p, etc. För multimodal inmatning, använd ett innehållsblock med type: "image_url" för bilder eller modellens specifika videohantering (troligen via base64-kodade bildrutor eller en URL). API:et returnerar ett JSON-svar med den genererade texten och användningsmetadata (token-antal). OrcaRouter-dokumentationen ger mer information om parametrar som stöds.
Modellen stöder standardchattparametrar: temperature (standard typiskt 0,7), top_p (standard 0,9), max_tokens (upp till modellens maximala utdata på 65 536), presence_penalty, frequency_penalty och stoppsekvenser. Kontextfönstrets gräns är 32 768 tokens, vilket inkluderar alla meddelanden, bilder och videoramar. Om det totala tokenantalet överstiger denna gräns kommer API:t att returnera ett fel eller trunkera indatan (beroende på inställningar). Parametern max_tokens får inte överstiga 65 536. För multimodala förfrågningar, observera att bilder och videor lägger till tokens; den exakta omräkningskursen anges inte, men högupplösta eller långa videor kan snabbt förbruka kontextfönstret. OrcaRouter kan också stödja strömningsläge, där svar strömmas token för token, vilket är användbart för realtidsapplikationer. Kontrollera API-referensen för ytterligare alternativ som logprobs eller verktyg.
Migreringen är enkel: ersätt din bas-URL med https://api.orcarouter.ai/v1, använd modell-ID "qwen/qwen3.5-122b-a10b", och ange din OrcaRouter API-nyckel. Förfrågeformatet är identiskt med OpenAI:s chat completions API. Till exempel, i Python med openai-biblioteket kan du ställa in client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Anropa sedan client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Om din applikation använder funktionsanrop eller verktyg, notera att modellen stöder dem eftersom den är tränad på τ²-Bench som involverar verktygsanvändning. Men den exakta syntaxen för verktygsanrop kan skilja sig från OpenAI:s; OrcaRouter stöder troligen OpenAI-formatet men testa för att bekräfta. För multimodala indata kan din befintliga kod som skickar image_url i meddelanden fungera så länge modellen stöder det formatet.
Inom Qwen-familjen befinner sig denna modell mellan mindre täta modeller (t.ex. Qwen-7B, Qwen-14B) och de största MoE-modellerna (t.ex. Qwen3.5-235B). Jämfört med täta modeller kan denna MoE-modell få tillgång till en större total parameteruppsättning men aktiverar endast en bråkdel per token, vilket kan möjliggöra mer specialiserade experter. Detta kan leda till bättre prestanda inom en mängd olika uppgifter, särskilt de som kräver mångsidig kunskap. Mindre täta modeller kan dock vara snabbare och billigare för smala uppgifter. Jämfört med den större Qwen3.5-235B har denna modell troligen lägre prestanda men är mer effektiv. Det multimodala stödet är en gemensam funktion för Qwen3.5-generationen; tidigare versioner (Qwen2, Qwen1) var endast textbaserade. Användare bör jämföra benchmarkresultat för sina specifika uppgifter för att avgöra vilken modell som passar bäst.
Direkta jämförelser är svåra utan omfattande riktmärken. Qwen3.5-122B-A10B uppnår 93,6 på τ²-Bench, vilket är ett starkt resultat för verktygsanvändningsuppgifter. Som referens anges inte liknande poäng på det riktmärket för andra modeller, men det anses vara en hög nivå av förmåga. Arkitekturmässigt är Llama-modeller täta och enklare, medan Claude-modeller har olika proprietära arkitekturer. Qwen3.5 erbjuder multimodal inmatning (bild/video) vilket Claude stöder, men Llama 3.2 och 3.1 är endast textbaserade (förutom vissa vision-varianter). Kontextfönstret på 32K är mindre än Claudes 100K eller 200K men jämförbart med Llama 3.1:s 128K? Inte exakt; vi får inte hitta på siffror. För kod och resonemang är många modeller konkurrenskraftiga. Denna modells fördel kan vara dess specifika anpassning för verktygsanvändning (högt τ²-Bench-resultat) och effektiv multimodal MoE. Claude och Llama har dock större ekosystem och mer communitystöd.
Få modeller kombinerar multimodal indata, ett stort kontextfönster, en stor utdatalimit och ett högt τ²-Bench-resultat i ett paket. Qwen3.5-serien är utformad för att vara en kapabel allmän modell med starka resonemangs- och verktygsanvändningsförmågor. MoE-arkitekturen med 122B totalt och 10B aktiva gör att den kan innehålla mycket kunskap samtidigt som inferenskostnaderna hålls lägre än en tät 122B-modell. Det sagt, andra MoE-modeller som Mixtral 8x7B (totalt 47B, aktiva 13B) har olika avvägningar. Qwen3.5-122B-A10B har ett mycket större totalt parameterantal men färre aktiva parametrar per token (10B vs. 13B). Det multimodala stödet är en differentierare; Mixtral är endast textbaserad. Inom det multimodala MoE-området finns modeller som Qwen-VL eller andra, men de har ofta mindre kontextfönster. Denna modell är positionerad som ett starkt alternativ för utvecklare som behöver en enda modell för olika, multimodala och verktygstunga uppgifter på OrcaRouter.
Välj Qwen3.5-122B-A10B om din applikation kräver både multimodal förståelse och komplex flerstegsresonemang, och du behöver den stora utdatagränsen för att generera långa svar. Det är också ett bra val om du bygger agentiska system som använder verktyg, med tanke på dess höga τ²-Bench-poäng. Om din uppgift endast är textbaserad och inte kräver den extra kapaciteten, kan en billigare modell som Llama 3.1 70B eller Qwen-14B vara tillräcklig. Om du behöver ett större kontextfönster (t.ex. >100K tokens), överväg modeller som är speciellt utformade för lång kontext. Om du behöver lägre latens kan en mindre eller tät modell vara bättre. Eftersom OrcaRouter erbjuder många modeller kan du utvärdera flera via samma API för att hitta den bästa passformen för dina kostnads- och kvalitetsmål. Modell-ID är qwen/qwen3.5-122b-a10b.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Nivå | Inmatning / 1M token | Utdata / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Nivå väljs utifrån antalet inmatningstoken per förfrågan | ||
Uppskattning baserad på listpris
Skiktad prissättning — den här uppskattningen använder priser för basnivån.
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/qwen/qwen3.5-122b-a10bÖppna @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b