Qwen3.6 35B-A3B — MoE med öppen vikt, multimodal (text/bild/video), 35B totalt / 3B aktiva parametrar, 256k kontext.
Qwen3.6 35B A3B är en mixture-of-experts (MoE) stor språkmodell från Qwen-familjen. Den innehåller 35 miljarder parametrar totalt, men endast cirka 3 miljarder aktiveras under varje framåtriktad…
Qwen3.6 35B A3B utmärker sig i uppgifter som drar nytta av långa kontextfönster och multimodal förståelse. Detta inkluderar frågebesvarande på dokumentnivå, sammanfattning av långa rapporter, kodgenerering med utökad kontext och komplex resonemang över flera steg. Modellens kontext på 262,144 tokens gör det möjligt för den att bearbeta hela böcker, omfattande kodbaser eller timmar av transkriberad video. Dess styrka på τ²-Bench (95.3) indikerar stark prestanda i uppgifter som kräver att hämta och använda information från långa indata, samt att anropa externa verktyg och följa instruktioner över många turer. Multimodala indata—bilder och videor—lägger till förmågan att analysera visuellt innehåll tillsammans med text i en enda prompt.
Modellen stödjer indata i form av text, bilder och videofiler. När du skickar en förfrågan via OrcaRouters API kan du inkludera bilddata (t.ex. base64-kodad eller URL) och videofiler i användarmeddelandet, enligt samma multimodala format som används av andra leverantörer. Modellen bearbetar dessa visuella element tillsammans med textprompten, vilket gör att den kan resonera kring diagram, illustrationer, fotografier eller videoklipp. Du kan till exempel be den beskriva en scen från en video, extrahera data från en bild eller kombinera textinstruktioner med visuell kontext. Utdata är alltid text. Det finns ingen separat prissättning för multimodala indata – de debiteras till samma per-token-indatapris.
Det 262 144-token stora kontextfönstret gör att modellen kan hantera mycket långa sekvenser utan trunkering. Långkontextbearbetning kan dock öka latens och minnesanvändning. MoE-arkitekturen hjälper till att minska kostnaden eftersom endast 3B parametrar är aktiva per token, men den fulla uppmärksamhetsmekanismen skalas fortfarande med sekvenslängd. För uppgifter där relevant information är utspridd över en lång inmatning indikerar Qwen3.6 35B A3B:s höga τ²-Bench-poäng att den kan hämta och resonera effektivt. För mycket långa dokument, överväg chunkningsstrategier eller använd modellens egen sammanfattningsförmåga. För uppgifter med kort kontext kan en billigare, tät modell vara mer ekonomisk.
Om din användning involverar korta promptar (under 4K tokens), enkla uppgifter som klassificering eller extrahering, eller inte kräver multimodalt inflöde, kan en mindre, tät modell—som en 7B-parametervariant—erbjuda lägre latens och kostnad. Priset per token för Qwen3.6 35B A3B ($0,25/$1,48 per miljon tokens) är måttligt, men för högvolymarbeten med låg komplexitet kan en modell med ännu lägre aktiva parametrar (t.ex. 1B eller 3B tät) vara mer kostnadseffektiv. Om du dessutom inte behöver den långa kontexten eller multimodala förmågan betalar du för overhead du kanske inte använder. Utvärdera dina genomsnittliga prompt- och utdatalängder mot modellens styrkor för att bestämma.
τ²-Bench är ett benchmark som utvärderar en modells förmåga att utföra resonemang över långa sammanhang och flerstegsverktygsanvändning. Det innebär att bearbeta en stor textsamling (t.ex. en databas med dokument eller en kodbas) och sedan besvara frågor som kräver att hämta och syntetisera information från samlingen. Ett resultat på 95,3 indikerar att modellen framgångsrikt hanterade dessa uppgifter med hög noggrannhet och presterade bättre än många andra modeller på detta specifika benchmark. Det tyder på starka förmågor inom informationshämtning, resonemang och instruktionsföljning över längre sammanhang. Benchmarkresultat bör dock tolkas som ett mått på prestanda; resultat i verkligheten kan variera beroende på uppgiftens specifikationer.
Fördröjningen för Qwen3.6 35B A3B påverkas av dess MoE-arkitektur: endast 3B parametrar är aktiva per token, vilket generellt möjliggör snabbare inferens än en tät 35B-modell. Uppmärksamhetsmekanismen kräver dock fortfarande bearbetning av hela kontextfönstret, så längre indata ökar tiden till första token. OrcaRouter publicerar inga specifika latensmätvärden för denna modell. I praktiken beror svarstider på förfrågningsbelastning, promptlängd och antal utdatatokens. För realtidsapplikationer bör du testa med dina typiska indata. För batchbearbetning kan modellens kostnadseffektivitet kompensera för längre fördröjningar. Användare bör ta hänsyn till både hastighet och kostnad när de jämför med täta modeller.
Det primära benchmarkresultatet är τ²-Bench-poängen 95,3, vilket indikerar stark långkontext- och verktygsanvändningsresonemang. Detta är ett viktigt styrkeområde. Modellens multimodalitet positionerar den också väl för uppgifter som kombinerar visuell och textuell data, även om inga separata benchmarkpoäng för visuella uppgifter anges här. Baserat på arkitekturen kan man förvänta sig att modellen presterar bra på uppgifter som drar nytta av det stora parameterantalet men inte kräver full aktivering av alla parametrar. MoE-designen kan leda till något mindre konsekvens jämfört med täta modeller på vissa snäva uppgifter, men den erbjuder en fördelaktig avvägning mellan kapacitet och kostnad.
Även om τ²-Bench-poängen är hög, är det ett enskilt riktmärke; resultat på andra riktmärken (t.ex. MMLU, MATH, kodningstävlingar) tillhandahålls inte. Modellens täta motsvarigheter (t.ex. en full 35B tät modell) kan prestera bättre på uppgifter som kräver att alla parametrar är samtidigt engagerade, såsom vissa matematiska resonemang eller flerspråkiga uppgifter. Dessutom stöds multimodal inmatning, men kvaliteten på videoförståelsen kan bero på bildruteurval och komprimering. Latens har inte offentligt jämförts. Användare bör inte anta att modellen är det bästa valet för alla scenarier; utvärdera alltid mot din specifika användningssituation och överväg att köra egna riktmärken.
Prissättningen är per token, debiteras separat för input och output. Kostnaden är $0,25 per 1 miljon input-tokens och $1,48 per 1 miljon output-tokens. Detta är leverantörens priser, och OrcaRouter tillämpar inget påslag. Input-tokens inkluderar alla tokens i prompten, inklusive text, bildtokenisering och videotokenisering. Output-tokens är alla tokens som genereras i svaret. Det finns inga extra avgifter för att använda API:et, inga månadsabonnemang och inga krav på minsta användning. Faktureringen hanteras av OrcaRouter baserat på tokenanvändning. Eftersom endast 3B parametrar är aktiva per token, är beräkningskostnaden för leverantören lägre än för en tät 35B-modell, och denna besparing förs vidare i prissättningen.
Inmatningspriset ($0.25/1M tokens) är relativt lågt, medan utmatningspriset ($1.48/1M tokens) är högre, vilket återspeglar genereringskostnaden. Om din applikation matar ut ett stort antal tokens (t.ex. långa sammanfattningar, kodgenerering), kommer utmatningskostnaden att dominera. I sådana fall, överväg att minska utmatningslängden via instruktioner eller använda en billigare modell för generering om kvaliteten tillåter. Omvänt, om du har mycket långa prompts men korta utmatningar, är inmatningskostnaden fördelaktig. MoE-arkitekturen innebär att inferenskostnaden per token är lägre än för en tät modell med liknande totala parametrar, men prissättningen här är fastställd enligt leverantörens taxa; du betalar för effektiviteten.
OrcaRouter avslöjar inte offentligt om promptcachelagring är tillgängligt för denna modell. Om cachelagring vore implementerat skulle det kunna minska kostnaderna genom att undvika omkodning av identiska promptprefix. Emellertid nämns ingen sådan funktion specifikt för denna modell. Användare bör anta att varje förfrågan faktureras enligt standardpris per token. För repetitiva prompts, överväg att gruppera frågor eller använda kortare prefix för att minimera användningen av inmatningstokens. Du kan också övervaka tokenantal via API-svarets användningsfält för att optimera kostnaderna. För användning i företagsskala, kontakta OrcaRouter för att diskutera potentiella anpassade arrangemang eller cachelagringsstöd.
Noll marginal innebär att OrcaRouter tar ut exakt samma pris per token som modellleverantören (Qwen) har satt. Inga extra plattformsavgifter, omkostnader eller vinstmarginaler läggs till. $0,25/1M indata och $1,48/1M utdata är leverantörens egna priser. Detta är pristransparens; du betalar endast för den underliggande inferenskostnaden. OrcaRouter hanterar fortfarande API-infrastruktur, routning och fakturering, men tar inte ut extra avgifter för den tjänsten. Detta kan göra Qwen3.6 35B A3B mer ekonomisk jämfört med vissa andra plattformar som kan lägga på en marginal. Du kan dock fortfarande behöva jämföra totalkostnader inklusive eventuella volymrabatter eller krediter som OrcaRouter erbjuder separat.
Använd den OpenAI-kompatibla chattkompletteringsändpunkten på https://api.orcarouter.ai/v1. Ställ in modellparametern till "qwen/qwen3.6-35b-a3b". Konstruera meddelanden som du skulle göra med OpenAI:s API, inklusive ett systemmeddelande om så önskas, och användarmeddelanden. För multimodal input, inkludera en array av innehållsdelar med typen "text" och "image_url" (eller "video_url"). Exempel (pseudokod): curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" -d '{"model":"qwen/qwen3.6-35b-a3b","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'. Svaret följer OpenAI-formatet med choices, usage, etc.
Standard OpenAI-parametrar stöds: temperature (0 till 2, standard 1), top_p (0 till 1, standard 1), max_tokens (upp till 65536), stoppsekvenser, frequency_penalty, presence_penalty och stream. För multimodal-förfrågningar kan du skicka bilder som base64 data-URL:er eller offentliga URL:er. Videoinmatningar kan kräva specifik kodning—kontrollera OrcaRouter-dokumentationen. Ytterligare parametrar som seed för reproducerbarhet kan stödjas men är inte garanterade. Modellen stöder inte funktionsanrop eller verktyg inbyggt; du kan dock simulera verktygsanrop genom att instruera modellen i systemprompten. För parallella verktygsanrop måste du hantera loopen externt. Strömning rekommenderas för realtidsapplikationer för att minska upplevd latens.
Om du är van vid ett OpenAI-kompatibelt API kräver migrering endast att du byter bas-URL och modell-ID. Ersätt din befintliga slutpunkt med https://api.orcarouter.ai/v1 och ställ in modell på "qwen/qwen3.6-35b-a3b". Autentisering använder en API-nyckel från OrcaRouter (anges i Authorization-huvudet som Bearer). Prisgränser och fakturering hanteras av OrcaRouter. För multimodal migrering, se till att din bild-/videoformatering matchar det förväntade schemat (OpenAI-kompatibelt). Svarformatet är identiskt med OpenAIs chattkompletteringar, så din befintliga parsningskod bör fungera med minimala ändringar. Testa med en enda begäran för att bekräfta att tokenräkning och latens är acceptabla.
Ja, modellen stöder strömning via OpenAI-kompatibla server-sent events (SSE)-protokollet. Sätt "stream": true i din begäran. Strömmen kommer att sända deltatokens när de genereras, precis som med OpenAIs strömning, inklusive finish_reason och användningsinformation i den slutliga händelsen. Strömning är användbart för interaktiva applikationer där du vill visa utdata stegvis. Observera att strömning inte minskar totala tokenkostnader; du debiteras för hela utdata. MoE-arkitekturen kan producera tokens i en jämn takt, men faktisk genomströmning beror på nätverks- och serverbelastning. Testa din integration för att säkerställa korrekt hantering av strömhändelser.
Jämfört med Mixtral 8x7B (en populär MoE-modell med 47B totalt, 12,9B aktiva) har Qwen3.6 35B A3B färre totala parametrar men också färre aktiva parametrar (3B jämfört med 12,9B). Detta gör den potentiellt mer kostnadseffektiv per token. Kontextfönstret på 262K tokens är betydligt större än Mixtrals standard på 32K (även om Mixtral kan utökas). Qwen3.6 A3B stöder även bild- och videoinmatning, vilket Mixtral inte gör inbyggt. När det gäller benchmarks får Mixtral runt 65–70 på τ²-Bench? Ej angivet; men Qwens 95,3 är mycket högt för just det benchmarktestet. För korta kontexter med ren text kan Mixtral prestera jämförbart eller bättre i vissa resonemangsuppgifter tack vare fler aktiva parametrar. För långa kontexter och multimodala uppgifter har Qwen3.6 A3B en klar fördel.
En tät modell med 35B parametrar skulle kräva ungefär 12 gånger mer beräkning per token än de 3B aktiva parametrarna i denna MoE-modell. Qwen3.6 A3B erbjuder därför en hastighets- och kostnadsfördel vid inferens, på bekostnad av viss konsekvens eftersom expertdirigeringen inte alltid aktiverar de mest relevanta experterna för varje indata. Täta modeller uppnår ofta mer förutsägbar kvalitet över olika uppgifter. Dock indikerar τ²-Bench-poängen att denna MoE-modell kan konkurrera med täta modeller inom resonemang över långa kontexter. Om du har en produktionsarbetsbelastning med hög volym där latens och kostnad är kritiska, är MoE-metoden fördelaktig. För forskning som kräver deterministiskt beteende kan en tät modell vara att föredra.
Välj Qwen3.6 35B A3B när din applikation kräver: (1) bearbetning av mycket långa dokument (upp till 262K tokens) i en enda genomgång, (2) multimodal förståelse som inkluderar bilder och video, (3) stark prestanda på uppgifter som involverar att hämta och resonera över stora kontexter (mätt med τ²-Bench), och (4) kostnadseffektivitet från en MoE-arkitektur med låga aktiva parametrar. Om dina uppgifter är kortfattade, endast text, och inte kräver lång kontext, kan en billigare modell som en 7B tät modell vara tillräcklig. För uppgifter som kräver högsta möjliga kvalitet på smala riktmärken (t.ex. matematikproblem), kan en större tät modell (t.ex. 70B) prestera bättre.
Alternativ inkluderar de täta modellerna Qwen2.5 32B eller 72B om du behöver mer konsekvent kvalitet över alla uppgifter. För multimodal erbjuder GPT-4o eller Claude 3.5 Sonnet bredare visuell förståelse men till en högre kostnad. För mycket hög genomströmning kan en mindre MoE-modell som Qwen2.5 14B A2B vara billigare. Om du behöver funktionsanrop eller verktygsanvändning med strukturerade utdata, överväg modeller med inbyggt stöd för funktionsanrop (t.ex. GPT-4 eller Claude). Valet beror i slutändan på din specifika kombination av kontextlängd, modalitet, latenstolerans och budget. Kör alltid din egen utvärdering med representativa exempel.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.6-35b-a3b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Inmatning / 1M token | $0.248 |
| Utdata / 1M tokens | $1.485 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/qwen/qwen3.6-35b-a3bÖppna @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.6-35b-a3b}
}Qwen. (2026). Qwen3.6 35B A3B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.6-35b-a3b