En förlustfri ocensurerad version av Qwen3.6 35B A3B som bevarar originalmodellens förmåga samtidigt som vägrarbeteende tas bort. Byggd för utvecklare, AI-forskare och avancerade agentarbetsflöden som kräver obegränsade modellutdata utan att kompromissa med resonemang, kodning, flerspråkig prestanda eller verktygsanvändning. Den aggressiva varianten är helt upplåst och utformad för att ge direkta, fullständiga svar på ett brett spektrum av prompts. Även om modellen ibland kan lägga till korta informationsmässiga friskrivningar ärvda från basmodellens träning, rör det sig inte om vägran, och det begärda innehållet genereras fortfarande i sin helhet. Idealisk för AI-forskning, säkerhetstestning, red teaming, agentutveckling, kodningsassistenter och andra avancerade AI-tillämpningar som drar nytta av maximal flexibilitet i utdata. Tillgång till denna modell är begränsad och avsedd för säkerhetsforskare, red teams, AI-säkerhetsforskare och andra kvalificerade yrkesverksamma som bedriver legitim forskning, utvärdering och testning.
Denna modell är en variant av Mixture-of-Experts från Qwen3.6-serien, ursprungligen utvecklad av Alibaba Cloud och värd hos leverantören Obsidian på OrcaRouter. Den har totalt 35 miljarder…
Denna modell utmärker sig vid uppgifter som drar nytta av ett stort kontextfönster och multimodal förståelse. För text kan den sammanfatta eller besvara frågor om dokument upp till 262 144 tokens långa, såsom hela böcker eller långa rapporter. För bilder och videor kan den extrahera detaljerad information och kombinera den med textuell kontext. Den ocensurerade naturen gör att den kan generera kreativt innehåll utan typiska säkerhetsbegränsningar, användbart för berättelsegenerering, rollspel eller andra scenarier där restriktiva filter är oönskade. Dess MoE-design ger snabb inferens i förhållande till täta modeller av liknande total storlek, vilket gör den praktisk för realtidsapplikationer när den distribueras effektivt. Flerspråkiga förmågor är ärvda från Qwen3.6-familjen, som stöder många språk.
Taggen "uncensored" innebär att modellen har genomgått minskad anpassningsträning jämfört med standard Qwen3.6-kontrollpunkter. Detta kan resultera i utdata som är mindre filtrerade för skadligt, stötande eller kontroversiellt innehåll. Användare bör testa modellen noggrant i sitt specifika användningsfall för att säkerställa att utdatan uppfyller deras standarder. Avsaknaden av censur kan vara fördelaktig för uppgifter som kreativt skrivande, ocensurerad rollspel eller forskning om känsliga ämnen där neutral generering önskas. Men det innebär också att modellen kan producera innehåll som bryter mot typiska innehållspolicyer. OrcaRouter gör inte anspråk på något ytterligare säkerhetsfiltrering; modellens grundläggande beteende är vad du får.
Om din uppgift involverar korta indata (t.ex. några hundra tokens), enkel klassificering eller endast kräver grundläggande språkförståelse, kan mindre och billigare modeller som Qwen2.5-7B eller GPT-4o-mini vara mer kostnadseffektiva. Denna modells styrkor är tydligast när den hanterar mycket långa kontexter (över 10K tokens) eller multimodala indata. För rena textuppgifter under 8K tokens utan behov av bild-/videokapacitet kan du spara pengar genom att använda en dedikerad liten modell. Om din applikation dessutom kräver strikt innehållsfiltrering kan den ocensurerade naturen tvinga dig att lägga till ett externt modereringslager, vilket ökar kostnaden.
Modellen accepterar bild- och videoinmatningar utöver text. För bilder kan du tillhandahålla base64-kodad bilddata eller webbadresser (via API:ets innehållsarray med typ "image_url"). För videor accepterar API:t troligen videorutor som bildsekvenser eller videofil-URL:er; det exakta formatet bör kontrolleras i OrcaRouters dokumentation. Modellen bearbetar dessa visuella inmatningar tillsammans med text för att generera svar. Kontextfönstret på 262 144 token gäller för det kombinerade tokenantalet för alla inmatningsmodaliteter. Observera att bearbetning av bilder och videor förbrukar token proportionellt mot den visuella upplösningen och längden, så större inmatningar minskar den tillgängliga textkapaciteten.
Inga specifika riktmärkespoäng för denna modell tillhandahölls av leverantören. Qwen3.6-serien presterar generellt konkurrenskraftigt på långkontextriktmärken som L-Eval och RULER, och på multimodala uppgifter som MMMU och MathVista, men exakta siffror för denna 35B A3B ocensurerade variant är inte publicerade. Användare som är intresserade av empirisk prestanda bör köra egna utvärderingar på representativa dataset. MoE-arkitekturen med 3B aktiverade parametrar ger ofta resultat jämförbara med täta modeller av liknande aktiv storlek, medan totala lagrings- och minneskostnader är högre på grund av hela 35B parametrar.
Hastighet och latens beror på flera faktorer: indatalängd, utdatalängd, serverbelastning och hårdvarukonfiguration. Eftersom modellen endast aktiverar 3B parametrar per token förväntas den vara snabbare än en tät 35B-modell, med genereringstakter jämförbara med modeller som GPT-3.5 (även om inga exakta siffror anges). OrcaRouters infrastruktur via Obsidian kan erbjuda variabel latens; användare kan testa med sina egna arbetsbelastningar. För långkontextscenarier (t.ex. 100K+ tokens) ökar förifyllnadstiden linjärt med indatalängden. Generering av utdatatoken är vanligtvis den största bidragande faktorn till latensen. Inget serviceavtal (SLA) för hastighet anges.
Modellens styrkor inkluderar dess stora kontextfönster på 262K, vilket möjliggör bearbetning av hela böcker eller flera timmars videotranskriptioner i en enda omgång. MoE-designen ger en bra avvägning mellan kapacitet och inferenshastighet. Multimodal indata möjliggör uppgifter som kombinerar text och visuell data. Den ocensurerade naturen tillåter generering av innehåll som andra modeller skulle kunna vägra. Flerspråkigt stöd täcker dussintals språk. Prissättningen är konkurrenskraftig för en modell av denna kapacitet: 0,31 $/M inmatning och 4,21 $/M utdata, noll påslag.
Begränsningar inkluderar avsaknad av publicerade benchmarksiffror, vilket gör det svårare att bedöma relativ prestanda. Den ocensurerade naturen kan producera oönskade utdata utan ytterligare moderering. Det 3B aktiverade parametrarna innebär att den kanske inte matchar den råa resonemangskraften hos större täta modeller (t.ex., GPT-4) vid komplexa logiska uppgifter. Multimodala förmågor kan vara mindre förfinade än dedikerade syn-språkmodeller. Inmatningsmodaliteter som videotokenisering kan minska den effektiva kontexten för text. Inga strömnings- eller verktygsanvändningsfunktioner garanteras. Slutligen innebär beroendet av tredjepartsleverantören Obsidian att tillgänglighet och drifttid inte är under OrcaRouters kontroll.
Prissättningen är transparent: 0,31 USD per miljon inmatningstokens och 4,21 USD per miljon utmatningstokens. Dessa är de exakta leverantörspriserna från Obsidian, utan något påslag från OrcaRouter. Inmatningstokens inkluderar all text och visuella tokens (för bilder och videor). Utmatningstokens är den genererade texten. Det finns ingen avgift per förfrågan eller prenumerationskrav. Du betalar endast för de tokens som förbrukas. Priset är per 1M tokens, så små förfrågningar kostar bråkdelar av en cent. Ingen gratissnivå eller provperiod annonseras.
Inga rabatter, fördelar med cachelagring eller volymprissättning har avslöjats för denna modell. De angivna avgifterna är fasta per token. Till skillnad från vissa leverantörer som erbjuder reducerade priser för cachade indatatokens, tillämpar OrcaRouter samma inmatningsavgift oavsett upprepning. För mycket hög användning kan du kontakta OrcaRouter för eventuella anpassade arrangemang, men ingen standardrabatt är dokumenterad. Nollpåslags-policyn säkerställer att du betalar exakt vad Obsidian tar ut, utan dolda avgifter.
Jämförbara långkontext multimodala modeller från andra leverantörer kostar ofta mer: till exempel, OpenAI:s GPT-4 Turbo är $10/1M input och $30/1M output, medan Claude 3.5 Sonnet är $3/1M input och $15/1M output. Denna modell är märkbart billigare till $0.31/$4.21. Dessa modeller erbjuder dock olika funktioner (t.ex. verktygsanvändning, högre resonemangsriktmärken). Det lägre priset återspeglar MoE-arkitekturen och det faktum att det är en ocensurerad tredjepartshostad modell. Om du kräver garanterad tillförlitlighet, högre säkerhet eller avancerade funktioner som funktionsanrop, kan den extra kostnaden vara motiverad.
För att använda modellen skicka en POST-förfrågan till https://api.orcarouter.ai/v1/chat/completions (eller lämplig slutpunkt enligt OrcaRouters OpenAI-kompatibla API). Inkludera rubriken "Authorization: Bearer YOUR_API_KEY". I förfrågningskroppen anger du "model": "obsidian/Qwen3.6-35B-A3B". Skicka meddelanden i standard OpenAI-format: en array av objekt med "role" och "content". För multimodalt innehåll använd en innehållsarray med typ "text" och "image_url" (eller videomotsvarighet). Exempel med cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Du kan använda typiska OpenAI-kompatibla parametrar: temperature (standard 1.0), top_p (0.9), max_tokens (standard varierar, rekommenderar att ställa in explicit), stoppsekvenser, frequency_penalty, presence_penalty och seed för reproducerbarhet. Modellen stöder streaming via "stream": true för att få svar token-för-token. För multimodal input förväntar API:t innehållsarrayer med typ "image_url" och eventuellt "video_url" (kolla OrcaRouter-dokumentationen för exakt videoformat). Kontextfönstrets gräns på 262 144 tokens gäller det totala antalet tokens i meddelanden plus svaret. Om du överskrider gränsen får du ett kontextlängdfel; du kan justera "max_tokens" eller trunkera meddelanden.
För att dra nytta av 262K-kontexten, strukturera dina frågor så att de inkluderar hela dokumentet eller konversationshistoriken. Var medveten om att varje token i indata räknas mot kostnad och gränser. För mycket långa indata, överväg att dela upp eller sammanfatta innan du skickar, även om modellen är utformad för att hantera hela kontexten. Använd parametern "max_tokens" för att kontrollera utdatalängden. Om du stöter på timeout-fel, aktivera streaming för att få partiella resultat snabbare. OrcaRouter kan ha egna timeout-inställningar; kontakta supporten om det behövs. Modellen stöder inte systemmeddelanden på ett speciellt sätt; behandla dem som ett användar- eller assistentmeddelande med rollen "system" (standard OpenAI-format).
Att migrera från leverantörer som OpenAI eller Anthropic innebär att ändra bas-URL till https://api.orcarouter.ai/v1 och uppdatera modell-ID. Om din kod använder OpenAI Python-klienten, ställ in client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") och använd sedan client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). Meddelandeformatet och parameternamnen är identiska. Inga ändringar i promptlogiken krävs. Observera att svars-objektens former också är kompatibla, så befintlig parsningskod bör fungera. Testa med en liten begäran först för att säkerställa korrekt autentisering och fakturering.
Jämfört med Qwen3.6-72B (dense) använder denna modell MoE och har därmed lägre inferenskostnad per token men kan ha något lägre råkapacitet. Kontexten på 262K är större än Qwen2.5:s 128K. Jämfört med Qwen3.6-32B (kanske dense) erbjuder denna modell multimodal inmatning som tidigare versioner kanske inte har. Varianten "uncensored" är unik; vanliga Qwen-utgåvor har alignment. Om du behöver strikt säkerhet, välj den vanliga Qwen3.6. När det gäller pris är denna modell billigare än många dense Qwen-modeller på andra plattformar.
GPT-4o och Claude 3.5 Sonnet är proprietära modeller med omfattande säkerhetsträning, högre benchmark-poäng på resonemang och kodning, och stödjer verktygsanvändning, vision och stort sammanhang (200K för Claude). Denna modell erbjuder ett större sammanhang (262K) och multimodal input till ett betydligt lägre pris. Men den saknar de avancerade funktionerna, tillförlitligheten och prestandakonsekvensen hos dessa modeller. För applikationer där kostnad är en primär fråga och du kan acceptera en viss kvalitetsavvägning, är denna modell ett bra alternativ. Om du behöver toppklass resonemang eller funktionsanrop, är premiummodellerna värda den extra kostnaden.
Den här modellen är bäst när du behöver: (1) en mycket lång kontext (262K tokens) till låg kostnad; (2) multimodal inmatning (bilder/video) utan att betala premiumpriser; (3) ocensurerad textgenerering där innehållsfilter skulle störa; (4) snabb inferens i förhållande till totala parametrar på grund av MoE-aktivering. Den är en stark kandidat för forskning, dataextraktion, kreativt skrivande och alla uppgifter som drar nytta av hög kontext och låg kostnad per token. Om du behöver avancerade funktioner som verktygsanrop, strukturerade utdata eller hög tillförlitlighet, överväg andra modeller.
| Inmatning / 1M token | $0.310 |
| Utdata / 1M tokens | $4.21 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BÖppna @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B