Een verliesloze, ongecensureerde versie van Qwen3.6 35B A3B die de oorspronkelijke mogelijkheden van het model behoudt, maar weigeringsgedrag verwijdert. Gebouwd voor ontwikkelaars, AI-onderzoekers en geavanceerde agent-workflows die onbeperkte modeloutput vereisen, zonder concessies te doen aan redeneren, coderen, meertalige prestaties of toolgebruik. De Aggressive variant is volledig ontgrendeld en ontworpen om directe, complete antwoorden te geven op een breed scala aan prompts. Hoewel het model af en toe korte informatieve disclaimers kan toevoegen die zijn overgenomen uit de training van het basismodel, zijn dit geen weigeringen en wordt de gevraagde inhoud nog steeds volledig gegenereerd. Ideaal voor AI-onderzoek, beveiligingstesten, red teaming, agentontwikkeling, code-assistenten en andere geavanceerde AI-toepassingen die profiteren van maximale outputflexibiliteit. Toegang tot dit model is beperkt en bedoeld voor beveiligingsonderzoekers, red teams, AI-veiligheidsonderzoekers en andere gekwalificeerde professionals die legitiem onderzoek, evaluatie en testen uitvoeren.
Dit model is een Mixture-of-Experts variant uit de Qwen3.6-serie, oorspronkelijk ontwikkeld door Alibaba Cloud en gehost door provider Obsidian op OrcaRouter. Het heeft in totaal 35 miljard…
Dit model blinkt uit in taken die profiteren van een groot contextvenster en multimodaal begrip. Voor tekst kan het samenvatten of vragen beantwoorden over documenten van maximaal 262.144 tokens lang, zoals hele boeken of uitgebreide rapporten. Voor afbeeldingen en video's kan het gedetailleerde informatie extraheren en combineren met tekstuele context. De ongecensureerde aard maakt het mogelijk om creatieve inhoud te genereren zonder de gebruikelijke veiligheidsbeperkingen, nuttig voor verhalengeneratie, rollenspel of andere scenario's waar restrictieve filters ongewenst zijn. Het MoE-ontwerp biedt snelle inferentie in vergelijking met dichte modellen van vergelijkbare totale grootte, waardoor het praktisch is voor realtime toepassingen wanneer het efficiënt wordt ingezet. Meertalige mogelijkheden zijn overgenomen van de Qwen3.6-familie en ondersteunen vele talen.
De tag "uncensored" betekent dat het model minder alignment-training heeft ondergaan vergeleken met standaard Qwen3.6-checkpoints. Dit kan leiden tot uitvoer die minder gefilterd is op schadelijke, aanstootgevende of controversiële inhoud. Gebruikers moeten het model grondig testen in hun specifieke gebruikssituatie om te garanderen dat de uitvoer aan hun normen voldoet. Het gebrek aan censuur kan nuttig zijn voor taken zoals creatief schrijven, ongecensureerd rollenspel of onderzoek naar gevoelige onderwerpen waar neutrale generatie gewenst is. Het betekent echter ook dat het model inhoud kan produceren die in strijd is met gangbare inhoudsbeleid. OrcaRouter claimt geen extra veiligheidsfiltering; het basale gedrag van het model is wat je krijgt.
Als uw taak korte invoer (bijv. een paar honderd tokens), eenvoudige classificatie of slechts basis taalbegrip vereist, kunnen kleinere en goedkopere modellen zoals Qwen2.5-7B of GPT-4o-mini kosteneffectiever zijn. De sterke punten van dit model komen het duidelijkst naar voren bij het verwerken van zeer lange contexten (meer dan 10K tokens) of multimodale invoer. Voor zuivere teksttaken onder de 8K tokens zonder behoefte aan beeld-/videocapaciteit kunt u geld besparen door een specifiek klein model te gebruiken. Ook, als uw applicatie strikte contentfiltering vereist, kan de ongecensureerde aard u dwingen een externe moderatielaag toe te voegen, wat extra kosten met zich meebrengt.
Het model accepteert afbeelding- en video-invoer naast tekst. Voor afbeeldingen kun je base64-gecodeerde afbeeldingsgegevens of URL's opgeven (via de content-array van de API met type "image_url"). Voor video's accepteert de API waarschijnlijk videoframes als afbeeldingsreeksen of videobestand-URL's; het exacte formaat moet worden gecontroleerd in de documentatie van OrcaRouter. Het model verwerkt deze visuele invoer samen met tekst om reacties te genereren. Het contextvenster van 262.144 tokens is van toepassing op het gecombineerde token-aantal van alle invoermodaliteiten. Merk op dat het verwerken van afbeeldingen en video's tokens verbruikt in verhouding tot de visuele resolutie en lengte, dus grotere invoer zal de beschikbare tekstcapaciteit verminderen.
Er werden door de aanbieder geen specifieke benchmarkresultaten voor dit model verstrekt. De Qwen3.6-serie presteert over het algemeen concurrerend op benchmarks voor lange contexten, zoals L-Eval en RULER, en op multimodale taken zoals MMMU en MathVista, maar exacte cijfers voor deze ongecensureerde 35B A3B-variant zijn niet gepubliceerd. Gebruikers die geïnteresseerd zijn in empirische prestaties, dienen hun eigen evaluaties op representatieve datasets uit te voeren. De MoE-architectuur met 3B geactiveerde parameters levert vaak resultaten op die vergelijkbaar zijn met dichte modellen van vergelijkbare actieve omvang, terwijl de totale opslag- en geheugenkosten hoger zijn vanwege de volledige 35B parameters.
Snelheid en latentie zijn afhankelijk van verschillende factoren: invoerlengte, uitvoerlengte, serverbelasting en hardwareconfiguratie. Omdat het model slechts 3B parameters per token activeert, wordt verwacht dat het sneller is dan een dense 35B-model, met generatiesnelheden vergelijkbaar met modellen zoals GPT-3.5 (hoewel er geen exacte cijfers worden gegeven). De infrastructuur van OrcaRouter via Obsidian kan variabele latentie bieden; gebruikers kunnen testen met hun eigen workloads. Voor scenario's met lange contexten (bijv. 100K+ tokens) neemt de prefill-tijd lineair toe met de invoerlengte. Het genereren van uitvoertokens is doorgaans de grootste bijdrage aan de latentie. Er wordt geen service-level agreement (SLA) voor snelheid vermeld.
De sterke punten van het model zijn onder meer het grote contextvenster van 262K, waardoor het in één keer hele boeken of transcripten van urenlange video's kan verwerken. Het MoE-ontwerp biedt een goede balans tussen capaciteit en inferentiesnelheid. Multimodale invoer maakt taken mogelijk die tekst en visuele gegevens combineren. De ongecensureerde aard maakt het mogelijk inhoud te genereren die andere modellen zouden weigeren. Meertalige ondersteuning omvat tientallen talen. De prijsstelling is concurrerend voor een model van deze capaciteit: $0.31/M invoer en $4.21/M uitvoer, zonder opslag.
Beperkingen zijn onder andere het ontbreken van gepubliceerde benchmarkcijfers, waardoor het moeilijker is om de relatieve prestaties te beoordelen. De ongecensureerde aard kan zonder extra moderatie ongewenste uitkomsten produceren. Het geactiveerde parameteraantal van 3B betekent dat het mogelijk niet de ruwe redeneerkracht van grotere dichte modellen (zoals GPT-4) evenaart bij complexe logische taken. Multimodale mogelijkheden kunnen minder verfijnd zijn dan speciale visie-taalmodellen. Invoermodaliteiten zoals videotokenisatie kunnen de effectieve context voor tekst verminderen. Streaming of toolgebruiksmogelijkheden zijn niet gegarandeerd. Tot slot is de afhankelijkheid van de externe provider Obsidian van invloed op de beschikbaarheid en uptime, die niet onder controle van OrcaRouter vallen.
De prijzen zijn transparant: $0.31 per miljoen invoertokens en $4.21 per miljoen uitvoertokens. Dit zijn de exacte provider-tarieven van Obsidian, zonder markup toegevoegd door OrcaRouter. Invoertokens omvatten alle tekst- en visuele tokens (voor afbeeldingen en video's). Uitvoertokens zijn de gegenereerde tekst. Er is geen kosten per verzoek of abonnement vereist. U betaalt alleen voor de verbruikte tokens. De prijzen zijn per 1M tokens, dus kleine aanvragen kosten fracties van een cent. Er wordt geen gratis laag of proefversie geadverteerd.
Geen kortingen, caching-voordelen of volumeprijzen zijn voor dit model bekendgemaakt. De vermelde tarieven zijn vast per token. In tegenstelling tot sommige aanbieders die lagere prijzen bieden voor gecachte invoertokens, past OrcaRouter hetzelfde invoertarief toe, ongeacht herhaling. Voor zeer hoog gebruik kunt u contact opnemen met OrcaRouter voor mogelijke maatwerkafspraken, maar er is geen standaardkorting gedocumenteerd. Het nul-opslagbeleid garandeert dat u precies betaalt wat Obsidian in rekening brengt, zonder verborgen kosten.
Vergelijkbare lange context multimodale modellen van andere aanbieders kosten vaak meer: bijvoorbeeld OpenAI's GPT-4 Turbo is $10/1M input en $30/1M output, terwijl Claude 3.5 Sonnet $3/1M input en $15/1M output kost. Dit model is aanzienlijk goedkoper met $0.31/$4.21. Echter, die modellen bieden andere mogelijkheden (bijv. toolgebruik, hogere redeneerbenchmarks). De lagere prijs weerspiegelt de MoE-architectuur en het feit dat het een ongecensureerd, door derden gehost model is. Als u gegarandeerde betrouwbaarheid, hogere beveiliging of geavanceerde functies zoals function calling nodig heeft, kunnen de extra kosten gerechtvaardigd zijn.
Om het model te gebruiken, stuur een POST-verzoek naar https://api.orcarouter.ai/v1/chat/completions (of het juiste eindpunt volgens OrcaRouter's OpenAI-compatibele API). Voeg de header "Authorization: Bearer YOUR_API_KEY" toe. Stel in de body van het verzoek "model": "obsidian/Qwen3.6-35B-A3B" in. Geef berichten door in het standaard OpenAI-formaat: een array van objecten met "role" en "content". Gebruik voor multimodale content een content-array met type "text" en "image_url" (of het equivalent voor video). Voorbeeld met cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
U kunt typische OpenAI-compatibele parameters gebruiken: temperature (standaard 1.0), top_p (0.9), max_tokens (standaard varieert, aanbevolen om expliciet in te stellen), stop-sequenties, frequency_penalty, presence_penalty en seed voor reproduceerbaarheid. Het model ondersteunt streaming via "stream": true om token-voor-token antwoorden te ontvangen. Voor multimodale invoer verwacht de API inhoudarrays met type "image_url" en optioneel "video_url" (raadpleeg de OrcaRouter-documentatie voor exacte video-indeling). De contextvensterlimiet van 262.144 tokens geldt voor het totale aantal tokens in berichten plus het antwoord. Als u de limiet overschrijdt, krijgt u een contextlengtefout; u kunt "max_tokens" aanpassen of berichten inkorten.
Om de 262K context te benutten, structureer uw prompts om het volledige document of de volledige gespreksgeschiedenis op te nemen. Houd er rekening mee dat elke token in de invoer meetelt voor de kosten en limieten. Overweeg bij zeer lange invoer om te chunken of samen te vatten voordat u verzendt, hoewel het model is ontworpen om de volledige context te verwerken. Gebruik de "max_tokens"-parameter om de uitvoerlengte te regelen. Als u time-outfouten tegenkomt, schakel dan streaming in om sneller gedeeltelijke resultaten te krijgen. OrcaRouter kan eigen time-outinstellingen hebben; neem indien nodig contact op met ondersteuning. Het model ondersteunt systeemberichten niet op een speciale manier; behandel ze als een gebruiker- of assistentbericht met rol "system" (standaard OpenAI-formaat).
Migreren van providers zoals OpenAI of Anthropic vereist het wijzigen van de basis-URL naar https://api.orcarouter.ai/v1 en het bijwerken van de model-ID. Als uw code de OpenAI Python-client gebruikt, stelt u client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") in en gebruikt u vervolgens client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). Het berichtformaat en de parameternamen zijn identiek. Er zijn geen wijzigingen in de promptlogica vereist. Merk op dat response-objectvormen ook compatibel zijn, dus bestaande parseringscode zou moeten werken. Test eerst met een klein verzoek om te zorgen voor goede authenticatie en facturering.
Vergeleken met Qwen3.6-72B (dense) gebruikt dit model MoE, waardoor de inferentiekosten per token lager zijn, maar de ruwe capaciteit mogelijk iets lager uitvalt. De 262K context is groter dan Qwen2.5's 128K. Vergeleken met Qwen3.6-32B (mogelijk dense) biedt dit model multimodale invoer, wat die eerdere versies mogelijk niet hebben. De "uncensored"-variant is uniek; standaard Qwen-releases hebben alignment. Als u strikte veiligheid nodig hebt, kies dan de reguliere Qwen3.6. Qua prijs is dit model goedkoper dan veel dichte Qwen-modellen op andere platforms.
GPT-4o en Claude 3.5 Sonnet zijn propriëtaire modellen met uitgebreide veiligheidstraining, hogere benchmarkscores op het gebied van redeneren en coderen, en ondersteunen toolgebruik, visie en grote context (200K voor Claude). Dit model biedt een grotere context (262K) en multimodale invoer tegen een aanzienlijk lagere prijs. Het mist echter de geavanceerde functies, betrouwbaarheid en prestatiesconsistentie van die modellen. Voor toepassingen waar kosten een primaire overweging zijn en u enige kwaliteitscompromis kunt accepteren, is dit model een goed alternatief. Als u topniveau-redenering of functieaanroepen nodig heeft, zijn de premium modellen de extra kosten waard.
Dit model is het beste wanneer u nodig heeft: (1) een zeer lange context (262K tokens) tegen lage kosten; (2) multimodale invoer (afbeeldingen/video) zonder premium prijzen te betalen; (3) ongecensureerde tekstgeneratie waar contentfilters zouden interfereren; (4) snelle inferentie ten opzichte van het totale aantal parameters door MoE-activatie. Het is een sterke kandidaat voor onderzoek, gegevensextractie, creatief schrijven en elke taak die baat heeft bij hoge context en lage kosten per token. Als u geavanceerde functies nodig heeft zoals tool calls, gestructureerde uitvoer of hoge betrouwbaarheid, overweeg dan andere modellen.
| Invoer / 1M tokens | $0.310 |
| Uitvoer / 1M tokens | $4.21 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BOpenen @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B