Eine verlustfreie, unzensierte Version von Qwen3.6 35B A3B, die die Fähigkeiten des Originalmodells bewahrt, während das Verweigerungsverhalten entfernt wird. Entwickelt für Entwickler, KI-Forscher und fortgeschrittene Agent-Workflows, die uneingeschränkte Modellausgaben erfordern, ohne Kompromisse bei Reasoning, Coding, mehrsprachiger Leistung oder Tool-Nutzung einzugehen. Die aggressive Variante ist vollständig freigeschaltet und darauf ausgelegt, direkte, vollständige Antworten auf ein breites Spektrum von Eingabeaufforderungen zu liefern. Während das Modell gelegentlich kurze informative Haftungsausschlüsse aus dem Training des Basismodells anhängen kann, handelt es sich dabei nicht um Verweigerungen, und die angeforderte Inhalte werden dennoch vollständig generiert. Ideal für KI-Forschung, Sicherheitstests, Red Teaming, Agentenentwicklung, Programmierassistenten und andere fortgeschrittene KI-Anwendungen, die von maximaler Ausgabeflexibilität profitieren. Der Zugang zu diesem Modell ist beschränkt und richtet sich an Sicherheitsforscher, Red Teams, KI-Sicherheitsforscher und andere qualifizierte Fachleute, die legitime Forschung, Evaluierung und Tests durchführen.
Dieses Modell ist eine Mixture-of-Experts-Variante aus der Qwen3.6-Serie, die ursprünglich von Alibaba Cloud entwickelt und vom Anbieter Obsidian auf OrcaRouter gehostet wird. Es verfügt über…
Dieses Modell eignet sich hervorragend für Aufgaben, die von einem großen Kontextfenster und multimodaler Textverständnisfähigkeit profitieren. Für Text kann es Dokumente mit bis zu 262.144 Tokens Länge zusammenfassen oder Fragen beantworten, wie ganze Bücher oder ausführliche Berichte. Für Bilder und Videos kann es detaillierte Informationen extrahieren und mit textuellem Kontext kombinieren. Die unzensierte Natur ermöglicht es, kreative Inhalte ohne typische Sicherheitsbeschränkungen zu generieren, nützlich für Geschichtenerstellung, Rollenspiele oder andere Szenarien, bei denen restriktive Filter unerwünscht sind. Sein MoE-Design bietet schnelle Inferenz im Vergleich zu dichten Modellen ähnlicher Gesamtgröße, was es bei effizienter Bereitstellung praktisch für Echtzeitanwendungen macht. Mehrsprachige Fähigkeiten werden von der Qwen3.6-Familie geerbt und unterstützen viele Sprachen.
Das "uncensored"-Tag bedeutet, dass das Modell im Vergleich zu den Standard-Qwen3.6-Checkpoints ein reduziertes Alignment-Training durchlaufen hat. Dies kann zu Ausgaben führen, die weniger auf schädliche, anstößige oder kontroverse Inhalte gefiltert sind. Benutzer sollten das Modell in ihrem spezifischen Anwendungsfall gründlich testen, um sicherzustellen, dass die Ausgaben ihren Standards entsprechen. Das Fehlen von Zensur kann für Aufgaben wie kreatives Schreiben, unzensiertes Rollenspiel oder Forschung zu sensiblen Themen, bei denen eine neutrale Generierung gewünscht wird, vorteilhaft sein. Es bedeutet jedoch auch, dass das Modell Inhalte erzeugen kann, die gegen typische Inhaltsrichtlinien verstoßen. OrcaRouter erhebt keinen Anspruch auf zusätzliche Sicherheitsfilterung; was Sie erhalten, ist das Basisverhalten des Modells.
Wenn Ihre Aufgabe kurze Eingaben (z. B. einige hundert Tokens), einfache Klassifikation oder nur grundlegende Sprachverständnisfähigkeiten erfordert, können kleinere und günstigere Modelle wie Qwen2.5-7B oder GPT-4o-mini kosteneffizienter sein. Die Stärken dieses Modells zeigen sich am deutlichsten bei der Verarbeitung sehr langer Kontexte (über 10.000 Tokens) oder multimodaler Eingaben. Für reine Textaufgaben unter 8.000 Tokens ohne Bild-/Video-Funktionalität können Sie Geld sparen, indem Sie ein spezielles kleines Modell verwenden. Wenn Ihre Anwendung zudem eine strenge Inhaltsfilterung erfordert, könnte die unzensierte Natur Sie dazu zwingen, eine externe Moderationsschicht hinzuzufügen, was zusätzliche Kosten verursacht.
Das Modell akzeptiert Bild- und Videoeingaben zusätzlich zum Text. Für Bilder können Sie base64-kodierte Bilddaten oder URLs bereitstellen (über das Inhaltsarray der API mit Typ "image_url"). Für Videos akzeptiert die API wahrscheinlich Videobilder als Bildsequenzen oder Videodatei-URLs; das genaue Format sollte in der Dokumentation von OrcaRouter überprüft werden. Das Modell verarbeitet diese visuellen Eingaben zusammen mit Text, um Antworten zu generieren. Das Kontextfenster von 262,144 Token gilt für die kombinierte Tokenanzahl aller Eingabemodalitäten. Beachten Sie, dass die Verarbeitung von Bildern und Videos Token proportional zur visuellen Auflösung und Länge verbraucht, sodass größere Eingaben die verfügbare Textkapazität reduzieren.
Vom Anbieter wurden keine spezifischen Benchmark-Ergebnisse für dieses Modell bereitgestellt. Die Qwen3.6-Serie schneidet im Allgemeinen wettbewerbsfähig bei Langkontext-Benchmarks wie L-Eval und RULER sowie bei multimodalen Aufgaben wie MMMU und MathVista ab, jedoch sind genaue Zahlen für diese 35B A3B unzensierte Variante nicht veröffentlicht. Nutzer, die an der empirischen Leistung interessiert sind, sollten eigene Bewertungen auf repräsentativen Datensätzen durchführen. Die MoE-Architektur mit 3B aktivierten Parametern liefert oft Ergebnisse, die mit dichten Modellen ähnlicher aktiver Größe vergleichbar sind, während die Gesamtspeicher- und Speicherkosten aufgrund der vollen 35B Parameter höher sind.
Geschwindigkeit und Latenz hängen von mehreren Faktoren ab: Eingabelänge, Ausgabelänge, Serverauslastung und Hardwarekonfiguration. Da das Modell nur 3B Parameter pro Token aktiviert, wird erwartet, dass es schneller ist als ein dichtes 35B-Modell, mit Generierungsraten, die mit Modellen wie GPT-3.5 vergleichbar sind (obwohl keine genauen Zahlen angegeben werden). Die Infrastruktur von OrcaRouter über Obsidian kann variable Latenz bieten; Benutzer können dies mit ihren eigenen Workloads testen. Bei Szenarien mit langem Kontext (z. B. 100K+ Token) steigt die Prefill-Zeit linear mit der Eingabelänge. Die Ausgabe-Token-Generierung ist in der Regel der Hauptfaktor für die Latenz. Es wird keine Service-Level-Vereinbarung (SLA) für die Geschwindigkeit angegeben.
Die Stärken des Modells umfassen seinen großen 262K-Kontextfenster, das die Verarbeitung ganzer Bücher oder mehrstündiger Video-Transkripte in einem Durchlauf ermöglicht. Das MoE-Design bietet einen guten Kompromiss zwischen Kapazität und Inferenzgeschwindigkeit. Die multimodale Eingabe ermöglicht Aufgaben, die Text und visuelle Daten kombinieren. Die unzensierte Art erlaubt die Generierung von Inhalten, die andere Modelle möglicherweise ablehnen. Die mehrsprachige Unterstützung umfasst Dutzende von Sprachen. Die Preisgestaltung ist wettbewerbsfähig für ein Modell dieser Leistungsfähigkeit: $0,31/M Input und $4,21/M Output, ohne Aufschlag.
Zu den Einschränkungen gehören das Fehlen veröffentlichter Benchmark-Zahlen, was es schwieriger macht, die relative Leistung zu beurteilen. Der unzensierte Charakter kann ohne zusätzliche Moderation unerwünschte Ausgaben erzeugen. Die Anzahl der aktivierten Parameter von 3B bedeutet, dass sie möglicherweise nicht mit der rohen Denkfähigkeit größerer dichter Modelle (z. B. GPT-4) bei komplexen Logikaufgaben mithalten kann. Multimodale Fähigkeiten sind möglicherweise weniger ausgefeilt als bei speziell entwickelten Vision-Language-Modellen. Eingabemodalitäten wie Videotokenisierung könnten den effektiven Kontext für Text reduzieren. Es werden keine Streaming- oder Tool-Use-Funktionen garantiert. Schließlich bedeutet die Abhängigkeit vom Drittanbieter Obsidian, dass Verfügbarkeit und Betriebszeit nicht unter der Kontrolle von OrcaRouter stehen.
Die Preisgestaltung ist transparent: 0,31 $ pro Million Input-Token und 4,21 $ pro Million Output-Token. Dies sind die genauen Provider-Tarife von Obsidian, ohne Aufschlag durch OrcaRouter. Input-Token umfassen alle Text- und visuellen Token (für Bilder und Videos). Output-Token sind der generierte Text. Es fallen keine Gebühren pro Anfrage oder Abonnement an. Sie zahlen nur für die verbrauchten Token. Die Preisgestaltung erfolgt pro 1 Million Token, daher kosten kleine Anfragen nur Bruchteile eines Cents. Es wird keine kostenlose Testversion oder Testphase beworben.
Für dieses Modell wurden keine Rabatte, Caching-Vorteile oder Mengenrabatte bekannt gegeben. Die aufgeführten Tarife sind fest pro Token. Im Gegensatz zu einigen Anbietern, die reduzierte Preise für gecachte Eingabetokens anbieten, wendet OrcaRouter denselben Eingabetarif unabhängig von der Wiederholung an. Bei sehr hoher Nutzung können Sie OrcaRouter für mögliche individuelle Vereinbarungen kontaktieren, aber es ist kein Standardrabatt dokumentiert. Die Null-Aufschlag-Richtlinie stellt sicher, dass Sie genau das bezahlen, was Obsidian berechnet, ohne versteckte Gebühren.
Vergleichbare multimodale Modelle mit langem Kontext von anderen Anbietern kosten oft mehr: zum Beispiel kostet OpenAIs GPT-4 Turbo $10/1M für Input und $30/1M für Output, während Claude 3.5 Sonnet $3/1M für Input und $15/1M für Output kostet. Dieses Modell ist mit $0.31/$4.21 deutlich günstiger. Allerdings bieten diese Modelle unterschiedliche Fähigkeiten (z.B. Tool-Nutzung, höhere Reasoning-Benchmarks). Der niedrigere Preis spiegelt die MoE-Architektur und die Tatsache wider, dass es sich um ein unzensiertes, von Drittanbietern gehostetes Modell handelt. Wenn Sie garantierte Zuverlässigkeit, höhere Sicherheit oder erweiterte Funktionen wie Function Calling benötigen, können die zusätzlichen Kosten gerechtfertigt sein.
Um das Modell zu verwenden, senden Sie eine POST-Anfrage an https://api.orcarouter.ai/v1/chat/completions (oder den entsprechenden Endpunkt gemäß OrcaRouters OpenAI-kompatibler API). Fügen Sie den Header "Authorization: Bearer YOUR_API_KEY" hinzu. Setzen Sie im Anforderungstext "model": "obsidian/Qwen3.6-35B-A3B". Übergeben Sie Nachrichten im standardmäßigen OpenAI-Format: ein Array von Objekten mit "role" und "content". Verwenden Sie für multimodale Inhalte ein Content-Array mit den Typen "text" und "image_url" (oder Video-Äquivalent). Beispiel mit cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Beschreiben Sie dieses Bild"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
Sie können typische OpenAI-kompatible Parameter verwenden: temperature (Standard 1.0), top_p (0.9), max_tokens (Standard variiert, empfehlen explizite Angabe), stop sequences, frequency_penalty, presence_penalty und seed für Reproduzierbarkeit. Das Modell unterstützt Streaming über "stream": true, um tokenweise Antworten zu erhalten. Für multimodale Eingaben erwartet die API Inhalts-Arrays mit Typ "image_url" und optional "video_url" (siehe OrcaRouter-Dokumentation für das genaue Videoformat). Das Kontextfenster-Limit von 262.144 Token gilt für die Gesamtzahl der Token in Nachrichten plus Antwort. Wenn Sie das Limit überschreiten, erhalten Sie einen Kontextlängenfehler; Sie können "max_tokens" anpassen oder Nachrichten kürzen.
Um den 262K-Kontext zu nutzen, strukturieren Sie Ihre Prompts so, dass sie das gesamte Dokument oder den gesamten Gesprächsverlauf enthalten. Beachten Sie, dass jedes Token in der Eingabe zu den Kosten und Grenzen beiträgt. Bei sehr langen Eingaben sollten Sie eine Aufteilung oder Zusammenfassung vor dem Senden in Betracht ziehen, obwohl das Modell für die Verarbeitung des gesamten Kontexts ausgelegt ist. Verwenden Sie den Parameter "max_tokens", um die Ausgabelänge zu steuern. Wenn Sie Timeout-Fehler erhalten, aktivieren Sie Streaming, um schneller Teilergebnisse zu erhalten. OrcaRouter verfügt möglicherweise über eigene Timeout-Einstellungen; wenden Sie sich bei Bedarf an den Support. Das Modell unterstützt keine Systemnachrichten in besonderer Weise; behandeln Sie sie als Benutzer- oder Assistentennachricht mit der Rolle "system" (Standard-OpenAI-Format).
Migration von Anbietern wie OpenAI oder Anthropic erfordert das Ändern der Basis-URL auf https://api.orcarouter.ai/v1 und das Aktualisieren der Modell-ID. Wenn Ihr Code den OpenAI-Python-Client verwendet, setzen Sie `client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1")` und verwenden Sie dann `client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)`. Das Nachrichtenformat und die Parameternamen sind identisch. Es sind keine Änderungen an der Prompt-Logik erforderlich. Beachten Sie, dass auch die Formen der Antwortobjekte kompatibel sind, sodass vorhandener Parsing-Code funktionieren sollte. Testen Sie zunächst mit einer kleinen Anfrage, um korrekte Authentifizierung und Abrechnung sicherzustellen.
Im Vergleich zu Qwen3.6-72B (dicht) verwendet dieses Modell MoE und hat daher niedrigere Inferenzkosten pro Token, aber möglicherweise eine etwas geringere Rohkapazität. Der 262K-Kontext ist größer als die 128K von Qwen2.5. Im Vergleich zu Qwen3.6-32B (vielleicht dicht) bietet dieses Modell multimodalen Input, den frühere Versionen möglicherweise nicht haben. Die "uncensored"-Variante ist einzigartig; standardmäßige Qwen-Veröffentlichungen haben Alignment. Wenn Sie strenge Sicherheit benötigen, wählen Sie das reguläre Qwen3.6. Preislich ist dieses Modell günstiger als viele dichte Qwen-Modelle auf anderen Plattformen.
GPT-4o und Claude 3.5 Sonnet sind proprietäre Modelle mit umfangreichem Sicherheitstraining, höheren Benchmark-Ergebnissen bei logischem Denken und Programmierung, und unterstützen Tool-Nutzung, Bildverarbeitung sowie große Kontexte (200K für Claude). Dieses Modell bietet einen größeren Kontext (262K) und multimodalen Input zu einem deutlich niedrigeren Preis. Allerdings fehlen ihm die erweiterten Funktionen, die Zuverlässigkeit und die konsistente Leistung dieser Modelle. Für Anwendungen, bei denen die Kosten im Vordergrund stehen und man gewisse Qualitätseinbußen akzeptieren kann, ist dieses Modell eine gute Alternative. Wenn Sie erstklassige Argumentationsfähigkeiten oder Funktionsaufrufe benötigen, sind die Premium-Modelle die zusätzlichen Kosten wert.
Dieses Modell ist am besten geeignet, wenn Sie Folgendes benötigen: (1) einen sehr langen Kontext (262K Token) zu geringen Kosten; (2) multimodale Eingaben (Bilder/Videos) ohne Premium-Preise; (3) unzensierte Textgenerierung, bei der Inhaltsfilter stören würden; (4) schnelle Inferenz relativ zur Gesamtanzahl der Parameter aufgrund von MoE-Aktivierung. Es ist eine starke Option für Forschung, Datenextraktion, kreatives Schreiben und alle Aufgaben, die von hohem Kontext und niedrigen Kosten pro Token profitieren. Wenn Sie erweiterte Funktionen wie Tool-Aufrufe, strukturierte Ausgaben oder hohe Zuverlässigkeit benötigen, ziehen Sie andere Modelle in Betracht.
| Eingabe / 1M Tokens | $0.310 |
| Ausgabe / 1M Tokens | $4.21 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BÖffnen @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B