Bezstratna, ocenzurowana wersja Qwen3.6 35B A3B, która zachowuje możliwości oryginalnego modelu, jednocześnie eliminując zachowania polegające na odmowie. Stworzona z myślą o programistach, badaczach AI oraz zaawansowanych przepływach pracy agentów wymagających nieskrępowanych wyników modelu bez kompromisów w zakresie rozumowania, kodowania, wydajności wielojęzycznej i wykorzystania narzędzi. Wariant Agresywny jest w pełni odblokowany i zaprojektowany tak, aby udzielać bezpośrednich, kompletnych odpowiedzi na szeroki zakres zapytań. Chociaż model może czasami dołączać krótkie informacyjne zastrzeżenia odziedziczone po treningu modelu bazowego, są to ostrzeżenia, a nie odmowy, a żądana treść nadal jest generowana w całości. Idealny do badań AI, testów bezpieczeństwa, red teamingu, tworzenia agentów, asystentów kodowania i innych zaawansowanych zastosowań AI, które korzystają z maksymalnej elastyczności wyników. Dostęp do tego modelu jest ograniczony i przeznaczony dla badaczy bezpieczeństwa, zespołów red team, badaczy bezpieczeństwa AI oraz innych wykwalifikowanych specjalistów prowadzących legalne badania, oceny i testy.
Ten model to wariant Mixture-of-Experts z serii Qwen3.6, opracowany pierwotnie przez Alibaba Cloud i hostowany przez dostawcę Obsidian na OrcaRouter. Posiada 35 miliardów parametrów, z czego tylko 3…
Ten model doskonale radzi sobie z zadaniami, które korzystają z dużego okna kontekstowego i multimodalnego rozumienia. W przypadku tekstu może streszczać lub odpowiadać na pytania dotyczące dokumentów o długości do 262 144 tokenów, takich jak całe książki czy obszerne raporty. W przypadku obrazów i filmów może wyodrębniać szczegółowe informacje i łączyć je z kontekstem tekstowym. Niescenzurowany charakter pozwala mu generować kreatywne treści bez typowych ograniczeń bezpieczeństwa, co jest przydatne do tworzenia opowiadań, odgrywania ról lub innych scenariuszy, w których restrykcyjne filtry są niepożądane. Jego architektura MoE zapewnia szybkie wnioskowanie w porównaniu z gęstymi modelami o podobnej całkowitej wielkości, co czyni go praktycznym w zastosowaniach czasu rzeczywistego przy efektywnym wdrożeniu. Możliwości wielojęzyczne są dziedziczone z rodziny Qwen3.6, obsługującej wiele języków.
Tag "uncensored" oznacza, że model przeszedł zredukowane szkolenie w zakresie dostosowania w porównaniu do standardowych punktów kontrolnych Qwen3.6. Może to skutkować wynikami, które są mniej filtrowane pod kątem szkodliwych, obraźliwych lub kontrowersyjnych treści. Użytkownicy powinni dokładnie przetestować model w swoim konkretnym przypadku użycia, aby upewnić się, że wyniki spełniają ich standardy. Brak cenzury może być korzystny w zadaniach takich jak kreatywne pisanie, niescenzurowane odgrywanie ról lub badania nad wrażliwymi tematami, gdzie pożądane jest neutralne generowanie. Oznacza to jednak również, że model może tworzyć treści naruszające typowe zasady dotyczące treści. OrcaRouter nie deklaruje żadnego dodatkowego filtrowania bezpieczeństwa; otrzymujesz podstawowe zachowanie modelu.
Jeśli twoje zadanie obejmuje krótkie wejścia (np. kilkaset tokenów), prostą klasyfikację lub wymaga jedynie podstawowego rozumienia języka, mniejsze i tańsze modele, takie jak Qwen2.5-7B lub GPT-4o-mini, mogą być bardziej opłacalne. Mocne strony tego modelu są najbardziej widoczne przy obsłudze bardzo długich kontekstów (powyżej 10K tokenów) lub multimodalnych wejść. W przypadku zadań czysto tekstowych poniżej 8K tokenów, które nie wymagają obsługi obrazu/wideo, możesz zaoszczędzić pieniądze, używając dedykowanego małego modelu. Ponadto, jeśli twoja aplikacja wymaga ścisłego filtrowania treści, nieocenzurowana natura może zmusić cię do dodania zewnętrznej warstwy moderacji, co zwiększa koszty.
Model akceptuje wejścia obrazu i wideo oprócz tekstu. W przypadku obrazów możesz podać dane obrazu zakodowane w base64 lub adresy URL (poprzez tablicę content API z typem "image_url"). W przypadku wideo API prawdopodobnie akceptuje klatki wideo jako sekwencje obrazów lub adresy URL plików wideo; dokładny format należy sprawdzić w dokumentacji OrcaRouter. Model przetwarza te wejścia wizualne razem z tekstem, aby generować odpowiedzi. Okno kontekstu o rozmiarze 262,144 tokenów dotyczy łącznej liczby tokenów wszystkich modalności wejściowych. Należy pamiętać, że przetwarzanie obrazów i wideo zużywa tokeny proporcjonalnie do rozdzielczości i długości wizualnej, więc większe wejścia zmniejszą dostępną pojemność tekstu.
Dostawca nie podał konkretnych wyników testów porównawczych dla tego modelu. Seria Qwen3.6 ogólnie dobrze radzi sobie w testach dotyczących długiego kontekstu, takich jak L-Eval i RULER, oraz w zadaniach multimodalnych, takich jak MMMU i MathVista, ale dokładne liczby dla tego nieocenzurowanego wariantu 35B A3B nie zostały opublikowane. Użytkownicy zainteresowani rzeczywistą wydajnością powinni przeprowadzić własne oceny na reprezentatywnych zbiorach danych. Architektura MoE z 3B aktywowanych parametrów często daje wyniki porównywalne do gęstych modeli o podobnej aktywnej wielkości, podczas gdy całkowite koszty przechowywania i pamięci są wyższe ze względu na pełne 35B parametrów.
Szybkość i opóźnienie zależą od kilku czynników: długości wejścia, długości wyjścia, obciążenia serwera i konfiguracji sprzętu. Ponieważ model aktywuje tylko 3B parametrów na token, oczekuje się, że będzie szybszy niż gęsty model 35B, z szybkością generowania porównywalną do modeli takich jak GPT-3.5 (choć nie podano dokładnych wartości). Infrastruktura OrcaRouter za pośrednictwem Obsidian może oferować zmienne opóźnienie; użytkownicy mogą testować na swoich własnych obciążeniach. W scenariuszach z długim kontekstem (np. 100K+ tokenów) czas wstępnego wypełnienia rośnie liniowo wraz z długością wejścia. Generowanie tokenów wyjściowych jest zazwyczaj głównym czynnikiem opóźnienia. Nie określono umowy dotyczącej poziomu usług (SLA) dla szybkości.
Mocne strony modelu obejmują duże okno kontekstowe o wielkości 262K, które umożliwia przetwarzanie całych książek lub wielogodzinnych transkryptów wideo w jednym przebiegu. Architektura MoE zapewnia dobry kompromis między pojemnością a szybkością wnioskowania. Wejście multimodalne umożliwia zadania łączące dane tekstowe i wizualne. Niescensurowany charakter pozwala na generowanie treści, których inne modele mogłyby odmówić. Wsparcie wielojęzyczne obejmuje dziesiątki języków. Ceny są konkurencyjne jak na model o takich możliwościach: $0,31/M za wejście i $4,21/M za wyjście, bez marży.
Ograniczenia obejmują brak opublikowanych wskaźników wydajności, co utrudnia ocenę względnej wydajności. Niefiltrowany charakter może powodować niepożądane wyniki bez dodatkowej moderacji. Liczba aktywowanych parametrów 3B oznacza, że może nie dorównywać surowej mocy rozumowania większych modeli gęstych (np. GPT-4) w złożonych zadaniach logicznych. Możliwości multimodalne mogą być mniej dopracowane niż w dedykowanych modelach wizyjno-językowych. Modalności wejściowe, takie jak tokenizacja wideo, mogą zmniejszyć efektywny kontekst dla tekstu. Nie gwarantuje się strumieniowania ani korzystania z narzędzi. Wreszcie, zależność od zewnętrznego dostawcy Obsidian oznacza, że dostępność i czas pracy nie są kontrolowane przez OrcaRouter.
Cennik jest przejrzysty: $0,31 za milion tokenów wejściowych i $4,21 za milion tokenów wyjściowych. Są to dokładne stawki dostawcy z Obsidian, z zerową marżą dodaną przez OrcaRouter. Tokeny wejściowe obejmują wszystkie tokeny tekstowe i wizualne (dla obrazów i filmów). Tokeny wyjściowe to wygenerowany tekst. Nie ma opłaty za zapytanie ani wymaganej subskrypcji. Płacisz tylko za zużyte tokeny. Cennik jest podany za 1M tokenów, więc małe zapytania kosztują ułamki centa. Nie reklamuje się darmowego poziomu ani wersji próbnej.
Nie ujawniono żadnych rabatów, korzyści z buforowania ani cen hurtowych dla tego modelu. Podane stawki są stałe za token. W przeciwieństwie do niektórych dostawców oferujących niższe ceny dla buforowanych tokenów wejściowych, OrcaRouter stosuje tę samą stawkę za wejście niezależnie od powtarzalności. W przypadku bardzo dużego użycia możesz skontaktować się z OrcaRouter w sprawie potencjalnych indywidualnych ustaleń, ale nie ma udokumentowanego standardowego rabatu. Polityka zerowej marży gwarantuje, że płacisz dokładnie tyle, ile nalicza Obsidian, bez ukrytych opłat.
Porównywalne modele multimodalne o długim kontekście od innych dostawców często kosztują więcej: na przykład GPT-4 Turbo od OpenAI to $10/1M wejścia i $30/1M wyjścia, podczas gdy Claude 3.5 Sonnet to $3/1M wejścia i $15/1M wyjścia. Ten model jest znacznie tańszy – $0,31/$4,21. Należy jednak pamiętać, że tamte modele oferują inne możliwości (np. korzystanie z narzędzi, wyższe wyniki w testach wnioskowania). Niższa cena odzwierciedla architekturę MoE oraz fakt, że jest to niescenzurowany model hostowany przez zewnętrzną stronę. Jeśli potrzebujesz gwarantowanej niezawodności, wyższego bezpieczeństwa lub zaawansowanych funkcji, takich jak wywoływanie funkcji, dodatkowy koszt może być uzasadniony.
Aby skorzystać z modelu, wyślij żądanie POST na adres https://api.orcarouter.ai/v1/chat/completions (lub odpowiedni endpoint zgodny z API OrcaRouter kompatybilnym z OpenAI). Dołącz nagłówek "Authorization: Bearer YOUR_API_KEY". W treści żądania ustaw "model": "obsidian/Qwen3.6-35B-A3B". Przekaż wiadomości w standardowym formacie OpenAI: tablicę obiektów z polami "role" i "content". W przypadku treści multimodalnej użyj tablicy content z typami "text" i "image_url" (lub odpowiednik dla wideo). Przykład z cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'.
Możesz korzystać z typowych parametrów zgodnych z OpenAI: temperature (domyślnie 1.0), top_p (0.9), max_tokens (domyślnie różne, zaleca się ustawienie jawnie), stop sequences, frequency_penalty, presence_penalty oraz seed dla powtarzalności. Model obsługuje strumieniowanie przez "stream": true, aby otrzymywać odpowiedzi token po tokenie. W przypadku wejść multimodalnych API oczekuje tablic zawartości z typem "image_url" i opcjonalnie "video_url" (sprawdź dokumentację OrcaRouter po dokładny format wideo). Limit okna kontekstowego wynoszący 262 144 tokenów dotyczy całkowitej liczby tokenów w wiadomościach plus odpowiedź. Jeśli przekroczysz limit, otrzymasz błąd długości kontekstu; możesz dostosować "max_tokens" lub skrócić wiadomości.
Aby wykorzystać kontekst 262K, strukturyzuj swoje prompty tak, aby zawierały pełny dokument lub historię rozmowy. Pamiętaj, że każdy token w wejściu liczy się do kosztów i limitów. W przypadku bardzo długich wejść rozważ podział na fragmenty lub streszczenie przed wysłaniem, chociaż model jest zaprojektowany do obsługi pełnego kontekstu. Użyj parametru „max_tokens”, aby kontrolować długość wyjścia. Jeśli napotkasz błędy przekroczenia czasu, włącz strumieniowanie, aby szybciej uzyskać częściowe wyniki. OrcaRouter może mieć własne ustawienia limitu czasu; w razie potrzeby skontaktuj się z pomocą techniczną. Model nie obsługuje w specjalny sposób wiadomości systemowych; traktuj je jako wiadomość użytkownika lub asystenta z rolą „system” (standardowy format OpenAI).
Migracja z dostawców takich jak OpenAI czy Anthropic polega na zmianie podstawowego URL na https://api.orcarouter.ai/v1 oraz aktualizacji identyfikatora modelu. Jeśli Twój kod korzysta z klienta OpenAI Python, ustaw client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") a następnie użyj client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). Format wiadomości i nazwy parametrów są identyczne. Nie są wymagane żadne zmiany w logice promptów. Należy pamiętać, że kształty obiektów odpowiedzi są również zgodne, więc istniejący kod parsowania powinien działać. Przetestuj najpierw za pomocą małego zapytania, aby upewnić się co do prawidłowego uwierzytelniania i rozliczeń.
W porównaniu do Qwen3.6-72B (gęstego), ten model wykorzystuje MoE, przez co ma niższy koszt wnioskowania na token, ale może mieć nieco niższą surową pojemność. Kontekst 262K jest większy niż 128K w Qwen2.5. W porównaniu do Qwen3.6-32B (być może gęstego), ten model oferuje multimodalne wejście, którego wcześniejsze wersje mogą nie mieć. Odmiana „uncensored” jest unikalna; standardowe wydania Qwen mają alignment. Jeśli potrzebujesz ścisłego bezpieczeństwa, wybierz zwykły Qwen3.6. Pod względem ceny ten model jest tańszy niż wiele gęstych modeli Qwen na innych platformach.
GPT-4o i Claude 3.5 Sonnet to modele zastrzeżone, z rozbudowanym treningiem bezpieczeństwa, wyższymi wynikami w testach wnioskowania i kodowania, a także obsługują narzędzia, widzenie i duży kontekst (200K dla Claude). Ten model oferuje większy kontekst (262K) i multimodalne wejście po znacznie niższej cenie. Brakuje mu jednak zaawansowanych funkcji, niezawodności i spójności wydajności tamtych modeli. W zastosowaniach, gdzie koszt jest głównym zmartwieniem i można zaakceptować pewien kompromis jakości, ten model jest dobrą alternatywą. Jeśli potrzebujesz najwyższej klasy wnioskowania lub wywoływania funkcji, modele premium są warte dodatkowego kosztu.
Ten model jest najlepszy, gdy potrzebujesz: (1) bardzo długiego kontekstu (262K tokenów) przy niskim koszcie; (2) multimodalnego wejścia (obrazy/wideo) bez płacenia wyższych cen; (3) niecenzurowanego generowania tekstu, gdzie filtry treści byłyby przeszkodą; (4) szybkiego wnioskowania względem całkowitej liczby parametrów dzięki aktywacji MoE. Jest to silny kandydat do badań, ekstrakcji danych, kreatywnego pisania oraz wszelkich zadań, które korzystają z wysokiego kontekstu i niskiego kosztu na token. Jeśli potrzebujesz zaawansowanych funkcji, takich jak wywołania narzędzi, strukturyzowane wyniki lub wysoka niezawodność, rozważ inne modele.
| Wejście / 1M tokenów | $0.310 |
| Wyjście / 1M tokenów | $4.21 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BOtwórz @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B