무손실 검열되지 않은 Qwen3.6 35B A3B 버전으로, 거부 응답을 제거하면서 원본 모델의 성능을 유지합니다. 제한 없는 모델 출력이 필요하면서도 추론, 코딩, 다국어 성능, 도구 사용을 저해하지 않는 환경을 원하는 개발자, AI 연구자, 고급 에이전트 워크플로를 위해 설계되었습니다. Aggressive 변종은 완전히 잠금 해제되어 다양한 프롬프트에 대해 직접적이고 완전한 응답을 제공합니다. 모델이 기본 모델 훈련에서 물려받은 간략한 정보 제공 면책 문구를 간혹 추가할 수 있으나, 이는 거부가 아니며 요청된 콘텐츠는 여전히 전체가 생성됩니다. AI 연구, 보안 테스트, 레드 팀, 에이전트 개발, 코딩 어시스턴트 및 최대 출력 유연성이 필요한 기타 고급 AI 애플리케이션에 이상적입니다. 본 모델에 대한 액세스는 게이트 방식으로 제한되며, 합법적인 연구, 평가 및 테스트를 수행하는 보안 연구자, 레드 팀, AI 안전 연구자 및 기타 자격을 갖춘 전문가를 대상으로 합니다.
이 모델은 Alibaba Cloud가 원래 개발하고 제공업체 Obsidian이 OrcaRouter에 호스팅한 Qwen3.6 시리즈의 Mixture-of-Experts 변형입니다. 총 350억 개의 파라미터 중 토큰당 30억 개만 활성화되어 계산 비용을 줄이면서도 높은 용량을 유지합니다. 컨텍스트 윈도우는 262,144개의 토큰으로, 매우 긴 문서나 여러…
이 모델은 큰 컨텍스트 윈도우와 멀티모달 이해가 필요한 작업에 뛰어납니다. 텍스트의 경우, 전체 책이나 긴 보고서와 같이 최대 262,144개의 토큰 길이의 문서를 요약하거나 질문에 답변할 수 있습니다. 이미지와 비디오의 경우, 세부 정보를 추출하고 이를 텍스트 컨텍스트와 결합할 수 있습니다. 검열되지 않은 특성 덕분에 일반적인 안전 제약 없이 창의적인 콘텐츠를 생성할 수 있으며, 스토리 생성, 롤플레이 또는 제한적인 필터가 원치 않는 다른 시나리오에 유용합니다. MoE 설계는 유사한 전체 크기의 밀집 모델에 비해 빠른 추론을 제공하므로, 효율적으로 배포될 때 실시간 애플리케이션에 실용적입니다. 다국어 기능은 Qwen3.6 제품군에서 계승되어 많은 언어를 지원합니다.
"uncensored" 태그는 해당 모델이 표준 Qwen3.6 체크포인트에 비해 정렬 학습이 축소되었음을 의미합니다. 이로 인해 유해하거나 공격적이거나 논란의 여지가 있는 콘텐츠에 대한 필터링이 덜 적용된 결과가 생성될 수 있습니다. 사용자는 특정 사용 사례에서 모델을 철저히 테스트하여 출력이 자신의 기준을 충족하는지 확인해야 합니다. 검열 부재는 창작 글쓰기, 검열되지 않은 역할극, 또는 중립적인 생성이 요구되는 민감한 주제에 대한 연구와 같은 작업에 유용할 수 있습니다. 그러나 이는 또한 모델이 일반적인 콘텐츠 정책을 위반하는 콘텐츠를 생성할 수 있음을 의미합니다. OrcaRouter는 추가적인 안전 필터링을 제공하지 않습니다. 모델의 기본 동작이 그대로 제공됩니다.
만약 작업이 짧은 입력(예: 수백 개의 토큰), 단순한 분류, 또는 기본적인 언어 이해만 필요로 한다면, Qwen2.5-7B나 GPT-4o-mini 같은 더 작고 저렴한 모델이 비용 효율적일 수 있습니다. 이 모델의 강점은 매우 긴 컨텍스트(10K 토큰 이상)나 멀티모달 입력을 처리할 때 가장 분명하게 드러납니다. 이미지/비디오 기능 없이 8K 토큰 미만의 순수 텍스트 작업에는 전용 소형 모델을 사용하여 비용을 절감할 수 있습니다. 또한, 애플리케이션에서 엄격한 콘텐츠 필터링이 필요한 경우, 검열되지 않은 특성 때문에 외부 중재 레이어를 추가해야 하므로 비용이 증가할 수 있습니다.
모델은 텍스트 외에도 이미지 및 비디오 입력을 받아들입니다. 이미지의 경우, base64로 인코딩된 이미지 데이터 또는 URL(API의 유형이 "image_url"인 콘텐츠 배열을 통해)을 제공할 수 있습니다. 비디오의 경우, API는 비디오 프레임을 이미지 시퀀스 또는 비디오 파일 URL로 받아들일 가능성이 높습니다. 정확한 형식은 OrcaRouter의 문서에서 확인해야 합니다. 모델은 이러한 시각적 입력을 텍스트와 함께 처리하여 응답을 생성합니다. 262,144 토큰의 컨텍스트 창은 모든 입력 모달리티의 결합된 토큰 수에 적용됩니다. 이미지 및 비디오 처리는 시각적 해상도와 길이에 비례하여 토큰을 소모하므로, 더 큰 입력은 사용 가능한 텍스트 용량을 줄입니다.
해당 모델에 대한 구체적인 벤치마크 점수는 제공업체에서 제공되지 않았습니다. Qwen3.6 시리즈는 일반적으로 L-Eval 및 RULER와 같은 긴 컨텍스트 벤치마크와 MMMU 및 MathVista와 같은 멀티모달 작업에서 경쟁력 있는 성능을 보이지만, 이 35B A3B 검열되지 않은 변형의 정확한 수치는 공개되지 않았습니다. 실증적 성능에 관심이 있는 사용자는 대표적인 데이터셋에서 자체 평가를 실행해야 합니다. 3B 활성화 파라미터를 가진 MoE 아키텍처는 종종 비슷한 활성 크기의 밀집 모델과 비교할 수 있는 결과를 제공하지만, 전체 35B 파라미터로 인해 총 저장 및 메모리 비용이 더 높습니다.
속도와 지연 시간은 여러 요인에 따라 달라집니다: 입력 길이, 출력 길이, 서버 부하, 하드웨어 구성. 모델이 토큰당 3B 매개변수만 활성화하므로, 밀집 35B 모델보다 빠를 것으로 예상되며, 생성 속도는 GPT-3.5와 같은 모델과 비슷합니다(정확한 수치는 제공되지 않음). Obsidian을 통한 OrcaRouter의 인프라는 가변적인 지연 시간을 제공할 수 있습니다. 사용자는 자신의 워크로드로 테스트할 수 있습니다. 긴 컨텍스트 시나리오(예: 100K+ 토큰)의 경우, 프리필 시간은 입력 길이에 따라 선형적으로 증가합니다. 출력 토큰 생성이 일반적으로 주요 지연 시간 요인입니다. 속도에 대한 서비스 수준 계약(SLA)은 명시되어 있지 않습니다.
이 모델의 강점은 262K라는 큰 컨텍스트 윈도우로, 이를 통해 한 번에 전체 책이나 여러 시간 분량의 비디오 대본을 처리할 수 있습니다. MoE 설계는 용량과 추론 속도 사이에서 좋은 균형을 제공합니다. 다중 모달 입력은 텍스트와 시각 데이터를 결합한 작업을 가능하게 합니다. 검열되지 않은 특성 덕분에 다른 모델이 거부할 수 있는 콘텐츠도 생성할 수 있습니다. 다국어 지원은 수십 개 언어를 포괄합니다. 가격은 이와 같은 성능의 모델 기준으로 경쟁력이 있습니다: 입력 $0.31/M, 출력 $4.21/M, 마크업 없음.
한계점은 공개된 벤치마크 수치가 부족하여 상대적 성능을 측정하기 어렵다는 점입니다. 무검열 특성으로 인해 추가적인 조정 없이 원치 않는 출력이 생성될 수 있습니다. 3B 활성화 파라미터 수는 복잡한 논리 작업에서 GPT-4와 같은 더 큰 밀집 모델의 순수 추론 능력에 미치지 못할 수 있습니다. 멀티모달 기능은 전용 시각-언어 모델보다 정교함이 떨어질 수 있습니다. 비디오 토큰화와 같은 입력 양식은 텍스트의 유효 컨텍스트를 줄일 수 있습니다. 스트리밍이나 도구 사용 기능은 보장되지 않습니다. 마지막으로, 타사 제공업체인 Obsidian에 대한 의존성으로 인해 가용성과 업타임이 OrcaRouter의 통제 하에 있지 않습니다.
가격 정책은 투명합니다: 입력 토큰 100만 개당 0.31달러, 출력 토큰 100만 개당 4.21달러입니다. 이는 Obsidian의 정확한 제공업체 요금이며, OrcaRouter에서 마크업을 추가하지 않았습니다. 입력 토큰에는 모든 텍스트 및 시각적 토큰(이미지 및 비디오용)이 포함됩니다. 출력 토큰은 생성된 텍스트입니다. 요청당 수수료나 구독이 필요하지 않습니다. 사용한 토큰에 대해서만 비용을 지불합니다. 가격은 100만 토큰 단위이므로 소규모 요청은 1센트의 일부만 비용이 듭니다. 무료 등급이나 평가판은 광고되지 않습니다.
이 모델에 대해서는 할인, 캐싱 혜택 또는 볼륨 가격이 공개되지 않았습니다. 명시된 요금은 토큰당 고정 가격입니다. 캐시된 입력 토큰에 대해 할인된 가격을 제공하는 일부 제공업체와 달리, OrcaRouter는 반복 여부와 관계없이 동일한 입력 요금을 적용합니다. 매우 높은 사용량의 경우 잠재적인 맞춤 계약을 위해 OrcaRouter에 문의할 수 있지만, 표준 할인은 문서화되어 있지 않습니다. 제로 마크업 정책은 숨겨진 수수료 없이 Obsidian이 청구하는 금액을 정확히 지불하도록 보장합니다.
타사 제공업체의 유사한 장문 컨텍스트 멀티모달 모델은 종종 비용이 더 높습니다. 예를 들어, OpenAI의 GPT-4 Turbo는 입력 100만 토큰당 $10, 출력 100만 토큰당 $30이고, Claude 3.5 Sonnet은 입력 100만 토큰당 $3, 출력 100만 토큰당 $15입니다. 이 모델은 눈에 띄게 저렴한 $0.31/$4.21입니다. 하지만 해당 모델들은 다른 기능(예: 도구 사용, 더 높은 추론 벤치마크)을 제공합니다. 낮은 가격은 MoE 아키텍처와 검열되지 않은 타사 호스팅 모델이라는 사실을 반영합니다. 보장된 안정성, 더 높은 보안 또는 함수 호출과 같은 고급 기능이 필요하다면 추가 비용이 정당화될 수 있습니다.
모델을 사용하려면 https://api.orcarouter.ai/v1/chat/completions(또는 OrcaRouter의 OpenAI 호환 API에 해당하는 엔드포인트)로 POST 요청을 보내십시오. 헤더에 "Authorization: Bearer YOUR_API_KEY"를 포함하십시오. 요청 본문에서 "model": "obsidian/Qwen3.6-35B-A3B"로 설정하십시오. 메시지는 표준 OpenAI 형식으로 전달합니다: "role"과 "content"를 가진 객체 배열. 멀티모달 콘텐츠의 경우, "text"와 "image_url"(또는 동영상에 해당) 유형의 콘텐츠 배열을 사용하십시오. cURL 예: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'
일반적인 OpenAI 호환 매개변수를 사용할 수 있습니다: temperature(기본값 1.0), top_p(0.9), max_tokens(기본값은 다양하며, 명시적으로 설정하는 것을 권장), stop sequences, frequency_penalty, presence_penalty, 재현성을 위한 seed. 모델은 "stream": true를 통한 스트리밍을 지원하여 토큰 단위로 응답을 받습니다. 멀티모달 입력의 경우, API는 "image_url" 유형과 선택적으로 "video_url" 유형의 콘텐츠 배열을 필요로 합니다(정확한 비디오 형식은 OrcaRouter 문서를 확인하세요). 컨텍스트 윈도우 제한은 262,144개의 토큰이며, 메시지의 총 토큰 수와 응답을 합친 값에 적용됩니다. 제한을 초과하면 컨텍스트 길이 오류가 발생합니다. "max_tokens"를 조정하거나 메시지를 자를 수 있습니다.
262K 컨텍스트를 활용하려면, 프롬프트에 전체 문서 또는 대화 기록을 포함하도록 구성하십시오. 입력의 모든 토큰이 비용과 제한에 포함된다는 점에 유의하십시오. 매우 긴 입력의 경우, 모델이 전체 컨텍스트를 처리하도록 설계되었지만, 전송 전에 청킹 또는 요약을 고려하십시오. 출력 길이를 제어하려면 "max_tokens" 매개변수를 사용하십시오. 시간 초과 오류가 발생하면 스트리밍을 활성화하여 부분 결과를 더 빠르게 얻으십시오. OrcaRouter에는 자체 시간 초과 설정이 있을 수 있습니다. 필요한 경우 지원팀에 문의하십시오. 모델은 시스템 메시지를 특별한 방식으로 지원하지 않습니다. 역할이 "system"인 사용자 또는 어시스턴트 메시지로 처리하십시오(표준 OpenAI 형식).
OpenAI나 Anthropic 같은 제공업체에서 마이그레이션하려면 기본 URL을 https://api.orcarouter.ai/v1로 변경하고 모델 ID를 업데이트하면 됩니다. 코드에서 OpenAI Python 클라이언트를 사용하는 경우, client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1")로 설정한 다음 client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)를 사용하세요. 메시지 형식과 매개변수 이름은 동일합니다. 프롬프트 로직을 변경할 필요가 없습니다. 또한 응답 객체 형태도 호환되므로 기존 파싱 코드가 그대로 작동합니다. 먼저 소규모 요청으로 테스트하여 인증 및 결제가 제대로 되는지 확인하세요.
Qwen3.6-72B (dense)와 비교할 때, 이 모델은 MoE를 사용하므로 토큰당 추론 비용이 낮지만 원시 용량이 약간 낮을 수 있습니다. 262K 컨텍스트는 Qwen2.5의 128K보다 큽니다. Qwen3.6-32B (아마 dense)와 비교할 때, 이 모델은 이전 버전에는 없을 수 있는 다중 모드 입력을 제공합니다. "uncensored" 변형은 독특합니다. 표준 Qwen 릴리스에는 정렬이 있습니다. 엄격한 안전이 필요하다면 일반 Qwen3.6을 선택하세요. 가격 측면에서 이 모델은 다른 플랫폼의 많은 dense Qwen 모델보다 저렴합니다.
GPT-4o와 Claude 3.5 Sonnet은 독점 모델로, 광범위한 안전 훈련, 추론 및 코딩에서 더 높은 벤치마크 점수, 도구 사용 지원, 비전, 그리고 큰 컨텍스트(Claude의 경우 200K)를 제공합니다. 이 모델은 더 큰 컨텍스트(262K)와 멀티모달 입력을 훨씬 낮은 가격에 제공합니다. 하지만 이 모델은 해당 모델들의 고급 기능, 신뢰성 및 일관된 성능이 부족합니다. 비용이 주요 고려 사항이고 어느 정도의 품질 저하를 감수할 수 있는 애플리케이션의 경우, 이 모델은 좋은 대안이 됩니다. 최고 수준의 추론이나 함수 호출이 필요하다면 프리미엄 모델이 추가 비용을 들일 가치가 있습니다.
이 모델은 다음과 같은 경우에 적합합니다: (1) 매우 긴 컨텍스트(262K 토큰)를 저렴한 비용으로 사용해야 할 때; (2) 프리미엄 가격을 지불하지 않고 멀티모달 입력(이미지/비디오)을 처리해야 할 때; (3) 콘텐츠 필터가 방해되는 검열되지 않은 텍스트 생성이 필요할 때; (4) MoE 활성화로 인해 총 파라미터 수 대비 빠른 추론이 필요할 때. 연구, 데이터 추출, 창작 글쓰기 및 높은 컨텍스트와 낮은 토큰당 비용의 이점을 누리는 모든 작업에 강력한 대안입니다. 도구 호출, 구조화된 출력, 높은 신뢰성과 같은 고급 기능이 필요하다면 다른 모델을 고려하세요.
| 입력 / 1M tokens | $0.310 |
| 출력 / 1M tokens | $4.21 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
@misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B