Uma versão sem censura e sem perdas do Qwen3.6 35B A3B que preserva as capacidades do modelo original enquanto remove o comportamento de recusa. Desenvolvido para desenvolvedores, pesquisadores de IA e fluxos de trabalho avançados de agentes que exigem saídas irrestritas do modelo sem comprometer raciocínio, codificação, desempenho multilíngue ou uso de ferramentas. A variante Agressiva é totalmente desbloqueada e projetada para fornecer respostas diretas e completas em uma ampla gama de prompts. Embora o modelo possa ocasionalmente anexar avisos informativos breves herdados do treinamento do modelo base, estes não são recusas e o conteúdo solicitado ainda é gerado por completo. Ideal para pesquisa em IA, testes de segurança, red teaming, desenvolvimento de agentes, assistentes de codificação e outras aplicações avançadas de IA que se beneficiam de máxima flexibilidade de saída. O acesso a este modelo é controlado e destinado a pesquisadores de segurança, red teams, pesquisadores de segurança de IA e outros profissionais qualificados que realizam pesquisas, avaliações e testes legítimos.
Este modelo é uma variante Mixture-of-Experts da série Qwen3.6, desenvolvido originalmente pela Alibaba Cloud e hospedado pelo provedor Obsidian no OrcaRouter. Ele tem 35 bilhões de parâmetros no…
Este modelo se destaca em tarefas que se beneficiam de uma grande janela de contexto e compreensão multimodal. Para texto, pode resumir ou responder perguntas sobre documentos de até 262.144 tokens de comprimento, como livros inteiros ou relatórios extensos. Para imagens e vídeos, pode extrair informações detalhadas e combiná-las com contexto textual. A natureza não censurada permite gerar conteúdo criativo sem as restrições típicas de segurança, útil para geração de histórias, role-play ou outros cenários onde filtros restritivos são indesejados. Seu design MoE oferece inferência rápida em relação a modelos densos de tamanho total similar, tornando-o prático para aplicações em tempo real quando implantado de forma eficiente. As capacidades multilíngues são herdadas da família Qwen3.6, suportando muitos idiomas.
A tag "uncensored" significa que o modelo passou por um treinamento de alinhamento reduzido em comparação com os checkpoints padrão do Qwen3.6. Isso pode resultar em saídas menos filtradas para conteúdo prejudicial, ofensivo ou controverso. Os usuários devem testar o modelo minuciosamente em seu caso de uso específico para garantir que as saídas atendam aos seus padrões. A falta de censura pode ser benéfica para tarefas como escrita criativa, role-play não censurado ou pesquisa sobre tópicos sensíveis onde seja desejada uma geração neutra. No entanto, também significa que o modelo pode produzir conteúdo que viola políticas de conteúdo típicas. A OrcaRouter não alega nenhuma filtragem de segurança adicional; o comportamento base do modelo é o que você obtém.
Se sua tarefa envolver entradas curtas (por exemplo, algumas centenas de tokens), classificação simples ou exigir apenas compreensão básica de linguagem, modelos menores e mais baratos como Qwen2.5-7B ou GPT-4o-mini podem ser mais econômicos. Os pontos fortes deste modelo são mais evidentes ao lidar com contextos muito longos (mais de 10K tokens) ou entradas multimodais. Para tarefas de texto puro com menos de 8K tokens e sem necessidade de capacidade de imagem/vídeo, você pode economizar dinheiro usando um modelo pequeno dedicado. Além disso, se sua aplicação exigir filtragem rigorosa de conteúdo, a natureza sem censura pode forçá-lo a adicionar uma camada de moderação externa, aumentando o custo.
O modelo aceita entradas de imagem e vídeo além de texto. Para imagens, você pode fornecer dados de imagem codificados em base64 ou URLs (via o array de conteúdo da API com tipo "image_url"). Para vídeos, a API provavelmente aceita quadros de vídeo como sequências de imagens ou URLs de arquivos de vídeo; o formato exato deve ser verificado na documentação do OrcaRouter. O modelo processa essas entradas visuais juntamente com o texto para gerar respostas. A janela de contexto de 262.144 tokens se aplica à contagem combinada de tokens de todas as modalidades de entrada. Observe que o processamento de imagens e vídeos consome tokens proporcionais à resolução e duração visual, portanto entradas maiores reduzirão a capacidade de texto disponível.
Nenhuma pontuação de benchmark específica foi fornecida para este modelo pelo provedor. A série Qwen3.6 geralmente tem desempenho competitivo em benchmarks de contexto longo, como L-Eval e RULER, e em tarefas multimodais, como MMMU e MathVista, mas números exatos para esta variante 35B A3B sem censura não são publicados. Usuários interessados em desempenho empírico devem realizar suas próprias avaliações em conjuntos de dados representativos. A arquitetura MoE com 3B parâmetros ativados frequentemente produz resultados comparáveis a modelos densos de tamanho ativo semelhante, enquanto os custos totais de armazenamento e memória são mais altos devido aos 35B parâmetros completos.
A velocidade e a latência dependem de vários fatores: tamanho da entrada, tamanho da saída, carga do servidor e configuração de hardware. Como o modelo ativa apenas 3B parâmetros por token, espera-se que seja mais rápido que um modelo denso de 35B, com taxas de geração comparáveis a modelos como o GPT-3.5 (embora não sejam fornecidos números exatos). A infraestrutura do OrcaRouter via Obsidian pode oferecer latência variável; os usuários podem testar com suas próprias cargas de trabalho. Para cenários de contexto longo (por exemplo, 100K+ tokens), o tempo de preenchimento aumenta linearmente com o comprimento da entrada. A geração de tokens de saída é geralmente o principal contribuinte para a latência. Nenhum acordo de nível de serviço (SLA) para velocidade é declarado.
Os pontos fortes do modelo incluem sua grande janela de contexto de 262K, que permite processar livros inteiros ou transcrições de vídeo de várias horas em uma única passagem. O design MoE oferece um bom equilíbrio entre capacidade e velocidade de inferência. A entrada multimodal permite tarefas que combinam dados textuais e visuais. A natureza não censurada permite a geração de conteúdo que outros modelos podem recusar. O suporte multilíngue cobre dezenas de idiomas. O preço é competitivo para um modelo com essa capacidade: $0,31/M de entrada e $4,21/M de saída, sem margem de lucro.
As limitações incluem a falta de números de referência publicados, dificultando a avaliação do desempenho relativo. A natureza sem censura pode produzir saídas indesejáveis sem moderação adicional. A contagem de parâmetros ativados de 3B significa que pode não corresponder ao poder de raciocínio bruto de modelos densos maiores (por exemplo, GPT-4) em tarefas lógicas complexas. As capacidades multimodais podem ser menos refinadas do que modelos dedicados de visão-linguagem. Modalidades de entrada, como tokenização de vídeo, podem reduzir o contexto efetivo para texto. Não há garantia de capacidades de streaming ou uso de ferramentas. Finalmente, a dependência do provedor terceirizado Obsidian significa que a disponibilidade e o tempo de atividade não estão sob o controle da OrcaRouter.
Os preços são transparentes: $0.31 por milhão de tokens de entrada e $4.21 por milhão de tokens de saída. Estas são as taxas exatas do provedor Obsidian, sem nenhum markup adicionado pelo OrcaRouter. Tokens de entrada incluem todos os tokens de texto e visuais (para imagens e vídeos). Tokens de saída são o texto gerado. Não há taxa por requisição ou assinatura necessária. Você paga apenas pelos tokens consumidos. O preço é por 1M de tokens, então requisições pequenas custam frações de centavo. Nenhuma camada gratuita ou teste é anunciado.
Nenhum desconto, benefícios de cache ou preços por volume foram divulgados para este modelo. As taxas listadas são fixas por token. Diferentemente de alguns provedores que oferecem preços reduzidos para tokens de entrada em cache, o OrcaRouter aplica a mesma taxa de entrada independentemente da repetição. Para uso muito elevado, você pode entrar em contato com o OrcaRouter para possíveis acordos personalizados, mas nenhum desconto padrão está documentado. A política de margem zero garante que você está pagando exatamente o que a Obsidian cobra, sem taxas ocultas.
Modelos multimodais de contexto longo comparáveis de outros provedores geralmente custam mais: por exemplo, o GPT-4 Turbo da OpenAI custa $10/1M de entrada e $30/1M de saída, enquanto o Claude 3.5 Sonnet custa $3/1M de entrada e $15/1M de saída. Este modelo é notavelmente mais barato a $0,31/$4,21. No entanto, esses modelos oferecem capacidades diferentes (por exemplo, uso de ferramentas, benchmarks de raciocínio mais elevados). O preço mais baixo reflete a arquitetura MoE e o fato de ser um modelo não censurado hospedado por terceiros. Se você exigir confiabilidade garantida, maior segurança ou recursos avançados como function calling, o custo extra pode ser justificado.
Para usar o modelo, envie uma requisição POST para https://api.orcarouter.ai/v1/chat/completions (ou o endpoint apropriado conforme a API compatível com OpenAI da OrcaRouter). Inclua o cabeçalho "Authorization: Bearer YOUR_API_KEY". No corpo da requisição, defina "model": "obsidian/Qwen3.6-35B-A3B". Passe as mensagens no formato padrão da OpenAI: um array de objetos com "role" e "content". Para conteúdo multimodal, use um array de content com type "text" e "image_url" (ou equivalente de vídeo). Exemplo com cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'.
Você pode usar parâmetros típicos compatíveis com OpenAI: temperature (padrão 1.0), top_p (0.9), max_tokens (padrão varia, recomenda-se definir explicitamente), stop sequences, frequency_penalty, presence_penalty e seed para reprodutibilidade. O modelo suporta streaming via "stream": true para receber respostas token por token. Para entradas multimodais, a API espera arrays de conteúdo com type "image_url" e opcionalmente "video_url" (consulte a documentação do OrcaRouter para o formato exato de vídeo). O limite da janela de contexto de 262.144 tokens se aplica ao número total de tokens nas mensagens mais a resposta. Se você exceder o limite, receberá um erro de comprimento de contexto; você pode ajustar "max_tokens" ou truncar mensagens.
Para aproveitar o contexto de 262K, estruture seus prompts para incluir o documento completo ou o histórico da conversa. Lembre-se de que cada token na entrada conta para o custo e os limites. Para entradas muito longas, considere dividir ou resumir antes de enviar, embora o modelo seja projetado para lidar com o contexto completo. Use o parâmetro "max_tokens" para controlar o comprimento da saída. Se você encontrar erros de tempo limite, ative o streaming para obter resultados parciais mais rapidamente. O OrcaRouter pode ter suas próprias configurações de tempo limite; entre em contato com o suporte se necessário. O modelo não suporta mensagens de sistema de uma forma especial; trate-as como uma mensagem de usuário ou assistente com a função "system" (formato padrão OpenAI).
Migrar de provedores como OpenAI ou Anthropic envolve alterar a URL base para https://api.orcarouter.ai/v1 e atualizar o ID do modelo. Se seu código usa o cliente Python da OpenAI, defina client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1") e então use client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...). O formato da mensagem e os nomes dos parâmetros são idênticos. Nenhuma alteração na lógica do prompt é necessária. Observe que as formas dos objetos de resposta também são compatíveis, portanto o código de análise existente deve funcionar. Teste com uma pequena solicitação primeiro para garantir autenticação e faturamento adequados.
Em comparação com o Qwen3.6-72B (denso), este modelo usa MoE e, portanto, tem menor custo de inferência por token, mas pode ter capacidade bruta ligeiramente inferior. O contexto de 262K é maior que os 128K do Qwen2.5. Comparado ao Qwen3.6-32B (talvez denso), este modelo oferece entrada multimodal que essas versões anteriores podem não ter. A variante "uncensored" é única; as versões padrão do Qwen possuem alinhamento. Se você precisar de segurança rigorosa, escolha o Qwen3.6 regular. Em termos de preço, este modelo é mais barato que muitos modelos densos Qwen em outras plataformas.
O GPT-4o e o Claude 3.5 Sonnet são modelos proprietários com extenso treinamento de segurança, pontuações mais altas em benchmarks de raciocínio e codificação, e suportam uso de ferramentas, visão e contexto grande (200K para o Claude). Este modelo oferece um contexto maior (262K) e entrada multimodal a um preço significativamente mais baixo. No entanto, ele carece dos recursos avançados, confiabilidade e consistência de desempenho desses modelos. Para aplicações onde o custo é uma preocupação principal e você pode aceitar alguma troca de qualidade, este modelo é uma boa alternativa. Se você precisar de raciocínio de alto nível ou chamada de funções, os modelos premium valem o custo extra.
Este modelo é melhor quando você precisa: (1) um contexto muito longo (262K tokens) a baixo custo; (2) entrada multimodal (imagens/vídeo) sem pagar preços premium; (3) geração de texto sem censura onde os filtros de conteúdo interfeririam; (4) inferência rápida em relação à contagem total de parâmetros devido à ativação MoE. É um forte concorrente para pesquisa, extração de dados, escrita criativa e qualquer tarefa que se beneficie de alto contexto e baixo custo por token. Se você precisa de recursos avançados como chamadas de ferramentas, saídas estruturadas ou alta confiabilidade, considere outros modelos.
| Entrada / 1M tokens | $0.310 |
| Saída / 1M tokens | $4.21 |
| Moeda | USD |
Estimativa com base no preço de tabela
Apenas uma estimativa — a contagem real de tokens depende do tokenizador do provedor.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BAbrir @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B