Versi tanpa sensor tanpa kehilangan dari Qwen3.6 35B A3B yang mempertahankan kemampuan model asli sambil menghilangkan perilaku penolakan. Dibangun untuk pengembang, peneliti AI, dan alur kerja agen tingkat lanjut yang memerlukan output model tanpa batasan tanpa mengorbankan penalaran, pengodean, kinerja multibahasa, atau penggunaan alat. Varian Agresif sepenuhnya terbuka dan dirancang untuk memberikan respons langsung dan lengkap di berbagai macam perintah. Meskipun model kadang-kadang dapat menambahkan sengkala informasi singkat yang diwarisi dari pelatihan model dasar, ini bukan penolakan dan konten yang diminta tetap dihasilkan secara penuh. Ideal untuk penelitian AI, pengujian keamanan, red teaming, pengembangan agen, asisten pengodean, dan aplikasi AI tingkat lanjut lainnya yang mendapat manfaat dari fleksibilitas output maksimum. Akses ke model ini dibatasi dan ditujukan bagi peneliti keamanan, red team, peneliti keselamatan AI, dan profesional berkualifikasi lainnya yang melakukan penelitian, evaluasi, dan pengujian yang sah.
Model ini merupakan varian Mixture-of-Experts dari seri Qwen3.6, yang dikembangkan oleh Alibaba Cloud dan dihosting oleh penyedia Obsidian di OrcaRouter. Model ini memiliki total 35 miliar parameter,…
Model ini unggul dalam tugas-tugas yang memanfaatkan jendela konteks yang besar dan pemahaman multimodal. Untuk teks, model ini dapat merangkum atau menjawab pertanyaan pada dokumen hingga 262.144 token, seperti seluruh buku atau laporan panjang. Untuk gambar dan video, model ini dapat mengekstrak informasi terperinci dan menggabungkannya dengan konteks tekstual. Sifat tanpa sensor memungkinkannya menghasilkan konten kreatif tanpa batasan keselamatan yang biasa, berguna untuk pembuatan cerita, bermain peran, atau skenario lain di mana filter yang membatasi tidak diinginkan. Desain MoE-nya menyediakan inferensi cepat relatif terhadap model padat dengan ukuran total serupa, sehingga praktis untuk aplikasi real-time saat digunakan secara efisien. Kemampuan multibahasa diwarisi dari keluarga Qwen3.6, yang mendukung banyak bahasa.
Tag "uncensored" berarti model telah menjalani pelatihan alignment yang dikurangi dibandingkan dengan checkpoint Qwen3.6 standar. Ini dapat menghasilkan keluaran yang kurang difilter untuk konten berbahaya, ofensif, atau kontroversial. Pengguna harus menguji model secara menyeluruh dalam kasus penggunaan spesifik mereka untuk memastikan keluaran memenuhi standar mereka. Kurangnya sensor dapat bermanfaat untuk tugas-tugas seperti penulisan kreatif, role-play tanpa sensor, atau penelitian tentang topik sensitif di mana generasi netral diinginkan. Namun, ini juga berarti model dapat menghasilkan konten yang melanggar kebijakan konten pada umumnya. OrcaRouter tidak mengklaim adanya penyaringan keamanan tambahan; perilaku dasar model itulah yang Anda dapatkan.
Jika tugas Anda melibatkan input pendek (misalnya, beberapa ratus token), klasifikasi sederhana, atau hanya memerlukan pemahaman bahasa dasar, model yang lebih kecil dan lebih murah seperti Qwen2.5-7B atau GPT-4o-mini mungkin lebih hemat biaya. Kekuatan model ini paling terlihat saat menangani konteks yang sangat panjang (lebih dari 10K token) atau input multimodal. Untuk tugas teks murni di bawah 8K token tanpa perlu kemampuan gambar/video, Anda dapat menghemat uang dengan menggunakan model kecil khusus. Selain itu, jika aplikasi Anda memerlukan penyaringan konten yang ketat, sifat tanpa sensor mungkin memaksa Anda untuk menambahkan lapisan moderasi eksternal, yang menambah biaya.
Model menerima input gambar dan video selain teks. Untuk gambar, Anda dapat menyediakan data gambar yang dienkode base64 atau URL (melalui array konten API dengan tipe "image_url"). Untuk video, API kemungkinan menerima bingkai video sebagai urutan gambar atau URL file video; format pastinya harus diperiksa di dokumentasi OrcaRouter. Model memproses input visual ini bersama dengan teks untuk menghasilkan respons. Jendela konteks sebesar 262,144 token berlaku untuk jumlah token gabungan dari semua modalitas input. Perhatikan bahwa pemrosesan gambar dan video mengonsumsi token sebanding dengan resolusi dan panjang visual, sehingga input yang lebih besar akan mengurangi kapasitas teks yang tersedia.
Tidak ada skor benchmark spesifik yang diberikan untuk model ini oleh penyedia. Seri Qwen3.6 umumnya berkinerja kompetitif pada benchmark konteks panjang seperti L-Eval dan RULER, serta pada tugas multimodal seperti MMMU dan MathVista, tetapi angka pasti untuk varian 35B A3B tanpa sensor ini tidak dipublikasikan. Pengguna yang tertarik dengan kinerja empiris harus menjalankan evaluasi sendiri pada kumpulan data yang representatif. Arsitektur MoE dengan 3B parameter yang diaktifkan sering kali menghasilkan hasil yang sebanding dengan model padat dengan ukuran aktif yang serupa, sementara total biaya penyimpanan dan memori lebih tinggi karena 35B parameter penuh.
Kecepatan dan latensi bergantung pada beberapa faktor: panjang input, panjang output, beban server, dan konfigurasi perangkat keras. Karena model hanya mengaktifkan 3B parameter per token, diperkirakan lebih cepat daripada model padat 35B, dengan tingkat generasi yang sebanding dengan model seperti GPT-3.5 (meskipun tidak ada angka pasti yang diberikan). Infrastruktur OrcaRouter melalui Obsidian dapat menawarkan latensi yang bervariasi; pengguna dapat menguji dengan beban kerja mereka sendiri. Untuk skenario konteks panjang (mis., 100K+ token), waktu prefill meningkat secara linear seiring panjang input. Generasi token output biasanya menjadi kontributor utama latensi. Tidak ada perjanjian tingkat layanan (SLA) untuk kecepatan yang disebutkan.
Keunggulan model ini mencakup jendela konteks sebesar 262K, yang memungkinkan pemrosesan seluruh buku atau transkrip video berdurasi berjam-jam dalam satu kali pengolahan. Desain MoE memberikan keseimbangan yang baik antara kapasitas dan kecepatan inferensi. Input multimodal memungkinkan tugas-tugas yang menggabungkan data teks dan visual. Sifat tanpa sensor memungkinkan pembuatan konten yang mungkin ditolak oleh model lain. Dukungan multibahasa mencakup puluhan bahasa. Harga yang kompetitif untuk model dengan kemampuan ini: $0.31/M input dan $4.21/M output, tanpa markup.
Keterbatasannya meliputi kurangnya angka benchmark yang dipublikasikan, sehingga lebih sulit untuk mengukur performa relatif. Sifat tanpa sensor dapat menghasilkan output yang tidak diinginkan tanpa moderasi tambahan. Jumlah parameter aktif 3B berarti mungkin tidak sebanding dengan kemampuan penalaran mentah model padat yang lebih besar (misalnya, GPT-4) pada tugas logika yang kompleks. Kemampuan multimodal mungkin kurang terasah dibandingkan model visi-bahasa khusus. Modalitas input seperti tokenisasi video dapat mengurangi konteks efektif untuk teks. Tidak ada kemampuan streaming atau penggunaan alat yang dijamin. Terakhir, ketergantungan pada penyedia pihak ketiga Obsidian berarti ketersediaan dan waktu aktif tidak berada dalam kendali OrcaRouter.
Harga bersifat transparan: $0.31 per juta token input dan $4.21 per juta token output. Ini adalah tarif penyedia yang tepat dari Obsidian, tanpa markup tambahan dari OrcaRouter. Token input mencakup semua token teks dan visual (untuk gambar dan video). Token output adalah teks yang dihasilkan. Tidak ada biaya per permintaan atau langganan yang diperlukan. Anda hanya membayar untuk token yang digunakan. Harga per 1M token, sehingga permintaan kecil hanya memerlukan biaya sepersekian sen. Tidak ada tingkatan gratis atau uji coba yang diiklankan.
Tidak ada diskon, manfaat caching, atau harga volume yang telah diungkapkan untuk model ini. Tarif yang tercantum adalah flat per token. Tidak seperti beberapa penyedia yang menawarkan harga lebih rendah untuk token input yang di-cache, OrcaRouter menerapkan tarif input yang sama terlepas dari pengulangan. Untuk penggunaan yang sangat tinggi, Anda dapat menghubungi OrcaRouter untuk pengaturan khusus potensial, tetapi tidak ada diskon standar yang didokumentasikan. Kebijakan zero-markup memastikan Anda membayar persis seperti yang dikenakan Obsidian, tanpa biaya tersembunyi.
Model multimodal konteks panjang yang sebanding dari penyedia lain seringkali lebih mahal: misalnya, GPT-4 Turbo dari OpenAI adalah $10/1M input dan $30/1M output, sementara Claude 3.5 Sonnet adalah $3/1M input dan $15/1M output. Model ini jauh lebih murah yaitu $0.31/$4.21. Namun, model-model tersebut menawarkan kemampuan yang berbeda (misalnya, penggunaan alat, tolok ukur penalaran yang lebih tinggi). Harga yang lebih rendah mencerminkan arsitektur MoE dan fakta bahwa ini adalah model yang dihosting oleh pihak ketiga tanpa sensor. Jika Anda memerlukan keandalan terjamin, keamanan lebih tinggi, atau fitur lanjutan seperti panggilan fungsi, biaya tambahan mungkin dapat dibenarkan.
Untuk menggunakan model, kirim permintaan POST ke https://api.orcarouter.ai/v1/chat/completions (atau titik akhir yang sesuai sesuai API kompatibel OpenAI milik OrcaRouter). Sertakan header "Authorization: Bearer YOUR_API_KEY". Di badan permintaan, atur "model": "obsidian/Qwen3.6-35B-A3B". Kirim pesan dalam format OpenAI standar: larik objek dengan "role" dan "content". Untuk konten multimodal, gunakan larik konten dengan tipe "text" dan "image_url" (atau setara video). Contoh dengan cURL: curl https://api.orcarouter.ai/v1/chat/completions -H "Content-Type: application/json" -H "Authorization: Bearer $KEY" -d '{"model":"obsidian/Qwen3.6-35B-A3B","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}]}'.
Anda dapat menggunakan parameter yang kompatibel dengan OpenAI: temperature (default 1.0), top_p (0.9), max_tokens (default bervariasi, disarankan untuk diatur secara eksplisit), urutan penghentian, frequency_penalty, presence_penalty, dan seed untuk reproduksibilitas. Model mendukung streaming melalui "stream": true untuk menerima respons token demi token. Untuk input multimodal, API mengharapkan array konten dengan tipe "image_url" dan opsional "video_url" (periksa dokumentasi OrcaRouter untuk format video yang tepat). Batas jendela konteks sebesar 262.144 token berlaku untuk total jumlah token dalam pesan ditambah respons. Jika Anda melebihi batas, Anda akan mendapatkan kesalahan panjang konteks; Anda dapat menyesuaikan "max_tokens" atau memotong pesan.
Untuk memanfaatkan konteks 262K, susun prompt Anda untuk menyertakan dokumen lengkap atau riwayat percakapan. Perhatikan bahwa setiap token dalam input diperhitungkan terhadap biaya dan batasan. Untuk input yang sangat panjang, pertimbangkan untuk memotong atau meringkas sebelum mengirim, meskipun model dirancang untuk menangani konteks penuh. Gunakan parameter "max_tokens" untuk mengontrol panjang keluaran. Jika Anda mengalami kesalahan waktu habis, aktifkan streaming untuk mendapatkan hasil parsial lebih cepat. OrcaRouter mungkin memiliki pengaturan waktu habis sendiri; hubungi dukungan jika diperlukan. Model tidak mendukung pesan sistem dengan cara khusus; perlakukan mereka sebagai pesan pengguna atau asisten dengan peran "system" (format OpenAI standar).
Migrasi dari penyedia seperti OpenAI atau Anthropic melibatkan perubahan base URL menjadi https://api.orcarouter.ai/v1 dan memperbarui ID model. Jika kode Anda menggunakan klien Python OpenAI, setel `client = OpenAI(api_key="YOUR_KEY", base_url="https://api.orcarouter.ai/v1")` lalu gunakan `client.chat.completions.create(model="obsidian/Qwen3.6-35B-A3B", ...)`. Format pesan dan nama parameter identik. Tidak diperlukan perubahan pada logika prompt. Perhatikan bahwa bentuk objek respons juga kompatibel, sehingga kode parsing yang sudah ada seharusnya berfungsi. Uji dengan permintaan kecil terlebih dahulu untuk memastikan autentikasi dan penagihan yang benar.
Dibandingkan dengan Qwen3.6-72B (dense), model ini menggunakan MoE sehingga biaya inferensi per token lebih rendah, namun mungkin memiliki kapasitas mentah yang sedikit lebih rendah. Konteks 262K lebih besar dari Qwen2.5 yang 128K. Dibandingkan dengan Qwen3.6-32B (mungkin dense), model ini menawarkan input multimodal yang mungkin tidak dimiliki versi-versi sebelumnya. Varian "tanpa sensor" bersifat unik; rilis Qwen standar memiliki penyelarasan. Jika Anda membutuhkan keamanan yang ketat, pilih Qwen3.6 reguler. Dari segi harga, model ini lebih murah dibandingkan banyak model Qwen dense di platform lain.
GPT-4o dan Claude 3.5 Sonnet adalah model proprietary dengan pelatihan keamanan yang ekstensif, skor benchmark yang lebih tinggi dalam penalaran dan pengkodean, serta mendukung penggunaan alat, visi, dan konteks besar (200K untuk Claude). Model ini menawarkan konteks yang lebih besar (262K) dan input multimodal dengan harga yang jauh lebih rendah. Namun, model ini tidak memiliki fitur canggih, keandalan, dan konsistensi kinerja dari model-model tersebut. Untuk aplikasi di mana biaya menjadi perhatian utama dan Anda dapat menerima beberapa pengorbanan kualitas, model ini merupakan alternatif yang baik. Jika Anda memerlukan penalaran tingkat atas atau pemanggilan fungsi, model premium sepadan dengan biaya tambahan.
Model ini paling baik ketika Anda membutuhkan: (1) konteks yang sangat panjang (262K token) dengan biaya rendah; (2) input multimodal (gambar/video) tanpa membayar harga premium; (3) generasi teks tanpa sensor di mana filter konten akan mengganggu; (4) inferensi cepat relatif terhadap jumlah total parameter karena aktivasi MoE. Model ini merupakan pesaing kuat untuk penelitian, ekstraksi data, penulisan kreatif, dan tugas apa pun yang diuntungkan oleh konteks tinggi dan biaya per-token yang rendah. Jika Anda membutuhkan fitur lanjutan seperti panggilan alat, keluaran terstruktur, atau keandalan tinggi, pertimbangkan model lain.
| Input / 1M token | $0.310 |
| Output / 1M token | $4.21 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/obsidian/Qwen3.6-35B-A3BBuka @misc{orcarouter_qwen3_6_35b_a3b,
title = {Qwen3.6 35B A3B Uncensored (Aggressive) API},
author = {obsidian},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B}
}obsidian. (2026). Qwen3.6 35B A3B Uncensored (Aggressive) API. OrcaRouter. https://www.orcarouter.ai/models/obsidian/Qwen3.6-35B-A3B