Kartu judul hero untuk artikel 'Qwen3.8-27B-Uncensored-MLX on Apple Silicon' menampilkan tajuk berita 'Qwen3.8-27B-Uncensored-MLX', subjudul 'The Apple Silicon Runbook', deretan chip kuantisasi berlabel 2-bit, 4-bit, 6-bit, dan 8-bit dengan 4-bit disorot, jendela LM Studio bergaya yang menampilkan '4-bit build at repo root', dan motif konteks 262K, dengan logo OrcaRouter dikomposit di sudut.
Guides & Insights

Qwen3.8-27B-Uncensored-MLX di Apple Silicon: Cara Memilih Build Anda, Memuatnya di LM Studio atau mlx-vlm, dan Menjinakkan Konteks 262K

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang paling berguna untuk diketahui tentang orcarouter/Qwen3.8-27B-Uncensored-MLX adalah bahwa Anda tidak perlu memilih subfolder untuk menjalankannya. Build abliterated milik OrcaRouter dari Qw​en/Qwen3.8-27B berbasis Apple-Silicon — diterbitkan ke Hugging Face pada 17 Agustus 2026, jadi bukan hal baru, hanya kurang terdokumentasi — menyimpan salinan build 4-bit di root repo, khususnya agar alat yang memperlakukan satu repo sebagai satu model, yang terpenting LM Studio, dapat memuatnya tanpa konfigurasi sama sekali. Keputusan tunggal itulah mengapa kartu ini telah menarik sekitar 83.000 unduhan dalam sebulan terakhir, sementara konversi MLX yang sebanding hanya mendapatkan sebagian kecil dari angka tersebut. Semua hal lain tentangnya adalah pilihan nyata: mana dari keempat presisi yang sesuai dengan memori terpadu Mac Anda, runner mana yang Anda gunakan, apakah visi dan pemanggilan alat bertahan pada lebar-bit Anda, dan apakah jendela konteks 262.144 token sepadan dengan biayanya pada perangkat keras Anda. Buku panduan ini membahas keputusan-keputusan tersebut secara berurutan. Ini adalah dokumentasi pihak pertama — ukuran, presisi, dan angka fidelitas di bawah ini adalah milik OrcaRouter sendiri, diukur pada build yang persis ini, dan setiap angka komunitas diberi label demikian.

Screenshot of the Hugging Face model card for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the model title, the description 'An abliterated (refusal-removed) MLX build of Qwen's Qwen3.8-27B — 2/4/6/8-bit for Apple Silicon', the apache-2.0 license, tag chips, and the 'Downloads last month' statistic of 83,352.

Apa sebenarnya isi repositori ini

Ini adalah build abliterasi dari Qw​en/Qwen3.8-27B — model padat 27B dengan perhatian hibrida (perhatian linear Gated DeltaNet plus perhatian penuh), secara native vision-language, dengan kontrol berpikir, pemanggilan alat, kepala prediksi multi-token (MTP), dan jendela konteks 262.144 token. Abliterasi menghilangkan perilaku penolakan model dengan mengortogonalisasi arah penolakan dari aliran residual; jika itu baru bagi Anda, pengantar kami tentang teknik tersebut adalah tempat yang lebih baik untuk memulai daripada halaman ini, yang membahas tentang menjalankan build, bukan metodenya. Bobotnya berlisensi Apache-2.0, diwarisi dari model dasar.

Jangan kelirukan repo ini dengan qwen-3-8-27b-mlx, yang merupakan model dasar yang sama dalam format MLX tanpa abliterasi. Pembaca sering kali mengunduh yang satu padahal yang dimaksud yang lain: repo ini adalah build riset tanpa penolakan; yang itu adalah Qw​en/Qwen3.8-27B biasa di Apple Silicon. Periksa nama repo sebelum menghabiskan waktu unduhan.

Satu detail struktural lebih penting daripada yang terlihat: menara visi, semua norma, dan conv1d perhatian linear tetap dalam BF16, dan hanya lapisan linear model bahasa — termasukembed_tokens dan lm_head — dikuantisasi. Itulah sebabnya pemahaman gambar tetap bertahan setelah kuantisasi, dan itu juga mengapa ukuran pada disk di bawah ini sedikit lebih besar daripada perkiraan naif "27B pada N bit": sebagian model tidak pernah dikompresi.

Keputusan: build mana yang cocok untuk Mac mana

A generated scoreboard titled 'Qwen3.8-27B-Uncensored-MLX — pick your build' comparing the four MLX builds: 8-bit at 27.5 GB near-lossless cos 0.9997, 6-bit at 22 GB excellent cos 0.9996, 4-bit at 15 GB recommended default cos 0.996, 2-bit at 8.7 GB archival only cos 0.92, plus 'Repo root: 4-bit copy, zero-config in LM Studio' and 'BF16 kept: vision tower, norms, conv1d', with a footer noting sizes and fidelity per the OrcaRouter model card and Mac RAM guidance per card and community tests, and the OrcaRouter logo composited in the corner.

Empat presisi hadir sebagai subfolder — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — semua kuantisasi affine MLX pada ukuran grup 64. Build 4-bit juga dicerminkan di root repositori. Pilih berdasarkan memori terpadu Mac Anda terlebih dahulu, kualitas kedua:

8-bit — ~27,5 GB di disk, membutuhkan Mac 64 GB (mesin 32 GB dapat memuatnya tetapi menyisakan sedikit ruang untuk hal lain). Kesetiaan kosinus terukur terhadap sumber BF16: 0,9997, secara efektif hampir tanpa kehilangan. Pilih ini saat kualitas adalah yang utama dan memori berlimpah.

6-bit — ~22 GB, cocok untuk Mac 24–32 GB. Fidelitas 0,9996, sangat baik. Keseimbangan kualitas-per-gigabyte terbaik bagi sebagian besar pemilik mesin 48 GB.

4-bit — ±15 GB, nyaman di Mac 24 GB. Fidelity 0,996, sangat baik. Ini adalah default yang kami rekomendasikan, dan untuk alasan itulah ini adalah salinan di root repo.

2-bit — ~8,7 GB, muat di Mac 16 GB. Fidelity 0,92 dan, pada 27B, sangat terdegradasi: pengulangan, teks kacau, kode dan bahasa Mandarin, penglihatan sebagian. Kartu itu mengatakannya dengan jelas — hanya untuk arsip, bukan untuk kerja nyata. Mac 16 GB secara teknis dapat memuatnya; itu tidak membuatnya dapat digunakan.

{{1}}Ukuran pada disk bukanlah angka memorinya.{{/1}} Bobot harus muat dalam memori terpadu bersama macOS, cache KV, dan buffer sementara Metal, {{2}}jadi sisakan ruang{{/2}}. Uji coba komunitas terhadap build 4-bit pada Mac M1 Pro 32 GB mengukur bobot ~16 GB di disk tetapi puncak inferensi 18,5–21,7 GB; uji coba komunitas terhadap build MLX 8-bit melaporkan puncak sekitar 34–36 GB meskipun bobotnya ~29,5 GB. Panduan praktis dari uji komunitas yang sama adalah: 16 GB bukan pilihan nyata untuk model 27B, 24 GB dapat mencoba 4-bit dengan konteks pendek, dan 32 GB adalah titik awal yang nyaman. {{3}}Artikel perencanaan VRAM kami menerapkan perhitungan yang sama untuk seluruh keluarga.{{/3}}

Karena daftar keseluruhan repositori berjumlah sekitar 94 GB di semua presisi, unduh hanya subfolder yang Anda perlukan dengan hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — gantikan dengan presisi yang Anda pilih. Salinan root 4-bit adalah duplikat dari subfolder 4-bit, jadi Anda tidak perlu mengunduh keduanya.

Jalur satu — LM Studio, tanpa konfigurasi

Akar salinan 4-bit ada khusus agar LM Studio dapat memperlakukan seluruh repositori sebagai satu model. Cari ID model, pilih presisi yang Anda inginkan (salinan akar adalah 4-bit), dan aplikasi menangani sisanya. Tiga jebakan, semuanya dari kartu kami, dan itulah seluruh perbedaan antara berhasil dan gagal:

Screenshot of the Hugging Face files-and-versions page for orcarouter/Qwen3.8-27B-Uncensored-MLX showing the repo tree with the 4-bit build's files at the repo root (config.json and model-00001 through model-00003-of-00003 safetensors shards) alongside the 2-bit, 4-bit, 6-bit, 8-bit and mtp subfolders.

Repositori ini dibatasi (gated). Unduhan anonim mendapatkan HTTP 401. Terima persyaratan di halaman model, lalu tempel token baca Hugging Face ke Pengaturan → Integrasi → Hugging Face di LM Studio. Lewati langkah ini dan pemuatan akan gagal.

Matikan kuantisasi cache KV. Model visi MLX tidak mendukungnya pada arsitektur ini dan pemuatan gagal selama inisialisasi jika diaktifkan (dilacak sebagai mlx-engine#286). Ini berlawanan dengan saran untuk build GGUF, di mana mengkuantisasi cache K/V adalah penghematan VRAM yang sah — kedua format tidak dapat dipertukarkan di sini.

Perbarui runtime. qwen3_5dukungan arsitektur telah hadir di mlx-vlm 0.6.x; runtime bawaan yang lebih lama tidak dapat memuat bobot-bobot ini sama sekali. Sebaliknya, lencana "Likely too large" dari LM Studio hanyalah peringatan RAM, bukan kesalahan — abaikan saja jika memori terpadu Anda memenuhi panduan di atas.

Presisi mana di LM Studio: 8-bit sekitar ~29.5 GB di disk dan membutuhkan Mac 64 GB; 6-bit ~22 GB cocok untuk mesin 48 GB; 4-bit pada ~16 GB adalah pilihan yang tepat di Mac 32 GB. Jika Anda ingin menggunakan jalur llama.cpp / Ollama di perangkat keras lain, panduan kami untuk menjalankan model tanpa sensor secara lokal mencakup jalur tersebut secara terpisah.

Jalur dua — mlx-vlm dan mlx-lm dari subfolder

Rute baris perintah memberi Anda presisi secara langsung dan server yang kompatibel dengan Open​AI untuk alat agen. Persyaratan: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 dan mlx ≥ 0.32; backend Metal dipilih secara otomatis pada Apple Silicon). Setelah unduhan subfolder di atas:

python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "Jelaskan keterikatan kuantum dalam satu kalimat." --max-tokens 256

Tambahkan --image path/to/image.png untuk input visi, atau sajikan:

python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

For agent frameworks that speak Open​AI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.

Visi bertahan melalui kuantisasi.

Karena vision tower dan conv1d tetap dalam BF16, pemahaman gambar tetap terjaga pada 4/6/8-bit. Pada gambar uji kami — bentuk, warna, posisi, latar belakang, dan teks dalam gambar — build 4/6/8-bit menjelaskan semuanya dengan benar; 2-bit hanya sebagian. Jika Anda memilih build dan visi itu penting, 4-bit adalah yang terendah yang sebaiknya Anda gunakan. Kami belum memublikasikan throughput visi khusus Apple-Silicon untuk build ini, jadi jangan percaya angka tok/s untuk itu kecuali berasal dari run bernama pada kelas chip Anda sendiri.

Menara visi yang dipertahankan juga merupakan bagian dari permukaan risiko, dan perlu dikatakan secara gamblang: model yang telah diabliterasi namun juga dapat membaca gambar bukanlah masalah keamanan yang hanya terkait teks.

Pemanggilan alat dan penggunaan agen

Pemanggilan alat adalah kemampuan model dasar dan ia bertahan dari abliterasi, yang membuat build ini benar-benar berguna untuk red-teaming sistem agen — dan benar-benar berbahaya jika diarahkan ke layanan nyata. Pengaturan standarnya adalah mlx_lm.server titik akhir di atas, yang dapat dijangkau oleh agen mana pun yang kompatibel dengan Open​AI. Jika Anda menjalankannya sebagai agen, pahami apa yang telah Anda aktifkan: model tanpa penolakan dengan function-calling dan konteks 262K adalah postur keamanan yang berbeda dari model obrolan, dan pembingkaian kartu yang hanya untuk riset ada karena alasan itu.

Konteks 262K dan berapa biaya sebenarnya

Arsitektur ini memberikan model konteks panjang yang luar biasa murah. Atensi hibrida di sini berarti 48 lapisan atensi linear (Gated DeltaNet) yang disisipkan dengan 16 lapisan atensi penuh, dan hanya 16 lapisan atensi penuh yang membawa cache KV klasik — lapisan linear justru menyimpan status berulang yang ringkas. Jadi, 262.144 token membutuhkan biaya yang jauh lebih rendah daripada pada 27B dengan atensi penuh. Itu adalah fakta struktural tentang model dasar, bukan janji tentang Mac Anda.

Dalam praktiknya, jendela konteks adalah sebuah kapabilitas, bukan tier gratis. Uji konteks panjang dari komunitas pada M4 Max mengukur sekitar 63 tok/s pada konteks pendek, turun menjadi sekitar 11 tok/s pada 31K token — decode menurun tajam seiring terisinya cache, dan latensi token pertama pada prompt yang sangat panjang biasanya menjadi hambatan yang lebih besar daripada throughput mentah. Prefill berbasis spekulatif dan ANE meningkatkan ingesti, bukan decode. Angka biaya KV-cache Apple Silicon kami sendiri untuk build ini tidak dipublikasikan; jika Anda membutuhkan angka pasti untuk perangkat keras Anda, hasil uji komunitas adalah sumber yang jujur, dan konsensus komunitas adalah memperlakukan 262K penuh sebagai sesuatu yang sengaja digunakan, bukan sebagai default yang dibiarkan aktif.

Kecepatan — apa yang sebenarnya diukur

Kami menerbitkan tepat satu angka kecepatan untuk build ini dan itu bukan Apple Silicon: ~32–37 tok/s dalam steady-state pada satu H200 melalui backend MLX CUDA, yang menegaskan bahwa bobot juga berjalan di luar macOS. Pada Mac, kartu kami sengaja tidak menerbitkan tok/s, karena itu bergantung pada chip, presisi, dan runner. Angka praktisi yang layak diketahui, semuanya diberi label demikian:

• Build persis ini, 4-bit, M1 Pro 32 GB: ~8,7 tok/s generasi dan ~41,7 tok/s prefill pada uji coba singkat (uji komunitas, Agustus 2026). Chip yang lebih lama, tetapi merupakan batas bawah yang realistis.

• oMLX dengan MTP asli pada M4 Max, checkpoint stok non-abliterated: 53.3 tok/s prosa dan 72.1 tok/s kode, dengan prefill ~273.7 tok/s pada 4K; decode mentah tanpa MTP ~24.6 tok/s. Diukur oleh praktisi pada checkpoint dan runtime yang berbeda, jadi perlakukan ini sebagai batas atas yang mungkin didekati oleh bobot abliterated, bukan sebagai janji.

• Prefill oMLX dual-ANE pada M3 Ultra, dengan oQ4e-MTP yang abliterated: prefill meningkat hingga ~17.7% pada 16K dan ~18.9% pada 32K, serta decode melalui Lightning MTP hingga ~75 tok/s pada 16K. Peringatannya nyata: ia menggunakan antarmuka runtime privat Apple dan bobot INT8 perkiraan, menambah sekitar 4 GB memori puncak, dan meningkatkan waktu pemuatan model dari ~3.4 s menjadi ~28 s. Itu adalah optimasi pemrosesan prompt, bukan akselerator generasi.

Kepala MTP — percepatan gratis jika runner Anda mendukungnya

Build ini menyertakan drafter prediksi multi-token model dasar di dalam mtp/ subfolder (arsitektur qwen3_5_mtp), dan ia bekerja dengan presisi utama apa pun. Penerimaannya lossless — dengan decoding greedy, keluarannya identik dengan menjalankan tanpa drafter — jadi ini merupakan percepatan yang sesungguhnya tanpa biaya kualitas saat ia aktif. Dua catatan pengaturan dari kartu kami: ini memerlukan build mlx-vlm yang menyertakan qwen3_5_mtp drafter (cabang main), dan Anda harus menyertakan keduanya --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp dan --draft-kind mtp. Menyetel mtp_enabled saja tidak melakukan apa pun. Jika runner Anda tidak mendukung drafter, drafter tersebut diabaikan dan model berjalan normal — tidak ada yang rusak.

Keselamatan — baca ini sebelum Anda menjalankannya, bukan setelahnya

Penafian pada kartu model itu sendiri sangat blak-blakan, dan halaman ini tidak akan melunakkannya. Penyelarasan keamanan dari build ini telah dihilangkan secara substansial. Model ini akan mematuhi permintaan berbahaya, tidak etis, ofensif, atau ilegal yang akan ditolak oleh Qw​en/Qwen3.8-27B dasar, dan model ini tidak memiliki pengaman bawaan yang bermakna. Model ini dirilis semata-mata untuk riset yang sah — interpretabilitas, studi keamanan AI dan mekanisme penolakan, red-teaming, evaluasi ketahanan, dan eksperimen terkontrol. Jika itu bukan yang sedang Anda lakukan, ini adalah model yang salah.

Dua peringatan dari kartu tersebut patut ditekankan. Pertama, probe jailbreak dan keselamatan "berhasil" secara sepele pada model yang diabliterasi, dan itu bukanlah evaluasi keselamatan yang lulus — itu adalah perilaku yang diharapkan dari model yang arah penolakannya telah dihapus. Tidak adanya penolakan bukanlah bukti keselamatan. Kedua, visi, pemanggilan alat, dan konteks 262K yang dipertahankan memperluas permukaan serangan ke pemahaman gambar dan penggunaan agen: model tanpa sensor yang dapat membaca tangkapan layar dan memanggil alat adalah risiko yang lebih luas daripada versi tanpa penolakan yang hanya mengobrol. Kuantisasi bit rendah menambahkan lapisan ketiga ketidakstabilan di atasnya — pada 2-bit, keluaran yang kacau bahkan dapat disalahartikan sebagai penolakan, yang merupakan jenis kegagalan yang membingungkan tersendiri.

Anda memikul tanggung jawab dan kewajiban penuh atas penggunaan dan hasilnya. Lisensi Apache-2.0 diwarisi dari model dasar dan tidak mengubah hal tersebut: lisensi ini mengizinkan penggunaan; namun tidak membuat penerapan Anda aman. Siapa pun yang menerapkan ini kepada pengguna akhir, anak di bawah umur, atau lingkungan produksi apa pun harus menambahkan lapisan moderasi, keamanan, dan pencegahan penyalahgunaan mereka sendiri terlebih dahulu, serta mematuhi hukum yang berlaku. Bagi peneliti yang benar-benar menjalankannya, pengaman praktisnya adalah: lingkungan yang terisolasi, idealnya offline; alat agen yang tidak diarahkan ke layanan nyata; tanpa paparan kepada pengguna akhir; dan peninjauan hasil sebelum disebarluaskan ke mana pun.

Ketika lokal bukanlah jawabannya

Lokal adalah inti dari build ini — bobot model tersimpan di disk Anda, tidak ada biaya per-token, dan tidak ada apa pun yang keluar dari mesin. Tetapi lokal juga memiliki keterbatasan: hanya untuk Apple Silicon, Anda harus menerima kualitas kuantisasi, dan tidak ada redundansi jika mesin sedang sibuk. Jika Anda membutuhkan model kelas 27B non-abliterated melalui API untuk beban kerja nyata, atau ingin menguji A/B build lokal ini dengan model hosted menggunakan prompt yang sama, itulah celah yang menjadi alasan keberadaan lapisan routing. OrcaRouter menempatkan 200+ model di balik satu kunci API dengan harga daftar penyedia, lengkap dengan failover otomatis dan DSL routing — pemotongan harga vendor langsung aktif di sisi kami pada hari yang sama saat diumumkan, karena kami meneruskan harga daftar tersebut. Satu API, satu integrasi, dan Anda dapat membandingkan setup lokal yang belum teruji dengan model hosted tanpa perlu membuat akun kedua. Kami tidak menghosting build MLX ini — memang dirancang sebagai bobot lokal — jadi API adalah jalur pelengkap, bukan penggantinya.

Panduan keputusan singkat

• Mac 16 GB — sejujurnya, bukan model ini. 2-bit muat dan hanya untuk arsip; Anda akan berjuang melawan memori bagaimanapun juga. Lihatlah model tanpa sensor yang lebih kecil, atau konversi campuran 3/6-bit buatan komunitas yang dibuat untuk mesin 18–24 GB.

• Mac 24 GB — 4-bit, dan jaga konteks tetap pendek; jangan jalankan vision dan konteks panjang secara bersamaan.

• Mac 32 GB — 4-bit adalah titik optimal; 6-bit jika Anda menjaga konteks tetap ketat.

• Mac 48 GB — 6-bit dengan headroom; 8-bit jika Anda tidak mendorong jendela.

• 64 GB ke atas — 8-bit, near-lossless, dan konteks 262K dalam jangkauan dengan peringatan-peringatan di atas.

Itulah seluruh runbook. Modelnya berasal dari 17 Agustus 2026; ini bukan berita peluncuran, dan memang tidak perlu demikian: 83.000 unduhan terjadi karena orang menginginkan panduan, dan halaman ini adalah panduan tersebut. Mulailah dari root repositori, muat versi 4-bit di LM Studio, dan tinggalkan build default hanya jika Anda tahu apa yang Anda korbankan demi kualitas. Jika Anda datang dari sisi keluarga GGUF atau FP8, panduan terkait membahas jalur-jalur tersebut — kerangka keputusannya sama, sedangkan matematika kuantisasinya tidak.

Bukan sekadar build lain dari model ini — Qwen3.8-Flash-Next-Uncensored adalah rilis terpisah: diabliterasi dari Qwen3.8-Flash-Next, sebuah pratinjau mixture-of-experts dengan 176B parameter tersimpan / 6B aktif dari arsitektur Qwen4. Teknik abliterasi yang sama, bobot yang berbeda, koleksinya sendiri.

Keenam build 27B — BF16, GGUF, MLX, FP8, INT8, dan NVFP4 — dikumpulkan dalam koleksi Qwen3.8-27B-Uncensored di Hugging Face.

Bobot-bobot ini secara desain hanya bersifat lokal. Untuk baseline yang di-host sebagai pembanding build yang diabliberasi, Qwen3.8-27B disajikan di OrcaRouter dengan harga daftar penyedia tanpa markup — model stok, alignment keamanannya tetap utuh.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube