
Kuantisasi Sadar Sensitivitas Dijelaskan: Bagaimana OrcaSAQ Menentukan Bobot Mana yang Mendapat Lebih Banyak Bit
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Kuantisasi sadar-sensitivitas adalah praktik membelanjakan anggaran bit Anda di tempat yang paling penting: tensor-tensor yang paling dirugikan oleh kuantisasi mendapatkan lebih banyak bit, sementara yang lainnya tetap pada lebar bit dasar yang lebih rendah. Artikel ini menjelaskan bagaimana OrcaSAQ — metode presisi campuran kami yang bebas kalibrasi dan sadar-arsitektur, dirilis bersama GLM-5.3-Flashkeluarga kuantisasiorcarouter/GLM-5.3-Flash-MLX — menentukan tensor mana dari 37.338 tensor dalam model Mixture-of-Experts dengan 320 miliar parameter yang layak mendapatkan bit ekstra, sepenuhnya tanpa dataset kalibrasi. Pelajaran yang dapat ditransfer bagi siapa pun yang melakukan kuantisasi pada MoE yang berbeda: eksper bersama dan proyeksi ke bawah layak mendapatkan bit ekstra, dan Anda dapat menemukannya hanya dengan menggunakan metadata kuantisasi dari rilis upstream itu sendiri.
Jawaban singkatnya
Kuantisasi berbasis sensitivitas adalah presisi campuran dengan sebuah kebijakan: lebar bit setiap tensor mengikuti seberapa sensitif tensor tersebut terhadap kesalahan kuantisasi, alih-alih satu lebar untuk seluruh model. Literatur penelitian mengukur sensitivitas dengan Hessian, informasi Fisher, atau divergensi antara keluaran lapisan asli dan terkuantisasi, lalu mengalokasikan bit ke lapisan yang paling merugikan. OrcaSAQ termasuk dalam keluarga yang lebih kecil yang melewatkan pengukuran tersebut sepenuhnya. Ia mengodekan peringkat sensitivitas dalam arsitekturnya sendiri: ia menggunakan prior arsitektural dan peran tensor untuk memutuskan bobot mana yang rapuh, lalu mengkuantisasi semua hal lain pada presisi dasar target.
Yang Anda peroleh adalah pipeline yang cepat, deterministik, dan tanpa kalibrasi. Tidak ada korpus kalibrasi yang perlu disusun, tidak ada pencarian sensitivitas per lapisan, dan tidak ada penyetelan ulang per model, sehingga resep yang sama dapat diterapkan ke arsitektur baru begitu bobotnya dirilis. Yang dikorbankan adalah adaptasi: metode berbasis kalibrasi seperti GPTQ atau AWQ melihat distribusi aktivasi yang sebenarnya dari model dan data Anda, dan biasanya akan menghasilkan kualitas yang lebih tinggi dari lebar bit rata-rata yang sama. Taruhan OrcaSAQ adalah bahwa untuk model Mixture-of-Experts, peran sebuah tensor memberi tahu Anda sebagian besar dari apa yang akan diberikan oleh proses kalibrasi, hanya dengan sebagian kecil biaya.
Dua cara untuk menemukan bobot sensitif
Sebelum kebijakan, pertanyaannya: bagaimana Anda tahu tensor mana yang dirugikan oleh kuantisasi? Dua jawaban tersebut adalah seluruh ruang desain.
• Berbasis kalibrasi.Jalankan korpus kecil melalui model, ukur kesalahan yang ditimbulkan setiap tensor atau blok, dan alokasikan bit untuk meminimalkan total kesalahan rekonstruksi. GPTQ menggunakan pendekatan berbasis Hessian untuk kesalahan kuantisasi per lapisan; AWQ menggunakan statistik aktivasi untuk mengidentifikasi bobot penting yang perlu dilindungi. Kekuatannya adalah adaptasi terhadap data aktual Anda; biayanya adalah korpus terkurasi, forward pass, dan penyelesaian invers-Hessian untuk setiap lapisan, serta hasil yang berubah ketika set kalibrasi berubah.
• Tanpa kalibrasi. Tentukan peringkat sensitivitas sebelum melihat data apa pun, dari arsitekturnya. Dalam MoE, Anda sudah tahu peran penopang beban: ahli yang aktif pada setiap token, dan proyeksi yang menulis ke dalam aliran residual. Kodekan peringkat tersebut sebagai kebijakan tetap dan terapkan secara mekanis.
OrcaSAQ berada dengan tegas di kubu kedua, dan artikel ini merupakan pembelaan terhadap kubu tersebut untuk kuantisasi MoE — dengan uraian yang jernih tentang apa yang Anda korbankan untuk itu.
Kebijakan: tensor mana yang mendapatkan lebih banyak bit
Kebijakan alokasi bit OrcaSAQ dinyatakan dalam kartu model untuk orcarouter/GLM-5.3-Flash-MLX, dan kebijakan tersebut tereduksi menjadi tiga aturan ditambah satu pengecualian. Presisi dasar adalah build yang Anda buat — 6, 4, 3, atau 2 bit — dan kebijakan tersebut menaikkan peran tensor tertentu di atasnya:
• Pakar bersama: basis +2 bit.Pakar bersama aktif pada setiap token, sehingga galat kuantisasinya terulang pada setiap keluaran yang dihasilkan model. Ini adalah tensor dengan pengaruh tertinggi dalam model, dan ia mendapat bit terbanyak.
• down_proj: basis +1 bit. Dalam blok MLP SwiGLU, proyeksi down adalah bottleneck residual — keluarannya ditambahkan langsung ke aliran residual yang dibaca oleh setiap lapisan yang lebih dalam. Kesalahan di sini secara langsung merusak apa yang dilihat oleh semua yang berada di hilir.
• gate_proj dan up_proj: presisi dasar. Ini adalah jalur ekspansi dan gating; keluarannya dikalikan per elemen di dalam aktivasi. Kesalahan kecil di sana sebagian diredam oleh gating, sehingga keduanya dapat mentolerir lebar dasar.
• Tidak pernah dikuantisasi, disimpan dalam BF16: 34 lapisan attention linear, pengindeks sparse yang dipelajari, array koneksi-hiper, norma-norma, embed_tokens, lm_head, dan seluruh menara visi. Ini bukan FP8 dalam rilis upstream, dan tetap dalam presisi penuh.
Bit dibulatkan ke atas ke lebar terdekat yang didukung MLX, {2,3,4,5,6,8}. Secara konkret, pada GLM-5.3-Flash — total 320B / 18B aktif, 288 routed ditambah 1 shared expert dengan routing top-8, 45 lapisan — build 4-bit memberikan shared expert 6 bit, setiap down projection 5 bit, serta gate dan up projection 4 bit. Build 6-bit membulatkan down projection ke atas menjadi 8 bit. Ukuran grup adalah 64 untuk build 4- dan 6-bit, 32 untuk build 2- dan 3-bit, dan shared expert selalu menggunakan 64.

Apakah aturan shared-expert sepadan? Pada basis 2-bit, shared expert menempati 4 bit, dan pada basis 6-bit ia menempati 8 — dalam kedua kasus, dua bit tambahan itu memakan memori yang seharusnya bisa digunakan oleh routed expert, dan angka-angka pada model card itu sendiri, yang dibahas di bawah, menunjukkan bahwa trade-off ini terbayar. Ini adalah penalaran yang sama yang membuat build 2bit-lite layak untuk dirilis: expert yang selalu aktif adalah satu-satunya tempat di mana sedikit presisi ekstra memberi manfaat paling besar.
Aturan seleksi: _scale_inv sebagai sinyal sensitivitas bebas
Kebijakan alokasi bit mengasumsikan Anda sudah mengetahui tensor mana yang menjadi kandidat. Memilih kumpulan itu adalah bagian di mana OrcaSAQ paling cerdas, karena aturannya bersifat mekanis dan tidak memerlukan data: sebuah tensor dikuantisasi ulang jika dan hanya jika rilis FP8 menyertainya dengan pendamping _scale_inv.
Mengapa itu berhasil: basis GLM-5.3-Flash hulu adalah FP8 — per blok e4m3, blok 128×128, dengan skema aktivasi dinamis. Kuantisasi FP8 per blok menyimpan skala per blok dan inversnya bersamaan dengan bobot; keberadaan _scale_inv dalam checkpoint adalah penanda persisten bahwa tensor telah melalui jalur kuantisasi hulu. Rilis hulu telah memberi tahu Anda tensor mana yang aman untuk dikuantisasi — tanpa Hessian, tanpa korpus kalibrasi, tanpa forward passes.
Untuk GLM-5.3-Flash, himpunan tersebut adalah lapisan linear MoE dan dense-MLP, ditambah empat proyeksi dari setiap blok deepseek_sparse_attention — q_a_proj, q_b_proj, kv_a_proj_with_mqa, dan o_proj — di seluruh 11 lapisan sparsa pada kedalaman 3, 7, 11 … 43, ditambah blok MTP, 12 × 4 = 48 tensor. Semua hal lain tidak pernah membawa penanda dan tetap BF16: 34 lapisan linear_attention, indekser sparsa, dan menara visi. Lapisan MTP — lapisan 45 — disertakan di dalam bobot terkuantisasi, bukan diekspor sebagai modul terpisah.
Poin yang layak dicuri adalah triknya itu sendiri. Rilis model yang mengkuantisasi bobotnya di hulu telah melakukan sebagian besar pekerjaan dalam menentukan apa yang dapat dikuantisasi; penanda _scale_inv adalah keputusan tersebut, yang diserialisasi ke dalam format berkas. OrcaSAQ membacanya kembali. Itulah yang membuat alur ini deterministik dan dapat ditransfer — model apa pun yang menyertakan bobot FP8 dengan metadata skala dapat ditangani oleh aturan yang sama, tanpa alur data sama sekali.

Jebakannya: konfigurasi per modul, bukan di tingkat atas.
Jika Anda menulis kuantizer MLX sendiri — dan itulah audiens untuk bagian ini — hal paling berguna dalam kartu model adalah peringatan: tingkat atas bits dan group_size dalam config.json tidak cukup.
Secara total, 37.338 tensor dikuantisasi. Penetapan ini dicatat dalam config.json → kuantisasi sebagai override per-modul {group_size, bits} yang kuncinya adalah jalur modul MLX — misalnya model.layers.3.mlp.switch_mlp.down_proj. Karena MLX menggabungkan eksper-eksper hasil routing dari sebuah lapisan menjadi satu switch_mlp, 173 entri mencakup semua 37.338 tensor.
Dan loader membaca entri-entri tersebut pada saat pemuatan. Jika Anda mengkuantisasi seluruh file pada lebar dasar, setiap tensor dengan presisi yang dinaikkan — expert bersama di basis +2, setiap proyeksi turun di basis +1 — akan keluar pada lebar yang salah, dan model dimuat dalam bentuk yang salah. Peta per-modul bukanlah optimasi yang bisa dilewati; itu adalah jalur pemuatan. Saat Anda menulis kuantisator sendiri, hasilkan override untuk setiap tensor yang dinaikkan oleh kebijakan, dan verifikasi terhadap default tingkat atas sebelum Anda merilis.
Apakah kebijakan tersebut membayar untuk dirinya sendiri?
Bukti ini adalah milik kami sendiri, diukur pada satu model: GLM-5.3-Flash, setiap build didekuantisasi dan dijalankan secara identik melalui glm5_next forward sehingga satu-satunya variabel adalah kuantisasinya. Angka-angka di bawah ini berasal dari kartu model, dan itu bukan tolok ukur vendor atau angka pihak ketiga — anggaplah sebagai satu titik data, bukan sebuah hukum.
• Perplexity, dibandingkan dengan referensi FP8 pada 2.7797: 6-bit 2.7864 (+0.24%), 4-bit 2.8620 (+2.96%), 3-bit 3.0566 (+9.96%), 2-bit 4.3622 (+56.9%).
• Kesesuaian token Top-1 dengan referensi, urutan yang sama: 97.76%, 96.13%, 92.06%, 86.56%.
Pembacaan ini persis seperti yang diprediksi kebijakan tersebut. Semuanya, hingga 3-bit, menurun secara perlahan — itulah tanda dari anggaran bit yang dibelanjakan pada tensor yang tepat — dan 2-bit adalah tebing, karena di bawah titik tertentu, peningkatan berbasis peran berhenti menutupi kerusakan tersebut. Pada 4-bit, +2,96% perplexity untuk build yang kira-kira 38% lebih kecil daripada referensi FP8 adalah pertukaran yang benar-benar baik, dan kebijakan yang sama, yang diterapkan lebih agresif, itulah yang membuat build 2bit-lite 102 GB dapat dimuat sama sekali. Para praktisi independen yang melakukan kuantisasi pada basis yang sama melaporkan urutan yang sama — anak tangga teratas mendekati lantai derau, 4-bit nyata tetapi sederhana — dengan angka absolut yang berbeda dari korpus evaluasi yang berbeda.

Apa yang ditransfer ke MoE Anda sendiri?
Penalaran yang dapat digunakan kembali, untuk model yang bukan milik kita:
• Temukan para pakar yang selalu aktif. Apa pun yang terpicu pada setiap token — biasanya pakar bersama atau yang selalu dirutekan — mendapatkan alokasi bit paling besar. Kesalahannya diputar ulang di mana-mana.
• Temukan bottleneck residual.Proyeksi yang menulis ke dalam aliran residual (biasanya proyeksi bawah dari setiap blok MLP) mendapat basis +1. Kesalahan di sana terlihat oleh setiap lapisan yang lebih dalam.
• Biarkan jalur ekspansi dan gating pada nilai dasarnya. Jika sebuah keluaran dikalikan per elemen di dalam sebuah aktivasi, kesalahan kuantisasi di dalamnya sebagian terserap.
• Upstream yang tidak pernah dikuantisasi berarti tidak pernah dikuantisasi oleh Anda. Jika rilis dasar membawa tensor-tensor tersebut dalam presisi penuh, bawalah dalam presisi penuh.
• Gunakan metadata skala dari rilis upstream sebagai aturan seleksi Anda. Jika model dasar mengkuantisasi bobotnya, penanda skala/skala-terbalik yang ditinggalkannya adalah peta gratis tentang apa yang dapat dikuantisasi — tidak perlu pencarian sensitivitas.
• Catat override per modul. Lebar bit global akan membentuk setiap tensor yang dimuat secara salah. Tulis peta jalur modul.
Dan jika Anda dapat memiliki set kalibrasi sama sekali, gunakan untuk mengaudit kebijakan — bukan untuk menggantinya. Jalankan kuantisasi berbasis kalibrasi pada rata-rata bit yang sama dan periksa apakah urutan prior peran sesuai dengan apa yang dikatakan data. Pada model padat atau arsitektur yang benar-benar baru, audit itu adalah perbedaan antara default yang dapat dipertahankan dan tebakan.
Di mana OrcaSAQ adalah pilihan yang salah
Ini adalah bagian yang harus menjaga metode tetap jujur, karena trade-off tanpa kalibrasi itu nyata.
• Ketika batas kualitas mengalahkan kecepatan pipeline, dan Anda memiliki set kalibrasi. Metode bergaya GPTQ atau AWQ beradaptasi dengan statistik aktivasi aktual dari model dan data Anda, dan pada bit rata-rata yang sama, metode tersebut biasanya akan mengalahkan kebijakan berbasis peran yang tetap. Jika Anda mengkuantisasi satu model sekali dan tidak pernah mengkuantisasi ulang, jam ekstra kalibrasi adalah biaya satu kali yang menghasilkan kualitas yang terukur.
• Model dense non-MoE. Prior peran — shared expert, gate/up/down — tidak ada, sehingga kebijakan kehilangan struktur yang membuatnya dapat dipercaya. Anda hanya memiliki "semua yang terkuantisasi di hulu tetap terkuantisasi," yang merupakan klaim yang lebih lemah.
• Model tanpa rilis upstream FP8.Yang disebut _scale_inv adalah aturan seleksi yang tidak memiliki pijakan. Anda harus menentukan himpunan yang dapat dikuantisasi dengan cara lain, dan argumen transferabilitas mekanis runtuh.
• Arsitektur yang benar-benar baru.Asumsi awal justru merupakan asumsi yang mungkin tidak berlaku. Metode berbasis kalibrasi akan mendeteksi tensor rapuh yang terlewatkan oleh kebijakan berbasis peran; OrcaSAQ tidak akan, karena ia tidak pernah melihat.
• Target di bawah 3-bit. Kebijakan itu tidak menyelamatkan Anda. Pada 2-bit, model berada pada +56,9% perplexity terlepas dari ke mana bit ekstra itu pergi; build 2bit-lite ada untuk kecocokan, bukan kualitas.
• Ketika Anda membutuhkan jaminan. Jaminan per-tensor, anggaran pelatihan sadar kuantisasi (QAT), atau kualitas terbaik yang mungkin untuk ukuran tetap tanpa mempertimbangkan biaya pipeline semuanya merupakan wilayah kalibrasi.
Intinya
Kuantisasi sadar-sensitivitas adalah praktiknya; OrcaSAQ adalah salah satu resep deterministik tanpa kalibrasi untuk itu. Pelajaran yang bertahan lama adalah peningkatan expert bersama dan proyeksi-bawah, aturan seleksi _scale_inv yang mekanis, dan konfigurasi per-modul yang benar-benar dibaca oleh loader. Untuk MoE dengan 320 miliar parameter seperti GLM-5.3-Flash, resep tersebut menghasilkan build MLX 4-bit pada +2,96% perplexity — dan repo orcarouter/GLM-5.3-Flash-MLX menyediakan kebijakan yang sama pada 2, 3, 4, dan 6 bit, dengan build 2bit-lite terpisah untuk mesin 128 GB. Panduan GLM-5.3-Flash-MLX kami mencakup build mana yang harus dijalankan di mesin mana, langkah demi langkah.
Jika prioritas Anda adalah mengejar kualitas terakhir pada ukuran tetap dan Anda dapat menyusun korpus kalibrasi, gunakan alat berbasis kalibrasi dan biarkan alat-alat tersebut beradaptasi. Jika prioritas Anda adalah kuantisasi yang dapat direproduksi, cepat, bebas data, dan dapat ditransfer ke arsitektur berikutnya — atau Anda sama sekali tidak ingin membangun pipeline data — kebijakan berbasis peran adalah default yang dapat dipertahankan. Dan jika Anda lebih memilih untuk tidak melakukan kuantisasi sejak awal, presisi penuh GLM-5.3-Flash dilayani melalui OrcaRouter sebagai z-ai/glm-5.3-flash. Pilihan ini tentang seberapa banyak pipeline yang ingin Anda jalankan, bukan tentang apakah kuantisasi berbasis sensitivitas layak dilakukan.
Lebih suka tidak mengkuantisasi apa pun sama sekali? z-ai/glm-5.3-flash adalah model presisi penuh yang dilayani di OrcaRouter dengan harga penyedia, markup 0%.
