
Qwen3.8-27B GGUF: Kuantisasi Mana yang Harus Diunduh untuk GPU Anda
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
Unduh paket unsloth/Qwen3.8-27B-GGUF, dan sesuaikan berkasnya dengan kartu yang sebenarnya Anda miliki. Itulah jawaban keseluruhannya: GPU 24GB (RTX 4090 atau 3090) sebaiknya mengambil Q4_K_M sebesar 17.1GB; GPU 16GB sebaiknya mengambil IQ4_XS sebesar 15.7GB (atau Q3_K_M sebesar 13.8GB jika Anda ingin ruang konteks lebih); GPU 12GB terbatas pada berkas 2-bit, UD-IQ2_XXS sebesar 9.0GB, dan itu adalah kompromi yang perlu diambil secara sadar. Qwen3.8 27B — model padat 27 miliar parameter milik Alibaba, bobot Apache 2.0 yang dirilis 13–14 Agustus 2026 — berjalan sangat murah secara lokal karena attention hibridanya hanya meng-cache 16 dari 64 lapisannya, sehingga kuantisasi 4-bit pada GPU 24GB dengan nyaman membawa konteks 32K–64K token. Dan GGUF adalah satu-satunya jalur dengan biaya marjinal nol: tanpa kunci API, tanpa tagihan per token, tanpa data yang meninggalkan mesin Anda.
Mengenai sumber: arsitektur, jendela konteks, dan lisensi bersifat resmi, berasal dari kartu model Qwen3.8 27B di Hugging Face, diverifikasi pada 15 Agustus 2026. Ukuran GGUF berasal dari repositori GGUF unsloth dan ggml-org, pada hari yang sama. Panduan VRAM per-GPU adalah rekomendasi resmi unsloth. Perkiraan byte cache KV dan angka token-per-detik diukur oleh komunitas pada hari-hari pertama setelah rilis, bukan spesifikasi vendor. Setiap tolok ukur yang disebutkan di bawah ini dilaporkan oleh Alibaba dan belum direproduksi.
Pemilih file, satu baris per quant.
• UD-IQ2_XXS — 9.0GB — satu-satunya yang muat dengan nyaman untuk kartu 12GB; bersiaplah untuk penurunan kualitas yang terlihat.
• UD-Q2_K_XL — 10.7GB — kartu 12GB, dengan hampir tidak ada sisa konteks.
• Q3_K_M — 13.8GB — kartu 16GB yang menginginkan ruang konteks ekstra.
• IQ4_XS — 15.7GB — kartu 16GB: kuantisasi terbesar yang muat utuh.
• Q4_K_M — 17.1GB — kartu 24GB: pilihan yang paling pas, dan berkas yang ditunjuk artikel ini.
• Q5_K_M — 19.8GB — 24GB, menukar ruang konteks dengan peningkatan kualitas yang kecil.
• Q6_K — 22.9GB — muat di 24GB jika dipadatkan; hampir lossless.
• Q8_0 — 29.0GB — 32GB, pembagian dua kartu, atau offload ke CPU.
• BF16 — 54.7GB — kartu server dan pengaturan CPU dengan RAM besar; presisi referensi.
Dua paket, dua ukuran Q4_K_M: milik unsloth {{1}}berukuran 17,1GB{{/1}}; milik ggml-org {{2}}berukuran 19,0GB{{/2}}. Paket unsloth menggunakan kuantisasi Dynamic V3.0 (pratinjau) untuk file UD-*-nya dan merupakan paket yang paling sering dipakai default oleh aplikasi lokal; paket ggml-org menyertakan K-quant standar plus head prediksi multi-token terpisah yang digunakan untuk decoding spekulatif. Kedua Q4_K_M sama-sama berfungsi — perbedaannya hanya beberapa ratus megabyte dan file MTP.

Mengapa 27B ini muat di kartu yang lebih kecil dari kebanyakan
Qwen3.8 27B memiliki 64 lapisan, tetapi hanya 16 yang menggunakan attention penuh. 48 lainnya menggunakan Gated DeltaNet linear attention, yang mempertahankan status recurrent berukuran tetap alih-alih cache key-value yang terus bertambah. Tata letak blok pada model card sendiri adalah 3×(Gated DeltaNet → FFN) untuk setiap 1×(Gated Attention → FFN) — rasio hibrida 3:1. Efek praktisnya: cache KV kira-kira seperempat dari apa yang dibutuhkan model 27B dense konvensional untuk konteks yang sama. Pengukuran komunitas minggu ini menempatkan cache sekitar 0,5GB pada konteks 8K, 2,0GB pada 32K, dan 16,4GB pada jendela native penuh 262K. Ini membalikkan saran umum — sebagian besar anggaran VRAM Anda digunakan untuk bobot, bukan konteks, dan kartu 24GB dapat menjalankan Q4_K_M dengan konteks 64K–96K tanpa kesulitan. Anda dapat mengecilkan cache lebih jauh dengan flag --cache-type-k milik llama.cpp, yang mengkuantisasi cache itu sendiri.

Tiga jebakan yang akan menjegalmu di hari pertama
• Build llama.cpp lama menolak file tersebut. GGUF mendaftarkan arsitektur qwen35 yang baru, jadi Anda memerlukan build terkini — apa pun dari sebelum minggu rilis menolak memuatnya dengan kesalahan arsitektur. Perbarui llama.cpp terlebih dahulu, sebelum Anda mengunduh.
• Jebakan template. Template obrolan Jinja resmi membungkus setiap giliran asisten dalam blok think bahkan ketika jejak penalaran kosong, yang menghasilkan blok bersarang dan riwayat terpotong dalam obrolan multi-giliran — seolah-olah model lupa apa yang Anda katakan. Jalankan llama.cpp dengan --jinja, dan pilih paket yang menyertakan chat_template.jinja yang telah dikoreksi.
• Vision membutuhkan file terpisah. Teks langsung berfungsi; gambar dan video tanpa peringatan tidak melakukan apa-apa kecuali Anda juga memuat proyektor mmproj, sekitar 0,9GB. Ini tidak tercantum di halaman repo GGUF unsloth — ambil dari repositori dasar atau paket ggml-org. Jika Anda berencana memberi dokumen atau tangkapan layar, tambahkan --mmproj pada perintah server.
Jalankan: perintah-perintahnya
llama.cpp, setelah Anda memiliki build terkini:
llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0
dan tambahkan --mmproj Qwen3.8-27B-mmproj-bf16.gguf jika Anda membutuhkan visi.
Ollama, jika Anda menginginkan entri pustaka: ollama pull qwen3.8:27b, lalu ollama run qwen3.8:27b. LM Studio dan Unsloth Desktop secara otomatis mendeteksi templat obrolan dan menangani offloading RAM — keduanya adalah jalur paling tidak merepotkan untuk menjalankan pertama kali.
Lokal vs API: Ekonomi yang Jujur
GGUF adalah jalur gratis: biaya marjinal nol, tanpa batas permintaan, tidak ada apa pun yang keluar dari mesin Anda. Ini bukan jalur murah secara absolut — Anda menyediakan GPU 24GB (RTX 3090 bekas atau RTX 4090 baru, plus listrik), dan file 2-bit pada kartu 12GB adalah pengalaman yang terkompromi.
Rute API ini ada karena bobotnya berlisensi Apache 2.0, sehingga biaya marjinal untuk melayani hampir nol dan siapa pun dapat menghostingnya. Qwen3.8 27B telah tersedia di OrcaRouter hari ini dengan harga $0,33 per satu juta token input dan $2,40 per satu juta token output — harga daftar penyedia diteruskan tanpa markup — dan karena bobotnya terbuka, ada juga tingkatan gratis dengan batas kuota yang mengenakan biaya $0 per permintaan dan mengembalikan HTTP 429 saat Anda melebihi batasnya. Sebagai gambaran, bulan dengan 10 juta token dengan 70% porsi input biayanya sekitar $9,51 pada tingkatan berbayar. Jika Anda sudah memiliki GPU, penggunaan lokal lebih hemat biaya; jika tidak, menyewa token lebih baik daripada membeli kartu untuk proyek sampingan.

Saat rekomendasi ini salah
Q4_K_M pada 24GB adalah default, bukan jawaban universal. Pilih yang lain ketika:
• Anda membutuhkan kualitas maksimal pada server atau workstation — Q8_0 pada 29GB atau BF16 pada 54.7GB dengan offload CPU dan RAM, bukan file 4-bit.
• Anda menggunakan kartu Blackwell RTX seri 50 — varian NVFP4 kira-kira 1,5× lebih cepat di VRAM 24GB yang sama dan menggunakan cache KV FP8 untuk konteks yang lebih panjang. Pada 5090, NVFP4 mengungguli semua GGUF pada model ini.
• Anda memerlukan konteks 262K penuh — anggarkan cache sekitar 16GB di luar bobot; itu menurunkan kartu 24GB ke Q3_K_M, atau memaksa kuantisasi KV.
• Anda mengandalkan decoding spekulatif — pilih paket ggml-org, yang mempertahankan kepala prediksi multi-token; beberapa kuantisasi membuangnya untuk menghemat sekitar 0,5GB.
• Anda hanya punya 12GB — sejujurnya: 27B dengan 2-bit terasa jauh lebih buruk daripada model yang sama yang dijalankan dengan benar. Coba dulu tier API gratis sebelum Anda berkomitmen pada pengaturan 2-bit lokal; jika itu cukup baik, GGUF bisa menunggu sampai perangkat kerasnya mumpuni.
Intinya
Qwen3.8 27B adalah 27B langka yang muat di kartu 24GB tanpa kompromi: unduhan Q4_K_M sebesar 17.1GB, build llama.cpp terbaru, dan cache KV yang cukup murah sehingga konteks panjang hampir tidak memakan biaya. Unduh file itu jika Anda memiliki perangkat kerasnya, ingat bahwa visi memerlukan mmproj terpisah, dan perkirakan jebakan templat saat pertama kali percakapan multi-putaran terlihat pelupa. Jika Anda tidak memiliki perangkat kerasnya, model yang sama adalah API $0.33/$2.40 dengan tingkat gratis yang dibatasi, jadi tidak ada alasan untuk menjalankan file 2-bit yang tidak Anda sukai. GGUF adalah jalur gratis; hanya saja bukan satu-satunya jalur lagi.
