Kartu judul untuk artikel 'Qwen3.8-27B VRAM Requirements' yang menampilkan chip GPU dengan label memori ~17 GB dan lencana kuantisasi untuk Q4_K_M, Q6_K, dan Q8_0.
Guides & Insights

Kebutuhan VRAM Qwen3.8-27B: Berapa Banyak Perangkat Keras yang Benar-Benar Anda Butuhkan

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sekitar 17 GB VRAM adalah angka yang beredar untuk Qwen3.8-27B — Daniel Han dari Unsloth mengatakan model itu "seharusnya muat dalam sekitar 17GB VRAM saat dirilis" — dan penting untuk memahami dengan tepat apa arti angka tersebut dan apa tidak. Ini adalah proyeksi berdasarkan pendahulu 27B, bukan spesifikasi dari Alibaba, karena modelnya belum dirilis; repositori resmi dijanjikan untuk pekan 10 Agustus 2026 dan belum muncul saat tulisan ini dibuat. Artikel ini mengelompokkan persoalan VRAM menjadi hal yang bisa Anda andalkan, hal yang benar-benar tidak pasti, dan bagaimana angka tersebut berubah seiring dengan kuantisasi, jendela konteks, dan runtime Anda.

Jawaban yang jujur terlebih dahulu.

Belum ada spesifikasi perangkat keras resmi untuk Qwen3.8-27B. Semua yang tercantum di bawah ini merupakan proyeksi dari Qwen3.6-27B, model yang digantikan oleh versi 27B — jumlah parameter yang sama, kemungkinan besar arsitektur hibrida yang sama, dan yang paling mendekati sebagai referensi ukuran. Anggaplah angka-angka tersebut sebagai perkiraan perencanaan, bukan lembar persyaratan. Pengukuran nyata pertama akan datang dari para pengkuantisasi dan pemelihara kerangka kerja inferensi dalam beberapa hari setelah bobot dirilis, dan itulah angka yang harus Anda jadikan acuan untuk pembelian.

Tangga quant

Berapa banyak VRAM yang Anda butuhkan hampir sepenuhnya bergantung pada kuantisasi yang Anda jalankan. Mulai dari tabel Qwen3.6-27B yang diukur komunitas:

• Q4_K_M — sekitar 16 GB VRAM. Titik manis untuk kartu 24 GB, dan kemungkinan asal dari angka "17 GB" tersebut. Default bagi sebagian besar tim.

• Q3_K_M / IQ3 — sekitar 13 GB VRAM. Cocok untuk kartu 16 GB dan bahkan 12 GB, dengan penurunan kualitas yang terlihat jelas.

• Q6_K — sekitar 21 GB VRAM. Hampir tanpa kehilangan, dan muat dengan pas namun realistis pada kartu 24 GB.

• Q8_0 — sekitar 27–30 GB VRAM. Untuk kartu 48 GB jika Anda ingin mendapatkan kualitas hingga tetes terakhir.

• Penyajian FP8 — kira-kira 27 GB VRAM untuk bobot, itulah sebabnya satu L40S menjadi pilihan GPU inferensi yang umum.

• Presisi penuh (BF16) — kira-kira 54 GB VRAM. Realistisnya kartu kelas H100, dan wilayah di mana orang berhenti menyebutnya "lokal."

Singkatnya: GPU 24 GB adalah pembelian yang aman untuk model ini, kartu 16 GB hanya dapat menjalankannya jika Anda menerima kuantisasi rendah, dan semua yang 8 GB atau kurang tidak memungkinkan kecuali modelnya ternyata jauh lebih ramping dari pendahulunya.

An infographic titled 'Qwen3.8-27B - the quant ladder' listing six quantization tiers with VRAM figures: Q3_K_M ~13 GB, Q4_K_M ~16 GB, Q6_K ~21 GB, Q8_0 ~27-30 GB, FP8 serving ~27 GB, BF16 full ~54 GB, with the Q4_K_M row highlighted as the sweet spot for 24 GB cards.

Variabel yang tidak dikutip siapa pun: panjang konteks

Setiap angka di atas berlaku untuk konteks yang moderat. VRAM meningkat seiring bertambahnya konteks karena cache KV harus berada berdampingan dengan bobot. Pada Qwen3.6-27B, konteks 2K berjalan di sekitar 11 GB, konteks 32K mendorong kuant yang sama melewati 14 GB, dan 128K membuat jejak cache lebih dari dua kali lipat. Jika Qwen3.8-27B mempertahankan jendela konteks native yang besar — dan generasi Qwe​n memang cenderung ke arah itu — siapkan ruang cadangan beberapa GB di luar ukuran kuant, atau batasi konteks pada konfigurasi runtime Anda. Memilih panjang konteks yang sebenarnya tidak digunakan adalah cara paling umum tim akhirnya membeli kartu yang lebih besar dari yang mereka butuhkan.

Kartu liar arsitektur hibrida

Qwen3.6-27B adalah model hibrida: hanya 16 dari 65 lapisannya yang menggunakan cache KV tradisional, sementara 48 menggunakan status berulang tetap. Hasilnya adalah memori KV sekitar empat kali lebih kecil daripada model padat dengan ukuran yang sama — yang merupakan sebagian besar alasan mengapa 27B terasa seperti model kartu 24 GB, bukan 48 GB. Jika Qwen3.8-27B mempertahankan desain hibrida (mungkin, tetapi belum dikonfirmasi), perhitungan panjang konteks di atas menjadi lebih bersahabat daripada yang terlihat. Kendalanya adalah dukungan runtime: build llama.cpp atau vLLM yang tidak mengimplementasikan lapisan berulang akan melaporkan penggunaan memori yang jauh lebih tinggi. Periksa runtime mana yang telah menggabungkan dukungan sebelum berasumsi proyeksi tersebut berlaku.

GPU mana yang benar-benar berfungsi?

Secara konkret, untuk kartu-kartu umum:

RTX 4090 / 3090 / 5090 (24 GB) — Q4_K_M dengan nyaman, Q6_K jika Anda mau berkompromi. Ini adalah audiens yang dituju.

• RTX 3060 / 4060 Ti 16 GB — hanya kuantisasi IQ4 atau Q3, dengan konteks yang sederhana. Bisa dipakai, tetapi tidak nyaman.

Kartu 12 GB — Q3_K_M dengan kualitas berkurang. Bagus untuk eksperimen, bukan untuk serving.

• Apple Silicon — Mac 24 GB menjalankan file Q4 yang sama melalui MLX atau llama.cpp; model dasar 16 GB melakukan swap-thrash dan secara efektif gugur, seperti halnya dengan Qwen3.6-27B.

• 48 GB ke atas (A6000, L40S, konfigurasi dua kartu) — penyajian Q8_0 atau FP8 dengan ruang cadangan yang nyata.

An infographic titled 'Context vs VRAM' comparing the same Q4 quant at 2K context (~11 GB) versus 32K context (~14 GB+), with a tip box advising to cap context at what you actually use.

Atau lewati GPU sepenuhnya

Jika hitung-hitungan perangkat keras tidak berhasil untuk Anda, model tidak harus ikut gagal. OrcaRouter adalah satu API untuk lebih dari 200 model — termasuk keluarga Qwe​n — dan ia meneruskan harga daftar penyedia tanpa markup, sehingga Qwen3.8-Max saat ini berharga $2,00 per juta token input dan $6,00 per juta token output, sama seperti di halaman harga vendor itu sendiri. 27B itu sendiri akan menjadi model lokal, tetapi ketika bobotnya dirilis dan ia mendapatkan kepercayaan, kunci yang sama akan merutekan ke penyedia mana pun yang menghostingnya — Anda dapat membangun untuk generasi tersebut sekarang dan tidak perlu menyentuh pasar reseller GPU sama sekali.

OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the NEW FEATURED badge, Vision and Tools capabilities, $2.00 per million input tokens and $6.00 per million output tokens, a p50 time-to-first-token of 4.84 seconds, a 1M-token context window, and OpenAI-compatible API code samples.

Intinya untuk pertanyaan perangkat keras: rencanakan 16 GB untuk menjalankan 4-bit dengan nyaman, 24 GB untuk lebih aman dan memberi ruang cadangan untuk konteks serta kuantisasi yang lebih tinggi, dan anggaplah semua angka di sini bersifat sementara hingga repositori dirilis dan pengukuran nyata pertama muncul. Proyeksi "17 GB" adalah angka perencanaan yang masuk akal — hanya saja belum menjadi fakta.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube