
Qwen3.8-27B dengan Unsloth: Jalankan, Kuantisasi, atau Fine-Tune Secara Lokal
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 juta token · 18 tok/s
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Ya — Unsloth menjalankan Qwen3.8 27B, dan ini adalah cara tercepat untuk mendapatkan model Apache-2.0 baru Alibaba ke GPU Anda sendiri. Seluruh jawaban dalam satu baris: buka Unsloth Studio, cari "Qwen3.8 27B", pilih UD-Q4_K_XL (17.9GB) pada kartu 24GB, dan mengobrol dalam waktu kurang dari satu menit. Di balik klik tersebut, Unsloth merilis tiga hal pada minggu yang sama saat bobot model dirilis (13–14 Agustus 2026): paket unsloth/Qwen3.8-27B-GGUF yang dibangun di atas kuantisasi Unsloth Dynamic V3.0 (preview), dukungan penuh di Unsloth Studio dan Desktop, serta rilis v0.1.800-beta dengan ekspor GGUF, deteksi imatrix, dan peningkatan kecocokan VRAM. Unsloth juga melakukan fine-tuning pada model tersebut — klaimnya adalah pelatihan 2× lebih cepat dengan VRAM 70% lebih hemat. Qwen3.8 27B adalah model visi-bahasa padat dengan 27 miliar parameter yang atensi hibridanya hanya mempertahankan 16 dari 64 lapisan dalam atensi penuh, itulah sebabnya file 4-bit dapat muat di kartu yang tidak dapat memuat kebanyakan model 27B.
Tentang sumber: fakta modelnya resmi, dari kartu model Qwen3.8 27B di Hugging Face, diverifikasi pada 15 Agustus 2026. Dukungan Unsloth, ukuran kuantisasi, kebutuhan VRAM, dan perintah instalasi berasal dari catatan rilis dan dokumentasi Unsloth, pada hari yang sama. Harga API diambil langsung dari katalog OrcaRouter, pada hari yang sama. Klaim Unsloth "2× lebih cepat, VRAM 70% lebih hemat" dan "model terkuat untuk ukurannya" adalah klaim vendor, tidak direproduksi secara independen.
Apa arti "Qwen3.8 + Unsloth": empat hal yang berbeda.
Unsloth adalah empat hal yang terpisah, dan hasil pencarian kata kunci mencampuradukkannya. Mengetahui mana yang Anda butuhkan adalah setengah dari pengaturan:
• unsloth/Qwen3.8-27B-GGUF — file bobot terkuantisasi di Hugging Face, 21 kuant plus proyektor visi. Dibuat dengan Dynamic V3.0 (pratinjau), bukan Dynamic 2.0 yang lebih lama (yang diumumkan pada 24 April 2025 dan mendahului model ini). Ini adalah rute "unduh file", yang dapat digunakan dari build llama.cpp mana pun.
• Unsloth Studio — aplikasi peramban yang Anda pasang atau jalankan dari Hugging Face Space. Cari di hub model, klik sebuah quant, mengobrol dengan alat. Tanpa konfigurasi templat manual atau parameter inferensi.
• Unsloth Desktop — aplikasi GUI lokal untuk macOS, Windows, dan Linux yang membungkus Studio serta pelatihan. Di sinilah penyesuaian halus '2× lebih cepat dengan VRAM 70% lebih sedikit' berada.
• Pustaka Python unsloth — from unsloth import FastLanguageModel, API fine-tuning QLoRA yang digunakan di notebook dan skrip.
Catatan rilis Unsloth untuk v0.1.800-beta, berjudul "Rilis Qwen3.8 27B", menyatakan bahwa Qwen3.8 27B dan Qwen3.8-2.4T-A95B yang berparameter 2,4T "kini dapat dijalankan secara lokal di Unsloth," bahwa 27B "berjalan pada RAM 17GB melalui Unsloth Dynamic GGUFs," dan bahwa "Anda juga dapat melakukan fine-tune Qwen3.8 27B di Unsloth." Rilis yang sama menambahkan kuantisasi NVFP4, memeriksa ruang disk sebelum ekspor GGUF, mendeteksi dukungan imatrix GGUF asli di Studio, dan mempercepat inferensi hingga 10% pada GGUF dengan batas VRAM yang dapat diatur.

Pilih quant-mu berdasarkan VRAM, bukan berdasarkan perasaan.
Tabel memori Unsloth ada di total RAM ditambah VRAM (atau unified memory), dan ini adalah panduan resminya. Qwen3.8 27B 4-bit membutuhkan 17–19GB; RTX 4090 24GB, RTX 5080, atau Mac dengan unified memory 24GB adalah batas realistis untuk pengaturan 4-bit yang nyaman. Tiga pilihan yang mencakup hampir semua orang:
• 12GB → UD-IQ2_XXS pada 9.0GB — satu-satunya file yang muat utuh; perkirakan penurunan kualitas yang terlihat. Buatlah pilihan ini secara sadar.
• 16GB → UD-Q3_K_XL sebesar 13.4GB — file 3-bit terbaik, menurut pemilih Unsloth sendiri.
• 24GB → UD-Q4_K_XL at 17.9GB — file 4-bit yang direkomendasikan dan jawaban default dari artikel ini.
• 48–64GB → UD-Q8_K_XL pada 31.5GB — mendekati lossless pada workstation atau pengaturan GPU ganda.
Tangga lengkap, dari daftar file unsloth/Qwen3.8-27B-GGUF dan dokumentasi Unsloth, keduanya diverifikasi pada 15 Agustus 2026: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. K-quant standar (Q4_K_M 17.1GB, Q8_0 29.0GB) juga ada, dan paketnya menyertakan proyektor visi (mmproj-BF16, 931MB) sehingga gambar dan video berfungsi jika Anda memuatnya. Unsloth menyebut seluruh tangga ini "Dynamic V3.0 (preview)" — lebih baru daripada Dynamic 2.0 yang akan Anda lihat di tulisan-tulisan lama, yang dibuat untuk model-model yang dirilis lebih dari setahun sebelumnya.

Jalankan dengan Unsloth dalam tiga menit
Rute sekali klik: di macOS atau Linux, curl -fsSL https://unsloth.ai/install.sh | sh, lalu unsloth studio -p 8888 dan buka http://127.0.0.1:8888. Di Windows, irm https://unsloth.ai/install.ps1 | iex. Jika Anda ingin tanpa instalasi sama sekali, Studio Unsloth juga dipublikasikan sebagai Hugging Face Space — buka di peramban, cari "Qwen3.8 27B", dan pilih kuantisasi sesuai memori yang Anda miliki. Studio menyetel otomatis parameter sampling dan templat obrolan, membongkar ke RAM saat VRAM menipis, serta mendeteksi pengaturan multi-GPU — bagian "tanpa konfigurasi" itu nyata, dan ini adalah cara tercepat untuk menjalankan model minggu ini.
Pendekatan file-first, jika Anda sudah menggunakan llama.cpp: unduh satu quant dan jalankan langsung. Ini adalah perintah milik Unsloth sendiri, yang telah diverifikasi dengan dokumentasi mereka:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Nilai sampling tersebut adalah pengaturan mode berpikir yang direkomendasikan pada model card. Ganti glob --include dengan *UD-Q3_K_XL* pada kartu 16GB, dan tambahkan --mmproj yang menunjuk ke mmproj-BF16.gguf milik paket jika Anda membutuhkan visi. Satu hal yang perlu diwaspadai: llama.cpp harus berupa build terbaru — file tersebut mendaftarkan arsitektur qwen35 yang baru, dan build apa pun dari sebelum minggu rilis akan menolak untuk memuatnya.
Fine-tune dengan Unsloth
Fine-tuning adalah tempat Unsloth mendapatkan reputasinya: pustaka ini mengklaim pelatihan 2× lebih cepat dengan penggunaan VRAM 70% lebih sedikit dibandingkan Transformers + PEFT standar, yang membuat QLoRA pada model 27B layak dijalankan pada satu kartu grafis konsumen. Titik masuk fine-tuning adalah repositori biasa unsloth/Qwen3.8-27B (halaman berkas safetensors, 28B) dan bukan paket GGUF. Pola QLoRA standar Unsloth, yang diterapkan pada model ini:
dari unsloth impor FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
Lalu loop trl.SFTTrainer standar pada dataset Anda. Cuplikan itu adalah pola QLoRA bawaan dari dokumentasi Unsloth — klaim benchmark pelatihan adalah milik Unsloth sendiri dan bukan sesuatu yang saya reproduksi — dan ada dua catatan: kernel Unsloth menambal lapisan transformer teks, jadi rencanakan untuk menangani encoder visi secara terpisah, dan pertahankan paket unsloth pada rilis saat ini karena arsitektur ini baru berumur beberapa hari dan ketidakcocokan versi akan gagal dengan jelas.
Apa yang Unsloth Studio tangani untuk Anda
{{1}}Menjalankan GGUF secara manual berarti harus menyeimbangkan ukuran konteks, offload RAM, dan pemanggilan alat. Studio mereduksi semua itu menjadi pengaturan default: ia menyesuaikan ukuran konteks berdasarkan memori yang benar-benar tersedia, membongkar model visi yang menganggur untuk membebaskan VRAM bagi obrolan atau pelatihan, mendeteksi tata letak multi-GPU, dan menghubungkan pencarian web, eksekusi kode, serta koneksi agen (Claude Code, Codex, MCP) secara langsung.{{/1}} {{2}}Rilisan v0.1.800-beta juga mengencangkan bagian-bagian yang sering bermasalah dalam praktik: ekspor GGUF kini memeriksa ruang disk sebelum memulai penggabungan panjang alih-alih gagal di tengah jalan, Studio mendeteksi apakah GGUF yang diekspor benar-benar mendukung imatrix (sehingga Anda tidak membuang-buang proses), dan pengawas memori tidak lagi memesan memori GPU secara berlebihan.{{/2}} {{3}}Untuk model yang baru berusia tiga hari, "no-config" benar-benar bekerja nyata.{{/3}}
Lokal gratis vs API berbayar: ekonomi yang jujur
Perbedaan inti antara Unsloth dan API bukanlah soal kualitas — melainkan siapa yang memiliki perangkat kerasnya. Unsloth adalah jalur gratis: biaya marjinal nol per token, tidak ada apa pun yang keluar dari mesin Anda, tanpa batas laju, dan kendali penuh atas bobot (weights). Ini tidak gratis secara absolut: Anda yang menyediakan GPU dan listrik, dan file 2-bit pada kartu 12GB adalah pengalaman yang terkompromi. Qwen3.8 27B bersifat padat dan berkemampuan visi, jadi 4-bit berarti 17,9GB bobot sebelum konteks; mesin itulah harga masuknya.
Rute API ada karena bobotnya berlisensi Apache-2.0, sehingga siapa pun dapat menghostingnya dengan biaya marjinal hampir nol. Qwen3.8 27B ada dalam katalog OrcaRouter hari ini dengan harga $0.33 per juta token input dan $2.40 per juta token output, model yang di-host sendiri di infrastruktur kami — tidak ada harga vendor yang diteruskan — dengan jendela konteks 262K-token serta masukan teks, gambar, dan video. Karena bobotnya terbuka, ada juga tier gratis dengan batas kecepatan yang mengenakan biaya $0 per permintaan. Sebagai gambaran, bulan dengan 10 juta token dengan proporsi input 70% menghabiskan sekitar $9.51 di tier berbayar. Jika Anda sudah memiliki kartu 24GB, pemrosesan lokal lebih unggul dalam biaya; jika tidak, menyewa token dengan tarif tersebut lebih baik daripada membeli kartu untuk proyek sampingan, dan tier gratis adalah cara yang jujur untuk menguji model sebelum Anda berkomitmen pada perangkat keras apa pun.

Ketika Unsloth adalah jawaban yang salah
Unsloth Studio dan paket GGUF adalah pilihan yang tepat untuk satu mesin. Mereka adalah pilihan yang salah ketika:
• Anda memiliki kartu Blackwell RTX 50-series. Kuantisasi unsloth/Qwen3.8-27B-NVFP4 kira-kira 1.5× lebih cepat daripada BF16 pada VRAM yang sama dan menggunakan cache KV FP8 untuk konteks yang lebih panjang. Jalur tersebut berjalan melalui vLLM atau SGLang, bukan GGUF dan bukan Studio.
• Anda memerlukan jendela native 262K penuh atau ekstensi YaRN 1M dalam produksi. Model visi dense pada konteks panjang itu berat; penyesuaian ukuran konteks Unsloth dengan senang hati akan menjalankannya lebih pendek untuk Anda, tetapi tumpukan serving dengan manajemen KV yang tepat mengalahkan aplikasi lokal.
• Anda melayani banyak pengguna. Unsloth adalah aplikasi lokal dan pustaka fine-tuning, bukan server multi-tenant. Untuk konkurensi, autoscaling, dan jaminan uptime, Anda memerlukan endpoint yang di-hosting.
• Anda tidak memiliki GPU sama sekali. Jawaban yang jujur: 27B 2-bit pada kartu 12GB terasa jauh lebih buruk daripada model yang sama yang dijalankan dengan benar. Gunakan tier API gratis terlebih dahulu; jika itu sudah cukup baik, beli perangkat keras saat kasus penggunaannya sudah terbukti.
• Anda ingin melakukan fine-tuning pada sisi visi. Percepatan Unsloth menargetkan lapisan transformer teks; fine-tuning multimodal penuh membutuhkan stack yang berbeda.
Intinya
Qwen3.8 27B dengan Unsloth adalah masalah yang terpecahkan mulai minggu ini: instal Studio, pilih UD-Q4_K_XL untuk kartu 24GB (UD-Q3_K_XL untuk 16GB, UD-IQ2_XXS untuk 12GB), dan model berjalan tanpa konfigurasi dan tanpa tagihan per-token. Jalur fine-tuning itu nyata dan klaim kecepatan Unsloth adalah alasan QLoRA 27B praktis pada satu kartu. Ketahuilah bahwa tangga kuantisasi adalah Dynamic V3.0 (pratinjau), bukan Dynamic 2.0 yang dijelaskan artikel-artikel lama; jaga llama.cpp tetap terbaru; dan jika Anda tidak memiliki perangkat kerasnya, bobot yang sama adalah API seharga $0,33/$2,40 dengan tingkat terbatas gratis — jadi tidak ada alasan untuk menjalankan file 2-bit yang tidak Anda sukai. Lokal adalah rute gratis, dan untuk pertama kalinya di kelas bobot ini, ini juga rute yang mudah.
