Kartu judul untuk artikel Qwen3.8-27B di Ollama ini menampilkan jendela terminal minimal dengan perintah 'ollama run qwen3.8:27b' dan kursor berkedip, tiga lencana bertuliskan 'unduhan 18 GB', 'default Q4_K_M', dan 'konteks 262K', serta keterangan 'gratis untuk dijalankan, perangkat Anda'.
Guides & Insights

Qwen3.8-27B di Ollama: Satu Perintah, Empat Kuantisasi, dan Berapa Sebenarnya Harga "Gratis"

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jalankan dengan satu perintah: ollama run qwen3.8:27b. Itulah keseluruhan jawaban untuk pertanyaan yang dibahas di halaman ini. Qwen3.8 27B — Model padat 27 miliar parameter milik Ali​baba, bobot dirilis pada 14 Agustus 2026 di bawah Apache 2.0 — mulai tersedia di pustaka Ollama minggu ini, dan build bawaan sudah merupakan kuantisasi Q4_K_M 18 GB yang masuk akal (17 GB bobot ditambah encoder visi 931 MB). Model ini berjalan sepenuhnya di GPU 24 GB pada panjang konteks normal, beralih ke CPU bila kartu Anda lebih kecil, dan tidak memungut biaya per token.

Semua yang ada di sini bertanggal 15 Agustus 2026. Spesifikasi berasal dari kartu model Qwen3.8 27B; ukuran unduhan, tag, dan jumlah unduhan berasal dari halaman live pustaka Ollama; angka benchmark dilaporkan oleh Ali​baba dan belum ada replikasi independennya. Model ini dirilis beberapa hari lalu, jadi anggap saja semua yang dapat berubah bersifat sementara.

One-liner yang benar-benar berhasil

Jika Anda sudah menginstal Ollama, Anda hanya berjarak dua kata:

ollama jalankan qwen3.8:27b

Dukungan Ollama hadir di v0.32.12 — catatan rilisnya dengan gamblang berbunyi, "Rilis ini menambahkan dukungan untuk Qwe​n 3.8 27B." Pada peluncuran pertama, program tersebut mengunduh build default (sekitar 18 GB, Q4_K_M), lalu membawa Anda ke REPL obrolan dengan mode berpikir aktif secara default. Halaman pustaka mencantumkan build tersebut dengan tag kemampuan "vision tools thinking 27b", yang memberi tahu Anda bahwa jalur vision dan pemanggilan alat sudah terhubung ke unduhan yang sama. Hingga tulisan ini dibuat, halaman tersebut menunjukkan lebih dari 40.000 unduhan dan daftar tag yang sudah mencakup sebelas varian.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Dua varian yang benar-benar akan Anda pilih:

• ollama run qwen3.8:27b-mlx — varian Apple Silicon, dengan ukuran yang sama 18 GB tetapi dikompilasi untuk Metal; inilah yang secara khusus dioptimalkan oleh catatan rilis Ollama "untuk performa maksimal dan kualitas output yang cocok untuk tugas berulang dan agen coding."

• ollama run qwen3.8:27b-q8_0 — kuantisasi 8-bit 30 GB, untuk saat Anda memiliki VRAM dan menginginkan bobot yang lebih mendekati presisi penuh.

Apa yang sebenarnya Anda unduh

Nama tersebut menyebut 27B, tetapi jumlah parameter penuhnya adalah 28B: model bahasa padat 27.3B ditambah encoder visi 461M yang memberikan input gambar dan video asli. Sisa spesifikasi utama, langsung dari kartu model:

• 64 lapisan, ukuran tersembunyi 5,120, kosakata 248,320.

• Perhatian hibrida: 16 lapisan Gated Attention penuh dan 48 lapisan Gated DeltaNet linear — campuran ramping-linear 3:1, dan alasan sebuah 27B dapat mempertahankan konteks asli 262.144 token (dapat diperluas hingga 1M) tanpa cache KV menghabiskan seluruh pusat data.

• Pemahaman gambar dan video secara native — "dari diagram dan dokumen STEM hingga video berskala jam" adalah ungkapan Ali​baba.

• Apache 2.0. Unduh, ubah, jual produk berdasarkannya. Lisensi itulah fakta hukum yang menjadi sandaran bahasan ekonomi dalam artikel ini.

Referensi presisi penuh adalah BF16, itulah sebabnya tag 56 GB ada; setiap tag yang lebih kecil adalah pertukaran antara presisi dan ukuran, dan benchmark pada kartu model itu sendiri adalah yang Anda korbankan.

Pilih quant, lalu periksa VRAM Anda, bukan sebaliknya.

Ollama memberi Anda sebelas tag, tetapi keputusan tersebut bermuara pada tiga ukuran.

18 GB — Q4_K_M (bawaan). Muat sepenuhnya di kartu 24 GB (kelas RTX 4090 / 5090) pada konteks normal, dan di kartu 16 GB dengan offload CPU sebagian — lebih lambat, tetapi berfungsi. Ini adalah build untuk "langsung menjalankannya."

30 GB — Q8_0. Bobot mendekati presisi penuh, membutuhkan sekitar 40 GB VRAM agar tetap sepenuhnya di-GPU. Pada 27B, Anda seharusnya sudah tahu mengapa Anda menginginkan fidelitas ekstra sebelum membayarnya.

56 GB — BF16. Build referensi. Membutuhkan hardware kelas H100 atau 96 GB. Tidak ada yang menjalankan ini pada GPU konsumen, dan itu tidak masalah.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Angka yang sering menjebak orang adalah cache KV. Unduhan 18 GB tidak berarti VRAM 18 GB cukup untuk sesi konteks 262K — pada konteks panjang, cache menambah beberapa gigabyte di atas bobot, itulah sebabnya kartu 24 GB akan menampung model ini dengan nyaman pada konteks 8K–32K tetapi tidak pada 262K. Pada kartu yang pas-pasan, turunkan konteksnya, bukan kuantisasinya.

Apple Silicon adalah target kelas satu di sini

Catatan rilis v0.32.12 Ollama menyoroti macOS secara khusus. Secara konkret, ollama run qwen3.8:27b-mlx membutuhkan sekitar 18 GB memori terpadu, sehingga Mac dengan RAM 24 GB+ menjalankannya sepenuhnya di GPU dengan ruang lebih untuk konteks. Ada juga tag mxfp8 MLX 32 GB dan tag mlx-bf16 56 GB untuk mesin 64–128 GB. Jika Mac seri-M Anda telah mengikuti kabar model desktop, ini adalah build yang telah Anda tunggu-tunggu.

262K di lembar spesifikasi, lebih sedikit di kursi Anda

Kartu model mencantumkan 262.144 token native, yang dapat diperluas hingga 1M; halaman pustaka Ollama melaporkan jendela yang sama, yaitu 256K. Keduanya benar — 262.144 adalah 256K dikali 1024 — dan tidak ada satu pun yang berarti Anda harus mengetikkan angka itu ke dalam --num-ctx pada kartu 24 GB. Cache KV tumbuh kira-kira secara linear seiring konteks, jadi pada perangkat keras konsumen Anda akan beroperasi di 16K–64K, bukan 262K. Mulailah dengan bawaan Ollama, naikkan --num-ctx hanya ketika tugas benar-benar membutuhkannya, dan ingat bahwa angka 1M memerlukan mekanisme ekstensi plus VRAM untuk menopangnya.

Yang masih goyah — baca ini sebelum Anda bertaruh padanya.

No independent benchmarks yet. Every figure on the model card is Ali​baba's word as of August 15. The claimed gains over Qwen3.6-27B are large — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — and they all read as plausible, and none of them has been reproduced by an outside harness. Do not rest a production decision on them alone.

Stack visi baru berusia beberapa hari. Laporan bug awal (ollama issue #17753) menunjukkan build Q4 mengarahkan input visi melalui parser Qwen3.5 dan gagal pada gambar; bug ini diperbaiki dalam beberapa hari melalui PR #17755, tetapi jalur multimodal pada model yang baru berumur seminggu adalah tempat yang tepat untuk Anda uji sebelum mengandalkannya.

Build bawaan mencakup MTP. Tag q4_K_M juga merupakan build prediksi multi-token — decoding lebih cepat, dan alasan mengapa "18 GB" dan "27B" dapat berdampingan tanpa kontradiksi.

Label kuantisasi dapat menyesatkan di Apple.Tag 18 GB "mlx" dan "nvfp4" berbeda dalam kuantisasi — NVFP4 adalah format FP4 NVIDIA — jadi di Mac lebih baik menggunakan build -mlx biasa kecuali Anda memang membutuhkan varian FP8/FP4 untuk GPU Blackwell.

"Free" sedang melakukan banyak pekerjaan dalam judul itu.

{{1}}Menghosting sendiri model 27B gratis per token{{/1}}, tetapi {{2}}itu tidak gratis{{/2}}. Pembingkaian yang jujur adalah tiga opsi yang memakan biaya dalam mata uang berbeda:

Jalankan sendiri (Ollama). $0 per token, offline, tanpa batas, privat — dan perangkat kerasnya milik Anda. GPU 24 GB atau Mac 18 GB+ adalah pembelian yang nyata, begitu juga dengan listrik dan waktu pengaturannya. Ini adalah keputusan yang tepat ketika Qwen3.8 27B menjadi andalan harian.

Panggil API $0 yang dibatasi kecepatannya. OrcaRouter menyediakan Qwen3.8 27B pada infrastrukturnya sendiri tanpa biaya (ID model qwen/qwen3.8-27b-free, $0 per permintaan, dibatasi kecepatannya) — karena bobotnya terbuka, tidak ada biaya vendor per token yang diteruskan. Ini adalah pilihan yang tepat ketika Anda ingin mencoba model tanpa membeli perangkat keras untuk menguji rilis yang berumur seminggu.

Panggil API tanpa batas.Model yang sama tanpa batas laju adalah $0.33 per juta token input dan $2.40 per juta token output di OrcaRouter (qwen/qwen3.8-27b, konteks 262K, input teks, gambar, dan video). Ini adalah pilihan yang tepat ketika Anda membutuhkan skala produksi dan tidak ingin mengawasi GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Perhitungan yang menentukan di antara keduanya: penggunaan sesekali lebih terbayar pada $0 atau $0,33/$2,40 daripada harga sebuah GPU; penggunaan interaktif harian lebih murah secara lokal; produksi berkelanjutan paling murah sebagai API yang tidak perlu Anda jaga tetap hidup. Kebutuhan privasi dan offline mendorong Anda ke kolom pertama apa pun kata perhitungan.

Saat rekomendasi ini salah

Anda benar-benar membutuhkan konteks 100K+. Model dapat melakukannya; kartu 24 GB Anda tidak bisa. Pada konteks panjang yang sesungguhnya, GPU 40 GB+ atau API berkonteks lebih panjang bukanlah kemewahan.

Anda membutuhkan video dalam produksi hari ini. Jalur visi baru saja diperbaiki bug parser-nya; video produksi pada model multimodal berumur seminggu adalah taruhan yang sebaiknya tidak Anda pasang tanpa cadangan.

Anda menginginkan konkurensi. Satu GPU konsumen melakukan streaming satu atau dua generasi pada satu waktu. Model 27B bukanlah server penyajian.

Anda berada di perangkat keras khusus CPU. Model 27B dengan 4-bit di CPU adalah demonstrasi yang lambat, bukan alat. API adalah pilihan yang jujur sampai Anda memiliki GPU.

Intinya

Qwen3.8 27B di Ollama adalah cara termudah untuk menjalankan 27B generasi saat ini yang pernah dirilis siapa pun: satu perintah, bawaan 18 GB yang muat di kartu 24 GB, build kelas satu untuk Apple Silicon, dan kebebasan Apache 2.0. Kuantisasi yang sebaiknya Anda pilih hampir selalu bawaan Q4_K_M — beralih ke q8_0 hanya jika Anda bisa mengukur perbedaannya. Dan "gratis" itu bersyarat: jika Anda hanya akan menyentuh model sesekali, API berbatas kecepatan $0 lebih bebas daripada membeli perangkat keras; jika itu menjadi penggerak harian Anda, salinan lokal adalah barang termurah yang Anda miliki. Verifikasi angkanya sebelum Anda membangun di atasnya — semua dalam artikel ini benar pada 15 Agustus 2026, dan model ini berubah setiap hari.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube