
Qwen3.8-27B dengan MLX di Apple Silicon: Ya, Ini Berjalan — Inilah yang Sebenarnya Anda Butuhkan
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 juta token · 22 tok/s
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Qwen3.8 27B berjalan di Apple Silicon saat ini melalui MLX. Tag-nya adalah qwen3.8:27b-mlx di Ollama, ditambahkan dalam Ollama v0.32.12, dan build 4-bit diunduh sekitar 18 GB serta membutuhkan sekitar 16–19 GB memori terpadu — yang menjadikan Mac 24 GB+ sebagai batas realistis dan Mac 16 GB sebagai pilihan yang tidak layak. Bobotnya berlisensi Apache 2.0, gratis saat digunakan pada perangkat keras yang Anda miliki, yang merupakan inti dari model ini. Rilis Alibaba baru berumur dua hari (13–14 Agustus 2026), jadi setiap angka di bawah ini diberi label: apa yang berasal dari kartu model Alibaba, apa yang kami verifikasi di halaman Ollama hari ini, dan apa yang merupakan proyeksi atau pengukuran pihak ketiga.
Lembar fakta 30 detik
Qwen3.8 27B adalah model dense Alibaba dengan 27 miliar parameter, dirilis pada 13–14 Agustus 2026 di bawah Apache 2.0 — bobotnya tiba di Hugging Face dan ModelScope pada tanggal 13, dengan file LICENSE muncul keesokan paginya. Model ini adalah saudara dense yang dapat digunakan dari Qwen3.8-Max dengan 2,4T parameter. Dari kartu model, semua yang dilaporkan Alibaba dan belum direproduksi secara independen:
• Ukuran — 27B dense, 27,78B total parameter termasuk encoder visi.
• Arsitektur — 64 lapisan, ukuran tersembunyi 5.120, kosakata 248.320.
• Atensi hibrida — 16 lapisan atensi penuh ditambah 48 lapisan linear Gated DeltaNet, rasio 3:1.
• Konteks — 262,144 token native, dapat diperluas hingga 1M melalui YaRN (Ollama mencantumkan tag pada 256K).
• Input — pemahaman gambar dan video secara native selain teks, dari dokumen hingga video berdurasi jam.
• Bobot — 55.6 GB dalam BF16, termasuk kepala dekoding spekulatif MTP.

Di sisi MLX, terverifikasi hari ini: Ollama merilis qwen3.8:27b-mlx — build asli MLX untuk Apple Silicon dengan unduhan 4-bit ~18 GB — dan catatan rilis v0.32.12 menyoroti optimasi Apple Silicon. mlx-lm, perangkat Python milik Apple, mendukung arsitektur tersebut untuk generasi dan konversi, serta kuantisasi MLX (3/5/6-bit, plus MXFP4 dan NVFP4) muncul dalam hitungan jam setelah bobotnya dirilis. Bagian selanjutnya dari artikel ini mengasumsikan Mac seri-M dengan memori terpadu 24 GB atau lebih.
Apa yang MLX ubah tentang memori
Pada Apple Silicon tidak ada VRAM terpisah. MLX berjalan pada kumpulan memori terpadu seri M, jadi angka yang penting adalah total RAM di Mac Anda dikurangi dengan apa yang digunakan macOS dan hal lainnya. Model yang "muat dalam 17 GB" membutuhkan mesin yang memiliki kapasitas lebih dari itu dengan nyaman.
Kabar baiknya adalah Qwen3.8 27B lebih murah untuk disimpan daripada yang disarankan oleh jumlah parameternya. Karena hanya 16 lapisan full-attention yang menyimpan cache KV — 48 lapisan linear tidak — biaya cache sekitar 64 KB per token, kira-kira seperempat dari yang dibayarkan model padat konvensional dengan 64 lapisan. Pada sisi ekstrem, jendela penuh 262K membutuhkan ~16,4 GB cache di samping bobot, yang merupakan anggaran server, bukan anggaran laptop.
Tangga realistis untuk Mac, ukuran file ditambah ruang cadangan cache:
• 4-bit MLX — Totalnya ~16–19 GB. Cocok untuk Mac 24 GB dengan jendela konteks sekitar 64K–96K; pilihan default yang masuk akal.
• 6-bit MLX — ~21–22 GB. Mesin 32 GB; peningkatan kualitas dibanding 4-bit hanya sedikit.
• 8-bit MLX — ~27–30 GB. Mesin 48 GB+; hampir lossless.
• BF16 — ~55,6 GB. Hanya mesin studio M-series Max dan Ultra kelas atas.

Sumber: angka 4-bit mengacu pada GGUF Q4_K_M terukur (17.1 GB, unsloth, 14 Agustus) dan unduhan Ollama 18 GB; angka 8-bit dan BF16 mengacu pada kartu BF16 milik Alibaba dan lini Qwen3.6-27B. Angka cache 64 KB per token berasal dari arsitektur, bukan tercetak di lembar spesifikasi, dan hanya berlaku untuk runtime yang melewati cache KV pada lapisan linear seperti yang dilakukan MLX.
Tiga cara untuk menjalankannya, dari yang paling sederhana hingga yang paling terkontrol.
Jalur A — Ollama, yang paling sederhana
Tingkatkan ke Ollama 0.32.12 atau lebih baru, lalu:
• ollama pull qwen3.8:27b-mlx — mengunduh build MLX ~18 GB.
• ollama run qwen3.8:27b-mlx — obrolan interaktif dengan templat pemikiran yang terhubung.
• ollama serve — mengekspos API yang kompatibel dengan OpenAI di localhost:11434 untuk aplikasi Anda.

Satu cacat yang diketahui, dari isu GitHub langsung pada saat penulisan ini: qwen3.8:27b-mlx menolak peran "developer" pada endpoint /v1/responses, yang membuat ollama launch codex gagal untuk model ini — sementara ollama run langsung berfungsi dengan baik. Jika Anda membangun loop agen bergaya Codex pada build MLX, uji endpoint yang persis akan Anda gunakan sebelum mempertaruhkan loop tersebut padanya.
Jalur B — mlx-lm, dengan kontrol paling banyak
Toolkit milik Apple sendiri. Instal dengan pip install mlx-lm, lalu tarik checkpoint MLX pra-kuantisasi atau konversi sendiri bobot BF16 resminya:
• mlx_lm.generate --model <checkpoint> — jalankan checkpoint secara langsung; kuantisasi 4-bit dan 8-bit komunitas untuk 27B masih hadir di mlx-community dalam hitungan hari setelah rilis.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — konversi sekali; biayanya sekitar satu unduhan.
• mlx_lm.server --model <checkpoint> — server yang kompatibel dengan OpenAI dan menerapkan template chat thinking-block untuk Anda.
Jika kuantisasi yang Anda inginkan belum tersedia, mengonversi dari bobot resmi adalah pekerjaan singkat di Mac seri-M mana pun dan menghilangkan keraguan tentang apa yang dikirim pihak ketiga.
Jalur C — LM Studio, sekali klik
LM Studio menggunakan backend MLX di Apple Silicon dan langsung mendukung Qwen3.8 27B saat dirilis: cari modelnya, pilih kuantisasi yang sesuai dengan RAM Anda, dan model tersebut akan terunduh serta langsung berjalan. Jika Anda lebih suka GUI, ini jalur yang paling ramah pengguna, dan panduan pendamping kami membahasnya dari awal hingga akhir — lihat "How to Run Qwen3.8 27B Locally" di bacaan terkait di bawah ini.
Perangkap template
Qwen3.8 27B berpikir secara default, dan blok think dirender oleh template chat, bukan inti model. Pengujian pihak ketiga dari 48 jam pertama mencatat bahwa template resmi membungkus setiap giliran asisten dalam blok think — bahkan yang kosong — dan bahwa dalam loop agen multi-giliran blok-blok tersebut bersarang dan riwayatnya terpotong, yang terasa seperti amnesia. Ini bukan masalah kuantisasi. Jika sebuah runtime menyertakan template yang telah dikoreksi, gunakanlah; ketika Anda membangun loop agen dan tidak membutuhkan penalaran, nonaktifkan thinking per permintaan — template chat mengekspos flag enable_thinking, dan model menerima reasoning_effortxhigh, medium, atau low.
Seperti apa rasanya sebenarnya
Uji independen pada Mac mini M4 dengan memori terpadu 32 GB, menjalankan build MLX 4-bit, mengukur kecepatan generasi sekitar 5–6 token/detik. Angka itulah yang seharusnya menjadi patokan: bagus untuk penyusunan draf interaktif, penalaran jangka panjang, dan panggilan agen sesekali; menyakitkan untuk siklus agen yang panjang dan pekerjaan batch. Anekdot penguji yang sama — pemikiran selama beberapa menit diikuti oleh aplikasi kecil yang tampak benar tetapi sebenarnya tidak masuk akal — adalah pengingat yang baik bahwa 27B di laptop adalah asisten yang cakap tetapi tidak sempurna.
Kecepatan mengikuti tingkatan chip: M-series Max dengan bandwidth memori dan jumlah inti lebih banyak berjalan jauh lebih cepat daripada M4 dasar di mini. Namun, 5–6 tok/s di titik masuk adalah patokan yang jujur, dan Anda sebaiknya menilai setiap berita utama "berjalan di Apple Silicon" berdasarkan angka tersebut.
Konteks 262K adalah fitur server
Jendela 262K bawaan Qwen3.8 27B benar-benar berguna — tetapi di Mac, ia dibatasi oleh memori, bukan oleh modelnya. Dengan cache KV 64 KB per token, jendela 8K membutuhkan sekitar 0,5 GB, 32K sekitar 2 GB, 128K sekitar 8 GB, dan 262K penuh sekitar 16,4 GB di luar bobotnya. Pada mesin 24 GB yang berjalan dengan 4-bit, batas realistisnya kira-kira 64K–96K token; mencapai 128K+ berarti membutuhkan mesin 32 GB+, dan jendela penuh berarti mesin yang memori terpadunya sebagian besar adalah cache. Rencanakan konteks yang benar-benar Anda butuhkan dan batasi dalam konfigurasi runtime — modelnya akan senang, dan file swap Anda tetap tenang.
Ketika Apple Silicon adalah jawaban yang salah
Ambil jalur berbeda jika salah satu dari ini adalah beban kerja Anda:
• Anda memiliki Mac 8 GB atau 16 GB. Build 4-bit sudah membutuhkan memori terpadu ~17 GB; kurang dari itu akan terjadi swapping dan model menjadi tidak bisa digunakan. Ini adalah kesalahan paling umum, dan tidak ada trik kuantisasi yang dapat memperbaikinya.
• Anda memerlukan jendela konteks 262K penuh atau ekstensi YaRN 1M. Anggaran KV tersebut adalah anggaran server, bukan anggaran laptop.
Anda melayani orang lain. Laptop adalah satu kursi; throughput multi-pengguna membutuhkan kotak GPU atau API yang di-hosting.
• Anda perlu bergerak cepat pada loop agen yang panjang. 5–6 tok/s cukup untuk manusia yang membaca sambil lalu, lambat untuk sub-agen.
Penjelasan yang jujur: daya tarik Qwen3.8 27B adalah gratis saat digunakan pada perangkat keras milik Anda sendiri — kebalikan dari model API yang mengenakan biaya per token. Justru itulah mengapa model ini tidak ada dalam katalog OrcaRouter (katalog tersebut merutekan generasi Qwen3.6/3.5-27B sebelumnya dan lini API Qwen yang dihosting). Kami adalah alat yang salah untuk cerita lokal-gratis, dan justru itu intinya: ketika beban kerja melampaui kapasitas Mac, alternatifnya adalah kotak GPU, GPU sewaan, atau API Qwen yang dihosting — bukan router yang kebetulan membawa 27B spesifik ini.
Intinya
Qwen3.8 27B di Apple Silicon itu nyata, bagus, dan cakupannya sempit. Build MLX 4-bit cocok untuk Mac 24 GB+, diunduh sebagai qwen3.8:27b-mlx di Ollama, tidak memungut biaya per token, dan merupakan model terbuka kelas agen pertama yang benar-benar dapat digunakan dan muat di laptop. Trade-off-nya adalah kecepatan (5–6 tok/s di M4 mini) dan konteks (batasi jauh di bawah 262K kecuali Anda punya RAM yang cukup). Jika Anda memiliki Mac 24 GB+ dan beban kerja yang bisa ditangani 27B, ini adalah model lokal gratis terbaik yang tersedia minggu ini. Jika Anda memiliki Mac 16 GB atau membutuhkan throughput produksi, ini bukan pilihan — dan alternatifnya adalah jalur berbayar, yang merupakan keputusan yang berbeda sama sekali.
