Kartu hero yang bertuliskan 'Qwen3.8-27B for Coding' dengan subjudul 'Apa yang diharapkan sebelum bobot dirilis', chip untuk 'sekitar 27B bobot terbuka', 'pengodean agen' dan 'Diumumkan 3 Agustus 2026', dengan logo OrcaRouter di pojok.
Engineering & Research

Qwen3.8-27B untuk Coding: Yang Perlu Diketahui Sebelum Bobot Dirilis

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jika Anda menjalankan model lokal untuk coding, angka yang paling penting dari peluncuran Qwe​n3.8 Alibaba pada 3 Agustus 2026 bukanlah judul utama 2,4 triliun parameter Qwen3.8-Max — melainkan skor FrontierSWE yang melonjak dari 40,7 pada generasi sebelumnya menjadi 73,5 pada generasi ini. Lonjakan itu terjadi pada model unggulan. Model yang mungkin membawa sebagian dari kemampuan itu ke perangkat keras Anda sendiri adalah Qwen3.8-27B, anggota generasi Qwe​n3.8 dengan bobot terbuka sekitar 27 miliar parameter, yang diumumkan pada hari yang sama dan belum dapat diunduh saat tulisan ini dibuat. Ini adalah artikel tentang apa yang kita ketahui sejauh ini, bukan ulasan: belum ada orang di luar lab Alibaba yang menjalankan Qwen3.8-27B, belum ada kartu model resmi, dan unduhan apa pun yang mengklaim sebagai model tersebut saat ini hanyalah placeholder atau unggahan pihak ketiga.

Inilah posisi awal yang jujur bagi siapa pun yang merencanakan pengaturan coding lokal seputar 27B: keunggulan model unggulan tersebut masih dilaporkan oleh vendor sampai pengujian independen muncul, spesifikasi 27B itu sendiri belum dikonfirmasi, dan satu hal yang dapat kita ukur hari ini adalah pendahulunya, Qwen3.6-27B — yang sudah menjadi salah satu model coding lokal terbaik tahun 2026. Itulah garis dasar yang harus dikalahkan oleh generasi ini, dan itu adalah garis dasar yang tinggi.

Mengapa 27B adalah model yang benar-benar dipedulikan oleh para programmer.

Qwen3.8-Max adalah model pusat data: mixture-of-experts dengan 2,4T parameter dan sekitar 95 miliar parameter aktif, konteks 1M-token, dan tanpa jalur bagi konsumen untuk menjalankannya secara lokal. Qwen3.8-27B adalah taruhan sebaliknya — model open-weight kelas ~27B yang dirancang untuk satu GPU, diposisikan sebagai rilis yang dapat di-host sendiri dari generasi ini. Bagi audiens pengembang, 27B adalah produknya. Max adalah bukti bahwa pelatihan generasi ini membuahkan hasil.

Menurut evaluasi Alibaba sendiri, yang dimaksud dengan "sesuatu" itu adalah: Terminal-Bench 2.1 di angka 86.6 (naik dari 74.5 untuk Qwen 3.7 Max), SWE-bench Pro di 67.7, PaperBench di 93.0, dan lompatan FrontierSWE dari 40.7 ke 73.5 yang menandakan perubahan besar dalam coding agen bercakrawala panjang — model yang mengerjakan tugas repositori multi-langkah secara otonom, bukan sekadar menjawab prompt tunggal. Pelacak independen mencatat Qwen3.8-Max pada indeks Coding Artificial Analysis sebesar 71.8 dan indeks Intelligence sebesar 58.1, jadi generasi ini memang nyata bahkan setelah Anda mengesampingkan pemasaran Alibaba. Tidak ada satu pun dari angka-angka tersebut yang berlaku langsung untuk 27B. Namun, justru itulah alasan mengapa 27B menjadi coder lokal paling dinantikan pada paruh kedua tahun 2026: model yang lebih kecil yang mewarisi bahkan sebagian kecil dari peningkatan agen tersebut akan mengubah total makna "coding lokal yang baik" pada skala 27B.

Scoreboard titled 'Qwen3.8-27B for coding - what is known' listing: status announced, weights not yet downloadable; class approx 27B, successor to Qwen3.6-27B; 4-bit VRAM 16-24 GB projected; Terminal-Bench 2.1 (Max) 86.6 vendor-reported; FrontierSWE (Max) 73.5 up from 40.7; independent coding score none yet.

Pendahulunya menetapkan standar: Qwen3.6-27B

Qwen3.6-27B adalah model yang menjadi dasar setiap proyeksi untuk 3.8 27B, karena kelasnya sama dan fisikanya sama. Ini adalah model padat 27B dengan konteks asli 262K, mode berpikir dan non-berpikir ganda, input teks/gambar/video asli, dan lisensi Apache 2.0. Ia mendapatkan reputasinya sebagai pembuat kode lokal bukan dengan memenangkan setiap tolok ukur, tetapi dengan menjadi model terbesar yang masih muat di GPU konsumen dengan kualitas yang dapat digunakan — titik pada kurva ukuran/kualitas di mana Anda berhenti menukar kemampuan dengan perangkat keras.

Itulah jendela konteks pada 3.8-27B: ia harus setidaknya sebaik 3.6-27B dengan biaya perangkat keras yang sama, dan idealnya lebih baik dalam pekerjaan agentik, karena itulah satu-satunya alasan jujur untuk beralih. Jika ia menyamai 3.6 dalam pengkodean mentah dan menambahkan peningkatan agentik dari generasi ini, ia menjadi pilihan lokal default. Jika ia hanya mengulang skor yang sama, peningkatan tersebut marjinal.

Realitas perangkat keras: 16 GB adalah pertanyaan yang salah.

Karena tidak ada spesifikasi resmi, proyeksi VRAM berasal dari pengukuran Qwen3.6-27B, dan ringkasan jujurnya adalah kuantisasi 4-bit adalah permainan 24 GB, bukan 16 GB. Pada Q4_K_M, bobotnya sekitar 16–17 GB, yang terdengar seperti kartu 16 GB muat — sampai cache KV dan overhead model mendorong kebutuhan sebenarnya menjadi sekitar 20–24 GB. Panduan praktis dari tulisan Alibaba Cloud sendiri blak-blakan: Q4_K_M tidak muat di GPU 16 GB dalam penggunaan nyata. Angka dari komunitas berkisar sekitar:

• Q3_K_M — ~13 GB bobot, cocok untuk kartu 12–16 GB dengan kualitas yang lebih rendah

• Q4_K_M — ~16–17 GB bobot, realistisnya 20–24 GB dengan konteks — titik manis RTX 3090/4090

• Q6_K — ~21–22 GB, hampir lossless pada kartu 24 GB

• Q8_0 — ~28,6 GB, membutuhkan 32 GB

• Presisi penuh BF16 — ~54–56 GB, di luar jangkauan GPU konsumen mana pun

{{1}}Unsloth mempratinjau build 4-bit yang berjalan pada sekitar 17 GB{{/1}}, yang konsisten dengan {{2}}model ~27B pada 4-bit{{/2}} — anggap itu sebagai batas bawah untuk beban kerja tanpa konteks yang ramping, bukan sebagai angka produksi Anda. Jika Anda merencanakan perangkat keras, rencanakan di sekitar {{3}}kartu 24 GB{{/3}}.

Toolchain: apa yang tersedia di hari pertama versus minggu kedua.

Saat weights dirilis, dukungan tidak datang sekaligus. Engine serving vLLM dan SGLang biasanya menambahkan dukungan dalam hitungan hari setelah rilis Alibaba, yang merupakan cara para self-hoster mendapatkan endpoint yang kompatibel dengan OpenAI dengan cepat. Kuantisasi GGUF dan AWQ dari komunitas tertinggal satu hingga dua minggu, yang berarti pengalaman 'pull and run' melalui alat berbasis llama.cpp (Ollama, LM Studio) akan tertinggal dari weights mentah — dan jika 27B berbagi arsitektur yang benar-benar baru dengan Max, bukan menggunakan kembali layout 3.6, perkirakan tooling akan memakan waktu lebih lama. Untuk satu atau dua minggu pertama, jalur tercepat adalah vLLM pada weights yang tidak terkuantisasi, bukan pull satu perintah.

Screenshot of the official Qwen Studio blog post 'Qwen3.8-Max: A New Bar for Coding and Cowork', dated 2026/08/03, announcing the Qwen3.8 generation.

Apa yang sebenarnya dapat dilakukan 27B untuk pekerjaan agen

Tetapkan ekspektasi dengan benar: demo otonom 16 hari — Qwe​n3.8 milik Alibaba yang membangun kerangka agen berevolusi-sendiri melalui ratusan commit tanpa intervensi manusia — adalah showcase unggulan. Model 27B tidak akan melakukan itu. Yang terbukti dilakukan dengan baik oleh coder lokal kelas 27B, berdasarkan pengalaman komunitas dengan Qwen3.6-27B dan Qwen3-Coder-30B-A3B:

• Rapikan dan triase tiket, identifikasi akar penyebab, dan siapkan dasar agar model yang lebih kuat dapat menyelesaikannya.

Tangani refaktorisasi skala repositori dan loop pemanggilan alat dengan kecepatan interaktif.

• Jalankan volume coding harian Anda secara lokal — data tetap di mesin Anda, biaya tetap

• Pertahankan tingkat keberhasilan ~50/50 dalam memperbaiki sepenuhnya bug yang benar-benar rumit — cukup baik untuk berguna, tidak cukup andal untuk menjadi satu-satunya agen Anda

27B adalah model volume dengan ekor penilaian. Ia akan sangat baik pada bagian tengah beban kerja Anda yang bervolume tinggi dan salah pada sepuluh persen yang paling sulit. Itu bukan cacat; itu adalah desainnya.

Membangun di sekitarnya: bagi lalu lintas.

Strategi yang paling banyak dipilih tim adalah pemisahan: 27B lokal menangani volume — pembuatan rutin, boilerplate, refactor, perbaikan gaya lint — dan model frontier yang di-hosting menangani bagian sulit di mana beberapa poin kualitas tambahan dapat membenarkan biaya API. Cara yang bersih untuk menjalankan pemisahan ini adalah melalui router, karena kedua sisi gagal pada tingkat yang berbeda dan Anda tidak ingin pipeline agen Anda macet karena kemacetan lokal atau gangguan penyedia.

Itulah alur kerja yang menjadi dasar perancangan OrcaRouter. Qwen3.8-Max sudah live di sana dengan harga sesuai daftar penyedia — $2 per juta token input, $6 per juta token output — diteruskan tanpa markup, jadi ketika Alibaba menurunkan tarif, tagihan Anda langsung turun di hari yang sama. Anda cukup mengarahkan satu endpoint yang kompatibel dengan OpenAI ke titik pembagian tersebut, mengarahkan lalu lintas yang sulit ke Qwen3.8-Max, tetap menggunakan 27B lokal untuk volume setelah bobotnya dirilis, dan membiarkan failover otomatis menangani penyedia yang lambat atau gagal tanpa perubahan kode. Anda mengevaluasi 27B di perangkat keras Anda sendiri sementara jalur produksi Anda tetap berjalan — model yang belum terbukti tidak akan pernah menjadi titik kegagalan tunggal.

Screenshot of the OrcaRouter model page for Qwen3.8 Max showing model ID qwen/qwen3.8-max, $2.00 per 1M input tokens, p50 TTFT 4.84 s, and a code sample.

Apa yang perlu diperiksa pada hari bobot turun

Ketika repositori resmi muncul di Hugging Face atau ModelScope, verifikasi hal-hal berikut sebelum Anda membangun sesuatu di atasnya:

• Repo tersebut ada di organisasi Qwen resmi — bukan mirror atau namesquatter

• File LICENSE benar-benar ada, dan sesuai dengan lisensi yang diklaim oleh catatan rilis.

Kartu model mengungkapkan jendela konteks, arsitektur (dense atau MoE), dan mode berpikir.

• Run independen pertama muncul di Terminal-Bench atau Artificial Analysis — klaim vendor tetap klaim vendor sampai saat itu

• Dukungan GGUF kini tersedia di llama.cpp dan runtime lokal favorit Anda

Pada poin terakhir itu, disiplin dari sebelumnya tetap berlaku: sampai uji coba independen mengonfirmasi peningkatan coding, anggap janji warisan FrontierSWE sebagai alasan untuk menguji, bukan alasan untuk merilis.

Ekspektasinya, dinyatakan secara adil:Qwen3.8-27B adalah rilis model coding lokal paling menjanjikan tahun 2026 di atas kertas — baseline 27B yang terbukti plus peningkatan dari satu generasi pelatihan agentik, dengan biaya perangkat keras yang komunitas sudah terbiasa membayarnya. Apakah ia benar-benar memenuhi harapan bergantung pada apa yang sebenarnya terkandung dalam bobotnya. Pantau repo resmi, baca lisensinya, dan biarkan benchmark independen pertama yang memutuskan. Sampai saat itu, Qwen3.6-27B menjaga posisinya tetap hangat, dan flagship terhosting yang dirutekan menanggung bagian tersulit.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube