
Ulasan Qwen3.8-27B: 27B open-weight yang "Opus di rumah" — diuji terhadap hype
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 juta token · 22 tok/s
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Qwen3.8 27B adalah open-weights 27B terbaik yang bisa Anda self-host saat ini, dan tidak ada yang mendekatinya. Bobotnya dirilis pada 14 Agustus 2026 di bawah Apache 2.0: sebuah 27B padat (28B dengan vision encoder) dengan konteks native 262K, input gambar dan video native, serta skor agentic-coding yang dilaporkan vendor berada di atau di atas Claude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Harga yang paling menonjol adalah nol: unduh 55.6 GB dan jalankan. Catatan peringatannya juga nyata — pengujian independen menunjukkan model ini kira-kira tiga kali lebih lambat dan lebih boros token daripada pendahulunya, semua benchmark di kartu masih dilaporkan oleh Alibaba, dan konteks 1M adalah fitur khusus hosted. Kesimpulan: jika Anda punya GPU 24 GB+ dan menginginkan kemampuan yang mendekati frontier tanpa tagihan yang terukur, self-host — tetapi jalani dengan mengetahui dengan tepat di mana angka-angkanya masih lemah.
Kesimpulan dulu: haruskah Anda menggunakan Qwen3.8 27B?
Jawaban singkat — ya untuk beban kerja lokal dan privat; tunggu angka dari pihak ketiga sebelum keputusan pengadaan. Qwen3.8 27B adalah model langka di mana bobot terbuka adalah produknya dan API adalah kenyamanannya. Karena lisensinya adalah Apache 2.0, harga per-token menjadi nol secara permanen setelah Anda memiliki perangkat kerasnya, dan tidak ada apa pun yang Anda bangun di atasnya yang dapat dilisensikan ulang atau ditagih secara retroaktif. Yang Anda korbankan adalah kecepatan, verifikasi, dan kenyamanan.
Jika Anda sudah menjalankan Qwen3.6-27B dan merasa puas dengannya, peningkatannya nyata tetapi tidak gratis dalam hal waktu riil. Jika Anda datang ke sini dari peluncuran Qwen3.8-Max, ini adalah anggota generasi yang sama yang lebih kecil dan dapat di-host sendiri — alat yang berbeda untuk pekerjaan yang berbeda.
Fakta singkat, diperiksa 15 Agustus 2026
• Dirilis — bobot model mulai tersedia pada 14 Agustus 2026 di Qwen/Qwen3.8-27B di Hugging Face, dicerminkan di ModelScope; peliputan lintas zona waktu juga menyebut 13 Agustus, dan rilis tersebut hadir sekitar seminggu setelah generasi Qwen3.8 diumumkan.
• Lisensi — Apache 2.0: mengunduh, memodifikasi, mendistribusikan ulang, penggunaan komersial, dengan pemberian paten yang eksplisit. Permanen.
• Parameter — 27B dense (28B termasuk encoder visi), 64 lapisan, ukuran tersembunyi 5.120, kosakata 248.320.
• Arsitektur — atensi hibrida: 48 lapisan atensi linear Gated DeltaNet dibandingkan dengan 16 lapisan Gated Attention penuh (rasio 3:1). Inilah sebabnya model padat 27B dapat mendukung 262K token konteks asli.
• Konteks — 262,144 token secara native; dapat diperluas hingga 1,000,000 melalui YaRN pada versi yang dihosting.
• Input — gambar dan video native bersama teks; mengembalikan teks. Jumlah parameter menunjukkan 28B karena encoder visi.
• Thinking — mode penalaran aktif secara default dan dapat dinonaktifkan sesuai permintaan; reasoning_effort (rendah/sedang/tinggi) dan preserve_thinking untuk proses agen yang panjang.
• Bobot — 55,6 GB safetensors BF16 dalam 18 bagian; FP8 dan GGUFs komunitas juga tersedia.
Spesifikasi di atas berasal dari kartu model dan konfigurasi Hugging Face untuk Qwen3.8 27B, yang dibaca hari ini. Klaim tolok ukur tersebut dilaporkan oleh Alibaba; hingga saat ini belum ada laboratorium independen yang mereproduksinya.
Apa yang Qwen3.8 27B benar-benar kuasai
Kasus terkuat adalah agentic software engineering. Alibaba melaporkan lonjakan 3x pada DeepSWE 1.1 dibandingkan 27B sebelumnya (42.2 vs 13.3) dan skor di atas Claude Opus 4.6 Max pada SWE-bench Pro (61.7 vs 53.4). Angka-angka itulah yang membuatnya mendapat julukan "Opus at home" — model 27B yang padat yang melakukan pekerjaan pengodean berdekatan dengan frontier pada perangkat keras yang benar-benar dapat dimiliki seseorang.

Tiga hal selain angka-angka mentah menjadikannya pembelian yang dapat dipertahankan:
• Multimodal native. Gambar dan video masuk, teks keluar — dokumen dengan diagram atau video walkthrough bukanlah model terpisah. Skor penalaran visual (85.6 dengan fitur chain-of-thought diaktifkan, 94.6 matematika visual, keduanya dilaporkan vendor) adalah bukti nilai encoder visi.
• 262K konteks native.Tugas agen jangka panjang, codebase besar, dan transkrip multi-jam muat dalam satu jendela. Desain hybrid linear-attention menjaga biaya KV dari konteks tersebut lebih rendah daripada model full-attention murni dengan ukuran yang sama.
• Bobot gratis dan permanen. Inilah inti kategori ini: model API tertutup disewa; Qwen3.8 27B adalah milik Anda. Pada 4-bit, ia berjalan di kartu 24 GB (kelas RTX 3090/4090), dan AMD memberikan dukungan Day-0 (hingga 24.5 token/s pada Ryzen AI Max+ 395 dan 51.8 token/s pada Radeon AI PRO R9700, menurut blog AMD sendiri).
Bagian di mana ulasan menjadi buruk: kecepatan, token, dan verifikasi
Pengujian independen sejauh ini hanyalah perangkat uji seorang penguji, bukan laboratorium — tetapi itu adalah sinyal terbaik yang kita miliki. Menjalankan Qwen3.8 27B melawan Qwen3.6-27B pada sepuluh tugas dunia nyata (dinilai oleh GPT-5.5 melalui harness llmcompare), model 3.8 memenangkan sembilan dari sepuluh dan mencetak rata-rata 8.838 vs 6.862 — "salah satu peningkatan kecerdasan yang paling mengesankan" yang pernah dilihat penguji. Model ini juga menggunakan hampir tiga kali lebih banyak token dan jauh lebih lambat; satu tugas memakan waktu sekitar 600% lebih lama. Jadi lonjakan kualitas itu nyata, begitu pula harganya dalam waktu yang dibutuhkan.
Empat hal lagi yang memberatkannya:
• Belum ada benchmark pihak ketiga. Setiap angka utama dalam artikel ini dilaporkan oleh Alibaba per 15 Agustus. Kartu vendor memang terperinci, tetapi reproduksi oleh laboratorium independen belum dilakukan. Jika keputusan Anda bergantung pada angka yang terverifikasi, tunggu saja — bobotnya akan tetap ada.
• Batas minimum VRAM itu nyata.BF16 membutuhkan GPU kelas 80 GB. Agar muat di kartu 24 GB, Anda harus menjalankan 4-bit, dan laporan komunitas (utas komentar dev.to, beberapa hari setelah rilis) mengatakan bahwa build terkuantisasi "kehilangan fokus setelah konteks panjang." Gunakan bobot resmi jika Anda memiliki VRAM yang cukup; gunakan yang terkuantisasi jika tidak.
• Konteks 1M hanya tersedia di layanan hosted. Bobot terbuka (open weights) dibatasi hingga 262K. Angka yang dapat diperluas hingga 1M adalah fitur Qwen Cloud yang di-host, bukan sesuatu yang dapat dilakukan salinan lokal secara langsung.
• "Beats Opus" perlu kualifikasi. Benchmark agenik memberi penghargaan pada perilaku spesifik harness, dan komentar teratas pada pos peluncuran dev.to mengatakannya secara blak-blakan: "mereka tidak mengalahkan opus dalam penggunaan dunia nyata." Perlakukan papan skor sebagai batas atas pada hari yang baik, bukan sebuah janji.
Bagaimana posisinya dalam keluarga Qwen 3.8
• vs Qwen3.6-27B — kelas perangkat keras yang sama dan konteks 262K, tetapi lompatan kemampuan yang besar dengan mengorbankan kecepatan dan efisiensi token. Jika Anda sudah menjalankan 3.6 dan terkendala throughput, tetap bertahan adalah hal yang masuk akal.
• vs Qwen3-Coder-30B-A3B— Coder adalah MoE dengan sekitar 3,3 miliar parameter aktif yang berjalan jauh lebih cepat (~90–110 token/detik). 27B yang padat lebih lambat per token tetapi mewarisi keuntungan agentik dari generasi ini; jika skor rekayasa perangkat lunak 27B bertahan dalam pengujian independen, peran Coder-30B menyusut.
• vs Qwen3.8-Max — andalan MoE 2.4T adalah model pusat data (khusus API, sekitar $2/$6 per juta token dalam liputan yang dipublikasikan) dengan konteks 1M dan video. 27B adalah yang dapat disebarkan. Keduanya menjawab pertanyaan yang berbeda.
Biaya: pertanyaan lokal-versus-API, terjawab.
Untuk model tertutup, Anda membandingkan harga per token. Untuk Qwen3.8 27B, biaya token marjinalnya nol di perangkat keras Anda sendiri — harga sebenarnya adalah GPU di muka dan waktu Anda. Pada 4-bit itu adalah kartu 24 GB; pada BF16 itu adalah mesin kelas 80 GB. Jika Anda hanya perlu mengevaluasi model, atau tidak memiliki perangkat keras, ada opsi hosted: OrcaRouter sekarang mencantumkan Qwen3.8 27B dengan tingkatan gratis yang dibatasi lajunya yang menagih $0 dan mengembalikan HTTP 429 setelah melewati batasnya, plus tingkatan berbayar sebesar $0,33 per juta token masukan dan $2,40 per juta token keluaran (diperiksa 15 Agustus). Versi hosted Qwen Cloud, dengan konteks 1M, ditandai sebagai "segera hadir".

Kerangka yang jujur: untuk model open-weights, penyedia hanyalah kemudahan, bukan ketergantungan. Tingkatan gratis adalah cara paling murah untuk memutuskan apakah unduhan 55.6 GB sepadan. Namun setelah Anda memutuskan, bobot itulah yang utama — dan bobot itu gratis.
Cara benar-benar mencobanya
• Evaluasi tercepat — coba tier hosted gratis dengan batas permintaan; jika menjawab apa yang Anda butuhkan, Anda selesai dan tidak mengeluarkan biaya apa pun.
• Uji nyata pada perangkat keras Anda — unduh GGUF komunitas (build Q4_K_M berukuran sekitar 17 GB dan muat di kartu 24 GB) lalu jalankan di llama.cpp atau Ollama. Berikan templat obrolan Jinja, atau model akan menjawab Anda dalam tag pemikiran. Untuk visi dari GGUF, Anda juga memerlukan file mmproj terpisah. Buku panduan kami untuk menjalankan Qwen3.8 27B secara lokal memandu Anda langkah demi langkah.
• Presisi penuh — huggingface-cli download Qwen/Qwen3.8-27B ke GPU kelas 80 GB.
• Verifikasi apa yang Anda unduh — periksa penerbitnya adalah Qwen org dan validasi shard terhadap crc32.txt; repositori tiruan muncul sebelum rilis.
Ketika ulasan ini salah (dan siapa yang seharusnya melewatkan Qwen3.8 27B)
• Anda tidak memiliki GPU dan tidak akan menyewa satu.Tingkat gratis dibatasi lajunya dan tingkat berbayar adalah $0.33/$2.40 per juta — model API kecil mungkin melayani Anda dengan lebih murah dan lebih andal. Model ini untuk orang-orang yang ingin memiliki inferensinya sendiri.
• Anda memerlukan SLA. Tingkat hosting baru berumur beberapa hari; halaman model OrcaRouter, yang dibaca hari ini, menunjukkan tingkat kesalahan 33,3% selama tujuh hari terakhir dan latensi token pertama p50 sebesar 225 ms. Ini adalah model yang masih baru dengan beban awal, bukan kontrak produksi. Para pengguna self-hosting harus mengunci commit unduhan mereka dan menyimpan cadangan.
• Anda memerlukan benchmark terverifikasi untuk keputusan pembelian. Angka yang dilaporkan vendor hanya berguna sebagai indikasi arah, bukan standar pengadaan. Tunggu reproduksi independen.
• Konteks open-weights 262K tidak cukup. Ekstensi 1M saat ini hanya tersedia di versi hosted.
• Throughput adalah hambatan Anda.Ringkasan massal atau batch besar akan merugikan: ini adalah model 27B yang padat dan juga menghabiskan kira-kira 3x token dari pendahulunya. Untuk pekerjaan massal berbiaya rendah, model yang lebih kecil atau lebih cepat lebih unggul.
• Anda menggunakan kartu 12 GB.GGUF 2-bit muat dengan penurunan kualitas yang terlihat; ini bukan model untuk Anda.

Intinya
Qwen3.8 27B adalah 27B open-weights terkuat yang tersedia saat ini, dan gratis selamanya di bawah lisensi Apache 2.0. Jika Anda memiliki GPU 24 GB+ dan menginginkan coding agentic, konteks 262K, serta input gambar/video native tanpa tagihan berbasis pemakaian, inilah pilihan yang tepat. Alasan untuk menunda pun sama konkretnya: Anda memerlukan konfirmasi benchmark independen, SLA, konteks open-weights lebih dari 262K, atau throughput yang lebih tinggi daripada yang diberikan 27B dense. Modelnya sudah rilis, bobotnya nyata, dan angkanya bagus — ingat saja angka siapa itu.
