
Qwen3.8-27B vs Qwen 3.8: Generasi yang Sama, Satu GPU versus Satu Rak
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Minggu ini Alibaba menempatkan Qwen3.8-27B di jalur inferensi cepat Cerebras — pertama kalinya model dense 27B punya opsi hosted yang benar-benar cepat — dan Artificial Analysis akhirnya mengindeks kedua sisi pertarungan ini. Qwen3.8-27B mencetak skor 34 pada AA Intelligence Index. Qwen 3.8, yang berarti inti terbuka yang dimaksud sebagian besar orang saat menulis nama tanpa sufiks, mencetak skor 40. Kedua angka itu mengatur ulang perbandingan yang pada liputan peluncuran Agustus harus dijalankan sepenuhnya berdasarkan klaim vendor.
Model di balik "Qwen 3.8" sebagai nama mandiri adalah Qwen3.8-2.4T-A95B: bobot mixture-of-experts dengan 2,4 triliun parameter yang diterbitkan Alibaba di bawah lisensi khusus. Qwen3.8-27B adalah anggota dense dari generasi yang sama — sekitar 27 miliar parameter, Apache 2.0, berukuran untuk satu GPU. Keduanya berbagi nama keluarga, panjang konteks native 262K, dan jendela peluncuran. Segala hal lain tentang keduanya adalah studi tentang pertentangan: yang satu dapat Anda miliki, yang lain hanya dapat Anda sewa. Berikut ini untuk apa masing-masing sebenarnya, sekarang setelah keduanya memiliki angka independen.
Generasi yang sama, bentuk yang berlawanan
Qwen3.8-27B adalah model dense — 27B parameter (28B jika menghitung encoder visi), 64 lapisan, tumpukan attention hibrida dari 48 lapisan linear-attention Gated DeltaNet berbanding 16 lapisan full-attention. Hibrida itulah sebabnya model 27B dapat membawa 262.144 token konteks native. Qwen3.8-2.4T-A95B adalah arsitektur unggulan: total 2,4T parameter, sekitar 95B aktif per token, 92 lapisan dengan 512 expert per lapisan, dan 69 dari 92 lapisan tersebut menggunakan linear attention. Trik yang sama, dengan ukuran sembilan puluh kali lipat.
• Arsitektur — Qwen3.8-27B: 27B dense, setiap token menyalakan seluruh bagiannya. Qwen3.8-2.4T-A95B: 2.4T total / ~95B aktif MoE.
• Konteks — keduanya 262K native; ekstensi 1M milik 27B hanya tersedia di hosted, sedangkan 2.4T mencapai ~984K terukur.
• Masukan — Qwen3.8-27B: teks, gambar, dan video. Qwen3.8-2.4T-A95B: hanya teks, mode berpikir terkunci menyala.
• Lisensi — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Lisensi Kustom Qwen3.8-Max.
• Bobot — Qwen3.8-27B: 55,6GB BF16, terkuantisasi menjadi build Q4 ~16GB. Qwen3.8-2.4T-A95B: ~2,4TB BF16, rak GPU, bukan desktop.
• Di mana Anda menemuinya — Qwen3.8-27B: di-host sendiri atau disewa murah. Qwen3.8-2.4T-A95B: disewa, karena tidak ada orang waras yang memiliki rak itu.
Angka independen, akhirnya
Setiap artikel August vs tentang Qwen3.8-27B selalu membawa peringatan yang sama: "belum ada skor independen." Itu tidak lagi benar. Artificial Analysis telah mengukur kedua model tersebut per minggu ini, dan bentuk datanya sungguh menarik.
Pada Intelligence Index, Qwen3.8-2.4T-A95B mencetak skor 40, peringkat ke-4 dari 113 di kelasnya. Qwen3.8-27B mencetak skor 34 — yang menempatkannya di peringkat pertama dari 140 model di kelas ukuran 4–40B dengan bobot terbuka, pencapaian yang benar-benar kuat untuk model dense 27B. Keduanya lambat menurut pengukuran independen: 39,0 token keluaran per detik untuk 27B dan 38,1 untuk 2.4T, dibandingkan median kelas sekitar 90. Keduanya verbose, dengan 27B menghasilkan sekitar 200M token keluaran di seluruh run indeks versus median kelas 68M. Tidak satu pun merupakan model frontier utama; keduanya adalah pekerja keras, dan indeks menyatakan 2.4T adalah pekerja keras yang lebih kuat dengan selisih yang jelas.

Harga di sisi independen menunjukkan hal yang sama dalam dolar. Artificial Analysis menetapkan harga 27B sebesar $0,50 per juta input dan $3,00 per juta output pada build yang dihosting Qwen Cloud (diskon cache 90%), dan 2.4T pada $2,00 / $6,00 (diskon cache 88%). Biaya per tugas Intelligence Index: $0,82 untuk 27B dibandingkan dengan $2,16 untuk 2.4T. Model yang lebih kecil lebih murah untuk dijalankan per unit kecerdasan — dan keduanya mahal relatif terhadap kelas kecepatannya karena keduanya adalah model penalaran yang membakar token output.
Semua hal lainnya — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 untuk 27B; 86.6 Terminal-Bench 2.1 dan 67.7 SWE-bench Pro milik 2.4T — tetap hanya dilaporkan vendor, tidak direproduksi, dan dilabeli demikian di sepanjang tulisan ini. Indeks AA di atas adalah batas bawah independen di bawah semua itu.
Apa yang diubah oleh pencatatan saham Cerebras
Pada 12 September 2026, akun Qwen mengumumkan bahwa Qwen3.8-27B kini berjalan di Cerebras, dengan entri katalognya tayang di bawah spanduk "Qwen 3.8 27B kini tersedia di Cerebras PayGo." Cerebras mencantumkannya pada $0,99 per juta token masukan dan $1,49 per juta token keluaran di perangkat keras kelas WSE yang membuat nama perusahaan itu tenar dalam hal kecepatan. Itu memberi 27B sesuatu yang belum pernah dimiliki inti 2.4T: jalur cepat.

Ini penting karena lambat-dan-bertele-tele adalah satu-satunya kelemahan nyata pada 27B sejak awal. Pada harness independen, model ini mencapai 39 t/s; pada telemetri penyajian kami sendiri, model ini menghasilkan sekitar 154 token keluaran per detik dengan latensi token pertama p50 sebesar 4,48 dtk — dan kini penyedia kedua bersaing pada sumbu yang sama. Sebaliknya, 2.4T sama sekali tidak memiliki jalur cepat: pada 38 t/s, Anda membayar harga frontier untuk kecepatan kelas menengah, dan satu-satunya cara untuk mengatasinya adalah klaster GPU sewaan yang menjalankan bobot terbuka sendiri.
Tiga lajur untuk 27B, satu untuk 2.4T
Per hari ini, dense 27B dapat disewa dengan tiga cara, dan selisih harganya layak dibaca sebelum Anda memilih:
• Jalur self-hosted — Qwen3.8-27B sudah aktif di OrcaRouter dengan harga $0,33 / $2,40 per juta, dijalankan di infrastruktur kami sendiri. Input termurah di pasar untuk model ini, output ~154 tok/s, konteks 262K.
• Jalur vendor — build terhosting Qwen Cloud, $0.50 / $3.00 per juta dengan konteks 1M token dan diskon cache 90%.
• Jalur cepat — Cerebras PayGo, $0,99 / $1,49 per juta, diposisikan pada kecepatan, bukan harga.

Open core 2.4T tidak memiliki spread yang setara. API unggulan yang melayani arsitektur yang sama — Qwen3.8-Max — adalah $2,00 / $6,00 per juta, dan itulah angka yang melekat baik Anda menyebutnya Max maupun open core. Jalankan bobotnya sebagai gantinya dan ekonominya beralih ke perangkat keras: 2.4T membutuhkan ~2,4TB bobot BF16 dan node multi-GPU, keputusan modal yang tidak diambil sembarangan. GPU 24GB menjalankan build Q4 milik 27B dengan biaya marginal yang dibulatkan menjadi nol.
Contoh perhitungan yang menentukan sebagian besar tim: 100 juta token input dan 20 juta token output per hari. Dengan tarif $2/$6 milik 2.4T, itu sekitar $320 per hari, ~$117.000 per tahun. Pada 27B dengan tarif $0,33/$2,40 kami, biayanya sekitar $81 per hari — dan pada salinan yang di-host sendiri, biayanya adalah harga listrik. 2.4T memberi Anda keunggulan kualitas yang nyata, AA 40 versus 34. Apakah keunggulan itu sepadan dengan tagihan bulanan lima digit — itulah keseluruhan pertanyaan yang diajukan pasangan ini.
Di mana mereka benar-benar berbeda
Selain indeks, tiga perbedaan praktis menentukan mana yang cocok untuk beban kerja tertentu.
Input multimodal adalah filter paling bersih. Qwen3.8-27B membaca teks, gambar, dan video — tangkapan layar, bagan, dokumen dengan gambar, bingkai video semuanya masuk ke jendela 262K yang sama. Qwen3.8-2.4T-A95B secara agresif hanya teks. Jika input Anda mencakup apa pun yang visual, 2.4T didiskualifikasi terlepas dari indeksnya yang lebih tinggi.
Kontrol berpikir adalah yang kedua. Mode penalaran 27B dapat dinonaktifkan per permintaan, yang penting untuk ekstraksi yang sensitif terhadap latensi di mana rantai pemikiran hanyalah overhead; ini juga mengekspos reasoning_effort. Inti 2.4T tidak dapat mematikan pemikiran — setiap respons dibuka dengan blok think>, dan Anda membayar token tersebut entah Anda menginginkannya atau tidak. API unggulan memperbaiki ini, tetapi inti terbuka tidak.
Lisensi berada di urutan ketiga, dan diam-diam penting pada skala besar. Apache 2.0 pada 27B adalah standar permisif: memodifikasi, mendistribusikan ulang, mengomersialkan, termasuk pemberian paten. 2.4T dirilis di bawah lisensi Qwen3.8-Max khusus — secara semangat permisif, tetapi ini adalah ketentuan Alibaba, bukan standar komunitas, dan ada baiknya membaca file tersebut sebelum Anda membangun produk di atasnya.
Merutekan keputusan
Kedua sisi pertarungan ini dapat dijangkau melalui satu kunci OrcaRouter, yang membuat pertanyaan "mana yang harus saya pilih" murah untuk dijawab secara empiris.Qwen3.8-27B sudah live sebagai qwen/qwen3.8-27b dengan harga daftar penyedia tanpa markup, dan API unggulan yang dibangun di atas inti 2.4T yang sama sudah live sebagai qwen/qwen3.8-max dengan $2.00 / $6.00 per juta — tarif Alibaba sendiri, diteruskan langsung, jadi setiap perubahan harga vendor langsung live di sini pada hari yang sama.
Arsitektur 2.4T yang sama sebagai bobot yang dapat diunduh bukanlah sesuatu yang kami layani — jika Anda menginginkan inti terbuka melalui API hari ini, jalur unggulan adalah cara praktis untuk mencapainya, dan qwen/qwen3.8 sudah terpasang untuk diaktifkan begitu ada penyedia yang menyajikan bobot terbuka tersebut. Aturan perutean yang mengirimkan lalu lintas visual dan sensitif latensi ke qwen/qwen3.8-27b serta ekor penalaran berat ke qwen/qwen3.8-max tidak memerlukan biaya apa pun untuk disiapkan dan otomatis beralih antar penyedia jika terjadi kegagalan. Satu kunci, tanpa kontrak kedua, dan pemisahan itu hanyalah perubahan konfigurasi, bukan arsitektur ulang — cara termurah untuk menguji apakah enam poin indeks tambahan milik 2.4T sepadan dengan $5,67 per juta token keluaran bagi Anda.
Siapa yang harus memilih yang mana
• Pilih Qwen3.8-27B jika input Anda menyertakan gambar atau video, jika Anda menginginkan kemampuan berpikir yang bisa dimatikan, jika Anda memiliki GPU 24GB atau berencana memilikinya, atau jika pengeluaran per token Anda cukup besar sehingga $0.33/$2.40 versus $2.00/$6.00 menjadi seluruh dasar argumennya.
• Pilih Qwen 3.8 (inti 2.4T) jika Anda hanya untuk teks, Anda menginginkan skor penalaran independen terkuat di keluarga ini (AA 40), dan tarif $2/$6 — atau biaya menjalankan node GPU — masih nyaman di dalam anggaran Anda.
• Pilih keduanya jika lalu lintas Anda mencakup kedua profil tersebut: rutekan melalui gateway, biarkan router memisahkannya berdasarkan modalitas dan tingkat kesulitan, lalu ubah pikiran Anda saat checkpoint atau harga berikutnya dari salah satu model tersedia.
Putusan
Nama Qwen 3.8 selalu merupakan dua produk yang berpura-pura menjadi satu keluarga, dan sekarang keduanya punya angka independen masing-masing untuk diperdebatkan. Qwen3.8-2.4T-A95B adalah otak yang lebih kuat, hanya teks, mahal, dan tak dapat disangkal menguntungkan pada $2/$6. Qwen3.8-27B adalah yang dapat diterapkan — multimodal, Apache 2.0, dapat di-host sendiri, dan sejak minggu ini akhirnya juga punya jalur cepat. Selisih indeksnya nyata: 40 berbanding 34. Begitu pula selisih harganya: sekitar lima kali biaya per token saat Anda menjalankan 2.4T sebagai API. Bagi sebagian besar tim, keputusannya bukan tentang enam poin indeks. Ini tentang apakah Anda membeli token atau membeli perangkat keras — dan 27B adalah satu-satunya dari keduanya yang memungkinkan Anda membeli perangkat keras.
