Kartu judul hero untuk pertarungan Qwen3.8-27B vs Qwen 3.8, menampilkan dua kartu chip membulat — model dense 27B dengan konteks 262K dan lisensi Apache 2.0 melawan inti MoE 2.4T / 95B-aktif dengan lisensi khusus — serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Qwen3.8-27B vs Qwen 3.8: Generasi yang Sama, Satu GPU versus Satu Rak

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Minggu ini Alibaba menempatkan Qwen3.8-27B di jalur inferensi cepat Cerebras — pertama kalinya model dense 27B punya opsi hosted yang benar-benar cepat — dan Artificial Analysis akhirnya mengindeks kedua sisi pertarungan ini. Qwen3.8-27B mencetak skor 34 pada AA Intelligence Index. Qwen 3.8, yang berarti inti terbuka yang dimaksud sebagian besar orang saat menulis nama tanpa sufiks, mencetak skor 40. Kedua angka itu mengatur ulang perbandingan yang pada liputan peluncuran Agustus harus dijalankan sepenuhnya berdasarkan klaim vendor.

Model di balik "Qwen 3.8" sebagai nama mandiri adalah Qwen3.8-2.4T-A95B: bobot mixture-of-experts dengan 2,4 triliun parameter yang diterbitkan Alibaba di bawah lisensi khusus. Qwen3.8-27B adalah anggota dense dari generasi yang sama — sekitar 27 miliar parameter, Apache 2.0, berukuran untuk satu GPU. Keduanya berbagi nama keluarga, panjang konteks native 262K, dan jendela peluncuran. Segala hal lain tentang keduanya adalah studi tentang pertentangan: yang satu dapat Anda miliki, yang lain hanya dapat Anda sewa. Berikut ini untuk apa masing-masing sebenarnya, sekarang setelah keduanya memiliki angka independen.

Generasi yang sama, bentuk yang berlawanan

Qwen3.8-27B adalah model dense — 27B parameter (28B jika menghitung encoder visi), 64 lapisan, tumpukan attention hibrida dari 48 lapisan linear-attention Gated DeltaNet berbanding 16 lapisan full-attention. Hibrida itulah sebabnya model 27B dapat membawa 262.144 token konteks native. Qwen3.8-2.4T-A95B adalah arsitektur unggulan: total 2,4T parameter, sekitar 95B aktif per token, 92 lapisan dengan 512 expert per lapisan, dan 69 dari 92 lapisan tersebut menggunakan linear attention. Trik yang sama, dengan ukuran sembilan puluh kali lipat.

• Arsitektur — Qwen3.8-27B: 27B dense, setiap token menyalakan seluruh bagiannya. Qwen3.8-2.4T-A95B: 2.4T total / ~95B aktif MoE.

• Konteks — keduanya 262K native; ekstensi 1M milik 27B hanya tersedia di hosted, sedangkan 2.4T mencapai ~984K terukur.

• Masukan — Qwen3.8-27B: teks, gambar, dan video. Qwen3.8-2.4T-A95B: hanya teks, mode berpikir terkunci menyala.

• Lisensi — Qwen3.8-27B: Apache 2.0. Qwen3.8-2.4T-A95B: Lisensi Kustom Qwen3.8-Max.

• Bobot — Qwen3.8-27B: 55,6GB BF16, terkuantisasi menjadi build Q4 ~16GB. Qwen3.8-2.4T-A95B: ~2,4TB BF16, rak GPU, bukan desktop.

• Di mana Anda menemuinya — Qwen3.8-27B: di-host sendiri atau disewa murah. Qwen3.8-2.4T-A95B: disewa, karena tidak ada orang waras yang memiliki rak itu.

Angka independen, akhirnya

Setiap artikel August vs tentang Qwen3.8-27B selalu membawa peringatan yang sama: "belum ada skor independen." Itu tidak lagi benar. Artificial Analysis telah mengukur kedua model tersebut per minggu ini, dan bentuk datanya sungguh menarik.

Pada Intelligence Index, Qwen3.8-2.4T-A95B mencetak skor 40, peringkat ke-4 dari 113 di kelasnya. Qwen3.8-27B mencetak skor 34 — yang menempatkannya di peringkat pertama dari 140 model di kelas ukuran 4–40B dengan bobot terbuka, pencapaian yang benar-benar kuat untuk model dense 27B. Keduanya lambat menurut pengukuran independen: 39,0 token keluaran per detik untuk 27B dan 38,1 untuk 2.4T, dibandingkan median kelas sekitar 90. Keduanya verbose, dengan 27B menghasilkan sekitar 200M token keluaran di seluruh run indeks versus median kelas 68M. Tidak satu pun merupakan model frontier utama; keduanya adalah pekerja keras, dan indeks menyatakan 2.4T adalah pekerja keras yang lebih kuat dengan selisih yang jelas.

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

Harga di sisi independen menunjukkan hal yang sama dalam dolar. Artificial Analysis menetapkan harga 27B sebesar $0,50 per juta input dan $3,00 per juta output pada build yang dihosting Qwen Cloud (diskon cache 90%), dan 2.4T pada $2,00 / $6,00 (diskon cache 88%). Biaya per tugas Intelligence Index: $0,82 untuk 27B dibandingkan dengan $2,16 untuk 2.4T. Model yang lebih kecil lebih murah untuk dijalankan per unit kecerdasan — dan keduanya mahal relatif terhadap kelas kecepatannya karena keduanya adalah model penalaran yang membakar token output.

Semua hal lainnya — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3 untuk 27B; 86.6 Terminal-Bench 2.1 dan 67.7 SWE-bench Pro milik 2.4T — tetap hanya dilaporkan vendor, tidak direproduksi, dan dilabeli demikian di sepanjang tulisan ini. Indeks AA di atas adalah batas bawah independen di bawah semua itu.

Apa yang diubah oleh pencatatan saham Cerebras

Pada 12 September 2026, akun Qwen mengumumkan bahwa Qwen3.8-27B kini berjalan di Cerebras, dengan entri katalognya tayang di bawah spanduk "Qwen 3.8 27B kini tersedia di Cerebras PayGo." Cerebras mencantumkannya pada $0,99 per juta token masukan dan $1,49 per juta token keluaran di perangkat keras kelas WSE yang membuat nama perusahaan itu tenar dalam hal kecepatan. Itu memberi 27B sesuatu yang belum pernah dimiliki inti 2.4T: jalur cepat.

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

Ini penting karena lambat-dan-bertele-tele adalah satu-satunya kelemahan nyata pada 27B sejak awal. Pada harness independen, model ini mencapai 39 t/s; pada telemetri penyajian kami sendiri, model ini menghasilkan sekitar 154 token keluaran per detik dengan latensi token pertama p50 sebesar 4,48 dtk — dan kini penyedia kedua bersaing pada sumbu yang sama. Sebaliknya, 2.4T sama sekali tidak memiliki jalur cepat: pada 38 t/s, Anda membayar harga frontier untuk kecepatan kelas menengah, dan satu-satunya cara untuk mengatasinya adalah klaster GPU sewaan yang menjalankan bobot terbuka sendiri.

Tiga lajur untuk 27B, satu untuk 2.4T

Per hari ini, dense 27B dapat disewa dengan tiga cara, dan selisih harganya layak dibaca sebelum Anda memilih:

• Jalur self-hosted — Qwen3.8-27B sudah aktif di OrcaRouter dengan harga $0,33 / $2,40 per juta, dijalankan di infrastruktur kami sendiri. Input termurah di pasar untuk model ini, output ~154 tok/s, konteks 262K.

• Jalur vendor — build terhosting Qwen Cloud, $0.50 / $3.00 per juta dengan konteks 1M token dan diskon cache 90%.

• Jalur cepat — Cerebras PayGo, $0,99 / $1,49 per juta, diposisikan pada kecepatan, bukan harga.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

Open core 2.4T tidak memiliki spread yang setara. API unggulan yang melayani arsitektur yang sama — Qwen3.8-Max — adalah $2,00 / $6,00 per juta, dan itulah angka yang melekat baik Anda menyebutnya Max maupun open core. Jalankan bobotnya sebagai gantinya dan ekonominya beralih ke perangkat keras: 2.4T membutuhkan ~2,4TB bobot BF16 dan node multi-GPU, keputusan modal yang tidak diambil sembarangan. GPU 24GB menjalankan build Q4 milik 27B dengan biaya marginal yang dibulatkan menjadi nol.

Contoh perhitungan yang menentukan sebagian besar tim: 100 juta token input dan 20 juta token output per hari. Dengan tarif $2/$6 milik 2.4T, itu sekitar $320 per hari, ~$117.000 per tahun. Pada 27B dengan tarif $0,33/$2,40 kami, biayanya sekitar $81 per hari — dan pada salinan yang di-host sendiri, biayanya adalah harga listrik. 2.4T memberi Anda keunggulan kualitas yang nyata, AA 40 versus 34. Apakah keunggulan itu sepadan dengan tagihan bulanan lima digit — itulah keseluruhan pertanyaan yang diajukan pasangan ini.

Di mana mereka benar-benar berbeda

Selain indeks, tiga perbedaan praktis menentukan mana yang cocok untuk beban kerja tertentu.

Input multimodal adalah filter paling bersih. Qwen3.8-27B membaca teks, gambar, dan video — tangkapan layar, bagan, dokumen dengan gambar, bingkai video semuanya masuk ke jendela 262K yang sama. Qwen3.8-2.4T-A95B secara agresif hanya teks. Jika input Anda mencakup apa pun yang visual, 2.4T didiskualifikasi terlepas dari indeksnya yang lebih tinggi.

Kontrol berpikir adalah yang kedua. Mode penalaran 27B dapat dinonaktifkan per permintaan, yang penting untuk ekstraksi yang sensitif terhadap latensi di mana rantai pemikiran hanyalah overhead; ini juga mengekspos reasoning_effort. Inti 2.4T tidak dapat mematikan pemikiran — setiap respons dibuka dengan blok think>, dan Anda membayar token tersebut entah Anda menginginkannya atau tidak. API unggulan memperbaiki ini, tetapi inti terbuka tidak.

Lisensi berada di urutan ketiga, dan diam-diam penting pada skala besar. Apache 2.0 pada 27B adalah standar permisif: memodifikasi, mendistribusikan ulang, mengomersialkan, termasuk pemberian paten. 2.4T dirilis di bawah lisensi Qwen3.8-Max khusus — secara semangat permisif, tetapi ini adalah ketentuan Alibaba, bukan standar komunitas, dan ada baiknya membaca file tersebut sebelum Anda membangun produk di atasnya.

Merutekan keputusan

Kedua sisi pertarungan ini dapat dijangkau melalui satu kunci OrcaRouter, yang membuat pertanyaan "mana yang harus saya pilih" murah untuk dijawab secara empiris.Qwen3.8-27B sudah live sebagai qwen/qwen3.8-27b dengan harga daftar penyedia tanpa markup, dan API unggulan yang dibangun di atas inti 2.4T yang sama sudah live sebagai qwen/qwen3.8-max dengan $2.00 / $6.00 per juta — tarif Aliba​ba sendiri, diteruskan langsung, jadi setiap perubahan harga vendor langsung live di sini pada hari yang sama.

Arsitektur 2.4T yang sama sebagai bobot yang dapat diunduh bukanlah sesuatu yang kami layani — jika Anda menginginkan inti terbuka melalui API hari ini, jalur unggulan adalah cara praktis untuk mencapainya, dan qwen/qwen3.8 sudah terpasang untuk diaktifkan begitu ada penyedia yang menyajikan bobot terbuka tersebut. Aturan perutean yang mengirimkan lalu lintas visual dan sensitif latensi ke qwen/qwen3.8-27b serta ekor penalaran berat ke qwen/qwen3.8-max tidak memerlukan biaya apa pun untuk disiapkan dan otomatis beralih antar penyedia jika terjadi kegagalan. Satu kunci, tanpa kontrak kedua, dan pemisahan itu hanyalah perubahan konfigurasi, bukan arsitektur ulang — cara termurah untuk menguji apakah enam poin indeks tambahan milik 2.4T sepadan dengan $5,67 per juta token keluaran bagi Anda.

Siapa yang harus memilih yang mana

• Pilih Qwen3.8-27B jika input Anda menyertakan gambar atau video, jika Anda menginginkan kemampuan berpikir yang bisa dimatikan, jika Anda memiliki GPU 24GB atau berencana memilikinya, atau jika pengeluaran per token Anda cukup besar sehingga $0.33/$2.40 versus $2.00/$6.00 menjadi seluruh dasar argumennya.

• Pilih Qwen 3.8 (inti 2.4T) jika Anda hanya untuk teks, Anda menginginkan skor penalaran independen terkuat di keluarga ini (AA 40), dan tarif $2/$6 — atau biaya menjalankan node GPU — masih nyaman di dalam anggaran Anda.

• Pilih keduanya jika lalu lintas Anda mencakup kedua profil tersebut: rutekan melalui gateway, biarkan router memisahkannya berdasarkan modalitas dan tingkat kesulitan, lalu ubah pikiran Anda saat checkpoint atau harga berikutnya dari salah satu model tersedia.

Putusan

Nama Qwen 3.8 selalu merupakan dua produk yang berpura-pura menjadi satu keluarga, dan sekarang keduanya punya angka independen masing-masing untuk diperdebatkan. Qwen3.8-2.4T-A95B adalah otak yang lebih kuat, hanya teks, mahal, dan tak dapat disangkal menguntungkan pada $2/$6. Qwen3.8-27B adalah yang dapat diterapkan — multimodal, Apache 2.0, dapat di-host sendiri, dan sejak minggu ini akhirnya juga punya jalur cepat. Selisih indeksnya nyata: 40 berbanding 34. Begitu pula selisih harganya: sekitar lima kali biaya per token saat Anda menjalankan 2.4T sebagai API. Bagi sebagian besar tim, keputusannya bukan tentang enam poin indeks. Ini tentang apakah Anda membeli token atau membeli perangkat keras — dan 27B adalah satu-satunya dari keduanya yang memungkinkan Anda membeli perangkat keras.