
Qwen3.8-Max vs Qwen 3.8: Satu Inti 2.4T, Disewa atau Dijalankan — Setelah Refresh 0902
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pada 2 September 2026, Alibaba merilis pembaruan bertanggal dari Qwen3.8-Max — versi yang mereka tetapkan sebagai Qwen3.8-Max-0902 — dan papan peringkat coding independen menempatkan snapshot baru itu di peringkat #1 pada minggu yang sama. Versi yang dapat diunduh dari model inti 2,4 triliun parameter yang sama, model yang dimaksud kebanyakan orang ketika menulis "Qwen 3.8" tanpa sufiks, masih berada pada checkpoint 12 Agustus: khusus teks, mode penalarannya terkunci aktif, dan kekurangan ratusan gigabyte untuk dapat dijalankan pada perangkat yang lebih kecil dari rak GPU. Kesenjangan antara model unggulan yang dihosting dan model dengan bobot terbuka itu belum ada pada bulan Agustus. Kini perbandingannya sepenuhnya soal kesenjangan itu, dan itulah sebabnya model yang sama terus dijual kepada Anda dengan dua nama.
Qwen3.8-Max adalah produk unggulan yang dihosting Alibaba: model sparse mixture-of-experts dengan 2,4 triliun parameter, dengan sekitar 95 miliar parameter aktif per token, tersedia di API berbayar sejak 3 Agustus, dan membawa jendela konteks multimodal 1 juta token. Qwen 3.8, sebagai nama yang berdiri sendiri, adalah rilis terbuka dari generasi yang sama — yang paling penting Qwen3.8-2.4T-A95B, bobot yang Alibaba terbitkan pada 12 Agustus dengan lisensi khusus. Keduanya bukan saudara yang lebih murah dan saudara premium; keduanya adalah otak yang sama yang dijual dengan dua cara, dan proses pasca-pelatihan bulan September telah mulai memisahkan kedua penawaran tersebut. Tulisan ini menguraikan "Qwen 3.8" mana yang sebenarnya Anda lihat, apa yang diubah oleh pembaruan 0902, dan jalur mana — menyewa API atau menjalankan bobotnya — yang sebaiknya Anda pilih hari ini.
Pasangan yang bukan persaingan.
Sebelum membahas tanggal-tanggal dan tabel tarifnya, soal arsitekturnya: Qwen3.8-Max dan Qwen3.8-2.4T-A95B sama-sama memakai desain MoE bergranularitas halus dengan 512 pakar per lapisan (10 yang dirutekan plus satu yang bersama, per lapisan), 92 lapisan, dan tumpukan hibrida yang mana 69 dari 92 lapisan itu menggunakan atensi linear — Gated DeltaNet yang dipadukan dengan atensi bergated — dengan atensi penuh yang diselipkan untuk kerja konteks panjang. Itulah mengapa kartu model bisa mengklaim konteks sejuta token di API, dan mengapa build terbuka mencapai 262K native yang memanjang mendekati sejuta dengan konfigurasi serving yang tepat. Perbedaan antara kedua nama itu bukan pada arsitektur bobotnya, melainkan pada tepiannya — dan tepian itu telah bergeser sejak 2 September.
• Parameter — Qwen3.8-Max: 2,4T total / ~95B aktif, MoE. Qwen3.8-2.4T-A95B: inti yang sama, jumlah aktif yang sama.
• Pengiriman — Qwen3.8-Max: API yang di-hosting, aktif sejak 3 Agustus, diperbarui sebagai Qwen3.8-Max-0902 pada 2 September. Qwen3.8-2.4T-A95B: bobot yang dapat diunduh, pertama kali diterbitkan 12 Agustus, tidak ada checkpoint yang lebih baru sejak itu.
• Modalitas — Qwen3.8-Max: input teks, gambar, dan video. Qwen3.8-2.4T-A95B: hanya teks.
• Kontrol penalaran — Qwen3.8-Max: sakelar pemikiran, termasuk mode non-berpikir. Qwen3.8-2.4T-A95B: pemikiran selalu aktif, dengan hanya dial upaya penalaran (rendah / tinggi / ekstra-tinggi).
Alat — Qwen3.8-Max: pemanggilan fungsi native, lima alat bawaan, dan keluaran terstruktur. Qwen3.8-2.4T-A95B: tidak ada lapisan alat native; apa yang Anda dapatkan bergantung pada kerangka kerja inferensi yang Anda gunakan untuk menyajikannya.
Apa yang diubah oleh pembaruan 2 September
Build 0902 adalah proses pasca-pelatihan, bukan arsitektur baru. Alibaba mengarahkannya pada dua hal yang selama ini sudah dikenal dari Qwen3.8-Max — coding dan "cowork," sebutannya untuk pekerjaan agenik dan perkantoran berhorizon panjang — dan angka-angka yang menyertainya adalah alasan mengapa pembaruan ini penting. Di papan peringkat independen Code Arena: WebDev, Qwen3.8-Max-0902 debut dengan skor 1.691 Elo, melompat 22 poin dari build sebelumnya dan cukup untuk langsung merebut posisi pertama. Alibaba juga membingkai build ini sebagai model dengan skor tertinggi pada batas Pareto biaya-kinerja di papan tersebut, dengan tarif gabungan sekitar $5 per juta token — harga daftar $2 dan $6 yang dibobot oleh lalu lintas agenik yang berat di sisi output, kira-kira seperempat dari biaya panggilan model frontier sebanding di tempat lain. Angka-angka ini perlu dibedakan dengan cermat oleh pembaca: skor 1.691 Elo adalah hasil arena independen; bingkai batas Pareto adalah karakterisasi Alibaba sendiri terhadap papan independen tersebut.
Evaluasi internal Alibaba untuk pass 0902, yang dilaporkan vendor dan belum direproduksi, menunjukkan arah yang sama: Terminal-Bench 3.0 naik dari 11,3 menjadi 29,0, ProgramBench dari 10,5 menjadi 28,0, JobBench dari 53,4 menjadi 64,0, dan WorkArena Elo dari 1.348 menjadi 1.468. Bacalah itu sebagai "pembaruan menggeser sumbu agentik dan coding", bukan sebagai skor terverifikasi. Di sisi kecerdasan umum, Indeks Kecerdasan Artificial Analysis menempatkan Qwen3.8-Max pada 56 — kompetitif, tetapi bukan alasan untuk memilihnya; alasan utamanya adalah hasil coding dan agentik.
Bagian yang luput dari sebagian besar pemberitaan adalah bahwa post-training 0902, pada saat tulisan ini dibuat, hanya tersedia melalui API. Alibaba belum menerbitkan checkpoint terbuka dari model yang diperbarui — bobot Qwen3.8-2.4T-A95B di Hugging Face masih merujuk pada rilis 12 Agustus. Itu berarti Qwen3.8-Max yang dihosting dan inti yang dapat diunduh bukan lagi model yang sama seperti pada pertengahan Agustus. API memiliki post-training September; bobotnya tidak. Jika seluruh alasan Anda menjalankan rilis terbuka adalah untuk mereproduksi secara persis apa yang dilakukan model unggulan, asumsi itu diam-diam tidak lagi benar sejak 2 September.

Lima tempat di mana mereka benar-benar berbeda
Kesampingkan arsitektur bersama itu, dan perbedaan praktisnya tersusun rapi. Modalitas adalah filter pertama: jika beban kerja Anda mencakup gambar atau video — tangkapan layar, bagan, dokumen dengan gambar, bingkai video — hanya Qwen3.8-Max yang dapat memprosesnya, dan jendela 1M-token-nya bersifat native, bukan sekadar ekstensi. Bobot terbuka (open weights) hanya mendukung teks. Kontrol penalaran adalah filter kedua: API ter-hosting dapat berjalan dengan mode berpikir nonaktif, yang penting untuk ekstraksi bervolume tinggi dan sensitif terhadap latensi, di mana rantai pemikiran hanyalah beban tambahan; open build tidak dapat mematikannya. Perkakas adalah filter ketiga: function calling, lima alat bawaan, dan mode JSON adalah bagian dari produk ter-hosting, sedangkan open build bergantung pada apa pun yang disediakan oleh lapisan penyajian (serving layer) Anda.
Konteksnya lebih bernuansa daripada yang disiratkan oleh lembar spesifikasi. Kedua sisi dapat mencapai sekitar satu juta token, tetapi model yang dihosting melakukannya secara native dengan input multimodal, sementara konteks native 262K dari build terbuka harus diperluas melalui konfigurasi, dan setiap token dari jendela yang diperluas tersebut adalah teks. Batas output juga berbeda — API mengizinkan hingga sekitar 131K token output, dan build terbuka biasanya dikonfigurasi dengan batas atas yang serupa, tetapi batas praktis di sisi terbuka ditentukan oleh tumpukan serving Anda, bukan oleh modelnya.
Berapa biaya sebenarnya dari setiap rute
Di sinilah kedua mode penyediaan tersebut sama sekali tidak bisa dibandingkan lagi. Qwen3.8-Max memiliki harga resmi: $2.00 per juta token input, $6.00 per juta token output, dan $0.25 per juta untuk input yang di-cache. Karena OrcaRouter meneruskan harga resmi penyedia dengan markup 0%, itulah tarif yang Anda bayar di sini, dan ketika Alibaba mengubahnya, angka baru tersebut langsung berlaku di hari yang sama. Snapshot 0902 dipatok secara terpisah sebagai qwen/qwen3.8-max-0902 bagi tim yang menginginkan perilaku yang dapat direproduksi — harga sama, kemampuan sama, tetapi berupa checkpoint tetap, bukan model yang terus bergulir. Pada lalu lintas OrcaRouter, median waktu hingga token pertama dalam 7 hari untuk Qwen3.8-Max berada di kisaran 2–4 detik, dan Artificial Analysis mengukur sekitar 45–48 token output per detik: tidak lambat, tetapi boros kata, itulah sebabnya tugas-tugas agentik pada model ini dapat menghabiskan jumlah token yang mencengangkan meskipun tarifnya murah.

Qwen3.8-2.4T-A95B tidak memiliki harga daftar, karena harganya adalah infrastruktur Anda. Bobot BF16 mencapai sekitar 4,9 TB dan bahkan versi FP8 resminya sekitar 2,4 TB, jadi ini adalah perangkat keras skala rak: konfigurasi penyajian terkecil yang terdokumentasi dimulai dari sekitar delapan GPU B300 atau GB300, dan rak GB300 NVL72 penuh adalah deployment referensinya. Kuantisasi agresif mengubah batas bawahnya — versi NVFP4 muat dalam sekitar 1,3 TB, dan kuantisasi berlapis 1-bit dari Unsloth mengompres model hingga sekitar 397 GB, yang akhirnya membuat satu node dengan kelengkapan memadai menjadi layak — tetapi setiap jalur tersebut mengasumsikan Anda mengoperasikan GPU dalam skala pusat data. Penyedia pihak ketiga yang melayani checkpoint terbuka akan menjual token kepada Anda di bawah harga per-token Max, tetapi Anda kehilangan input multimodal, mode non-berpikir, perkakas asli, dan pasca-pelatihan 0902 dalam prosesnya, dan belum ada tolok ukur independen dari checkpoint yang dapat diunduh tersebut yang dipublikasikan. Kartu model Alibaba sendiri jujur tentang hubungan tersebut: kartu tersebut mendeskripsikan Qwen3.8-Max sebagai versi resmi yang dibangun di atas Qwen3.8-2.4T-A95B, yang menambahkan input visi, dukungan non-berpikir, konteks 1M bawaan, dan perkakas bawaan di atas inti terbukanya.

Angka independen versus klaim vendor
Kejujuran sumber lebih penting di sini daripada di kebanyakan perbandingan, karena kedua sisi memiliki usia bukti yang sangat berbeda. Qwen3.8-Max telah dinilai secara independen: hasil Code Arena: WebDev 1.691 untuk build 0902 dan Intelligence Index 56 dari Artificial Analysis adalah pengukuran pihak ketiga, dan penetapan harga yang membuat klaim Pareto-frontier menarik adalah kartu tarif yang dipublikasikan. Qwen3.8-2.4T-A95B belum memilikinya — tabel tolok ukur yang dipublikasikan Alibaba mendeskripsikan inti kelas Max, bukan hasil uji independen terhadap checkpoint yang dapat diunduh, sehingga sisi terbuka dari perbandingan ini sebagian besar masih berupa "vendor menyatakan bahwa inti tersebut mencetak skor seperti ini." Jika Anda memutuskan di antara keduanya berdasarkan kemampuan, perlakukan angka-angka utama bobot terbuka sebagai klaim sampai pihak ketiga menjalankannya.
Siapa yang harus memilih yang mana
Keputusan ini muncul dari daftar di atas. Ambil Qwen3.8-Max yang di-hosting — hari ini, khususnya build 0902 — ketika Anda membutuhkan post-training September, input gambar atau video, mode non-berpikir, alat native dan keluaran terstruktur, atau jendela jutaan token tanpa menyiapkan infrastruktur. Itu adalah posisi terdepan dalam hal coding dan agen, dan dengan harga $2/$6 dengan input cache $0.25, harganya sangat agresif untuk apa yang ditawarkan.
Pilih Qwen3.8-2.4T-A95B ketika kontrol lebih penting daripada kemudahan: Anda membutuhkan bobot model di perangkat keras sendiri atau penyedia yang sudah Anda operasikan; Anda menginginkan checkpoint tetap yang dapat diaudit dan direproduksi; atau volume pemakaian Anda yang berkelanjutan membuat biaya per token menjadi komponen dominan dan Anda siap menjalankan MoE 2,4T. Terima daftar kompromi berikut — hanya teks, mode berpikir selalu aktif, tanpa tooling bawaan, belum ada post-training 0902 — dan verifikasi ketentuan lisensi untuk kisaran pendapatan Anda, karena lisensi khusus Qwen3.8-Max bukan Apache 2.0 dan menambahkan persyaratan bagi operator komersial skala besar.
Jika beban kerja Anda bervolume tinggi, menggunakan satu GPU, atau sensitif terhadap latensi, tidak satu pun dari keduanya mungkin merupakan jalur yang tepat — saudara dari generasi ini dengan 27 miliar parameter, Qwen3.8-27B, adalah yang dirancang untuk itu, dan dibahas secara terpisah dalam perbandingan Qwen3.8-27B vs Qwen3.8-Max kami.
Cara mencoba keduanya tanpa mempertaruhkan seluruh modal Anda
Cara yang bersih untuk mengambil keputusan ini adalah dengan menjalankan kedua sisi pada prompt Anda sendiri, dan di sinilah lapisan routing menunjukkan nilainya alih-alih sekadar ditempelkan. Qwen3.8-Max dan snapshot Qwen3.8-Max-0902 yang dipatok sama-sama berada di balik satu endpoint yang kompatibel dengan OpenAI di OrcaRouter, sehingga perpindahan antara flagship yang berjalan dan checkpoint yang dapat direproduksi hanyalah perubahan model-id, bukan redeploy. Ketika sebuah tim memutuskan untuk membawa open weights ke internal, DSL routing dapat menempatkan endpoint vLLM atau SGLang yang di-host sendiri di bagian depan untuk melayani Qwen3.8-2.4T-A95B dan meletakkannya dalam call graph yang sama — lalu lintas massal ke deployment Anda sendiri, prompt sulit dan permintaan multimodal dilimpahkan ke Qwen3.8-Max yang di-host, dengan failover otomatis di antara keduanya. Mencoba checkpoint baru dengan cara itu hanya memerlukan perubahan konfigurasi, bukan migrasi — persis seperti yang Anda inginkan ketika kedua sisi perbandingan ini masih bergerak dengan kecepatan yang berbeda.
Intinya
Qwen3.8-Max dan Qwen 3.8 bukanlah dua model yang memperebutkan pekerjaan yang sama. Keduanya adalah satu inti berparameter 2,4 triliun yang disediakan sebagai API sewaan dan sebagai bobot yang dapat diunduh, dan pembaruan 2 September membuat kedua bentuk penyediaan itu bermakna berbeda. Sewa API dan Anda akan mendapatkan pasca-pelatihan 0902 yang meraih posisi terdepan di Code Arena: WebDev, plus visi, mode non-berpikir, perkakas native, dan jendela native satu juta token, dengan harga $2/$6 dan $0,25 untuk input cache. Jalankan bobot terbuka dan Anda mendapatkan arsitektur yang sama yang dibekukan pada kondisi 12 Agustus — hanya teks, penalaran terkunci aktif — tanpa skor independen apa pun hingga kini dan dengan tagihan perangkat keras pusat data. Jika peningkatan koding dan agenik September penting bagi Anda, hanya satu dari kedua nama itu yang memilikinya saat ini. Jika kontrol yang dapat direproduksi lebih Anda utamakan, hanya satu dari kedua nama itu yang dapat Anda simpan.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
