Kartu judul hero untuk Qwen3.8 Max Prime, tier penyajian throughput 1,5-2x milik Alibaba untuk produk unggulan Qwen3.8-Max, dengan chip spesifikasi yang bertuliskan total 2,4T yang sama dan ~95B aktif, Prime seharga $3.301/$9.902, standar seharga $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba Menempatkan Kartu Tarif Kelas Dua di Samping Andalan Mereka

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 22 September 2026, di Konferensi Yunqi di Hangzhou, lini bisnis MaaS Alibaba mengumumkan tingkat layanan yang mereka sebut mode Prime — 优速模式 — dan menempatkan ID model baru pada daftar harga untuknya: qwen3.8-max-prime. ID itu bukan model baru. ID itu adalah Qwen3.8-Max, model andalan sparse mixture-of-experts dengan 2,4 triliun parameter yang mencapai ketersediaan umum pada 3 Agustus 2026, yang disalurkan melalui jalur yang lebih cepat. Qwen3.8 Max Prime membawa bobot yang sama, jendela konteks yang sama, perkakas yang sama, dan batas penggunaan yang sama dengan model dasar. Yang berbeda adalah throughput dan harga, dan harganya kira-kira dua kali lipat.

Ini adalah kedua kalinya dalam tujuh minggu Alibaba mengubah cara Qwen3.8-Max dijual tanpa mengubah apa produk itu sebenarnya. Pada 2 September, perusahaan merilis penyegaran pasca-pelatihan yang dipatok sebagai Qwen3.8-Max-0902, yang berfokus pada coding dan kerja agentik, hanya API. Pada 22 September, tier kecepatan ditambahkan. Keduanya bukan peluncuran, dan menafsirkan salah satunya sebagai peluncuran akan merugikan Anda secara finansial.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Apa sebenarnya mode Prime itu

Dokumentasi Alibaba sendiri mendeskripsikan mode Prime sebagai saluran untuk "skenario yang sensitif terhadap kecepatan output" — asisten pengodean AI, penalaran agen multi-langkah, percakapan waktu nyata — dan menyatakan manfaatnya secara gamblang: TPS dinaikkan menjadi 1,5 hingga 2 kali lipat API standar. Tidak ada parameter baru untuk diatur. Anda mengalihkan nilai model ke ID Prime dan Anda berada di jalur cepat.

Dokumentasinya sama eksplisitnya tentang apa yang tidak berubah: "Kemampuan yang didukung model dan pembatasan penggunaannya sama seperti model asli." Jadi tidak ada konteks yang lebih besar, tidak ada mode penalaran yang lebih baik, tidak ada permukaan alat tambahan. Ini adalah stack penyajian yang sama dengan lebih banyak ruang cadangan di belakangnya.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Kartu tarif, baca dengan cermat

Halaman harga internasional Aliba​ba mencantumkan kedua ID tersebut secara berdampingan, sehingga perbandingannya menjadi luar biasa jelas. Per sejuta token:

• Input — qwen3.8-max-prime $3.301 vs qwen3.8-max $1.65

• Keluaran — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951

• Cache hit — qwen3.8-max-prime $0.413 vs tarif pembacaan cache pada ID standar yang dicantumkan halaman yang sama sebagai baris diskon

• Rasio — 2.0× pada input dan output, bukan perkiraan yang dibulatkan melainkan aritmetika literal dari angka-angka yang dipublikasikan

Pada kartu tarif Tiongkok, rasio 2× yang sama juga berlaku dalam yuan: ¥24 input dan ¥72 output per juta untuk Prime ID dibandingkan ¥12 dan ¥36 untuk versi standar, dengan cache hit di ¥3.

Angka peluncuran Qwen3.8-Max yang banyak dikutip adalah $2 untuk input dan $6 untuk output per juta. Itulah angka utama yang dipakai dalam liputan Agustus, dan itu bukan angka pada kartu tarif internasional saat ini. Jika Anda membuat model pengeluaran, gunakan kartu tarif untuk wilayah Anda, bukan angka utama peluncuran, dan periksa lagi sebelum Anda berkomitmen — Alibaba telah merevisi halaman ini dua kali sejak 2 September.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

Aturan throttling adalah fitur yang sebenarnya.

Baris yang paling sering dilewatkan orang justru yang paling penting untuk produksi. Dokumentasi Prime Alibaba menyatakan bahwa ketika penggunaan Anda mencapai batas laju, jika platform masih memiliki sumber daya tersisa, Anda tidak akan dibatasi, sehingga throughput yang sebenarnya tersedia bagi Anda tidak akan turun di bawah batas yang dinyatakan.

Itu adalah plafon lunak dengan lantai yang keras, yang bentuknya berbeda dari batas tier standar. Artinya, angka 1,5–2× adalah janji tentang lantai, bukan batas atas pada plafon: saat terjadi kontensi Anda mendapatkan batasnya, dan saat kapasitas menganggur Anda bisa mendapatkan lebih banyak. Untuk loop agen yang memicu puluhan panggilan berurutan, asimetri itu lebih bernilai daripada pengali TPS mentah, karena latensi ekor pada panggilan paling lambatlah yang menentukan apakah alur kerja Anda selesai.

Batas TPM dinamis model standar diberlakukan bertingkat berdasarkan pengeluaran Model Studio bulanan — keluarga dokumentasi yang sama menunjukkan ID qwen3.8-max dasar pada 5,000,000, 10,000,000, dan 20,000,000 TPM di seluruh tier, yang diperbarui setiap bulan. Prime tidak menghapus struktur itu; ia mengubah bagaimana dampaknya terasa.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Apa yang belum diukur oleh siapa pun

Inilah kesenjangan yang jujur. Angka 1,5–2× itu adalah angka yang dinyatakan vendor. Tidak ada pengukuran throughput Prime-mode independen yang dapat kami temukan, dan itu penting karena angka independen dari build standar itu sendiri tidak bagus dalam hal kecepatan.

Artificial Analysis, yang mengukur model dengan harness miliknya sendiri, saat ini memberi skor Qwen3.8-Max pada build 0902 dengan Intelligence Index 45, dengan GPQA Diamond 92,8%, Terminal-Bench Hard 38,9%, dan Humanity's Last Exam 43,1% — dan menetapkan biaya terukur per tugasnya sebesar $5,41. Itu adalah angka independen pada SKU standar, yang diambil pada 2026-09-24. Angka-angka itu juga menjadi pengingat bahwa indeks telah direvisi sejak liputan peluncuran Agustus, jadi jangan menempatkan nilai indeks lama di samping nilai indeks terkini lalu menyebutnya tren.

Yang tidak dimiliki AA adalah baris Prime. Sampai seseorang mengukurnya, klaim kecepatan itu hanya milik Aliba​ba, dan sikap yang benar adalah mengujinya pada beban kerja Anda sendiri daripada menganggapnya sebagai puncak jajaran.

Bagaimana posisi keputusan routing setelah ini

Prime adalah tier yang dijual Alibaba di API-nya sendiri, dan hanya di sana tempat untuk mendapatkannya. Kami tidak menghosting qwen3.8-max-prime di sini. Yang dirutekan OrcaRouter adalah standar Qwen3.8-Max dan pin bertanggalnya Qwen3.8-Max-0902, keduanya berada pada key yang sama dengan anggota lain keluarga Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — bersama 200+ model lainnya, dengan harga daftar penyedia diteruskan pada markup 0%. Bagian terakhir itulah sebabnya pembaruan 2 September dan setiap perubahan tarif Max di masa mendatang berlaku di sisi kami pada hari yang sama ketika berlaku di Alibaba.

Pembagian praktisnya seperti ini. Jalankan lalu lintas default Anda pada ID standar melalui router, di mana failover melindungi Anda jika satu jalur penyedia menurun. Pindahkan panggilan spesifik yang latensi wall-clock adalah produknya — penyelesaian interaktif, langkah agen yang ketat — ke Prime, dan hitung biaya keputusan itu terhadap 2×, bukan terhadap 1,5×.

Siapa yang harus beralih, dan siapa yang harus menunggu

Beralihlah jika pengguna Anda menunggu token: pelengkapan otomatis, giliran chat, loop edit kode yang ditonton manusia. Di ujung atas rentang kecepatan, Prime bersifat netral biaya per detik latensi yang dihilangkan — Anda membayar tepat dua kali lipat untuk waktu tepat setengahnya. Di ujung bawah rentang, Anda membayar 2× untuk 1,5×, yang merupakan premi 33% per detik yang dihemat. Jika beban kerja Anda adalah tugas batch yang berjalan semalaman, premi itu tidak memberi Anda apa pun yang Anda butuhkan.

Tunggu, jika model biaya Anda dibangun di atas headline peluncuran $2/$6, atau jika permintaan Anda berat input. Klaim kecepatan vendor adalah tentang TPS — token output per detik — dan prefill adalah tahap pipeline yang berbeda. Permintaan berkonteks panjang membayar dua kali lipat untuk token input, terlepas dari apakah outputnya tiba lebih cepat. Ukur kasus itu sebelum Anda memigrasikannya.

Dan periksa tanggal pada kartu tarif Anda. Qwen3.8-Max sudah ada di pasar sejak 3 Agustus, telah diperbarui sekali, dan telah dikemas ulang sekali, dan usianya masih tujuh minggu. Tier-nya yang jadi berita; modelnya bukan.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari