
Qwen3.8-Max vs Qwen3.7-Max: Dua Tingkat Max, 16 Poin Indeks, dan Promo yang Membalik Harga
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 495 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 186 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Empat hari lalu, vendor memberi tahu kami bahwa Qwen3.8-Max bukanlah model yang dirilisnya pada Agustus. Dalam siaran pers tertanggal 22 September 2026, dari Apsara Conference di Hangzhou, perusahaan mengungkapkan bahwa model unggulannya menyelesaikan 33 siklus iteratif pekerjaan pelatihan dan pasca-pelatihan yang sepenuhnya otomatis selama lebih dari sebulan, dan bahwa build yang dihasilkan meningkatkan Artificial Analysis Intelligence Index-nya dari 40 menjadi 45. ID modelnya tidak pernah berubah. Angka di baliknya berubah.
Hal itu paling penting di satu tempat spesifik: perbandingan antara Qwen3.8-Max dan Qwen3.7-Max, tier Max yang digantikannya. Qwen3.8-Max mencapai ketersediaan umum pada 3 Agustus 2026; Qwen3.7-Max dirilis pada Mei. Di atas kertas ini tampak seperti keputusan antargenerasi yang mudah — flagship lebih baru, skor lebih tinggi, lanjut saja. Angka-angkanya mengatakan sesuatu yang lebih janggal. Tier lama tiga hingga empat kali lebih cepat, sekitar lima kali lebih murah per tugas yang diselesaikan, dan identik dengan yang lebih baru pada benchmark pengetahuan murni. Tier yang lebih baru bersifat multimodal, jauh lebih baik dalam pekerjaan agentik, dan lebih murah pada kartu tarif internasional. Yang mana yang sebaiknya Anda panggil bergantung pada pertanyaan yang dilewatkan oleh sebagian besar perbandingan: apakah Anda membeli pengetahuan atau membeli panggilan alat.
Apa yang sebenarnya diklaim oleh pengungkapan Apsara
Pengungkapan ini adalah pernyataan vendor, yang diterbitkan oleh Alibaba di situs persnya sendiri, dan harus dibaca sebagai demikian. Apa yang dinyatakannya spesifik: selama lebih dari sebulan eksekusi otomatis penuh yang mencakup desain pipeline, validasi data, eksperimen iteratif, dan diagnosis kesalahan, Qwen3.8-Max menyelesaikan 33 siklus, dan optimisasi pelatihan otonom plus teknik pasca-pelatihan menghasilkan pergerakan skor tersebut. Alibaba juga menjelaskan eksperimen kedua dalam desain chip, di mana model tersebut menjalankan lebih dari 60 jam peningkatan diri sepanjang siklus hidup desain, melakukan lebih dari 10.000 panggilan alat EDA, dan menghasilkan modul bus chip tingkat produksi sambil mengurangi area chip sebesar 42% tanpa kompromi kinerja yang dinyatakan. Semua itu adalah klaim Alibaba tentang modelnya sendiri, yang tidak direproduksi oleh siapa pun di luar perusahaan.
Pergerakan skor itu sendiri, bagaimanapun, bukanlah klaim vendor. Indeks tersebut milik Artificial Analysis, dan angka 45 ada di halaman Qwen3.8 Max (0902) milik pihak ketiga itu. Angka 40 yang menjadi asal pergerakannya ada di halaman organisasi yang sama untuk build 3 Agustus, yang kini ditandai usang dan mengarah ke versi terkini. Jadi delta itu adalah penyebab yang dilaporkan vendor yang dilekatkan pada efek yang dinilai secara independen, yang merupakan posisi lebih kuat daripada salah satu bagiannya saja. Ini juga, per saat tulisan ini dibuat, bukti publik paling konkret yang dimiliki siapa pun bahwa sebuah lab terdepan menggerakkan kemampuan terukur produk andalannya tanpa merilis nomor versi baru.
Dua hal lain tentang rilis ini mudah terlewatkan dan keduanya sama-sama berperan penting. Pertama, Alibaba mengonfirmasi bahwa Qwen 4 sedang dalam pelatihan, dengan seri Qwen 4.5 dan Qwen 5 diproyeksikan dapat diskalakan hingga 5–10 triliun parameter. Kedua, ada snapshot bertanggal dari model yang diperbarui. Alibaba menyematkan build pasca-pelatihan sebagai qwen3.8-max-0902 pada 2 September, dan model itu dapat dirutekan secara terpisah. Penyematan itu adalah jawaban praktis untuk semua yang tersirat dari pengungkapan RSI, dan kita akan kembali membahasnya.
Papan skor
Enam dimensi, kedua sisi, dengan disiplin penelusuran sumber yang tetap eksplisit karena kedua kolom tersebut tidak terverifikasi secara setara.
• Jendela konteks — Qwen3.8-Max 1.000.000 token vs Qwen3.7-Max 1.000.000 token (identik)
• Output maksimum — 131.072 token vs 131.072 token menurut halaman model milik Alibaba sendiri (identik; perhatikan bahwa halaman katalog kami untuk Qwen3.7-Max mencantumkan 64.000, suatu ketidaksesuaian yang kami tandai alih-alih menutupinya)
• Modalitas masukan — teks, gambar, dan video vs hanya teks
• Harga daftar internasional per 1 juta token — $2,00 untuk input / $6,00 untuk output vs $2,50 untuk input / $7,50 untuk output; kartu tarif yang sama sudah membebankan biaya sebesar $1,65 / $4,951 kepada kedua model di Beijing, Frankfurt dan Virginia
• Indeks Intelijen Artificial Analysis — 45 vs 29
• Kecepatan output independen — 39,7 token/detik vs 211,3 token/detik, diukur terhadap kelas pembanding 211 model yang sama, di mana Artificial Analysis menilai tingkat yang lebih baru secara nyata lambat dan yang lebih lama secara nyata cepat
Dua baris terakhir adalah keseluruhan artikel. Pada keluarga indeks yang sama, tier yang lebih baru unggul 16 poin. Dalam hal kecepatan, ia tertinggal lebih dari lima kali.

Dari mana 16 poin itu berasal — dan dari mana tidak
Pisahkan Indeks menjadi bagian-bagiannya dan bentuk peningkatan itu menjadi jelas, dan itu bukan bentuk yang disarankan oleh pemasaran.
Dalam hal pengetahuan dan penalaran, kedua model tersebut pada dasarnya imbang. GPQA Diamond: 92.8 vs 92.3. Humanity's Last Exam: 43.1 vs 40.5. Recall konteks panjang: 80.33 vs 79. SciCode: 52.1 vs 49.5. Jika beban kerja Anda adalah menjawab pertanyaan atas korpus besar, lompatan generasi ini hanyalah kesalahan pembulatan. Membayar kelipatan untuk itu akan sulit dibenarkan.
Dalam pekerjaan agentik dan coding, kesenjangannya melebar tajam. Terminal-Bench 2.1: 88.76 vs 74.53. Indeks coding Artificial Analysis: 76.2 vs 66. Dan divergensi terlebar dalam rangkaian ini adalah tugas penggunaan alat perbankan, di mana Qwen3.8-Max mencatat 47.84 berbanding Qwen3.7-Max 11.75 — selisih empat kali lipat tepat pada kemampuan yang menurut deskripsi RSI sedang dioptimalkan oleh siklus otomatis: desain pipeline, validasi data, eksperimen iteratif, diagnosis kesalahan. Model yang menghabiskan sebulan untuk meningkatkan loop pelatihannya sendiri adalah model yang menjadi lebih baik dalam hal loop.
Satu catatan jujur tentang baris-baris individual itu. Kedua halaman model berada dalam keluarga revisi Intelligence Index yang sama (v4.3 dan v4.3.2), sehingga perbandingan utama 45 versus 29 menjadi perbandingan yang adil. Baris-baris per benchmark tidak berasal dari kohort yang sama: angka tingkat tugas Qwen3.7-Max berasal dari jendela evaluasi Mei, sedangkan Qwen3.8-Max berasal dari rangkaian September. Bacalah arah pergerakannya, bukan angka signifikan ketiga.
Pertanyaan harga adalah dua pertanyaan
Pada daftar tarif internasional Alibaba, Max yang lebih baru lebih murah daripada yang digantikannya: $2.00 / $6.00 untuk Qwen3.8-Max dibandingkan $2.50 / $7.50 untuk Qwen3.7-Max, per juta token. Penurunan 20% pada kedua arah seiring kemajuan generasi tidak biasa dan patut dicatat tersendiri. Ekonomi cache juga menguntungkan tier yang lebih baru — cache implisit sebesar $0.25 dibandingkan $0.50, pembacaan cache eksplisit sebesar $0.17 dibandingkan $0.25.
Itulah pertanyaan pertama, dan jawabannya bersifat regional, yang sebagian besar liputan anggap seragam. Alibaba mengenakan biaya untuk kedua model $1.65 input / $4.951 output di Beijing, Frankfurt, dan Virginia. Selisih 20% hanya ada pada kartu internasional Singapura. Jika lalu lintas Anda masuk ke tiga wilayah lainnya, token input dan output berbiaya sama untuk kedua tier Max saat ini, dan keputusannya menyusut menjadi murni soal kemampuan — pada titik itu model yang lebih baru menang dalam segala hal kecuali throughput, dan tidak ada aritmetika yang tersisa untuk dikerjakan.
Pertanyaan kedua adalah jebakannya. Qwen3.7-Max saat ini tidak dipatok pada $2.50 / $7.50. Model ini ditawarkan pada $1.25 / $3.75 — setengah harga daftar, tarif promosi. Itu menjadikan tingkat generasi sebelumnya sebagai opsi yang lebih murah saat ini, dengan selisih yang lebar. Ini juga berarti harga yang dapat Anda ukur minggu ini bukanlah harga yang akan menjadi komitmen Anda. Halaman model Alibaba sendiri menyatakan dengan gamblang bahwa tabel yang dipublikasikan menunjukkan harga asli "tidak termasuk promosi waktu terbatas apa pun" dan mengarahkan Anda ke konsol untuk penawaran terkini. Promosi, secara inheren, adalah tarif yang bisa berakhir. Jika itu terjadi, Qwen3.7-Max tidak sekadar menjadi lebih mahal daripada saat ini; model itu menjadi 25% lebih mahal daripada model yang mengalahkannya.
Kami meneruskan tarif penyedia dengan markup 0%, jadi baik harga daftar maupun promosi aktif di sisi kami pada hari yang sama saat berubah — yang memudahkan untuk perbandingan dan tidak membantu jika Anda mencoba menyusun anggaran. Bangun model berdasarkan kartu daftar, dan perlakukan tarif promosi sebagai potensi keuntungan.

Angka yang membalikkan argumen biaya
Harga token bukanlah yang menentukan biaya sebuah tugas. Artificial Analysis menerbitkan angka biaya per tugas yang memperhitungkan ekonomi cache, volume penalaran, dan panjang jawaban, dan berdasarkan ukuran tersebut peringkatnya berbalik sepenuhnya: $5.41 per tugas Intelligence Index untuk Qwen3.8-Max dibandingkan $1.15 untuk Qwen3.7-Max. Premi 4.7×, dibandingkan tarif token yang entah 20% lebih murah atau identik, bergantung pada wilayah Anda.
Kesenjangan itu sebagian besar karena verbositas. Dalam evaluasi yang sama, model yang lebih baru menghasilkan 190M token keluarandibandingkan 120M milik model lama, dan model ini bernalar panjang lebar untuk mencapai jawabannya. Jika Anda membayar per token keluaran untuk beban kerja bervolume tinggi dengan tingkat kesulitan sedang, Max yang lebih baru bukanlah model yang lebih murah pada harga token berapa pun di kedua kartu tarif. Model ini justru yang lebih mahal, dan harga daftar token adalah instrumen yang salah untuk memutuskan hal itu.
Kecepatan, dan apa yang ditunjukkan oleh trafik kami sendiri
Kesenjangan throughput cukup besar untuk mengubah arsitektur. Artificial Analysis menempatkan Qwen3.8-Max pada 39,7 token per detik — ringkasannya menyebut model itu sangat lambat — dibandingkan dengan 211,3 untuk Qwen3.7-Max, yang disebutnya sangat cepat. Itulah perbedaan antara model yang Anda tempatkan di balik antarmuka interaktif dan model yang Anda tempatkan di balik antrean — dan pada Qwen3.8-Max itulah hal pertama yang ditunjukkan panel stat kami sendiri kepada Anda.
Telemetri playground kami sendiri selama tujuh hari hingga 25 September menunjukkan gambaran yang sedikit lebih bernuansa tentang latensi, dan disertai catatan penting: ini adalah pengukuran kami pada routing kami, bukan benchmark yang terkontrol. Qwen3.8-Max menunjukkan median 2.611 ms untuk respons pertama pada 54,7 token per detik dengan tingkat galat 2,45%; build 0902 yang di-pin menunjukkan median 3.360 ms pada 46,2 token per detik dengan tingkat galat 0,66% yang jauh lebih bersih. Qwen3.7-Max berada pada median 4.509 ms tetapi 169,8 token per detik dengan tingkat galat 3,80%. Jadi tier yang lebih lama menjawab lebih lambat di awal lalu melakukan streaming tiga kali lebih cepat, tetapi lebih sering gagal. Jika beban kerja Anda bersifat bursty, perbedaan tingkat galat itu lebih layak diperhatikan daripada mediannya.
Kedua tier aktif pada satu kunci OrcaRouter bersama snapshot yang dipin, dengan failover otomatis antar penyedia. Untuk perbandingan seperti ini, itulah poin praktisnya: mengukur prompt Anda sendiri terhadap kedua generasi Max adalah perubahan konfigurasi, bukan kontrak kedua.

Reprodusibilitas kini menjadi faktor penentu
Berikut adalah bagian dari pengungkapan Apsara yang belum diperhitungkan oleh siapa pun. ID model live yang kemampuan terukurnya berubah dari 40 menjadi 45 selama sebulan, tanpa perubahan versi dan tanpa pengumuman saat itu, merupakan bahaya reprodusibilitas. Jika perilaku produk Anda merupakan fungsi dari ID yang bergerak, Anda memiliki model yang dapat meningkat — atau bergeser — di bawah rangkaian evaluasi yang dibekukan, pustaka prompt yang di-cache, atau set regresi yang telah disetujui.
Kedua generasi menawarkan snapshot bertanggal, dan itulah mitigasinya. Qwen3.7-Max didokumentasikan oleh Alibaba sebagai setara secara fungsional dengan qwen3.7-max-2026-05-20, dengan build bertanggal lainnya pada 2026-05-17 dan 2026-06-08. Qwen3.8-Max memiliki qwen3.8-max-0902, build September pasca-pelatihan, yang merupakan yang dimaksud dengan 45. Jika Anda merilis apa pun yang perlu direproduksi, sematkan ID bertanggal dan perlakukan yang mengambang sebagai target staging. Siklus RSI adalah fitur dari ID mengambang; pin adalah cara Anda memilih keluar darinya.
Satu detail penamaan yang perlu diketahui agar Anda tidak salah membaca katalog. Alibaba mencantumkan bentuk bertanggal ketiga, qwen3.8-max-2026-09-02, di samping alias 0902; keduanya merujuk pada build yang sama. Rilis 3 Agustus yang asli tidak lagi dapat dirutekan di sisi kami — kami menyediakan Qwen3.8-Max, pin 0902-nya, dan Qwen3.7-Max.
Siapa yang harus memilih yang mana?
Keputusan ini bukan soal model mana yang lebih baik. Keputusan ini soal apa yang Anda beli.
Tetap gunakan Qwen3.7-Max jika beban kerja Anda hanya teks, lebih berat pada pengetahuan ketimbang berat pada alat, dan sensitif terhadap throughput — klasifikasi bervolume tinggi, ekstraksi, pengambilan konteks panjang, peringkasan batch. Pada GPQA Diamond dan recall konteks panjang, model ini hanya terpaut satu poin dari model yang lebih baru, melakukan streaming tiga hingga empat kali lebih cepat, dan biayanya $1,15 per tugas dibandingkan $5,41. Ini juga jawaban yang tepat bagi siapa pun yang menginginkan pendapat kedua yang murah dalam konfigurasi fusi atau perutean, karena pada tarif promosinya kelas harganya sama sekali berbeda. Dua catatan: promosi tetaplah promosi, dan Artificial Analysis telah menandai model ini sebagai deprecated, digantikan oleh Qwen3.8-Max. Jangan memulai komitmen multi-tahun pada model ini.
Pindah ke Qwen3.8-Max jika salah satu dari ini benar: Anda memerlukan input gambar atau video, yang sama sekali tidak diterima oleh Qwen3.7-Max; beban kerja Anda bersifat agentik, dengan rantai pemanggilan alat yang panjang atau loop pengodean multi-langkah, di mana 88,76 versus 74,53 pada Terminal-Bench 2.1 dan selisih penggunaan alat empat kali lipat adalah pembeda antara merilis atau tidak; atau Anda menulis terhadap kartu tarif internasional Singapura, di mana model yang lebih baru hanya 20% lebih murah dan tidak ada trade-off yang perlu ditimbang. Sematkan qwen3.8-max-0902 jika Anda memerlukan perilakunya agar tetap stabil.
Jika Anda berada di Beijing, Frankfurt, atau Virginia, pilihannya lebih jelas daripada yang disarankan oleh perbandingan apa pun: kedua tier Max berbiaya $1.65 / $4.951 per juta token. Identik. Pada tarif tersebut, tidak membayar ekstra untuk input multimodal, Index yang 16 poin lebih tinggi, dan skor penggunaan alat yang empat kali lebih baik bukanlah sebuah keputusan, melainkan gratis — dan satu-satunya alasan untuk tetap menggunakan Qwen3.7-Max menjadi throughput mentah.
Dua pertanyaan yang layak dijawab secara langsung
Apakah proses pelatihan 33 siklus berarti model berubah di bawah lalu lintas API yang sudah ada? Itulah yang tersirat dari pengungkapan tersebut, dan itulah alasan pin bertanggal itu ada. Alibaba menyebut model yang ditingkatkan sebagai "the updated Qwen3.8-Max," yaitu ID mengambang, bukan ID baru. Jika Anda memiliki beban kerja pada ID mengambang tersebut sepanjang September, beban kerja itu dilayani oleh model yang kapabilitas terukurnya bergerak selama periode tersebut. Alibaba belum menerbitkan changelog untuk build-build di antaranya, jadi satu-satunya cara yang andal untuk mengetahui perilaku mana yang Anda miliki adalah dengan melakukan pin.
Apakah klaim RSI diverifikasi secara independen? Skor yang dihasilkannya memang terverifikasi — Index tersebut milik Artificial Analysis, dan angka 45 tertera di halaman mereka. Mekanisme di baliknya adalah deskripsi Alibaba sendiri tentang proses pelatihannya sendiri, tanpa replikasi eksternal, tanpa protokol evaluasi yang dipublikasikan, dan tanpa pihak ketiga yang mengamati 33 siklus tersebut. Perlakukan "33 siklus iteratif" sebagai klaim vendor dan "45 setelah 40" sebagai pasangan yang terukur. Keduanya bukan jenis pernyataan yang sama, dan perbedaan itulah alasan judul berita ini layak dibaca dengan cermat alih-alih sekadar diulang.
Hal berikutnya yang perlu diperhatikan bukanlah Qwen 4. Yang perlu diperhatikan adalah apakah promosi setengah harga Qwen3.7-Max bertahan dengan kedatangan model yang dimaksudkan untuk menggantikannya. Jika tidak, banyak sekali tim akan menyadari bahwa mereka membandingkan harga daftar dengan diskon, dan bahwa yang lebih tua di antara dua saudara itu ternyata selama ini justru yang lebih mahal.
