Ulasan Qwen3.8-Max: Produk Andalan 2.4T Alibaba dengan Harga $2/$6 — Build 0902 Menduduki Puncak Code Arena WebDev
Guides & Insights

Ulasan Qwen3.8-Max: Produk Andalan 2.4T Alibaba dengan Harga $2/$6 — Build 0902 Menduduki Puncak Code Arena WebDev

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Alibaba Qwen mempratinjau Qwen3.8-Max di Konferensi AI Dunia di Shanghai pada 19 Juli 2026, dan selama dua minggu, model ini menjadi model yang paling banyak diperbincangkan yang tak seorang pun bisa benar-benar menyebutkan harganya. Tidak ada kartu tarif, tidak ada tabel tolok ukur, tidak ada kartu model, tidak ada lisensi, dan tidak ada jumlah parameter aktif — hanya tajuk utama 2,4 triliun parameter dan klaim bahwa model tersebut "hanya kalah dari Claude Fable 5."

Pada 3 Agustus 2026, hal itu berubah. Qwen3.8-Max tersedia secara umum: kartu tarif yang dipublikasikan sebesar $2 per juta token input dan $6 per juta token output, endpoint yang kompatibel dengan OpenAI dan DashScope, tabel tolok ukur lengkap, serta bobot terbuka yang dirilis pada 12 Agustus. Seminggu kemudian, pada 14 Agustus, model ini diluncurkan di DigitalOcean Serverless Inference sebagai "mitra peluncuran Hari ke-0" Alibaba — cloud besar Barat pertama yang menyediakannya. Pada 2 September, Alibaba merilis pembaruan bernama, Qwen3.8-Max-0902, yang dilatih lanjut pada Coding dan Cowork, yang menurut Qwen memperkuat kinerja pada pekerjaan perusahaan dan ilmiah yang kompleks. Tinjauan ini ditulis berdasarkan fakta GA, dengan peluncuran hari ke-0 tersebut dan build 0902 yang disertakan, dan menjawab pertanyaan yang sebenarnya dimiliki tim sekarang setelah model ini dapat dibeli: apakah Qwen3.8-Max siap menangani lalu lintas produksi, atau masih sekadar model daftar pantauan?

Jawaban singkatnya: produk ini berkembang lebih jauh dari yang diperkirakan kebanyakan orang—khususnya penetapan harganya yang agresif dengan cara yang mematok ulang harga di level terdepan, dan pembaruan 2 September semakin memperkuat dua hal yang memang sudah menjadi keunggulan model tersebut, yaitu pengodean dan kerja kolaboratif. Kartu skor independen yang kemudian terbit benar-benar bagus, tetapi ada satu peringatan yang layak dibaca sebelum Anda mengalokasikan trafik.

Singkatnya, Qwen3.8-Max kini resmi GA (Generally Available) dengan harga $2 / $6 per 1 juta token — flat di seluruh konteks 1 juta token, tanpa biaya tambahan untuk prompt panjang — lebih murah daripada Kimi K3 ($3/$15) dan Claude Opus 5 ($5/$25) pada output, komponen yang menjadi pendorong biaya untuk beban kerja penalaran. Alibaba menerbitkan tabel benchmark yang kuat (Terminal-Bench 2.1: 86,6; GPQA Diamond: 92,6; OSWorld-Verified: 86,1), dan lompatan coding-nya dibanding pendahulunya sangat dramatis: FrontierSWE 73,5 berbanding 40,7. Namun tabel kualitas itu buatan Alibaba sendiri, dan penilai independen pertama — Artificial Analysis Intelligence Index — kini telah angkat bicara: Qwen3.8-Max mencetak skor 56 dengan biaya $1,14 per tugas, setara dengan Claude Opus 4.8 (56) dan tertinggal satu poin dari pemimpin open-weights Kimi K3 (57) dengan biaya per tugas 25% lebih tinggi. Jumlah parameter aktif kini bukan lagi tanda tanya: 95 miliar parameter aktif dari total 2,4 triliun, terkonfirmasi di kartu model resmi — yang akhirnya memungkinkan pihak luar memperhitungkan ekonomi serving. Sejak ulasan ini pertama kali tayang, jalur terkelola kedua juga ikut terbuka: Qwen3.8-Max go live di DigitalOcean Serverless Inference pada 14 Agustus sebagai mitra Day 0 Alibaba, dengan angka serving yang dipublikasikan DigitalOcean — prefill yang mencapai skala sekitar 16.000 token/detik dan sekitar 1.937 token output/detik pada 256 permintaan serentak tanpa satu pun error — data latensi nyata pertama dari penyedia selain Alibaba. Pada 2 September, Alibaba menyegarkan model unggulannya menjadi Qwen3.8-Max-0902, yang selanjutnya menjalani post-training pada Coding dan Cowork; menurut Qwen, snapshot baru ini lebih kuat untuk beban kerja enterprise dan ilmiah yang kompleks — klaim vendor yang belum didukung angka independen apa pun di ranah enterprise maupun ilmiah. Sisi coding dari build 0902 kini punya hasil arena independennya sendiri: Qwen3.8-Max-0902 debut di peringkat #1 papan Code Arena: WebDev dengan 1.691 poin — naik 22 poin dari build sebelumnya dan di depan Claude Opus 5 serta Kimi K3 — menurut Alibaba, yang mengutip daftar peringkat arena pihak ketiga secara live. Narasi agentic-commerce mendapat papan skor di pekan yang sama: pada CommerceAgentBench, benchmark baru dari tim Accio milik Alibaba yang dibangun di atas replika stateful perangkat lunak commerce sungguhan, Qwen3.8-Max mencatat hasil open-weight terkuat — 156 pass agregat di tiga harness, unggul dua pass dari DeepSeek V4 Pro — tabel yang dijalankan vendor, bukan penilai independen. Kesimpulan: kini benar-benar layak dibeli, dan cukup murah untuk membenarkan evaluasi yang serius — tetapi arahkan penggunaannya secara selektif, bukan secara menyeluruh.

Poin-poin penting

GA sejak 3 Agustus 2026. Era kampanye pratinjau dan kredit telah berakhir; ada kartu tarif yang nyata dan titik akhir yang nyata.

$2 / $6 per 1M token, satu tingkatan flat untuk konteks 1M. Sebagian besar pesaing mengenakan biaya tambahan untuk prompt panjang. Alibaba tidak, dan ini sangat penting untuk pekerjaan dokumen panjang dan repositori besar.

Tabel benchmark Alibaba kuat tetapi tidak diaudit: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.

Lompatan generasi coding adalah cerita utamanya:FrontierSWE 73.5 (dari 40.7) dan DeepSWE 1.1 56.6 (dari 21.6) — hampir dua kali lipat pada keduanya.

Skor independen pertama sudah masuk: Qwen3.8-Max mencetak 56 pada AA Intelligence Index sebesar $1,14/tugas — lompatan 10 poin di atas Qwen3.7-Max (46), setara dengan Claude Opus 4.8 (56), satu poin di belakang Kimi K3 (57). Papan peringkat umum LMArena masih belum memiliki skor publik.

• Parameter aktif dikonfirmasi pada 95B — kartu model resmi menyatakan total 2.4T dan 95B yang diaktifkan, menutup pertanyaan terbuka terbesar dalam perhitungan biaya serving.

Bobot terbuka sudah dirilis — Qwen3.8-2.4T-A95B (BF16) dan Qwen3.8-2.4T-A95B-FP8 hadir di Hugging Face pada 12 Agustus dengan lisensi Qwen3.8-Max khusus, bukan Apache 2.0. Jalur on-premise Qwen3.8-27B dirilis pada 14 Agustus dengan lisensi Apache 2.0.

Jalur terkelola kedua dibuka pada 14 Agustus. Qwen3.8-Max kini tersedia di DigitalOcean Serverless Inference sebagai "mitra peluncuran Day 0" milik Alibaba — NVFP4 pada NVIDIA HGX B300, $2/$6 dengan input cache $0,20, dilayani pada konteks native 262K dari checkpoint terbuka. Angka terukur DigitalOcean (prefill ~16K token/detik, nol kesalahan pada 256 konkurensi) merupakan data performa penyajian pertama pada platform terkelola di luar Alibaba.

Pembaruan 2 September: Qwen3.8-Max-0902. Alibaba melakukan post-training lebih lanjut pada model unggulannya pada Coding dan Cowork dan menyajikannya di QwenCloud dengan harga yang sama $2/$6 dan konteks 1M. Qwen mengatakan kinerja enterprise dan ilmiah lebih kuat — masih klaim vendor — sementara sisi coding memperoleh hasil arena independen pada hari yang sama: build tersebut debut di #1 pada Code Arena: WebDev dengan skor 1.691 (lihat bullet Code Arena di bawah).

CommerceAgentBench: pemimpin open-weight, dijalankan vendor. Tim Accio dari Alibaba merilis CommerceAgentBench minggu ini — 107 tugas berhorizon panjang dalam replika stateful dari perangkat lunak bisnis dan komersial nyata, dinilai berbasis status di harness Accio, OpenClaw, dan Pi. Qwen3.8-Max memimpin model open-weight dengan 156 pass agregat, dua lebih banyak dari DeepSeek V4 Pro; model tertutup Claude Opus 5 memimpin keseluruhan dengan 191, dan tabel tersebut adalah milik Alibaba sendiri, bukan penilai independen.

Code Arena: WebDev #1 — hasil arena independen dari build 0902. Qwen3.8-Max-0902 memulai debutnya di puncak papan peringkat Code Arena: WebDev dengan 1.691 poin — naik 22 poin dari build sebelumnya dan unggul atas Claude Opus 5 serta Kimi K3 — serta memimpin frontier Pareto biaya-kinerja papan tersebut dengan harga rata-rata ~$5/MToken, sekitar seperempat dari harga rata-rata Claude Opus 5. Akun resmi QwenCloud milik Qwen mengonfirmasi posisi tersebut. Tidak seperti CommerceAgentBench, papan peringkat ini bersifat pihak ketiga: arena pemungutan suara manusia secara buta, bukan tabel buatan Alibaba, meskipun 'debut di #1' adalah pengumuman Alibaba tentang pencatatan pada titik waktu tertentu.

Catatan akurasi: tabel benchmark Qwen3.8-Max dalam ulasan ini dilaporkan oleh Alibaba dan belum direplikasi secara independen. Skor Artificial Analysis Intelligence Index (56 pada $1.14 per tugas) diukur secara independen oleh AA pada API resmi Alibaba — penilai independen pertama untuk model tersebut. Harga berasal dari kartu tarif GA Alibaba Model Studio. Repositori bobot terbuka (Qwen3.8-2.4T-A95B dan Qwen3.8-2.4T-A95B-FP8), angka 95B-aktif, dan teks lisensi bersifat first-party: semuanya berasal dari organisasi Hugging Face milik Qwen sendiri, diverifikasi pada 13 Agustus 2026. Ketersediaan DigitalOcean, kartu tarifnya, pengukuran performa serving, dan pemeriksaan spot GPQA sebesar 88 pada build terkuantisasi berasal dari dokumentasi dan tutorial komunitas DigitalOcean sendiri, yang diterbitkan bersamaan dengan pengumuman 14 Agustus; karakterisasi “mitra peluncuran Day 0” adalah bahasa pengumuman Alibaba. Jika kami mengutip angka kompetitor, angka-angka itu berasal dari Artificial Analysis atau vendor yang disebutkan langsung dalam teks. Pembaruan Qwen3.8-Max-0902 yang diumumkan pada 2 September sepenuhnya bersumber dari pernyataan vendor: spesifikasinya, deskripsi pasca-pelatihan Coding-and-Cowork, serta klaim peningkatan enterprise dan sains semuanya berasal dari pengumuman Qwen sendiri dan halaman model QwenCloud, dan tidak ada satu pun angkanya yang direproduksi secara independen. Posisi Code Arena: WebDev yang dibahas di bagian benchmark adalah satu-satunya pengecualian: papan peringkat tersebut adalah arena blind-vote pihak ketiga, bukan tabel Alibaba — meskipun “debut di #1 dengan 1.691” adalah pengumuman Alibaba tentang peringkat pada suatu titik waktu, dan skor arena terus berubah seiring bertambahnya suara. Hasil CommerceAgentBench yang dibahas di bawah ini berada dalam kategori yang sama: benchmark tersebut dibuat dan diterbitkan oleh Accio, tim Alibaba International, jadi tabel-tabelnya dilaporkan oleh Alibaba — sebuah benchmark sumber terbuka, tetapi bukan penilai independen seperti Artificial Analysis. Sebagai aturan umum, tabel benchmark vendor cenderung optimistis — perlakukan ini sebagai hipotesis untuk diuji pada beban kerja Anda sendiri, bukan sebagai peringkat yang sudah pasti.

Apa itu Qwen3.8-Max?

Qwen3.8-Max adalah model unggulan keluarga Qwen milik Alibaba: model sparse Mixture-of-Experts dengan total 2,4 triliun parameter, jendela konteks 1 juta token, dan input multimodal bawaan. Model ini menerima teks, gambar, dan video, serta mengembalikan teks. Model ini mendukung mode berpikir, pemanggilan fungsi, alat bawaan, dan output terstruktur, serta disajikan melalui endpoint /v1/chat/completions yang kompatibel dengan OpenAI, yang berarti sebagian besar integrasi yang sudah ada hanya perlu mengubah base-URL, bukan menulis ulang. Snapshot produksi saat ini, yang dirilis pada 2 September, adalah Qwen3.8-Max-0902, yang selanjutnya menjalani post-training pada Coding dan Cowork.

Angka konteks sebenarnya sedikit lebih spesifik daripada "1M" yang digunakan dalam pemasaran. Metadata cloud Alibaba mencantumkan jendela konteks 983.616 token dengan penalaran diaktifkan, input maksimum sekitar 991K token, dan output maksimum 131.072 token. Batas output itu luar biasa besar dan penting untuk tugas-tugas seperti pembuatan kode seluruh file atau penyusunan laporan panjang, di mana batas yang lebih rendah memaksa Anda untuk memecah dan menyambung. Checkpoint terbuka yang kini disediakan DigitalOcean adalah konfigurasi yang berbeda: kartu modelnya mencantumkan 262.144 token secara native, yang dapat diperluas hingga sekitar 1.010.000, sehingga penyajian pihak ketiga yang menjalankan basis terbuka biasanya akan menggunakan angka native yang lebih kecil.

Jumlah parameter aktif kini bersifat publik, dan nama repositori membawanya: A95B berarti 95 miliar yang diaktifkan. Kartu model resmi untuk Qwen3.8-2.4T-A95B menyatakan "total 2,4T dan 95B diaktifkan," sebuah Mixture-of-Experts berbutir halus dengan 512 pakar, di mana 10 pakar yang dirutekan ditambah satu pakar bersama aktif per token. Angka itu lebih penting daripada tajuk 2,4T. Untuk model padat, total parameter memberi tahu Anda kira-kira berapa biaya inferensi; untuk model MoE, angka itu hampir tidak memberi tahu apa pun — hanya jumlah aktif yang memberi tahu, karena itulah yang benar-benar berjalan per token. Model 2,4T yang mengaktifkan 30B berperilaku sangat berbeda, dalam hal latensi dan ekonomi penyajian, dibandingkan dengan model yang mengaktifkan 200B. Dengan 95B aktif, komputasi per token berada pada urutan yang sama dengan model padat di kisaran 90B — sebagian kecil dari yang dibutuhkan model padat 2,4T — yang merupakan angka yang akhirnya membuat pertanyaan hosting mandiri di bawah ini dapat dijawab.

Pembaruan 2 September: Qwen3.8-Max-0902

Pada tanggal 2 September 2026, Qwen merilis pembaruan produksi bernama pertamanya. Qwen3.8-Max-0902 mempertahankan arsitektur sparse-MoE dengan 2.4T parameter, 95B parameter aktif yang sama, dan jendela konteks 1M token yang sama, tetapi telah melalui post-training lebih lanjut pada dua kemampuan — Coding dan Cowork — dan kini tersedia di API QwenCloud sebagai qwen3.8-max-0902 (juga terdaftar sebagai qwen3.8-max-2026-09-02). Ini adalah build yang direkomendasikan saat ini, bukan cabang sampingan: endpoint qwen3.8-max tanpa tanggal milik Alibaba kini melayani snapshot 0902, sehingga panggilan ke nama model standar akan mengarah ke pembaruan ini, sementara id ber tanggal tersedia untuk tim yang ingin mengunci build tertentu. Sejak 3 September, snapshot tersebut juga telah terdaftar sebagai id model yang dapat dirutekan sendiri di API terkelola pihak ketiga. Struktur tarif tidak berubah: $2 per 1M input, $6 per 1M output, dengan tarif cache yang sama.

Klaim performa adalah klaim Qwen. Pengumuman serta laman model QwenCloud menggambarkan kapabilitas Coding yang "menerobos batas baru" pada proyek berskala engineering dan pengembangan otonom berhorizon panjang, pengalaman agen kolaboratif yang "meningkat secara signifikan" dalam orkestrasi multi-alat serta pengiriman tugas ujung-ke-ujung, dan — sebagaimana diutarakan perusahaan — performa yang lebih kuat untuk tugas enterprise yang kompleks, riset ilmiah, serta alur kerja bersiklus panjang. Pemeriksaan independen pertama muncul pada hari yang sama. Qwen3.8-Max-0902 memulai debut di posisi #1 papan peringkat Code Arena: WebDev — arena voting buta pihak ketiga untuk pengembangan web agenik, proyek yang sebelumnya dikenal sebagai WebDev Arena — dengan 1.691 poin, naik 22 poin dari versi sebelumnya dan ungguli Claude Opus 5 serta Kimi K3, menurut Alibaba yang mengutip papan peringkat live — posisi yang dikonfirmasi akun resmi Qwen pada hari yang sama dengan merujuk ke API QwenCloud. Apa yang terbukti dan tidak terbukti dari pencapaian ini diuraikan di bagian benchmark di bawah ini. Klaim selebihnya dari pembaruan ini — penalaran enterprise, pekerjaan ilmiah, dan otonomi berhorizon panjang pada umumnya — masih merupakan pernyataan vendor, jadi pertahankan disiplin yang sama seperti pada tabel Agustus: perlakukan semua itu sebagai hipotesis sampai ada pengujian Artificial Analysis atau beban kerja nyata yang mengonfirmasinya.

Yang membuat pembaruan ini menarik adalah makna "Cowork" dalam praktiknya. Qwen3.8-Max era GA sudah mengandalkan otonomi jangka panjang — proyek oh-my-cli selama 16 hari, bisnis virtual lebih dari 2.000 putaran — dan build 0902 adalah Alibaba yang kian serius menggarap poros tersebut: agen yang mengorkestrasi berbagai tool dan menyelesaikan tugas secara end-to-end, bukan sekadar jawaban sekali jalan. Pada minggu yang sama, tim Accio dari Alibaba menerbitkan CommerceAgentBench, sebuah benchmark yang dibuat untuk mengukur poros itu secara langsung: 107 tugas jangka panjang di dalam replika stateful dari perangkat lunak perdagangan dan bisnis nyata, tempat Qwen3.8-Max memimpin di antara model open-weight — dirinci pada bagian benchmark di bawah ini. Bagi tim yang mengevaluasi model ini untuk pekerjaan enterprise, itulah klaim yang harus diuji lebih dulu, karena klaim tersebut juga yang paling sulit diverifikasi hanya dari tabel benchmark.

Pricing: hal paling agresif dari peluncuran ini

Alibaba Model Studio mencantumkan Qwen3.8-Max seharga $2.00 per 1M token input dan $6.00 per 1M token output. Outputnya mencakup thinking token, yang penting karena konfigurasi dengan penalaran berat membebankan proses berpikir internalnya pada tarif output. Biaya cache: cache hit input dikenai biaya $0.25 per 1M, pembuatan cache eksplisit $2.50, dan pembacaan cache eksplisit $0.17.

Bagian yang menarik secara struktural bukanlah angka utamanya, melainkan tingkatan datar. Alibaba mengenakan biaya yang sama $2/$6 baik prompt Anda 5.000 token maupun 900.000. Sebagian besar pesaing menerapkan biaya tambahan untuk konteks panjang justru karena melayani prompt dengan hampir satu juta token itu mahal. Alibaba menyerap biaya tersebut adalah perebutan lahan yang disengaja, menyasar tepat pada beban kerja yang konteks panjangnya adalah inti: tinjauan kode seluruh repositori, analisis kontrak dan berkas, serta sintesis riset multi-dokumen.

Contoh pengerjaan. Misalnya, Anda menjalankan agen analisis repo: 200.000 token input konteks kode dan 8.000 token output per panggilan.

Per panggilan: 0.2M × $2 = $0.40 masukan, ditambah 0.008M × $6 = $0.048 keluaran. ≈ $0.45 per panggilan.

Pada 1.000 panggilan/hari: ≈ $448/hari, atau sekitar $13.400/bulan.

Panggilan yang sama terhadap Claude Opus 5 dengan $5/$25: $1.00 + $0.20 = $1.20 — kira-kira 2.7× lebih banyak.

Dengan prompt caching pada konteks kode yang stabil, input yang di-cache pada $0.25 menurunkan biaya input dari $0.40 menjadi $0.05, menjadikan biaya panggilan menjadi ≈ $0.10 — pengurangan hampir 4,5× pada lalu lintas berulang.

Perbedaan harga cache itulah tempat anggaran sesungguhnya berada. Jika agen Anda membaca ulang konteks yang hampir tidak berubah di setiap giliran—yang menggambarkan sebagian besar agen coding dan dukungan—harga efektifnya jauh lebih mendekati $0,25/$6 daripada $2/$6. Tim yang melewatkan konfigurasi cache secara rutin membayar 3–4× lebih mahal pada model ini.

Sebagai perbandingan pada harga daftar: Qwen3.8-Max $2/$6; pendahulunya sendiri Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. Pada input, Qw​en sekadar kompetitif. Pada output — sisi yang mendominasi pengeluaran dalam pekerjaan penalaran dan agen — model termurah yang diklaim frontier dalam daftar itu.

Pengukuran independen Artificial Analysis mengungkap sisi sebaliknya dari token murah tersebut. Pada Intelligence Index-nya, Qwen3.8-Max berbiaya $1.14 per tugas — lebih dari dua kali lipat $0.53 milik pendahulunya, dan 25% lebih tinggi daripada $0.86 milik Kimi K3 meskipun Kimi K3 tercantum pada $3/$15 per token. Perbedaan tersebut bersifat perilaku, bukan kenaikan harga: model ini rata-rata 64 langkah per tugas GDPval-AA versus 14 untuk Qwen3.7-Max, dan karena harness mengirim ulang seluruh percakapan di setiap langkah, token input tumbuh sekitar 15× dan output ~45%. Token murah tidak sama dengan agen murah — kata-kata bertele-tele yang disorot oleh penguji pratinjau kini memiliki label harga yang terukur. Karena OrcaRouter meneruskan harga daftar dengan markup 0% di balik satu endpoint yang kompatibel dengan OpenAI, pertanyaan $1.14-versus-$0.86 itu adalah sesuatu yang dapat Anda ukur pada prompt yang identik tanpa kontrak kedua.

Tabel tolok ukur, dan apa yang sebenarnya diukur oleh setiap angka

Pada GA, Alibaba menerbitkan tabel yang disembunyikannya saat pratinjau. Skor yang dilaporkan:

Terminal-Bench 2.1 — 86.6. Mengukur apakah sebuah model dapat mengoperasikan shell nyata hingga selesai: menjalankan perintah, membaca keluaran, dan pulih dari kesalahan. Ini adalah proksi terdekat untuk "dapatkah ia berfungsi sebagai agen pengodean, bukan sekadar pemberi saran kode."

GPQA Diamond — 92.6. Pertanyaan fisika, kimia, dan biologi tingkat pascasarjana yang ditulis agar tahan terhadap pencarian jawaban. Skor tinggi menunjukkan penalaran ilmiah yang sesungguhnya, bukan sekadar hafalan. 92.6 berada di puncak bidang saat ini.

PaperBench — 93.0. Mereproduksi hasil dari makalah penelitian — membaca metodologi dan mengimplementasikannya kembali. Memberi penghargaan pada pemahaman multi-langkah yang berkelanjutan.

IFBench — 82.8. Kepatuhan terhadap instruksi dengan batasan: format, panjang, dan instruksi negatif. Tercatat sebagai skor terendah di tabel milik Alibaba sendiri, yang konsisten dengan keluhan era pratinjau bahwa model tersebut terlalu teliti sampai-sampai mengabaikan batas cakupan.

OSWorld-Verified — 86.1. Penggunaan komputer: mengendalikan GUI desktop nyata untuk menyelesaikan tugas. Kekuatan di bidang ini mendukung positioning agentic.

OmniDocBench 1.5 — 92.1.Parsing dokumen — tabel, tata letak, teks dan gambar campuran. Berpasangan dengan konteks tarif tetap 1M untuk membangun kasus nyata bagi pipeline dokumen.

FrontierSWE — 73.5, naik dari 40.7 pendahulunya. DeepSWE 1.1 — 56.6, naik dari 21.6.

Dua hal terakhir itu perlu ditekankan. Hampir dua kali lipatnya capaian pada tolok ukur rekayasa perangkat lunak yang sulit dalam satu generasi bukanlah peningkatan inkremental yang normal, dan hal itu konsisten dengan keputusan Alibaba untuk memasarkan model ini kepada pengembang, bukan pengguna chat. Jika angka FrontierSWE bertahan dalam replikasi independen, Qwen3.8-Max adalah model pengodean yang serius, bukan sekadar model yang besar.

Peringatan dalam pratinjau telah menyusut, tetapi belum hilang sepenuhnya. Tabel di atas dibuat oleh Alibaba, dengan kerangka uji miliknya sendiri, dalam kondisi yang tidak dapat diperiksa oleh pihak lain. Tabel-tabel dari vendor dipilih, bukan diambil acak — lab menerbitkan benchmark yang mereka kuasai. Namun, per 6 Agustus sudah ada penilai independen yang sesungguhnya: Artificial Analysis telah memberi skor kepada Qwen3.8-Max sebesar 56 pada Intelligence Index dengan biaya $1,14 per tugas, yang diukur pada API resmi Alibaba — lompatan 10 poin dibanding pendahulunya yang meraih 46, sejajar dengan Claude Opus 4.8 (56), dan tertinggal satu poin dari Kimi K3 (57). Pada leaderboard agentik GDPval-AA milik AA, model ini mencapai 1.739 Elo, melampaui Kimi K3 (1.685) dan GPT-5.6 Sol (1.730), dengan hanya Claude Opus 5 (1.852) yang berada di depannya. Peringatan dari AA sendiri juga patut diberi bobot yang sama: uji coba sebelumnya mencetak 53 sebelum masalah endpoint dituntaskan, dan pengujian ulang pada API resmi menghasilkan 56; AA-Omniscience turun 10 poin seiring tingkat halusinasi yang naik dari 23% menjadi 40%; dan biaya per tugas memang tinggi justru karena model ini menempuh langkah yang jauh lebih banyak. Leaderboard umum LMArena masih belum memiliki skor publik.

Peluncuran DigitalOcean menambah titik data ketiga, kali ini pada build terkuantisasi, bukan pada produk unggulan. Pemeriksaan internal DigitalOcean sendiri terhadap bobot NVFP4 yang disajikannya mendapat skor 88 pada GPQA Diamond, dibandingkan dengan 92.6 yang dipublikasikan Alibaba untuk produk unggulan yang tidak terkuantisasi. DigitalOcean sendiri menyebut perbandingan ini sebagai "titik data indikatif, bukan perbandingan terkontrol" — perbedaannya berjalan pada tiga sumbu (basis open-weights, bukan produk unggulan yang di-host; NVFP4, bukan BF16; dan tumpukan evaluasi yang berbeda) — tetapi ini adalah pemeriksaan independen pertama pada penerapan nyata dari bobot-bobot ini, dan pengingat bahwa checkpoint terbuka tersebut bukanlah angka yang sama persis dengan yang ada di tabel Alibaba.

CommerceAgentBench: papan skor perdagangan agentik

Seiring dengan pembaruan tersebut, tim Accio dari Alibaba International merilis CommerceAgentBench, sebuah benchmark yang dirancang untuk menilai secara tepat pekerjaan jangka panjang yang terus dipromosikan Qwen. Setiap tugas dimulai oleh agen di dalam kontainer baru di salah satu dari 14 replika offline perangkat lunak bisnis dan perdagangan nyata — penerbitan produk, pemesanan pengiriman, administrasi toko, operasi pembayaran, analisis pemasok — dan penilaiannya berbasis status: sebuah tugas hanya lulus ketika layanan mock yang mendasari serta file yang dihasilkan benar-benar berubah, sehingga agen yang hanya menjelaskan alur kerja yang masuk akal tanpa mengubah status akan bernilai nol. Rangkaian ini menjalankan 107 tugas di berbagai antarmuka — CLI, peramban, file/dokumen, dan API/MCP — dieksekusi melalui tiga harness: Accio, OpenClaw, dan Pi — dan kode harness (Apache 2.0) serta data tugas (CC BY 4.0) terbuka untuk diperiksa atau dijalankan ulang.

Pada tabel yang dipublikasikan, Qwen3.8-Max mencatat hasil open-weight terkuat: 56 dari 107 tugas pada harness Accio, 47 pada OpenClaw, dan 53 pada Pi — 156 lolos agregat, dua angka di depan DeepSeek V4 Pro yang mencapai 154. Seluruh keunggulan open-weight berasal dari harness Accio; kedua model seri pada OpenClaw dan Pi. Pemimpin open-weight bukanlah pemimpin keseluruhan: model tertutup Claude Opus 5 mengungguli semua dengan 191 lolos agregat, unggul 35 angka. Dan tabel itu adalah buatan Alibaba sendiri — Accio adalah tim Alibaba, dan repositorinya sendiri menandai batasan audit: harness Accio hanya referensi dan tidak dapat direproduksi dari checkout (OpenClaw adalah jalur yang dapat dijalankan ulang), hasil tingkat tugas tidak memiliki checksum publik yang tidak dapat diubah, dan baris Qwen mengandalkan protokol replay konten penalaran agar tetap sebanding. Anggap ini sebagai titik data yang dinyatakan vendor pada sumbu agen yang sama — yang didekati OSWorld-Verified dan GDPval-AA milik AA dari sudut berbeda — layak diuji terhadap alur kerja Anda sendiri, bukan peringkat yang sudah mapan.

Code Arena WebDev: wasit independen untuk build 0902

Code Arena adalah bukti independen yang kurang dari pembaruan tersebut. Ini adalah papan peringkat pihak ketiga untuk pengembangan web agentik — proyek yang sebelumnya dikenal sebagai WebDev Arena — tempat suara manusia secara buta dan berpasangan tentang output model mana yang lebih ingin dikirim pengguna diubah menjadi peringkat bergaya Elo. Di papan WebDev-nya, Qwen3.8-Max-0902 debut di posisi teratas dengan 1.691 poin, naik 22 dari build sebelumnya, dan berada di depan Claude Opus 5 serta Kimi K3. Posisi ini juga memiliki keunggulan efisiensi biaya: dengan harga campuran sekitar $5 per juta token — tarif daftar $2/$6 yang dibobotkan pada campuran yang didominasi output, sebagaimana yang sebenarnya dihasilkan oleh pembuatan aplikasi web — build 0902 adalah model dengan skor tertinggi di frontier Pareto papan tersebut, dengan biaya sekitar seperempat dari harga campuran ~$20/M milik Claude Opus 5 dan jauh di bawah ~$12/M milik Kimi K3; itulah sebabnya keduanya berada di luar frontier meskipun menempati peringkat #2 dan #3 dalam hal skor. Alibaba mengumumkan posisi ini pada 2 September dan akun resmi Qwen mengonfirmasinya, mengarahkan pengguna ke QwenCloud; pengukuran ini bukan milik Alibaba: tidak seperti tabel benchmark di atas atau hasil CommerceAgentBench tepat di atasnya, skor ini dihasilkan oleh arena pihak ketiga dari suara preferensi manusia.

Dua catatan membuatnya tetap jujur. Pertama, peringkat arena hanya berlaku pada titik waktu tertentu: 1.691 adalah posisi papan saat Alibaba mengumumkan debutnya, dan angka itu akan bergeser seiring bertambahnya suara, jadi bacalah sebagai sinyal kuat tentang pengodean pengembangan web, bukan mahkota permanen. Kedua, peringkat itu hanya mencakup satu sumbu tersebut. Klaim refresh tentang enterprise, ilmiah, dan cakrawala panjang umum masih belum memiliki wasit independen, itulah sebabnya tabel vendor dan Indeks AA 56 pada model dasar tetap menjadi titik acuan untuk segala hal di luar pekerjaan front-end agentik. Ketiga, harga frontier adalah pilihan pemodelan, bukan kartu tarif baru: angka ~$5/MToken memadukan daftar $2/$6 yang tidak berubah dengan asumsi penggunaan yang berat pada keluaran, jadi perlakukan sebagai peringkat efisiensi biaya berdasarkan ketentuan arena itu sendiri, bukan penetapan ulang harga oleh Alibaba.

Bobot terbuka, Qwen3.8-27B, dan persoalan on-premise

Janji open-weight Alibaba kini ditepati. Pada 12 Agustus 2026, Qwen menerbitkan dua repositori di Hugging Face — Qwen3.8-2.4T-A95B dalam BF16 dan Qwen3.8-2.4T-A95B-FP8 — masing-masing dengan 213 file bobot. Lisensinya adalah lisensi khusus Qwen3.8-Max, bukan Apache 2.0; kolom lisensi di Hugging Face bertuliskan "other." Ketentuannya mengizinkan penggunaan, modifikasi, distribusi, dan fine-tuning, termasuk penggunaan komersial, dengan atribusi, ditambah dua batasan berbasis skala: produk dengan lebih dari 100 juta pengguna aktif bulanan atau pendapatan bulanan di atas $20 juta harus menampilkan nama model secara menonjol, dan bisnis Model-as-a-Service atau AI-Work-Assistant dengan pendapatan agregat dua belas bulan terakhir di atas $50 juta memerlukan lisensi terpisah dari Qwen. Sebagian besar tim berada di dalam batasan tersebut; jika bisnis Anda melewatinya, baca teks lisensi sebelum membangun di atasnya. Penghitung unduhan mengonfirmasi kebaruan rilis ini — 978 di repositori BF16 dan 3.851 di repositori FP8 hingga tulisan ini dibuat, angka yang rendah untuk rilis kelas frontier dan konsisten dengan repositori yang dibuat pada 8 Agustus dan baru dibuka untuk publik pada 12 Agustus, bukan repositori yang sudah terlihat selama seminggu. Satu catatan kejujuran lagi: checkpoint terbuka adalah model dasar, khusus teks dengan mode berpikir yang selalu aktif, sementara API Qwen3.8-Max yang di-host menambahkan input visi, mode non-thinking opsional, dan konteks penuh 1M — mengunduh bobot memberi Anda modelnya, bukan semua fitur API.

Self-hosting model andalan masih di luar jangkauan sebagian besar tim, tetapi kini di luar jangkauan dengan perhitungan yang diketahui. Set bobot lengkap dengan 2,4 triliun parameter berukuran kira-kira 4,9TB dalam BF16 dan sekitar 2,4TB dalam FP8, karena setiap expert harus berada di memori meskipun hanya 95 miliar yang diaktifkan per token. Pada kuantisasi 4-bit, ukurannya sekitar 1,2TB dibandingkan dengan kira-kira 141GB per H200, jadi Anda membutuhkan delapan atau lebih akselerator kelas atas sebelum melayani satu token pun. Yang ditambahkan oleh jumlah aktif yang kini publik adalah sisi throughput: dengan 95 miliar parameter diaktifkan per token, komputasi per token sebanding dengan model dense di kelas ~90 miliar — sebagian kecil dari biaya yang akan ditanggung model dense 2,4 triliun — sehingga begitu bobot berada di memori, biaya per token bukanlah mimpi buruk seperti yang disiratkan oleh angka total parameter. Kombinasi jejak memori yang besar dan komputasi per token yang sederhana inilah yang menjadi alasan Alibaba dapat mematok harga output di $6/1M, dan ini mengarahkan tim self-hosting ke node multi-GPU yang menjalankan checkpoint FP8, bukan ke hal-hal yang hanya menggunakan satu GPU.

Pilihan penyajian DigitalOcean adalah contoh nyata dari matematika tersebut dalam produksi. Ia menjalankan model yang dikuantisasi NVFP4 pada GPU NVIDIA HGX B300 secara khusus agar bobot 2,4T muat di satu node, menghindari perutean pakar antar-node — penerapan langsung dari ekonomi 4-bit yang telah dilakukan bagian ini di atas kertas. Pertukarannya persis seperti yang dikuantifikasi oleh pemeriksaan titik GPQA di atas: jejak yang lebih kecil, dengan biaya kualitas yang terukur dibandingkan dengan produk unggulan yang tidak terkuantisasi.

Dan inilah yang menjadikan Qwen3.8-27B rilis yang lebih penting bagi sebagian besar pembaca — dan tidak seperti model unggulannya, bobotnya dirilis sesuai jadwal. Pada 14 Agustus 2026, Qwen menerbitkan Qwen/Qwen3.8-27B di Hugging Face dan ModelScope di bawah lisensi Apache 2.0: sebuah model dense 27B, multimodal secara native, dengan konteks native 262K token yang dapat diperluas hingga 1M dan mode reasoning_effort yang dapat dikonfigurasi. Daniel Han dari Unsloth memperkirakan model ini dapat berjalan di sekitar 17GB VRAM — satu kartu grafis prosumer — dan itu kini dapat diuji: repositori resmi menyediakan safetensors BF16 (sekitar 55.6GB dalam 18 shard), dengan kuantisasi GGUF menyusul di repositori komunitas. Jadi pola rilis generasi ini kini lengkap: bobot model unggulan 2.4T dirilis lebih dulu pada 12 Agustus, dan model kecil untuk jalur on-premise dirilis dua hari kemudian. Kami melacak rilisnya dalam postingan tanggal rilis Qwen3.8-27B kami.

Di mana Qwen3.8-Max cocok: empat skenario

1. Analisis dokumen panjang dan kontrak. Ini adalah kecocokan terkuat. Tarif flat untuk 1M token plus OmniDocBench 92.1 berarti Anda dapat memproses dokumen setebal 400 halaman dalam satu panggilan tanpa biaya tambahan dan tanpa memecah-mecah. Kompetitor yang mengenakan premi konteks panjang membuat pekerjaan yang sama jauh lebih mahal. Pada jalur DigitalOcean, ingat bahwa jalur tersebut melayani basis terbuka pada konteks 262K — masih merupakan dokumen besar, tetapi tidak mencapai satu juta penuh.

2. Agen pengkodean skala repositori. Terminal-Bench 86.6 dan FrontierSWE 73.5 mendukung hal ini, dan harga cache membuat pengerjaan iteratif pada codebase yang stabil menjadi murah. Hal yang perlu diuji pertama adalah latensi pada konkurensi Anda sendiri, karena pengulas era pratinjau menemukan model ini teliti tetapi lambat pada proses agentik yang panjang, dan layanan GA berbeda dari layanan pratinjau. Hasil GDPval-AA dari AA — Elo 1.739 terdepan dengan biaya 64 langkah per tugas — adalah konfirmasi independen dari kedua sisi trade-off tersebut. Pengukuran DigitalOcean pada 12 Agustus — throughput agregat yang diskalakan hampir linear hingga ~1.937 token keluaran/detik pada 256 permintaan bersamaan dengan nol kesalahan dan tanpa saturasi yang ditemukan — adalah titik data platform terkelola pertama mengenai pertanyaan tersebut, meskipun angka tersebut adalah angka DigitalOcean sendiri pada layanannya sendiri, bukan perbandingan langsung dengan Alibaba.

3. Pipeline dokumen dan tangkapan layar.Input video dan gambar ditambah OSWorld-Verified 86.1 menjadikannya kredibel untuk alur kerja yang membaca layar — otomatisasi QA, triage dukungan dari tangkapan layar, tugas-tugas terkait RPA. Sekali lagi, input multimodal adalah fitur API yang di-hosting; jalur open-base DigitalOcean hanya mendukung teks.

4. Yang belum kami terapkan. UX interaktif yang sensitif terhadap latensi dan beban kerja yang diatur yang memerlukan evaluasi yang dapat direproduksi. Untuk yang pertama, Anda menginginkan throughput terukur yang Anda kendalikan. Untuk yang kedua, reproduksibilitas kini memiliki kartu model dan lisensi untuk dikutip, tetapi tabel tolok ukur Alibaba masih belum direplikasi — dan regresi Omniscience AA (tingkat halusinasi hingga 40%) adalah pengingat bahwa skor independen itu bisa menjadi pisau bermata dua.

Cara mengakses Qwen3.8-Max

Ada beberapa jalur praktis. Langsung melalui Alibaba Model Studio / DashScope — atau API QwenCloud milik Qwen sendiri — memberi Anda kartu tarif di atas dan akses paling awal ke snapshot baru berangka tanggal — build Qwen3.8-Max-0902 tanggal 2 September muncul pertama kali di sana sebelum diluncurkan ke endpoint lain — dengan biaya berupa orientasi vendor baru dan pengelolaan kunci lain. Qwen Chat dan Aplikasi Qwen adalah cara tercepat untuk mengamati perilaku sebelum menulis kode. Mengunduh bobot terbuka dari Hugging Face adalah jalur keempat bagi tim yang ingin menjalankan infrastruktur mereka sendiri — dengan peringatan ukuran dan lisensi di atas. Melalui router adalah opsi yang paling perlu dipertimbangkan sebagian besar tim produksi, karena opsi ini menghilangkan keputusan migrasi dari keputusan evaluasi.

Sejak 14 Agustus 2026, ada opsi yang benar-benar baru: Qwen3.8-Max telah aktif di DigitalOcean Serverless Inference, yang diumumkan Alibaba sebagai "mitra peluncuran Day 0" — istilah Alibaba sendiri, meskipun daftar tersebut milik DigitalOcean dan berdiri sendiri. DigitalOcean menyajikan checkpoint open-weights (id model platform qwen3.8-max), terkuantisasi NVFP4 pada GPU NVIDIA HGX B300 dalam kolaborasi teknis dengan Inferact, sebagai API serverless yang dikelola sepenuhnya: satu endpoint, harga berbasis pemakaian, tanpa infrastruktur untuk dikelola. Struktur tarifnya sama dengan daftar Alibaba — $2.00 input / $6.00 output per 1M, dengan input yang di-cache sebesar $0.20 — dan ia menyajikan native dari basis terbuka, yaitu 262K context dengan mode berpikir selalu aktif, bukan mode multimodal ~1M token dari model unggulan yang di-host. Batas konteks tersebut penting jika beban kerja Anda condong ke sisi panjang: mode satu juta token penuh tetap hanya tersedia melalui API Alibaba.

Apa yang ditambahkan jalur DigitalOcean melampaui geografi adalah data penyajian nyata pertama dari penyedia selain Alibaba. Pengukuran DigitalOcean sendiri terhadap endpoint produksinya, yang diambil pada 12 Agustus, menunjukkan penskalaan prefill secara linear sekitar 16.000 token/detik — aturan praktis TTFT ≈ (input ÷ 16.000) + 0,7 detik, jadi ~1,1 detik pada ~1.080 token dan ~15,8 detik pada ~254K — dan throughput agregat mencapai ~1.937 token output/detik pada 256 permintaan bersamaan dengan nol kesalahan dan tidak ada titik jenuh yang ditemukan. Itu adalah angka DigitalOcean pada penerapannya sendiri, bukan adu performa terkontrol, tetapi ini adalah data latensi-dan-konkurensi pertama pada model ini di luar cloud Alibaba, dan secara langsung menjawab kekhawatiran "teliti tetapi lambat" dari era pratinjau.

Qwen3.8-Max telah aktif di OrcaRouter sebagai qwen/qwen3.8-max, dan pembaruan 2 September dapat dirutekan dengan id bertanggalnya sendiri — qwen/qwen3.8-max-0902 — keduanya dengan tarif daftar yang sama $2.00 / $6.00. OrcaRouter menerapkan markup 0% dan meneruskan harga penyedia secara langsung, sehingga biaya kedua rute sama dengan akses langsung. Telemetri layanan kami sendiri saat ini menunjukkan p50 time-to-first-token sebesar 1,64 detik selama jendela 7 hari. Itu adalah pengukuran latensi pihak pertama, bukan klaim vendor, dan perlu dibandingkan dengan laporan era pratinjau yang menyebut "model paling lambat yang pernah saya gunakan": laporan-laporan itu berasal dari satu peninjau yang menjalankan build agen selama berjam-jam di infrastruktur pratinjau, dan harus diuji ulang pada layanan GA, bukan diulang sebagai fakta saat ini.

Nilai praktis dari jalur router adalah bahwa Qwen3.8-Max berada di belakang endpoint yang kompatibel dengan OpenAI yang sama dengan model yang sudah Anda jalankan, sehingga evaluasi hanyalah perubahan string model. Anda dapat mengirim 5% lalu lintas produksi ke model tersebut, membandingkannya dengan model incumbent Anda pada prompt yang identik, dan tetap memiliki fallback — yang merupakan pendekatan yang memang layak untuk model dengan tabel vendor yang tidak direplikasi. Pendekatan yang sama adalah cara yang tepat untuk menguji deployment DigitalOcean: jalankan sebagian lalu lintas ke model tersebut dengan fallback yang tersedia, daripada mempertaruhkan jalur produksi pada stack penyajian yang baru berusia dua minggu.

Keterbatasan dan risiko yang jujur

Tabel vendor masih belum diaudit. Skor independennya sudah masuk (AA Index 56), tetapi tabel benchmark Alibaba sendiri masih belum direplikasi, dan pengukuran AA menandai regresi Omniscience dengan tingkat halusinasi hingga 40%. Penilaian independen membantu; namun tidak membuat tabel vendor dapat diaudit.

Jalur DigitalOcean adalah basis terbuka, bukan yang unggulan.Layanan ini menyajikan checkpoint pada konteks 262K, hanya teks, pemikiran selalu aktif, dikuantisasi NVFP4 — dan skor spot-check DigitalOcean sendiri yang mencapai 88 pada GPQA Diamond dibandingkan dengan 92.6 yang dipublikasikan Alibaba, sebuah kesenjangan yang oleh DigitalOcean disebut indikatif daripada terkontrol. Jika Anda membutuhkan API multimodal jutaan token penuh, itu masih dihosting oleh Alibaba.

Qwen3.8-27B sudah dirilis, tetapi penomoran versinya dilakukan oleh vendor. Bobot model 27B dirilis pada 14 Agustus dengan lisensi Apache 2.0, menutup kesenjangan on-premise — tetapi klaim benchmark-nya hanya berdasarkan laporan Alibaba dan belum direplikasi, dan kuantisasi dari komunitas masih digulirkan per pembaruan ini.

• Lisensi khusus, bukan Apache 2.0. Lisensi Qwen3.8-Max mengizinkan penggunaan komersial dengan atribusi, tetapi memberlakukan dua ambang batas skala — penampilan nama model yang menonjol di atas 100 juta MAU atau pendapatan bulanan $20 juta, serta lisensi terpisah untuk bisnis MaaS/AI-Work-Assistant dengan pendapatan di atas $50 juta dalam dua belas bulan terakhir. Bacalah sebelum Anda berkembang melampaui ambang batas tersebut.

Kebertele-telean dan penyimpangan instruksi.IFBench 82.8 adalah angka terlemah dalam tabel milik Alibaba sendiri, dan para penguji pratinjau berulang kali melihat model melampaui cakupan — menambahkan fitur yang tidak diminta. Angka AA sendiri kini memberi angkanya: 64 langkah per tugas GDPval-AA itulah yang mendorong biaya menjadi $1,14, 25% di atas Kimi K3. Menarik dalam demo, mahal saat keluaran ditagih dengan harga $6/1M, dan mengganggu stabilitas saat Anda membutuhkan format yang presisi.

Batasan konten. Seperti model frontier yang dihosting di China lainnya, respons terhadap topik yang sensitif secara politik dibatasi. Relevan jika produk Anda melayani kueri terbuka.

Token pemikiran ditagih sebagai output. Dengan penalaran diaktifkan, biaya riil melampaui perkiraan naif. Ukur dengan penalaran yang dikonfigurasi sesuai cara Anda benar-benar akan mengirimkannya.

FAQ

Apakah Qwen3.8-Max tersedia sekarang?

Ya. Ini mencapai ketersediaan umum pada 3 Agustus 2026, dengan kartu tarif yang diterbitkan dan API yang kompatibel dengan OpenAI dan DashScope. Snapshot produksi saat ini — Qwen3.8-Max-0902, dirilis 2 September — aktif di API QwenCloud dan itulah yang sekarang dilayani oleh endpoint qwen3.8-max standar. Ini adalah perubahan dari status pratinjau 19 Juli, ketika akses dibatasi untuk Qwen Chat, Aplikasi Qwen, dan kampanye kredit Qoder.

Apa itu Qwen3.8-Max-0902?

Qwen3.8-Max-0902 adalah penyegaran produksi Qwen3.8-Max pada 2 September 2026: unggulan sparse-MoE berparameter 2.4T yang sama dengan konteks 1M-token, yang dilatih lanjut pada Coding dan Cowork, dan tersedia di API QwenCloud dengan harga $2/$6 yang sama. Qwen menyebutkan bahwa snapshot baru ini lebih kuat pada tugas enterprise dan ilmiah yang kompleks — klaim vendor, belum diuji tolok ukur secara independen — sementara pada sumbu coding, ia sudah memiliki hasil independen: #1 di papan Code Arena: WebDev dengan 1.691 poin dan puncak frontier Pareto biaya-kinerjanya dengan campuran sekitar $5/MToken, menurut pengumuman Alibaba tentang daftar arena langsung, yang dikonfirmasi oleh akun QwenCloud milik Qwen sendiri.

Berapa harga Qwen3.8-Max?

$2,00 per 1M token input dan $6,00 per 1M token output, tetap untuk seluruh konteks 1M token penuh tanpa biaya tambahan untuk prompt panjang. Cache input yang cocok dikenakan biaya $0,25 per 1M, pembuatan cache eksplisit $2,50, dan pembacaan cache $0,17. Token berpikir ditagih dengan tarif output. Pada Intelligence Index milik Artificial Analysis, biaya terukur model adalah $1,14 per tugas — lihat bagian harga untuk alasan mengapa angka tersebut di atas perhitungan token. Jalur serverless DigitalOcean mencantumkan $2/$6 yang sama dengan input cache sebesar $0,20.

Berapa banyak parameter yang dimiliki Qwen3.8-Max?

Total 2,4 triliun, dalam konfigurasi sparse Mixture-of-Experts. Jumlah parameter aktif — angka yang sebenarnya menentukan biaya dan latensi penyajian — kini dikonfirmasi sebesar 95 miliar yang diaktifkan, sesuai kartu model resmi untuk Qwen3.8-2.4T-A95B (512 expert; 10 routed plus satu shared active per token).

Apakah bobot Qwen3.8-Max terbuka?

Ya — sejak 12 Agustus 2026. Qwen menerbitkan Qwen3.8-2.4T-A95B (BF16) dan Qwen3.8-2.4T-A95B-FP8 di Hugging Face, masing-masing dengan 213 file bobot. Lisensinya adalah lisensi Qwen3.8-Max khusus (Hugging Face mencantumkannya sebagai "other"), bukan Apache 2.0: lisensi ini mengizinkan penggunaan komersial dengan atribusi dan membawa dua batasan berbasis skala. Checkpoint yang terbuka hanya berupa teks dengan mode berpikir yang selalu aktif; API yang dihosting menambahkan visi, mode non-berpikir opsional, dan konteks 1M penuh.

Apakah Qwen3.8-Max telah di-benchmark secara independen?

Ya — per 6 Agustus 2026. Artificial Analysis memberinya skor 56 pada Intelligence Index-nya dengan harga $1,14 per tugas, yang diukur pada API resmi Alibaba: lonjakan 10 poin di atas Qwen3.7-Max (46), setara dengan Claude Opus 4.8 (56), dan satu poin di belakang Kimi K3 (57). Namun, tabel tolok ukur di atas masih merupakan laporan Alibaba yang belum direplikasi, dan papan peringkat umum LMArena masih belum memiliki skor publik. Gambaran arena independen berubah pada 2 September: pembaruan 0902 memulai debutnya di #1 pada papan Code Arena: WebDev di platform yang sama dengan 1.691 poin — hasil pemungutan suara buta dari pihak ketiga, bukan tabel Alibaba — dan frontier biaya-kinerja Code Arena menempatkannya sebagai pilihan dengan skor tertinggi di papan tersebut dengan biaya gabungan sekitar $5/MToken. Pemeriksaan spot DigitalOcean terhadap build terkuantisasinya (88 pada GPQA Diamond) merupakan pemeriksaan pihak ketiga pertama pada deployment serving, dan secara eksplisit bersifat indikatif, bukan terkontrol. Satu peringatan untuk kolom "independen": CommerceAgentBench, tempat Qwen3.8-Max memimpin di antara model open-weight, bukanlah wasit independen kedua — Accio, yang membangun dan menerbitkannya, adalah tim Alibaba sendiri.

Apakah Qwen3.8-Max lebih baik daripada Qwen3.7-Max?

Berdasarkan angka Alibaba sendiri, secara substansial — FrontierSWE 73.5 versus 40.7 dan DeepSWE 1.1 56.6 versus 21.6 hampir dua kali lipat pada tugas-tugas rekayasa perangkat lunak yang sulit. Harganya juga lebih murah daripada pendahulunya yang $2.50/$7.50. Secara independen, AA menempatkan lonjakan generasi pada 10 poin di Indeks Intelijennya (56 versus 46). Kedua klaim vendor tersebut masih perlu diverifikasi pada beban kerja Anda.

Bisakah saya menghosting sendiri Qwen3.8-Max?

Secara praktis tidak. Set bobot 2.4T penuh berukuran kira-kira 4,9TB dalam BF16 dan sekitar 2,4TB dalam FP8, sekitar 1,2TB pada 4-bit — dibandingkan dengan sekitar 141GB per H200, itu berarti delapan GPU kelas atas atau lebih. Dengan 95B aktif per token, biaya komputasi per token relatif rendah, tetapi jejak memorilah kendala utamanya. Layanan NVFP4 DigitalOcean pada B300 adalah bukti nyata bahwa 4-bit dapat memuat model pada satu node. Qwen3.8-27B — yang dilaporkan memakai sekitar ~17GB VRAM — adalah opsi on-premise yang realistis, dan bobotnya dirilis pada 14 Agustus 2026 di bawah Apache 2.0 — kini dapat diunduh, bukan sekadar janji.

Apa itu Qwen3.8-27B?

Model yang jauh lebih kecil ini, yang diumumkan bersamaan dengan model andalan, diposisikan sebagai jalur penerapan on-premise yang praktis. Model ini adalah model dense 27B, multimodal secara native, dengan konteks native 262K token yang dapat diperluas hingga 1M, serta dirilis di bawah lisensi Apache 2.0. Bobotnya tersedia di Hugging Face dan ModelScope pada 14 Agustus 2026; Daniel Han dari Unsloth melaporkan bahwa model ini dapat berjalan dalam sekitar 17GB VRAM — satu kartu grafis konsumen kelas atas. Klaim tolok ukurnya berasal dari laporan Alibaba dan belum direproduksi secara independen.

Apakah Qwen3.8-Max multimodal?

Ya — ia menerima input teks, gambar, dan video serta mengembalikan teks. Ia juga mendukung mode berpikir, pemanggilan fungsi, alat bawaan, dan keluaran terstruktur. Checkpoint dengan bobot terbuka hanya mendukung teks; input multimodal adalah fitur dari API yang dihosting, yang tidak dibawa oleh jalur DigitalOcean.

Apakah Qwen3.8-Max tersedia di DigitalOcean?

Ya — sejak 14 Agustus 2026. DigitalOcean Serverless Inference menyajikan checkpoint open-weights (NVFP4 pada NVIDIA HGX B300) dengan harga $2,00/$6,00 per 1M dengan $0,20 untuk input cache, konteks 262K token, khusus teks, thinking selalu aktif. Alibaba menyebut DigitalOcean sebagai "mitra peluncuran Hari 0"; daftar itu sendiri milik DigitalOcean dan independen dari bahasa tersebut. Angka yang diukur DigitalOcean: prefill ~16K token/detik dan ~1.937 token output/detik pada 256 permintaan bersamaan dengan nol kesalahan.

Bisakah saya menggunakan Qwen3.8-Max melalui OrcaRouter?

Ya. Model ini sudah aktif sebagai qwen/qwen3.8-max, dan snapshot 2 September hadir dengan id berlabel tanggalnya sendiri — qwen/qwen3.8-max-0902 — dengan harga daftar yang sama yaitu $2.00/$6.00, tanpa markup. Biaya routing sama dengan akses langsung, melalui endpoint yang kompatibel dengan OpenAI yang sudah Anda gunakan. Telemetri 7 hari kami menunjukkan p50 time-to-first-token sebesar 1,64 detik.

Haruskah saya memindahkan lalu lintas produksi ke sana hari ini?

Bukan sekaligus. Penetapan harga dan skor independen pertama membuat evaluasi serius menjadi murah dan layak dilakukan sekarang, tetapi dengan biaya per tugas 25% lebih tinggi daripada Kimi K3, langkah yang disiplin adalah pembagian lalu lintas terhadap sistem yang Anda gunakan saat ini pada prompt yang identik, dengan fallback yang tersedia — bukan migrasi. Jalur DigitalOcean menambahkan deployment terkelola kedua untuk diuji, yang membuat evaluasi menjadi lebih murah lagi.

Intinya

Qwen3.8-Max menghabiskan dua minggu sebagai model paling menarik yang tidak bisa dibeli siapa pun. Pada GA, ia merupakan proposisi yang benar-benar berbeda: harga flat $2/$6 per sejuta token adalah penetapan harga yang agresif, tarif cache membuat kerja agen iteratif menjadi murah, dan lompatan generasi pada FrontierSWE dan DeepSWE — jika terbukti — menjadikannya model pengodean yang nyata, bukan sekadar pamer skala. Bobot terbuka yang hadir dengan lisensi resmi pada 12 Agustus mengubah "bobot terbuka segera hadir" dari janji menjadi fakta, dan jalur DigitalOcean pada hari pertama yang diumumkan pada 14 Agustus — dengan angka pelayanan terukur dan cache read $0.20 — memperkuat kasus "coba dengan murah" serta memberi tim penerapan pihak ketiga terkelola untuk dibandingkan dengan API Alibaba sendiri. Pembaruan Qwen3.8-Max-0902 pada 2 September menjaga tesis itu tetap utuh: $2/$6 yang sama dan konteks 1M, dengan lebih banyak post-training pada pengodean dan kerja kolaboratif yang memang sudah menjadi posisi model tersebut. Pembaruan itu juga menambahkan papan skor preferensi manusia yang independen untuk tawaran pengodean tersebut: Qwen3.8-Max-0902 debut di #1 di papan WebDev Code Arena dengan 1.691 poin, mengungguli Claude Opus 5 dan Kimi K3, dan dengan ~$5/MToken gabungan, ia adalah model dengan skor tertinggi di batas Pareto biaya-kinerja papan tersebut. Hasil CommerceAgentBench yang diterbitkan tim Accio Alibaba pada minggu yang sama — Qwen3.8-Max memimpin bidang bobot terbuka pada tolok ukur yang dibangun dari alur kerja perdagangan nyata — memberi tesis kerja kolaboratif itu papan skor konkretnya sendiri, meskipun dijalankan oleh vendor.

Yang berubah adalah sang penilai dan bobotnya sama-sama telah mendarat — dan vonisnya sebagian besar baik, dengan tanda bintang yang nyata. AA menempatkan Qwen3.8-Max di angka 56 pada Indeks Kecerdasan, sebuah lompatan generasional sejati yang menyejajarkannya dengan Claude Opus 4.8; kendati demikian, papan skor yang sama memperlihatkan Kimi K3 unggul satu poin dengan biaya per tugas 25% lebih rendah, sekaligus menandai penurunan Omniscience 10 poin seiring meningkatnya tingkat halusinasi. Pertanyaan soal parameter aktif telah tuntas — 95B diaktifkan, terkonfirmasi di kartu model — dan lisensinya telah dipublikasikan: lisensi khusus, bukan Apache 2.0. Adapun yang belum berubah: tabel tolok ukur Alibaba sendiri masih belum direplikasi, biaya per tugas masih tinggi karena modelnya menuntaskan begitu banyak langkah, model dasar terbuka yang dilayankan di DigitalOcean merupakan model yang sedikit berbeda dari angka-angka utama versi unggulan (konteks 262K, NVFP4, pemeriksaan acak GPQA 88 berbanding 92,6), serta klaim tolok ukur Qwen3.8-27B masih berasal dari laporan vendor kendati bobotnya sudah dirilis. Kombinasi itu tidak membuat Qwen3.8-Max menjadi taruhan yang buruk — pada harga segini, ia hampir merupakan eksperimen yang wajib dicoba — tetapi ini berarti postur yang tepat adalah mengevaluasi secara agresif, merutekan secara cermat, dan menyiapkan cadangan. Peristiwa yang patut disimak selanjutnya adalah apakah jumlah langkah agentif di balik biaya $1,14 per tugas itu mampu diserap beban kerja Anda; apakah keunggulan Code Arena: WebDev dari build 0902 bertahan seiring bertambahnya suara; apakah peningkatan pada Coding dan Cowork-nya terulang pada beban kerja nyata; apakah keunggulan open-weight CommerceAgentBench — dua lintasan agregat pada harness milik Alibaba sendiri — bertahan dalam pengujian independen; apakah klaim tolok ukur si 27B itu terbukti; dan apakah throughput terukur dari penerapan di DigitalOcean bertahan di bawah lalu lintas nyata. Itulah yang akan menentukan apakah predikat “hanya kalah dari Fable 5” adalah posisioning belaka atau sebuah ramalan.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari