Kartu judul yang dihasilkan berjudul 'Qwen 4.5 dan Qwen 5: 5 hingga 10 triliun parameter' dengan subjudul 'Rentang peta jalan, bukan spesifikasi' dan tiga kartu bertuliskan 'Target peta jalan / 5-10T parameter', 'Flagship yang sudah dirilis / Qwen3.8-Max 2.4T' dan 'Tanggal rilis / belum diumumkan'. Baris footer berbunyi 'Menurut siaran pers Alibaba 22 September 2026; tidak ada kartu model yang diterbitkan.' Gaya editorial vektor datar pada latar putih dengan sapuan gradien biru ke cyan dan logo OrcaRouter dikomposit di kanan bawah.
Guides & Insights

Qwen 4.5 dan Qwen 5 menargetkan 5 hingga 10 triliun parameter: apa yang Alibaba katakan dan tidak katakan

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada Konferensi Apsara-nya di Hangzhou pada 22 September 2026, perusahaan itu menetapkan ukuran untuk generasi setelah generasi berikutnya. Seri Qwen 4.5 dan Qwen 5 "diproyeksikan akan diperbesar hingga 5 sampai 10 triliun parameter," dalam bunyi siaran pers berbahasa Inggris perusahaan itu sendiri — sebuah pernyataan peta jalan, bukan spesifikasi. Tidak satu pun model tersebut memiliki tanggal rilis, kartu model, pengenal API, harga, atau skor tolok ukur yang dipublikasikan, yang berarti tidak ada satu pun dari keduanya yang dapat dipanggil hari ini. Model unggulan yang benar-benar dapat Anda beli adalah Qwen3.8-Max, tersedia secara umum sejak 3 Agustus 2026, dengan 2,4 triliun parameter. Dalam beberapa hari sejak konferensi, kalimat peta jalan itu telah disederhanakan dalam banyak liputan menjadi klaim bahwa model 10 triliun parameter akan datang — klaim yang lebih kuat dan lebih sederhana daripada yang dibuat perusahaan. Jarak antara kedua kalimat itu kira-kira satu tahun perencanaan.

Klaim tersebut, dan versi darinya yang menyebar

Dua hal disampaikan di atas panggung, dan keduanya layak dipisahkan karena membawa jumlah informasi yang sangat berbeda. Yang pertama adalah pembaruan status: Qwen 4 sedang dalam pelatihan, dengan arsitektur baru. Yang kedua adalah peta jalan: seri Qwen 4.5 dan Qwen 5 diproyeksikan mencapai rentang parameter 5 hingga 10 triliun.

Siaran pers berbahasa Inggris Alibaba mengatribusikan keduanya kepada perusahaan, bukan kepada eksekutif yang disebutkan namanya. Liputan konferensi yang melangkah lebih jauh mengatribusikan peta jalan itu kepada Liu Da Yiheng, yang menjalankan proyek model bahasa besar Qwen di Alibaba Token Hub, dan melaporkan kerangka pikirnya bahwa penskalaan adalah jalur utama menuju superinteligensi artifisial. Kerangka pikir itulah konteks yang melatarbelakangi penyampaian angka parameter tersebut, dan itu menjelaskan mengapa angka itu berupa rentang, bukan target.

Yang kemudian beredar adalah ujung atas rentang itu. Judul-judul berita berbahasa Inggris yang menyusul mencakup setidaknya satu yang menggambarkan model 10 triliun parameter yang diisyaratkan, dan beberapa yang menggambarkan rencana untuk model berukuran 5 hingga 10 triliun parameter. Keduanya merupakan tafsiran yang dapat dipertahankan atas sebuah slide. Tidak satu pun merupakan spesifikasi, dan perbedaannya penting bagi siapa pun yang harus membuat perencanaan berdasarkan hal itu.

5 triliun adalah target satu generasi dan 10 triliun adalah target generasi lainnya.

Hal tunggal yang paling berguna untuk dipahami dengan benar tentang pengumuman ini adalah bahwa 5 hingga 10 triliun adalah rentang yang mencakup dua generasi, bukan satu model dengan toleransi yang lebar. Kalimat Alibaba sendiri mengaitkan rentang tersebut dengan "seri model Qwen 4.5 dan Qwen 5 yang akan datang" — seri, jamak, jika diambil bersama.

Pemberitaan berbahasa Mandarin dari konferensi yang sama kembali presisi ke arah yang berbeda, dengan judul-judul berita yang menggambarkan model-model setelah Qwen 4.5 meluas ke kisaran 5 hingga 10 triliun. Pembacaan itu menempatkan ujung 10 triliun juga di luar Qwen 4.5. Satu pernyataan yang disepakati semua sumber adalah bahwa rentang itu mencakup rentang Qwen 4.5 hingga Qwen 5. Penetapan 10 triliun secara khusus pada Qwen 5 adalah inferensi yang menjadi judul berita, bukan kutipan.

Sebagai gambaran skala, dan ini adalah satu-satunya angka dalam cerita ini yang dipublikasikan, bukan diproyeksikan:

• 5 hingga 10 triliun — rentang parameter yang dilekatkan siaran pers Alibaba pada seri Qwen 4.5 dan Qwen 5

• 2,4 triliun — total parameter Qwen3.8-Max, model unggulan yang sudah dirilis, menurut kartu model resminya

• 95 miliar — parameter aktif Qwen3.8-Max per token, angka yang menentukan berapa biaya untuk menyajikan sebuah token

• 10 triliun — puncak dari rentang tersebut, dan satu-satunya bagian yang mencapai sebagian besar berita utama berbahasa Inggris

• 0 — jumlah spesifikasi yang dipublikasikan, tanggal rilis, harga, jendela konteks, atau skor benchmark untuk Qwen 4.5 atau Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Nomor parameter yang penting adalah nomor yang tidak dipublikasikan oleh siapa pun.

Parameter total adalah angka yang dipilih lab untuk disebutkan. Parameter aktif adalah angka yang dibutuhkan pembeli, dan peta jalan tidak mencantumkannya.

Qwen3.8-Max adalah model mixture-of-experts dengan total 2,4 triliun parameter dan 95 miliar parameter aktif per token. Itu berarti rasio aktivasi sekitar 4 persen: model ini menyimpan banyak pengetahuan dalam bobot yang tidak dibacanya pada token mana pun, dan hanya membayar komputasi untuk sebagian kecilnya. Total parameter memberi tahu Anda berapa banyak memori yang ditempati model ini dan seberapa besar kotak yang Anda butuhkan. Parameter aktif memberi tahu Anda biaya yang Anda keluarkan setiap kali model ini menjawab.

Teruskan rasio itu ke depan, dan bentuk persoalannya menjadi terlihat. Model 10 triliun parameter yang dibangun pada aktivasi 4 persen yang sama akan mengaktifkan sekitar 400 miliar parameter per token — lebih dari empat kali lipat yang diaktifkan Qwen3.8-Max sekarang. Itu adalah aritmetika atas asumsi yang dinyatakan, bukan klaim tentang Qwen 5: naikkan sparsitas dan jumlah aktif turun, turunkan dan ia meningkat. Tetapi aritmetika itulah yang menentukan apakah model 10 triliun parameter merupakan produk yang dilayani atau artefak riset, dan itulah perhitungan yang diminta oleh tajuk 5-ke-10-triliun lalu dibiarkan belum dikerjakan.

Di sinilah juga ekonomi perutean berhenti menjadi abstrak. Di OrcaRouter, harga daftar penyedia diteruskan dengan markup 0%, sehingga pemotongan harga vendor pada tier Qwen langsung berlaku di kunci Anda pada hari yang sama, bukan pada saat perpanjangan. Suatu generasi yang biaya penyajiannya benar-benar tidak pasti justru merupakan kasus di mana penerusan itu bernilai lebih daripada diskon yang dinegosiasikan di muka terhadap angka yang belum pernah diterbitkan siapa pun.

Pengumuman chip adalah garis waktu yang sebenarnya.

Alibaba mengumumkan peta jalan model dan akselerator baru dalam siaran pers yang sama, dan keduanya lebih saling terkait daripada yang dinyatakan dalam siaran pers itu.

Zhenwu V900 dari T-Head adalah prosesor pelatihan dan inferensi dengan memori 216 GB dan bandwidth antar-chip 1.200 GB/s, dukungan native untuk FP8 dan FP4, serta klaim performa tiga kali lipat dari pendahulunya, Zhenwu M890, yang dirilis pada Mei. Produksi massal dan rilis komersial dijadwalkan pada kuartal pertama 2027. Server supernode pendamping mendukung klaster hingga 500.000 kartu, dan T-Head mengatakan lini Zhenwu telah melayani lebih dari 650 pelanggan.

Bacalah kedua pengumuman itu secara bersamaan dan urutannya menjadi jelas. Melatih dan melayani model mixture-of-experts pada skala 10 triliun adalah masalah interkoneksi sebelum menjadi masalah komputasi, karena paralelisme pakar berarti memindahkan aktivasi antarchip terus-menerus, dan bandwidth antarchip 1.200 GB/s adalah angka yang menentukan apakah hal itu dapat dilakukan. Silikon pada jadwal tersebut menempatkan jendela paling awal yang masuk akal untuk proses pelatihan skala frontier semacam ini jauh memasuki 2027 — dan bahkan saat itu, pengiriman sebuah chip tidak mengatakan apa pun tentang selesainya proses pelatihan. Alibaba menghubungkan kedua subjek itu dengan menempatkannya dalam satu rilis; keterkaitannya sendiri adalah pembacaan kami, dan hal itu diberi label sebagai demikian.

Horizon waktu perusahaan sendiri konsisten dengan itu. Chief Executive Eddie Wu menetapkan target kapasitas pusat data Alibaba Cloud global lebih dari 20 gigawatt pada 2032 — target kapasitas, bukan kapasitas yang sudah dioperasikan, dan horizon lebih dari lima tahun, bukan horizon kuartal berikutnya.

Klaim-klaim peningkatan diri yang menopang peta jalan itu

Alasan rencana 5 hingga 10 triliun sama sekali bisa diperdebatkan, bukan sekadar mahal, adalah perbaikan diri secara rekursif: jika alur pelatihan meningkatkan dirinya sendiri, komputasi yang dibutuhkan per generasi menurun, dan garis terdepan bergerak lebih dekat ke taraf terjangkau. Itulah klaim penopang di balik peta jalan tersebut, dan itu juga hal yang paling sulit diverifikasi dari apa yang dikatakan Alibaba.

Apa yang dilaporkan perusahaan: Qwen3.8-Max menyelesaikan 33 siklus iteratif selama sekitar satu bulan kerja yang sepenuhnya otomatis yang mencakup desain pipeline, validasi data, dan diagnosis kesalahan, serta meningkatkan skor Artificial Analysis-nya dari 40 menjadi 45. Dalam eksperimen desain chip, model tersebut menghabiskan lebih dari 60 jam untuk peningkatan diri sepanjang siklus hidup desain, melakukan lebih dari 10.000 panggilan alat otomasi desain elektronik, dan mengurangi luas chip sebesar 42 persen tanpa kehilangan performa. Satu laporan dari konferensi tersebut juga memuat peningkatan throughput inferensi sebesar 96 persen dari penyetelan otonom GPU T-Head baru.

Hal-hal ini dilaporkan oleh vendor dan belum direplikasi secara independen. Itu bukan sekadar soal teknis — loop otonom yang menilai eksperimennya sendiri sedang mengukur dirinya terhadap penilainya sendiri, dan dunia luar tidak punya cara untuk memeriksa rubrik tersebut. Liputan konferensi itu umumnya sudah menyatakan demikian, dan pembaca sebaiknya mengasumsikannya.

Ada perangkap kedua dalam klaim yang sama, dan ini soal label, bukan kejujuran. Alibaba tidak menyebutkan revisi mana dari Artificial Analysis Intelligence Index yang menjadi acuan untuk pergerakan 40-ke-45-nya, dan indeks itu telah dibangun ulang sejak model ini diluncurkan. Halaman Artificial Analysis saat ini untuk Qwen3.8 Max (0902) tertulis 45 — angka independen, pada revisi yang berlaku saat ini. Pembacaan yang tercatat untuk model yang sama pada pertengahan Agustus, di bawah revisi yang berlaku saat itu, adalah 56. Angka 45 dan 56 bukanlah pengukuran yang sama dalam satuan yang sama, dan mengurangkan yang satu dari yang lain menghasilkan angka yang tidak berarti apa-apa. Yang tidak dimuat halaman itu adalah angka 40 yang menurut Alibaba menjadi titik peningkatannya: titik awal delta itu milik perusahaan sendiri, dan hanya titik akhirnya yang kebetulan berada di posisi pembacaan independen sekarang. Bacalah pergerakan itu sebagai arah, bukan sebagai pengukuran.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Apa yang dirilis Alibaba pada konferensi yang sama?

Jika roadmap dikesampingkan, konferensi itu tetap berisi rilis nyata, semuanya multimodal:

• Qwen3.8-LiveTranslate — interpretasi simultan, dengan latensi (LAAL) dipangkas hampir 20 persen, dari 2,8 detik menjadi 2,3 detik

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS dan Qwen-Audio-3.1-Realtime — rangkaian ucapan yang diperbarui

• Qwen-Audio-3.1-TTS-Next — lanskap suara sinematik yang memadukan dialog dan ambiens dari naskah teks, ditujukan untuk buku audio, film dan televisi, siniar, serta gim

• Qwen-Image 3.1 — pembuatan gambar yang disesuaikan untuk desain kreatif dan pemasaran e-commerce, dijadwalkan rilis akhir tahun ini, dengan pembuatan latar belakang transparan secara native

• Qwen Intelligence — platform agentic full-stack yang menyasar produsen smartphone

Setiap item dalam daftar itu adalah produk dengan jendela pengiriman. Klaim berskala frontier adalah satu-satunya item dalam agenda yang tidak disertai tanggal, dan kontrasnya bukan kebetulan: merilis tier multimodal adalah yang mendanai satu tahun roadmap, dan roadmap itulah yang membuat putaran pendanaan berikutnya atau kontrak cloud berikutnya menjadi cerita, bukan spreadsheet. Kedua hal itu nyata. Hanya satu di antaranya yang bisa Anda panggil.

Apa yang dapat dipanggil hari ini, dan apa yang harus berubah agar itu berubah?

Generasi Qwen 3.8 tetap menjadi keseluruhan lini yang dapat dibeli. Qwen3.8-Max telah tersedia secara umum sejak 3 Agustus 2026 dengan harga $2,00 per juta token masukan dan $6,00 per juta token keluaran, dengan tarif tetap di seluruh konteks 1.000.000 token tanpa biaya tambahan untuk prompt panjang. Bobotnya diterbitkan pada 12 Agustus 2026 sebagai Qwen3.8-2.4T-A95B dalam BF16 dan FP8 di bawah lisensi Qwen khusus. Tabel tolok ukur vendornya kuat dan belum diaudit — Terminal-Bench 2.1 pada 86,6, GPQA Diamond pada 92,6, OSWorld-Verified pada 86,1, semuanya angka Alibaba sendiri — Gambaran independennya kurang menyanjung dibandingkan gambaran vendor: Artificial Analysis menempatkan Qwen3.8 Max (0902) pada Intelligence Index 45, ke-24 dari 212 model, dengan biaya terukur $5,41 per tugas Intelligence Index dan 39,2 token keluaran per detik — ke-159 dari 212, mendekati ujung paling lambat di bidang ini. Halaman yang sama mencantumkan jendela konteks sebagai 984k dibandingkan dengan 1.000.000 di halaman model kami sendiri, selisih yang perlu diketahui sebelum Anda menentukan ukuran pekerjaan konteks panjang. Skor kelas terdepan, kecepatan kelas menengah: itulah ringkasan jujur dari produk unggulan yang dikirim, dan itulah tolok ukur yang harus dikalahkan oleh Qwen 4.5 mana pun pada kedua poros sekaligus.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter menyediakan keluarga Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash dan qwen3.8-27b — di satu endpoint yang kompatibel dengan OpenAI bersama lebih dari 200 model lainnya, yang berarti tier Qwen 4.5 akan menjadi perubahan ID model pada kunci yang sudah ada, bukan kontrak vendor baru, tagihan baru, dan SDK baru. Ketika tier itu dirilis, katalog itulah tempat model itu akan muncul. Saat ini, baik Qwen 4.5 maupun Qwen 5 tidak ada di dalamnya, karena keduanya belum dirilis — dan sebanyak apa pun liputan pers tentang roadmap tidak akan mengubahnya.

Kegunaan praktis dari peta jalan seperti ini adalah kebalikan dari rencana migrasi. Jika suatu saat tingkat Qwen 4.5 tampak masuk akal untuk beban kerja Anda, cara murah untuk mengetahuinya adalah mengarahkan sebagian trafik nyata ke model itu di balik fallback otomatis, sehingga model yang ternyata lambat, mahal, atau lebih buruk daripada model yang sudah digunakan hanya membebani Anda sebesar persentase dari satu beban kerja, bukan seperempat. Itulah gunanya failover, dan model terdepan yang belum terbukti dan baru berumur beberapa hari adalah kasus paling jelas untuk menggunakannya.

Apa yang perlu dicermati, dan apa yang belum bisa dipercaya

Sebuah butir peta jalan menjadi rilis ketika sejumlah kecil hal konkret muncul. Kartu model yang memuat jumlah total parameter, jumlah parameter aktif, dan jendela konteks. Pengenal API yang dapat Anda sertakan dalam permintaan. Bobot di hub model. Entri di papan peringkat independen yang disertai tanggal. Harga. Salah satu saja dari hal-hal itu adalah sinyal; sebagian besar darinya yang hadir bersamaan adalah peluncuran.

Hal-hal yang bukan sebuah rilis, betapapun teknisnya kelihatannya: penyebutan dalam konferensi; pull request sebuah kerangka kerja serving yang menambahkan cabang arsitektur untuk build Qwen eksperimental, yang merupakan pekerjaan engine pada tumpukan inferensi seseorang alih-alih model yang bisa Anda panggil; id snapshot bertanggal untuk generasi yang sudah dirilis; dan postingan media sosial yang memparafrasakan pernyataan di atas panggung. Sinyal yang menghasilkan artikel ini adalah yang terakhir dari hal-hal itu, dan alasan artikel ini layak ditulis adalah bahwa klaim yang mendasarinya dapat diperiksa terhadap siaran pers Alibaba sendiri — yang merupakan sumber dari rentang 5 hingga 10 triliun, status Qwen 4, dan angka-angka RSI. Sinyal itu menunjuk pada cerita; sinyal itu bukan cerita.

Pertanyaan jangka pendek lebih sempit daripada yang disiratkan oleh berita utama. Alibaba mengatakan Qwen 4 sedang dilatih, yang menempatkan Qwen 4 di depan 4.5 dan 5 dalam urutan — jadi hal berikutnya yang layak diperhatikan bukanlah model 10 triliun parameter, melainkan apakah Qwen 4 hadir dengan kartu model, harga, dan endpoint, serta kapan. Sampai ada sesuatu dalam rantai itu yang terwujud, posisi jujur tentang rentang 5 hingga 10 triliun adalah bahwa itu adalah arah perjalanan, diungkapkan secara resmi, tanpa spesifikasi yang menyertainya dan tanpa tanggal. Buat rencana untuk Qwen3.8-Max, pantau rentang 4.5 dan 5 sebagai tesis penskalaan alih-alih produk, dan anggap setiap jumlah parameter yang Anda lihat untuk model tanpa kartu model sebagai prakiraan.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari