
GLM 5.3 Prime: Bobot GLM-5.3 yang Sama, dengan Tarif Tepat Dua Kali Lipat Daftar Harga
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
GLM 5.3 Prime berbiaya $2.80 per juta token masukan dan $8.80 per juta token keluaran. GLM-5.3, model yang menjalankannya, berbiaya $1.40 dan $4.40. Itu bukan perbedaan pembulatan atau selisih promosi — tepat 2,0× pada kedua lini, dan itulah satu-satunya hal yang diperselisihkan kedua produk. GLM 5.3 Prime bukan model baru. Ia membawa bobot milik GLM-5.3 sendiri, yang dibuka Z.ai pada 25 Agustus 2026, di balik tumpukan penyajian yang lebih cepat. GLM-5.3 sendiri diumumkan pada 14 Agustus 2026 dan mencapai API pada 18 Agustus. Tidak ada yang berubah pada model dasarnya ketika ID Prime muncul pada akhir September. Yang berubah adalah seseorang memasang label harga kedua padanya.
Jika Anda membaca ini karena daftar model menunjukkan nama yang tidak familier di sebelah nama yang familier, jawaban singkatnya adalah: Anda sedang melihat tier penyajian, bukan rilis. Jawaban yang lebih panjang layak menyita dua menit, karena aritmetikanya luar biasa bersih dan asal-usulnya luar biasa keruh.
Apa itu tingkat "Prime", dalam satu paragraf
Tingkat penyajian adalah ID produk kedua yang menunjuk ke bobot yang sama, disetel untuk throughput, bukan untuk biaya. Anda tidak mendapatkan model yang lebih besar, konteks yang lebih panjang, mode penalaran yang lebih baik, atau permukaan alat yang lebih luas. Anda mendapatkan token yang dikirim keluar lebih cepat, dan Anda membayar keistimewaan itu pada setiap token, bukan pada waktu aktual yang Anda hemat. Pertukaran itu nyata dan terkadang tepat — loop agen multi-langkah yang melakukan sepuluh panggilan berurutan memang benar-benar mendapat manfaat dari setiap panggilan yang kembali lebih cepat — tetapi itu adalah pembelian latensi, bukan pembelian kemampuan, dan seharusnya dihargai sebagai pembelian latensi.
Deskripsi vendor untuk GLM 5.3 Prime mengatakan bagian yang tersirat secara langsung: ini adalah "varian berkecepatan tinggi dari GLM-5.3 milik Z.ai, mewarisi kemampuan lengkapnya sekaligus memberikan throughput keluaran 1,5–2× melalui akselerasi inferensi." Kemampuan lengkap. Jendela konteks yang sama sebesar 1.000.000 token. Batas keluaran yang sama sebesar 131.072 token. Teks masuk, teks keluar. Penalaran wajib, dengan rendah, tinggi dan maks tingkat upaya dan maks sebagai default — identik dengan model dasar.
Kartu tarif, berdampingan
• Input — GLM 5.3 Prime $2.80 per 1 juta vs GLM-5.3 $1.40 per 1 juta
• Output — GLM 5.3 Prime $8.80 per 1 juta vs GLM-5.3 $4.40 per 1 juta
• Input cache — GLM 5.3 Prime $0.56 per 1 juta vs GLM-5.3 $0.26 per 1 juta
• Pengganda — 2.0× pada ketiga baris, di kedua arah
• Konteks — 1,000,000 token pada keduanya
• Output maks — 131,072 token pada keduanya
• Penalaran — wajib pada keduanya, tiga tingkat upaya yang sama, default yang sama
Pos cache adalah pos yang sering orang lewatkan. Pembacaan cache adalah token termurah yang akan pernah Anda beli dari model terdepan, dan di situlah beban kerja agen benar-benar menghabiskan anggaran mereka — prompt sistem, definisi alat, dan transkrip yang terus bertambah dibaca ulang pada setiap giliran. Menggandakan tarif cache akan menggandakan pos biaya terbesar dalam sesi agen yang panjang, yang berarti premi efektif pada beban kerja nyata lebih mendekati 2× daripada yang disiratkan oleh selisih utama pada token input baru. Jika Anda berharap jalur cepat akan lebih murah dalam praktik karena Anda melakukan cache secara agresif, ternyata tidak.
Siapa yang sebenarnya menjualnya
Di sinilah daftar ini menjadi menarik, dan di sinilah pembaca yang cermat seharusnya memperlambat. Dokumentasi Z.ai sendiri, ikhtisar modelnya, dan halaman harga yang dipublikasikannya tidak mencantumkan SKU Prime. Telusuri ID model vendor untuk glm-5.3-prime dan Anda tidak akan menemukan apa pun. Tingkat kecepatan Z.ai sendiri adalah produk yang berbeda pada lini yang sama sekali berbeda — GLM-5.3-FlashX, yang berada di keluarga Flash yang lebih murah, diluncurkan pada 18 September 2026, dan dihargai $0.37 dan $1.25 per juta token.
Jadi, Prime adalah produk di sisi platform yang dibangun di atas bobot Z.ai. Dua rincian menunjukkan platform milik siapa. Yang pertama adalah frasa "1.5–2× output throughput", yang merupakan susunan kata yang sama yang digunakan penyedia cloud besar untuk mode penyajian akselerasinya sendiri — mode yang Anda aktifkan dengan mengganti ID model, dengan kapabilitas dan batas penggunaan yang secara eksplisit tidak diubah. Yang kedua adalah bahwa daftar tersebut menyebutkan tepat satu penyedia hulu di balik endpoint. Satu penyedia tunggal di balik SKU tingkat cepat bukanlah cara model open-weights dilayani; itulah tampilan dari luar untuk deployment akselerasi milik platform sendiri.
Tidak ada dari semua itu yang membuat GLM 5.3 Prime menjadi produk yang buruk. Hal itu membuatnya menjadi produk dengan satu pemasok, yang merupakan pertanyaan resiliensi yang harus Anda ajukan sebelum mengarahkan lalu lintas produksi melaluinya.
Berapa nilainya klaim kecepatan itu

Angka 1,5–2× itu adalah klaim throughput yang diukur dalam kondisi milik vendor sendiri, dan throughput adalah metrik yang paling sensitif terhadap kondisi tersebut. Token output per detik pada cache hangat dengan prompt pendek dan klaster yang menganggur bukanlah angka yang dilihat oleh agen konteks panjang. Pengukuran independen terhadap model dasar menempatkan GLM-5.3 pada sekitar 61 token output per detik dan GLM-5.3-Flash pada sekitar 46, pada set yang rata-rata kelasnya 67 — jadi jalur yang lebih murah juga yang lebih lambat, kebalikan dari apa yang disiratkan oleh namanya. Itu adalah median di seluruh set evaluasi terstandardisasi, bukan puncak.
Ada juga biaya yang lebih halus. Default upaya penalaran pada kedua ID adalah maks, yang merupakan pengaturan yang menghasilkan rantai pemikiran terpanjang. Kecepatan dan verbositas menarik ke arah yang berlawanan di sini: tier cepat yang juga bernalar pada panjang maksimum masih bisa lambat secara end-to-end pada masalah sulit, karena hambatannya adalah jumlah token yang diputuskan model untuk dihasilkan, bukan laju model dalam menghasilkannya. Jika beban kerja Anda berat dalam penalaran, turunkan ke tinggi atau rendah sebelum Anda membayar 2× untuk akselerasi — tingkat upaya akan lebih memengaruhi latensi Anda daripada tier penyajian.
Tiga cara untuk membeli model yang sama

GLM-5.3 kini hadir dalam tiga bentuk yang dapat dibeli, dan itu bukan tiga model:
• GLM-5.3 dengan $1.40 / $4.40 — kartu tarif dasar, kemampuan penuh, versi dengan bobot terbuka yang dipublikasikan yang bisa Anda hosting sendiri
• GLM 5.3 Prime dengan $2.80 / $8.80 — bobot yang sama melalui stack yang dipercepat, satu pemasok hulu, tanpa menyertakan bobot
• GLM-5.3-FlashX dengan $0.37 / $1.25 — sama sekali bukan GLM-5.3, melainkan tier kecepatan pada keluarga Flash yang lebih murah, dan sejauh ini cara termurah untuk membeli latensi
Baris ketiga itulah yang layak diperhatikan. Jika yang sebenarnya Anda inginkan adalah token yang lebih cepat dan Anda fleksibel soal dari GLM mana Anda mendapatkannya, FlashX memberikan akselerasi pada model yang biayanya sudah sekitar sepersepuluh dari model flagship, dengan harga kurang dari setengah biaya model flagship tanpa akselerasi. Prime hanya masuk akal jika Anda secara khusus membutuhkan kualitas penalaran GLM-5.3 dan secara khusus membutuhkannya lebih cepat.
Di mana posisi ini di sisi kami

Kita harus terus terang soal satu hal: OrcaRouter tidak menghosting GLM 5.3 Prime, dan kami juga tidak menghosting GLM-5.3-FlashX. Kedua halaman model tersebut mengembalikan 404 di situs kami. Jika Anda menginginkan tier yang dipercepat, Anda harus membelinya dari platform yang menjualnya, atau dari API milik vendor untuk model dasarnya.
Yang kami host adalah GLM-5.3 dan GLM-5.3-Flash, pada harga daftar penyedia dengan markup nol dari kami — $1.40 dan $4.40 yang sama yang Anda lihat di kartu tarif Z.ai sendiri, diteruskan apa adanya alih-alih ditetapkan ulang harganya. Itu lebih penting daripada kedengarannya untuk model yang harganya telah berubah dua kali dalam enam minggu. Karena kami tidak menambahkan spread, perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama saat berlaku di sisi mereka, tanpa migrasi atau tiket dukungan. Kedua ID berada di balik satu kunci API bersama lebih dari 200 model lainnya, jadi A/B antara GLM-5.3 dan GLM-5.3-Flash cukup dengan mengubah nama model satu baris alih-alih kontrak kedua, dan failover otomatis melindungi Anda jika satu penyedia upstream mengalami degradasi — yang merupakan risiko spesifik yang melekat pada tier cepat pemasok tunggal.
Haruskah kamu membayar 2×
Bayarlah jika manusia atau layanan upstream tertahan menunggu respons, beban kerjanya terikat latensi alih-alih terikat throughput, dan Anda sudah memastikan bahwa upaya penalaran adalah pendorong latensi Anda yang sebenarnya. Jangan bayar jika Anda menjalankan pembuatan batch sepanjang malam, jika volume Anda cukup tinggi sehingga premi token 2× melampaui waktu aktual yang Anda hemat, atau jika Anda berharap tier ini diam-diam menjadi model yang lebih baik. Tidak. Ini GLM-5.3 dengan stopwatch yang berjalan, dan stopwatch itu menagih per token.
Kerangka yang jujur untuk seluruh keluarga GLM-5.3 saat ini adalah bahwa Z.ai merilis satu model pada Agustus dan pasar menghabiskan September dengan mengemas ulang model itu dalam empat harga berbeda. GLM 5.3 Prime adalah yang paling mahal dari paket-paket tersebut. Model ini juga yang jejak dokumentasinya paling tipis, karena perusahaan yang namanya tercantum pada bobot model tidak mencantumkannya. Itu bukan alasan untuk menghindarinya. Itu adalah alasan untuk mengetahui persis apa yang Anda beli sebelum Anda menempatkannya di jalur produksi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
