
GLM-5.3-FlashX vs GLM-5.3-Flash: Bobot Sama, Harga 2,5×, Satu Angka Berbeda
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Anda tidak bisa membeli GLM-5.3-FlashX lalu mendapatkan model yang lebih baik. Itu bukan kritik — itulah seluruh premisnya. GLM-5.3-FlashX, yang diluncurkan di API Z.ai pada 18 September 2026, menggunakan bobot yang identik dengan GLM-5.3-Flash: backbone mixture-of-experts yang sama dengan total 320B dan 18B aktif, konteks 1M token yang sama, input native teks, gambar, video, dan file yang sama, batas output 131.072 token yang sama. Z.ai belum menerbitkan benchmark FlashX karena tidak ada hal baru untuk dijadikan benchmark. Yang berbeda adalah seberapa cepat token keluar dan berapa biayanya, dan kedua angka itu adalah satu-satunya hal yang harus dipertimbangkan pembeli.
Itu keputusan yang lebih jernih daripada kebanyakan perbandingan model, dan juga lebih sulit, karena tidak ada cerita kemampuan yang bisa dijadikan tempat berlindung. Entah latensinya sepadan dengan 2,5× bagi Anda atau tidak.
Satu model, dua label harga
• Apa itu FlashX — tier penyajian, bukan rilis model; bobot sama, skor sama, batas samabr> • Harga input — $0,37 per 1 juta token di FlashX vs $0,15 per 1 juta di Flash pada harga daftarbr> • Harga output — $1,25 per 1 juta vs $0,50 per 1 juta, pengali yang benar-benar menggerakkan tagihanbr> • Input cache — $0,075 per 1 juta vs $0,03 per 1 jutabr> • Kecepatan — hingga 200 token output per detik (puncak menurut vendor) vs 98 tok/s yang diukur secara independen oleh Artificial Analysisbr> • Akses langganan — GLM-5.3-Flash disertakan dalam GLM Coding Plan Z.ai dengan kuota 3×; FlashX tidak disertakanbr> • Hosting mandiri — GLM-5.3-Flash adalah bobot terbuka berlisensi MIT di Hugging Face; FlashX tidak memiliki bobot untuk diunduh

Di pasar domestik Z.ai, rasio yang sama dinyatakan secara gamblang: ¥2 masuk dan ¥7 keluar untuk FlashX, dibandingkan ¥0,8 dan ¥2,8 untuk Flash. Sejumlah media Tiongkok menggambarkan peluncuran ini dengan cara yang sama — kecepatan 5× dengan harga 2,5× — dan semuanya mencatat bahwa tingkat kecerdasannya tidak berubah.
Latensi adalah pos tersendiri, dan tidak dihargai per token.
Alasan 2,5× tidak otomatis menjadi kesepakatan buruk adalah karena harga token dan biaya tugas merupakan dua besaran yang berbeda. Pekerjaan batch yang menghasilkan satu juta token keluaran dalam semalam membayar $0,50 di Flash dan $1,25 di FlashX hanya untuk keluaran, dan tidak mendapatkan apa pun kembali atas $0,75 ekstra itu karena tidak ada yang menunggu. Loop agen yang melakukan sepuluh panggilan berurutan membayar premi per token yang sama, tetapi setiap panggilan kembali lebih cepat, dan penghematannya terletak pada waktu aktual, bukan pada faktur. Jika FlashX benar-benar kembali dalam sebagian kecil dari waktu itu, sepuluh putaran dapat mengembalikan puluhan detik latensi per tugas — dan jika tugas itu memblokir manusia atau layanan upstream, detik-detik itu bernilai lebih daripada tokennya.
Posisi Z.ai sendiri mengikuti garis ini dengan tepat. Ini mengarahkan FlashX ke coding konkurensi tinggi, panggilan agen multi-langkah, dialog real-time, penyelesaian kode, dan pekerjaan multimodal konteks panjang, serta mengarahkan beban kerja yang sensitif terhadap harga dan tidak sensitif terhadap latensi — batch offline, pembuatan massal, apa pun yang terjadwal — kembali ke Flash dasar. Itu adalah pemisahan yang benar, dan perlu dicatat bahwa vendor itulah yang menariknya.
Di sinilah penalaran mulai goyah, yakni pada sisi throughput. Angka 200 token per detik milik FlashX adalah puncak yang dilaporkan vendor; angka 98 milik model dasar adalah median yang diukur oleh laboratorium independen. Puncak dicapai pada keluaran pendek dengan cache hangat dan klaster yang menganggur. Permintaan multimodal konteks panjang — beban kerja yang justru menjadi sasaran FlashX — adalah yang paling kecil kemungkinannya untuk mendekatinya, dan tidak ada pihak di luar Z.ai yang menerbitkan angka untuk menjawab pertanyaan itu. Jika beban kerja Anda terbatas oleh throughput, bukan latensi, angka puncak tidak banyak memberi tahu Anda tentang apa yang sebenarnya akan Anda dapatkan.
Jalan keluar darurat yang tidak dimiliki FlashX
Ada opsi ketiga dalam perbandingan ini, dan opsi itu ada hanya karena model dasarnya bersifat terbuka. GLM-5.3-Flash dirilis pada 26 Agustus 2026 di bawah lisensi MIT, dengan bobot di Hugging Face dan ModelScope, dan saat ini dilayani oleh tumpukan inferensi termasuk SGLang, vLLM, TokenSpeed, dan KTransformers. Jika volume Anda cukup tinggi untuk membenarkan perangkat kerasnya, perbandingan yang jujur bukanlah Flash versus FlashX — melainkan $1,25 per juta token keluaran milik FlashX versus biaya per token Anda sendiri yang diamortisasi pada akselerator Anda sendiri.

Opsi itu memiliki harga masuk yang nyata. Rilis FP8 membutuhkan sekitar 328 GB memori GPU untuk melayani, yang merupakan penerapan multi-node bagi sebagian besar tim dan tidak bisa dijadikan pilihan bagi sisanya. Namun hal ini perlu dikemukakan karena asimetri inilah yang menjadikan penetapan harga FlashX sebagai uji yang disengaja, bukan suatu keniscayaan: Z.ai mengenakan harga premium untuk konfigurasi penyajian yang, untuk model dasar, pada prinsipnya dapat dibangun sendiri oleh pelanggan. Premi tersebut adalah untuk kenyamanan, bukan untuk kemampuan, dan kenyamanan memiliki tarif pasar yang menurun seiring waktu.
Apa sebenarnya inti dari perubahan harga
Ekonomi di balik peluncuran ini terbilang sangat jelas. GLM-5.3-Flash dirilis dengan harga sepersepuluh dari GLM-5.3 — setengahnya lagi selama promosi peluncuran — dan digunakan secara besar-besaran, termasuk rentetan pengujian pra-rilis secara anonim yang sejak itu telah dikonfirmasi oleh Z.ai. FlashX adalah pertama kalinya keluarga ini bergerak ke arah sebaliknya: model yang sama, dengan harga yang dinaikkan. Analis yang dikutip di pers keuangan Tiongkok menafsirkannya sebagai uji komersial yang disengaja untuk mengetahui apakah para pengembang akan membayar untuk kecepatan itu sendiri, setelah setahun membeli pangsa pasar dengan kemampuan yang mendekati terdepan pada harga komoditas.
Dua detail mendukung tafsiran itu. FlashX dikecualikan dari GLM Coding Plan, sementara Flash dasar disertakan dengan kuota tiga kali lipat, sehingga pengguna langganan tidak dapat menyerap tier baru ke dalam komitmen yang sudah ada — mereka membayar per token. Dan harganya datar, tanpa diskon di luar jam sibuk, tidak seperti struktur berdasarkan waktu dalam sehari yang digunakan sebagian pesaing untuk mengisi kapasitas menganggur. Tarif datar 2,5× pada tier kecepatan adalah harga bagi orang yang tidak bisa menunggu, dan Z.ai sedang mencari tahu berapa banyak dari mereka yang ada.
Memilih di antara keduanya
Gunakan FlashX jika manusia atau layanan terhambat menunggu token berikutnya dan model itu sendiri sudah menjadi pilihan yang tepat — penyelesaian inline, agen interaktif, obrolan real-time, apa pun yang jedanya menjadi produknya. Gunakan GLM-5.3-Flash untuk pekerjaan batch, offline, dan massal, untuk apa pun yang dapat Anda jadwalkan, dan untuk beban kerja apa pun yang Anda bayar berdasarkan volume keluaran, bukan latensi keluaran. Jika volume Anda besar dan tim Anda dapat menjalankan akselerator, hitung harga bobot dasar yang dihosting sendiri sebelum menghitung harga FlashX; perbandingannya lebih menguntungkan daripada yang disiratkan oleh tarif token.
Ke arah mana pun Anda memilih, perlakukan keduanya sebagai dapat dipertukarkan di titik pemanggilan. Keduanya menerima prompt yang sama, mengembalikan format yang sama, dan menghasilkan kualitas yang sama — satu-satunya yang berubah hanyalah string model, yang merupakan jenis uji A/B paling murah untuk dijalankan. Di OrcaRouter harga daftar dari vendor diteruskan tanpa markup 0%, sehingga perubahan harga atau promosi dari Z.ai langsung berlaku pada hari yang sama saat diluncurkan di sisi hulu, dan kedua tier berada di belakang satu endpoint yang menghadap 200+ model. Untuk keputusan yang sepenuhnya bergantung pada latensi terukur, kemampuan beralih di antara keduanya di tengah eksperimen tanpa menyentuh integrasi Anda adalah sebagian besar dari pekerjaannya.
Putusannya lebih sempit daripada perbandingan model pada umumnya, dan itulah intinya. FlashX bukan model yang lebih baik dan tidak berpura-pura menjadi lebih baik. Modelnya sama, hanya antreannya lebih pendek, dijual dengan harga yang hanya masuk akal jika antrean memang masalah Anda. Ukur sendiri waktu Anda ke token pertama pada keduanya sebelum berkomitmen — angka 200 dari vendor adalah batas atas, beban kerja Anda adalah satu-satunya tolok ukur yang penting, dan perbedaan antara kedua tier hanya berjarak satu perubahan konfigurasi.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
