
GLM-5.3-FlashX Dirilis dengan Harga 2,5x dari Model yang Menjalankannya
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Angka yang perlu diperhatikan bukanlah 200. Melainkan 2,5. Pada 18 September 2026, Z.ai menempatkan GLM-5.3-FlashX di API-nya pada hingga 200 token keluaran per detik — dan menetapkan harganya 2,5× dari yang dikenakannya untuk GLM-5.3-Flash, model berbobot terbuka yang menjadi dasar pembuatannya. Tidak ada yang berubah dari model itu sendiri. Bobot yang sama, tulang punggung mixture-of-experts 320B-A18B yang sama, konteks 1M token yang sama, penanganan native yang sama untuk teks, gambar, video, dan file. Yang berubah adalah stack penyajian di bawahnya, dan apa yang kini dibebankan Z.ai untuk keistimewaan berada lebih dekat ke depan antrean.
Itu menjadikan FlashX sebagai hal yang langka di pasar model: peluncuran tanpa tolok ukur yang disertakan. Z.ai tidak menerbitkan evaluasi khusus FlashX, karena tidak ada model baru yang perlu dievaluasi. Setiap angka kemampuan yang berlaku untuk GLM-5.3-Flash juga berlaku di sini, termasuk angka-angka yang kurang menguntungkan dibandingkan dengan yang disiratkan oleh liputan peluncuran.
Seluruh delta, dalam satu kali proses
• Kecepatan — GLM-5.3-FlashX hingga 200 tok/s (puncak yang dilaporkan vendor) vs GLM-5.3-Flash pada 98 tok/s sebagaimana diukur oleh Artificial Analysis pada API milik Z.ai sendiribr> • Harga — $0.37 per 1 juta input / $1.25 per 1 juta output vs $0.15 / $0.50 pada harga daftarbr> • Input yang di-cache — $0.075 per 1 juta vs $0.03 per 1 jutabr> • Kecerdasan — identik; FlashX mewarisi skor model dasarbr> • Konteks — 1 juta token di keduanyabr> • Bobot — GLM-5.3-Flash adalah bobot terbuka berlisensi MIT; FlashX adalah tier yang dihosting dan tidak memiliki bobotnya sendiri
Angka 200 dan 98 bukan jenis angka yang sama, dan ada baiknya bersikap blak-blakan soal itu. Yang satu adalah batas atas yang menurut vendor dapat dicapai layanan. Yang lainnya adalah hasil pengukuran lab independen pada permintaan nyata. Pengguna yang memutuskan apakah akan membayar 2,5× harus menganggap 200 sebagai iklan dan mengukur sendiri beban kerjanya.

Apa yang Z.ai katakan sedang melakukan pekerjaan
Percepatan ini adalah soal infrastruktur, bukan matematika. Z.ai mendeskripsikan FlashX sebagai berjalan di atas kluster sekitar 100.000 akselerator domestik Tiongkok dengan tumpukan penyajian yang dirancang khusus: mesin inferensi berbasis SGLang, kuantisasi W8A8, kuantisasi cache campuran INT8/FP8/BF16, dan arsitektur terdisagregasi encode–prefill–decode yang memisahkan tahap pengodean multimodal dari tahap-tahap pembangkitan token sehingga keduanya tidak saling menghambat. Perusahaan melaporkan throughput layanan end-to-end sekitar 3× dibandingkan baseline awalnya pada perangkat keras yang sama, dan mengatakan bahwa agen infrastruktur yang ditenagai GLM-5.3 membantu menyetel tumpukan tersebut.
Semua itu dilaporkan vendor dan, sejauh ini, belum direproduksi oleh siapa pun di luar Z.ai. Itu juga bagian paling masuk akal dari cerita ini: peluncuran tingkat layanan seperti ini biasanya merupakan kemenangan rekayasa, dan pilihan arsitektur yang dijelaskan adalah perangkat standar untuk peningkatan seperti ini. Namun semua itu bukanlah jaminan. Angka 200 tok/s adalah puncak, dan puncak dicapai pada keluaran pendek, cache hangat, dan klaster yang tidak padat. Permintaan multimodal konteks panjang — beban kerja yang secara eksplisit menjadi sasaran FlashX — adalah yang paling kecil kemungkinannya mencapainya.
Harga adalah keputusan produk yang sebenarnya
Pada harga daftar, GLM-5.3-FlashX berbiaya $0,37 per juta token input dan $1,25 per juta token output, dengan input yang di-cache sebesar $0,075 dan penyimpanan cache gratis untuk waktu terbatas. Dalam harga domestik Z.ai, itu berarti ¥2 untuk input dan ¥7 untuk output, dibandingkan ¥0,8 dan ¥2,8 untuk Flash dasar — rasio 2,5× yang sama, dinyatakan dalam mata uang yang digunakan Z.ai untuk menjual di dalam negeri.

Aritmetikanya dengan cepat menjadi tidak nyaman ke arah yang jarang diperiksa orang. Token output adalah tempat pengali itu paling terasa menggigit, karena output adalah sisi yang mahal pada setiap model di keluarga ini: output FlashX adalah 2,5× output Flash, dan output sudah sekitar 3,4× harga input pada keduanya. Pekerjaan batch yang menghasilkan satu juta token output per hari bergeser dari $0,50 ke $1,25 — selisih $274 setahun untuk beban kerja yang, secara definisi, tidak ditunggu siapa pun.
Nilai manfaatnya terletak pada latensi yang bisa diamortisasi. Sebuah loop agen yang melakukan sepuluh panggilan berurutan menghemat selisih per panggilan sebanyak sepuluh kali, dan jika selisih itu dua atau tiga detik, Anda telah menghemat setengah menit waktu aktual per tugas. Untuk penyelesaian kode interaktif, dialog waktu nyata, atau pipeline apa pun ketika manusia atau layanan hulu terhalang menunggu token berikutnya, pertukaran itu biasanya tepat. Z.ai juga secara eksplisit menyatakan bahwa model tersebut saat ini bukan bagian dari GLM Coding Plan miliknya, sehingga pengguna langganan tidak mendapatkan FlashX sebagai bundel — mereka membayar per token untuk itu.
Jika stack Anda sudah terhubung ke lebih dari satu penyedia, peralihannya hanyalah perubahan string model dan tidak ada hal lain. Itulah alasan praktis mengapa routing ada sebagai sebuah lapisan: di OrcaRouter harga daftar vendor diteruskan dengan markup 0%, sehingga perubahan harga Z.ai atau potongan promosi berlaku pada hari yang sama saat hal itu terjadi di sisi hulu, dan satu endpoint di depan 200+ model berarti mengevaluasi FlashX terhadap Flash hanyalah penyuntingan konfigurasi, bukan proyek integrasi. Failover juga penting di sini — tier penyajian yang benar-benar baru di klaster yang benar-benar baru adalah persis jenis dependensi yang layak memiliki fallback di belakangnya.
Apa yang tidak berubah, dan mengapa itu lebih penting
FlashX mewarisi profil kemampuan GLM-5.3-Flash secara penuh, dan profil itu lebih sempit daripada yang tersirat dalam liputan peluncuran. Materi Z.ai menempatkan model dasar sejajar dengan Claude Opus 4.8 pada Artificial Analysis Intelligence Index. Artificial Analysis sendiri saat ini mencantumkan GLM-5.3-Flash pada angka 42 dalam indeks tersebut, yang diukur pada API milik Z.ai sendiri — skor yang solid, jauh di atas median untuk model open-weight di kelasnya, dan jauh dari tingkat terdepan yang disiratkan oleh perbandingan vendor. Kedua pernyataan itu benar; keduanya hanya bukan pernyataan yang sama, dan kesenjangan di antara keduanya adalah alasan blog ini melabeli angka vendor sebagai angka vendor.
Model dasar ini benar-benar mumpuni dan benar-benar terbuka. GLM-5.3-Flash dirilis pada 26 Agustus 2026 di bawah lisensi MIT dengan bobot di Hugging Face, dan desain atensi hibrida linear-plus-sparse-nya — kompresi IndexPool, hyper-connection dengan kendala manifold — memangkas komputasi atensi sekitar 3× dan cache KV sekitar 4,4× dibandingkan GLM-5.3, itulah yang membuat model 320B dengan 18B parameter aktif cukup murah untuk dapat dilayani sama sekali. Output dibatasi pada 131.072 token. Model ini cepat untuk harganya, bukan cepat untuk kelasnya: Artificial Analysis mengukur 98 token per detik, sementara median para pesaingnya di atas 70 tetapi di bawah model-model tercepat di papan peringkat.
FlashX tidak mengubah semua itu. Yang diubahnya adalah berapa lama Anda menunggunya.
Pembacaan yang jujur
Beli FlashX jika beban kerja Anda terikat latensi dan Anda sudah memutuskan GLM-5.3-Flash adalah model yang tepat — agen yang merangkai panggilan, editor yang melengkapi secara inline, permukaan suara atau obrolan di mana jeda adalah produknya. Tetap gunakan GLM-5.3-Flash, atau bobot terbuka yang dapat Anda host sendiri, jika pekerjaan Anda bersifat batch, offline, atau terikat throughput alih-alih terikat latensi. Kecerdasan yang Anda bayar 2,5× itu adalah kecerdasan yang sudah Anda miliki.
Pertanyaan terbukanya adalah apa yang dikatakan pengukuran independen tentang 200. Belum ada orang di luar Z.ai yang menerbitkan angka throughput FlashX, dan sampai ada yang melakukannya, posisi yang jujur adalah bahwa FlashX adalah tier penyajian yang menjanjikan yang dijual berdasarkan angka puncak. Ini juga, yang patut dicatat, merupakan uji komersial: sebuah lab yang menghabiskan setahun untuk memberikan model yang hampir setara frontier secara cuma-cuma dengan harga sepersepuluh dari model flagship-nya kini bertanya apakah para pengembang akan membayar untuk kecepatan itu sendiri. Jawabannya akan membentuk bagaimana tier berikutnya diberi harga.

Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
