
GLM-5.3 vs GLM-5.2: Otak Sama, Benchmark Dua Kali Lipat
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Cara Zhipu AI sendiri membingkai peningkatan dari GLM-5.2 ke GLM-5.3 adalah yang jujur: buku teksnya tidak berubah, hanya pelatihan siswanya yang berubah. GLM-5.3, yang dirilis pada 14 Agustus 2026, dibangun di atas basis MoE dengan 743 miliar parameter yang sama persis dengan GLM-5.2, yang memuncaki bidang bobot terbuka pada Indeks Kecerdasan Artificial Analysis pada bulan Juni. Arsitekturnya tidak berubah, jejaknya tidak berubah, harga $1.40 / $4.40 per juta tidak berubah — namun Z.ai melaporkan bahwa model yang dilatih ulang ini menggandakan atau melampaui pendahulunya pada beberapa tolok ukur pengkodean dan keamanan yang dipublikasikan oleh kedua versi. Apakah hal itu menjadikan GLM-5.3 sebagai peningkatan yang wajib atau sikap tunggu-dan-lihat bergantung pada seberapa besar Anda mempercayai model yang meningkat pesat tanpa mengubah arsitekturnya sendiri, dan pada apakah kemampuan siber yang baru muncul itu adalah fitur yang ingin Anda batasi di balik jendela keamanan dua minggu.
Otak yang sama, dilatih ulang.
Semua yang membuat GLM-5.2 menjadi server yang praktis tetap dipertahankan: MoE 743B dengan sekitar 40B parameter aktif, perhatian sparse IndexShare yang memangkas FLOPs pada konteks 1M, lisensi MIT, jendela konteks 1M, dan throughput token yang ramping yang terukur sekitar 145–168 token/detik dalam pengamatan independen. GLM-5.3 hanya berbeda dalam satu dimensi — pasca-pelatihan. Z.ai meningkatkan skala tahap reinforcement learning dengan kerangka IndexShare, SAO, dan Slime, menambahkan lingkungan tugas long-horizon puluhan kali lebih banyak, dan memperluasnya dari debugging kode ke penemuan kerentanan keamanan dan rekayasa sistem. Hasilnya adalah model yang berperilaku berbeda pada perangkat keras yang sama, itulah sebabnya pertanyaan tentang peningkatan bukanlah "apakah saya perlu GPU baru" melainkan "apakah saya perlu perilaku baru."
Delta tolok ukur, dalam kedua arah.
Jika dibaca sebagai perbandingan sebelum-dan-sesudah pada angka-angka yang dipublikasikan Z.ai, lompatan tersebut adalah yang terbesar dalam sejarah open-weights. Terminal-Bench 3.0 — revisi yang lebih sulit, di mana keduanya diberi skor — naik dari 4.6 menjadi 28.3, lompatan enam kali lipat. DeepSWE v1.1 naik dari 46.2 menjadi 66.9, yang merupakan perbedaan antara 'model open yang baik' dan 'kompetitif dengan model tertutup terdepan.' Subset CLI Agents' Last Exam bergerak dari 23.8 menjadi 28.5. Penemuan kerentanan CyberGym naik dari 77.2 menjadi 84.5. ExploitBench lebih dari dua kali lipat, dari 24.4 menjadi 54.4, dan throughput ExploitGym naik dari 29 dan 39 tugas yang diselesaikan (dua dan enam jam) menjadi 105 dan 130. Z.ai merangkumnya sebagai peningkatan coding sekitar 50%, dan bentuk peningkatan tersebut — terpusat pada coding jangka panjang, otomatisasi terminal, dan keamanan — konsisten dengan model yang hanya melalui post-training: pengetahuan mentahnya sama, tetapi kemampuan untuk benar-benar melakukan pekerjaan multi-langkah itulah yang menjadi lebih kuat.
• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3
DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5
• Penemuan kerentanan CyberGym — GLM-5.2 77.2 vs GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4


Kapabilitas yang tidak dijadwalkan oleh siapa pun
Keuntungan keamanan ini layak mendapat paragraf tersendiri karena Z.ai mengatakan bahwa hal itu bukan bagian dari rencana. Tim pasca-pelatihan menambahkan lingkungan penemuan kerentanan dengan harapan terjadi peningkatan yang sederhana; alih-alih demikian, model tersebut mulai merangkai eksploitasi secara utuh — sebuah perilaku emergen yang memaksa Z.ai menahan bobot model selama sekitar dua minggu untuk penguatan keamanan. Dalam pengujian dunia nyata dengan tim keamanan, GLM-5.3 berkontribusi dalam menemukan 2.436 kerentanan di 269 proyek, 1.097 di antaranya berisiko sedang atau tinggi, termasuk celah yang tidak terdeteksi selama puluhan tahun pada perangkat lunak yang digunakan secara luas. GLM-5.2 memiliki kemampuan keamanan dalam arti biasa — ia dapat membaca kode untuk mencari bug. GLM-5.3 memilikinya dalam arti yang berbeda: ia adalah hal yang menjadi inti dari jendela keamanan tersebut. Itu adalah perubahan jenis, bukan derajat, dan itulah alasan tunggal yang paling kuat untuk memperlakukan kedua model sebagai produk yang berbeda meskipun berbagi basis yang sama.

Peringatan konsistensi
Penyeimbang dari setiap angka di atas adalah bahwa pengujian pihak ketiga awal menggambarkan GLM-5.3 sebagai tidak konsisten dengan cara yang tidak terjadi pada GLM-5.2. Para peninjau independen melaporkan model yang sama tampil seperti insinyur alih daya yang lulus pas-pasan pada beberapa tugas dan memberikan hasil kelas profesional pada tugas lainnya, dengan perbedaan yang mengikuti seberapa jelas persyaratan dispesifikasikan. Itu persis profil kegagalan yang akan Anda prediksi dari model yang peningkatannya seluruhnya berasal dari pasca-pelatihan yang sarat lingkungan: ia melakukan generalisasi dari bentuk-bentuk tugas yang dilatihkan padanya, dan prompt yang dispesifikasikan dengan buruk berada di luar cakupan tersebut. Tidak ada satu pun hasil independen yang sebersih tabel yang dipublikasikan Z.ai, dan belum ada satu pun angka Z.ai yang direproduksi secara independen. Untuk produksi, hal itu menganjurkan evaluasi eksplisit pada beban kerja Anda sendiri sebelum migrasi — peringatan yang sama yang juga berlaku untuk GLM-5.2, kini dengan rentang yang lebih lebar antara kasus terbaik dan terburuk.
Harga, akses, dan pertanyaan tentang penantian
Harganya identik, sehingga menghilangkan gesekan upgrade yang biasa terjadi: kedua model sama-sama $1,40 / $4,40 per juta token, dengan GLM-5.3 yang mengharuskan mode thinking aktif. Akseslah yang menjadi perbedaan sesungguhnya. GLM-5.2 dapat diunduh hari ini di bawah lisensi MIT, dapat di-host sendiri dengan footprint FP8 di bawah satu terabyte, dan dapat dipanggil melalui OrcaRouter dengan harga daftar tanpa markup — model yang bisa Anda rute sekarang juga, stabil, dan dinilai secara independen. GLM-5.3 kini dapat digunakan melalui ZCode / AutoClaw milik Z.ai dan GLM Coding Plan, tetapi API publik dan bobotnya (weights) sama-sama masih dibatasi selama safety window, dan seluruh angka benchmark-nya masih berasal dari laporan vendor, sembari menunggu pengujian ulang oleh pihak ketiga. Jadi, jawaban jujur atas pertanyaan "haruskah saya menunggu?" terdiri dari dua bagian: untuk lalu lintas produksi yang tidak boleh mengalami regresi, GLM-5.2 tetap menjadi pilihan open-weights yang aman saat ini; dan begitu API GLM-5.3 dibuka serta hasil uji independen terkonfirmasi, perpindahannya hanyalah pergantian rute, bukan penulisan ulang — Anda tetap memakai pengaturan satu kunci yang sama dan tinggal berpindah jalur. Untuk pekerjaan eksplorasi dan evaluasi keamanan, GLM-5.3 layak dicoba sekarang melalui tools Z.ai, dengan pemahaman bahwa keunggulan yang dipublikasikannya belum terverifikasi dan perilakunya lebih bervariasi daripada model yang digantikannya.
Vonis yang Jujur
GLM-5.3 adalah model yang lebih baik menurut angka-angka Z.ai sendiri — jauh lebih baik dalam pengodean jangka panjang dan berbeda secara kategoris dalam hal keamanan — dan gratis untuk alur kerja Anda karena basis, jejak, dan harganya tidak berubah. Namun, "lebih baik pada evaluasi vendor" dan "lebih baik di pipeline Anda" dipisahkan oleh dua hal yang sudah dimiliki GLM-5.2 dan belum dimiliki GLM-5.3: reproduksi independen dan bobot rilis. Jika Anda sudah menjalankan GLM-5.2, jalur peningkatan adalah yang termurah dalam sejarah open-weights — perangkat keras yang sama, harga yang sama, permukaan API yang sama, dan tunggu dua minggu untuk bobotnya. Keputusannya kurang tentang apakah GLM-5.3 lebih baik daripada GLM-5.2, dan lebih tentang apakah Anda bersedia mempertaruhkan produksi pada model yang perbaikannya, serta kemampuan keamanan yang baru muncul, belum dikonfirmasi oleh siapa pun di luar Z.ai.
