Kartu judul hero untuk perbandingan GLM-5.3 dan GLM-5.2, dengan subjudul 'Otak yang sama, tolok ukur berlipat ganda', menampilkan dua kartu model yang berbagi satu blok dasar MoE 743B yang saling terhubung serta panah peningkatan melengkung berlabel 'hanya pasca-pelatihan' yang menunjuk dari GLM-5.2 ke GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Otak Sama, Benchmark Dua Kali Lipat

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cara Zhipu AI sendiri membingkai peningkatan dari GLM-5.2 ke G​LM-5.3 adalah yang jujur: buku teksnya tidak berubah, hanya pelatihan siswanya yang berubah. G​LM-5.3, yang dirilis pada 14 Agustus 2026, dibangun di atas basis MoE dengan 743 miliar parameter yang sama persis dengan GLM-5.2, yang memuncaki bidang bobot terbuka pada Indeks Kecerdasan Artificial Analysis pada bulan Juni. Arsitekturnya tidak berubah, jejaknya tidak berubah, harga $1.40 / $4.40 per juta tidak berubah — namun Z.ai melaporkan bahwa model yang dilatih ulang ini menggandakan atau melampaui pendahulunya pada beberapa tolok ukur pengkodean dan keamanan yang dipublikasikan oleh kedua versi. Apakah hal itu menjadikan G​LM-5.3 sebagai peningkatan yang wajib atau sikap tunggu-dan-lihat bergantung pada seberapa besar Anda mempercayai model yang meningkat pesat tanpa mengubah arsitekturnya sendiri, dan pada apakah kemampuan siber yang baru muncul itu adalah fitur yang ingin Anda batasi di balik jendela keamanan dua minggu.

Otak yang sama, dilatih ulang.

Semua yang membuat GLM-5.2 menjadi server yang praktis tetap dipertahankan: MoE 743B dengan sekitar 40B parameter aktif, perhatian sparse IndexShare yang memangkas FLOPs pada konteks 1M, lisensi MIT, jendela konteks 1M, dan throughput token yang ramping yang terukur sekitar 145–168 token/detik dalam pengamatan independen. G​LM-5.3 hanya berbeda dalam satu dimensi — pasca-pelatihan. Z.ai meningkatkan skala tahap reinforcement learning dengan kerangka IndexShare, SAO, dan Slime, menambahkan lingkungan tugas long-horizon puluhan kali lebih banyak, dan memperluasnya dari debugging kode ke penemuan kerentanan keamanan dan rekayasa sistem. Hasilnya adalah model yang berperilaku berbeda pada perangkat keras yang sama, itulah sebabnya pertanyaan tentang peningkatan bukanlah "apakah saya perlu GPU baru" melainkan "apakah saya perlu perilaku baru."

Delta tolok ukur, dalam kedua arah.

Jika dibaca sebagai perbandingan sebelum-dan-sesudah pada angka-angka yang dipublikasikan Z.ai, lompatan tersebut adalah yang terbesar dalam sejarah open-weights. Terminal-Bench 3.0 — revisi yang lebih sulit, di mana keduanya diberi skor — naik dari 4.6 menjadi 28.3, lompatan enam kali lipat. DeepSWE v1.1 naik dari 46.2 menjadi 66.9, yang merupakan perbedaan antara 'model open yang baik' dan 'kompetitif dengan model tertutup terdepan.' Subset CLI Agents' Last Exam bergerak dari 23.8 menjadi 28.5. Penemuan kerentanan CyberGym naik dari 77.2 menjadi 84.5. ExploitBench lebih dari dua kali lipat, dari 24.4 menjadi 54.4, dan throughput ExploitGym naik dari 29 dan 39 tugas yang diselesaikan (dua dan enam jam) menjadi 105 dan 130. Z.ai merangkumnya sebagai peningkatan coding sekitar 50%, dan bentuk peningkatan tersebut — terpusat pada coding jangka panjang, otomatisasi terminal, dan keamanan — konsisten dengan model yang hanya melalui post-training: pengetahuan mentahnya sama, tetapi kemampuan untuk benar-benar melakukan pekerjaan multi-langkah itulah yang menjadi lebih kuat.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs G​LM-5.3 28.3

DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5

• Penemuan kerentanan CyberGym — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

Kapabilitas yang tidak dijadwalkan oleh siapa pun

Keuntungan keamanan ini layak mendapat paragraf tersendiri karena Z.ai mengatakan bahwa hal itu bukan bagian dari rencana. Tim pasca-pelatihan menambahkan lingkungan penemuan kerentanan dengan harapan terjadi peningkatan yang sederhana; alih-alih demikian, model tersebut mulai merangkai eksploitasi secara utuh — sebuah perilaku emergen yang memaksa Z.ai menahan bobot model selama sekitar dua minggu untuk penguatan keamanan. Dalam pengujian dunia nyata dengan tim keamanan, G​LM-5.3 berkontribusi dalam menemukan 2.436 kerentanan di 269 proyek, 1.097 di antaranya berisiko sedang atau tinggi, termasuk celah yang tidak terdeteksi selama puluhan tahun pada perangkat lunak yang digunakan secara luas. GLM-5.2 memiliki kemampuan keamanan dalam arti biasa — ia dapat membaca kode untuk mencari bug. G​LM-5.3 memilikinya dalam arti yang berbeda: ia adalah hal yang menjadi inti dari jendela keamanan tersebut. Itu adalah perubahan jenis, bukan derajat, dan itulah alasan tunggal yang paling kuat untuk memperlakukan kedua model sebagai produk yang berbeda meskipun berbagi basis yang sama.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

Peringatan konsistensi

Penyeimbang dari setiap angka di atas adalah bahwa pengujian pihak ketiga awal menggambarkan G​LM-5.3 sebagai tidak konsisten dengan cara yang tidak terjadi pada GLM-5.2. Para peninjau independen melaporkan model yang sama tampil seperti insinyur alih daya yang lulus pas-pasan pada beberapa tugas dan memberikan hasil kelas profesional pada tugas lainnya, dengan perbedaan yang mengikuti seberapa jelas persyaratan dispesifikasikan. Itu persis profil kegagalan yang akan Anda prediksi dari model yang peningkatannya seluruhnya berasal dari pasca-pelatihan yang sarat lingkungan: ia melakukan generalisasi dari bentuk-bentuk tugas yang dilatihkan padanya, dan prompt yang dispesifikasikan dengan buruk berada di luar cakupan tersebut. Tidak ada satu pun hasil independen yang sebersih tabel yang dipublikasikan Z.ai, dan belum ada satu pun angka Z.ai yang direproduksi secara independen. Untuk produksi, hal itu menganjurkan evaluasi eksplisit pada beban kerja Anda sendiri sebelum migrasi — peringatan yang sama yang juga berlaku untuk GLM-5.2, kini dengan rentang yang lebih lebar antara kasus terbaik dan terburuk.

Harga, akses, dan pertanyaan tentang penantian

Harganya identik, sehingga menghilangkan gesekan upgrade yang biasa terjadi: kedua model sama-sama $1,40 / $4,40 per juta token, dengan G​LM-5.3 yang mengharuskan mode thinking aktif. Akseslah yang menjadi perbedaan sesungguhnya. GLM-5.2 dapat diunduh hari ini di bawah lisensi MIT, dapat di-host sendiri dengan footprint FP8 di bawah satu terabyte, dan dapat dipanggil melalui OrcaRouter dengan harga daftar tanpa markup — model yang bisa Anda rute sekarang juga, stabil, dan dinilai secara independen. G​LM-5.3 kini dapat digunakan melalui ZCode / AutoClaw milik Z.ai dan G​LM Coding Plan, tetapi API publik dan bobotnya (weights) sama-sama masih dibatasi selama safety window, dan seluruh angka benchmark-nya masih berasal dari laporan vendor, sembari menunggu pengujian ulang oleh pihak ketiga. Jadi, jawaban jujur atas pertanyaan "haruskah saya menunggu?" terdiri dari dua bagian: untuk lalu lintas produksi yang tidak boleh mengalami regresi, GLM-5.2 tetap menjadi pilihan open-weights yang aman saat ini; dan begitu API G​LM-5.3 dibuka serta hasil uji independen terkonfirmasi, perpindahannya hanyalah pergantian rute, bukan penulisan ulang — Anda tetap memakai pengaturan satu kunci yang sama dan tinggal berpindah jalur. Untuk pekerjaan eksplorasi dan evaluasi keamanan, G​LM-5.3 layak dicoba sekarang melalui tools Z.ai, dengan pemahaman bahwa keunggulan yang dipublikasikannya belum terverifikasi dan perilakunya lebih bervariasi daripada model yang digantikannya.

Vonis yang Jujur

G​LM-5.3 adalah model yang lebih baik menurut angka-angka Z.ai sendiri — jauh lebih baik dalam pengodean jangka panjang dan berbeda secara kategoris dalam hal keamanan — dan gratis untuk alur kerja Anda karena basis, jejak, dan harganya tidak berubah. Namun, "lebih baik pada evaluasi vendor" dan "lebih baik di pipeline Anda" dipisahkan oleh dua hal yang sudah dimiliki GLM-5.2 dan belum dimiliki G​LM-5.3: reproduksi independen dan bobot rilis. Jika Anda sudah menjalankan GLM-5.2, jalur peningkatan adalah yang termurah dalam sejarah open-weights — perangkat keras yang sama, harga yang sama, permukaan API yang sama, dan tunggu dua minggu untuk bobotnya. Keputusannya kurang tentang apakah G​LM-5.3 lebih baik daripada GLM-5.2, dan lebih tentang apakah Anda bersedia mempertaruhkan produksi pada model yang perbaikannya, serta kemampuan keamanan yang baru muncul, belum dikonfirmasi oleh siapa pun di luar Z.ai.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube