
GLM-5.3 Diluncurkan: Kebocoran Itu Nyata — Andalan Pengodean & Pertahanan Siber Pasca-Pelatihan Z.ai
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Kebocoran itu nyata, peluncurannya sudah hadir, dan GLM-5.3 kini memiliki skor independen untuk diperdebatkan. Indeks Kecerdasan milik Artificial Analysis — diukur oleh laboratorium, bukan oleh Z.ai — menempatkan GLM-5.3 di angka 60, sejajar dengan Kimi K3 untuk skor open-weights tertinggi di papan dan unggul 7 poin dari GLM-5.2 yang berada di 53. API mulai beroperasi minggu ini dengan harga yang sama dengan pendahulunya, open weights dikonfirmasi untuk Jumat, 28 Agustus, dan klaim pengkodean serta pertahanan siber yang Z.ai lontarkan sejak pengumuman 14 Agustus mulai dapat diuji. Halaman ini pertama kali melacak GLM-5.3 dari jejak kebocoran 3 Agustus; ini adalah laporan peluncuran, diperbarui di tempat dengan apa yang sebenarnya dikonfirmasi oleh peluncuran, API, dan tolok ukur independen pertama.
Dari kebocoran hingga peluncuran
Empat jejak yang muncul pada 3 Agustus — halaman harness "ZCode for GLM-5.3", halaman dokumen resmi yang dapat diakses selama sekitar satu jam, entri indeks Bing yang berbunyi "GLM-5.3 Official Harness", dan sebuah commit yang menambahkan entri "glm-5.3" dengan dukungan JSON Schema ke Java SDK resmi Zhipu — semuanya mengarah pada rilis nyata yang memiliki nama. Balasan "sooooooon" dari salah satu pendiri Z.ai, Tang Jie, dan penyebutan "epic-level plus" kini dikonfirmasi oleh produk nyata, bukan sekadar rumor. Sinyal waktu "sekitar seminggu" yang diuji oleh laman ini — diposting di X oleh @teortaxesTex setelah DeepSeek V4 Pro rilis pada 13 Agustus — terbukti tepat hingga ke harinya: Z.ai secara resmi mengumumkan GLM-5.3 pada 14 Agustus dengan slogan "Dibangun untuk Coding. Siap untuk Pertahanan Siber." Tindak lanjutnya datang minggu ini: pada 19 Agustus Z.ai mengatakan API GLM-5.3 sudah aktif dan terbuka untuk dipanggil, dengan harga yang sama seperti GLM-5.2, dan modelnya sudah terintegrasi dengan ZCode, AutoClaw, dan GLM Coding Plan.
Apa yang sebenarnya diperoleh dari post-training
Klaim arsitektural adalah bagian yang perlu dipastikan, karena spesifikasi paling mencolok dari kebocoran tersebut — parameter yang naik melewati satu triliun — adalah salah. GLM-5.3 bukan model yang lebih besar. Z.ai mengatakan model ini menggunakan kembali basis Mixture-of-Experts 743B yang sama persis dengan GLM-5.2 (sekitar 40 miliar parameter aktif per token), mempertahankan jendela konteks 1M-token yang sama dan output maksimum sekitar 128K, dan mendapatkan semua peningkatannya dari post-training yang diperbesar skalanya: lebih banyak lingkungan tugas jangka panjang, lebih banyak jenis lingkungan, dan sesi pelatihan yang lebih lama, dibangun di atas kerangka kerja IndexShare long-context, SAO asynchronous-RL, dan slime framework open-source yang sudah menghasilkan GLM-5.2. Kerangka "tanpa pelatihan ulang, semua post-training" itu adalah milik Z.ai sendiri, dan belum diaudit secara independen. Ukuran adalah judul utama lainnya: dengan total 743B parameter dan hanya sekitar 40B aktif per token, GLM-5.3 cukup ringan untuk di-host sendiri di kluster sederhana dan cukup murah untuk dilayani dalam volume besar — positioning "lebih kecil, lebih murah, terbuka" yang dilekatkan komentar hari peluncuran padanya, dan kontras tajam dengan flagship frontier tertutup yang dibandingkan dengannya.
Coding dan agen: angka yang diklaim Z.ai
Dalam hal coding, Z.ai melaporkan — semuanya angka dari vendor dan belum direproduksi — Terminal-Bench 3.0 naik dari 4,6 ke 28,3, yang oleh Z.ai disebut sebagai skor open-weights tertinggi pada pengujian tersebut; DeepSWE v1.1 naik dari 46,2 ke 66,9; SWE-Marathon kira-kira berlipat ganda dari 19,4 ke 42,5; dan Agents' Last Exam (CLI) naik dari 23,8 ke 28,5. Pada benchmark kode internal Z.ai, GLM-5.3 mencetak 31,4% dengan sekitar 50K token output per tugas pada usaha tinggi, dibandingkan Claude Opus 4.8 yang mencetak 29,5% dengan sekitar 120K token — maksud Z.ai adalah bahwa GLM-5.3 mencapai hasil yang sebanding sambil mengeluarkan jauh lebih sedikit token output. Claude Fable 5 masih memimpin evaluasi internal tersebut dengan 39,5% pada usaha maksimum, dan Z.ai mengakui GLM-5.3 masih tertinggal dari GPT-5.6 Sol dan Claude Fable 5 pada beberapa evaluasi coding yang lebih sulit. Anggap semua ini sebagai angka vendor sampai pengujian independen mereproduksinya.
Pertahanan siber: kemampuan yang tidak terduga
Angka-angka keamanan siber adalah berita yang sesungguhnya, dan semuanya juga dilaporkan oleh vendor. Pada CyberGym, sebuah tolok ukur penemuan dan validasi kerentanan white-box, Z.ai melaporkan GLM-5.3 pada 84,5%, naik dari 77,2% milik GLM-5.2 dan unggul dari Mythos 5 (83,8%) milik Anthropic serta GPT-5.6 Sol (83,6%). Pada ExploitBench, yang menuntut analisis akar masalah dan eksploit yang berfungsi, GLM-5.3 meningkat lebih dari dua kali lipat dari 24,4% menjadi 54,4%, meskipun Mythos 5 (78,0%) tetap unggul. Pada ExploitGym, Z.ai melaporkan 105 tugas diselesaikan dalam batas waktu 2 jam dan 130 dalam 6 jam, dibandingkan 29 dan 39 untuk GLM-5.2 — lagi-lagi di belakang Mythos 5 (181 dan 247). Z.ai membingkai kemampuan siber tersebut sebagai properti yang muncul dari pasca-pelatihan berskala — "kemampuan terus bertambah seiring skala pelatihan," menurut kata-kata perusahaan — bukan sebagai target yang disengaja.
Z.ai menambahkan klaim dunia nyata untuk mendukung tolok ukurnya: dalam pengujian dengan tim keamanan, GLM-5.3 mengidentifikasi 2.436 kerentanan di 269 proyek sumber terbuka, 1.097 di antaranya dinilai kritis atau tingkat keparahan tinggi, dengan temuan tertua berasal dari tahun 1981 dan rata-rata "masa hidup" 26,6 tahun. Itu adalah angka yang paling mencolok dalam pengumuman tersebut dan juga yang paling sulit diverifikasi secara independen. Perusahaan telah memasangkan kemampuan ini dengan Security Disclosure Ledger untuk pengungkapan terkoordinasi, program "trusted access" yang membatasi fungsi siber sensitif hanya untuk pengguna terverifikasi, serta inisiatif "Open Source Shield" untuk mengaudit secara berkelanjutan proyek-proyek sumber terbuka utama.
Garis dasar GLM-5.3 yang harus dikalahkan
GLM-5.2 adalah titik acuan yang menjadi tumpuan keseluruhan cerita ini. Model ini dirilis pada Juni 2026 sebagai model Mixture-of-Experts berkekuatan 743B dengan sekitar 40B parameter aktif per token, jendela konteks 1M token, output maksimal 128K, lisensi MIT, dan bobot terbuka di Hugging Face. Secara independen, Intelligence Index dari Artificial Analysis menempatkan GLM-5.2 di angka 53—skor bobot terbuka tertinggi di indeks tersebut hingga minggu ini. GLM-5.3 kini mengungguli angka itu dengan selisih 7 poin: Artificial Analysis mengukur GLM-5.3 di angka 60 pada indeks yang sama (v4.1.1), menyamai Kimi K3 untuk posisi teratas bobot terbuka dan mendaratkannya di jalur frontier bersama model flagship tertutup seperti Claude Fable 5 dan GPT-5.6 Sol. Itu adalah angka independen pertama yang melekat pada GLM-5.3, dan angka tersebut konsisten dengan arah—meskipun tidak semua detail—dari klaim Z.ai sendiri. Untuk pengodean horizon panjang, harness OrcaRouter mengukur 77,9 pada Terminal-Bench 2.1, sementara angka terbaik GLM-5.2 yang dilaporkan Z.ai adalah 82,7, yang akan menjadi skor bobot terbuka pertama di atas 80, tetapi angka itu berasal dari vendor dan belum direproduksi. Harga daftarnya adalah $1,40 per juta token input dan $4,40 per juta token output.

Papan skor di atas adalah proyeksi era bocoran yang diterbitkan halaman ini sebelum peluncuran — baris ">1T params (rumored)", konteks dan lisensi yang belum dikonfirmasi, indeks AA yang diproyeksikan. Peluncuran mengoreksi sel terbesar: GLM-5.3 menggunakan basis 743B yang sama dengan GLM-5.2, jadi tidak ada lompatan parameter. Jendela konteks dikonfirmasi pada 1M, dan lisensinya tetap belum dikonfirmasi karena bobot terbuka belum dirilis. Sel indeks yang diproyeksikan — tebakan halaman ini sendiri sekitar 57–60 — adalah proyeksi langka yang tepat sasaran: angka sebenarnya adalah 60, dan pertanyaan terbuka sekarang adalah apa yang terjadi ketika skor tersebut direproduksi terhadap bobot yang sebenarnya.

Tangkapan di atas adalah baseline independen yang menjadi acuan klaim GLM-5.3. GLM-5.2 memuncaki papan peringkat open-weights pada Artificial Analysis Intelligence Index dengan skor 53. Uji pertama apakah delta pasca-pelatihan GLM-5.3 mampu menggerakkan angka tersebut kini tiba: Artificial Analysis mengukur GLM-5.3 pada skor 60 di indeks yang sama — setara dengan Kimi K3 untuk memimpin open-weights, unggul 7 poin dari GLM-5.2, dan dilaporkan oleh lab sebagai hasil pengukuran independen.
Harga dan ketersediaan
GLM-5.3 dibanderol dengan harga yang sama dengan GLM-5.2: $1.40 per juta token input dan $4.40 per juta token output (¥8 / ¥28 dalam daftar harga domestik), dengan pembacaan input cache sebesar $0.26 / ¥2 per juta. Z.ai mengumumkan API tersebut telah dibuka pada 19 Agustus, dan API ini dapat diakses melalui API milik Z.ai sendiri, ZCode, AutoClaw, GLM Coding Plan, dan beberapa gateway mitra. Satu perubahan perilaku penting bagi pemanggil API: permintaan kini mengharuskan "thinking" diaktifkan di tiga tingkat upaya — rendah, tinggi, dan maksimal — tanpa opsi untuk mematikannya, sebuah perubahan yang merusak (breaking change) bagi integrasi yang sudah ada.
Harga yang sama tidak berarti tagihan yang sama. GLM-5.3 memproses sekitar 20% lebih banyak token per tugas daripada GLM-5.2 pada beban kerja yang sama, yang jika dibaca dari biaya per tugas berada di sekitar $0.68 dibandingkan $0.44 milik GLM-5.2 — masih di bawah Kimi K3 (sekitar $0.84) dan GPT-5.6 Sol (sekitar $1.23). Perhitungan per tugas tersebut adalah perkiraan turunan dari penggunaan token yang teramati, bukan angka resmi vendor, tetapi angka itulah yang menentukan apakah kartu tarif tetap $1.40 / $4.40 benar-benar menghemat uang Anda.
Apa yang peluncuran ini ubah bagimu
Bagi pemanggil API yang sudah berada di GLM-5.2, langkah praktisnya adalah mengubah nama model, bukan proyek: GLM-5.2 kompatibel dengan OpenAI dan integrasinya tetap berlanjut, dengan peringatan thinking-effort di atas. Bagi yang self-hosting, garis waktunya kini berupa tanggal, bukan perkiraan: Zhipu menjanjikan bobot "dua minggu setelah rilis" pada 14 Agustus, yang jatuh pada Jumat, 28 Agustus, dan pertanyaan terbukanya adalah apakah lisensinya tetap permisif. Bagi siapa pun yang membandingkan model-model di tingkat DeepSeek V4 Pro, Qwen3.8-Max, Kimi K3, GPT-5.6 Sol, dan Claude Fable 5, GLM-5.3 kini menjadi variabel nyata yang dinilai secara independen dalam peringkat tersebut, bukan sekadar kabar burung.
Argumen hari peluncuran seputar GLM-5.3 adalah bahwa garis depan coding telah menyatu: untuk sebagian besar tugas sehari-hari, menurut ceritanya, hanya sedikit pengguna yang dapat membedakan dengan andal antara GPT-5.6 Sol, Claude Fable 5, Kimi K3, GLM-5.2, dan Qwen3.8-Max. Jika konvergensi itu nyata, faktor penentu tidak lagi berupa kemampuan mentah, melainkan harga, keterbukaan, dan biaya peralihan — yang justru menjadi ceruk yang digarap GLM-5.3 dengan harga $1.40 / $4.40 per juta pada basis 743B yang dapat di-host sendiri dengan bobot yang dikonfirmasi untuk 28 Agustus. Apakah model-model coding benar-benar dapat dipertukarkan adalah opini, bukan tolok ukur; harga, jumlah parameter, dan tanggal bobot bukanlah opini.
Di sisi routing, GLM-5.3 mulai aktif di OrcaRouter pada 18 Agustus, hari yang sama saat API Z.ai dibuka — sesuai harga daftar first-party, $1.40 / $4.40 per juta, diteruskan tanpa markup. Tangkapan layar di bawah ini menampilkan halaman GLM-5.2, yang persis seperti bentuk GLM-5.3 sekarang: harga yang sama, konteks 1M token yang sama, output maksimal 128K yang sama. Merutekan sebagian lalu lintas nyata ke GLM-5.3 dengan failover otomatis ke GLM-5.2 atau model lain yang terbukti adalah perubahan konfigurasi, bukan penulisan ulang — kunci yang sama, tanpa kontrak kedua. Jika model baru mengalami regresi pada beban kerja Anda, router akan kembali sebelum halaman berganti, dan Anda mendapatkan sinyal kualitas dari lalu lintas Anda sendiri, bukan dari slide vendor. Untuk model yang klaim utamanya masih sebagian besar berasal dari laporan vendor, itulah cara berisiko rendah untuk mengetahuinya sendiri.

Tontonan Berikutnya
• Bobot, pada Jumat, 28 Agustus, dan baris lisensi di kartu model — MIT permisif seperti GLM-5.2, atau sesuatu yang lebih sempit. Penguatan keamanan siber Zhipu adalah alasan yang dinyatakan untuk penundaan dua minggu, dan program "akses tepercaya" menunjukkan beberapa fungsi akan tetap dibatasi.
• Apakah klaim-klaim siber tersebut bertahan di luar kerangka uji milik Z.ai sendiri. Klaim 2.436 kerentanan di dunia nyata dan keunggulan CyberGym adalah angka-angka yang pertama kali akan diuji oleh laboratorium independen; Indeks Kecerdasan AA mengukur kemampuan umum, bukan keamanan.
• Di mana indeks berada setelah bobot-bobotnya dirilis. Skor 60 dinilai terhadap API yang dilayani; versi self-hosted, dengan lisensi terlampir, adalah versi yang sebenarnya akan dipakai ulang oleh tim.
• Kenaikan harga yang diumumkan DeepSeek V4 Flash, yang menjadi acuan harga bagi GLM-5.3, dan keunggulan satu poin GPT-5.6 Sol pada 61.
FAQ
Apakah GLM-5.3 adalah model yang lebih besar daripada GLM-5.2?
Tidak. Z.ai mengatakan GLM-5.3 menggunakan basis Mixture-of-Experts dengan 743 miliar parameter yang sama dengan GLM-5.2, dengan jendela konteks 1M token yang sama dan sekitar 40 miliar parameter aktif per token. Semua peningkatan yang dilaporkan berasal dari post-training berskala, bukan penambahan parameter — yang secara langsung mengoreksi rumor era bocoran tentang basis di atas satu triliun. Klaim arsitektur itu adalah milik Z.ai sendiri dan belum diaudit secara independen.
Kapan open weights GLM-5.3 akan tersedia?
Jumat, 28 Agustus. Zhipu menjanjikan bobot "dua minggu setelah rilis" ketika mengumumkan GLM-5.3 pada 14 Agustus, dan mengatakan "Jumat depan" saat API mulai beroperasi pada 19 Agustus — kedua pembacaan jatuh pada tanggal yang sama. Lisensi belum dikonfirmasi, dan Z.ai telah mengatakan bahwa fungsi siber sensitif akan dibatasi pada program "akses tepercaya" bagi pengguna terverifikasi.
Bagaimana saya harus memperlakukan angka-angka benchmark?
Pisahkan daftarnya. Lompatan coding — Terminal-Bench 3.0 pada 28.3, DeepSWE v1.1 pada 66.9, SWE-Marathon pada 42.5 — dan hasil siber — CyberGym 84.5%, ExploitBench 54.4% — semuanya berasal dari pengumuman Z.ai sendiri dan tetap berstatus laporan vendor hingga kerangka uji independen mereproduksinya. Artificial Analysis Intelligence Index sebesar 60 adalah pengukuran independen pertama, dan angka itulah yang menjadi tolok ukur untuk menilai semua klaim Z.ai.
Kebocoran itu nyata, dan peluncurannya mengonfirmasi nama, pembingkaian, dan waktu — sekaligus mengoreksi satu hal spesifik yang paling ramai dibicarakan oleh gosip. GLM-5.3 adalah basis yang sama, dilatih lanjut secara intensif, dan kini ia membawa skor independen untuk mengukur klaim vendornya: 60 pada Artificial Analysis Intelligence Index, sejajar dengan Kimi K3, unggul tujuh angka dari GLM-5.2. Angka coding dan cyber masih milik Z.ai sendiri, bobot rilis pada 28 Agustus, dan yang tersisa untuk diselesaikan adalah garis lisensi serta penyelidikan yang benar-benar independen terhadap klaim keamanan. Sampai saat itu, cara berisiko rendah untuk membentuk pandangan sendiri adalah dengan mengambil sebagian lalu lintas asli dan failover ke sesuatu yang sudah terbukti.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
