
GLM 5.5 atau GLM 5.3-Vision? Model Anonim yang Cocok dengan Sidik Jari Z.ai Baru Saja Muncul
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Model tak dikenal yang profil pelayanannya — kecepatan, waktu-ke-token-pertama, rasio cache hit — cocok dengan tumpukan GLM milik Z.ai mulai menarik perhatian para analis kapasitas, dan dugaan sementara adalah model tersebut mungkin diberi nama GLM 5.3-Vision atau GLM 5.5. Pada 20 Agustus, analis komputasi dan kapasitas teortaxesTex memposting bahwa model anonim yang dia lacak "jelas bukan DeepSeek, setidaknya," bahwa "sejauh ini tidak ada yang mengesampingkan GLM," dan bahwa "kecepatan, ttft, rasio cache hit juga cocok dengan GLM." Bacaannya: perkirakan model itu akan disebut GLM 5.3-Vision atau 5.5, dengan skor sekitar 61 pada Artificial Analysis Intelligence Index — satu poin di atas posisi GLM-5.3 yang dirilis saat ini. Tidak ada yang terkonfirmasi di sini. Belum ada model card, pengumuman Z.ai, atau API, dan halaman ini memperlakukan penampakan tersebut sebagaimana adanya: sinyal kebocoran awal yang belum direplikasi, layak dilacak justru karena GLM-5.5 telah menjadi produk unggulan Z.ai yang dinanti sepanjang bulan ini dan belum muncul. Lima hari setelah postingan itu, titik data kedua yang kali ini sepenuhnya dapat diverifikasi tiba: pada 25 Agustus, vLLM — runtime inferensi di balik sebagian besar pelayanan model skala besar — membuka pull request Do-Not-Merge yang mengaktifkan dukungan kernel masked-MHA untuk dimensi head GLM-5. Pull request itu tidak menyebut varian apa pun dan tidak membuktikan peluncuran apa pun; ini adalah fondasi tumpukan pelayanan, jenis aktivitas latar belakang yang ditinggalkan model baru.
Apa yang sebenarnya dikatakan sinyal tersebut
Sumbernya adalah satu postingan X dari teortaxesTex, bertanggal 20 Agustus — akun yang sama yang sinyal waktu "kira-kira seminggu"-nya untuk peluncuran GLM-5.3 terbukti tepat hingga ke harinya di bulan Agustus. Pembingkaiannya eksplisit tentang tingkat bukti: "bukti kuat (belum direplikasi)." Analis tersebut mengecualikan DeepSeek, tidak menemukan hal yang bertentangan dengan GLM, dan mengutip tiga pengukuran tingkat serving — throughput, waktu hingga token pertama, dan tingkat cache hit — sebagai yang cocok dengan stack Z.ai. Lalu, dua nama kandidat, dan skor proyeksi: "Saat ini saya memperkirakan model ini akan diberi nama GLM 5.3-Vision atau 5.5, dan mendapat skor sekitar 61 di AA."
Ambil setiap bagian secara terpisah. Klaim identitas (bukan DeepSeek, cocok dengan GLM) adalah inferensi sidik jari dari cara model disajikan, bukan kartu model. Skor adalah ekspektasi, bukan pengukuran. Nama-nama hanyalah tebakan. Yang membuat sinyal ini lebih berharga daripada sekadar noise adalah bahwa sinyal ini konsisten secara arah dengan segala hal lain yang kita ketahui tentang peta jalan Z.ai bulan ini: GLM-5.3 dirilis hanya dengan teks, satu-satunya permintaan paling keras dari komunitas adalah visi, dan GLM-5.5 telah dilaporkan oleh berbagai media (via JPMorgan, Reuters, CGTN, dan catatan Goldman pada 18 Agustus) akan hadir "dalam bulan Agustus" — babak akhir bulan ini terjadi sekarang.
Mengapa sidik jari penyajian penting
Time-to-first-token dan cache hit rate adalah penanda tingkat infrastruktur. Keduanya ditentukan oleh cara penyedia membangun tumpukan inferensinya — penjadwal, tata letak cache, kebijakan batching — bukan oleh nama model yang dipanggil oleh sebuah prompt. Ketika seorang analis mengatakan bahwa TTFT dan cache hit rate sebuah model anonim cocok dengan GLM, mereka menyatakan bahwa tumpukan serving di baliknya berperilaku seperti milik Z.ai, yang merupakan hal terdekat dengan sidik jari yang bisa Anda dapatkan tanpa bobot atau kartu model. Itu bukan bukti. Vendor lain bisa meniru tumpukan yang sama, atau Z.ai bisa menyajikan model untuk mitra. Tetapi ini adalah klaim yang spesifik dan dapat diperiksa, dan peringatan "belum direplikasi" memberi tahu Anda bahwa analis tersebut tidak menyajikannya sebagai hal yang sudah tuntas.
Pengecualian DeepSeek juga penting. DeepSeek V4 Pro mencapai GA pada 13 Agustus dan build Flash-nya telah menjadi rilis open-weight China berkecepatan tinggi lainnya bulan ini. Sebuah model anonim yang menyingkirkan DeepSeek tetapi menunjuk ke GLM mempersempit pilihan menjadi pipeline Z.ai — dan pipeline Z.ai memiliki dua kandidat yang masuk akal, yang persis merupakan percabangan yang disebut oleh sinyal tersebut.
Sinyal kedua: stack serving sedang dibangun untuk attention GLM-5.
Pada 25 Agustus, titik data kedua tiba — yang satu ini sepenuhnya dapat diverifikasi. vLLM, runtime inferensi di balik sebagian besar penyajian model skala besar, menerima pull request #53785, berjudul "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Terverifikasi terhadap repositori, PR ini mengaktifkan jalur prefill masked-MHA untuk geometri perhatian GLM-5: 64 kepala, peringkat KV 512, dimensi kepala QK 192+64, dan dimensi kepala V 256 — tata letak QK/V 256/256, menurut deskripsi PR. Ini bergantung pada perubahan FlashAttention untuk dukungan mask dimensi kepala 256, untuk sementara mengunci FlashAttention ke commit fork (itulah gunanya penanda Do Not Merge), dan menambahkan ambang routing yang telah di-benchmark untuk jalur baru: batas pure-prefill FlashMLA sebesar 8K / 20K / 48K / 112K token pada TP 1/2/4/8, serta batas 64K yang dibulatkan untuk FlashInfer pada TP8. Penulis mencatat bahwa tidak ada PR terbuka lain yang mencakup dukungan masked-MHA GLM-5.
Bacalah sesuai apa adanya: ini kerja fondasi tumpukan serving, bukan pengumuman. PR tersebut tidak menyebut GLM 5.5 atau GLM 5.3-Vision — ia menulis "GLM-5" — dan mengaktifkan jalur prefill masked-MHA untuk dimensi head GLM-5 adalah kerja infrastruktur pada keluarga model yang ekosistem vLLM sudah jalankan melalui jalur sparse-MLA (garis keturunan GLM-5.3 sendiri dilayani di sana saat ini). Ini juga tidak terisolasi: PR-PR sejenis bulan ini mencakup pemeriksaan dimensi MLA FlashInfer untuk GLM-5, fallback Triton sparse-MLA untuk model kelas GLM-5, dan dukungan dimensi FlashAttention yang dilaporkan. Dua detail membuatnya tetap berada di radar pelacak kebocoran. Pertama, geometri yang ditargetkan — 64 head, KV rank 512, 256/256 QK/V — berbeda dari 192/128 milik DeepSeek, yang merupakan pemisahan yang sama, "bukan DeepSeek, cocok dengan GLM," yang digambar sidik jari model anonim, kini terlihat di tingkat kernel attention. Kedua, soal waktu: PR dibuka pada 25 Agustus, dalam jendela Agustus yang sama di mana GLM-5.5 telah dinanti sepanjang bulan. Tak satu pun dari itu membuktikan bahwa model anonim adalah GLM generasi berikutnya — ini bisa juga rekayasa pada model yang sudah dirilis — tetapi ini adalah jenis aktivitas latar yang dilakukan ekosistem serving sebelum sebuah model hadir, dan dapat diverifikasi dengan cara yang tidak bisa dilakukan postingan X mana pun.
Dua nama, satu fork: GLM 5.3-Vision vs GLM 5.5
Dua identitas kandidat tersebut sebenarnya adalah produk yang berbeda, dan kebocoran itu tidak menyelesaikan mana yang ada di papan.
GLM 5.3-Vision akan menjadi varian berkemampuan visi dari model yang dirilis pada 14 Agustus. GLM-5.3 hanya menerima input teks — Artificial Analysis mendaftarnya sebagai teks masuk, teks keluar, tanpa dukungan gambar — dan celah itu adalah keluhan paling keras dari komunitas. Ketika Tang Jie dari Z.ai menjalankan kampanye umpan balik global, komentar yang masuk pada dasarnya sepakat untuk visi, dan Z.ai sudah memiliki fondasinya (model multimodal GLM-5V-Turbo dan encoder CogVLM) yang belum mereka gabungkan ke lini unggulan. Varian 5.3-Vision akan menjadi cara tercepat untuk menutup celah itu.
• GLM 5.5 adalah andalan utamanya. Spesifikasi yang dilaporkan namun belum terkonfirmasi menunjukkan basis di atas satu triliun parameter (naik dari 743B milik GLM-5.3), konteks 1M-token yang dipertahankan, bobot terbuka, dan fokus agentic/coding yang lebih berat. Setiap catatan analis bulan ini memperlakukan 5.5 sebagai yang terbesar — kendaraan yang diisyaratkan oleh salah satu pendiri Z.ai, Tang Jie, akan menutup kesenjangan dengan model tertutup kelas Fable. Model ini diharapkan hadir pada bulan Agustus dan belum dirilis hingga tulisan ini dibuat.
Sidik jari yang sama tidak dapat memberi tahu Anda yang mana dari keduanya ini — 5.3 yang disetel untuk visi dan flagship baru sama-sama dapat menggunakan tumpukan penyajian yang sama. Ambiguitas itu adalah keadaan sinyal yang jujur, dan dua nama dalam postingan analis tersebut mencerminkannya daripada menyelesaikannya.
<img src="2.png" alt="Papan skor perbandingan dua kolom berjudul 'GLM 5.5 vs GLM-5.3 — papan skor'. Kolom kiri GLM 5.5 (bocor): 'AA Index ~61 (diproyeksikan, belum diverifikasi)', 'Status: belum dirilis', 'Ukuran >1T parameter (dikabarkan)', 'Visi: diharapkan', 'Konteks: 1M (diharapkan)', 'Harga: TBD'. Kolom kanan GLM-5.3 (dirilis): 'AA Index 60', 'Status: API aktif 19 Agu', 'Ukuran 743B MoE / 40B aktif', 'Visi: hanya teks', 'Konteks: 1M', 'Harga: $1,40 / $4,40'. Catatan kaki berbunyi 'Angka GLM 5.5 adalah proyeksi yang belum diverifikasi; GLM-5.3 menurut Artificial Analysis.'" />

Apa arti dari ~61 pada AA Intelligence Index
Skor yang diproyeksikan adalah bagian paling tajam dari kebocoran tersebut. Indeks Artificial Analysis Intelligence (v4.1.1) saat ini menempatkan GLM-5.3 di angka 60 — imbang dengan Kimi K3 untuk skor open-weights tertinggi, dan unggul 7 poin dari GLM-5.2 yang mencapai 53. Satu poin di atasnya, yaitu 61, adalah wilayah GPT-5.6 Sol, dengan Claude Fable 5 di 62 dan Claude Opus 5 di 63. Secara sederhana: model keluarga GLM dengan skor 61 akan menjadi satu-satunya skor open-weights tertinggi pada indeks tersebut, berada di atas Kimi K3 dan GLM-5.3, dan secara efektif sejajar dengan garis frontier tertutup.
Perlu ditekankan apa yang bukan 61. Itu adalah ekspektasi teortaxesTex terhadap apa yang akan dikembalikan oleh evaluasi independen, bukan skor Artificial Analysis yang dipublikasikan dan bukan angka dari vendor. Proyeksi bisa salah ke arah mana pun — varian vision mungkin mengorbankan satu atau dua poin pada indeks yang banyak teksnya, dan andalan >1T bisa mendarat lebih tinggi atau lebih rendah tergantung pada bagaimana post-training-nya berjalan. Nilai dari angka tersebut adalah klaim yang dikandungnya: siapa pun model anonim ini nantinya, ia diharapkan mengalahkan pemimpin open-weights saat ini, bukan sekadar menyamainya.

Apa yang dikonfirmasi, dan apa yang tidak
Jaga kebersihan buku besar, karena hidup atau matinya komponen kebocoran bergantung pada hal itu.
• Dikonfirmasi: GLM-5.3 benar-benar ada, dirilis pada 14 Agustus, API aktif pada 18/19 Agustus, mendapat skor 60 pada AA Intelligence Index (diukur secara independen oleh Artificial Analysis), dengan harga $1.40 / $4.40 per 1 juta token, hanya input teks, dengan bobot terbuka yang dikonfirmasi untuk Jumat, 28 Agustus. Fakta-fakta tersebut tidak bergantung pada kebocoran.
• Dikonfirmasi: GLM-5.5 masih belum dirilis. Pada saat penulisan ini, belum ada kartu model, belum ada harga, dan belum ada ketersediaan; jangka waktu Agustus dan angka parameter >1T dilaporkan oleh analis, bukan komitmen Z.ai.
• Belum terkonfirmasi: bahwa model anonim tersebut ada sebagai produk terpisah, bahwa itu adalah GLM, bahwa namanya akan menjadi GLM 5.3-Vision atau 5.5, dan bahwa skornya 61. Keempatnya hanya bertumpu pada satu postingan analis yang belum direplikasi.
• Juga belum terkonfirmasi: apakah model anonim ini bahkan berbeda dari GLM-5.3 itu sendiri. Endpoint GLM-5.3 yang live dengan alias tanpa label akan menghasilkan sidik jari penyajian yang sama. Sampai sebuah nama, kartu model, atau rilis bobot mengklarifikasinya, penafsiran "model baru" adalah prior yang kuat tetapi bukan fakta.
Tontonan Berikutnya
• Jumat, 28 Agustus — perilisan bobot GLM-5.3. Jika model anonim tersebut sebenarnya adalah 5.3 yang diubah namanya atau 5.3-Vision, perilisan bobot dan kartu model akan segera menjelaskannya.
• Pengamatan kedua yang menguatkan. Sidik jari seorang analis hanyalah hipotesis; pembacaan independen kedua pada entri anonim yang sama, atau daftar Artificial Analysis yang menyebutnya, meningkatkannya menjadi bukti.
Pernyataan apa pun dari Z.ai. GLM-5.5 telah dilaporkan untuk jendela Agustus, dan bulan ini hampir berakhir. Penamaan resmi, halaman harga, atau entri changelog API adalah peristiwa yang mengubah kebocoran ini menjadi kisah peluncuran.
• Apakah skor AA terwujud di angka 61. Jika model anonim tersebut nyata dan berasal dari keluarga GLM, skor indeks independen yang mendekati 61 akan menjadi nilai open-weights pertama yang menembus 60.
• Apakah pekerjaan attention vLLM mendapatkan nama model yang dilampirkan. PR #53785 menargetkan dimensi head "GLM-5" tanpa menyebut 5.3-Vision atau 5.5; sebuah merge, entri model yang didukung, atau kartu model yang memasangkan geometri tersebut dengan nama tertentu akan menjadi sinyal terkuat sejauh ini.
Bagaimana cara menangani kebocoran seperti ini
Kebocoran adalah alasan untuk bersiap, bukan untuk berpindah platform. Jika model keluarga GLM berikutnya tiba di atau dekat puncak papan peringkat open-weights, pertanyaan praktisnya adalah apakah akan mengarahkan lalu lintas nyata ke model tersebut — dan model yang belum terbukti dengan klaim vendor dan proyeksi satu analis adalah kasus yang justru menginginkan jaring pengaman daripada taruhan. GLM-5.3 yang dirilis minggu lalu sudah aktif di OrcaRouter — halaman model menunjukkannya dengan harga $1.26 / $3.96 per 1M token, diskon peluncuran 10% dari harga daftar vendor $1.40 / $4.40, diteruskan tanpa markup — dan pengaturan routing inilah yang akan diwarisi oleh 5.5 atau 5.3-Vision pada hari model tersebut dirilis. Arahkan sebagian lalu lintas ke model baru melalui router dengan failover otomatis ke model yang terbukti — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — dan Anda mendapatkan sinyal kualitas pada beban kerja Anda sendiri, bukan tayangan slide. Jika proyeksi kebocoran itu benar, Anda mengetahuinya lebih dulu; jika salah, failover menyerapnya dan tidak ada yang dikirim dalam keadaan rusak. Kunci yang sama, tanpa kontrak kedua, dan tidak perlu memilih di antara dua nama kandidat sampai Z.ai melakukannya.
GLM berikutnya akan segera hadir — satu-satunya pertanyaan terbuka adalah nama apa yang akan disandangnya. GLM 5.3-Vision akan menjadi penutup kesenjangan yang paling banyak dikeluhkan oleh Z.ai pada model yang baru saja mereka rilis; GLM 5.5 akan menjadi andalan bertenaga triliunan parameter yang telah diarahkan sepanjang bulan ini. Entri anonim teortaxesTex yang teridentifikasi pada 20 Agustus adalah objek konkret pertama yang terlihat seperti salah satu dari keduanya, dan proyeksi skor 61 pada AA Intelligence Index akan menempatkannya di depan semua model open-weights yang saat ini tercatat. Lima hari setelah sidik jari tersebut, tumpukan layanan juga bergerak: pekerjaan perhatian GLM-5 milik vLLM adalah jenis landasan yang ditinggalkan oleh model baru, meskipun tidak menyebut varian apa pun. Tidak ada satupun yang terkonfirmasi, dan halaman ini akan diperbarui begitu nama, kartu, atau bobotnya teridentifikasi. Sampai saat itu, langkah berisiko rendah adalah menyiapkan rute — bukan mempertaruhkan tumpukan pada sebuah sidik jari.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
