Ulasan GLM-5.2: Koding Hampir Frontier dengan Harga Open-Weight?

Ulasan GLM-5.2: Koding Hampir Frontier dengan Harga Open-Weight?

Penulis

Fengya Tian

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Z.ai merilis GLM-5.2 pada 16 Juni 2026, dan menyebutnya sebagai model unggulan yang dirancang untuk tugas-tugas jangka panjang. Untuk sekali ini, label tersebut benar-benar terbukti. GLM-5.2 memadukan jendela konteks 1 juta token yang benar-benar dilatih untuk sesi agen coding panjang dengan skor coding tertinggi yang pernah dicatat oleh model bobot terbuka hingga saat ini — dan dirilis serempak di mana-mana: API Z.ai, GLM Coding Plan, serta bobot berlisensi MIT penuh di Hugging Face, tanpa batasan regional.

Ulasan ini menjawab pertanyaan yang sebenarnya ditanyakan oleh sebagian besar tim: apakah model dengan bobot terbuka akhirnya cukup baik untuk menjadi model pengkodean default Anda, dan di mana model-model unggulan frontier tertutup masih layak mendapatkan premi mereka? Kami akan membahas apa yang benar-benar baru, berapa biaya sebenarnya dari GLM-5.2 (termasuk diskon input cache yang sering dilewatkan oleh sebagian besar tulisan), bagaimana perbandingannya dengan GLM-5.1 dan frontier tertutup, serta siapa yang sebaiknya beralih hari ini.

Vonis cepat

Pertimbangkan GLM-5.2 jika Anda…

- Jalankan beban kerja coding bervolume tinggi atau agen dan inginkan kualitas mendekati frontier dengan harga $1.40 / $4.40 per juta token — sebagian kecil dari harga flagship

- Bangun agen coding yang berjalan lama — pada hasil FrontierSWE yang dipublikasikan Z.ai, GLM-5.2 berada dalam satu poin dari Claude Opus 4.8 dan di depan GPT-5.5

- Membutuhkan jendela konteks 1M-token dengan hingga 128K token output, yang dilatih secara khusus untuk lintasan agen yang panjang dan berantakan, bukan hanya diklaim di lembar spesifikasi

- Ingin bobot terbuka: lisensi MIT, hosting sendiri, fine-tuning, dan tanpa vendor lock-in

Tunda (atau tetap berada di flagship yang tutup) jika Anda...

Butuh batas maksimal untuk pekerjaan agentik tersulit — Claude Opus 4.8 masih memimpin dengan jelas dalam orkestrasi alat dan tugas otonom sepanjang marathon.

- Membutuhkan input gambar atau file: GLM-5.2 hanya teks; visi ada di lini GLM-V terpisah dari Z.ai

- Merupakan batasan latensi yang keras — GLM-5.2 adalah model yang mengutamakan pemikiran, dan statistik gateway publik menunjukkan median waktu-ke-token-pertama dalam rentang beberapa detik

Apa itu GLM-5.2?

GLM-5.2 adalah model andalan terbaru dalam keluarga GLM dari Z.ai (sebelumnya Zhipu AI), salah satu dari segelintir laboratorium yang merilis model berbobot terbuka dalam skala terdepan. Dokumentasi model publik menyebutkan bahwa model ini memiliki total sekitar 750 miliar parameter dalam desain Mixture-of-Experts, dengan sekitar 40 miliar parameter aktif per token. ID model adalah `glm-5.2`, dan sudah tersedia secara umum hari ini: Anda dapat mengobrol dengannya di Z.ai, memanggilnya melalui API Z.ai, menggunakannya dalam langganan GLM Coding Plan (di mana model ini muncul beberapa hari sebelum peluncuran publik), atau mengunduh bobot dari Hugging Face dan menjalankannya sendiri.

Yang menonjol pada generasi ini adalah positioning-nya. Z.ai tidak menjual GLM-5.2 sebagai pesaing yang lebih murah; ia mempromosikannya sebagai model coding open-source terkuat, dengan angka-angka yang dipublikasikan yang menempatkannya hanya beberapa poin di belakang frontier tertutup pada beban kerja yang tepat — coding jangka panjang dan agen — yang menjadi tujuan sebagian besar pengeluaran developer saat ini.

Apa yang baru di GLM-5.2?

Lompatan pengkodean jangka panjang, bukan rilis kecil.Perubahan utama. Pada tabel tolok ukur yang dipublikasikan Z.ai, GLM-5.2 mencetak 81.0 di Terminal-Bench 2.1 versus 63.5 untuk GLM-5.1, dan 62.1 versus 58.4 di SWE-bench Pro. Angka yang paling dramatis adalah FrontierSWE, yang mengukur proyek rekayasa terbuka yang berjalan selama jam hingga puluhan jam: 74.4 versus 30.5 milik GLM-5.1.

Konteks 1M token yang solid. GLM-5.2 adalah model GLM pertama yang memasangkan jendela satu juta token (lima kali lipat dari 200K milik GLM-5.1) dengan pelatihan yang menargetkannya: Z.ai mengatakan bahwa mereka secara substansial memperluas pelatihan konteks 1M pada skenario agen coding — implementasi skala besar, penelitian otomatis, optimalisasi kinerja, debugging kompleks. Output maksimal adalah 128K token per respons.

Kontrol level usaha. Baru di generasi ini: Anda dapat secara eksplisit menukar kemampuan dengan kecepatan eksekusi dan biaya komputasi dengan mengatur level usaha berpikir, alih-alih mendapatkan satu kedalaman penalaran tetap untuk setiap permintaan.

Arsitektur yang lebih murah di balik layar.Teknik IndexShare baru dari Z.ai menggunakan kembali indekser yang sama di setiap empat lapisan perhatian jarang, mengurangi komputasi per-token sebesar 2,9x pada panjang konteks penuh 1M, dan lapisan MTP yang ditingkatkan mempercepat decoding spekulatif dengan meningkatkan panjang penerimaan hingga 20%.

Terbuka murni. Bobot dikirimkan di bawah lisensi MIT dengan, dalam kata-kata Z.ai, tanpa batasan regional — penggunaan komersial, penyesuaian halus, dan hosting pribadi semuanya diperbolehkan.

Harga: berapa biaya sebenarnya

Pihak pertama GLM 5.2 API harganya $1.40 per juta token masukan dan $4.40 per juta token keluaran — harga yang sama dengan GLM-5.1, sehingga peningkatan kemampuan ini gratis jika Anda sudah menggunakan GLM API. Token masukan yang di-cache turun menjadi $0.26 per juta, dan Z.ai saat ini membebaskan biaya penyimpanan cache untuk waktu terbatas, yang penting untuk loop agen yang membaca ulang konteks proyek yang sama ratusan kali.

Untuk skala: Claude Opus 4.8 terdaftar dengan harga $5 / $25 per juta token. Jika tabel tolok ukur Z.ai bahkan secara arah benar, GLM-5.2 memberikan sebagian besar kemampuan coding jangka panjang dari frontier dengan harga kurang dari seperlima harga output flagship. Dua catatan: tingkat usaha menentukan pengeluaran riil (usaha lebih tinggi berarti lebih banyak token berpikir), dan host pihak ketiga mencantumkan tarif mereka sendiri — beberapa lebih murah daripada pihak pertama — jadi periksa angka terkini sebelum Anda menganggarkan.

Skor ulasan

Skor di bawah ini adalah penilaian editorial kami berdasarkan tolok ukur dan dokumentasi model yang dipublikasikan Z.ai — tabel tolok ukur tersebut milik vendor itu sendiri. Kami akan meninjau kembali seiring munculnya hasil independen.

- Coding: 9/10

- Agen / penggunaan alat: 8/10 — mendekati batas depan pada MCP-Atlas, tetapi Opus 4.8 tetap jelas unggul dalam orkestrasi alat

{{1}}- Penalaran: 8/10 — matematika elit (AIME 2026: 99.2, skor tertinggi dalam tabel Z.ai){{/1}}, {{2}}namun tes penalaran terluas masih lebih memilih batas tertutup{{/2}}

Efisiensi biaya: 10/10

- Konteks dan dokumen panjang: 9/10

- Kecepatan dan latensi: 7/10 — model yang mengutamakan pemikiran; gunakan tingkat upaya yang lebih rendah untuk tugas cepat

Keseluruhan: ~8.5/10 — model open-weight pertama yang cukup mendekati batas depan untuk menjadi opsi default, bukan kompromi.

Kelebihan

Pengkodean jangka panjang mendekati perbatasan dengan harga $1,40 / $4,40 per juta token — harga yang sama dengan GLM-5.1, jauh di bawah unggulan tertutup.

- Solid konteks 1M token dengan keluaran 128K, dilatih pada lintasan agen pengkodean nyata

- Kontrol tingkat upaya untuk menyesuaikan trade-off biaya/latensi/kualitas per permintaan

- bobot terbuka MIT: host sendiri, fine-tune, atau simpan cadangan pribadi — tanpa penguncian, tanpa batasan regional

- Input cache pada $0,26 per juta dengan penyimpanan cache saat ini gratis — besar untuk loop agen

Kekurangan

- Claude Opus 4.8 masih memimpin tolok ukur agentik yang paling sulit — orkestrasi alat dan tugas sepanjang maraton belum menjadi mahkota GLM-5.2

- Hanya teks: tidak ada masukan gambar, jadi alur kerja berbasis tangkapan layar atau visi dokumen memerlukan model yang berbeda.

- Desain yang mengutamakan pemikiran berarti waktu-ke-token-pertama yang terasa; pengalaman pengguna yang sensitif terhadap latensi memerlukan pengaturan usaha yang lebih rendah atau fallback yang lebih cepat.

- Menyediakan hosting sendiri adalah proyek pusat data, bukan proyek akhir pekan — checkpoint penuh dilaporkan membutuhkan memori GPU skala kluster.

- Cerita tolok ukur masih bergantung pada tabel Z.ai sendiri untuk saat ini; replikasi independen masih dalam proses.

Bagaimana perbandingan GLM-5.2

vs GLM-5.1.Stiker yang sama $1.40 / $4.40, jendela konteks lima kali lebih besar, dan lompatan cakrawala panjang yang terasa seperti lompatan generasi: FrontierSWE 74.4 versus 30.5, Terminal-Bench 2.1 81.0 versus 63.5, SWE-Marathon 13.0 versus 1.0. Jika Anda menggunakan GLM-5.1, ini adalah ajakan upgrade termudah tahun ini — Z.ai bahkan menerbitkan panduan migrasi khusus.

vs perbatasan tertutup (Claude Opus 4.8, GPT-5.5).Pada tabel Z.ai, GLM-5.2 terpaut empat poin dari Opus 4.8 di Terminal-Bench 2.1 (81.0 vs 85.0), terpaut satu poin di FrontierSWE (74.4 vs 75.1), dan benar-benar mengalahkan GPT-5.5 di SWE-bench Pro (62.1 vs 58.6) serta FrontierSWE (74.4 vs 72.6). Perbatasan ini mempertahankan keunggulannya pada tugas yang paling panjang dan paling banyak menggunakan alat: Opus 4.8 menggandakan GLM-5.2 di SWE-Marathon (26.0 vs 13.0) dan memimpin Tool-Decathlon dengan selisih yang lebar. Aturan praktisnya: GLM-5.2 untuk volume, flagship untuk puncak.

vs model open-weight lainnya. Melawan Qwen3.7-Max, MiniMax M3, dan DeepSeek-V4-Pro, GLM-5.2 mengungguli setiap baris pengkodean dalam tabel yang dipublikasikan. Per hari ini, mahkota pengkodean open-weight berada pada Z.ai.

Siapa yang harus menggunakan GLM-5.2?

- Tim yang menjalankan agen coding dalam skala besar — bot CI, refactoring otonom, review kode — di mana biaya per tugas menentukan apa yang mungkin secara ekonomi.

- Pembuat alat pengembang yang menginginkan kualitas setara dengan yang terdepan tanpa biaya yang mahal

- Beban kerja konteks panjang: analisis monorepo, spesifikasi teknik multi-dokumen, sesi agen berjam-jam yang benar-benar mengisi 1M token

- Organisasi yang membutuhkan bobot terbuka — untuk kepatuhan, penyebaran terisolasi (air-gapped), fine-tuning, atau sekadar pengaruh negosiasi terhadap vendor API.

Siapa yang harus tetap menggunakan flagship tertutup?

- Tim yang tugas tersulitnya adalah menjalankan otonom sepanjang maraton atau orkestrasi alat berat — tolok ukurnya mengatakan bahwa premi perbatasan masih nyata di sana

Alur kerja yang bergantung pada penglihatan: GLM-5.2 tidak menerima gambar

- Produk di mana setiap detik latensi token pertama merugikan pengguna

Apakah GLM-5.2 layak?

Untuk sebagian besar beban kerja coding dan agen, ya — dengan tegas. Kerangka yang jujur: GLM-5.2 memberi Anda kira-kira 90-95% dari kemampuan coding jangka panjang frontier dengan harga kurang dari seperlima, dengan bobot terbuka sebagai jaminan. Kapal utama tertutup masih memenangkan 5% tugas yang paling sulit. Itu bukan alasan untuk melewatkan GLM-5.2; itu adalah alasan untuk merutekan: kirim volume ke GLM-5.2 dan eskalasi masalah tingkat puncak ke kapal utama.

Putusan akhir

GLM-5.2 adalah model coding open-weight terkuat yang dapat Anda gunakan saat ini, dan model pertama yang terlihat sebagai pilihan default daripada kompromi anggaran — skor kami: ~8.5/10. Model ini tidak menggulingkan Claude Opus 4.8 di puncak rentang kesulitan, tetapi menjadikan flagship sebagai alat spesialis alih-alih jawaban sehari-hari yang jelas. Jika Anda menggunakan GLM-5.1, segera tingkatkan. Jika Anda membayar harga flagship untuk pekerjaan agen rutin, ini adalah sinyal Anda untuk mengukur ulang.

Menggunakan GLM-5.2 melalui OrcaRouter

Karena langkah cerdas adalah "GLM-5.2 untuk volume, model unggulan untuk tugas-tugas tersulit," Anda mungkin akan menginginkan lebih dari satu model dalam produksi — dari lebih dari satu penyedia. Itulah gesekan yang dihilangkan oleh OrcaRouter.

OrcaRouter sudah melayani GLM-5.2 (model ID `z-ai/glm-5.2`) melalui satu titik akhir yang kompatibel dengan OpenAI, dengan tarif Z.ai sendiri $1,40 / $4,40 tanpa markup token. Arahkan lalu lintas pengkodean dan agen bervolume tinggi ke GLM-5.2, tingkatkan penalaran tersulit ke Claude Opus 4.8 atau andalan lainnya, dan siapkan failover otomatis untuk lonjakan kapasitas jendela peluncuran — semuanya tanpa menulis ulang integrasi Anda setiap kali Anda mengganti model.

FAQ

Apakah GLM-5.2 tersedia sekarang?

Ya. Diluncurkan pada 16 Juni 2026 dan tersedia secara umum: di chat dan API Z.ai (ID model glm-5.2), di dalam GLM Coding Plan, melalui gateway seperti OrcaRouter, dan sebagai bobot terbuka berlisensi MIT di Hugging Face.

Berapa harga GLM-5.2?

Harga API pihak pertama adalah $1.40 per juta token input dan $4.40 per juta token output — tidak berubah dari GLM-5.1. Input yang di-cache adalah $0.26 per juta, dan penyimpanan cache gratis untuk waktu terbatas.

Apakah GLM-5.2 lebih baik daripada GLM-5.1?

Dengan selisih yang lebar pada pekerjaan jangka panjang: 81.0 vs 63.5 di Terminal-Bench 2.1, 74.4 vs 30.5 di FrontierSWE, dan konteks 1M versus 200K — dengan harga yang sama.

GLM-5.2 vs Claude Opus 4.8 — mana yang harus saya gunakan?

Default ke GLM-5.2 untuk pengkodean volume tinggi dan pekerjaan agen; eskalasi tugas otonom sepanjang maraton dan orkestrasi alat berat ke Opus 4.8, yang masih memimpin di sana. Routing di antara keduanya lebih baik daripada memilih salah satu.

Apa itu jendela konteks?

1M token, dengan hingga 128K token keluaran per respons — dan Z.ai mengatakan bahwa jendela panjang tersebut dilatih khusus pada skenario coding-agent, bukan hanya diperpanjang.

Apakah GLM-5.2 benar-benar open source?

Ya — bobot-bobot tersebut diterbitkan di bawah lisensi MIT tanpa batasan regional, gratis untuk penggunaan komersial dan fine-tuning. Namun, anggarkan secara realistis untuk self-hosting: checkpoint MoE dengan ~750 miliar parameter membutuhkan memori GPU skala klaster.

Apakah GLM-5.2 mendukung input gambar?

No. GLM-5.2 adalah teks masuk, teks keluar. Untuk tugas visi, Z.ai mempertahankan lini model GLM-V yang terpisah, atau Anda dapat mengarahkan permintaan gambar ke model multimodal.

Dapatkah saya menggunakan GLM-5.2 melalui OrcaRouter?

Ya — GLM-5.2 sudah aktif di OrcaRouter sebagai z-ai/glm-5.2 dengan tarif first-party tanpa markup, bersama dengan Claude, GPT, Gemini, dan model lainnya di belakang satu endpoint yang kompatibel dengan OpenAI.

Siap untuk menempatkan GLM-5.2 ke dalam produksi? Jalankan dalam hitungan menit — buat akun OrcaRouter Anda dan panggil GLM-5.2, Claude Opus 4.8, dan semua model terdepan lainnya melalui satu titik akhir yang kompatibel dengan OpenAI. Frontier-class coding menjadi jauh lebih murah; lapisan perutean adalah cara Anda mengumpulkan penghematan.



© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube