Kartu judul untuk perbandingan GLM-5.3 versus Kimi K3: kubus yang lebih kecil di kiri berlabel GLM-5.3 dengan label basis 743B pasca-dilatih, dan kubus yang lebih besar di kanan berlabel Kimi K3 dengan label basis 2.8T yang dibangun dari awal.
Guides & Insights

GLM-5.3 vs Kimi K3: Memeras Basis 743B atau Membangun Basis 2.8T — Taruhan Mana yang Menguntungkan?

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Perlombaan model open-weight Tiongkok baru saja terpecah menjadi dua jawaban untuk pertanyaan yang sama. Moonshot AI membangun Kimi K3 dari awal — basis mixture-of-experts dengan 2,8 triliun parameter, model open-weight terbesar yang pernah dirilis, diumumkan pada 16 Juli 2026 dengan bobot yang menyusul pada 27 Juli. G​L M-5.3 adalah taruhan yang berlawanan: Z.ai mempertahankan basis 743 miliar parameter yang sama persis yang mendukung GLM-5.2 dan menghabiskan seluruh siklus rilis untuk post-training, dengan alasan bahwa batas kecerdasan model dasar tidak pernah menjadi masalah. Keduanya adalah flagship dengan konteks 1M yang berfokus pada coding dan agen, dan keduanya mengklaim sebagai model coding terbuka terbaik di pasar. Keduanya tidak mungkin menjadi cara terbaik untuk menggunakan anggaran yang sama, dan tolok ukur (benchmark) benar-benar terbagi dua — yang menjadikan ini bukan sekadar perbandingan, melainkan referendum tentang bagaimana membangun model frontier berikutnya.

Dua taruhan tentang cara membangun model frontier

Z.ai menyebut G​LM-5.3 sebagai "penggalian dalam" daripada peningkatan generasional. Basisnya sama persis byte demi byte dengan model 743B dari GLM-5.2; delta-nya sepenuhnya berasal dari pasca-pelatihan, dijalankan melalui kerangka kerja slime sumber terbuka pada tugas-tugas yang mencakup seluruh sesi rekayasa — mendiagnosis, memperbaiki, memverifikasi, dan merilis di seluruh klaster nyata, sistem penyimpanan, dan basis kode, beberapa di antaranya memakan waktu beberapa hari kerja seorang insinyur senior. Peningkatan yang dilaporkan vendor sangat besar: lonjakan 50% pada Code Bench miliknya sendiri, Terminal-Bench 3.0 dari 4.6 menjadi 28.3, DeepSWE v1.1 dari 46.2 menjadi 66.9, dan kemampuan siber yang telah memaksa tinjauan keamanan sebelum bobot dirilis. Moonshot mengambil arah sebaliknya. Kimi K3 adalah basis yang benar-benar baru — 2.8T total parameter dengan sekitar 104B aktif per token (16 dari 896 pakar), arsitektur Kimi Delta Attention, input gambar dan video native, penalaran yang selalu aktif dan tidak dapat dimatikan, serta jendela konteks 1M pada input dan output. Sementara Z.ai bertaruh bahwa lebih banyak dari model yang sama sudah cukup, Moonshot bertaruh bahwa basisnya sendirilah yang menjadi batasnya.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

Perbandingan langsung, dengan asal-usul terlampir

Satu-satunya tempat kedua model muncul di halaman yang sama adalah tabel peluncuran milik Z.ai sendiri, jadi dari situlah angka berdampingan berasal — dilabeli sebagai laporan vendor, bukan diaudit secara independen. Angka mandiri Kimi K3 sejalan dengan apa yang dipublikasikan Moonshot pada bulan Juli dan apa yang diukur oleh Artificial Analysis, tetapi belum ada laboratorium netral yang menjalankan keduanya.

Terminal-Bench 3.0 — G​LM-5.3 pada 28.3 versus Kimi K3 pada 17.4 (tabel Z.ai). Kesenjangan coding terbesar dalam pertarungan ini, pada versi terbaru dan tersulit.

Terminal-Bench 2.1 — G​LM-5.3 dengan 88.2 berbanding Kimi K3 dengan 88.3. Hasil seri.

DeepSWE v1.1 — G​LM-5.3 pada 66.9 berbanding Kimi K3 pada 67.5. Kimi unggul tipis.

SWE-Marathon v1.1 — G​LM-5.3 pada 42,5 versus Kimi K3 pada 48,1. Kemenangan coding terbaik Kimi.

ExploitGym — G​LM-5.3 pada 105/130 berbanding Kimi K3 pada 36/70. Kemenangan yang hampir total untuk G​LM.

GDPval-AA v2 (pekerjaan pengetahuan) — G​LM-5.3 pada 1,769 berbanding Kimi K3 pada 1,682.

Akses — G​LM-5.3: langganan Coding Plan, bobot dibatasi hingga sekitar 28 Agustus. Kimi K3: API aktif dengan harga $3 / $15, bobot dapat diunduh sejak 27 Juli.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

Parit keamanan adalah pemisahan yang sesungguhnya.

Jika kita mengesampingkan tolok ukur pengkodean, perbedaan yang paling menentukan adalah keamanan siber. G​LM-5.3 melaporkan skor 84.5 di CyberGym dibandingkan dengan 80.0 milik Kimi K3, dan skor ExploitBench-nya 54.4 hampir dua kali lipat dari 32.2 milik Kimi K3. Di ExploitGym, selisihnya bukan sekadar perbedaan, melainkan kategori yang berbeda — 105 dan 130 berbanding 36 dan 70 untuk durasi 2 jam dan 6 jam. Itulah mengapa kedua peluncuran ini terasa sangat berbeda dalam praktiknya: bobot model Kimi K3 terbuka untuk umum di bawah lisensi Modified MIT, sementara bobot model G​LM-5.3 ditahan untuk penguatan keamanan justru karena Z.ai menyatakan model tersebut cukup mahir menemukan dan mengeksploitasi celah sehingga merilis bobotnya segera terasa tidak bertanggung jawab. Jika pekerjaan Anda melibatkan audit kode orang lain, atau mempertahankan kode Anda sendiri dari perburuan kerentanan otomatis, ini adalah poin paling relevan dalam seluruh perbandingan — dan juga poin yang paling sedikit diverifikasi secara independen.

Di mana Kimi K3 melawan balik

Kemenangan Kimi K3 terkumpul di area di mana G​LM-5.3 paling lemah: pekerjaan repositori berhorizon panjang. Ia unggul di DeepSWE dan SWE-Marathon, memimpin di Toolathlon Verified, dan jendela keluaran 1M-tokennya berarti ia dapat menulis seluruh basis kode atau jejak agen yang panjang dalam satu kali proses. Penalaran yang selalu aktifnya mengalirkan jejak lengkap ke API, yang oleh para pengembang disebut jauh lebih berguna untuk men-debug agen daripada ringkasan penjelasan yang buram — dengan catatan operasional bahwa Anda harus meneruskan kolom penalaran tersebut secara verbatim di antara panggilan alat, dan tidak ada prefill asisten. Pada Artificial Analysis's Intelligence Index, Kimi K3 berada di 57, peringkat keempat secara keseluruhan, dengan sekitar $0,94 biaya per tugas yang diukur pada set standarnya. Model ini juga merupakan model termahal yang pernah diluncurkan laboratorium Tiongkok: $3 per juta token input dan $15 per juta token output, harga setingkat Sonnet, sementara G​LM-5.3 belum dapat diberi harga per token sama sekali karena ia hanya ada dalam paket berlangganan.

Realita akses dan biaya

Kimi K3 berada di OrcaRouter sekarang dengan harga daftar Moonshot sendiri — $3 / $15 per juta token, $0,30 untuk pembacaan cache, markup 0% — sehingga pekerjaan agen konteks 1M dapat dipanggil dengan kunci yang sama dengan seluruh tumpukan Anda, dan bobot terbuka adalah opsi keluar jika Anda ingin self-host. G​LM-5.3 adalah yang sulit didapat: langganan bulanan $18 hingga $168 dengan sistem poin yang menghabiskan kredit 6,9x untuk input dan 24x untuk output, harga off-peak yang mengurangi separuh pengeluaran di luar pukul 14:00–18:00 waktu Tiongkok, dan tidak ada API per token hingga tinjauan keamanan selesai. Lapisan perutean sebenarnya meratakan asimetri ini untuk jendela dua minggu: ketika API G​LM-5.3 tiba di kunci yang sama, panggilan panel dapat menjalankan kedua flagship open-coding terhadap tugas Anda sendiri dan membiarkan juri merekonsiliasi keduanya — dan jika Anda tidak bisa menunggu, bobot Kimi K3 yang sudah dirilis menjadikannya satu-satunya dari keduanya yang dapat Anda bawa sepenuhnya on-premises hari ini.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

Taruhan mana yang membayar

Verdik jujur setelah satu minggu adalah bahwa kedua taruhan membuahkan hasil, tetapi pada beban kerja yang berbeda. Jika pekerjaan Anda banyak melibatkan terminal, terkait keamanan, dan diorkestrasi agen, G​LM-5.3 adalah arah yang lebih kuat berdasarkan bukti yang dipublikasikan Z.ai — dan kesenjangan keamanan sibernya cukup besar sehingga layak menunggu dua minggu untuk bobotnya agar bisa memeriksa sendiri. Jika pekerjaan Anda adalah sesi repositori panjang, input multimodal, atau apa pun yang membutuhkan bobot tersedia hari ini, Kimi K3 adalah satu-satunya dari keduanya yang benar-benar tersedia — dan kemenangan deep-repo-nya adalah yang bisa Anda verifikasi sekarang juga dari API langsungnya. Satu hal yang perlu diingat: setiap angka dalam perbandingan head-to-head ini berasal dari tabel Z.ai sendiri, jadi perlakukan selisih pengodean sebagai indikatif sampai laboratorium independen menjalankan keduanya. Itulah tepatnya jenis verifikasi yang akan dihasilkan oleh penantian dua minggu itu.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube