Kartu judul hero untuk GLM-5.2 vs Kimi K3 dengan subjudul 'Lebih murah dan lebih cepat, atau lebih besar dan lebih baik', tiga lencana pil membulat bertuliskan 'Konteks token 1M masing-masing', 'Indeks AA 34 vs 44' dan '$1,40 / $4,40 vs $3,00 / $15,00', baris footer bertuliskan 'Kartu tarif vendor dan Artificial Analysis, 2026-09-23', serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

GLM-5.2 vs Kimi K3: Lebih Murah dan Lebih Cepat, atau Lebih Besar dan Lebih Baik

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

GLM-5.2 dan Kimi K3 hadir berselang satu bulan pada pertengahan 2026 dan hampir sepenuhnya merupakan kebalikan satu sama lain. Kimi K3, dirilis pada 2026-07-16 dengan bobot terbuka menyusul pada 2026-07-27, adalah model yang lebih besar dan secara teori lebih baik: 2,8 triliun parameter, 104 miliar di antaranya aktif, dan skor lebih tinggi pada hampir setiap tolok ukur yang dijalankan terhadap keduanya. GLM-5.2 telah tersedia sejak 2026-06-16, merupakan yang lebih kecil dari keduanya dengan 753 miliar parameter dan 40 miliar aktif, serta biayanya sekitar sepertiga dari yang lain per token keluaran, menjawab lebih cepat pada median, dan dirilis di bawah lisensi MIT alih-alih lisensi khusus dengan pemicu pendapatan.

Itulah keputusannya dalam satu paragraf. Yang berikut adalah buktinya — aritmetika harga pada pekerjaan yang mungkin benar-benar Anda jalankan, pengukuran-pengukuran ketika keduanya cukup dekat sehingga perbedaannya hanyalah derau, dan satu angka populer yang tidak sebanding dengan angka yang tercetak di sebelahnya.

Di mana keduanya berdiri

Keduanya tersedia secara umum melalui API milik vendor masing-masing, keduanya dapat dirutekan di OrcaRouter, dan keduanya memiliki bobot yang dapat diunduh. Perbedaan yang penting sebelum Anda bahkan mendekati tolok ukur:

• Dirilis — GLM-5.2 pada 2026-06-16 vs Kimi K3 pada 2026-07-16 (halaman model Artificial Analysis; halaman model milik OrcaRouter sendiri untuk Kimi K3 mencantumkan tanggalnya sehari lebih awal, 2026-07-15)

• Bobot — GLM-5.2 terbuka di bawah MIT vs Kimi K3 terbuka di bawah Kimi K3 License, yang mensyaratkan perjanjian terpisah di atas $20M dalam pendapatan tahunan model-as-a-service dan atribusi yang menonjol di atas 100M pengguna bulanan (penelitian dan pengembangan internal dikecualikan)

• Ukuran — GLM-5.2 total 753B / 40B aktif vs Kimi K3 total 2,8T / 104B aktif

• Konteks — GLM-5.2 1.000.000 token vs Kimi K3 1.048.576 token

• Input — GLM-5.2 teks masuk, teks keluar vs Kimi K3 teks dan gambar masuk, teks keluar

• Output maksimum yang dipublikasikan — GLM-5.2 128.000 token vs tidak dipublikasikan di halaman OrcaRouter Kimi K3

Di OrcaRouter, keduanya berada di balik satu kunci pada satu endpoint yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1, dan kami meneruskan harga daftar dari penyedia secara langsung tanpa menambahkan markup apa pun — jadi setiap angka di bawah ini adalah angka dari vendor, bukan dari kami.

Berapa biaya satu juta token, untuk pekerjaan yang berbiaya

Kartu tarif vendor lebih dulu, dibaca dari halaman harga milik vendor sendiri pada 2026-09-23. Z.ai mencantumkan GLM-5.2 seharga $1,40 per juta token input, $0,26 per juta token input yang di-cache, dan $4,40 per juta token output. Moonshot mencantumkan Kimi K3 seharga $3,00 untuk input, $0,30 untuk baca cache, $15,00 untuk output — ditambah biaya penulisan cache sebesar $3,00 per juta untuk cache lima menit dan $6,00 per juta untuk cache satu jam. Itu adalah harga yang dipublikasikan, bukan harga yang diaudit secara independen, dan masing-masing vendor dapat mengubahnya.

Tempatkan mereka pada pekerjaan yang sebagian besar berupa membaca: tinjauan basis kode 600.000 token dengan jawaban tertulis 8.000 token. Pada GLM-5.2, itu berarti 0,6 x $1,40 = $0,84 untuk input ditambah 0,008 x $4,40 = $0,035 untuk output, atau sekitar $0,88. Pada Kimi K3, itu berarti 0,6 x $3,00 = $1,80 ditambah 0,008 x $15,00 = $0,12, atau sekitar $1,92. Kira-kira 2,2 kali biaya untuk pekerjaan yang sama.

Sekarang jalankan lagi dengan basis kode yang sudah berada di cache penyedia. Baris input menyusut menjadi tarif baca cache, dan dua harga yang tadinya terpaut 2,1x menjadi $0,26 versus $0,30 per juta — selisih 15%. Ini adalah angka yang paling jarang dibahas dalam perbandingan ini dan yang paling penting bagi agen yang membaca ulang konteks yang sama setiap giliran. Ada juga tanda bintangnya: Kimi K3 menagih secara terpisah untuk menulis cache dan halaman GLM-5.2 sama sekali tidak mencantumkan biaya penulisan, jadi cold start biayanya jauh lebih mahal pada Kimi K3 daripada yang disiratkan oleh angka utama $3,00.

• Pembacaan 600k token dengan jawaban 8k — GLM-5.2 sekitar $0,88 vs Kimi K3 sekitar $1,92

• Baris input yang di-cache yang sama — GLM-5.2 $0.16 vs Kimi K3 $0.18 per 600 ribu token

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Model independen itu setuju pada arahnya, tetapi tidak pada besarnya. Artificial Analysis memadukan token cache-hit, input, dan output dengan rasio 7:2:1 dan menambahkan token penalaran yang benar-benar dikonsumsi model, lalu angka-angkanya untuk kedua model ini — dibaca 2026-09-23 berdasarkan indeks v4.3.2-nya — menempatkan GLM-5.2 pada $0,902 per juta token campuran versus $2,31 milik Kimi K3, dan biaya untuk menyelesaikan salah satu tugas evaluasinya pada $0,96 versus $2,00. Menjalankan Intelligence Index penuh sekali menghabiskan biaya $1.559 pada GLM-5.2 dan $3.658 pada Kimi K3.

Ada detail kontraintuitif yang terkubur dalam model biaya itu. Kimi K3 menggunakan lebih sedikit token output per tugas dibandingkan GLM-5.2 — 48.000 versus 64.000 — dan lebih sedikit token penalaran, 32.000 versus 51.000. Model ini lebih ekonomis per unit pekerjaan namun tetap berbiaya sekitar dua kali lipat per tugas, karena harga per tokennya 2,1x untuk input dan 3,4x untuk output. Murah per tugas dan murah per token adalah properti yang berbeda, dan ini adalah pasangan yang arahnya berlawanan.

Jendela konteks, dan apa yang sebenarnya muat di dalamnya

Keduanya berada dalam selisih 5% satu sama lain di atas kertas: 1.000.000 token versus 1.048.576. Melaporkan itu sebagai kemenangan Kimi K3 akan terdengar konyol. Keduanya adalah model sejuta token dan jendela konteksnya bukan pembeda; pertanyaan jujurnya adalah apa yang masih bisa dilakukan masing-masing dengan teks yang terkubur di bagian tengahnya.

Itulah yang diukur oleh evaluasi penalaran konteks panjang Artificial Analysis, dan itu adalah salah satu kesenjangan yang lebih lebar dalam kumpulan data: Kimi K3 mendapat skor 89% berbanding 78% milik GLM-5.2. Jika pekerjaan Anda adalah memuat korpus besar dan mengajukan pertanyaan yang mengharuskan menggabungkan fakta dari kedua ujungnya yang berseberangan, tambahan 48.576 token bukan alasan untuk memilih Kimi K3 — margin konteks panjang sebelas poin itulah alasannya.

Batas bawah di bawah jendela juga berbeda. GLM-5.2 mempublikasikan keluaran maksimum 128.000 token; halaman Kimi K3 tidak mempublikasikan angka yang setara, jadi kami tidak akan menyediakannya. Jika Anda menghasilkan dokumen panjang alih-alih membacanya, asimetri itu layak diperiksa terhadap beban kerja Anda sendiri sebelum Anda membeli salah satunya.

Kecepatan: satu-satunya sumbu yang dikuasai GLM-5.2 secara mutlak

Dua pengukuran independen menunjuk ke arah yang sama di sini, dan hal ini layak disebutkan justru karena keduanya tidak sepakat dalam segala hal.

Data perutean kami sendiri, selama tujuh hari hingga 2026-09-23, menunjukkan GLM-5.2 menjawab pada median 3,28 detik untuk token pertama dibandingkan Kimi K3 8,09 detik, dan melakukan streaming 68,1 token per detik dibandingkan 43,4. Waktu p95 untuk token pertama kedua model berada tepat di 10,00 detik. Artificial Analysis, yang mengukur secara terpisah, mencatat GLM-5.2 pada 68,2 token keluaran per detik dibandingkan Kimi K3 36,7, pada 41,29 detik end-to-end dibandingkan 72,13, dan pada 33,95 detik untuk jawaban pertama dibandingkan 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Kedua sumber berbeda pada satu titik, dan itu perlu ditandai alih-alih dihaluskan. Artificial Analysis menempatkan Kimi K3 sedikit lebih unggul dalam waktu mentah ke token pertama, 4,08 detik versus 4,62, sementara routing kami sendiri mencatat GLM-5.2 hampir dua setengah kali lebih cepat pada p50. Endpoint berbeda, penyedia upstream berbeda, jendela berbeda. Anggap arah throughput — GLM-5.2 jelas lebih cepat — sebagai solid, dan anggap setiap angka waktu ke token pertama tunggal, milik kami atau milik mereka, sebagai properti dari minggu tertentu.

Ada juga sebuah angka di halaman GLM-5.2 kami yang tidak akan kami diam-diamkan begitu saja: selama tujuh hari yang sama, angka itu menunjukkan tingkat galat 9,2%, dibandingkan 0,26% untuk Kimi K3. Selisih sebesar itu kemungkinannya sama besarnya antara menjadi minggu yang buruk bagi penyedia upstream yang melayani GLM-5.2 dan menjadi karakteristik model itu sendiri, dan tujuh hari bukan jendela waktu yang cukup panjang untuk membedakan keduanya. Inilah jenis masalah yang memang menjadi alasan routing ada — ketika satu penyedia gagal pada satu dari sebelas permintaan, failover otomatis memindahkan trafik tanpa ada yang perlu menghubungi petugas on-call.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Tolok ukur: kemenangan telak yang nyata, tetapi lebih sempit daripada judulnya

Kimi K3 memenangkan hampir semua yang diujikan pada kedua model. Ini adalah angka Artificial Analysis berdasarkan revisi indeks v4.3.2, kedua model dalam konfigurasi penalaran maksimumnya, dibaca 2026-09-23:

• Indeks Kecerdasan — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 vs 1233

• GDPval-AA v2.1 — 1524 vs 1358

• AutomationBench-AA — 58% vs 28%

• Terminal-Bench 4.0 — 13% vs 1%

• SciCode — 59% vs 51%

• Ujian Terakhir Umat Manusia — 47% vs 41%

• GDP.pdf — 22% vs 10%

• AA-LCR v1.1 — 89% vs 78%

• CritPt — 23% vs 21%

Dua catatan sebelum siapa pun mengambil tangkapan layar daftar itu.

Pertama, revisi indeks. Liputan peluncuran Kimi K3 pada Juli mengutipnya di angka 57 pada Intelligence Index dengan GLM-5.2 di 51. Halaman live hari ini menyebut 44 dan 34. Itu bukan pengukuran yang sama — Artificial Analysis merevisi indeks dan menilai ulang model terhadapnya, dan menempatkan angka Juli di samping angka September adalah kesalahan yang paling mudah dilakukan pada pasangan ini. Arahnya stabil di setiap snapshot; angka absolutnya tidak dapat dibandingkan antar revisi.

Kedua, levelnya. Terminal-Bench 4.0 pada 13% dan 1% adalah evaluasi yang sulit, dan pada level setinggi itu rasionya memberi tahu Anda lebih banyak daripada kedua angka tersebut. AA-Omniscience, yang menguji apakah sebuah model mengetahui batas kemampuannya sendiri, menempatkan GLM-5.2 pada 4 berbanding 20 milik Kimi K3 — sebuah batas bawah yang perlu diketahui jika Anda berencana menjalankan salah satunya tanpa pengawasan.

Satu hal lagi yang dicatat Artificial Analysis tentang listing GLM-5.2: ini menandai konfigurasi penalaran maksimum sebagai usang dan digantikan oleh GLM-5.3 yang lebih baru. Itu tidak mengubah satu pun angka di atas, yang merupakan cuplikan GLM-5.2 sebagaimana saat diukur, tetapi itu berarti peta jalan Z.ai telah melampaui model ini. Pada endpoint yang dirutekan, itu hanya memerlukan penggantian string model, bukan migrasi, yang merupakan argumen utama untuk tidak meng-hard-code salah satu nama ini ke dalam aplikasi Anda.

Agen dan penggunaan alat: di mana kesenjangannya paling lebar

Jika satu blok dari tabel itu harus menentukan pembelian, blok inilah. Pekerjaan agentic berhorizon panjang adalah tempat margin Kimi K3 paling besar dan paling konsisten:

• AutomationBench-AA — 58% vs 28%, selisih 30 poin

• GDPval-AA v2.1 — 1524 vs 1358

• AA-Briefcase v1.1 — 1510 vs 1233

• Terminal-Bench 4.0 — 13% vs 1%

Materi rilis Moonshot sendiri bersandar pada cerita yang sama — peluncuran bobot K3 disertai laporan teknis yang membahas stack pelatihan expert-parallel milik vendor tersebut dan sebuah harness lingkungan agen — tetapi materi vendor tetap materi vendor, dan angka-angka di atas adalah angka yang independen.

Aggregator pihak ketiga LLM Stats, yang menjalankan kompositnya sendiri pada kumpulan benchmark bersama, sampai pada kesimpulan yang sama dari arah yang berbeda: dari sebelas benchmark yang dinilainya untuk kedua model, Kimi K3 memenangkan kesebelasnya, dan skor kategorinya menempatkan Kimi K3 unggul dalam penggunaan alat (30,8 vs 19,6), agen (38,3 vs 29,6), dan coding (42,3 vs 34,8). Itu adalah komposit milik LLM Stats sendiri dengan pembobotannya sendiri, pada kumpulan bersama yang tidak besar, jadi perlakukan itu sebagai penguat, bukan sebagai hasil laboratorium. Sebelas dari sebelas tetap bukan hasil yang tipis.

Pengodean

Arah yang sama, selisih lebih kecil. Pada evaluasi coding yang diberi skor oleh Artificial Analysis untuk keduanya, Kimi K3 memimpin SciCode 59% berbanding 51%; pada set bersama LLM Stats, ia memenangkan DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench, dan Terminal-Bench 2.1. Angka-angka yang menyanjung GLM-5.2 — 99,2% pada AIME 2026, 94,4% pada HMMT 2025, 91,2% pada GPQA sebagaimana dilansir oleh agregator pihak ketiga — dilaporkan vendor dan belum direproduksi, dan sebagian besar darinya mengukur matematika kompetisi, bukan rekayasa perangkat lunak.

Pembacaan praktisnya: bagi agen coding yang berjalan lama, mengedit banyak file, dan harus pulih dari kesalahannya sendiri, margin agentik Kimi K3 adalah sinyal yang lebih relevan daripada skor matematika model mana pun. Bagi asisten kode yang cepat, murah, dan sebagian besar sekali jalan, keunggulan throughput GLM-5.2 lebih bernilai daripada biaya kesenjangan benchmark.

Ketika mereka cukup dekat sehingga tidak menjadi masalah

• Harga input yang di-cache — $0,26 vs $0,30 per juta, selisih 15% dibandingkan selisih 3,4x pada output

• Jendela konteks — 1.000.000 vs 1.048.576 token

• p95 waktu ke token pertama — 10,00 detik vs 10,00 detik pada perutean kami sendiri

• CritPt — 23% vs 21%

• Matematika — LLM Stats menempatkan GLM-5.2 sedikit lebih unggul pada komposit matematikanya (41.4 vs 40.9), sementara Kimi K3 memimpin pada matematika-dengan-gambar; berdasarkan bukti yang tersedia, tidak ada dari kedua model yang menguasai aritmetika

Siapa pun yang memberi tahu Anda bahwa salah satu model ini dua kali lipat model lainnya di semua aspek hanya membaca satu baris tabel.

Pilih GLM-5.2 jika…

Anda yang membayar tagihannya, dan tagihan itulah kendalanya. GLM-5.2 kira-kira sepertiga harga output, lebih murah di jalur cache juga, berlisensi MIT tanpa pemicu pendapatan yang perlu diperiksa, lebih cepat pada median dan jauh lebih cepat saat streaming, dan jendela satu juta tokennya cukup dekat dengan milik Kimi K3 sehingga perbedaannya tidak akan pernah menentukan apa pun. Jika beban kerja Anda adalah input teks dan output teks, dan sebagian besar hanya membaca, bukan rangkaian panjang pemanggilan alat, poin benchmark tambahan pada Kimi K3 adalah poin yang tidak akan pernah dikumpulkan aplikasi Anda.

Pilih Kimi K3 jika…

Pekerjaan ini bersifat agentik dan panjang. Selisih 30 poin di AutomationBench, keunggulan di GDPval dan AA-Briefcase, margin penalaran konteks panjang sebelas poin, dan sapu bersih set bersama LLM Stats semuanya menunjuk ke arah yang sama: Kimi K3 adalah model yang lebih baik untuk diberi tugas multi-langkah lalu ditinggalkan. Ini juga satu-satunya dari keduanya yang menerima gambar. Anda akan membayar sekitar dua kali lipat per tugas untuk itu, dan jika set kerja Anda banyak di-cache, Anda akan membayar kurang dari dua kali lipat — tetapi alasan untuk memilihnya bukanlah harga, dan bukan pula kecepatan.

Keduanya dapat dirutekan di OrcaRouter dari satu kunci ke satu endpoint yang kompatibel dengan OpenAI, pada harga daftar para penyedia tanpa tambahan apa pun di atasnya, dan keduanya berada di balik failover otomatis yang sama. Itulah cara termurah untuk mengetahui mana yang sebenarnya diinginkan oleh beban kerja Anda, karena beralih di antara keduanya hanyalah soal string model, bukan kontrak.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari