
GLM-5.2 vs Kimi K3: Lebih Murah dan Lebih Cepat, atau Lebih Besar dan Lebih Baik
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 dan Kimi K3 hadir berselang satu bulan pada pertengahan 2026 dan hampir sepenuhnya merupakan kebalikan satu sama lain. Kimi K3, dirilis pada 2026-07-16 dengan bobot terbuka menyusul pada 2026-07-27, adalah model yang lebih besar dan secara teori lebih baik: 2,8 triliun parameter, 104 miliar di antaranya aktif, dan skor lebih tinggi pada hampir setiap tolok ukur yang dijalankan terhadap keduanya. GLM-5.2 telah tersedia sejak 2026-06-16, merupakan yang lebih kecil dari keduanya dengan 753 miliar parameter dan 40 miliar aktif, serta biayanya sekitar sepertiga dari yang lain per token keluaran, menjawab lebih cepat pada median, dan dirilis di bawah lisensi MIT alih-alih lisensi khusus dengan pemicu pendapatan.
Itulah keputusannya dalam satu paragraf. Yang berikut adalah buktinya — aritmetika harga pada pekerjaan yang mungkin benar-benar Anda jalankan, pengukuran-pengukuran ketika keduanya cukup dekat sehingga perbedaannya hanyalah derau, dan satu angka populer yang tidak sebanding dengan angka yang tercetak di sebelahnya.
Di mana keduanya berdiri
Keduanya tersedia secara umum melalui API milik vendor masing-masing, keduanya dapat dirutekan di OrcaRouter, dan keduanya memiliki bobot yang dapat diunduh. Perbedaan yang penting sebelum Anda bahkan mendekati tolok ukur:
• Dirilis — GLM-5.2 pada 2026-06-16 vs Kimi K3 pada 2026-07-16 (halaman model Artificial Analysis; halaman model milik OrcaRouter sendiri untuk Kimi K3 mencantumkan tanggalnya sehari lebih awal, 2026-07-15)
• Bobot — GLM-5.2 terbuka di bawah MIT vs Kimi K3 terbuka di bawah Kimi K3 License, yang mensyaratkan perjanjian terpisah di atas $20M dalam pendapatan tahunan model-as-a-service dan atribusi yang menonjol di atas 100M pengguna bulanan (penelitian dan pengembangan internal dikecualikan)
• Ukuran — GLM-5.2 total 753B / 40B aktif vs Kimi K3 total 2,8T / 104B aktif
• Konteks — GLM-5.2 1.000.000 token vs Kimi K3 1.048.576 token
• Input — GLM-5.2 teks masuk, teks keluar vs Kimi K3 teks dan gambar masuk, teks keluar
• Output maksimum yang dipublikasikan — GLM-5.2 128.000 token vs tidak dipublikasikan di halaman OrcaRouter Kimi K3
Di OrcaRouter, keduanya berada di balik satu kunci pada satu endpoint yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1, dan kami meneruskan harga daftar dari penyedia secara langsung tanpa menambahkan markup apa pun — jadi setiap angka di bawah ini adalah angka dari vendor, bukan dari kami.
Berapa biaya satu juta token, untuk pekerjaan yang berbiaya
Kartu tarif vendor lebih dulu, dibaca dari halaman harga milik vendor sendiri pada 2026-09-23. Z.ai mencantumkan GLM-5.2 seharga $1,40 per juta token input, $0,26 per juta token input yang di-cache, dan $4,40 per juta token output. Moonshot mencantumkan Kimi K3 seharga $3,00 untuk input, $0,30 untuk baca cache, $15,00 untuk output — ditambah biaya penulisan cache sebesar $3,00 per juta untuk cache lima menit dan $6,00 per juta untuk cache satu jam. Itu adalah harga yang dipublikasikan, bukan harga yang diaudit secara independen, dan masing-masing vendor dapat mengubahnya.
Tempatkan mereka pada pekerjaan yang sebagian besar berupa membaca: tinjauan basis kode 600.000 token dengan jawaban tertulis 8.000 token. Pada GLM-5.2, itu berarti 0,6 x $1,40 = $0,84 untuk input ditambah 0,008 x $4,40 = $0,035 untuk output, atau sekitar $0,88. Pada Kimi K3, itu berarti 0,6 x $3,00 = $1,80 ditambah 0,008 x $15,00 = $0,12, atau sekitar $1,92. Kira-kira 2,2 kali biaya untuk pekerjaan yang sama.
Sekarang jalankan lagi dengan basis kode yang sudah berada di cache penyedia. Baris input menyusut menjadi tarif baca cache, dan dua harga yang tadinya terpaut 2,1x menjadi $0,26 versus $0,30 per juta — selisih 15%. Ini adalah angka yang paling jarang dibahas dalam perbandingan ini dan yang paling penting bagi agen yang membaca ulang konteks yang sama setiap giliran. Ada juga tanda bintangnya: Kimi K3 menagih secara terpisah untuk menulis cache dan halaman GLM-5.2 sama sekali tidak mencantumkan biaya penulisan, jadi cold start biayanya jauh lebih mahal pada Kimi K3 daripada yang disiratkan oleh angka utama $3,00.
• Pembacaan 600k token dengan jawaban 8k — GLM-5.2 sekitar $0,88 vs Kimi K3 sekitar $1,92
• Baris input yang di-cache yang sama — GLM-5.2 $0.16 vs Kimi K3 $0.18 per 600 ribu token

Model independen itu setuju pada arahnya, tetapi tidak pada besarnya. Artificial Analysis memadukan token cache-hit, input, dan output dengan rasio 7:2:1 dan menambahkan token penalaran yang benar-benar dikonsumsi model, lalu angka-angkanya untuk kedua model ini — dibaca 2026-09-23 berdasarkan indeks v4.3.2-nya — menempatkan GLM-5.2 pada $0,902 per juta token campuran versus $2,31 milik Kimi K3, dan biaya untuk menyelesaikan salah satu tugas evaluasinya pada $0,96 versus $2,00. Menjalankan Intelligence Index penuh sekali menghabiskan biaya $1.559 pada GLM-5.2 dan $3.658 pada Kimi K3.
Ada detail kontraintuitif yang terkubur dalam model biaya itu. Kimi K3 menggunakan lebih sedikit token output per tugas dibandingkan GLM-5.2 — 48.000 versus 64.000 — dan lebih sedikit token penalaran, 32.000 versus 51.000. Model ini lebih ekonomis per unit pekerjaan namun tetap berbiaya sekitar dua kali lipat per tugas, karena harga per tokennya 2,1x untuk input dan 3,4x untuk output. Murah per tugas dan murah per token adalah properti yang berbeda, dan ini adalah pasangan yang arahnya berlawanan.
Jendela konteks, dan apa yang sebenarnya muat di dalamnya
Keduanya berada dalam selisih 5% satu sama lain di atas kertas: 1.000.000 token versus 1.048.576. Melaporkan itu sebagai kemenangan Kimi K3 akan terdengar konyol. Keduanya adalah model sejuta token dan jendela konteksnya bukan pembeda; pertanyaan jujurnya adalah apa yang masih bisa dilakukan masing-masing dengan teks yang terkubur di bagian tengahnya.
Itulah yang diukur oleh evaluasi penalaran konteks panjang Artificial Analysis, dan itu adalah salah satu kesenjangan yang lebih lebar dalam kumpulan data: Kimi K3 mendapat skor 89% berbanding 78% milik GLM-5.2. Jika pekerjaan Anda adalah memuat korpus besar dan mengajukan pertanyaan yang mengharuskan menggabungkan fakta dari kedua ujungnya yang berseberangan, tambahan 48.576 token bukan alasan untuk memilih Kimi K3 — margin konteks panjang sebelas poin itulah alasannya.
Batas bawah di bawah jendela juga berbeda. GLM-5.2 mempublikasikan keluaran maksimum 128.000 token; halaman Kimi K3 tidak mempublikasikan angka yang setara, jadi kami tidak akan menyediakannya. Jika Anda menghasilkan dokumen panjang alih-alih membacanya, asimetri itu layak diperiksa terhadap beban kerja Anda sendiri sebelum Anda membeli salah satunya.
Kecepatan: satu-satunya sumbu yang dikuasai GLM-5.2 secara mutlak
Dua pengukuran independen menunjuk ke arah yang sama di sini, dan hal ini layak disebutkan justru karena keduanya tidak sepakat dalam segala hal.
Data perutean kami sendiri, selama tujuh hari hingga 2026-09-23, menunjukkan GLM-5.2 menjawab pada median 3,28 detik untuk token pertama dibandingkan Kimi K3 8,09 detik, dan melakukan streaming 68,1 token per detik dibandingkan 43,4. Waktu p95 untuk token pertama kedua model berada tepat di 10,00 detik. Artificial Analysis, yang mengukur secara terpisah, mencatat GLM-5.2 pada 68,2 token keluaran per detik dibandingkan Kimi K3 36,7, pada 41,29 detik end-to-end dibandingkan 72,13, dan pada 33,95 detik untuk jawaban pertama dibandingkan 58,52.

Kedua sumber berbeda pada satu titik, dan itu perlu ditandai alih-alih dihaluskan. Artificial Analysis menempatkan Kimi K3 sedikit lebih unggul dalam waktu mentah ke token pertama, 4,08 detik versus 4,62, sementara routing kami sendiri mencatat GLM-5.2 hampir dua setengah kali lebih cepat pada p50. Endpoint berbeda, penyedia upstream berbeda, jendela berbeda. Anggap arah throughput — GLM-5.2 jelas lebih cepat — sebagai solid, dan anggap setiap angka waktu ke token pertama tunggal, milik kami atau milik mereka, sebagai properti dari minggu tertentu.
Ada juga sebuah angka di halaman GLM-5.2 kami yang tidak akan kami diam-diamkan begitu saja: selama tujuh hari yang sama, angka itu menunjukkan tingkat galat 9,2%, dibandingkan 0,26% untuk Kimi K3. Selisih sebesar itu kemungkinannya sama besarnya antara menjadi minggu yang buruk bagi penyedia upstream yang melayani GLM-5.2 dan menjadi karakteristik model itu sendiri, dan tujuh hari bukan jendela waktu yang cukup panjang untuk membedakan keduanya. Inilah jenis masalah yang memang menjadi alasan routing ada — ketika satu penyedia gagal pada satu dari sebelas permintaan, failover otomatis memindahkan trafik tanpa ada yang perlu menghubungi petugas on-call.

Tolok ukur: kemenangan telak yang nyata, tetapi lebih sempit daripada judulnya
Kimi K3 memenangkan hampir semua yang diujikan pada kedua model. Ini adalah angka Artificial Analysis berdasarkan revisi indeks v4.3.2, kedua model dalam konfigurasi penalaran maksimumnya, dibaca 2026-09-23:
• Indeks Kecerdasan — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% vs 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% vs 51%
• Ujian Terakhir Umat Manusia — 47% vs 41%
• GDP.pdf — 22% vs 10%
• AA-LCR v1.1 — 89% vs 78%
• CritPt — 23% vs 21%
Dua catatan sebelum siapa pun mengambil tangkapan layar daftar itu.
Pertama, revisi indeks. Liputan peluncuran Kimi K3 pada Juli mengutipnya di angka 57 pada Intelligence Index dengan GLM-5.2 di 51. Halaman live hari ini menyebut 44 dan 34. Itu bukan pengukuran yang sama — Artificial Analysis merevisi indeks dan menilai ulang model terhadapnya, dan menempatkan angka Juli di samping angka September adalah kesalahan yang paling mudah dilakukan pada pasangan ini. Arahnya stabil di setiap snapshot; angka absolutnya tidak dapat dibandingkan antar revisi.
Kedua, levelnya. Terminal-Bench 4.0 pada 13% dan 1% adalah evaluasi yang sulit, dan pada level setinggi itu rasionya memberi tahu Anda lebih banyak daripada kedua angka tersebut. AA-Omniscience, yang menguji apakah sebuah model mengetahui batas kemampuannya sendiri, menempatkan GLM-5.2 pada 4 berbanding 20 milik Kimi K3 — sebuah batas bawah yang perlu diketahui jika Anda berencana menjalankan salah satunya tanpa pengawasan.
Satu hal lagi yang dicatat Artificial Analysis tentang listing GLM-5.2: ini menandai konfigurasi penalaran maksimum sebagai usang dan digantikan oleh GLM-5.3 yang lebih baru. Itu tidak mengubah satu pun angka di atas, yang merupakan cuplikan GLM-5.2 sebagaimana saat diukur, tetapi itu berarti peta jalan Z.ai telah melampaui model ini. Pada endpoint yang dirutekan, itu hanya memerlukan penggantian string model, bukan migrasi, yang merupakan argumen utama untuk tidak meng-hard-code salah satu nama ini ke dalam aplikasi Anda.
Agen dan penggunaan alat: di mana kesenjangannya paling lebar
Jika satu blok dari tabel itu harus menentukan pembelian, blok inilah. Pekerjaan agentic berhorizon panjang adalah tempat margin Kimi K3 paling besar dan paling konsisten:
• AutomationBench-AA — 58% vs 28%, selisih 30 poin
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
Materi rilis Moonshot sendiri bersandar pada cerita yang sama — peluncuran bobot K3 disertai laporan teknis yang membahas stack pelatihan expert-parallel milik vendor tersebut dan sebuah harness lingkungan agen — tetapi materi vendor tetap materi vendor, dan angka-angka di atas adalah angka yang independen.
Aggregator pihak ketiga LLM Stats, yang menjalankan kompositnya sendiri pada kumpulan benchmark bersama, sampai pada kesimpulan yang sama dari arah yang berbeda: dari sebelas benchmark yang dinilainya untuk kedua model, Kimi K3 memenangkan kesebelasnya, dan skor kategorinya menempatkan Kimi K3 unggul dalam penggunaan alat (30,8 vs 19,6), agen (38,3 vs 29,6), dan coding (42,3 vs 34,8). Itu adalah komposit milik LLM Stats sendiri dengan pembobotannya sendiri, pada kumpulan bersama yang tidak besar, jadi perlakukan itu sebagai penguat, bukan sebagai hasil laboratorium. Sebelas dari sebelas tetap bukan hasil yang tipis.
Pengodean
Arah yang sama, selisih lebih kecil. Pada evaluasi coding yang diberi skor oleh Artificial Analysis untuk keduanya, Kimi K3 memimpin SciCode 59% berbanding 51%; pada set bersama LLM Stats, ia memenangkan DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench, dan Terminal-Bench 2.1. Angka-angka yang menyanjung GLM-5.2 — 99,2% pada AIME 2026, 94,4% pada HMMT 2025, 91,2% pada GPQA sebagaimana dilansir oleh agregator pihak ketiga — dilaporkan vendor dan belum direproduksi, dan sebagian besar darinya mengukur matematika kompetisi, bukan rekayasa perangkat lunak.
Pembacaan praktisnya: bagi agen coding yang berjalan lama, mengedit banyak file, dan harus pulih dari kesalahannya sendiri, margin agentik Kimi K3 adalah sinyal yang lebih relevan daripada skor matematika model mana pun. Bagi asisten kode yang cepat, murah, dan sebagian besar sekali jalan, keunggulan throughput GLM-5.2 lebih bernilai daripada biaya kesenjangan benchmark.
Ketika mereka cukup dekat sehingga tidak menjadi masalah
• Harga input yang di-cache — $0,26 vs $0,30 per juta, selisih 15% dibandingkan selisih 3,4x pada output
• Jendela konteks — 1.000.000 vs 1.048.576 token
• p95 waktu ke token pertama — 10,00 detik vs 10,00 detik pada perutean kami sendiri
• CritPt — 23% vs 21%
• Matematika — LLM Stats menempatkan GLM-5.2 sedikit lebih unggul pada komposit matematikanya (41.4 vs 40.9), sementara Kimi K3 memimpin pada matematika-dengan-gambar; berdasarkan bukti yang tersedia, tidak ada dari kedua model yang menguasai aritmetika
Siapa pun yang memberi tahu Anda bahwa salah satu model ini dua kali lipat model lainnya di semua aspek hanya membaca satu baris tabel.
Pilih GLM-5.2 jika…
Anda yang membayar tagihannya, dan tagihan itulah kendalanya. GLM-5.2 kira-kira sepertiga harga output, lebih murah di jalur cache juga, berlisensi MIT tanpa pemicu pendapatan yang perlu diperiksa, lebih cepat pada median dan jauh lebih cepat saat streaming, dan jendela satu juta tokennya cukup dekat dengan milik Kimi K3 sehingga perbedaannya tidak akan pernah menentukan apa pun. Jika beban kerja Anda adalah input teks dan output teks, dan sebagian besar hanya membaca, bukan rangkaian panjang pemanggilan alat, poin benchmark tambahan pada Kimi K3 adalah poin yang tidak akan pernah dikumpulkan aplikasi Anda.
Pilih Kimi K3 jika…
Pekerjaan ini bersifat agentik dan panjang. Selisih 30 poin di AutomationBench, keunggulan di GDPval dan AA-Briefcase, margin penalaran konteks panjang sebelas poin, dan sapu bersih set bersama LLM Stats semuanya menunjuk ke arah yang sama: Kimi K3 adalah model yang lebih baik untuk diberi tugas multi-langkah lalu ditinggalkan. Ini juga satu-satunya dari keduanya yang menerima gambar. Anda akan membayar sekitar dua kali lipat per tugas untuk itu, dan jika set kerja Anda banyak di-cache, Anda akan membayar kurang dari dua kali lipat — tetapi alasan untuk memilihnya bukanlah harga, dan bukan pula kecepatan.
Keduanya dapat dirutekan di OrcaRouter dari satu kunci ke satu endpoint yang kompatibel dengan OpenAI, pada harga daftar para penyedia tanpa tambahan apa pun di atasnya, dan keduanya berada di balik failover otomatis yang sama. Itulah cara termurah untuk mengetahui mana yang sebenarnya diinginkan oleh beban kerja Anda, karena beralih di antara keduanya hanyalah soal string model, bukan kontrak.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
