Kartu judul yang dihasilkan bertuliskan "Kimi K4" dengan subjudul "apa yang dikatakan kebocoran, dan apa yang tidak", lencana KEBOCORAN / TIDAK TERVERIFIKASI, tiga baris bertumpuk bertuliskan "Tidak ada kartu model", "Tidak ada bobot" dan "Tidak ada harga atau rute", serta baris catatan kaki "Per 25 September 2026", dengan logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Kimi K4: apa yang sebenarnya diklaim oleh kebocoran itu, dan mengapa "lebih sedikit parameter aktif" akan menjadi cerita yang sebenarnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sebuah unggahan tunggal telah membuat empat nama model yang belum diumumkan beredar sekaligus. Daftarnya dimulai dengan K​imi K4, yang diduga sebagai generasi berikutnya dari Moonshot AI, bersanding dengan GLM-5.5 Flash dan GLM-5.4 dari Z.ai serta D​eepSeek V4.1P — dan penekanan penulisnya sendiri bukan pada salah satu nama unggulan mana pun, melainkan pada dugaan tentang aritmetika di balik K4: bahwa model itu mungkin mengaktifkan lebih sedikit parameter daripada model yang digantikannya. Klaim itu belum terverifikasi. Tidak ada kartu model K​imi K4, tidak ada bobot, tidak ada pengenal API, tidak ada harga dan tidak ada rute, dan hal yang sama berlaku untuk setiap nama Z.ai dalam daftar tersebut. Yang layak dilakukan sekarang adalah mencari tahu klaim mana yang dapat diperiksa, seperti apa baseline yang sudah dirilis, dan apa arti sebenarnya dari K4 yang lebih sparse.

Sinyal, dan tingkatannya

Ini adalah sinyal awal, dan harus dibaca sebagai sinyal awal. Postingan yang membawanya adalah tafsiran atas konvensi penamaan model, bukan laporan penampakan: postingan itu menandai "GLM-5.5 Flash, GLM-5.4" sebagai tata nama yang menarik dan menyebut K​imi K4 "sangat aneh", lalu menawarkan mekanisme spekulatif — lebih sedikit pakar yang diaktifkan — tanpa mengklaim telah melihat konfigurasi, daftar checkpoint, atau endpoint staging.

Tidak ada apa pun dalam catatan publik yang bertentangan dengan nama-nama itu, dan tidak ada pula yang menguatkannya. Asimetri itu normal untuk tahap siklus rilis ini, dan justru itulah sebabnya langkah yang berguna adalah membenahi baseline dan pengujian, bukan berspekulasi lebih jauh. Nama dalam sebuah unggahan adalah hipotesis tentang suatu produk, bukan bukti keberadaannya.

Baseline yang akan dijadikan tolok ukur untuk Kimi K4

Kimi K3 nyata, sudah dirilis, dan didokumentasikan dengan luar biasa baik, yang menjadikannya titik referensi yang kuat. Kartu model milik Moonshot sendiri menjelaskan model Mixture-of-Experts dengan 2,8 triliun parameter yang mengaktifkan 104 miliar parameter per token, tersebar di 93 lapisan — satu lapisan dense dan 92 lapisan sparse. Sparsitasnya agresif dan dinyatakan secara gamblang: 16 dari 896 expert aktif per token, di samping 2 expert bersama, yang menurut Moonshot memberikan peningkatan sekitar 2,5× dalam efisiensi penskalaan dibandingkan Kimi K2.

Tumpukan atensi adalah titik tempat K3 berbeda dari generasi sebelumnya. Dari 92 lapisan sparse-nya, 69 menggunakan Kimi Delta Attention — mekanisme atensi linear hibrida — dan 24 menggunakan MLA bergerbang, pembagian 3:1 yang mempertahankan sebagian kecil lapisan atensi penuh dan mendorong sisanya ke jalur linear yang lebih murah. Setiap 12 blok, lapisan membawa residual atensi, fungsi aktivasinya adalah SiTU-GLU, dan seluruh model dilatih dengan bobot MXFP4 serta aktivasi MXFP8 dalam pelatihan sadar kuantisasi. Panjang konteksnya 1.048.576 token, kosakatanya 163.840, dan visi berjalan melalui encoder MoonViT-V2 berparameter 401M, sehingga K3 secara native mampu memproses gambar, bukan multimodal yang ditempelkan belakangan.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Itulah angka-angka yang harus dilampaui oleh penerusnya. Perhatikan implikasinya terhadap gagasan "parameter aktif yang lebih sedikit": K3 sudah merupakan model yang sangat sparse. Model itu mengaktifkan sekitar 3,7% dari total jumlah parameternya per token. K4 yang mengaktifkan kurang dari 104B tidak akan memangkas lemak dari desain yang kelebihan kapasitas — melainkan akan menarik kembali rasio sparsitas yang secara publik telah dibingkai Moonshot sebagai sebuah kemenangan, dan itu akan dilakukannya pada generasi ketika bagian lain dari bidang ini justru bergerak ke arah sebaliknya.

Apa arti "parameter aktif yang lebih sedikit" jika itu benar

Dua pembacaan tersedia dan keduanya mengarah ke arah yang berlawanan. Pembacaan yang bermurah hati bersifat arsitektural: Moonshot dapat memperluas hibrida KDA lebih jauh, mengganti lebih banyak lapisan full-attention dengan lapisan linear dan menyeimbangkan ulang anggaran pakar sehingga jumlah aktivasi yang lebih rendah membeli konteks yang lebih panjang, jejak penyajian yang lebih murah, atau rasio kualitas-per-flop yang lebih baik. Dalam pembacaan itu, lebih sedikit parameter aktif merupakan penyempurnaan dari tesis yang sama yang sudah dinyatakan K3 — bahwa sparsitas adalah strategi penskalaan, bukan kompromi.

Pembacaan lainnya adalah bahwa K4 sama sekali bukan penerus yang seragam. Lini K​imi sudah bercabang sekali tahun ini, dan berbagai laporan telah mengisyaratkan K3.1, K3.2, dan K4 sebagai tiga produk yang berbeda. K4 yang mengaktifkan lebih sedikit daripada K3, dalam keluarga yang merilis varian coding terpisah, setidaknya sama konsisten dengan reposisi sebagaimana dengan peningkatan langsung. Kedua pembacaan itu spekulasi. Tidak satu pun dipastikan oleh sebuah postingan.

Ada juga dimensi lisensi yang belum disinggung siapa pun. Bobot K3 dirilis di bawah Kimi K3 License, lisensi "other" khusus, bukan lisensi open-source standar, dan ini adalah model kelas 3T terbuka pertama. Apakah K4 yang lebih sparse mewarisi lisensi itu, atau mempersempitnya, lebih penting bagi siapa pun yang membangun di atas bobot tersebut daripada beberapa poin skor indeks.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Tiga nama lainnya di postingan yang sama

GLM-5.5 Flash dan GLM-5.4 adalah pasangan yang lebih mengejutkan, dan bukan karena angkanya. Batas atas yang dipublikasikan Z.ai adalah GLM-5.3, yang dirilis pada 14 Agustus 2026 dengan 743B parameter, disusul GLM-5.3-Flash pada 26 Agustus dan rilis bobot BF16 serta Flash-BF16 pada 25 Agustus. Dokumentasi Z.ai sendiri mencantumkan tepat tiga pengenal model terkini: glm-5.3, glm-5.3-flash dan glm-5.2. Tidak ada GLM-5.4, tidak ada GLM-5.5 dan tidak ada GLM-5.5 Flash — dan arah penamaannya justru bagian yang aneh, karena generasi 5.5 yang mendahului 5.4 bukanlah cara Z.ai menomori sebuah keluarga. Nomor versi yang muncul tidak berurutan dalam sebuah kebocoran adalah mode kegagalan yang lazim: nomor-nomor itu cenderung merupakan produk yang berdekatan, nama kode internal, atau label tingkat penyajian, bukan model dasar yang baru.

DeepSeek V4.1Padalah nama yang menurut penulis sinyal paling mereka minati, dan itu adalah yang paling mudah dari keempatnya untuk diperiksa. Dokumentasi API DeepSeek menyebutkan tepat dua string model terkini: deepseek-flash dan deepseek-v4-pro. Sufiks "P" tidak memiliki padanan dalam pengenal DeepSeek mana pun, dan rilis bobot terbaru di organisasi DeepSeek sendiri adalah DeepSeek-V4.1-Flash, yang diterbitkan pada 10 September 2026. V4.1P kemungkinan besar adalah saudara tingkat Pro dari model itu — tetapi "kemungkinan besar" hanyalah tebakan tentang string, bukan produk.

Bagaimana kamu akan tahu bahwa semua ini nyata

Keempat nama itu gagal pada uji yang sama dengan cara yang sama, yang membuat penantian menjadi sederhana alih-alih menyiksa. Rilis yang sesungguhnya meninggalkan artefak, dan masing-masingnya murah untuk diperiksa:

• Kartu model di organisasi Hugging Face milik vendor itu sendiri. Entri terbaru Moonshot adalah Kimi-K3, dibuat pada 13 Juni 2026; yang terbaru dari Z.ai adalah keluarga GLM-5.3 dari 25 Agustus; yang terbaru dari D​eepSeek adalah D​eepSeek-V4.1-Flash dari 10 September. Tidak ada yang lebih baru di ketiganya.

• Konfigurasi yang menyelesaikan perdebatan. Khusus untuk K4, bidang yang perlu dicari adalah num_experts dan num_experts_per_token — nilai K3 adalah 896 dan 16. Konfigurasi K4 dengan angka per-token yang lebih rendah adalah klaim dalam kebocoran ini yang dikonfirmasi atau dibantah dalam satu file.

• Model yang dapat dirutekan. Nama yang muncul di katalog adalah nama yang memiliki harga, jendela konteks, dan penyedia di baliknya; nama yang hanya ada di sebuah postingan tidak memiliki satu pun dari hal itu.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Apa saja yang bisa Anda rute hari ini

Versi praktis dari kebocoran ini adalah bahwa generasi yang dijelaskannya bukanlah yang dapat Anda jadikan fondasi. Yang sudah aktif adalah generasi sebelumnya, dan tugas router adalah menjadikan jarak antar generasi sebagai keputusan routing alih-alih proyek migrasi. Kimi K3 kini tersedia dengan konteks 1M token penuh dan visi native, dihargai $3.00 per juta token input dan $15.00 per juta token output, dengan pembacaan cache sebesar $0.30 — ditagih dengan tarif penyedia tanpa markup, itulah sebabnya perubahan harga vendor pada K3 sampai ke tagihan Anda pada hari yang sama, bukan pada siklus penetapan harga berikutnya. Kimi K3 di OrcaRouter memuat lembar spesifikasi lengkap dan tarif terkini.

Hal yang sama juga berlaku di seluruh sisa daftar tersebut. GLM-5.3, GLM-5.3-Flash, dan DeepSeek V4.1 Flash semuanya dapat dirutekan bersama Kimi K3, melalui satu endpoint yang kompatibel dengan OpenAI yang mencakup 200+ model, dengan failover otomatis saat penyedia menurun serta DSL perutean untuk mengekspresikan preferensi — batas biaya, ambang kualitas, anggaran latensi — sebagai kebijakan, bukan logika per panggilan. Ketika K​imi K4, GLM-5.5 Flash, atau D​eepSeek V4.1P muncul, migrasinya hanyalah perubahan string pada kebijakan perutean dan tidak ada yang lain. Fusi model memungkinkan Anda menggabungkan output dari beberapa model pada endpoint yang sama ketika suatu tugas mendapatkan manfaat darinya.

Untuk memperjelas apa yang bukan: tidak satu pun dari empat nama yang bocor itu merupakan rute di OrcaRouter saat ini. Kami tidak menghostingnya dan tidak dapat melayaninya.

Intinya

Klaim yang menarik di sini bukanlah nomor versinya. Melainkan mekanismenya — andalan generasi berikutnya yang mengaktifkan lebih sedikit parameter daripada pendahulunya akan menjadi pernyataan bahwa Moonshot percaya sparsitas, bukan jumlah aktivasi mentah, adalah poros yang layak didorong, dan pemisahan 16-dari-896 pakar milik K3 sudah menjadi argumen ke arah itu. Setiap bagian dari klaim tersebut belum terverifikasi: Kimi K4, GLM-5.5 Flash, GLM-5.4 dan DeepSeek V4.1P tidak memiliki kartu model, bobot, pengenal API, maupun harga, serta katalog milik vendor masing-masing berhenti satu generasi lebih awal dalam setiap kasus. Perlakukan nama-nama itu sebagai pratinjau sebuah pertanyaan, bukan jawaban — dan jika Anda membutuhkan bobot terbuka kelas terdepan dengan konteks 1M hari ini, Kimi K3 adalah model yang sudah ada.

Saat K​imi K4 benar-benar hadir, failover otomatis adalah yang mencegah migrasi berubah menjadi insiden

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari