
Kimi K4: apa yang sebenarnya diklaim oleh kebocoran itu, dan mengapa "lebih sedikit parameter aktif" akan menjadi cerita yang sebenarnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 506 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 183 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Sebuah unggahan tunggal telah membuat empat nama model yang belum diumumkan beredar sekaligus. Daftarnya dimulai dengan Kimi K4, yang diduga sebagai generasi berikutnya dari Moonshot AI, bersanding dengan GLM-5.5 Flash dan GLM-5.4 dari Z.ai serta DeepSeek V4.1P — dan penekanan penulisnya sendiri bukan pada salah satu nama unggulan mana pun, melainkan pada dugaan tentang aritmetika di balik K4: bahwa model itu mungkin mengaktifkan lebih sedikit parameter daripada model yang digantikannya. Klaim itu belum terverifikasi. Tidak ada kartu model Kimi K4, tidak ada bobot, tidak ada pengenal API, tidak ada harga dan tidak ada rute, dan hal yang sama berlaku untuk setiap nama Z.ai dalam daftar tersebut. Yang layak dilakukan sekarang adalah mencari tahu klaim mana yang dapat diperiksa, seperti apa baseline yang sudah dirilis, dan apa arti sebenarnya dari K4 yang lebih sparse.
Sinyal, dan tingkatannya
Ini adalah sinyal awal, dan harus dibaca sebagai sinyal awal. Postingan yang membawanya adalah tafsiran atas konvensi penamaan model, bukan laporan penampakan: postingan itu menandai "GLM-5.5 Flash, GLM-5.4" sebagai tata nama yang menarik dan menyebut Kimi K4 "sangat aneh", lalu menawarkan mekanisme spekulatif — lebih sedikit pakar yang diaktifkan — tanpa mengklaim telah melihat konfigurasi, daftar checkpoint, atau endpoint staging.
Tidak ada apa pun dalam catatan publik yang bertentangan dengan nama-nama itu, dan tidak ada pula yang menguatkannya. Asimetri itu normal untuk tahap siklus rilis ini, dan justru itulah sebabnya langkah yang berguna adalah membenahi baseline dan pengujian, bukan berspekulasi lebih jauh. Nama dalam sebuah unggahan adalah hipotesis tentang suatu produk, bukan bukti keberadaannya.
Baseline yang akan dijadikan tolok ukur untuk Kimi K4
Kimi K3 nyata, sudah dirilis, dan didokumentasikan dengan luar biasa baik, yang menjadikannya titik referensi yang kuat. Kartu model milik Moonshot sendiri menjelaskan model Mixture-of-Experts dengan 2,8 triliun parameter yang mengaktifkan 104 miliar parameter per token, tersebar di 93 lapisan — satu lapisan dense dan 92 lapisan sparse. Sparsitasnya agresif dan dinyatakan secara gamblang: 16 dari 896 expert aktif per token, di samping 2 expert bersama, yang menurut Moonshot memberikan peningkatan sekitar 2,5× dalam efisiensi penskalaan dibandingkan Kimi K2.
Tumpukan atensi adalah titik tempat K3 berbeda dari generasi sebelumnya. Dari 92 lapisan sparse-nya, 69 menggunakan Kimi Delta Attention — mekanisme atensi linear hibrida — dan 24 menggunakan MLA bergerbang, pembagian 3:1 yang mempertahankan sebagian kecil lapisan atensi penuh dan mendorong sisanya ke jalur linear yang lebih murah. Setiap 12 blok, lapisan membawa residual atensi, fungsi aktivasinya adalah SiTU-GLU, dan seluruh model dilatih dengan bobot MXFP4 serta aktivasi MXFP8 dalam pelatihan sadar kuantisasi. Panjang konteksnya 1.048.576 token, kosakatanya 163.840, dan visi berjalan melalui encoder MoonViT-V2 berparameter 401M, sehingga K3 secara native mampu memproses gambar, bukan multimodal yang ditempelkan belakangan.

Itulah angka-angka yang harus dilampaui oleh penerusnya. Perhatikan implikasinya terhadap gagasan "parameter aktif yang lebih sedikit": K3 sudah merupakan model yang sangat sparse. Model itu mengaktifkan sekitar 3,7% dari total jumlah parameternya per token. K4 yang mengaktifkan kurang dari 104B tidak akan memangkas lemak dari desain yang kelebihan kapasitas — melainkan akan menarik kembali rasio sparsitas yang secara publik telah dibingkai Moonshot sebagai sebuah kemenangan, dan itu akan dilakukannya pada generasi ketika bagian lain dari bidang ini justru bergerak ke arah sebaliknya.
Apa arti "parameter aktif yang lebih sedikit" jika itu benar
Dua pembacaan tersedia dan keduanya mengarah ke arah yang berlawanan. Pembacaan yang bermurah hati bersifat arsitektural: Moonshot dapat memperluas hibrida KDA lebih jauh, mengganti lebih banyak lapisan full-attention dengan lapisan linear dan menyeimbangkan ulang anggaran pakar sehingga jumlah aktivasi yang lebih rendah membeli konteks yang lebih panjang, jejak penyajian yang lebih murah, atau rasio kualitas-per-flop yang lebih baik. Dalam pembacaan itu, lebih sedikit parameter aktif merupakan penyempurnaan dari tesis yang sama yang sudah dinyatakan K3 — bahwa sparsitas adalah strategi penskalaan, bukan kompromi.
Pembacaan lainnya adalah bahwa K4 sama sekali bukan penerus yang seragam. Lini Kimi sudah bercabang sekali tahun ini, dan berbagai laporan telah mengisyaratkan K3.1, K3.2, dan K4 sebagai tiga produk yang berbeda. K4 yang mengaktifkan lebih sedikit daripada K3, dalam keluarga yang merilis varian coding terpisah, setidaknya sama konsisten dengan reposisi sebagaimana dengan peningkatan langsung. Kedua pembacaan itu spekulasi. Tidak satu pun dipastikan oleh sebuah postingan.
Ada juga dimensi lisensi yang belum disinggung siapa pun. Bobot K3 dirilis di bawah Kimi K3 License, lisensi "other" khusus, bukan lisensi open-source standar, dan ini adalah model kelas 3T terbuka pertama. Apakah K4 yang lebih sparse mewarisi lisensi itu, atau mempersempitnya, lebih penting bagi siapa pun yang membangun di atas bobot tersebut daripada beberapa poin skor indeks.

Tiga nama lainnya di postingan yang sama
GLM-5.5 Flash dan GLM-5.4 adalah pasangan yang lebih mengejutkan, dan bukan karena angkanya. Batas atas yang dipublikasikan Z.ai adalah GLM-5.3, yang dirilis pada 14 Agustus 2026 dengan 743B parameter, disusul GLM-5.3-Flash pada 26 Agustus dan rilis bobot BF16 serta Flash-BF16 pada 25 Agustus. Dokumentasi Z.ai sendiri mencantumkan tepat tiga pengenal model terkini: glm-5.3, glm-5.3-flash dan glm-5.2. Tidak ada GLM-5.4, tidak ada GLM-5.5 dan tidak ada GLM-5.5 Flash — dan arah penamaannya justru bagian yang aneh, karena generasi 5.5 yang mendahului 5.4 bukanlah cara Z.ai menomori sebuah keluarga. Nomor versi yang muncul tidak berurutan dalam sebuah kebocoran adalah mode kegagalan yang lazim: nomor-nomor itu cenderung merupakan produk yang berdekatan, nama kode internal, atau label tingkat penyajian, bukan model dasar yang baru.
DeepSeek V4.1Padalah nama yang menurut penulis sinyal paling mereka minati, dan itu adalah yang paling mudah dari keempatnya untuk diperiksa. Dokumentasi API DeepSeek menyebutkan tepat dua string model terkini: deepseek-flash dan deepseek-v4-pro. Sufiks "P" tidak memiliki padanan dalam pengenal DeepSeek mana pun, dan rilis bobot terbaru di organisasi DeepSeek sendiri adalah DeepSeek-V4.1-Flash, yang diterbitkan pada 10 September 2026. V4.1P kemungkinan besar adalah saudara tingkat Pro dari model itu — tetapi "kemungkinan besar" hanyalah tebakan tentang string, bukan produk.
Bagaimana kamu akan tahu bahwa semua ini nyata
Keempat nama itu gagal pada uji yang sama dengan cara yang sama, yang membuat penantian menjadi sederhana alih-alih menyiksa. Rilis yang sesungguhnya meninggalkan artefak, dan masing-masingnya murah untuk diperiksa:
• Kartu model di organisasi Hugging Face milik vendor itu sendiri. Entri terbaru Moonshot adalah Kimi-K3, dibuat pada 13 Juni 2026; yang terbaru dari Z.ai adalah keluarga GLM-5.3 dari 25 Agustus; yang terbaru dari DeepSeek adalah DeepSeek-V4.1-Flash dari 10 September. Tidak ada yang lebih baru di ketiganya.
• Konfigurasi yang menyelesaikan perdebatan. Khusus untuk K4, bidang yang perlu dicari adalah num_experts dan num_experts_per_token — nilai K3 adalah 896 dan 16. Konfigurasi K4 dengan angka per-token yang lebih rendah adalah klaim dalam kebocoran ini yang dikonfirmasi atau dibantah dalam satu file.
• Model yang dapat dirutekan. Nama yang muncul di katalog adalah nama yang memiliki harga, jendela konteks, dan penyedia di baliknya; nama yang hanya ada di sebuah postingan tidak memiliki satu pun dari hal itu.

Apa saja yang bisa Anda rute hari ini
Versi praktis dari kebocoran ini adalah bahwa generasi yang dijelaskannya bukanlah yang dapat Anda jadikan fondasi. Yang sudah aktif adalah generasi sebelumnya, dan tugas router adalah menjadikan jarak antar generasi sebagai keputusan routing alih-alih proyek migrasi. Kimi K3 kini tersedia dengan konteks 1M token penuh dan visi native, dihargai $3.00 per juta token input dan $15.00 per juta token output, dengan pembacaan cache sebesar $0.30 — ditagih dengan tarif penyedia tanpa markup, itulah sebabnya perubahan harga vendor pada K3 sampai ke tagihan Anda pada hari yang sama, bukan pada siklus penetapan harga berikutnya. Kimi K3 di OrcaRouter memuat lembar spesifikasi lengkap dan tarif terkini.
Hal yang sama juga berlaku di seluruh sisa daftar tersebut. GLM-5.3, GLM-5.3-Flash, dan DeepSeek V4.1 Flash semuanya dapat dirutekan bersama Kimi K3, melalui satu endpoint yang kompatibel dengan OpenAI yang mencakup 200+ model, dengan failover otomatis saat penyedia menurun serta DSL perutean untuk mengekspresikan preferensi — batas biaya, ambang kualitas, anggaran latensi — sebagai kebijakan, bukan logika per panggilan. Ketika Kimi K4, GLM-5.5 Flash, atau DeepSeek V4.1P muncul, migrasinya hanyalah perubahan string pada kebijakan perutean dan tidak ada yang lain. Fusi model memungkinkan Anda menggabungkan output dari beberapa model pada endpoint yang sama ketika suatu tugas mendapatkan manfaat darinya.
Untuk memperjelas apa yang bukan: tidak satu pun dari empat nama yang bocor itu merupakan rute di OrcaRouter saat ini. Kami tidak menghostingnya dan tidak dapat melayaninya.
Intinya
Klaim yang menarik di sini bukanlah nomor versinya. Melainkan mekanismenya — andalan generasi berikutnya yang mengaktifkan lebih sedikit parameter daripada pendahulunya akan menjadi pernyataan bahwa Moonshot percaya sparsitas, bukan jumlah aktivasi mentah, adalah poros yang layak didorong, dan pemisahan 16-dari-896 pakar milik K3 sudah menjadi argumen ke arah itu. Setiap bagian dari klaim tersebut belum terverifikasi: Kimi K4, GLM-5.5 Flash, GLM-5.4 dan DeepSeek V4.1P tidak memiliki kartu model, bobot, pengenal API, maupun harga, serta katalog milik vendor masing-masing berhenti satu generasi lebih awal dalam setiap kasus. Perlakukan nama-nama itu sebagai pratinjau sebuah pertanyaan, bukan jawaban — dan jika Anda membutuhkan bobot terbuka kelas terdepan dengan konteks 1M hari ini, Kimi K3 adalah model yang sudah ada.
Saat Kimi K4 benar-benar hadir, failover otomatis adalah yang mencegah migrasi berubah menjadi insiden
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
